Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
6,361 to 6,420 of 18,867
Multi-Modal Masked Autoencoders for Medical Vision-and-Language Pre-Training
Zhihong Chen, Yuhao Du, Jinpeng Hu +4
cs.CVcs.CLarXiv:2209.07098v12022What do different evaluation metrics tell us about saliency models?
Zoya Bylinskii, Tilke Judd, Aude Oliva +2
cs.CVarXiv:1604.03605v22016Adaptive Keyframe Sampling for Long Video Understanding
Xi Tang, Jihao Qiu, Lingxi Xie +3
cs.CVcs.AIcs.LGarXiv:2502.21271v12025Predicting Pedestrian Crossing Intention with Feature Fusion and Spatio-Temporal Attention
Dongfang Yang, Haolin Zhang, Ekim Yurtsever +2
cs.CVarXiv:2104.05485v22021Learning to Restore More: Continual Capability Expansion for Pretrained Image Restoration Models
Hu Gao, Yulong Chen, Lizhuang Ma
cs.CVarXiv:2608.30305v12026Generative Modelling With Inverse Heat Dissipation
Severi Rissanen, Markus Heinonen, Arno Solin
cs.CVcs.LGstat.MLarXiv:2206.13397v72022Deep Quaternion Networks
Chase Gaudet, Anthony Maida
cs.NEcs.CVarXiv:1712.04604v32017Experimental robustness of Fourier Ptychography phase retrieval algorithms
Li-Hao Yeh, Jonathan Dong, Jingshan Zhong +5
physics.opticscs.CVarXiv:1511.02986v22015A Light CNN for Deep Face Representation with Noisy Labels
Xiang Wu, Ran He, Zhenan Sun +1
cs.CVarXiv:1511.02683v42015LLaVAFlow: Preserving Latent Alignment Flow for Parameter-Efficient Multimodal Fine-Tuning
Muyao Yuan, Muyan Jiao, Jiangyong Ying +5
cs.CVarXiv:2608.26820v12026Do Vision-Language Models Agree on the Affective Qualities of Shape? A Cross-Model Audit for Generative Design Interfaces
Luca Bux, Thiago Rios, Ingo Scholtes +1
cs.HCcs.CVarXiv:2608.25876v12026Phase-Aligned Finite-Fourier Periodic Deformation for 4D Medical Image Interpolation
Haojin Li, Hengzhuo Wang, Zhiheng Ma +3
cs.CVarXiv:2608.24027v12026Reproducible Vision-Guided 6-DoF Robotic Manipulator with a Mixed Stepper-Driver Architecture and Browser-Native Control
Lasan Perera, Deneth Priyadarshana, Dulana Pitiwaduge +2
cs.ROcs.CVeess.SYarXiv:2608.22799v12026FIRM-Video: Check Before You Score for Reliable Text-to-Video Reward Modeling
Peiyuan Zhang, Xiangyu Zhao, Hongbo Liu +8
cs.CVarXiv:2608.21839v12026CoAnchor: Robust Collaborative Perception under Spatio-Temporal Misalignment via Object-Level Anchors
Chi Li, Rui Lin, Aobo Ji +1
cs.CVcs.AIarXiv:2608.21055v12026WA-JEPA: Rethinking the Video JEPA Paradigm for World-Action Modeling in Autonomous Driving
Xinlin Wang, Yujiao Xiang, Yuheng Zhou +11
cs.CVcs.AIarXiv:2608.20974v12026When Generated Images Look Right and Retrieve Wrong: Coverage-Guided Cross-Scale Re-Indexing for Knowledge-Faithful Generative Perception
Guangyuan Dong, Chuang Liu, Yangchen Zeng +6
cs.MMcs.AIcs.CVarXiv:2608.20810v12026AGIDefect-4K: A Richly Annotated Dataset for AI-Generated Image Defect Detection, Localization and Explanation
Xiangfei Sheng, Weidong Zou, Tianjiao Gu +3
cs.CVarXiv:2608.20713v12026TopoSurfel: Closing the Loop between Gaussian Surfels and Meshes for Surface Reconstruction
Chuanjin Fan, Wenjie Chang, Bohao Liao +3
cs.CVcs.GRarXiv:2608.20687v12026From Inference to Adaptation: A Unified Optimal Transport View of Vision Language Model
Qi Yu, Zhichen Zeng, Katherine Tieu +8
cs.CVcs.AIcs.CLarXiv:2608.18339v12026Machine Learning for Neuroimaging with Scikit-Learn
Alexandre Abraham, Fabian Pedregosa, Michael Eickenberg +6
cs.LGcs.CVstat.MLarXiv:1412.3919v12014Prior-Conditioned Gaussian Discriminants for Generalizable AI-generated Image Detection
Shashank Kotyan, Makoto Shing, Yuki Imajuku +2
cs.CVcs.AIarXiv:2608.18523v12026Code as Representation: A Compilable Parsing Paradigm for Academic Documents
Rihui Jin, Jun Wang, chengyuan zhu +11
cs.CVcs.CLarXiv:2608.17550v12026Learning What Not to Learn: Adversarial Disentangled Prompt Tuning for Robust Vision-Language Models
Yang Chen, Zhan Zhuang, Yanbin Wei +3
cs.CVcs.AIarXiv:2608.17306v12026Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL
Yunhao Yang, Yuexin Bian, Yunjie Tian +6
cs.LGcs.AIcs.CVarXiv:2608.17253v12026GenRouter: Unified Workflow Routing for Agentic Image Generation
Harold Haodong Chen, Zhiyu Hou, Wen-Jie Shu +4
cs.CVarXiv:2608.16721v12026TRACE-Bench: Decomposing and Diagnosing Multi-Reference Image Generation
Haoran Wang, Chaofan Ma, Ran Yi +1
cs.CVcs.AIarXiv:2608.16765v12026Defake-o3: From Speculative Rationales to Verifiable Evidence for Explainable AIGI Detection
Bowen Deng, Jiahui Zhan, Yikun Ji +2
cs.CVcs.AIarXiv:2608.16259v12026Bayesian Robust Tensor Factorization for Incomplete Multiway Data
Qibin Zhao, Guoxu Zhou, Liqing Zhang +2
cs.CVcs.LGarXiv:1410.2386v22014VGGT-Align: Bridging Local Reconstruction and Global Consistency for Long-Sequence 3D Reconstruction
Wei Zhang, Yihang Wu, Songhua Li +1
cs.CVcs.AIarXiv:2608.15260v12026Fast Test-Time Refinement for Robust Learned Image Compression
Jiaming Liang, Chi-Man Pun, Weisi Lin
cs.CVcs.AIcs.LGarXiv:2608.15113v12026Designing Reinforcement Learning for Diffusion Models: A Unified Path-Space View
Yixian Xu, Yuanrui Zhang, Shengjie Luo +2
cs.LGcs.CVstat.MLarXiv:2608.14430v12026AlignFace: Human-Aligned Face Similarity Metric with Interpretable Concept Relations
Ying Huang, Wencan Zhang, Brian Y. Lim
cs.MMcs.AIcs.CVarXiv:2608.14130v12026Scaling Properties of Text Conditioning in Visual Generation
Zilong Chen, Chaorui Deng, Kunchang Li +2
cs.CVarXiv:2607.29679v12026UltraArUco: A Lightweight Multilingual Library And Framework With Low-Latency Real-Time Marker-Based Tracking System For Mobile AR Interaction
Mikhail Kiselev, Aleksandr Marukhin, Ivan Snegirev +3
cs.HCcs.AIcs.CVarXiv:2608.13584v12026ID-V2V: Identity-Preserving Video Restylization
Yuancheng Xu, Mingming He, Pablo Salamanca +5
cs.CVarXiv:2607.22830v12026Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment
Dwip Dalal, Shivansh Patel, Chahit Jain +7
cs.ROcs.CVarXiv:2607.13429v12026Motion4Motion: Motion Transfer Across Subjects at Inference
Ling-Hao Chen, Zixin Yin, Duomin Wang +2
cs.CVarXiv:2607.11644v12026SynthDocBench: Controlled Benchmark for Long-Context Visual Document Understanding
Abhigya Verma, Khyati Mahajan, Amit Kumar Saha +4
cs.CVcs.AIarXiv:2607.10400v120264D Human-Scene Reconstruction from Low-Overlap Captures
Minhyuk Hwang, Sangmin Kim, Seunguk Do +2
cs.CVarXiv:2607.09125v12026LongE2V: Long-Horizon Event-based Video Reconstruction, Prediction, and Frame Interpolation with Video Diffusion Models
Cheng-De Fan, Chun-Wei Tuan Mu, Chen-Wei Chang +4
cs.CVarXiv:2607.08770v12026UI-MOPD: Multi-Platform On-Policy Distillation for Unified GUI Agents
Niu Lian, Tongbo Chen, Zhehao Yu +8
cs.CLcs.AIcs.CVarXiv:2607.04425v22026Advancing WordArt-Oriented Scene Text Recognition: Datasets and Methods
Xingsong Ye, Yongkun Du, Jiaxin Zhang +5
cs.CVarXiv:2606.24484v12026Go-with-the-Track: Video Compositing and Motion Control with Point Tracking
Koichi Namekata, Yash Kant, Zhizheng Liu +9
cs.CVcs.LGarXiv:2606.20891v12026Orchestra-o1: Omnimodal Agent Orchestration
Fan Zhang, Vireo Zhang, Shengju Qian +8
cs.AIcs.CLcs.CVarXiv:2606.13707v12026World Model Self-Distillation: Training World Models to Solve General Tasks
Sebastian Stapf, Pablo Acuaviva Huertos, Aram Davtyan +1
cs.CVarXiv:2606.12072v12026αDepth: Learning Single-Pass Soft Boundary Decomposition for Stereo Conversion
Xiang Zhang, Yang Zhang, Lukas Mehl +3
cs.CVarXiv:2606.00386v12026FreeForm: Reduced-Order Deformable Simulation from Particle-Based Skinning Eigenmodes
Donglai Xiang, Vismay Modi, Rishit Dagli +5
cs.GRcs.CVarXiv:2605.29318v12026Omni-DuplexEval: Evaluating Real-time Duplex Omni-modal Interaction
Chaoqun He, Mingyang Xiang, Yingjing Xu +5
cs.CVarXiv:2605.17360v22026KVPO: ODE-Native GRPO for Autoregressive Video Alignment via KV Semantic Exploration
Ruicheng Zhang, Kaixi Cong, Jun Zhou +5
cs.CVarXiv:2605.14278v12026CM-EVS: Sparse Panoramic RGB-D-Pose Data for Complete Scene Coverage
Jiale Liu, Jungang Li, Jieming Yu +13
cs.CVcs.GRcs.LGarXiv:2605.15597v12026RoboEvolve: Co-Evolving Planner-Simulator for Robotic Manipulation with Limited Data
Harold Haodong Chen, Sirui Chen, Yingjie Xu +2
cs.ROcs.CVarXiv:2605.13775v12026VidSplat: Gaussian Splatting Reconstruction with Geometry-Guided Video Diffusion Priors
Jimin Tang, Wenyuan Zhang, Junsheng Zhou +5
cs.CVarXiv:2605.11424v12026Pixal3D: Pixel-Aligned 3D Generation from Images
Dong-Yang Li, Wang Zhao, Yuxin Chen +5
cs.CVarXiv:2605.10922v12026EX-FIQA: Leveraging Intermediate Early eXit Representations from Vision Transformers for Face Image Quality Assessment
Guray Ozgur, Tahar Chettaoui, Eduarda Caldeira +4
cs.CVeess.IVarXiv:2604.22842v12026Mean Mode Screaming: Mean--Variance Split Residuals for 1000-Layer Diffusion Transformers
Pengqi Lu
cs.LGcs.CVarXiv:2605.06169v12026Sample Selection Using Multi-Task Autoencoders in Federated Learning with Non-IID Data
Emre Ardıç, Yakup Genç
cs.CVcs.LGarXiv:2604.26116v12026CanViT: Toward Active-Vision Foundation Models
Yohaï-Eliel Berreby, Sabrina Du, Audrey Durand +1
cs.CVarXiv:2603.22570v22026Elucidating the SNR-t Bias of Diffusion Probabilistic Models
Meng Yu, Lei Sun, Jianhao Zeng +2
cs.CVarXiv:2604.16044v12026Tunable Soft Equivariance with Guarantees
Md Ashiqur Rahman, Lim Jun Hao, Jeremiah Jiang +2
cs.CVcs.LGarXiv:2603.26657v12026