Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

6,361 to 6,420 of 18,867

  1. Multi-Modal Masked Autoencoders for Medical Vision-and-Language Pre-Training

    Zhihong Chen, Yuhao Du, Jinpeng Hu +4

    cs.CVcs.CLarXiv:2209.07098v12022
  2. What do different evaluation metrics tell us about saliency models?

    Zoya Bylinskii, Tilke Judd, Aude Oliva +2

    cs.CVarXiv:1604.03605v22016
  3. Adaptive Keyframe Sampling for Long Video Understanding

    Xi Tang, Jihao Qiu, Lingxi Xie +3

    cs.CVcs.AIcs.LGarXiv:2502.21271v12025
  4. Predicting Pedestrian Crossing Intention with Feature Fusion and Spatio-Temporal Attention

    Dongfang Yang, Haolin Zhang, Ekim Yurtsever +2

    cs.CVarXiv:2104.05485v22021
  5. Learning to Restore More: Continual Capability Expansion for Pretrained Image Restoration Models

    Hu Gao, Yulong Chen, Lizhuang Ma

    cs.CVarXiv:2608.30305v12026
  6. Generative Modelling With Inverse Heat Dissipation

    Severi Rissanen, Markus Heinonen, Arno Solin

    cs.CVcs.LGstat.MLarXiv:2206.13397v72022
  7. Deep Quaternion Networks

    Chase Gaudet, Anthony Maida

    cs.NEcs.CVarXiv:1712.04604v32017
  8. Experimental robustness of Fourier Ptychography phase retrieval algorithms

    Li-Hao Yeh, Jonathan Dong, Jingshan Zhong +5

    physics.opticscs.CVarXiv:1511.02986v22015
  9. A Light CNN for Deep Face Representation with Noisy Labels

    Xiang Wu, Ran He, Zhenan Sun +1

    cs.CVarXiv:1511.02683v42015
  10. LLaVAFlow: Preserving Latent Alignment Flow for Parameter-Efficient Multimodal Fine-Tuning

    Muyao Yuan, Muyan Jiao, Jiangyong Ying +5

    cs.CVarXiv:2608.26820v12026
  11. Do Vision-Language Models Agree on the Affective Qualities of Shape? A Cross-Model Audit for Generative Design Interfaces

    Luca Bux, Thiago Rios, Ingo Scholtes +1

    cs.HCcs.CVarXiv:2608.25876v12026
  12. Phase-Aligned Finite-Fourier Periodic Deformation for 4D Medical Image Interpolation

    Haojin Li, Hengzhuo Wang, Zhiheng Ma +3

    cs.CVarXiv:2608.24027v12026
  13. Reproducible Vision-Guided 6-DoF Robotic Manipulator with a Mixed Stepper-Driver Architecture and Browser-Native Control

    Lasan Perera, Deneth Priyadarshana, Dulana Pitiwaduge +2

    cs.ROcs.CVeess.SYarXiv:2608.22799v12026
  14. FIRM-Video: Check Before You Score for Reliable Text-to-Video Reward Modeling

    Peiyuan Zhang, Xiangyu Zhao, Hongbo Liu +8

    cs.CVarXiv:2608.21839v12026
  15. CoAnchor: Robust Collaborative Perception under Spatio-Temporal Misalignment via Object-Level Anchors

    Chi Li, Rui Lin, Aobo Ji +1

    cs.CVcs.AIarXiv:2608.21055v12026
  16. WA-JEPA: Rethinking the Video JEPA Paradigm for World-Action Modeling in Autonomous Driving

    Xinlin Wang, Yujiao Xiang, Yuheng Zhou +11

    cs.CVcs.AIarXiv:2608.20974v12026
  17. When Generated Images Look Right and Retrieve Wrong: Coverage-Guided Cross-Scale Re-Indexing for Knowledge-Faithful Generative Perception

    Guangyuan Dong, Chuang Liu, Yangchen Zeng +6

    cs.MMcs.AIcs.CVarXiv:2608.20810v12026
  18. AGIDefect-4K: A Richly Annotated Dataset for AI-Generated Image Defect Detection, Localization and Explanation

    Xiangfei Sheng, Weidong Zou, Tianjiao Gu +3

    cs.CVarXiv:2608.20713v12026
  19. TopoSurfel: Closing the Loop between Gaussian Surfels and Meshes for Surface Reconstruction

    Chuanjin Fan, Wenjie Chang, Bohao Liao +3

    cs.CVcs.GRarXiv:2608.20687v12026
  20. From Inference to Adaptation: A Unified Optimal Transport View of Vision Language Model

    Qi Yu, Zhichen Zeng, Katherine Tieu +8

    cs.CVcs.AIcs.CLarXiv:2608.18339v12026
  21. Machine Learning for Neuroimaging with Scikit-Learn

    Alexandre Abraham, Fabian Pedregosa, Michael Eickenberg +6

    cs.LGcs.CVstat.MLarXiv:1412.3919v12014
  22. Prior-Conditioned Gaussian Discriminants for Generalizable AI-generated Image Detection

    Shashank Kotyan, Makoto Shing, Yuki Imajuku +2

    cs.CVcs.AIarXiv:2608.18523v12026
  23. Code as Representation: A Compilable Parsing Paradigm for Academic Documents

    Rihui Jin, Jun Wang, chengyuan zhu +11

    cs.CVcs.CLarXiv:2608.17550v12026
  24. Learning What Not to Learn: Adversarial Disentangled Prompt Tuning for Robust Vision-Language Models

    Yang Chen, Zhan Zhuang, Yanbin Wei +3

    cs.CVcs.AIarXiv:2608.17306v12026
  25. Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL

    Yunhao Yang, Yuexin Bian, Yunjie Tian +6

    cs.LGcs.AIcs.CVarXiv:2608.17253v12026
  26. GenRouter: Unified Workflow Routing for Agentic Image Generation

    Harold Haodong Chen, Zhiyu Hou, Wen-Jie Shu +4

    cs.CVarXiv:2608.16721v12026
  27. TRACE-Bench: Decomposing and Diagnosing Multi-Reference Image Generation

    Haoran Wang, Chaofan Ma, Ran Yi +1

    cs.CVcs.AIarXiv:2608.16765v12026
  28. Defake-o3: From Speculative Rationales to Verifiable Evidence for Explainable AIGI Detection

    Bowen Deng, Jiahui Zhan, Yikun Ji +2

    cs.CVcs.AIarXiv:2608.16259v12026
  29. Bayesian Robust Tensor Factorization for Incomplete Multiway Data

    Qibin Zhao, Guoxu Zhou, Liqing Zhang +2

    cs.CVcs.LGarXiv:1410.2386v22014
  30. VGGT-Align: Bridging Local Reconstruction and Global Consistency for Long-Sequence 3D Reconstruction

    Wei Zhang, Yihang Wu, Songhua Li +1

    cs.CVcs.AIarXiv:2608.15260v12026
  31. Fast Test-Time Refinement for Robust Learned Image Compression

    Jiaming Liang, Chi-Man Pun, Weisi Lin

    cs.CVcs.AIcs.LGarXiv:2608.15113v12026
  32. Designing Reinforcement Learning for Diffusion Models: A Unified Path-Space View

    Yixian Xu, Yuanrui Zhang, Shengjie Luo +2

    cs.LGcs.CVstat.MLarXiv:2608.14430v12026
  33. AlignFace: Human-Aligned Face Similarity Metric with Interpretable Concept Relations

    Ying Huang, Wencan Zhang, Brian Y. Lim

    cs.MMcs.AIcs.CVarXiv:2608.14130v12026
  34. Scaling Properties of Text Conditioning in Visual Generation

    Zilong Chen, Chaorui Deng, Kunchang Li +2

    cs.CVarXiv:2607.29679v12026
  35. UltraArUco: A Lightweight Multilingual Library And Framework With Low-Latency Real-Time Marker-Based Tracking System For Mobile AR Interaction

    Mikhail Kiselev, Aleksandr Marukhin, Ivan Snegirev +3

    cs.HCcs.AIcs.CVarXiv:2608.13584v12026
  36. ID-V2V: Identity-Preserving Video Restylization

    Yuancheng Xu, Mingming He, Pablo Salamanca +5

    cs.CVarXiv:2607.22830v12026
  37. Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment

    Dwip Dalal, Shivansh Patel, Chahit Jain +7

    cs.ROcs.CVarXiv:2607.13429v12026
  38. Motion4Motion: Motion Transfer Across Subjects at Inference

    Ling-Hao Chen, Zixin Yin, Duomin Wang +2

    cs.CVarXiv:2607.11644v12026
  39. SynthDocBench: Controlled Benchmark for Long-Context Visual Document Understanding

    Abhigya Verma, Khyati Mahajan, Amit Kumar Saha +4

    cs.CVcs.AIarXiv:2607.10400v12026
  40. 4D Human-Scene Reconstruction from Low-Overlap Captures

    Minhyuk Hwang, Sangmin Kim, Seunguk Do +2

    cs.CVarXiv:2607.09125v12026
  41. LongE2V: Long-Horizon Event-based Video Reconstruction, Prediction, and Frame Interpolation with Video Diffusion Models

    Cheng-De Fan, Chun-Wei Tuan Mu, Chen-Wei Chang +4

    cs.CVarXiv:2607.08770v12026
  42. UI-MOPD: Multi-Platform On-Policy Distillation for Unified GUI Agents

    Niu Lian, Tongbo Chen, Zhehao Yu +8

    cs.CLcs.AIcs.CVarXiv:2607.04425v22026
  43. Advancing WordArt-Oriented Scene Text Recognition: Datasets and Methods

    Xingsong Ye, Yongkun Du, Jiaxin Zhang +5

    cs.CVarXiv:2606.24484v12026
  44. Go-with-the-Track: Video Compositing and Motion Control with Point Tracking

    Koichi Namekata, Yash Kant, Zhizheng Liu +9

    cs.CVcs.LGarXiv:2606.20891v12026
  45. Orchestra-o1: Omnimodal Agent Orchestration

    Fan Zhang, Vireo Zhang, Shengju Qian +8

    cs.AIcs.CLcs.CVarXiv:2606.13707v12026
  46. World Model Self-Distillation: Training World Models to Solve General Tasks

    Sebastian Stapf, Pablo Acuaviva Huertos, Aram Davtyan +1

    cs.CVarXiv:2606.12072v12026
  47. αDepth: Learning Single-Pass Soft Boundary Decomposition for Stereo Conversion

    Xiang Zhang, Yang Zhang, Lukas Mehl +3

    cs.CVarXiv:2606.00386v12026
  48. FreeForm: Reduced-Order Deformable Simulation from Particle-Based Skinning Eigenmodes

    Donglai Xiang, Vismay Modi, Rishit Dagli +5

    cs.GRcs.CVarXiv:2605.29318v12026
  49. Omni-DuplexEval: Evaluating Real-time Duplex Omni-modal Interaction

    Chaoqun He, Mingyang Xiang, Yingjing Xu +5

    cs.CVarXiv:2605.17360v22026
  50. KVPO: ODE-Native GRPO for Autoregressive Video Alignment via KV Semantic Exploration

    Ruicheng Zhang, Kaixi Cong, Jun Zhou +5

    cs.CVarXiv:2605.14278v12026
  51. CM-EVS: Sparse Panoramic RGB-D-Pose Data for Complete Scene Coverage

    Jiale Liu, Jungang Li, Jieming Yu +13

    cs.CVcs.GRcs.LGarXiv:2605.15597v12026
  52. RoboEvolve: Co-Evolving Planner-Simulator for Robotic Manipulation with Limited Data

    Harold Haodong Chen, Sirui Chen, Yingjie Xu +2

    cs.ROcs.CVarXiv:2605.13775v12026
  53. VidSplat: Gaussian Splatting Reconstruction with Geometry-Guided Video Diffusion Priors

    Jimin Tang, Wenyuan Zhang, Junsheng Zhou +5

    cs.CVarXiv:2605.11424v12026
  54. Pixal3D: Pixel-Aligned 3D Generation from Images

    Dong-Yang Li, Wang Zhao, Yuxin Chen +5

    cs.CVarXiv:2605.10922v12026
  55. EX-FIQA: Leveraging Intermediate Early eXit Representations from Vision Transformers for Face Image Quality Assessment

    Guray Ozgur, Tahar Chettaoui, Eduarda Caldeira +4

    cs.CVeess.IVarXiv:2604.22842v12026
  56. Mean Mode Screaming: Mean--Variance Split Residuals for 1000-Layer Diffusion Transformers

    Pengqi Lu

    cs.LGcs.CVarXiv:2605.06169v12026
  57. Sample Selection Using Multi-Task Autoencoders in Federated Learning with Non-IID Data

    Emre Ardıç, Yakup Genç

    cs.CVcs.LGarXiv:2604.26116v12026
  58. CanViT: Toward Active-Vision Foundation Models

    Yohaï-Eliel Berreby, Sabrina Du, Audrey Durand +1

    cs.CVarXiv:2603.22570v22026
  59. Elucidating the SNR-t Bias of Diffusion Probabilistic Models

    Meng Yu, Lei Sun, Jianhao Zeng +2

    cs.CVarXiv:2604.16044v12026
  60. Tunable Soft Equivariance with Guarantees

    Md Ashiqur Rahman, Lim Jun Hao, Jeremiah Jiang +2

    cs.CVcs.LGarXiv:2603.26657v12026