Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

5,161 to 5,220 of 18,830

  1. Improving Video-Text Retrieval by Multi-Stream Corpus Alignment and Dual Softmax Loss

    Xing Cheng, Hezheng Lin, Xiangyu Wu +2

    cs.CVarXiv:2109.04290v32021
  2. Spatiotemporal Modeling for Crowd Counting in Videos

    Feng Xiong, Xingjian Shi, Dit-Yan Yeung

    cs.CVarXiv:1707.07890v12017
  3. Traceable Evidence Enhanced Visual Grounded Reasoning: Evaluation and Methodology

    Haochen Wang, Xiangtai Li, Zilong Huang +9

    cs.CVcs.AIcs.CLarXiv:2507.07999v22025
  4. BooM-VVT: Boosting Mask-Free Video Virtual Try-On with Image-Level Pseudo Data

    Wei Zhang, Xin Li, Peishu Shi +4

    cs.CVarXiv:2609.04120v12026
  5. SAM-Med3D: Towards General-purpose Segmentation Models for Volumetric Medical Images

    Haoyu Wang, Sizheng Guo, Jin Ye +11

    cs.CVarXiv:2310.15161v32023
  6. FingerNet: An Unified Deep Network for Fingerprint Minutiae Extraction

    Yao Tang, Fei Gao, Jufu Feng +1

    cs.CVarXiv:1709.02228v12017
  7. On the Anatomy of MCMC-Based Maximum Likelihood Learning of Energy-Based Models

    Erik Nijkamp, Mitch Hill, Tian Han +2

    stat.MLcs.CVcs.LGarXiv:1903.12370v42019
  8. HoloAssist: an Egocentric Human Interaction Dataset for Interactive AI Assistants in the Real World

    Xin Wang, Taein Kwon, Mahdi Rad +9

    cs.CVarXiv:2309.17024v12023
  9. Understanding Humans in Crowded Scenes: Deep Nested Adversarial Learning and A New Benchmark for Multi-Human Parsing

    Jian Zhao, Jianshu Li, Yu Cheng +4

    cs.CVarXiv:1804.03287v32018
  10. Seeing, Listening, Remembering, and Reasoning: A Multimodal Agent with Long-Term Memory

    Lin Long, Yichen He, Wentao Ye +5

    cs.CVarXiv:2508.09736v42025
  11. Differentiable Learning-to-Normalize via Switchable Normalization

    Ping Luo, Jiamin Ren, Zhanglin Peng +2

    cs.CVcs.LGarXiv:1806.10779v52018
  12. FantasyTalking: Realistic Talking Portrait Generation via Coherent Motion Synthesis

    Mengchao Wang, Qiang Wang, Fan Jiang +5

    cs.CVarXiv:2504.04842v12025
  13. VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning

    Qiuchen Wang, Ruixue Ding, Yu Zeng +6

    cs.CLcs.AIcs.CVarXiv:2505.22019v22025
  14. CLIPN for Zero-Shot OOD Detection: Teaching CLIP to Say No

    Hualiang Wang, Yi Li, Huifeng Yao +1

    cs.CVcs.AIarXiv:2308.12213v22023
  15. EfficientPhys: Enabling Simple, Fast and Accurate Camera-Based Vitals Measurement

    Xin Liu, Brian L. Hill, Ziheng Jiang +2

    cs.CVcs.AIcs.HCarXiv:2110.04447v32021
  16. Specifying Object Attributes and Relations in Interactive Scene Generation

    Oron Ashual, Lior Wolf

    cs.CVcs.LGarXiv:1909.05379v22019
  17. Non-local Meets Global: An Integrated Paradigm for Hyperspectral Denoising

    Wei He, Quanming Yao, Chao Li +2

    cs.CVarXiv:1812.04243v22018
  18. Learning with Feature-Dependent Label Noise: A Progressive Approach

    Yikai Zhang, Songzhu Zheng, Pengxiang Wu +2

    cs.LGcs.CVstat.AParXiv:2103.07756v32021
  19. Bi-directional Adapter for Multi-modal Tracking

    Bing Cao, Junliang Guo, Pengfei Zhu +1

    cs.CVcs.AIarXiv:2312.10611v12023
  20. What, Where and How to Transfer in SAR Target Recognition Based on Deep CNNs

    Zhongling Huang, Zongxu Pan, Bin Lei

    eess.SPcs.CVarXiv:1906.01379v12019
  21. Driving Digital Rock towards Machine Learning: predicting permeability with Gradient Boosting and Deep Neural Networks

    Oleg Sudakov, Evgeny Burnaev, Dmitry Koroteev

    physics.geo-phcs.CVphysics.comp-pharXiv:1803.00758v22018
  22. Dual Cross-Attention for Medical Image Segmentation

    Gorkem Can Ates, Prasoon Mohan, Emrah Celik

    cs.CVcs.LGeess.IVarXiv:2303.17696v12023
  23. FairLens: Benchmarking Fairness in Vision-Language Models for High-Stakes Decision-Making

    Vahid Reza Khazaie, Ahmed Y. Radwan, Shaina Raza

    cs.CVcs.LGarXiv:2609.01691v12026
  24. Few-shot Image Generation with Elastic Weight Consolidation

    Yijun Li, Richard Zhang, Jingwan Lu +1

    cs.CVarXiv:2012.02780v12020
  25. NextStep-1: Toward Autoregressive Image Generation with Continuous Tokens at Scale

    NextStep Team, Chunrui Han, Guopeng Li +47

    cs.CVarXiv:2508.10711v22025
  26. Asymmetric Bilateral Motion Estimation for Video Frame Interpolation

    Junheum Park, Chul Lee, Chang-Su Kim

    cs.CVarXiv:2108.06815v12021
  27. FLAVR: Flow-Agnostic Video Representations for Fast Frame Interpolation

    Tarun Kalluri, Deepak Pathak, Manmohan Chandraker +1

    cs.CVarXiv:2012.08512v32020
  28. Multi-Modal Answer Validation for Knowledge-Based VQA

    Jialin Wu, Jiasen Lu, Ashish Sabharwal +1

    cs.CVcs.CLarXiv:2103.12248v32021
  29. On the Effectiveness of Image Rotation for Open Set Domain Adaptation

    Silvia Bucci, Mohammad Reza Loghmani, Tatiana Tommasi

    cs.CVarXiv:2007.12360v12020
  30. WoW: Towards a World omniscient World model Through Embodied Interaction

    Xiaowei Chi, Peidong Jia, Chun-Kai Fan +33

    cs.ROcs.CVcs.MMarXiv:2509.22642v22025
  31. Does Playing it Safe Count as Faithfulness? Reassessing LVLM Hallucination Mitigation Methods

    Mehrdad Fazli, Sina Mansouri, Mohit Marvania +1

    cs.CVarXiv:2609.01888v12026
  32. KRIS-Bench: Benchmarking Next-Level Intelligent Image Editing Models

    Yongliang Wu, Zonghui Li, Xinting Hu +7

    cs.CVarXiv:2505.16707v12025
  33. Ola: Pushing the Frontiers of Omni-Modal Language Model

    Zuyan Liu, Yuhao Dong, Jiahui Wang +4

    cs.CVcs.CLcs.MMarXiv:2502.04328v32025
  34. Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation

    Zhe Kong, Feng Gao, Yong Zhang +5

    cs.CVarXiv:2505.22647v12025
  35. Accuracy comparison across face recognition algorithms: Where are we on measuring race bias?

    Jacqueline G. Cavazos, P. Jonathon Phillips, Carlos D. Castillo +1

    cs.CVcs.LGarXiv:1912.07398v22019
  36. Dual Graph Convolutional Network for Semantic Segmentation

    Li Zhang, Xiangtai Li, Anurag Arnab +3

    cs.CVarXiv:1909.06121v32019
  37. LLaVA-ST: A Multimodal Large Language Model for Fine-Grained Spatial-Temporal Understanding

    Hongyu Li, Jinyu Chen, Ziyu Wei +5

    cs.CVarXiv:2501.08282v22025
  38. ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding

    Xingyu Fu, Minqian Liu, Zhengyuan Yang +6

    cs.CVcs.CLarXiv:2501.05452v12025
  39. A Survey of LLM-based Agents in Medicine: How far are we from Baymax?

    Wenxuan Wang, Zizhan Ma, Zheng Wang +5

    cs.CLcs.AIcs.CVarXiv:2502.11211v22025
  40. Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control

    NVIDIA, :, Hassan Abu Alhaija +38

    cs.CVcs.AIcs.LGarXiv:2503.14492v22025
  41. Selective Structured State-Spaces for Long-Form Video Understanding

    Jue Wang, Wentao Zhu, Pichao Wang +4

    cs.CVarXiv:2303.14526v12023
  42. InfiniteVGGT: Visual Geometry Grounded Transformer for Endless Streams

    Shuai Yuan, Yantai Yang, Xiaotian Yang +4

    cs.CVarXiv:2601.02281v12026
  43. Ming-Omni: A Unified Multimodal Model for Perception and Generation

    Inclusion AI, Biao Gong, Cheng Zou +55

    cs.AIcs.CLcs.CVarXiv:2506.09344v12025
  44. FedPara: Low-Rank Hadamard Product for Communication-Efficient Federated Learning

    Nam Hyeon-Woo, Moon Ye-Bin, Tae-Hyun Oh

    cs.LGcs.CVarXiv:2108.06098v32021
  45. StarVLA-$α$: Reducing Complexity in Vision-Language-Action Systems

    Jinhui Ye, Ning Gao, Senqiao Yang +7

    cs.ROcs.AIcs.CVarXiv:2604.11757v12026
  46. LLM Post-Training: A Deep Dive into Reasoning Large Language Models

    Komal Kumar, Tajamul Ashraf, Omkar Thawakar +7

    cs.CLcs.CVarXiv:2502.21321v22025
  47. A CNN-based methodology for breast cancer diagnosis using thermal images

    Juan Zuluaga-Gomez, Zeina Al Masry, Khaled Benaggoune +2

    cs.CVeess.IVarXiv:1910.13757v12019
  48. Real-Time Scene-Adaptive Tone Mapping for High-Dynamic Range Object Detection

    Gongzhe Li, Linwei Qiu, Peibei Cao +3

    cs.CVarXiv:2608.30400v12026
  49. SAGE: Subpopulation-Aware Generative Enhancement for Mitigating Spurious Correlations

    Yiming Luo, Rongqiang Zhao, Jie Liu

    cs.LGcs.CVarXiv:2609.01051v12026
  50. Semi-Dense 3D Reconstruction with a Stereo Event Camera

    Yi Zhou, Guillermo Gallego, Henri Rebecq +3

    cs.CVcs.ROarXiv:1807.07429v12018
  51. StreamForest: Efficient Online Video Understanding with Persistent Event Memory

    Xiangyu Zeng, Kefan Qiu, Qingyu Zhang +9

    cs.CVarXiv:2509.24871v12025
  52. Automated Movie Generation via Multi-Agent CoT Planning

    Weijia Wu, Zeyu Zhu, Mike Zheng Shou

    cs.CVarXiv:2503.07314v12025
  53. DriveMoE: Mixture-of-Experts for Vision-Language-Action Model in End-to-End Autonomous Driving

    Zhenjie Yang, Yilin Chai, Xiaosong Jia +5

    cs.CVcs.AIcs.ROarXiv:2505.16278v22025
  54. Inverse Rendering for Modeling with Line Primitives

    Kenji Tojo, Ariel Shamir, Nobuyuki Umetani +1

    cs.GRcs.CVarXiv:2609.00625v12026
  55. MeRoPE: Metric Rotary Position Embedding for Camera-Controlled Video Generation

    Zhijian Qiao, Xinjiang Wang, Jiajie Chen +5

    cs.CVcs.ROarXiv:2609.01252v12026
  56. Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models

    Yunxin Li, Zhenyu Liu, Zitao Li +19

    cs.CVcs.CLarXiv:2505.04921v22025
  57. NeRDi: Single-View NeRF Synthesis with Language-Guided Diffusion as General Image Priors

    Congyue Deng, Chiyu "Max'' Jiang, Charles R. Qi +4

    cs.CVarXiv:2212.03267v12022
  58. Wavelet Diffusion Models are fast and scalable Image Generators

    Hao Phung, Quan Dao, Anh Tran

    cs.CVeess.IVarXiv:2211.16152v22022
  59. VideoPainter: Any-length Video Inpainting and Editing with Plug-and-Play Context Control

    Yuxuan Bian, Zhaoyang Zhang, Xuan Ju +4

    cs.CVcs.AIcs.MMarXiv:2503.05639v32025
  60. Streaming Long Video Understanding with Large Language Models

    Rui Qian, Xiaoyi Dong, Pan Zhang +4

    cs.CVarXiv:2405.16009v12024