Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
5,161 to 5,220 of 18,830
Improving Video-Text Retrieval by Multi-Stream Corpus Alignment and Dual Softmax Loss
Xing Cheng, Hezheng Lin, Xiangyu Wu +2
cs.CVarXiv:2109.04290v32021Spatiotemporal Modeling for Crowd Counting in Videos
Feng Xiong, Xingjian Shi, Dit-Yan Yeung
cs.CVarXiv:1707.07890v12017Traceable Evidence Enhanced Visual Grounded Reasoning: Evaluation and Methodology
Haochen Wang, Xiangtai Li, Zilong Huang +9
cs.CVcs.AIcs.CLarXiv:2507.07999v22025BooM-VVT: Boosting Mask-Free Video Virtual Try-On with Image-Level Pseudo Data
Wei Zhang, Xin Li, Peishu Shi +4
cs.CVarXiv:2609.04120v12026SAM-Med3D: Towards General-purpose Segmentation Models for Volumetric Medical Images
Haoyu Wang, Sizheng Guo, Jin Ye +11
cs.CVarXiv:2310.15161v32023FingerNet: An Unified Deep Network for Fingerprint Minutiae Extraction
Yao Tang, Fei Gao, Jufu Feng +1
cs.CVarXiv:1709.02228v12017On the Anatomy of MCMC-Based Maximum Likelihood Learning of Energy-Based Models
Erik Nijkamp, Mitch Hill, Tian Han +2
stat.MLcs.CVcs.LGarXiv:1903.12370v42019HoloAssist: an Egocentric Human Interaction Dataset for Interactive AI Assistants in the Real World
Xin Wang, Taein Kwon, Mahdi Rad +9
cs.CVarXiv:2309.17024v12023Understanding Humans in Crowded Scenes: Deep Nested Adversarial Learning and A New Benchmark for Multi-Human Parsing
Jian Zhao, Jianshu Li, Yu Cheng +4
cs.CVarXiv:1804.03287v32018Seeing, Listening, Remembering, and Reasoning: A Multimodal Agent with Long-Term Memory
Lin Long, Yichen He, Wentao Ye +5
cs.CVarXiv:2508.09736v42025Differentiable Learning-to-Normalize via Switchable Normalization
Ping Luo, Jiamin Ren, Zhanglin Peng +2
cs.CVcs.LGarXiv:1806.10779v52018FantasyTalking: Realistic Talking Portrait Generation via Coherent Motion Synthesis
Mengchao Wang, Qiang Wang, Fan Jiang +5
cs.CVarXiv:2504.04842v12025VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning
Qiuchen Wang, Ruixue Ding, Yu Zeng +6
cs.CLcs.AIcs.CVarXiv:2505.22019v22025CLIPN for Zero-Shot OOD Detection: Teaching CLIP to Say No
Hualiang Wang, Yi Li, Huifeng Yao +1
cs.CVcs.AIarXiv:2308.12213v22023EfficientPhys: Enabling Simple, Fast and Accurate Camera-Based Vitals Measurement
Xin Liu, Brian L. Hill, Ziheng Jiang +2
cs.CVcs.AIcs.HCarXiv:2110.04447v32021Specifying Object Attributes and Relations in Interactive Scene Generation
Oron Ashual, Lior Wolf
cs.CVcs.LGarXiv:1909.05379v22019Non-local Meets Global: An Integrated Paradigm for Hyperspectral Denoising
Wei He, Quanming Yao, Chao Li +2
cs.CVarXiv:1812.04243v22018Learning with Feature-Dependent Label Noise: A Progressive Approach
Yikai Zhang, Songzhu Zheng, Pengxiang Wu +2
cs.LGcs.CVstat.AParXiv:2103.07756v32021Bi-directional Adapter for Multi-modal Tracking
Bing Cao, Junliang Guo, Pengfei Zhu +1
cs.CVcs.AIarXiv:2312.10611v12023What, Where and How to Transfer in SAR Target Recognition Based on Deep CNNs
Zhongling Huang, Zongxu Pan, Bin Lei
eess.SPcs.CVarXiv:1906.01379v12019Driving Digital Rock towards Machine Learning: predicting permeability with Gradient Boosting and Deep Neural Networks
Oleg Sudakov, Evgeny Burnaev, Dmitry Koroteev
physics.geo-phcs.CVphysics.comp-pharXiv:1803.00758v22018Dual Cross-Attention for Medical Image Segmentation
Gorkem Can Ates, Prasoon Mohan, Emrah Celik
cs.CVcs.LGeess.IVarXiv:2303.17696v12023FairLens: Benchmarking Fairness in Vision-Language Models for High-Stakes Decision-Making
Vahid Reza Khazaie, Ahmed Y. Radwan, Shaina Raza
cs.CVcs.LGarXiv:2609.01691v12026Few-shot Image Generation with Elastic Weight Consolidation
Yijun Li, Richard Zhang, Jingwan Lu +1
cs.CVarXiv:2012.02780v12020NextStep-1: Toward Autoregressive Image Generation with Continuous Tokens at Scale
NextStep Team, Chunrui Han, Guopeng Li +47
cs.CVarXiv:2508.10711v22025Asymmetric Bilateral Motion Estimation for Video Frame Interpolation
Junheum Park, Chul Lee, Chang-Su Kim
cs.CVarXiv:2108.06815v12021FLAVR: Flow-Agnostic Video Representations for Fast Frame Interpolation
Tarun Kalluri, Deepak Pathak, Manmohan Chandraker +1
cs.CVarXiv:2012.08512v32020Multi-Modal Answer Validation for Knowledge-Based VQA
Jialin Wu, Jiasen Lu, Ashish Sabharwal +1
cs.CVcs.CLarXiv:2103.12248v32021On the Effectiveness of Image Rotation for Open Set Domain Adaptation
Silvia Bucci, Mohammad Reza Loghmani, Tatiana Tommasi
cs.CVarXiv:2007.12360v12020WoW: Towards a World omniscient World model Through Embodied Interaction
Xiaowei Chi, Peidong Jia, Chun-Kai Fan +33
cs.ROcs.CVcs.MMarXiv:2509.22642v22025Does Playing it Safe Count as Faithfulness? Reassessing LVLM Hallucination Mitigation Methods
Mehrdad Fazli, Sina Mansouri, Mohit Marvania +1
cs.CVarXiv:2609.01888v12026KRIS-Bench: Benchmarking Next-Level Intelligent Image Editing Models
Yongliang Wu, Zonghui Li, Xinting Hu +7
cs.CVarXiv:2505.16707v12025Ola: Pushing the Frontiers of Omni-Modal Language Model
Zuyan Liu, Yuhao Dong, Jiahui Wang +4
cs.CVcs.CLcs.MMarXiv:2502.04328v32025Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation
Zhe Kong, Feng Gao, Yong Zhang +5
cs.CVarXiv:2505.22647v12025Accuracy comparison across face recognition algorithms: Where are we on measuring race bias?
Jacqueline G. Cavazos, P. Jonathon Phillips, Carlos D. Castillo +1
cs.CVcs.LGarXiv:1912.07398v22019Dual Graph Convolutional Network for Semantic Segmentation
Li Zhang, Xiangtai Li, Anurag Arnab +3
cs.CVarXiv:1909.06121v32019LLaVA-ST: A Multimodal Large Language Model for Fine-Grained Spatial-Temporal Understanding
Hongyu Li, Jinyu Chen, Ziyu Wei +5
cs.CVarXiv:2501.08282v22025ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding
Xingyu Fu, Minqian Liu, Zhengyuan Yang +6
cs.CVcs.CLarXiv:2501.05452v12025A Survey of LLM-based Agents in Medicine: How far are we from Baymax?
Wenxuan Wang, Zizhan Ma, Zheng Wang +5
cs.CLcs.AIcs.CVarXiv:2502.11211v22025Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control
NVIDIA, :, Hassan Abu Alhaija +38
cs.CVcs.AIcs.LGarXiv:2503.14492v22025Selective Structured State-Spaces for Long-Form Video Understanding
Jue Wang, Wentao Zhu, Pichao Wang +4
cs.CVarXiv:2303.14526v12023InfiniteVGGT: Visual Geometry Grounded Transformer for Endless Streams
Shuai Yuan, Yantai Yang, Xiaotian Yang +4
cs.CVarXiv:2601.02281v12026Ming-Omni: A Unified Multimodal Model for Perception and Generation
Inclusion AI, Biao Gong, Cheng Zou +55
cs.AIcs.CLcs.CVarXiv:2506.09344v12025FedPara: Low-Rank Hadamard Product for Communication-Efficient Federated Learning
Nam Hyeon-Woo, Moon Ye-Bin, Tae-Hyun Oh
cs.LGcs.CVarXiv:2108.06098v32021StarVLA-$α$: Reducing Complexity in Vision-Language-Action Systems
Jinhui Ye, Ning Gao, Senqiao Yang +7
cs.ROcs.AIcs.CVarXiv:2604.11757v12026LLM Post-Training: A Deep Dive into Reasoning Large Language Models
Komal Kumar, Tajamul Ashraf, Omkar Thawakar +7
cs.CLcs.CVarXiv:2502.21321v22025A CNN-based methodology for breast cancer diagnosis using thermal images
Juan Zuluaga-Gomez, Zeina Al Masry, Khaled Benaggoune +2
cs.CVeess.IVarXiv:1910.13757v12019Real-Time Scene-Adaptive Tone Mapping for High-Dynamic Range Object Detection
Gongzhe Li, Linwei Qiu, Peibei Cao +3
cs.CVarXiv:2608.30400v12026SAGE: Subpopulation-Aware Generative Enhancement for Mitigating Spurious Correlations
Yiming Luo, Rongqiang Zhao, Jie Liu
cs.LGcs.CVarXiv:2609.01051v12026Semi-Dense 3D Reconstruction with a Stereo Event Camera
Yi Zhou, Guillermo Gallego, Henri Rebecq +3
cs.CVcs.ROarXiv:1807.07429v12018StreamForest: Efficient Online Video Understanding with Persistent Event Memory
Xiangyu Zeng, Kefan Qiu, Qingyu Zhang +9
cs.CVarXiv:2509.24871v12025Automated Movie Generation via Multi-Agent CoT Planning
Weijia Wu, Zeyu Zhu, Mike Zheng Shou
cs.CVarXiv:2503.07314v12025DriveMoE: Mixture-of-Experts for Vision-Language-Action Model in End-to-End Autonomous Driving
Zhenjie Yang, Yilin Chai, Xiaosong Jia +5
cs.CVcs.AIcs.ROarXiv:2505.16278v22025Inverse Rendering for Modeling with Line Primitives
Kenji Tojo, Ariel Shamir, Nobuyuki Umetani +1
cs.GRcs.CVarXiv:2609.00625v12026MeRoPE: Metric Rotary Position Embedding for Camera-Controlled Video Generation
Zhijian Qiao, Xinjiang Wang, Jiajie Chen +5
cs.CVcs.ROarXiv:2609.01252v12026Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models
Yunxin Li, Zhenyu Liu, Zitao Li +19
cs.CVcs.CLarXiv:2505.04921v22025NeRDi: Single-View NeRF Synthesis with Language-Guided Diffusion as General Image Priors
Congyue Deng, Chiyu "Max'' Jiang, Charles R. Qi +4
cs.CVarXiv:2212.03267v12022Wavelet Diffusion Models are fast and scalable Image Generators
Hao Phung, Quan Dao, Anh Tran
cs.CVeess.IVarXiv:2211.16152v22022VideoPainter: Any-length Video Inpainting and Editing with Plug-and-Play Context Control
Yuxuan Bian, Zhaoyang Zhang, Xuan Ju +4
cs.CVcs.AIcs.MMarXiv:2503.05639v32025Streaming Long Video Understanding with Large Language Models
Rui Qian, Xiaoyi Dong, Pan Zhang +4
cs.CVarXiv:2405.16009v12024