Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
16,441 to 16,500 of 18,839
SPARK-SAM: Self-Prompt Adaptation with Response Knowledge for SAM in Infrared Small Target Segmentation
Aji Mao, Zhenming Peng, Bailin Mu +1
cs.CVarXiv:2608.20754v12026A survey of loss functions for semantic segmentation
Shruti Jadon
eess.IVcs.CVcs.LGarXiv:2006.14822v42020fastMRI: An Open Dataset and Benchmarks for Accelerated MRI
Jure Zbontar, Florian Knoll, Anuroop Sriram +24
cs.CVcs.LGeess.SParXiv:1811.08839v22018Inference-time Physics Alignment of Video Generative Models with Latent World Models
Jianhao Yuan, Xiaofeng Zhang, Felix Friedrich +7
cs.CVarXiv:2601.10553v22026MotionPhys: Detecting AI-Generated Videos via Physical Consistency of Optical-Flow Trajectories
Haojin He, Hao Tan, Zichang Tan +2
cs.CVarXiv:2608.20770v12026Learning multiple visual domains with residual adapters
Sylvestre-Alvise Rebuffi, Hakan Bilen, Andrea Vedaldi
cs.CVstat.MLarXiv:1705.08045v52017MultiCube: Compositional 3D Generation With Part-Level Semantic and Spatial Control
Ava Pun, Kangle Deng, Yiheng Zhu +3
cs.GRcs.CVarXiv:2608.20448v12026World Guidance: World Modeling in Condition Space for Action Generation
Yue Su, Sijin Chen, Haixin Shi +7
cs.ROcs.CVarXiv:2602.22010v12026ConViT: Improving Vision Transformers with Soft Convolutional Inductive Biases
Stéphane d'Ascoli, Hugo Touvron, Matthew Leavitt +3
cs.CVcs.LGstat.MLarXiv:2103.10697v22021GIRAFFE: Representing Scenes as Compositional Generative Neural Feature Fields
Michael Niemeyer, Andreas Geiger
cs.CVcs.LGarXiv:2011.12100v22020Enhancing Localized Reasoning for Long Video Understanding via Efficient Segment-to-Video Supervision
Beibei Zhang, Chao Xu, Jun Lan +4
cs.CVarXiv:2608.20814v12026Soft Filter Pruning for Accelerating Deep Convolutional Neural Networks
Yang He, Guoliang Kang, Xuanyi Dong +2
cs.CVarXiv:1808.06866v12018ABot-PhysWorld: Interactive World Foundation Model for Robotic Manipulation with Physics Alignment
Yuzhi Chen, Ronghan Chen, Dongjie Huo +11
cs.CVcs.ROarXiv:2603.23376v22026Towards Automatic Learning of Procedures from Web Instructional Videos
Luowei Zhou, Chenliang Xu, Jason J. Corso
cs.CVarXiv:1703.09788v32017When does fusing hand-crafted knowledge with learned representations pay? A cost-normalized benchmark of stacking, substitution, and interference
Ahmad AlMughrabi, Albert Clop, Benjamin Busam +2
cs.CVarXiv:2608.21098v12026A Survey on Learning to Hash
Jingdong Wang, Ting Zhang, Jingkuan Song +2
cs.CVarXiv:1606.00185v22016OmniGAIA: Towards Native Omni-Modal AI Agents
Xiaoxi Li, Wenxiang Jiao, Jiarui Jin +10
cs.AIcs.CLcs.CVarXiv:2602.22897v32026LoGeR: Long-Context Geometric Reconstruction with Hybrid Memory
Junyi Zhang, Charles Herrmann, Junhwa Hur +5
cs.CVcs.LGarXiv:2603.03269v22026SoPhie: An Attentive GAN for Predicting Paths Compliant to Social and Physical Constraints
Amir Sadeghian, Vineet Kosaraju, Ali Sadeghian +3
cs.CVarXiv:1806.01482v22018HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding
Haowei Zhang, Shudong Yang, Jinlan Fu +2
cs.CVcs.AIcs.CLarXiv:2601.14724v42026AgentDoG: A Diagnostic Guardrail Framework for AI Agent Safety and Security
Dongrui Liu, Qihan Ren, Chen Qian +40
cs.AIcs.CCcs.CLarXiv:2601.18491v22026MVSNeRF: Fast Generalizable Radiance Field Reconstruction from Multi-View Stereo
Anpei Chen, Zexiang Xu, Fuqiang Zhao +4
cs.CVarXiv:2103.15595v22021WildFin: An In-the-Wild Dataset for Fish Behavioral Recognition
Abigail G. Grassick, Jerome Tze-Hou Hsu, Ethan Lin +10
cs.CVarXiv:2608.21281v12026Deep Closest Point: Learning Representations for Point Cloud Registration
Yue Wang, Justin M. Solomon
cs.CVarXiv:1905.03304v12019PVNet: Pixel-wise Voting Network for 6DoF Pose Estimation
Sida Peng, Yuan Liu, Qixing Huang +2
cs.CVarXiv:1812.11788v12018MMFineReason: Closing the Multimodal Reasoning Gap via Open Data-Centric Methods
Honglin Lin, Zheng Liu, Yun Zhu +6
cs.CVarXiv:2601.21821v12026RFN-Nest: An end-to-end residual fusion network for infrared and visible images
Hui Li, Xiao-Jun Wu, Josef Kittler
cs.CVarXiv:2103.04286v22021OccluRank: Controllable Occlusion-Aware Layout-to-Image Generation by Adding Just an Ordinal Rank
Wenyang Hong, Yuan Wang, Yanbin Hao +5
cs.CVarXiv:2608.20932v12026Rethinking Video Generation Model for the Embodied World
Yufan Deng, Zilin Pan, Hongyu Zhang +6
cs.CVcs.AIcs.ROarXiv:2601.15282v12026Dorsal Hand Images for Immersive (XR) and Privacy-preserving Age Assurance and Child Safety
Riccardo Bovo, George Loukas, Josh P. Davis
cs.CVarXiv:2608.21009v12026AutoFigure: Generating and Refining Publication-Ready Scientific Illustrations
Minjun Zhu, Zhen Lin, Yixuan Weng +6
cs.AIcs.CLcs.CVarXiv:2602.03828v22026EGNet:Edge Guidance Network for Salient Object Detection
Jia-Xing Zhao, Jiangjiang Liu, Den-Ping Fan +3
cs.CVarXiv:1908.08297v12019Evaluation of Output Embeddings for Fine-Grained Image Classification
Zeynep Akata, Scott Reed, Daniel Walter +2
cs.CVarXiv:1409.8403v22014Revisiting the Platonic Representation Hypothesis: An Aristotelian View
Fabian Gröger, Shuo Wen, Maria Brbić
cs.LGcs.AIcs.CVarXiv:2602.14486v22026Just Noticeable Difference Modeling for Token Compression in Vision-Language-Action Models
Zhuoyuan Li, Rui Zhao, Jin Wang +5
cs.CVcs.ROarXiv:2608.21247v12026DynamicVLA: A Vision-Language-Action Model for Dynamic Object Manipulation
Haozhe Xie, Beichen Wen, Jiarui Zheng +4
cs.ROcs.CVarXiv:2601.22153v12026Solaris: Building a Multiplayer Video World Model in Minecraft
Georgy Savva, Oscar Michel, Daohan Lu +6
cs.CVarXiv:2602.22208v22026A Transformer-Based Siamese Network for Change Detection
Wele Gedara Chaminda Bandara, Vishal M. Patel
cs.CVarXiv:2201.01293v72022Vision Transformers for Single Image Dehazing
Yuda Song, Zhuqing He, Hui Qian +1
cs.CVarXiv:2204.03883v12022UI-Venus-1.5 Technical Report
Venus Team, Changlong Gao, Zhangxuan Gu +24
cs.CVcs.AIcs.CLarXiv:2602.09082v22026Infinite-World: Scaling Interactive World Models to 1000-Frame Horizons via Pose-Free Hierarchical Memory
Ruiqi Wu, Xuanhua He, Meng Cheng +8
cs.CVcs.AIarXiv:2602.02393v22026GridDehazeNet: Attention-Based Multi-Scale Network for Image Dehazing
Xiaohong Liu, Yongrui Ma, Zhihao Shi +1
cs.CVeess.IVarXiv:1908.03245v12019Gen-Searcher: Reinforcing Agentic Search for Image Generation
Kaituo Feng, Manyuan Zhang, Shuang Chen +7
cs.CVarXiv:2603.28767v32026FFJORD: Free-form Continuous Dynamics for Scalable Reversible Generative Models
Will Grathwohl, Ricky T. Q. Chen, Jesse Bettencourt +2
cs.LGcs.CVstat.MLarXiv:1810.01367v32018Pick-a-Pic: An Open Dataset of User Preferences for Text-to-Image Generation
Yuval Kirstain, Adam Polyak, Uriel Singer +3
cs.CVcs.AIarXiv:2305.01569v22023FireRed-Image-Edit-1.0 Technical Report
Super Intelligence Team, Changhao Qiao, Chao Hui +16
cs.CVeess.IVarXiv:2602.13344v22026Disentangling and Unifying Graph Convolutions for Skeleton-Based Action Recognition
Ziyu Liu, Hongwen Zhang, Zhenghao Chen +2
cs.CVarXiv:2003.14111v22020Multi-Modal Traffic Sign Detection with Semantic Attributes for Autonomous Driving
Meda Lazar, Sourab Sridhar, Shashwata Gupta +3
cs.CVcs.ROarXiv:2608.20874v12026PCN: Point Completion Network
Wentao Yuan, Tejas Khot, David Held +2
cs.CVcs.ROarXiv:1808.00671v32018MedCLIP: Contrastive Learning from Unpaired Medical Images and Text
Zifeng Wang, Zhenbang Wu, Dinesh Agarwal +1
cs.CVcs.CLarXiv:2210.10163v12022Vector Quantized Diffusion Model for Text-to-Image Synthesis
Shuyang Gu, Dong Chen, Jianmin Bao +5
cs.CVcs.LGarXiv:2111.14822v32021RepPoints: Point Set Representation for Object Detection
Ze Yang, Shaohui Liu, Han Hu +2
cs.CVarXiv:1904.11490v22019OmniWeaving: Towards Unified Video Generation with Free-form Composition and Reasoning
Kaihang Pan, Qi Tian, Jianwei Zhang +11
cs.CVarXiv:2603.24458v22026Recognition-Conditioned Reasoning: A Training-Free Multimodal-LLM Pipeline for Fine-Grained Micro-Action Understanding
Fengshun Wang, Jin'ang Han, Zhigang Tu
cs.CVcs.MMarXiv:2608.21022v12026eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers
Yogesh Balaji, Seungjun Nah, Xun Huang +10
cs.CVcs.LGarXiv:2211.01324v52022BabyVision: Visual Reasoning Beyond Language
Liang Chen, Weichu Xie, Yiyan Liang +27
cs.CVcs.CLarXiv:2601.06521v22026V-DPM: 4D Video Reconstruction with Dynamic Point Maps
Edgar Sucar, Eldar Insafutdinov, Zihang Lai +1
cs.CVarXiv:2601.09499v12026OFA: Unifying Architectures, Tasks, and Modalities Through a Simple Sequence-to-Sequence Learning Framework
Peng Wang, An Yang, Rui Men +7
cs.CVcs.CLarXiv:2202.03052v22022KoViDoRe: Korean Visual Document Retrieval
Yongbin Choi, Yongwoo Song, Mujeen Sung
cs.IRcs.CVarXiv:2608.20840v12026Video-to-Video Synthesis
Ting-Chun Wang, Ming-Yu Liu, Jun-Yan Zhu +4
cs.CVcs.GRcs.LGarXiv:1808.06601v22018