Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
6,001 to 6,060 of 18,839
Repeatability of Multiparametric Prostate MRI Radiomics Features
Michael Schwier, Joost van Griethuysen, Mark G Vangel +7
cs.CVeess.IVarXiv:1807.06089v22018MeshSplatBench: A Unified Benchmark for Triangle-Based Neural Rendering
Kaixuan Zhang, Minxian Li, Mingwu Ren +1
cs.GRcs.CVarXiv:2609.01306v12026DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control
Junjie Wen, Yichen Zhu, Jinming Li +3
cs.ROcs.CVarXiv:2502.05855v32025Vision-and-Language Navigation: A Survey of Tasks, Methods, and Future Directions
Jing Gu, Eliana Stefani, Qi Wu +2
cs.CVcs.AIcs.CLarXiv:2203.12667v32022DGNet: Dual-knowledge Guided Network for Infrared Small Target Detection
Chenglong Yu, Mingzhu Xu, Jing Wang +3
cs.CVarXiv:2609.00666v12026Bridging Language and Spherical Space: Object-Centric Control for Text-to-Panorama Generation
Derui Li, Qian Qiao, Yuhao Sun +2
cs.CVarXiv:2608.20691v12026Path2ST: Hierarchical Cell-Tissue Grounded Cross-Modal Translation for Spatial Transcriptomics
Ruochen Liu, Wei Lou
cs.CVcs.AIcs.CLarXiv:2608.14710v12026CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models
Mukhtiar Ali, Harsh Dubey, Sugam Mishra +1
cs.CVcs.IRcs.MMarXiv:2608.04302v12026G-MAD: A Game-Based Data Generation Framework for Multi-View RGB-T Aerial Object Detection
Yechan Kim, JongHyun Park, Dongho Yoon +2
cs.CVcs.AIarXiv:2607.19942v22026Appearance Pointers -- Multimodal Region Control of Diffusion Transformers
Rahul Sajnani, Yulia Gryaditskaya, Radomír Měch +2
cs.CVcs.AIcs.GRarXiv:2607.19344v12026Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget
Guoxuan Chen, Chufeng Xiao, Haoran Yang +30
cs.CVcs.AIarXiv:2607.13125v22026Confidence-Aware Tool Orchestration for Robust Video Understanding
Yangfan He, Yujin Choi, Jaehong Yoon
cs.CVcs.AIarXiv:2606.26904v12026Kairos: A Regret-Aware Native World-Action Model Stack for Physical AI
Kairos Team, Fei Wang, Shan You +21
cs.AIcs.CVarXiv:2606.16533v32026MeshFlow: Mesh Generation with Equivariant Flow Matching
Qi Sun, Kiyohiro Nakayama, Jing Nathan Yan +6
cs.GRcs.CVarXiv:2606.23489v12026Can Generalist Agents Automate Data Curation?
Feiyang Kang, Hanze Li, Adam Nguyen +5
cs.AIcs.CLcs.CVarXiv:2606.04261v12026Decoupled Residual Denoising Diffusion Models for Unified and Data Efficient Image-to-Image Translation
Ziyue Lin, Jiahe Hou, Hongyu Xia +6
cs.CVarXiv:2606.01048v12026Good Token Hunting: A Hitchhiker's Guide to Token Selection for Visual Geometry Transformers
Shuhong Zheng, Michael Oechsle, Erik Sandström +3
cs.CVcs.AIcs.GRarXiv:2605.23892v12026Generative Modeling with Orbit-Space Particle Flow Matching
Sinan Wang, Jinjin He, Shenyifan Lu +3
cs.GRcs.CVarXiv:2605.02222v12026Micro-Defects Expose Macro-Fakes: Detecting AI-Generated Images via Local Distributional Shifts
Boxuan Zhang, Jianing Zhu, Qifan Wang +2
cs.CVcs.AIcs.LGarXiv:2605.09296v12026HL-OutPaint: Coarse-to-Fine Video Outpainting for High-Resolution Long-Range Videos
Jeongeun Park, Janghyeok Han, Geonung Kim +4
cs.CVcs.GRarXiv:2605.17543v32026CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization
Ahmed Heakl, Abdelrahman M. Shaker, Youssef Mohamed +4
cs.LGcs.CLcs.CVarXiv:2605.19436v12026Fruit Detection, Segmentation and 3D Visualisation of Environments in Apple Orchards
Hanwen Kang, Chao Chen
cs.CVeess.IVarXiv:1911.12889v12019UniVidX: A Unified Multimodal Framework for Versatile Video Generation via Diffusion Priors
Houyuan Chen, Hong Li, Xianghao Kong +8
cs.CVarXiv:2605.00658v12026RoboRefer: Towards Spatial Referring with Reasoning in Vision-Language Models for Robotics
Enshen Zhou, Jingkun An, Cheng Chi +8
cs.ROcs.AIcs.CVarXiv:2506.04308v42025Semantic Richness or Geometric Reasoning? The Fragility of VLM's Visual Invariance
Jason Qiu, Zachary Meurer, Xavier Thomas +1
cs.CVarXiv:2604.01848v42026On-the-fly Repulsion in the Contextual Space for Rich Diversity in Diffusion Transformers
Omer Dahary, Benaya Koren, Daniel Garibi +1
cs.CVcs.AIcs.GRarXiv:2603.28762v22026ExpArt-KG: Artwork Image Description Generation through Iterative Exploration of Knowledge Graphs
Yuta Kato, Shintaro Ozaki, Kazuki Hayashi +4
cs.CLcs.CVarXiv:2609.00629v12026Less Gaussians, Texture More: 4K Feed-Forward Textured Splatting
Yixing Lao, Xuyang Bai, Xiaoyang Wu +7
cs.CVarXiv:2603.25745v12026Cognitive Mismatch in Multimodal Large Language Models for Discrete Symbol Understanding
Yinghui Li, Jiayi Kuang, Peng Xing +11
cs.AIcs.CVarXiv:2603.18472v22026Scaling Computer-Use Grounding via User Interface Decomposition and Synthesis
Tianbao Xie, Jiaqi Deng, Xiaochuan Li +12
cs.AIcs.CLcs.CVarXiv:2505.13227v32025GRADE: Benchmarking Discipline-Informed Reasoning in Image Editing
Mingxin Liu, Ziqian Fan, Zhaokai Wang +13
cs.CVarXiv:2603.12264v12026DanceFormer: Music Conditioned 3D Dance Generation with Parametric Motion Transformer
Buyu Li, Yongchi Zhao, Zhelun Shi +1
cs.AIcs.CVarXiv:2103.10206v52021Memory Attention Networks for Skeleton-based Action Recognition
Chunyu Xie, Ce Li, Baochang Zhang +4
cs.CVarXiv:1804.08254v22018Towards Practical Real-Time Neural Video Compression
Zhaoyang Jia, Bin Li, Jiahao Li +4
eess.IVcs.CVarXiv:2502.20762v22025LongCat-Image Technical Report
Meituan LongCat Team, Hanghang Ma, Haoxian Tan +10
cs.CVarXiv:2512.07584v12025LongVPO: From Anchored Cues to Self-Reasoning for Long-Form Video Preference Optimization
Zhenpeng Huang, Jiaqi Li, Zihan Jia +6
cs.CVarXiv:2602.02341v12026Think-Then-Generate: Reasoning-Aware Text-to-Image Diffusion with LLM Encoders
Siqi Kou, Jiachun Jin, Zetong Zhou +8
cs.CVarXiv:2601.10332v12026History-Guided Video Diffusion
Kiwhan Song, Boyuan Chen, Max Simchowitz +3
cs.LGcs.CVarXiv:2502.06764v22025Deep Learning with Lung Segmentation and Bone Shadow Exclusion Techniques for Chest X-Ray Analysis of Lung Cancer
Yu. Gordienko, Peng Gang, Jiang Hui +5
cs.LGcs.CVarXiv:1712.07632v12017RealNet: A Feature Selection Network with Realistic Synthetic Anomaly for Anomaly Detection
Ximiao Zhang, Min Xu, Xiuzhuang Zhou
cs.CVarXiv:2403.05897v12024Gaussian Splatting SLAM
Hidenobu Matsuki, Riku Murai, Paul H. J. Kelly +1
cs.CVcs.ROarXiv:2312.06741v22023Solving Challenging Math Word Problems Using GPT-4 Code Interpreter with Code-based Self-Verification
Aojun Zhou, Ke Wang, Zimu Lu +8
cs.CLcs.AIcs.CVarXiv:2308.07921v12023ImageReward: Learning and Evaluating Human Preferences for Text-to-Image Generation
Jiazheng Xu, Xiao Liu, Yuchen Wu +5
cs.CVcs.LGarXiv:2304.05977v42023Elucidating the Design Space of Diffusion-Based Generative Models
Tero Karras, Miika Aittala, Timo Aila +1
cs.CVcs.AIcs.LGarXiv:2206.00364v22022Simple Baselines for Image Restoration
Liangyu Chen, Xiaojie Chu, Xiangyu Zhang +1
cs.CVarXiv:2204.04676v42022Avoiding Overfitting: A Survey on Regularization Methods for Convolutional Neural Networks
Claudio Filipi Gonçalves dos Santos, João Paulo Papa
cs.CVcs.LGarXiv:2201.03299v12022Single View Stereo Matching
Yue Luo, Jimmy Ren, Mude Lin +4
cs.CVarXiv:1803.02612v22018PhaseNet for Video Frame Interpolation
Simone Meyer, Abdelaziz Djelouah, Brian McWilliams +3
cs.CVarXiv:1804.00884v12018GeoDesc: Learning Local Descriptors by Integrating Geometry Constraints
Zixin Luo, Tianwei Shen, Lei Zhou +5
cs.CVarXiv:1807.06294v22018Rendezvous: Attention Mechanisms for the Recognition of Surgical Action Triplets in Endoscopic Videos
Chinedu Innocent Nwoye, Tong Yu, Cristians Gonzalez +5
cs.CVarXiv:2109.03223v22021TransMIL: Transformer based Correlated Multiple Instance Learning for Whole Slide Image Classification
Zhuchen Shao, Hao Bian, Yang Chen +4
cs.CVarXiv:2106.00908v22021Applications of Deep Learning in Fundus Images: A Review
Tao Li, Wang Bo, Chunyu Hu +4
eess.IVcs.CVcs.LGarXiv:2101.09864v12021Stop Looking for Important Tokens in Multimodal Language Models: Duplication Matters More
Zichen Wen, Yifeng Gao, Shaobo Wang +5
cs.CLcs.CVarXiv:2502.11494v22025AQ3D: Adaptive Query Transformer for 3D Instance Segmentation
Keno Moenck, Thorsten Schüppstuhl
cs.CVarXiv:2608.30618v12026Rescaling Egocentric Vision
Dima Damen, Hazel Doughty, Giovanni Maria Farinella +8
cs.CVcs.LGarXiv:2006.13256v42020Learning Imbalanced Datasets with Label-Distribution-Aware Margin Loss
Kaidi Cao, Colin Wei, Adrien Gaidon +2
cs.LGcs.CVstat.MLarXiv:1906.07413v22019Detecting GAN generated Fake Images using Co-occurrence Matrices
Lakshmanan Nataraj, Tajuddin Manhar Mohammed, Shivkumar Chandrasekaran +4
cs.CVeess.IVarXiv:1903.06836v22019Unsupervised Learning via Meta-Learning
Kyle Hsu, Sergey Levine, Chelsea Finn
cs.LGcs.AIcs.CVarXiv:1810.02334v62018How Powerful are Graph Neural Networks?
Keyulu Xu, Weihua Hu, Jure Leskovec +1
cs.LGcs.CVstat.MLarXiv:1810.00826v32018Progressive Neural Architecture Search
Chenxi Liu, Barret Zoph, Maxim Neumann +7
cs.CVcs.LGstat.MLarXiv:1712.00559v32017