Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

6,001 to 6,060 of 18,839

  1. Repeatability of Multiparametric Prostate MRI Radiomics Features

    Michael Schwier, Joost van Griethuysen, Mark G Vangel +7

    cs.CVeess.IVarXiv:1807.06089v22018
  2. MeshSplatBench: A Unified Benchmark for Triangle-Based Neural Rendering

    Kaixuan Zhang, Minxian Li, Mingwu Ren +1

    cs.GRcs.CVarXiv:2609.01306v12026
  3. DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control

    Junjie Wen, Yichen Zhu, Jinming Li +3

    cs.ROcs.CVarXiv:2502.05855v32025
  4. Vision-and-Language Navigation: A Survey of Tasks, Methods, and Future Directions

    Jing Gu, Eliana Stefani, Qi Wu +2

    cs.CVcs.AIcs.CLarXiv:2203.12667v32022
  5. DGNet: Dual-knowledge Guided Network for Infrared Small Target Detection

    Chenglong Yu, Mingzhu Xu, Jing Wang +3

    cs.CVarXiv:2609.00666v12026
  6. Bridging Language and Spherical Space: Object-Centric Control for Text-to-Panorama Generation

    Derui Li, Qian Qiao, Yuhao Sun +2

    cs.CVarXiv:2608.20691v12026
  7. Path2ST: Hierarchical Cell-Tissue Grounded Cross-Modal Translation for Spatial Transcriptomics

    Ruochen Liu, Wei Lou

    cs.CVcs.AIcs.CLarXiv:2608.14710v12026
  8. CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models

    Mukhtiar Ali, Harsh Dubey, Sugam Mishra +1

    cs.CVcs.IRcs.MMarXiv:2608.04302v12026
  9. G-MAD: A Game-Based Data Generation Framework for Multi-View RGB-T Aerial Object Detection

    Yechan Kim, JongHyun Park, Dongho Yoon +2

    cs.CVcs.AIarXiv:2607.19942v22026
  10. Appearance Pointers -- Multimodal Region Control of Diffusion Transformers

    Rahul Sajnani, Yulia Gryaditskaya, Radomír Měch +2

    cs.CVcs.AIcs.GRarXiv:2607.19344v12026
  11. Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget

    Guoxuan Chen, Chufeng Xiao, Haoran Yang +30

    cs.CVcs.AIarXiv:2607.13125v22026
  12. Confidence-Aware Tool Orchestration for Robust Video Understanding

    Yangfan He, Yujin Choi, Jaehong Yoon

    cs.CVcs.AIarXiv:2606.26904v12026
  13. Kairos: A Regret-Aware Native World-Action Model Stack for Physical AI

    Kairos Team, Fei Wang, Shan You +21

    cs.AIcs.CVarXiv:2606.16533v32026
  14. MeshFlow: Mesh Generation with Equivariant Flow Matching

    Qi Sun, Kiyohiro Nakayama, Jing Nathan Yan +6

    cs.GRcs.CVarXiv:2606.23489v12026
  15. Can Generalist Agents Automate Data Curation?

    Feiyang Kang, Hanze Li, Adam Nguyen +5

    cs.AIcs.CLcs.CVarXiv:2606.04261v12026
  16. Decoupled Residual Denoising Diffusion Models for Unified and Data Efficient Image-to-Image Translation

    Ziyue Lin, Jiahe Hou, Hongyu Xia +6

    cs.CVarXiv:2606.01048v12026
  17. Good Token Hunting: A Hitchhiker's Guide to Token Selection for Visual Geometry Transformers

    Shuhong Zheng, Michael Oechsle, Erik Sandström +3

    cs.CVcs.AIcs.GRarXiv:2605.23892v12026
  18. Generative Modeling with Orbit-Space Particle Flow Matching

    Sinan Wang, Jinjin He, Shenyifan Lu +3

    cs.GRcs.CVarXiv:2605.02222v12026
  19. Micro-Defects Expose Macro-Fakes: Detecting AI-Generated Images via Local Distributional Shifts

    Boxuan Zhang, Jianing Zhu, Qifan Wang +2

    cs.CVcs.AIcs.LGarXiv:2605.09296v12026
  20. HL-OutPaint: Coarse-to-Fine Video Outpainting for High-Resolution Long-Range Videos

    Jeongeun Park, Janghyeok Han, Geonung Kim +4

    cs.CVcs.GRarXiv:2605.17543v32026
  21. CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization

    Ahmed Heakl, Abdelrahman M. Shaker, Youssef Mohamed +4

    cs.LGcs.CLcs.CVarXiv:2605.19436v12026
  22. Fruit Detection, Segmentation and 3D Visualisation of Environments in Apple Orchards

    Hanwen Kang, Chao Chen

    cs.CVeess.IVarXiv:1911.12889v12019
  23. UniVidX: A Unified Multimodal Framework for Versatile Video Generation via Diffusion Priors

    Houyuan Chen, Hong Li, Xianghao Kong +8

    cs.CVarXiv:2605.00658v12026
  24. RoboRefer: Towards Spatial Referring with Reasoning in Vision-Language Models for Robotics

    Enshen Zhou, Jingkun An, Cheng Chi +8

    cs.ROcs.AIcs.CVarXiv:2506.04308v42025
  25. Semantic Richness or Geometric Reasoning? The Fragility of VLM's Visual Invariance

    Jason Qiu, Zachary Meurer, Xavier Thomas +1

    cs.CVarXiv:2604.01848v42026
  26. On-the-fly Repulsion in the Contextual Space for Rich Diversity in Diffusion Transformers

    Omer Dahary, Benaya Koren, Daniel Garibi +1

    cs.CVcs.AIcs.GRarXiv:2603.28762v22026
  27. ExpArt-KG: Artwork Image Description Generation through Iterative Exploration of Knowledge Graphs

    Yuta Kato, Shintaro Ozaki, Kazuki Hayashi +4

    cs.CLcs.CVarXiv:2609.00629v12026
  28. Less Gaussians, Texture More: 4K Feed-Forward Textured Splatting

    Yixing Lao, Xuyang Bai, Xiaoyang Wu +7

    cs.CVarXiv:2603.25745v12026
  29. Cognitive Mismatch in Multimodal Large Language Models for Discrete Symbol Understanding

    Yinghui Li, Jiayi Kuang, Peng Xing +11

    cs.AIcs.CVarXiv:2603.18472v22026
  30. Scaling Computer-Use Grounding via User Interface Decomposition and Synthesis

    Tianbao Xie, Jiaqi Deng, Xiaochuan Li +12

    cs.AIcs.CLcs.CVarXiv:2505.13227v32025
  31. GRADE: Benchmarking Discipline-Informed Reasoning in Image Editing

    Mingxin Liu, Ziqian Fan, Zhaokai Wang +13

    cs.CVarXiv:2603.12264v12026
  32. DanceFormer: Music Conditioned 3D Dance Generation with Parametric Motion Transformer

    Buyu Li, Yongchi Zhao, Zhelun Shi +1

    cs.AIcs.CVarXiv:2103.10206v52021
  33. Memory Attention Networks for Skeleton-based Action Recognition

    Chunyu Xie, Ce Li, Baochang Zhang +4

    cs.CVarXiv:1804.08254v22018
  34. Towards Practical Real-Time Neural Video Compression

    Zhaoyang Jia, Bin Li, Jiahao Li +4

    eess.IVcs.CVarXiv:2502.20762v22025
  35. LongCat-Image Technical Report

    Meituan LongCat Team, Hanghang Ma, Haoxian Tan +10

    cs.CVarXiv:2512.07584v12025
  36. LongVPO: From Anchored Cues to Self-Reasoning for Long-Form Video Preference Optimization

    Zhenpeng Huang, Jiaqi Li, Zihan Jia +6

    cs.CVarXiv:2602.02341v12026
  37. Think-Then-Generate: Reasoning-Aware Text-to-Image Diffusion with LLM Encoders

    Siqi Kou, Jiachun Jin, Zetong Zhou +8

    cs.CVarXiv:2601.10332v12026
  38. History-Guided Video Diffusion

    Kiwhan Song, Boyuan Chen, Max Simchowitz +3

    cs.LGcs.CVarXiv:2502.06764v22025
  39. Deep Learning with Lung Segmentation and Bone Shadow Exclusion Techniques for Chest X-Ray Analysis of Lung Cancer

    Yu. Gordienko, Peng Gang, Jiang Hui +5

    cs.LGcs.CVarXiv:1712.07632v12017
  40. RealNet: A Feature Selection Network with Realistic Synthetic Anomaly for Anomaly Detection

    Ximiao Zhang, Min Xu, Xiuzhuang Zhou

    cs.CVarXiv:2403.05897v12024
  41. Gaussian Splatting SLAM

    Hidenobu Matsuki, Riku Murai, Paul H. J. Kelly +1

    cs.CVcs.ROarXiv:2312.06741v22023
  42. Solving Challenging Math Word Problems Using GPT-4 Code Interpreter with Code-based Self-Verification

    Aojun Zhou, Ke Wang, Zimu Lu +8

    cs.CLcs.AIcs.CVarXiv:2308.07921v12023
  43. ImageReward: Learning and Evaluating Human Preferences for Text-to-Image Generation

    Jiazheng Xu, Xiao Liu, Yuchen Wu +5

    cs.CVcs.LGarXiv:2304.05977v42023
  44. Elucidating the Design Space of Diffusion-Based Generative Models

    Tero Karras, Miika Aittala, Timo Aila +1

    cs.CVcs.AIcs.LGarXiv:2206.00364v22022
  45. Simple Baselines for Image Restoration

    Liangyu Chen, Xiaojie Chu, Xiangyu Zhang +1

    cs.CVarXiv:2204.04676v42022
  46. Avoiding Overfitting: A Survey on Regularization Methods for Convolutional Neural Networks

    Claudio Filipi Gonçalves dos Santos, João Paulo Papa

    cs.CVcs.LGarXiv:2201.03299v12022
  47. Single View Stereo Matching

    Yue Luo, Jimmy Ren, Mude Lin +4

    cs.CVarXiv:1803.02612v22018
  48. PhaseNet for Video Frame Interpolation

    Simone Meyer, Abdelaziz Djelouah, Brian McWilliams +3

    cs.CVarXiv:1804.00884v12018
  49. GeoDesc: Learning Local Descriptors by Integrating Geometry Constraints

    Zixin Luo, Tianwei Shen, Lei Zhou +5

    cs.CVarXiv:1807.06294v22018
  50. Rendezvous: Attention Mechanisms for the Recognition of Surgical Action Triplets in Endoscopic Videos

    Chinedu Innocent Nwoye, Tong Yu, Cristians Gonzalez +5

    cs.CVarXiv:2109.03223v22021
  51. TransMIL: Transformer based Correlated Multiple Instance Learning for Whole Slide Image Classification

    Zhuchen Shao, Hao Bian, Yang Chen +4

    cs.CVarXiv:2106.00908v22021
  52. Applications of Deep Learning in Fundus Images: A Review

    Tao Li, Wang Bo, Chunyu Hu +4

    eess.IVcs.CVcs.LGarXiv:2101.09864v12021
  53. Stop Looking for Important Tokens in Multimodal Language Models: Duplication Matters More

    Zichen Wen, Yifeng Gao, Shaobo Wang +5

    cs.CLcs.CVarXiv:2502.11494v22025
  54. AQ3D: Adaptive Query Transformer for 3D Instance Segmentation

    Keno Moenck, Thorsten Schüppstuhl

    cs.CVarXiv:2608.30618v12026
  55. Rescaling Egocentric Vision

    Dima Damen, Hazel Doughty, Giovanni Maria Farinella +8

    cs.CVcs.LGarXiv:2006.13256v42020
  56. Learning Imbalanced Datasets with Label-Distribution-Aware Margin Loss

    Kaidi Cao, Colin Wei, Adrien Gaidon +2

    cs.LGcs.CVstat.MLarXiv:1906.07413v22019
  57. Detecting GAN generated Fake Images using Co-occurrence Matrices

    Lakshmanan Nataraj, Tajuddin Manhar Mohammed, Shivkumar Chandrasekaran +4

    cs.CVeess.IVarXiv:1903.06836v22019
  58. Unsupervised Learning via Meta-Learning

    Kyle Hsu, Sergey Levine, Chelsea Finn

    cs.LGcs.AIcs.CVarXiv:1810.02334v62018
  59. How Powerful are Graph Neural Networks?

    Keyulu Xu, Weihua Hu, Jure Leskovec +1

    cs.LGcs.CVstat.MLarXiv:1810.00826v32018
  60. Progressive Neural Architecture Search

    Chenxi Liu, Barret Zoph, Maxim Neumann +7

    cs.CVcs.LGstat.MLarXiv:1712.00559v32017