Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

1,021 to 1,080 of 18,830

  1. Shedding Light: A Benchmark for Evaluating Lighting Understanding in Generative Image Models

    Justine Giroux, Jack Oliver Hilliard, Yannick Hold-Geoffroy +2

    cs.CVarXiv:2609.10787v12026
  2. GRADE: Single-Frame Generative Radar Depth Estimation Under Visual Degradation

    Bin Zhao, Patrick Chiou, Nakul Garg

    cs.CVcs.ROarXiv:2609.10756v12026
  3. MHE-Former: Multi-Hypothesis Transformers via Entropy Maximization for 3D Mesh Recovery

    Boshu Jia, Rongyu Chen, Linlin Yang +9

    cs.CVarXiv:2609.10743v12026
  4. Rethinking Handwritten Character Recognition

    Ranjit Raut, Aarav Subedi, Ashim Shrestha

    cs.CVeess.IVarXiv:2609.10572v12026
  5. 3D Point Splatting for mmWave Radar Novel View Synthesis

    Adnan Armouti, Yixuan Gao, Rajalakshmi Nandakumar

    cs.CVcs.GRcs.LGarXiv:2609.11894v12026
  6. Scale-Invariant Convolutional Neural Networks

    Yichong Xu, Tianjun Xiao, Jiaxing Zhang +2

    cs.CVcs.LGcs.NEarXiv:1411.6369v12014
  7. PhysCtrl: Generative Physics for Controllable and Physics-Grounded Video Generation

    Chen Wang, Chuhao Chen, Yiming Huang +4

    cs.CVarXiv:2509.20358v22025
  8. General Cutting Planes for Bound-Propagation-Based Neural Network Verification

    Huan Zhang, Shiqi Wang, Kaidi Xu +5

    cs.LGcs.CRcs.CVarXiv:2208.05740v22022
  9. Step-GUI Technical Report

    Haolong Yan, Jia Wang, Xin Huang +96

    cs.CVarXiv:2512.15431v22025
  10. OmniWorld: A Multi-Domain and Multi-Modal Dataset for 4D World Modeling

    Yang Zhou, Yifan Wang, Jianjun Zhou +16

    cs.CVarXiv:2509.12201v22025
  11. Logit Refiner: Improving Visual Autoregressive Models via Intra-Scale Dependency Modeling

    Meimingwei Li, Stefan Andreas Baumann, Felix Krause +1

    cs.CVcs.AIcs.LGarXiv:2609.11804v12026
  12. A-SDF: Learning Disentangled Signed Distance Functions for Articulated Shape Representation

    Jiteng Mu, Weichao Qiu, Adam Kortylewski +3

    cs.CVarXiv:2104.07645v12021
  13. UniME-V2: MLLM-as-a-Judge for Universal Multimodal Embedding Learning

    Tiancheng Gu, Kaicheng Yang, Kaichen Zhang +6

    cs.CVcs.AIarXiv:2510.13515v32025
  14. SAM Audio: Segment Anything in Audio

    Bowen Shi, Andros Tjandra, John Hoffman +11

    eess.AScs.CVarXiv:2512.18099v12025
  15. Evaluating Gemini Robotics Policies in a Veo World Simulator

    Gemini Robotics Team, Krzysztof Choromanski, Coline Devin +20

    cs.ROcs.AIcs.CVarXiv:2512.10675v22025
  16. Dream2Flow: Bridging Video Generation and Open-World Manipulation with 3D Object Flow

    Karthik Dharmarajan, Wenlong Huang, Jiajun Wu +2

    cs.ROcs.AIcs.CVarXiv:2512.24766v12025
  17. HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning

    Liyang Chen, Tianxiang Ma, Jiawei Liu +7

    cs.CVcs.MMarXiv:2509.08519v12025
  18. Multimodal Taxonomic Conditioning for Generative Plankton Imagery

    Daniela Ivanova, Ozgu Goksu, Nicolas Pugeault

    cs.CVcs.LGarXiv:2609.11673v12026
  19. Vidu S2: Real-Time Interactive, Editable, and Spatial Video Generation

    Jintao Zhang, Kai Jiang, Jintao Chen +32

    cs.CVcs.LGarXiv:2609.11638v12026
  20. WebInject: Prompt Injection Attack to Web Agents

    Xilong Wang, John Bloch, Zedian Shao +3

    cs.LGcs.AIcs.CLarXiv:2505.11717v42025
  21. Robust breast cancer detection in mammography and digital breast tomosynthesis using annotation-efficient deep learning approach

    William Lotter, Abdul Rahman Diab, Bryan Haslam +10

    eess.IVcs.CVcs.LGarXiv:1912.11027v22019
  22. FineVision: Open Data Is All You Need

    Luis Wiedmann, Orr Zohar, Amir Mahla +6

    cs.CVcs.AIarXiv:2510.17269v22025
  23. Breaking the Central Bias: Spatially Partitioned Experts for Coordinate-Based Neuroevolution

    Romain Claret, Arthur Gygax, Michael O'Neill +3

    cs.NEcs.CVcs.LGarXiv:2609.11518v12026
  24. Hologram Representation via Quadratic Phase Gaussian Splatting

    Haolong Wang, Yicheng Zhan, Kaan Akşit +1

    cs.GRcs.CVcs.LGarXiv:2609.11434v12026
  25. Think with 3D: Geometric Imagination Grounded Spatial Reasoning from Limited Views

    Zhangquan Chen, Manyuan Zhang, Xinlei Yu +8

    cs.CVcs.AIarXiv:2510.18632v42025
  26. Improved 8-point Approximate DCT for Image and Video Compression Requiring Only 14 Additions

    U. S. Potluri, A. Madanayake, R. J. Cintra +3

    cs.MMcs.CVmath.NAarXiv:1501.02995v12015
  27. Your Model Already Knows Don't Teach It, Learn to Ask It: Soft Prompting for Few-Shot Adaptation of Vision-Language Models

    Gautam Rajendrakumar Gare, Siyi Li, Hewei Wang +5

    cs.CVcs.AIcs.LGarXiv:2609.11310v12026
  28. LATTICE: Democratize High-Fidelity 3D Generation at Scale

    Zeqiang Lai, Yunfei Zhao, Zibo Zhao +5

    cs.GRcs.CVarXiv:2512.03052v12025
  29. Actions and Attributes from Wholes and Parts

    Georgia Gkioxari, Ross Girshick, Jitendra Malik

    cs.CVarXiv:1412.2604v22014
  30. Side Window Filtering

    Hui Yin, Yuanhao Gong, Guoping Qiu

    cs.CVarXiv:1905.07177v12019
  31. Learning Physics-guided Face Relighting under Directional Light

    Thomas Nestmeyer, Jean-François Lalonde, Iain Matthews +1

    cs.CVcs.GRcs.LGarXiv:1906.03355v22019
  32. Open-o3-Video: Grounded Video Reasoning with Explicit Spatio-Temporal Evidence

    Jiahao Meng, Xiangtai Li, Haochen Wang +8

    cs.CVcs.AIcs.MMarXiv:2510.20579v22025
  33. Improving Faint Object Detection for Space Situational Awareness with Variational Autoencoders

    Angela Cratere, Luca Ghilardi, Vishnu Reddy +3

    cs.CVcs.AIcs.LGarXiv:2609.11269v12026
  34. ThinkMorph: Emergent Properties in Multimodal Interleaved Chain-of-Thought Reasoning

    Jiawei Gu, Yunzhuo Hao, Huichen Will Wang +5

    cs.CVarXiv:2510.27492v32025
  35. Kangaroo: A Powerful Video-Language Model Supporting Long-context Video Input

    Jiajun Liu, Yibing Wang, Hanghang Ma +6

    cs.CVcs.AIcs.MMarXiv:2408.15542v12024
  36. Rethinking the Hyperparameters for Fine-tuning

    Hao Li, Pratik Chaudhari, Hao Yang +4

    cs.CVcs.LGstat.MLarXiv:2002.11770v12020
  37. ScaleCUA: Scaling Open-Source Computer Use Agents with Cross-Platform Data

    Zhaoyang Liu, Jingjing Xie, Zichen Ding +27

    cs.CVarXiv:2509.15221v22025
  38. Depth Extraction from Video Using Non-parametric Sampling

    Kevin Karsch, Ce Liu, Sing Bing Kang

    cs.CVarXiv:2002.04479v12019
  39. TailProp: content-adaptive light- and heavy-tailed propagation for vision

    Jiahao Kong, Zihan Li

    cs.CVcs.LGarXiv:2609.11081v12026
  40. Pointly-Supervised Instance Segmentation

    Bowen Cheng, Omkar Parkhi, Alexander Kirillov

    cs.CVarXiv:2104.06404v22021
  41. Patch2Self: Denoising Diffusion MRI with Self-Supervised Learning

    Shreyas Fadnavis, Joshua Batson, Eleftherios Garyfallidis

    cs.LGcs.CVq-bio.QMarXiv:2011.01355v12020
  42. Meta-Learning for Classifier Selection in Image Datasets: A Feature-Driven Framework for Accuracy Prediction

    Zahra Nabizadeh_Shahre_Babak, Farzaneh Koohestani, Nader Karimi +2

    cs.CVcs.LGarXiv:2609.11041v12026
  43. MemFlow: Flowing Adaptive Memory for Consistent and Efficient Long Video Narratives

    Sihui Ji, Xi Chen, Shuai Yang +3

    cs.CVarXiv:2512.14699v12025
  44. GigaWorld-0: World Models as Data Engine to Empower Embodied AI

    GigaWorld Team, Angen Ye, Boyuan Wang +22

    cs.CVcs.ROarXiv:2511.19861v22025
  45. Are We Really Doing Few-Shot Learning? A Critical Examination of Pre-Training Assumptions

    Alejandro Galan-Cuenca, Marcelo Saval-Calvo, Antonio Javier Gallego

    cs.CVcs.AIcs.LGarXiv:2609.10851v12026
  46. olmOCR 2: Unit Test Rewards for Document OCR

    Jake Poznanski, Luca Soldaini, Kyle Lo

    cs.CVcs.CLarXiv:2510.19817v12025
  47. Symmetry-aware super-resolution of crystal orientation maps via invariant latent-space learning

    Umang Garg, Warren Zamudio, McLean P. Echlin +3

    cs.CVcond-mat.mtrl-scics.LGarXiv:2609.10898v12026
  48. SLA: Beyond Sparsity in Diffusion Transformers via Fine-Tunable Sparse-Linear Attention

    Jintao Zhang, Haoxu Wang, Kai Jiang +10

    cs.LGcs.AIcs.CVarXiv:2509.24006v22025
  49. BLIP3o-NEXT: Next Frontier of Native Image Generation

    Jiuhai Chen, Le Xue, Zhiyang Xu +12

    cs.CVarXiv:2510.15857v12025
  50. Bayesian GAN

    Yunus Saatchi, Andrew Gordon Wilson

    stat.MLcs.AIcs.CVarXiv:1705.09558v32017
  51. Scale-Aware 3D Deep Learning for Robust Brain Metastasis Detection in Multimodal MRI

    Sylvain Jaume, Hongming Wang, Simon K. Warfield

    eess.IVcs.CVcs.LGarXiv:2609.10825v12026
  52. How Much Velocity Does Off-Ball Space Value Need? A Broadcast-Viewport Benchmark

    Seongjin Choi

    cs.CVcs.LGarXiv:2609.10801v12026
  53. DuLa-Net: A Dual-Projection Network for Estimating Room Layouts from a Single RGB Panorama

    Shang-Ta Yang, Fu-En Wang, Chi-Han Peng +3

    cs.CVarXiv:1811.11977v22018
  54. Deep Networks for Compressed Image Sensing

    Wuzhen Shi, Feng Jiang, Shengping Zhang +1

    cs.CVarXiv:1707.07119v12017
  55. VisPlay: Self-Evolving Vision-Language Models from Images

    Yicheng He, Chengsong Huang, Zongxia Li +2

    cs.CVcs.AIcs.CLarXiv:2511.15661v22025
  56. RoMa v2: Harder Better Faster Denser Feature Matching

    Johan Edstedt, David Nordström, Yushan Zhang +7

    cs.CVarXiv:2511.15706v32025
  57. Meta-Learning for Data-Efficient Plant Growth Estimation via Vision Transformers and Fuzzy Clustering

    Sheikh Hasan Elahi, Rusith Chamara Hathurusinghe Dewage, Habib Ullah +3

    cs.CVcs.LGarXiv:2609.10749v12026
  58. WorldMM: Dynamic Multimodal Memory Agent for Long Video Reasoning

    Woongyeong Yeo, Kangsan Kim, Jaehong Yoon +1

    cs.CVcs.AIcs.CLarXiv:2512.02425v22025
  59. TimeLens: Rethinking Video Temporal Grounding with Multimodal LLMs

    Jun Zhang, Teng Wang, Yuying Ge +4

    cs.CVcs.AIcs.CLarXiv:2512.14698v22025
  60. Region Ensemble Network: Improving Convolutional Network for Hand Pose Estimation

    Hengkai Guo, Guijin Wang, Xinghao Chen +3

    cs.CVarXiv:1702.02447v22017