Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
1,021 to 1,080 of 18,830
Shedding Light: A Benchmark for Evaluating Lighting Understanding in Generative Image Models
Justine Giroux, Jack Oliver Hilliard, Yannick Hold-Geoffroy +2
cs.CVarXiv:2609.10787v12026GRADE: Single-Frame Generative Radar Depth Estimation Under Visual Degradation
Bin Zhao, Patrick Chiou, Nakul Garg
cs.CVcs.ROarXiv:2609.10756v12026MHE-Former: Multi-Hypothesis Transformers via Entropy Maximization for 3D Mesh Recovery
Boshu Jia, Rongyu Chen, Linlin Yang +9
cs.CVarXiv:2609.10743v12026Rethinking Handwritten Character Recognition
Ranjit Raut, Aarav Subedi, Ashim Shrestha
cs.CVeess.IVarXiv:2609.10572v120263D Point Splatting for mmWave Radar Novel View Synthesis
Adnan Armouti, Yixuan Gao, Rajalakshmi Nandakumar
cs.CVcs.GRcs.LGarXiv:2609.11894v12026Scale-Invariant Convolutional Neural Networks
Yichong Xu, Tianjun Xiao, Jiaxing Zhang +2
cs.CVcs.LGcs.NEarXiv:1411.6369v12014PhysCtrl: Generative Physics for Controllable and Physics-Grounded Video Generation
Chen Wang, Chuhao Chen, Yiming Huang +4
cs.CVarXiv:2509.20358v22025General Cutting Planes for Bound-Propagation-Based Neural Network Verification
Huan Zhang, Shiqi Wang, Kaidi Xu +5
cs.LGcs.CRcs.CVarXiv:2208.05740v22022Step-GUI Technical Report
Haolong Yan, Jia Wang, Xin Huang +96
cs.CVarXiv:2512.15431v22025OmniWorld: A Multi-Domain and Multi-Modal Dataset for 4D World Modeling
Yang Zhou, Yifan Wang, Jianjun Zhou +16
cs.CVarXiv:2509.12201v22025Logit Refiner: Improving Visual Autoregressive Models via Intra-Scale Dependency Modeling
Meimingwei Li, Stefan Andreas Baumann, Felix Krause +1
cs.CVcs.AIcs.LGarXiv:2609.11804v12026A-SDF: Learning Disentangled Signed Distance Functions for Articulated Shape Representation
Jiteng Mu, Weichao Qiu, Adam Kortylewski +3
cs.CVarXiv:2104.07645v12021UniME-V2: MLLM-as-a-Judge for Universal Multimodal Embedding Learning
Tiancheng Gu, Kaicheng Yang, Kaichen Zhang +6
cs.CVcs.AIarXiv:2510.13515v32025SAM Audio: Segment Anything in Audio
Bowen Shi, Andros Tjandra, John Hoffman +11
eess.AScs.CVarXiv:2512.18099v12025Evaluating Gemini Robotics Policies in a Veo World Simulator
Gemini Robotics Team, Krzysztof Choromanski, Coline Devin +20
cs.ROcs.AIcs.CVarXiv:2512.10675v22025Dream2Flow: Bridging Video Generation and Open-World Manipulation with 3D Object Flow
Karthik Dharmarajan, Wenlong Huang, Jiajun Wu +2
cs.ROcs.AIcs.CVarXiv:2512.24766v12025HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning
Liyang Chen, Tianxiang Ma, Jiawei Liu +7
cs.CVcs.MMarXiv:2509.08519v12025Multimodal Taxonomic Conditioning for Generative Plankton Imagery
Daniela Ivanova, Ozgu Goksu, Nicolas Pugeault
cs.CVcs.LGarXiv:2609.11673v12026Vidu S2: Real-Time Interactive, Editable, and Spatial Video Generation
Jintao Zhang, Kai Jiang, Jintao Chen +32
cs.CVcs.LGarXiv:2609.11638v12026WebInject: Prompt Injection Attack to Web Agents
Xilong Wang, John Bloch, Zedian Shao +3
cs.LGcs.AIcs.CLarXiv:2505.11717v42025Robust breast cancer detection in mammography and digital breast tomosynthesis using annotation-efficient deep learning approach
William Lotter, Abdul Rahman Diab, Bryan Haslam +10
eess.IVcs.CVcs.LGarXiv:1912.11027v22019FineVision: Open Data Is All You Need
Luis Wiedmann, Orr Zohar, Amir Mahla +6
cs.CVcs.AIarXiv:2510.17269v22025Breaking the Central Bias: Spatially Partitioned Experts for Coordinate-Based Neuroevolution
Romain Claret, Arthur Gygax, Michael O'Neill +3
cs.NEcs.CVcs.LGarXiv:2609.11518v12026Hologram Representation via Quadratic Phase Gaussian Splatting
Haolong Wang, Yicheng Zhan, Kaan Akşit +1
cs.GRcs.CVcs.LGarXiv:2609.11434v12026Think with 3D: Geometric Imagination Grounded Spatial Reasoning from Limited Views
Zhangquan Chen, Manyuan Zhang, Xinlei Yu +8
cs.CVcs.AIarXiv:2510.18632v42025Improved 8-point Approximate DCT for Image and Video Compression Requiring Only 14 Additions
U. S. Potluri, A. Madanayake, R. J. Cintra +3
cs.MMcs.CVmath.NAarXiv:1501.02995v12015Your Model Already Knows Don't Teach It, Learn to Ask It: Soft Prompting for Few-Shot Adaptation of Vision-Language Models
Gautam Rajendrakumar Gare, Siyi Li, Hewei Wang +5
cs.CVcs.AIcs.LGarXiv:2609.11310v12026LATTICE: Democratize High-Fidelity 3D Generation at Scale
Zeqiang Lai, Yunfei Zhao, Zibo Zhao +5
cs.GRcs.CVarXiv:2512.03052v12025Actions and Attributes from Wholes and Parts
Georgia Gkioxari, Ross Girshick, Jitendra Malik
cs.CVarXiv:1412.2604v22014Side Window Filtering
Hui Yin, Yuanhao Gong, Guoping Qiu
cs.CVarXiv:1905.07177v12019Learning Physics-guided Face Relighting under Directional Light
Thomas Nestmeyer, Jean-François Lalonde, Iain Matthews +1
cs.CVcs.GRcs.LGarXiv:1906.03355v22019Open-o3-Video: Grounded Video Reasoning with Explicit Spatio-Temporal Evidence
Jiahao Meng, Xiangtai Li, Haochen Wang +8
cs.CVcs.AIcs.MMarXiv:2510.20579v22025Improving Faint Object Detection for Space Situational Awareness with Variational Autoencoders
Angela Cratere, Luca Ghilardi, Vishnu Reddy +3
cs.CVcs.AIcs.LGarXiv:2609.11269v12026ThinkMorph: Emergent Properties in Multimodal Interleaved Chain-of-Thought Reasoning
Jiawei Gu, Yunzhuo Hao, Huichen Will Wang +5
cs.CVarXiv:2510.27492v32025Kangaroo: A Powerful Video-Language Model Supporting Long-context Video Input
Jiajun Liu, Yibing Wang, Hanghang Ma +6
cs.CVcs.AIcs.MMarXiv:2408.15542v12024Rethinking the Hyperparameters for Fine-tuning
Hao Li, Pratik Chaudhari, Hao Yang +4
cs.CVcs.LGstat.MLarXiv:2002.11770v12020ScaleCUA: Scaling Open-Source Computer Use Agents with Cross-Platform Data
Zhaoyang Liu, Jingjing Xie, Zichen Ding +27
cs.CVarXiv:2509.15221v22025Depth Extraction from Video Using Non-parametric Sampling
Kevin Karsch, Ce Liu, Sing Bing Kang
cs.CVarXiv:2002.04479v12019TailProp: content-adaptive light- and heavy-tailed propagation for vision
Jiahao Kong, Zihan Li
cs.CVcs.LGarXiv:2609.11081v12026Pointly-Supervised Instance Segmentation
Bowen Cheng, Omkar Parkhi, Alexander Kirillov
cs.CVarXiv:2104.06404v22021Patch2Self: Denoising Diffusion MRI with Self-Supervised Learning
Shreyas Fadnavis, Joshua Batson, Eleftherios Garyfallidis
cs.LGcs.CVq-bio.QMarXiv:2011.01355v12020Meta-Learning for Classifier Selection in Image Datasets: A Feature-Driven Framework for Accuracy Prediction
Zahra Nabizadeh_Shahre_Babak, Farzaneh Koohestani, Nader Karimi +2
cs.CVcs.LGarXiv:2609.11041v12026MemFlow: Flowing Adaptive Memory for Consistent and Efficient Long Video Narratives
Sihui Ji, Xi Chen, Shuai Yang +3
cs.CVarXiv:2512.14699v12025GigaWorld-0: World Models as Data Engine to Empower Embodied AI
GigaWorld Team, Angen Ye, Boyuan Wang +22
cs.CVcs.ROarXiv:2511.19861v22025Are We Really Doing Few-Shot Learning? A Critical Examination of Pre-Training Assumptions
Alejandro Galan-Cuenca, Marcelo Saval-Calvo, Antonio Javier Gallego
cs.CVcs.AIcs.LGarXiv:2609.10851v12026olmOCR 2: Unit Test Rewards for Document OCR
Jake Poznanski, Luca Soldaini, Kyle Lo
cs.CVcs.CLarXiv:2510.19817v12025Symmetry-aware super-resolution of crystal orientation maps via invariant latent-space learning
Umang Garg, Warren Zamudio, McLean P. Echlin +3
cs.CVcond-mat.mtrl-scics.LGarXiv:2609.10898v12026SLA: Beyond Sparsity in Diffusion Transformers via Fine-Tunable Sparse-Linear Attention
Jintao Zhang, Haoxu Wang, Kai Jiang +10
cs.LGcs.AIcs.CVarXiv:2509.24006v22025BLIP3o-NEXT: Next Frontier of Native Image Generation
Jiuhai Chen, Le Xue, Zhiyang Xu +12
cs.CVarXiv:2510.15857v12025Bayesian GAN
Yunus Saatchi, Andrew Gordon Wilson
stat.MLcs.AIcs.CVarXiv:1705.09558v32017Scale-Aware 3D Deep Learning for Robust Brain Metastasis Detection in Multimodal MRI
Sylvain Jaume, Hongming Wang, Simon K. Warfield
eess.IVcs.CVcs.LGarXiv:2609.10825v12026How Much Velocity Does Off-Ball Space Value Need? A Broadcast-Viewport Benchmark
Seongjin Choi
cs.CVcs.LGarXiv:2609.10801v12026DuLa-Net: A Dual-Projection Network for Estimating Room Layouts from a Single RGB Panorama
Shang-Ta Yang, Fu-En Wang, Chi-Han Peng +3
cs.CVarXiv:1811.11977v22018Deep Networks for Compressed Image Sensing
Wuzhen Shi, Feng Jiang, Shengping Zhang +1
cs.CVarXiv:1707.07119v12017VisPlay: Self-Evolving Vision-Language Models from Images
Yicheng He, Chengsong Huang, Zongxia Li +2
cs.CVcs.AIcs.CLarXiv:2511.15661v22025RoMa v2: Harder Better Faster Denser Feature Matching
Johan Edstedt, David Nordström, Yushan Zhang +7
cs.CVarXiv:2511.15706v32025Meta-Learning for Data-Efficient Plant Growth Estimation via Vision Transformers and Fuzzy Clustering
Sheikh Hasan Elahi, Rusith Chamara Hathurusinghe Dewage, Habib Ullah +3
cs.CVcs.LGarXiv:2609.10749v12026WorldMM: Dynamic Multimodal Memory Agent for Long Video Reasoning
Woongyeong Yeo, Kangsan Kim, Jaehong Yoon +1
cs.CVcs.AIcs.CLarXiv:2512.02425v22025TimeLens: Rethinking Video Temporal Grounding with Multimodal LLMs
Jun Zhang, Teng Wang, Yuying Ge +4
cs.CVcs.AIcs.CLarXiv:2512.14698v22025Region Ensemble Network: Improving Convolutional Network for Hand Pose Estimation
Hengkai Guo, Guijin Wang, Xinghao Chen +3
cs.CVarXiv:1702.02447v22017