Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
5,521 to 5,580 of 18,839
MegaStyle++: Scaling Image Style Space through Hierarchical Style Definition
Junyao Gao, Sibo Liu, Jiaxing Li +4
cs.CVarXiv:2609.01423v22026Approximate evaluation of marginal association probabilities with belief propagation
Jason L. Williams, Roslyn A. Lau
cs.AIcs.CVarXiv:1209.6299v22012Residual Kalman Dynamics for Event-Based UAV Forecasting
Per Nyblom, Hannes Ovrén, David Gustafsson
cs.CVarXiv:2609.00839v12026Learning Multi-scale Features for Foreground Segmentation
Long Ang Lim, Hacer Yalim Keles
cs.CVarXiv:1808.01477v12018EditScore: Unlocking Online RL for Image Editing via High-Fidelity Reward Modeling
Xin Luo, Jiahao Wang, Chenyuan Wu +6
cs.CVarXiv:2509.23909v32025On the Diagnostic of Road Pathway Visibility
Pierre Charbonnier, Jean-Philippe Tarel, Francois Goulette
cs.CVarXiv:1601.05535v12016BrainDiff: Longitudinal Report Generation for Multimodal Brain MRI
Krish Patel, Peirong Liu
cs.CVarXiv:2609.00593v22026Zebra-CoT: A Dataset for Interleaved Vision Language Reasoning
Ang Li, Charles Wang, Deqing Fu +9
cs.CVcs.CLcs.LGarXiv:2507.16746v22025Uniworld-V2: Reinforce Image Editing with Diffusion Negative-aware Finetuning and MLLM Implicit Feedback
Zongjian Li, Zheyuan Liu, Qihui Zhang +10
cs.CVarXiv:2510.16888v32025How many images do I need? Understanding how sample size per class affects deep learning model performance metrics for balanced designs in autonomous wildlife monitoring
Saleh Shahinfar, Paul Meek, Greg Falzon
cs.CVcs.AIcs.LGarXiv:2010.08186v12020Small Object Detection: A Comprehensive Survey on Challenges, Techniques and Real-World Applications
Mahya Nikouei, Bita Baroutian, Shahabedin Nabavi +4
cs.CVarXiv:2503.20516v12025Deep reinforcement learning in medical imaging: A literature review
S. Kevin Zhou, Hoang Ngan Le, Khoa Luu +2
eess.IVcs.CVcs.LGarXiv:2103.05115v12021VisualQuality-R1: Reasoning-Induced Image Quality Assessment via Reinforcement Learning to Rank
Tianhe Wu, Jian Zou, Jie Liang +2
cs.CVarXiv:2505.14460v22025Sparse VideoGen2: Accelerate Video Generation with Sparse Attention via Semantic-Aware Permutation
Shuo Yang, Haocheng Xi, Yilong Zhao +10
cs.CVarXiv:2505.18875v52025EdiTikZ: Scientific Figure Editing from Revision Trajectories
Christian Greisinger, Zhixue Zhao, Steffen Eger
cs.AIcs.CLcs.CVarXiv:2609.01409v12026Marigold: Affordable Adaptation of Diffusion-Based Image Generators for Image Analysis
Bingxin Ke, Kevin Qu, Tianfu Wang +5
cs.CVcs.LGarXiv:2505.09358v12025Galaxea Open-World Dataset and G0 Dual-System VLA Model
Tao Jiang, Tianyuan Yuan, Yicheng Liu +7
cs.ROcs.CVarXiv:2509.00576v12025Mixture of Contexts for Long Video Generation
Shengqu Cai, Ceyuan Yang, Lvmin Zhang +10
cs.GRcs.AIcs.CVarXiv:2508.21058v32025Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation
Chao Liao, Liyang Liu, Xun Wang +7
cs.CVarXiv:2505.05472v22025Deep Photovoltaic Nowcasting
Jinsong Zhang, Rodrigo Verschae, Shohei Nobuhara +1
cs.CVarXiv:1810.06327v12018EasyControl: Adding Efficient and Flexible Control for Diffusion Transformer
Yuxuan Zhang, Yirui Yuan, Yiren Song +2
cs.CVarXiv:2503.07027v12025Self-Supervised Correspondence in Visuomotor Policy Learning
Peter Florence, Lucas Manuelli, Russ Tedrake
cs.ROcs.CVcs.LGarXiv:1909.06933v12019Large Video Planner Enables Generalizable Robot Control
Boyuan Chen, Tianyuan Zhang, Haoran Geng +9
cs.ROcs.CVarXiv:2512.15840v22025Where Should Experience Live? Hierarchical Hebbian Memory for Continual Vision Transformers
Mohammed Yusuf Mujawar, Noorbakhsh Amiri Golilarz
cs.CVcs.NEarXiv:2609.00358v12026MotionStream: Real-Time Video Generation with Interactive Motion Controls
Joonghyuk Shin, Zhengqi Li, Richard Zhang +4
cs.CVcs.LGarXiv:2511.01266v52025LOCI: A Locator-Critic with Refinement Loop
Walid Bousselham, Mathilde Caron, Arsha Nagrani +1
cs.CVcs.AIarXiv:2608.30959v12026OmniSVG: A Unified Scalable Vector Graphics Generation Model
Yiying Yang, Wei Cheng, Sijin Chen +7
cs.CVarXiv:2504.06263v32025Applying Faster R-CNN for Object Detection on Malaria Images
Jane Hung, Deepali Ravel, Stefanie C. P. Lopes +11
cs.CVarXiv:1804.09548v22018PhysTwin: Physics-Informed Reconstruction and Simulation of Deformable Objects from Videos
Hanxiao Jiang, Hao-Yu Hsu, Kaifeng Zhang +3
cs.CVcs.AIcs.ROarXiv:2503.17973v12025Unified Multimodal Chain-of-Thought Reward Model through Reinforcement Fine-Tuning
Yibin Wang, Zhimin Li, Yuhang Zang +4
cs.CVarXiv:2505.03318v32025InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy
Xinyi Chen, Yilun Chen, Yanwei Fu +26
cs.ROcs.AIcs.CVarXiv:2510.13778v12025STream3R: Scalable Sequential 3D Reconstruction with Causal Transformer
Yushi Lan, Yihang Luo, Fangzhou Hong +7
cs.CVarXiv:2508.10893v12025ChatVLA: Unified Multimodal Understanding and Robot Control with Vision-Language-Action Model
Zhongyi Zhou, Yichen Zhu, Minjie Zhu +8
cs.ROcs.CVcs.LGarXiv:2502.14420v22025OneIG-Bench: Omni-dimensional Nuanced Evaluation for Image Generation
Jingjing Chang, Yixiao Fang, Peng Xing +6
cs.CVarXiv:2506.07977v32025Lumina-Image 2.0: A Unified and Efficient Image Generative Framework
Qi Qin, Le Zhuo, Yi Xin +20
cs.CVarXiv:2503.21758v12025Complete Dictionary Recovery over the Sphere
Ju Sun, Qing Qu, John Wright
cs.ITcs.CVcs.LGarXiv:1504.06785v32015One-Minute Video Generation with Test-Time Training
Karan Dalal, Daniel Koceja, Gashon Hussein +12
cs.CVarXiv:2504.05298v12025DPM-Solver-v3: Improved Diffusion ODE Solver with Empirical Model Statistics
Kaiwen Zheng, Cheng Lu, Jianfei Chen +1
cs.CVcs.LGarXiv:2310.13268v32023MindCube: Spatial Mental Modeling from Limited Views
Qineng Wang, Baiqiao Yin, Pingyue Zhang +11
cs.AIcs.CLcs.CVarXiv:2506.21458v22025Scan, Attend and Read: End-to-End Handwritten Paragraph Recognition with MDLSTM Attention
Théodore Bluche, Jérôme Louradour, Ronaldo Messina
cs.CVarXiv:1604.03286v32016UniGoal: Towards Universal Zero-shot Goal-oriented Navigation
Hang Yin, Xiuwei Xu, Lingqing Zhao +3
cs.CVcs.ROarXiv:2503.10630v32025Deep Scale-spaces: Equivariance Over Scale
Daniel E. Worrall, Max Welling
cs.LGcs.CVstat.MLarXiv:1905.11697v12019A Multi-task Deep Network for Person Re-identification
Weihua Chen, Xiaotang Chen, Jianguo Zhang +1
cs.CVarXiv:1607.05369v32016Deep Hierarchical Semantic Segmentation
Liulei Li, Tianfei Zhou, Wenguan Wang +2
cs.CVarXiv:2203.14335v22022Visual Spatial Tuning
Rui Yang, Ziyu Zhu, Yanwei Li +9
cs.CVarXiv:2511.05491v12025GPT4Scene: Understand 3D Scenes from Videos with Vision-Language Models
Zhangyang Qi, Zhixiong Zhang, Ye Fang +2
cs.CVarXiv:2501.01428v42025Multi-Evidence Filtering and Fusion for Multi-Label Classification, Object Detection and Semantic Segmentation Based on Weakly Supervised Learning
Weifeng Ge, Sibei Yang, Yizhou Yu
cs.CVcs.AIcs.LGarXiv:1802.09129v12018Can We Generate Images with CoT? Let's Verify and Reinforce Image Generation Step by Step
Ziyu Guo, Renrui Zhang, Chengzhuo Tong +9
cs.CVcs.AIcs.CLarXiv:2501.13926v22025Binarized Convolutional Landmark Localizers for Human Pose Estimation and Face Alignment with Limited Resources
Adrian Bulat, Georgios Tzimiropoulos
cs.CVcs.LGstat.MLarXiv:1703.00862v22017LambdaNetworks: Modeling Long-Range Interactions Without Attention
Irwan Bello
cs.CVcs.LGarXiv:2102.08602v12021WildGS-SLAM: Monocular Gaussian Splatting SLAM in Dynamic Environments
Jianhao Zheng, Zihan Zhu, Valentin Bieri +3
cs.CVcs.ROarXiv:2504.03886v12025Better than Real: Complex-valued Neural Nets for MRI Fingerprinting
Patrick Virtue, Stella X. Yu, Michael Lustig
cs.CVarXiv:1707.00070v12017Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing
Junfei Wu, Jian Guan, Kaituo Feng +5
cs.CVcs.AIarXiv:2506.09965v22025A Unified Sequence Interface for Vision Tasks
Ting Chen, Saurabh Saxena, Lala Li +3
cs.CVcs.CLcs.LGarXiv:2206.07669v22022Learning Language-guided Adaptive Hyper-modality Representation for Multimodal Sentiment Analysis
Haoyu Zhang, Yu Wang, Guanghao Yin +3
cs.AIcs.CLcs.CVarXiv:2310.05804v22023Video Language Planning
Yilun Du, Mengjiao Yang, Pete Florence +10
cs.CVcs.AIcs.LGarXiv:2310.10625v12023COOPERNAUT: End-to-End Driving with Cooperative Perception for Networked Vehicles
Jiaxun Cui, Hang Qiu, Dian Chen +2
cs.CVcs.ROarXiv:2205.02222v12022GCFAgg: Global and Cross-view Feature Aggregation for Multi-view Clustering
Weiqing Yan, Yuanyang Zhang, Chenlei Lv +4
cs.CVarXiv:2305.06799v12023HIVE: Harnessing Human Feedback for Instructional Visual Editing
Shu Zhang, Xinyi Yang, Yihao Feng +9
cs.CVcs.AIcs.CLarXiv:2303.09618v22023Detect Anything via Next Point Prediction
Qing Jiang, Junan Huo, Xingyu Chen +6
cs.CVarXiv:2510.12798v12025