Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

5,521 to 5,580 of 18,839

  1. MegaStyle++: Scaling Image Style Space through Hierarchical Style Definition

    Junyao Gao, Sibo Liu, Jiaxing Li +4

    cs.CVarXiv:2609.01423v22026
  2. Approximate evaluation of marginal association probabilities with belief propagation

    Jason L. Williams, Roslyn A. Lau

    cs.AIcs.CVarXiv:1209.6299v22012
  3. Residual Kalman Dynamics for Event-Based UAV Forecasting

    Per Nyblom, Hannes Ovrén, David Gustafsson

    cs.CVarXiv:2609.00839v12026
  4. Learning Multi-scale Features for Foreground Segmentation

    Long Ang Lim, Hacer Yalim Keles

    cs.CVarXiv:1808.01477v12018
  5. EditScore: Unlocking Online RL for Image Editing via High-Fidelity Reward Modeling

    Xin Luo, Jiahao Wang, Chenyuan Wu +6

    cs.CVarXiv:2509.23909v32025
  6. On the Diagnostic of Road Pathway Visibility

    Pierre Charbonnier, Jean-Philippe Tarel, Francois Goulette

    cs.CVarXiv:1601.05535v12016
  7. BrainDiff: Longitudinal Report Generation for Multimodal Brain MRI

    Krish Patel, Peirong Liu

    cs.CVarXiv:2609.00593v22026
  8. Zebra-CoT: A Dataset for Interleaved Vision Language Reasoning

    Ang Li, Charles Wang, Deqing Fu +9

    cs.CVcs.CLcs.LGarXiv:2507.16746v22025
  9. Uniworld-V2: Reinforce Image Editing with Diffusion Negative-aware Finetuning and MLLM Implicit Feedback

    Zongjian Li, Zheyuan Liu, Qihui Zhang +10

    cs.CVarXiv:2510.16888v32025
  10. How many images do I need? Understanding how sample size per class affects deep learning model performance metrics for balanced designs in autonomous wildlife monitoring

    Saleh Shahinfar, Paul Meek, Greg Falzon

    cs.CVcs.AIcs.LGarXiv:2010.08186v12020
  11. Small Object Detection: A Comprehensive Survey on Challenges, Techniques and Real-World Applications

    Mahya Nikouei, Bita Baroutian, Shahabedin Nabavi +4

    cs.CVarXiv:2503.20516v12025
  12. Deep reinforcement learning in medical imaging: A literature review

    S. Kevin Zhou, Hoang Ngan Le, Khoa Luu +2

    eess.IVcs.CVcs.LGarXiv:2103.05115v12021
  13. VisualQuality-R1: Reasoning-Induced Image Quality Assessment via Reinforcement Learning to Rank

    Tianhe Wu, Jian Zou, Jie Liang +2

    cs.CVarXiv:2505.14460v22025
  14. Sparse VideoGen2: Accelerate Video Generation with Sparse Attention via Semantic-Aware Permutation

    Shuo Yang, Haocheng Xi, Yilong Zhao +10

    cs.CVarXiv:2505.18875v52025
  15. EdiTikZ: Scientific Figure Editing from Revision Trajectories

    Christian Greisinger, Zhixue Zhao, Steffen Eger

    cs.AIcs.CLcs.CVarXiv:2609.01409v12026
  16. Marigold: Affordable Adaptation of Diffusion-Based Image Generators for Image Analysis

    Bingxin Ke, Kevin Qu, Tianfu Wang +5

    cs.CVcs.LGarXiv:2505.09358v12025
  17. Galaxea Open-World Dataset and G0 Dual-System VLA Model

    Tao Jiang, Tianyuan Yuan, Yicheng Liu +7

    cs.ROcs.CVarXiv:2509.00576v12025
  18. Mixture of Contexts for Long Video Generation

    Shengqu Cai, Ceyuan Yang, Lvmin Zhang +10

    cs.GRcs.AIcs.CVarXiv:2508.21058v32025
  19. Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation

    Chao Liao, Liyang Liu, Xun Wang +7

    cs.CVarXiv:2505.05472v22025
  20. Deep Photovoltaic Nowcasting

    Jinsong Zhang, Rodrigo Verschae, Shohei Nobuhara +1

    cs.CVarXiv:1810.06327v12018
  21. EasyControl: Adding Efficient and Flexible Control for Diffusion Transformer

    Yuxuan Zhang, Yirui Yuan, Yiren Song +2

    cs.CVarXiv:2503.07027v12025
  22. Self-Supervised Correspondence in Visuomotor Policy Learning

    Peter Florence, Lucas Manuelli, Russ Tedrake

    cs.ROcs.CVcs.LGarXiv:1909.06933v12019
  23. Large Video Planner Enables Generalizable Robot Control

    Boyuan Chen, Tianyuan Zhang, Haoran Geng +9

    cs.ROcs.CVarXiv:2512.15840v22025
  24. Where Should Experience Live? Hierarchical Hebbian Memory for Continual Vision Transformers

    Mohammed Yusuf Mujawar, Noorbakhsh Amiri Golilarz

    cs.CVcs.NEarXiv:2609.00358v12026
  25. MotionStream: Real-Time Video Generation with Interactive Motion Controls

    Joonghyuk Shin, Zhengqi Li, Richard Zhang +4

    cs.CVcs.LGarXiv:2511.01266v52025
  26. LOCI: A Locator-Critic with Refinement Loop

    Walid Bousselham, Mathilde Caron, Arsha Nagrani +1

    cs.CVcs.AIarXiv:2608.30959v12026
  27. OmniSVG: A Unified Scalable Vector Graphics Generation Model

    Yiying Yang, Wei Cheng, Sijin Chen +7

    cs.CVarXiv:2504.06263v32025
  28. Applying Faster R-CNN for Object Detection on Malaria Images

    Jane Hung, Deepali Ravel, Stefanie C. P. Lopes +11

    cs.CVarXiv:1804.09548v22018
  29. PhysTwin: Physics-Informed Reconstruction and Simulation of Deformable Objects from Videos

    Hanxiao Jiang, Hao-Yu Hsu, Kaifeng Zhang +3

    cs.CVcs.AIcs.ROarXiv:2503.17973v12025
  30. Unified Multimodal Chain-of-Thought Reward Model through Reinforcement Fine-Tuning

    Yibin Wang, Zhimin Li, Yuhang Zang +4

    cs.CVarXiv:2505.03318v32025
  31. InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy

    Xinyi Chen, Yilun Chen, Yanwei Fu +26

    cs.ROcs.AIcs.CVarXiv:2510.13778v12025
  32. STream3R: Scalable Sequential 3D Reconstruction with Causal Transformer

    Yushi Lan, Yihang Luo, Fangzhou Hong +7

    cs.CVarXiv:2508.10893v12025
  33. ChatVLA: Unified Multimodal Understanding and Robot Control with Vision-Language-Action Model

    Zhongyi Zhou, Yichen Zhu, Minjie Zhu +8

    cs.ROcs.CVcs.LGarXiv:2502.14420v22025
  34. OneIG-Bench: Omni-dimensional Nuanced Evaluation for Image Generation

    Jingjing Chang, Yixiao Fang, Peng Xing +6

    cs.CVarXiv:2506.07977v32025
  35. Lumina-Image 2.0: A Unified and Efficient Image Generative Framework

    Qi Qin, Le Zhuo, Yi Xin +20

    cs.CVarXiv:2503.21758v12025
  36. Complete Dictionary Recovery over the Sphere

    Ju Sun, Qing Qu, John Wright

    cs.ITcs.CVcs.LGarXiv:1504.06785v32015
  37. One-Minute Video Generation with Test-Time Training

    Karan Dalal, Daniel Koceja, Gashon Hussein +12

    cs.CVarXiv:2504.05298v12025
  38. DPM-Solver-v3: Improved Diffusion ODE Solver with Empirical Model Statistics

    Kaiwen Zheng, Cheng Lu, Jianfei Chen +1

    cs.CVcs.LGarXiv:2310.13268v32023
  39. MindCube: Spatial Mental Modeling from Limited Views

    Qineng Wang, Baiqiao Yin, Pingyue Zhang +11

    cs.AIcs.CLcs.CVarXiv:2506.21458v22025
  40. Scan, Attend and Read: End-to-End Handwritten Paragraph Recognition with MDLSTM Attention

    Théodore Bluche, Jérôme Louradour, Ronaldo Messina

    cs.CVarXiv:1604.03286v32016
  41. UniGoal: Towards Universal Zero-shot Goal-oriented Navigation

    Hang Yin, Xiuwei Xu, Lingqing Zhao +3

    cs.CVcs.ROarXiv:2503.10630v32025
  42. Deep Scale-spaces: Equivariance Over Scale

    Daniel E. Worrall, Max Welling

    cs.LGcs.CVstat.MLarXiv:1905.11697v12019
  43. A Multi-task Deep Network for Person Re-identification

    Weihua Chen, Xiaotang Chen, Jianguo Zhang +1

    cs.CVarXiv:1607.05369v32016
  44. Deep Hierarchical Semantic Segmentation

    Liulei Li, Tianfei Zhou, Wenguan Wang +2

    cs.CVarXiv:2203.14335v22022
  45. Visual Spatial Tuning

    Rui Yang, Ziyu Zhu, Yanwei Li +9

    cs.CVarXiv:2511.05491v12025
  46. GPT4Scene: Understand 3D Scenes from Videos with Vision-Language Models

    Zhangyang Qi, Zhixiong Zhang, Ye Fang +2

    cs.CVarXiv:2501.01428v42025
  47. Multi-Evidence Filtering and Fusion for Multi-Label Classification, Object Detection and Semantic Segmentation Based on Weakly Supervised Learning

    Weifeng Ge, Sibei Yang, Yizhou Yu

    cs.CVcs.AIcs.LGarXiv:1802.09129v12018
  48. Can We Generate Images with CoT? Let's Verify and Reinforce Image Generation Step by Step

    Ziyu Guo, Renrui Zhang, Chengzhuo Tong +9

    cs.CVcs.AIcs.CLarXiv:2501.13926v22025
  49. Binarized Convolutional Landmark Localizers for Human Pose Estimation and Face Alignment with Limited Resources

    Adrian Bulat, Georgios Tzimiropoulos

    cs.CVcs.LGstat.MLarXiv:1703.00862v22017
  50. LambdaNetworks: Modeling Long-Range Interactions Without Attention

    Irwan Bello

    cs.CVcs.LGarXiv:2102.08602v12021
  51. WildGS-SLAM: Monocular Gaussian Splatting SLAM in Dynamic Environments

    Jianhao Zheng, Zihan Zhu, Valentin Bieri +3

    cs.CVcs.ROarXiv:2504.03886v12025
  52. Better than Real: Complex-valued Neural Nets for MRI Fingerprinting

    Patrick Virtue, Stella X. Yu, Michael Lustig

    cs.CVarXiv:1707.00070v12017
  53. Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing

    Junfei Wu, Jian Guan, Kaituo Feng +5

    cs.CVcs.AIarXiv:2506.09965v22025
  54. A Unified Sequence Interface for Vision Tasks

    Ting Chen, Saurabh Saxena, Lala Li +3

    cs.CVcs.CLcs.LGarXiv:2206.07669v22022
  55. Learning Language-guided Adaptive Hyper-modality Representation for Multimodal Sentiment Analysis

    Haoyu Zhang, Yu Wang, Guanghao Yin +3

    cs.AIcs.CLcs.CVarXiv:2310.05804v22023
  56. Video Language Planning

    Yilun Du, Mengjiao Yang, Pete Florence +10

    cs.CVcs.AIcs.LGarXiv:2310.10625v12023
  57. COOPERNAUT: End-to-End Driving with Cooperative Perception for Networked Vehicles

    Jiaxun Cui, Hang Qiu, Dian Chen +2

    cs.CVcs.ROarXiv:2205.02222v12022
  58. GCFAgg: Global and Cross-view Feature Aggregation for Multi-view Clustering

    Weiqing Yan, Yuanyang Zhang, Chenlei Lv +4

    cs.CVarXiv:2305.06799v12023
  59. HIVE: Harnessing Human Feedback for Instructional Visual Editing

    Shu Zhang, Xinyi Yang, Yihao Feng +9

    cs.CVcs.AIcs.CLarXiv:2303.09618v22023
  60. Detect Anything via Next Point Prediction

    Qing Jiang, Junan Huo, Xingyu Chen +6

    cs.CVarXiv:2510.12798v12025