Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

5,461 to 5,520 of 18,781

  1. Latent Diffusion Model without Variational Autoencoder

    Minglei Shi, Haolin Wang, Wenzhao Zheng +6

    cs.CVcs.AIarXiv:2510.15301v42025
  2. One-Shot Object Detection with Co-Attention and Co-Excitation

    Ting-I Hsieh, Yi-Chen Lo, Hwann-Tzong Chen +1

    cs.CVcs.LGeess.IVarXiv:1911.12529v12019
  3. MegaStyle++: Scaling Image Style Space through Hierarchical Style Definition

    Junyao Gao, Sibo Liu, Jiaxing Li +4

    cs.CVarXiv:2609.01423v22026
  4. Approximate evaluation of marginal association probabilities with belief propagation

    Jason L. Williams, Roslyn A. Lau

    cs.AIcs.CVarXiv:1209.6299v22012
  5. Residual Kalman Dynamics for Event-Based UAV Forecasting

    Per Nyblom, Hannes Ovrén, David Gustafsson

    cs.CVarXiv:2609.00839v12026
  6. Learning Multi-scale Features for Foreground Segmentation

    Long Ang Lim, Hacer Yalim Keles

    cs.CVarXiv:1808.01477v12018
  7. EditScore: Unlocking Online RL for Image Editing via High-Fidelity Reward Modeling

    Xin Luo, Jiahao Wang, Chenyuan Wu +6

    cs.CVarXiv:2509.23909v32025
  8. On the Diagnostic of Road Pathway Visibility

    Pierre Charbonnier, Jean-Philippe Tarel, Francois Goulette

    cs.CVarXiv:1601.05535v12016
  9. BrainDiff: Longitudinal Report Generation for Multimodal Brain MRI

    Krish Patel, Peirong Liu

    cs.CVarXiv:2609.00593v22026
  10. Zebra-CoT: A Dataset for Interleaved Vision Language Reasoning

    Ang Li, Charles Wang, Deqing Fu +9

    cs.CVcs.CLcs.LGarXiv:2507.16746v22025
  11. Uniworld-V2: Reinforce Image Editing with Diffusion Negative-aware Finetuning and MLLM Implicit Feedback

    Zongjian Li, Zheyuan Liu, Qihui Zhang +10

    cs.CVarXiv:2510.16888v32025
  12. How many images do I need? Understanding how sample size per class affects deep learning model performance metrics for balanced designs in autonomous wildlife monitoring

    Saleh Shahinfar, Paul Meek, Greg Falzon

    cs.CVcs.AIcs.LGarXiv:2010.08186v12020
  13. Small Object Detection: A Comprehensive Survey on Challenges, Techniques and Real-World Applications

    Mahya Nikouei, Bita Baroutian, Shahabedin Nabavi +4

    cs.CVarXiv:2503.20516v12025
  14. Deep reinforcement learning in medical imaging: A literature review

    S. Kevin Zhou, Hoang Ngan Le, Khoa Luu +2

    eess.IVcs.CVcs.LGarXiv:2103.05115v12021
  15. VisualQuality-R1: Reasoning-Induced Image Quality Assessment via Reinforcement Learning to Rank

    Tianhe Wu, Jian Zou, Jie Liang +2

    cs.CVarXiv:2505.14460v22025
  16. Sparse VideoGen2: Accelerate Video Generation with Sparse Attention via Semantic-Aware Permutation

    Shuo Yang, Haocheng Xi, Yilong Zhao +10

    cs.CVarXiv:2505.18875v52025
  17. EdiTikZ: Scientific Figure Editing from Revision Trajectories

    Christian Greisinger, Zhixue Zhao, Steffen Eger

    cs.AIcs.CLcs.CVarXiv:2609.01409v12026
  18. Marigold: Affordable Adaptation of Diffusion-Based Image Generators for Image Analysis

    Bingxin Ke, Kevin Qu, Tianfu Wang +5

    cs.CVcs.LGarXiv:2505.09358v12025
  19. Galaxea Open-World Dataset and G0 Dual-System VLA Model

    Tao Jiang, Tianyuan Yuan, Yicheng Liu +7

    cs.ROcs.CVarXiv:2509.00576v12025
  20. Mixture of Contexts for Long Video Generation

    Shengqu Cai, Ceyuan Yang, Lvmin Zhang +10

    cs.GRcs.AIcs.CVarXiv:2508.21058v32025
  21. Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation

    Chao Liao, Liyang Liu, Xun Wang +7

    cs.CVarXiv:2505.05472v22025
  22. Deep Photovoltaic Nowcasting

    Jinsong Zhang, Rodrigo Verschae, Shohei Nobuhara +1

    cs.CVarXiv:1810.06327v12018
  23. EasyControl: Adding Efficient and Flexible Control for Diffusion Transformer

    Yuxuan Zhang, Yirui Yuan, Yiren Song +2

    cs.CVarXiv:2503.07027v12025
  24. Self-Supervised Correspondence in Visuomotor Policy Learning

    Peter Florence, Lucas Manuelli, Russ Tedrake

    cs.ROcs.CVcs.LGarXiv:1909.06933v12019
  25. Large Video Planner Enables Generalizable Robot Control

    Boyuan Chen, Tianyuan Zhang, Haoran Geng +9

    cs.ROcs.CVarXiv:2512.15840v22025
  26. Where Should Experience Live? Hierarchical Hebbian Memory for Continual Vision Transformers

    Mohammed Yusuf Mujawar, Noorbakhsh Amiri Golilarz

    cs.CVcs.NEarXiv:2609.00358v12026
  27. MotionStream: Real-Time Video Generation with Interactive Motion Controls

    Joonghyuk Shin, Zhengqi Li, Richard Zhang +4

    cs.CVcs.LGarXiv:2511.01266v52025
  28. LOCI: A Locator-Critic with Refinement Loop

    Walid Bousselham, Mathilde Caron, Arsha Nagrani +1

    cs.CVcs.AIarXiv:2608.30959v12026
  29. OmniSVG: A Unified Scalable Vector Graphics Generation Model

    Yiying Yang, Wei Cheng, Sijin Chen +7

    cs.CVarXiv:2504.06263v32025
  30. Applying Faster R-CNN for Object Detection on Malaria Images

    Jane Hung, Deepali Ravel, Stefanie C. P. Lopes +11

    cs.CVarXiv:1804.09548v22018
  31. PhysTwin: Physics-Informed Reconstruction and Simulation of Deformable Objects from Videos

    Hanxiao Jiang, Hao-Yu Hsu, Kaifeng Zhang +3

    cs.CVcs.AIcs.ROarXiv:2503.17973v12025
  32. Unified Multimodal Chain-of-Thought Reward Model through Reinforcement Fine-Tuning

    Yibin Wang, Zhimin Li, Yuhang Zang +4

    cs.CVarXiv:2505.03318v32025
  33. InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy

    Xinyi Chen, Yilun Chen, Yanwei Fu +26

    cs.ROcs.AIcs.CVarXiv:2510.13778v12025
  34. STream3R: Scalable Sequential 3D Reconstruction with Causal Transformer

    Yushi Lan, Yihang Luo, Fangzhou Hong +7

    cs.CVarXiv:2508.10893v12025
  35. ChatVLA: Unified Multimodal Understanding and Robot Control with Vision-Language-Action Model

    Zhongyi Zhou, Yichen Zhu, Minjie Zhu +8

    cs.ROcs.CVcs.LGarXiv:2502.14420v22025
  36. OneIG-Bench: Omni-dimensional Nuanced Evaluation for Image Generation

    Jingjing Chang, Yixiao Fang, Peng Xing +6

    cs.CVarXiv:2506.07977v32025
  37. Lumina-Image 2.0: A Unified and Efficient Image Generative Framework

    Qi Qin, Le Zhuo, Yi Xin +20

    cs.CVarXiv:2503.21758v12025
  38. Complete Dictionary Recovery over the Sphere

    Ju Sun, Qing Qu, John Wright

    cs.ITcs.CVcs.LGarXiv:1504.06785v32015
  39. One-Minute Video Generation with Test-Time Training

    Karan Dalal, Daniel Koceja, Gashon Hussein +12

    cs.CVarXiv:2504.05298v12025
  40. DPM-Solver-v3: Improved Diffusion ODE Solver with Empirical Model Statistics

    Kaiwen Zheng, Cheng Lu, Jianfei Chen +1

    cs.CVcs.LGarXiv:2310.13268v32023
  41. MindCube: Spatial Mental Modeling from Limited Views

    Qineng Wang, Baiqiao Yin, Pingyue Zhang +11

    cs.AIcs.CLcs.CVarXiv:2506.21458v22025
  42. Scan, Attend and Read: End-to-End Handwritten Paragraph Recognition with MDLSTM Attention

    Théodore Bluche, Jérôme Louradour, Ronaldo Messina

    cs.CVarXiv:1604.03286v32016
  43. UniGoal: Towards Universal Zero-shot Goal-oriented Navigation

    Hang Yin, Xiuwei Xu, Lingqing Zhao +3

    cs.CVcs.ROarXiv:2503.10630v32025
  44. Deep Scale-spaces: Equivariance Over Scale

    Daniel E. Worrall, Max Welling

    cs.LGcs.CVstat.MLarXiv:1905.11697v12019
  45. A Multi-task Deep Network for Person Re-identification

    Weihua Chen, Xiaotang Chen, Jianguo Zhang +1

    cs.CVarXiv:1607.05369v32016
  46. Deep Hierarchical Semantic Segmentation

    Liulei Li, Tianfei Zhou, Wenguan Wang +2

    cs.CVarXiv:2203.14335v22022
  47. Visual Spatial Tuning

    Rui Yang, Ziyu Zhu, Yanwei Li +9

    cs.CVarXiv:2511.05491v12025
  48. GPT4Scene: Understand 3D Scenes from Videos with Vision-Language Models

    Zhangyang Qi, Zhixiong Zhang, Ye Fang +2

    cs.CVarXiv:2501.01428v42025
  49. Multi-Evidence Filtering and Fusion for Multi-Label Classification, Object Detection and Semantic Segmentation Based on Weakly Supervised Learning

    Weifeng Ge, Sibei Yang, Yizhou Yu

    cs.CVcs.AIcs.LGarXiv:1802.09129v12018
  50. Can We Generate Images with CoT? Let's Verify and Reinforce Image Generation Step by Step

    Ziyu Guo, Renrui Zhang, Chengzhuo Tong +9

    cs.CVcs.AIcs.CLarXiv:2501.13926v22025
  51. Binarized Convolutional Landmark Localizers for Human Pose Estimation and Face Alignment with Limited Resources

    Adrian Bulat, Georgios Tzimiropoulos

    cs.CVcs.LGstat.MLarXiv:1703.00862v22017
  52. LambdaNetworks: Modeling Long-Range Interactions Without Attention

    Irwan Bello

    cs.CVcs.LGarXiv:2102.08602v12021
  53. WildGS-SLAM: Monocular Gaussian Splatting SLAM in Dynamic Environments

    Jianhao Zheng, Zihan Zhu, Valentin Bieri +3

    cs.CVcs.ROarXiv:2504.03886v12025
  54. Better than Real: Complex-valued Neural Nets for MRI Fingerprinting

    Patrick Virtue, Stella X. Yu, Michael Lustig

    cs.CVarXiv:1707.00070v12017
  55. Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing

    Junfei Wu, Jian Guan, Kaituo Feng +5

    cs.CVcs.AIarXiv:2506.09965v22025
  56. A Unified Sequence Interface for Vision Tasks

    Ting Chen, Saurabh Saxena, Lala Li +3

    cs.CVcs.CLcs.LGarXiv:2206.07669v22022
  57. Learning Language-guided Adaptive Hyper-modality Representation for Multimodal Sentiment Analysis

    Haoyu Zhang, Yu Wang, Guanghao Yin +3

    cs.AIcs.CLcs.CVarXiv:2310.05804v22023
  58. Video Language Planning

    Yilun Du, Mengjiao Yang, Pete Florence +10

    cs.CVcs.AIcs.LGarXiv:2310.10625v12023
  59. COOPERNAUT: End-to-End Driving with Cooperative Perception for Networked Vehicles

    Jiaxun Cui, Hang Qiu, Dian Chen +2

    cs.CVcs.ROarXiv:2205.02222v12022
  60. GCFAgg: Global and Cross-view Feature Aggregation for Multi-view Clustering

    Weiqing Yan, Yuanyang Zhang, Chenlei Lv +4

    cs.CVarXiv:2305.06799v12023