Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

6,601 to 6,660 of 18,866

  1. BadWorld: Adversarial Attacks on World Models

    Linghui Shen, Mingyue Cui, Xingyi Yang

    cs.CVarXiv:2606.16519v12026
  2. SONIC: Supersizing Motion Tracking for Natural Humanoid Whole-Body Control

    Zhengyi Luo, Ye Yuan, Tingwu Wang +25

    cs.ROcs.AIcs.CVarXiv:2511.07820v42025
  3. GridVQA-X: A Framework for Evaluating Multimodal Explainability Methods

    Sujay Belsare, Sudarshan Nikhil, Sushant Kumar +2

    cs.CVarXiv:2606.14740v12026
  4. Show the Signal, Hide the Noise: Spectral Forcing for Pixel-Space Diffusion

    Weichen Fan, Haiwen Diao, Penghao Wu +1

    cs.CVarXiv:2606.15236v22026
  5. Z-Reward: Beyond Scalar Rewards by Internalizing Reasoning into Score Distributions

    Xin Jin, Huanqia Cai, Zhen Li +9

    cs.CVarXiv:2606.09076v32026
  6. AffordanceVLA: A Vision-Language-Action Model Empowering Action Generation through Affordance-Aware Understanding

    Qize Yu, Jiadi You, Yuran Wang +10

    cs.ROcs.CVcs.MMarXiv:2606.06155v12026
  7. MAOAM: Unified Object and Material Selection with Vision-Language Models

    Jaden Park, Valentin Deschaintre, Jason Kuen +5

    cs.CVarXiv:2606.04880v12026
  8. SOCO: Benchmarking Semantic Object Correspondence in Vision Foundation Models

    Olaf Dünkel, Basavaraj Sunagad, Haoran Wang +3

    cs.CVarXiv:2605.31597v32026
  9. VideoMLA: Low-Rank Latent KV Cache for Minute-Scale Autoregressive Video Diffusion

    Hidir Yesiltepe, Jiazhen Hu, Tuna Han Salih Meral +4

    cs.CVcs.AIarXiv:2605.30351v12026
  10. AdaState: Self-Evolving Anchors for Streaming Video Generation

    Yusuf Dalva, Pinar Yanardag

    cs.CVarXiv:2605.30349v12026
  11. Geo-Align: Video Generation Alignment via Metric Geometry Reward

    Zizun Li, Haoyu Guo, Runzhe Teng +2

    cs.CVarXiv:2605.23903v12026
  12. Registers Matter for Pixel-Space Diffusion Transformers

    Nikita Starodubcev, Ilia Sudakov, Ilya Drobyshevskiy +2

    cs.CVarXiv:2605.16147v22026
  13. DrawMotion: Generating 3D Human Motions by Freehand Drawing

    Tao Wang, Lei Jin, Zhihua Wu +7

    cs.CVarXiv:2605.20955v12026
  14. UniT: Unified Geometry Learning with Group Autoregressive Transformer

    Haotian Wang, Yusong Huang, Zhaonian Kuang +4

    cs.CVarXiv:2605.21131v12026
  15. SafeDiffusion-R1: Online Reward Steering for Safe Diffusion Post-Training

    Komal Kumar, Ankan Deria, Abhishek Basu +3

    cs.CVarXiv:2605.18719v12026
  16. Generative Modeling via Drifting

    Mingyang Deng, He Li, Tianhong Li +2

    cs.LGcs.CVarXiv:2602.04770v22026
  17. Aligning Latent Geometry for Spherical Flow Matching in Image Generation

    Tuna Han Salih Meral, Kaan Oktay, Hidir Yesiltepe +2

    cs.CVarXiv:2605.15193v12026
  18. ReactiveGWM: Steering NPC in Reactive Game World Models

    Zeqing Wang, Danze Chen, Zhaohu Xing +4

    cs.CVarXiv:2605.15256v12026
  19. Sat3DGen: Comprehensive Street-Level 3D Scene Generation from Single Satellite Image

    Ming Qian, Zimin Xia, Changkun Liu +6

    cs.CVcs.AIarXiv:2605.14984v12026
  20. Roto-Translation Covariant Convolutional Networks for Medical Image Analysis

    Erik J Bekkers, Maxime W Lafarge, Mitko Veta +3

    cs.CVcs.LGmath.GRarXiv:1804.03393v32018
  21. End-to-End Autoregressive Image Generation with 1D Semantic Tokenizer

    Wenda Chu, Bingliang Zhang, Jiaqi Han +4

    cs.CVcs.LGarXiv:2605.00503v22026
  22. Linear-Time Global Visual Modeling without Explicit Attention

    Ruize He, Dongchen Han, Gao Huang

    cs.CVarXiv:2605.01711v22026
  23. ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents

    Fanqing Meng, Lingxiao Du, Zijian Wu +46

    cs.CVcs.SEarXiv:2604.23781v22026
  24. On the Global Photometric Alignment for Low-Level Vision

    Mingjia Li, Tianle Du, Hainuo Wang +2

    cs.CVarXiv:2604.08172v12026
  25. DreamPartGen: Semantically Grounded Part-Level 3D Generation via Collaborative Latent Denoising

    Tianjiao Yu, Xinzhuo Li, Muntasir Wahed +4

    cs.CVcs.AIcs.LGarXiv:2603.19216v22026
  26. Video-CoE: Reinforcing Video Event Prediction via Chain of Events

    Qile Su, Jing Tang, Rui Chen +2

    cs.CVarXiv:2603.14935v12026
  27. AgilePruner: An Empirical Study of Attention and Diversity for Adaptive Visual Token Pruning in Large Vision-Language Models

    Changwoo Baek, Jouwon Song, Sohyeon Kim +1

    cs.CVcs.LGarXiv:2603.01236v12026
  28. TDM-R1: Reinforcing Few-Step Diffusion Models with Non-Differentiable Reward

    Yihong Luo, Tianyang Hu, Weijian Luo +1

    cs.CVcs.AIarXiv:2603.07700v12026
  29. Accelerating Diffusion via Hybrid Data-Pipeline Parallelism Based on Conditional Guidance Scheduling

    Euisoo Jung, Byunghyun Kim, Hyunjin Kim +2

    cs.CVarXiv:2602.21760v12026
  30. Learning from Trials and Errors: Reflective Test-Time Planning for Embodied LLMs

    Yining Hong, Huang Huang, Manling Li +4

    cs.LGcs.AIcs.CLarXiv:2602.21198v32026
  31. Vision Transformer Finetuning Benefits from Non-Smooth Components

    Ambroise Odonnat, Laetitia Chapel, Romain Tavenard +1

    cs.LGcs.CVstat.MLarXiv:2602.06883v32026
  32. Rolling Sink: Bridging Limited-Horizon Training and Open-Ended Testing in Autoregressive Video Diffusion

    Haodong Li, Shaoteng Liu, Zhe Lin +1

    cs.CVarXiv:2602.07775v62026
  33. Neural Predictor-Corrector: Solving Homotopy Problems with Reinforcement Learning

    Jiayao Mai, Bangyan Liao, Zhenjun Zhao +6

    cs.LGcs.CVarXiv:2602.03086v12026
  34. UniversalRAG: Retrieval-Augmented Generation over Corpora of Diverse Modalities and Granularities

    Woongyeong Yeo, Kangsan Kim, Soyeong Jeong +2

    cs.CLcs.AIcs.CVarXiv:2504.20734v52025
    Summaries:한국어
  35. LamRA: Large Multimodal Model as Your Advanced Retrieval Assistant

    Yikun Liu, Pingan Chen, Jiayin Cai +5

    cs.CVarXiv:2412.01720v12024
    Summaries:한국어
  36. YOLO advances to its genesis: a decadal and comprehensive review of the You Only Look Once (YOLO) series

    Ranjan Sapkota, Marco Flores Calero, Rizwan Qureshi +9

    cs.CVarXiv:2406.19407v82024
  37. Diffusion for World Modeling: Visual Details Matter in Atari

    Eloi Alonso, Adam Jelley, Vincent Micheli +4

    cs.LGcs.AIcs.CVarXiv:2405.12399v22024
  38. BLINK: Multimodal Large Language Models Can See but Not Perceive

    Xingyu Fu, Yushi Hu, Bangzheng Li +7

    cs.CVcs.AIcs.CLarXiv:2404.12390v42024
  39. BrushNet: A Plug-and-Play Image Inpainting Model with Decomposed Dual-Branch Diffusion

    Xuan Ju, Xian Liu, Xintao Wang +3

    cs.CVarXiv:2403.06976v12024
  40. The Faiss library

    Matthijs Douze, Alexandr Guzhva, Chengqi Deng +6

    cs.LGcs.CVcs.SEarXiv:2401.08281v42024
  41. EAGLES: Efficient Accelerated 3D Gaussians with Lightweight EncodingS

    Sharath Girish, Kamal Gupta, Abhinav Shrivastava

    cs.CVcs.GRarXiv:2312.04564v32023
  42. One-step Diffusion with Distribution Matching Distillation

    Tianwei Yin, Michaël Gharbi, Richard Zhang +4

    cs.CVarXiv:2311.18828v42023
  43. Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets

    Andreas Blattmann, Tim Dockhorn, Sumith Kulal +9

    cs.CVarXiv:2311.15127v12023
  44. Latent Consistency Models: Synthesizing High-Resolution Images with Few-Step Inference

    Simian Luo, Yiqin Tan, Longbo Huang +2

    cs.CVcs.LGarXiv:2310.04378v12023
  45. Nougat: Neural Optical Understanding for Academic Documents

    Lukas Blecher, Guillem Cucurull, Thomas Scialom +1

    cs.LGcs.CVarXiv:2308.13418v12023
  46. Radar-Camera Fusion for Object Detection and Semantic Segmentation in Autonomous Driving: A Comprehensive Review

    Shanliang Yao, Runwei Guan, Xiaoyu Huang +8

    cs.CVcs.AIcs.ROarXiv:2304.10410v22023
  47. A Tale of Two Features: Stable Diffusion Complements DINO for Zero-Shot Semantic Correspondence

    Junyi Zhang, Charles Herrmann, Junhwa Hur +4

    cs.CVarXiv:2305.15347v22023
  48. Align your Latents: High-Resolution Video Synthesis with Latent Diffusion Models

    Andreas Blattmann, Robin Rombach, Huan Ling +4

    cs.CVcs.LGarXiv:2304.08818v22023
  49. VideoChat: Chat-Centric Video Understanding

    KunChang Li, Yinan He, Yi Wang +6

    cs.CVcs.CLarXiv:2305.06355v22023
  50. Vision-Language Models for Vision Tasks: A Survey

    Jingyi Zhang, Jiaxing Huang, Sheng Jin +1

    cs.CVarXiv:2304.00685v22023
  51. DINOv2: Learning Robust Visual Features without Supervision

    Maxime Oquab, Timothée Darcet, Théo Moutakanni +23

    cs.CVarXiv:2304.07193v12023
    Summaries:한국어
  52. A Comprehensive Survey of Continual Learning: Theory, Method and Application

    Liyuan Wang, Xingxing Zhang, Hang Su +1

    cs.LGcs.AIcs.CVarXiv:2302.00487v32023
  53. HexPlane: A Fast Representation for Dynamic Scenes

    Ang Cao, Justin Johnson

    cs.CVarXiv:2301.09632v22023
  54. Learning to Exploit Temporal Structure for Biomedical Vision-Language Processing

    Shruthi Bannur, Stephanie Hyland, Qianchu Liu +13

    cs.CVcs.CLarXiv:2301.04558v22023
  55. Diffusion Models in Vision: A Survey

    Florinel-Alin Croitoru, Vlad Hondru, Radu Tudor Ionescu +1

    cs.CVcs.AIcs.LGarXiv:2209.04747v62022
  56. Advancing Plain Vision Transformer Towards Remote Sensing Foundation Model

    Di Wang, Qiming Zhang, Yufei Xu +4

    cs.CVarXiv:2208.03987v42022
  57. XMem: Long-Term Video Object Segmentation with an Atkinson-Shiffrin Memory Model

    Ho Kei Cheng, Alexander G. Schwing

    cs.CVarXiv:2207.07115v22022
  58. Egocentric Video-Language Pretraining

    Kevin Qinghong Lin, Alex Jinpeng Wang, Mattia Soldan +13

    cs.CVcs.AIarXiv:2206.01670v22022
  59. Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding

    Chitwan Saharia, William Chan, Saurabh Saxena +11

    cs.CVcs.LGarXiv:2205.11487v12022
  60. High-Resolution Image Synthesis with Latent Diffusion Models

    Robin Rombach, Andreas Blattmann, Dominik Lorenz +2

    cs.CVarXiv:2112.10752v22021