Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
6,601 to 6,660 of 18,866
BadWorld: Adversarial Attacks on World Models
Linghui Shen, Mingyue Cui, Xingyi Yang
cs.CVarXiv:2606.16519v12026SONIC: Supersizing Motion Tracking for Natural Humanoid Whole-Body Control
Zhengyi Luo, Ye Yuan, Tingwu Wang +25
cs.ROcs.AIcs.CVarXiv:2511.07820v42025GridVQA-X: A Framework for Evaluating Multimodal Explainability Methods
Sujay Belsare, Sudarshan Nikhil, Sushant Kumar +2
cs.CVarXiv:2606.14740v12026Show the Signal, Hide the Noise: Spectral Forcing for Pixel-Space Diffusion
Weichen Fan, Haiwen Diao, Penghao Wu +1
cs.CVarXiv:2606.15236v22026Z-Reward: Beyond Scalar Rewards by Internalizing Reasoning into Score Distributions
Xin Jin, Huanqia Cai, Zhen Li +9
cs.CVarXiv:2606.09076v32026AffordanceVLA: A Vision-Language-Action Model Empowering Action Generation through Affordance-Aware Understanding
Qize Yu, Jiadi You, Yuran Wang +10
cs.ROcs.CVcs.MMarXiv:2606.06155v12026MAOAM: Unified Object and Material Selection with Vision-Language Models
Jaden Park, Valentin Deschaintre, Jason Kuen +5
cs.CVarXiv:2606.04880v12026SOCO: Benchmarking Semantic Object Correspondence in Vision Foundation Models
Olaf Dünkel, Basavaraj Sunagad, Haoran Wang +3
cs.CVarXiv:2605.31597v32026VideoMLA: Low-Rank Latent KV Cache for Minute-Scale Autoregressive Video Diffusion
Hidir Yesiltepe, Jiazhen Hu, Tuna Han Salih Meral +4
cs.CVcs.AIarXiv:2605.30351v12026AdaState: Self-Evolving Anchors for Streaming Video Generation
Yusuf Dalva, Pinar Yanardag
cs.CVarXiv:2605.30349v12026Geo-Align: Video Generation Alignment via Metric Geometry Reward
Zizun Li, Haoyu Guo, Runzhe Teng +2
cs.CVarXiv:2605.23903v12026Registers Matter for Pixel-Space Diffusion Transformers
Nikita Starodubcev, Ilia Sudakov, Ilya Drobyshevskiy +2
cs.CVarXiv:2605.16147v22026DrawMotion: Generating 3D Human Motions by Freehand Drawing
Tao Wang, Lei Jin, Zhihua Wu +7
cs.CVarXiv:2605.20955v12026UniT: Unified Geometry Learning with Group Autoregressive Transformer
Haotian Wang, Yusong Huang, Zhaonian Kuang +4
cs.CVarXiv:2605.21131v12026SafeDiffusion-R1: Online Reward Steering for Safe Diffusion Post-Training
Komal Kumar, Ankan Deria, Abhishek Basu +3
cs.CVarXiv:2605.18719v12026Generative Modeling via Drifting
Mingyang Deng, He Li, Tianhong Li +2
cs.LGcs.CVarXiv:2602.04770v22026Aligning Latent Geometry for Spherical Flow Matching in Image Generation
Tuna Han Salih Meral, Kaan Oktay, Hidir Yesiltepe +2
cs.CVarXiv:2605.15193v12026ReactiveGWM: Steering NPC in Reactive Game World Models
Zeqing Wang, Danze Chen, Zhaohu Xing +4
cs.CVarXiv:2605.15256v12026Sat3DGen: Comprehensive Street-Level 3D Scene Generation from Single Satellite Image
Ming Qian, Zimin Xia, Changkun Liu +6
cs.CVcs.AIarXiv:2605.14984v12026Roto-Translation Covariant Convolutional Networks for Medical Image Analysis
Erik J Bekkers, Maxime W Lafarge, Mitko Veta +3
cs.CVcs.LGmath.GRarXiv:1804.03393v32018End-to-End Autoregressive Image Generation with 1D Semantic Tokenizer
Wenda Chu, Bingliang Zhang, Jiaqi Han +4
cs.CVcs.LGarXiv:2605.00503v22026Linear-Time Global Visual Modeling without Explicit Attention
Ruize He, Dongchen Han, Gao Huang
cs.CVarXiv:2605.01711v22026ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents
Fanqing Meng, Lingxiao Du, Zijian Wu +46
cs.CVcs.SEarXiv:2604.23781v22026On the Global Photometric Alignment for Low-Level Vision
Mingjia Li, Tianle Du, Hainuo Wang +2
cs.CVarXiv:2604.08172v12026DreamPartGen: Semantically Grounded Part-Level 3D Generation via Collaborative Latent Denoising
Tianjiao Yu, Xinzhuo Li, Muntasir Wahed +4
cs.CVcs.AIcs.LGarXiv:2603.19216v22026Video-CoE: Reinforcing Video Event Prediction via Chain of Events
Qile Su, Jing Tang, Rui Chen +2
cs.CVarXiv:2603.14935v12026AgilePruner: An Empirical Study of Attention and Diversity for Adaptive Visual Token Pruning in Large Vision-Language Models
Changwoo Baek, Jouwon Song, Sohyeon Kim +1
cs.CVcs.LGarXiv:2603.01236v12026TDM-R1: Reinforcing Few-Step Diffusion Models with Non-Differentiable Reward
Yihong Luo, Tianyang Hu, Weijian Luo +1
cs.CVcs.AIarXiv:2603.07700v12026Accelerating Diffusion via Hybrid Data-Pipeline Parallelism Based on Conditional Guidance Scheduling
Euisoo Jung, Byunghyun Kim, Hyunjin Kim +2
cs.CVarXiv:2602.21760v12026Learning from Trials and Errors: Reflective Test-Time Planning for Embodied LLMs
Yining Hong, Huang Huang, Manling Li +4
cs.LGcs.AIcs.CLarXiv:2602.21198v32026Vision Transformer Finetuning Benefits from Non-Smooth Components
Ambroise Odonnat, Laetitia Chapel, Romain Tavenard +1
cs.LGcs.CVstat.MLarXiv:2602.06883v32026Rolling Sink: Bridging Limited-Horizon Training and Open-Ended Testing in Autoregressive Video Diffusion
Haodong Li, Shaoteng Liu, Zhe Lin +1
cs.CVarXiv:2602.07775v62026Neural Predictor-Corrector: Solving Homotopy Problems with Reinforcement Learning
Jiayao Mai, Bangyan Liao, Zhenjun Zhao +6
cs.LGcs.CVarXiv:2602.03086v12026UniversalRAG: Retrieval-Augmented Generation over Corpora of Diverse Modalities and Granularities
Woongyeong Yeo, Kangsan Kim, Soyeong Jeong +2
cs.CLcs.AIcs.CVarXiv:2504.20734v52025Summaries:한국어LamRA: Large Multimodal Model as Your Advanced Retrieval Assistant
Yikun Liu, Pingan Chen, Jiayin Cai +5
cs.CVarXiv:2412.01720v12024Summaries:한국어YOLO advances to its genesis: a decadal and comprehensive review of the You Only Look Once (YOLO) series
Ranjan Sapkota, Marco Flores Calero, Rizwan Qureshi +9
cs.CVarXiv:2406.19407v82024Diffusion for World Modeling: Visual Details Matter in Atari
Eloi Alonso, Adam Jelley, Vincent Micheli +4
cs.LGcs.AIcs.CVarXiv:2405.12399v22024BLINK: Multimodal Large Language Models Can See but Not Perceive
Xingyu Fu, Yushi Hu, Bangzheng Li +7
cs.CVcs.AIcs.CLarXiv:2404.12390v42024BrushNet: A Plug-and-Play Image Inpainting Model with Decomposed Dual-Branch Diffusion
Xuan Ju, Xian Liu, Xintao Wang +3
cs.CVarXiv:2403.06976v12024The Faiss library
Matthijs Douze, Alexandr Guzhva, Chengqi Deng +6
cs.LGcs.CVcs.SEarXiv:2401.08281v42024EAGLES: Efficient Accelerated 3D Gaussians with Lightweight EncodingS
Sharath Girish, Kamal Gupta, Abhinav Shrivastava
cs.CVcs.GRarXiv:2312.04564v32023One-step Diffusion with Distribution Matching Distillation
Tianwei Yin, Michaël Gharbi, Richard Zhang +4
cs.CVarXiv:2311.18828v42023Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets
Andreas Blattmann, Tim Dockhorn, Sumith Kulal +9
cs.CVarXiv:2311.15127v12023Latent Consistency Models: Synthesizing High-Resolution Images with Few-Step Inference
Simian Luo, Yiqin Tan, Longbo Huang +2
cs.CVcs.LGarXiv:2310.04378v12023Nougat: Neural Optical Understanding for Academic Documents
Lukas Blecher, Guillem Cucurull, Thomas Scialom +1
cs.LGcs.CVarXiv:2308.13418v12023Radar-Camera Fusion for Object Detection and Semantic Segmentation in Autonomous Driving: A Comprehensive Review
Shanliang Yao, Runwei Guan, Xiaoyu Huang +8
cs.CVcs.AIcs.ROarXiv:2304.10410v22023A Tale of Two Features: Stable Diffusion Complements DINO for Zero-Shot Semantic Correspondence
Junyi Zhang, Charles Herrmann, Junhwa Hur +4
cs.CVarXiv:2305.15347v22023Align your Latents: High-Resolution Video Synthesis with Latent Diffusion Models
Andreas Blattmann, Robin Rombach, Huan Ling +4
cs.CVcs.LGarXiv:2304.08818v22023VideoChat: Chat-Centric Video Understanding
KunChang Li, Yinan He, Yi Wang +6
cs.CVcs.CLarXiv:2305.06355v22023Vision-Language Models for Vision Tasks: A Survey
Jingyi Zhang, Jiaxing Huang, Sheng Jin +1
cs.CVarXiv:2304.00685v22023DINOv2: Learning Robust Visual Features without Supervision
Maxime Oquab, Timothée Darcet, Théo Moutakanni +23
cs.CVarXiv:2304.07193v12023Summaries:한국어A Comprehensive Survey of Continual Learning: Theory, Method and Application
Liyuan Wang, Xingxing Zhang, Hang Su +1
cs.LGcs.AIcs.CVarXiv:2302.00487v32023HexPlane: A Fast Representation for Dynamic Scenes
Ang Cao, Justin Johnson
cs.CVarXiv:2301.09632v22023Learning to Exploit Temporal Structure for Biomedical Vision-Language Processing
Shruthi Bannur, Stephanie Hyland, Qianchu Liu +13
cs.CVcs.CLarXiv:2301.04558v22023Diffusion Models in Vision: A Survey
Florinel-Alin Croitoru, Vlad Hondru, Radu Tudor Ionescu +1
cs.CVcs.AIcs.LGarXiv:2209.04747v62022Advancing Plain Vision Transformer Towards Remote Sensing Foundation Model
Di Wang, Qiming Zhang, Yufei Xu +4
cs.CVarXiv:2208.03987v42022XMem: Long-Term Video Object Segmentation with an Atkinson-Shiffrin Memory Model
Ho Kei Cheng, Alexander G. Schwing
cs.CVarXiv:2207.07115v22022Egocentric Video-Language Pretraining
Kevin Qinghong Lin, Alex Jinpeng Wang, Mattia Soldan +13
cs.CVcs.AIarXiv:2206.01670v22022Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding
Chitwan Saharia, William Chan, Saurabh Saxena +11
cs.CVcs.LGarXiv:2205.11487v12022High-Resolution Image Synthesis with Latent Diffusion Models
Robin Rombach, Andreas Blattmann, Dominik Lorenz +2
cs.CVarXiv:2112.10752v22021