Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
15,361 to 15,420 of 18,817
Learning Spatial-Temporal Regularized Correlation Filters for Visual Tracking
Feng Li, Cheng Tian, Wangmeng Zuo +2
cs.CVarXiv:1803.08679v12018StreamingClaw Technical Report
Jiawei Chen, Zhe Chen, Chaoqun Du +21
cs.CVarXiv:2603.22120v22026Efficient Camera-Controlled Video Generation of Static Scenes via Sparse Diffusion and 3D Rendering
Jieying Chen, Jeffrey Hu, Joan Lasenby +1
cs.CVarXiv:2601.09697v12026Predicting Multiple Clinical Outcomes Related to Functional Recovery and Social Isolation Among Older Adults After Lower-Limb Fracture or Hip Replacement
Santosh Ray, Pratik K. Mishra, Ali Abedi +3
cs.CVcs.LGarXiv:2608.23531v12026SA-Net: Shuffle Attention for Deep Convolutional Neural Networks
Qing-Long Zhang Yu-Bin Yang
cs.CVcs.AIarXiv:2102.00240v12021LagerNVS: Latent Geometry for Fully Neural Real-time Novel View Synthesis
Stanislaw Szymanowicz, Minghao Chen, Jianyuan Wang +2
cs.CVarXiv:2603.20176v32026When Models Judge Themselves: Unsupervised Self-Evolution for Multimodal Reasoning
Zhengxian Wu, Kai Shi, Chuanrui Zhang +10
cs.CVcs.AIarXiv:2603.21289v22026Amulet: Aggregating Multi-level Convolutional Features for Salient Object Detection
Pingping Zhang, Dong Wang, Huchuan Lu +2
cs.CVarXiv:1708.02001v12017Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation
Peize Sun, Yi Jiang, Shoufa Chen +4
cs.CVarXiv:2406.06525v12024The Universal Normal Embedding
Chen Tasker, Roy Betser, Eyal Gofer +2
cs.CVeess.IVarXiv:2603.21786v12026Muse: Text-To-Image Generation via Masked Generative Transformers
Huiwen Chang, Han Zhang, Jarred Barber +9
cs.CVcs.AIcs.LGarXiv:2301.00704v12023SPLATNet: Sparse Lattice Networks for Point Cloud Processing
Hang Su, Varun Jampani, Deqing Sun +4
cs.CVcs.GRarXiv:1802.08275v42018Ego2Web: A Web Agent Benchmark Grounded in Egocentric Videos
Shoubin Yu, Lei Shu, Antoine Yang +6
cs.CVcs.AIcs.CLarXiv:2603.22529v12026EVA: Efficient Reinforcement Learning for End-to-End Video Agent
Yaolun Zhang, Ruohui Wang, Jiahao Wang +6
cs.CVcs.AIcs.CLarXiv:2603.22918v22026EEG-Based Emotion Recognition Using Regularized Graph Neural Networks
Peixiang Zhong, Di Wang, Chunyan Miao
cs.CVcs.AIcs.HCarXiv:1907.07835v42019FastNeRF: High-Fidelity Neural Rendering at 200FPS
Stephan J. Garbin, Marek Kowalski, Matthew Johnson +2
cs.CVarXiv:2103.10380v22021Self-Challenging Improves Cross-Domain Generalization
Zeyi Huang, Haohan Wang, Eric P. Xing +1
cs.CVcs.LGarXiv:2007.02454v12020Boosting Latent Diffusion Models via Disentangled Representation Alignment
John Page, Xuesong Niu, Kai Wu +1
cs.CVarXiv:2601.05823v22026End-to-End Human Pose and Mesh Reconstruction with Transformers
Kevin Lin, Lijuan Wang, Zicheng Liu
cs.CVarXiv:2012.09760v32020U-shape Transformer for Underwater Image Enhancement
Lintao Peng, Chunli Zhu, Liheng Bian
cs.CVeess.IVarXiv:2111.11843v62021MuSEAgent: A Multimodal Reasoning Agent with Stateful Experiences
Shijian Wang, Jiarui Jin, Runhao Fu +11
cs.CVarXiv:2603.27813v12026Motion Attribution for Video Generation
Xindi Wu, Despoina Paschalidou, Jun Gao +5
cs.CVcs.AIcs.LGarXiv:2601.08828v22026GIT: A Generative Image-to-text Transformer for Vision and Language
Jianfeng Wang, Zhengyuan Yang, Xiaowei Hu +6
cs.CVarXiv:2205.14100v52022CARLA-Air: Fly Drones Inside a CARLA World -- A Unified Infrastructure for Air-Ground Embodied Intelligence
Tianle Zeng, Yanci Wen, Hong Zhang
cs.ROcs.AIcs.CVarXiv:2603.28032v22026GameplayQA: A Benchmarking Framework for Decision-Dense POV-Synced Multi-Video Understanding of 3D Virtual Agents
Yunzhe Wang, Runhui Xu, Kexin Zheng +4
cs.CLcs.AIcs.CVarXiv:2603.24329v22026Language Is Not All You Need: Aligning Perception with Language Models
Shaohan Huang, Li Dong, Wenhui Wang +15
cs.CLcs.CVarXiv:2302.14045v22023MANIQA: Multi-dimension Attention Network for No-Reference Image Quality Assessment
Sidi Yang, Tianhe Wu, Shuwei Shi +5
cs.CVeess.IVarXiv:2204.08958v22022Deeply-Learned Part-Aligned Representations for Person Re-Identification
Liming Zhao, Xi Li, Jingdong Wang +1
cs.CVarXiv:1707.07256v12017End-to-End Video Instance Segmentation with Transformers
Yuqing Wang, Zhaoliang Xu, Xinlong Wang +4
cs.CVarXiv:2011.14503v52020Toward Physically Consistent Driving Video World Models under Challenging Trajectories
Jiawei Zhou, Zhenxin Zhu, Lingyi Du +10
cs.CVarXiv:2603.24506v22026CREval: An Automated Interpretable Evaluation for Creative Image Manipulation under Complex Instructions
Chonghuinan Wang, Zihan Chen, Yuxiang Wei +5
cs.CVarXiv:2603.26174v12026Continual Test-Time Domain Adaptation
Qin Wang, Olga Fink, Luc Van Gool +1
cs.CVarXiv:2203.13591v12022Diffusion Models for Medical Image Analysis: A Comprehensive Survey
Amirhossein Kazerouni, Ehsan Khodapanah Aghdam, Moein Heidari +4
eess.IVcs.CVarXiv:2211.07804v32022MPDiT: Multi-Patch Global-to-Local Transformer Architecture For Efficient Flow Matching and Diffusion Model
Quan Dao, Dimitris Metaxas
cs.CVarXiv:2603.26357v22026Project Imaging-X: A Survey of 1000+ Open-Access Medical Imaging Datasets for Foundation Model Development
Zhongying Deng, Cheng Tang, Ziyan Huang +124
cs.CVcs.AIarXiv:2603.27460v12026Incorporating Learnable Membrane Time Constant to Enhance Learning of Spiking Neural Networks
Wei Fang, Zhaofei Yu, Yanqi Chen +3
cs.NEcs.CVcs.LGarXiv:2007.05785v52020UM-Text: A Unified Multimodal Model for Image Understanding and Visual Text Editing
Lichen Ma, Xiaolong Fu, Gaojing Zhou +6
cs.CVarXiv:2601.08321v32026SnapGen++: Unleashing Diffusion Transformers for Efficient High-Fidelity Image Generation on Edge Devices
Dongting Hu, Aarush Gupta, Magzhan Gabidolla +12
cs.CVarXiv:2601.08303v32026Sign Language Transformers: Joint End-to-end Sign Language Recognition and Translation
Necati Cihan Camgoz, Oscar Koller, Simon Hadfield +1
cs.CVcs.CLcs.HCarXiv:2003.13830v12020EdgeConnect: Generative Image Inpainting with Adversarial Edge Learning
Kamyar Nazeri, Eric Ng, Tony Joseph +2
cs.CVarXiv:1901.00212v32019Habitat-Matterport 3D Dataset (HM3D): 1000 Large-scale 3D Environments for Embodied AI
Santhosh K. Ramakrishnan, Aaron Gokaslan, Erik Wijmans +10
cs.CVcs.AIarXiv:2109.08238v12021Designing Energy-Efficient Convolutional Neural Networks using Energy-Aware Pruning
Tien-Ju Yang, Yu-Hsin Chen, Vivienne Sze
cs.CVarXiv:1611.05128v42016WorldFlow3D: Flowing Through 3D Distributions for Unbounded World Generation
Amogh Joshi, Julian Ost, Felix Heide
cs.CVcs.AIcs.GRarXiv:2603.29089v12026Vision-Language Models for Occupational Physical Exposure Assessment: Estimating External Hand Forces in Manual Material Handling Tasks from RGB Video
Mohammad Sadra Rajabi, Aanuoluwapo Ojelade, Sunwook Kim +1
cs.CVcs.AIcs.CLarXiv:2608.22586v12026HandX: Scaling Bimanual Motion and Interaction Generation
Zimu Zhang, Yucheng Zhang, Xiyan Xu +8
cs.CVarXiv:2603.28766v12026BSN: Boundary Sensitive Network for Temporal Action Proposal Generation
Tianwei Lin, Xu Zhao, Haisheng Su +2
cs.CVarXiv:1806.02964v32018CaRGo-T: Causal Reasoning Graph-of-Thought improves Multimodal Humor Comprehension
Abhilash Nandy, Rahul Seetharaman, Aman Bansal +5
cs.CLcs.CVarXiv:2608.23172v12026DiffEdit: Diffusion-based semantic image editing with mask guidance
Guillaume Couairon, Jakob Verbeek, Holger Schwenk +1
cs.CVarXiv:2210.11427v12022Simple Does It: Weakly Supervised Instance and Semantic Segmentation
Anna Khoreva, Rodrigo Benenson, Jan Hosang +2
cs.CVarXiv:1603.07485v22016Extend3D: Town-Scale 3D Generation
Seungwoo Yoon, Jinmo Kim, Jaesik Park
cs.CVcs.AIarXiv:2603.29387v12026SVDNet for Pedestrian Retrieval
Yifan Sun, Liang Zheng, Weijian Deng +1
cs.CVarXiv:1703.05693v42017UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders
Matthew Walmer, Saksham Suri, Anirud Aggarwal +1
cs.CVarXiv:2601.17950v22026On the Efficacy of Knowledge Distillation
Jang Hyun Cho, Bharath Hariharan
cs.LGcs.CVarXiv:1910.01348v12019The Side Effects of Being Smart: Safety Risks in MLLMs' Multi-Image Reasoning
Renmiao Chen, Yida Lu, Shiyao Cui +6
cs.CVcs.CLarXiv:2601.14127v12026TVQA: Localized, Compositional Video Question Answering
Jie Lei, Licheng Yu, Mohit Bansal +1
cs.CLcs.AIcs.CVarXiv:1809.01696v22018SymmAdapt: Symmetrical Flow Matching for Source-Free Domain Adaptation in Medical Image Segmentation
Tal Grossman, Noa Cahan, Hayit Greenspan
cs.CVarXiv:2608.22532v12026AVMeme Exam: A Multimodal Multilingual Multicultural Benchmark for LLMs' Contextual and Cultural Knowledge and Thinking
Xilin Jiang, Qiaolin Wang, Junkai Wu +30
cs.SDcs.CLcs.CVarXiv:2601.17645v12026SONIC-O1: A Real-World Benchmark for Evaluating Multimodal Large Language Models on Audio-Video Understanding
Ahmed Y. Radwan, Christos Emmanouilidis, Hina Tabassum +2
cs.AIcs.CVarXiv:2601.21666v22026Videos as Space-Time Region Graphs
Xiaolong Wang, Abhinav Gupta
cs.CVarXiv:1806.01810v22018DeepIM: Deep Iterative Matching for 6D Pose Estimation
Yi Li, Gu Wang, Xiangyang Ji +2
cs.CVcs.ROarXiv:1804.00175v42018