Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

15,361 to 15,420 of 18,817

  1. Learning Spatial-Temporal Regularized Correlation Filters for Visual Tracking

    Feng Li, Cheng Tian, Wangmeng Zuo +2

    cs.CVarXiv:1803.08679v12018
  2. StreamingClaw Technical Report

    Jiawei Chen, Zhe Chen, Chaoqun Du +21

    cs.CVarXiv:2603.22120v22026
  3. Efficient Camera-Controlled Video Generation of Static Scenes via Sparse Diffusion and 3D Rendering

    Jieying Chen, Jeffrey Hu, Joan Lasenby +1

    cs.CVarXiv:2601.09697v12026
  4. Predicting Multiple Clinical Outcomes Related to Functional Recovery and Social Isolation Among Older Adults After Lower-Limb Fracture or Hip Replacement

    Santosh Ray, Pratik K. Mishra, Ali Abedi +3

    cs.CVcs.LGarXiv:2608.23531v12026
  5. SA-Net: Shuffle Attention for Deep Convolutional Neural Networks

    Qing-Long Zhang Yu-Bin Yang

    cs.CVcs.AIarXiv:2102.00240v12021
  6. LagerNVS: Latent Geometry for Fully Neural Real-time Novel View Synthesis

    Stanislaw Szymanowicz, Minghao Chen, Jianyuan Wang +2

    cs.CVarXiv:2603.20176v32026
  7. When Models Judge Themselves: Unsupervised Self-Evolution for Multimodal Reasoning

    Zhengxian Wu, Kai Shi, Chuanrui Zhang +10

    cs.CVcs.AIarXiv:2603.21289v22026
  8. Amulet: Aggregating Multi-level Convolutional Features for Salient Object Detection

    Pingping Zhang, Dong Wang, Huchuan Lu +2

    cs.CVarXiv:1708.02001v12017
  9. Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation

    Peize Sun, Yi Jiang, Shoufa Chen +4

    cs.CVarXiv:2406.06525v12024
  10. The Universal Normal Embedding

    Chen Tasker, Roy Betser, Eyal Gofer +2

    cs.CVeess.IVarXiv:2603.21786v12026
  11. Muse: Text-To-Image Generation via Masked Generative Transformers

    Huiwen Chang, Han Zhang, Jarred Barber +9

    cs.CVcs.AIcs.LGarXiv:2301.00704v12023
  12. SPLATNet: Sparse Lattice Networks for Point Cloud Processing

    Hang Su, Varun Jampani, Deqing Sun +4

    cs.CVcs.GRarXiv:1802.08275v42018
  13. Ego2Web: A Web Agent Benchmark Grounded in Egocentric Videos

    Shoubin Yu, Lei Shu, Antoine Yang +6

    cs.CVcs.AIcs.CLarXiv:2603.22529v12026
  14. EVA: Efficient Reinforcement Learning for End-to-End Video Agent

    Yaolun Zhang, Ruohui Wang, Jiahao Wang +6

    cs.CVcs.AIcs.CLarXiv:2603.22918v22026
  15. EEG-Based Emotion Recognition Using Regularized Graph Neural Networks

    Peixiang Zhong, Di Wang, Chunyan Miao

    cs.CVcs.AIcs.HCarXiv:1907.07835v42019
  16. FastNeRF: High-Fidelity Neural Rendering at 200FPS

    Stephan J. Garbin, Marek Kowalski, Matthew Johnson +2

    cs.CVarXiv:2103.10380v22021
  17. Self-Challenging Improves Cross-Domain Generalization

    Zeyi Huang, Haohan Wang, Eric P. Xing +1

    cs.CVcs.LGarXiv:2007.02454v12020
  18. Boosting Latent Diffusion Models via Disentangled Representation Alignment

    John Page, Xuesong Niu, Kai Wu +1

    cs.CVarXiv:2601.05823v22026
  19. End-to-End Human Pose and Mesh Reconstruction with Transformers

    Kevin Lin, Lijuan Wang, Zicheng Liu

    cs.CVarXiv:2012.09760v32020
  20. U-shape Transformer for Underwater Image Enhancement

    Lintao Peng, Chunli Zhu, Liheng Bian

    cs.CVeess.IVarXiv:2111.11843v62021
  21. MuSEAgent: A Multimodal Reasoning Agent with Stateful Experiences

    Shijian Wang, Jiarui Jin, Runhao Fu +11

    cs.CVarXiv:2603.27813v12026
  22. Motion Attribution for Video Generation

    Xindi Wu, Despoina Paschalidou, Jun Gao +5

    cs.CVcs.AIcs.LGarXiv:2601.08828v22026
  23. GIT: A Generative Image-to-text Transformer for Vision and Language

    Jianfeng Wang, Zhengyuan Yang, Xiaowei Hu +6

    cs.CVarXiv:2205.14100v52022
  24. CARLA-Air: Fly Drones Inside a CARLA World -- A Unified Infrastructure for Air-Ground Embodied Intelligence

    Tianle Zeng, Yanci Wen, Hong Zhang

    cs.ROcs.AIcs.CVarXiv:2603.28032v22026
  25. GameplayQA: A Benchmarking Framework for Decision-Dense POV-Synced Multi-Video Understanding of 3D Virtual Agents

    Yunzhe Wang, Runhui Xu, Kexin Zheng +4

    cs.CLcs.AIcs.CVarXiv:2603.24329v22026
  26. Language Is Not All You Need: Aligning Perception with Language Models

    Shaohan Huang, Li Dong, Wenhui Wang +15

    cs.CLcs.CVarXiv:2302.14045v22023
  27. MANIQA: Multi-dimension Attention Network for No-Reference Image Quality Assessment

    Sidi Yang, Tianhe Wu, Shuwei Shi +5

    cs.CVeess.IVarXiv:2204.08958v22022
  28. Deeply-Learned Part-Aligned Representations for Person Re-Identification

    Liming Zhao, Xi Li, Jingdong Wang +1

    cs.CVarXiv:1707.07256v12017
  29. End-to-End Video Instance Segmentation with Transformers

    Yuqing Wang, Zhaoliang Xu, Xinlong Wang +4

    cs.CVarXiv:2011.14503v52020
  30. Toward Physically Consistent Driving Video World Models under Challenging Trajectories

    Jiawei Zhou, Zhenxin Zhu, Lingyi Du +10

    cs.CVarXiv:2603.24506v22026
  31. CREval: An Automated Interpretable Evaluation for Creative Image Manipulation under Complex Instructions

    Chonghuinan Wang, Zihan Chen, Yuxiang Wei +5

    cs.CVarXiv:2603.26174v12026
  32. Continual Test-Time Domain Adaptation

    Qin Wang, Olga Fink, Luc Van Gool +1

    cs.CVarXiv:2203.13591v12022
  33. Diffusion Models for Medical Image Analysis: A Comprehensive Survey

    Amirhossein Kazerouni, Ehsan Khodapanah Aghdam, Moein Heidari +4

    eess.IVcs.CVarXiv:2211.07804v32022
  34. MPDiT: Multi-Patch Global-to-Local Transformer Architecture For Efficient Flow Matching and Diffusion Model

    Quan Dao, Dimitris Metaxas

    cs.CVarXiv:2603.26357v22026
  35. Project Imaging-X: A Survey of 1000+ Open-Access Medical Imaging Datasets for Foundation Model Development

    Zhongying Deng, Cheng Tang, Ziyan Huang +124

    cs.CVcs.AIarXiv:2603.27460v12026
  36. Incorporating Learnable Membrane Time Constant to Enhance Learning of Spiking Neural Networks

    Wei Fang, Zhaofei Yu, Yanqi Chen +3

    cs.NEcs.CVcs.LGarXiv:2007.05785v52020
  37. UM-Text: A Unified Multimodal Model for Image Understanding and Visual Text Editing

    Lichen Ma, Xiaolong Fu, Gaojing Zhou +6

    cs.CVarXiv:2601.08321v32026
  38. SnapGen++: Unleashing Diffusion Transformers for Efficient High-Fidelity Image Generation on Edge Devices

    Dongting Hu, Aarush Gupta, Magzhan Gabidolla +12

    cs.CVarXiv:2601.08303v32026
  39. Sign Language Transformers: Joint End-to-end Sign Language Recognition and Translation

    Necati Cihan Camgoz, Oscar Koller, Simon Hadfield +1

    cs.CVcs.CLcs.HCarXiv:2003.13830v12020
  40. EdgeConnect: Generative Image Inpainting with Adversarial Edge Learning

    Kamyar Nazeri, Eric Ng, Tony Joseph +2

    cs.CVarXiv:1901.00212v32019
  41. Habitat-Matterport 3D Dataset (HM3D): 1000 Large-scale 3D Environments for Embodied AI

    Santhosh K. Ramakrishnan, Aaron Gokaslan, Erik Wijmans +10

    cs.CVcs.AIarXiv:2109.08238v12021
  42. Designing Energy-Efficient Convolutional Neural Networks using Energy-Aware Pruning

    Tien-Ju Yang, Yu-Hsin Chen, Vivienne Sze

    cs.CVarXiv:1611.05128v42016
  43. WorldFlow3D: Flowing Through 3D Distributions for Unbounded World Generation

    Amogh Joshi, Julian Ost, Felix Heide

    cs.CVcs.AIcs.GRarXiv:2603.29089v12026
  44. Vision-Language Models for Occupational Physical Exposure Assessment: Estimating External Hand Forces in Manual Material Handling Tasks from RGB Video

    Mohammad Sadra Rajabi, Aanuoluwapo Ojelade, Sunwook Kim +1

    cs.CVcs.AIcs.CLarXiv:2608.22586v12026
  45. HandX: Scaling Bimanual Motion and Interaction Generation

    Zimu Zhang, Yucheng Zhang, Xiyan Xu +8

    cs.CVarXiv:2603.28766v12026
  46. BSN: Boundary Sensitive Network for Temporal Action Proposal Generation

    Tianwei Lin, Xu Zhao, Haisheng Su +2

    cs.CVarXiv:1806.02964v32018
  47. CaRGo-T: Causal Reasoning Graph-of-Thought improves Multimodal Humor Comprehension

    Abhilash Nandy, Rahul Seetharaman, Aman Bansal +5

    cs.CLcs.CVarXiv:2608.23172v12026
  48. DiffEdit: Diffusion-based semantic image editing with mask guidance

    Guillaume Couairon, Jakob Verbeek, Holger Schwenk +1

    cs.CVarXiv:2210.11427v12022
  49. Simple Does It: Weakly Supervised Instance and Semantic Segmentation

    Anna Khoreva, Rodrigo Benenson, Jan Hosang +2

    cs.CVarXiv:1603.07485v22016
  50. Extend3D: Town-Scale 3D Generation

    Seungwoo Yoon, Jinmo Kim, Jaesik Park

    cs.CVcs.AIarXiv:2603.29387v12026
  51. SVDNet for Pedestrian Retrieval

    Yifan Sun, Liang Zheng, Weijian Deng +1

    cs.CVarXiv:1703.05693v42017
  52. UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders

    Matthew Walmer, Saksham Suri, Anirud Aggarwal +1

    cs.CVarXiv:2601.17950v22026
  53. On the Efficacy of Knowledge Distillation

    Jang Hyun Cho, Bharath Hariharan

    cs.LGcs.CVarXiv:1910.01348v12019
  54. The Side Effects of Being Smart: Safety Risks in MLLMs' Multi-Image Reasoning

    Renmiao Chen, Yida Lu, Shiyao Cui +6

    cs.CVcs.CLarXiv:2601.14127v12026
  55. TVQA: Localized, Compositional Video Question Answering

    Jie Lei, Licheng Yu, Mohit Bansal +1

    cs.CLcs.AIcs.CVarXiv:1809.01696v22018
  56. SymmAdapt: Symmetrical Flow Matching for Source-Free Domain Adaptation in Medical Image Segmentation

    Tal Grossman, Noa Cahan, Hayit Greenspan

    cs.CVarXiv:2608.22532v12026
  57. AVMeme Exam: A Multimodal Multilingual Multicultural Benchmark for LLMs' Contextual and Cultural Knowledge and Thinking

    Xilin Jiang, Qiaolin Wang, Junkai Wu +30

    cs.SDcs.CLcs.CVarXiv:2601.17645v12026
  58. SONIC-O1: A Real-World Benchmark for Evaluating Multimodal Large Language Models on Audio-Video Understanding

    Ahmed Y. Radwan, Christos Emmanouilidis, Hina Tabassum +2

    cs.AIcs.CVarXiv:2601.21666v22026
  59. Videos as Space-Time Region Graphs

    Xiaolong Wang, Abhinav Gupta

    cs.CVarXiv:1806.01810v22018
  60. DeepIM: Deep Iterative Matching for 6D Pose Estimation

    Yi Li, Gu Wang, Xiangyang Ji +2

    cs.CVcs.ROarXiv:1804.00175v42018