Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

3,841 to 3,900 of 18,855

  1. SAM-6D: Segment Anything Model Meets Zero-Shot 6D Object Pose Estimation

    Jiehong Lin, Lihua Liu, Dekun Lu +1

    cs.CVarXiv:2311.15707v22023
  2. DisCo: Disentangled Control for Realistic Human Dance Generation

    Tan Wang, Linjie Li, Kevin Lin +6

    cs.CVcs.AIarXiv:2307.00040v32023
  3. Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation

    Zaijing Li, Bing Hu, Rui Shao +5

    cs.ROcs.AIcs.CVarXiv:2602.20200v22026
  4. Towards Unified INT8 Training for Convolutional Neural Network

    Feng Zhu, Ruihao Gong, Fengwei Yu +5

    cs.LGcs.CVarXiv:1912.12607v12019
  5. Multi-institutional Collaborations for Improving Deep Learning-based Magnetic Resonance Image Reconstruction Using Federated Learning

    Pengfei Guo, Puyang Wang, Jinyuan Zhou +2

    eess.IVcs.CVarXiv:2103.02148v42021
  6. Topology-aware Convolutional Neural Network for Efficient Skeleton-based Action Recognition

    Kailin Xu, Fanfan Ye, Qiaoyong Zhong +1

    cs.CVarXiv:2112.04178v22021
  7. Structured World Models from Human Videos

    Russell Mendonca, Shikhar Bahl, Deepak Pathak

    cs.ROcs.AIcs.CVarXiv:2308.10901v12023
  8. Automatic Liver Lesion Segmentation Using A Deep Convolutional Neural Network Method

    Xiao Han

    cs.CVarXiv:1704.07239v12017
  9. SUDS: Scalable Urban Dynamic Scenes

    Haithem Turki, Jason Y. Zhang, Francesco Ferroni +1

    cs.CVcs.GRcs.LGarXiv:2303.14536v12023
  10. Articraft: An Agentic System for Scalable Articulated 3D Asset Generation

    Matt Zhou, Ruining Li, Xiaoyang Lyu +6

    cs.CVcs.GRcs.ROarXiv:2605.15187v12026
  11. Scene Text Image Super-Resolution in the Wild

    Wenjia Wang, Enze Xie, Xuebo Liu +4

    cs.CVarXiv:2005.03341v32020
  12. Satellite Pose Estimation with Deep Landmark Regression and Nonlinear Pose Refinement

    Bo Chen, Jiewei Cao, Alvaro Parra +1

    cs.CVarXiv:1908.11542v12019
  13. 3D Sketch-aware Semantic Scene Completion via Semi-supervised Structure Prior

    Xiaokang Chen, Kwan-Yee Lin, Chen Qian +2

    cs.CVarXiv:2003.14052v12020
  14. A multi-centre polyp detection and segmentation dataset for generalisability assessment

    Sharib Ali, Debesh Jha, Noha Ghatwary +12

    eess.IVcs.CVcs.LGarXiv:2106.04463v32021
  15. On the Connection Between Adversarial Robustness and Saliency Map Interpretability

    Christian Etmann, Sebastian Lunz, Peter Maass +1

    stat.MLcs.CVcs.LGarXiv:1905.04172v12019
  16. Semantic-Spatial Discriminability Enhancement for Generalized Visual Grounding

    Kaiyan Lei, Xu-Yao Zhang

    cs.CVarXiv:2608.30233v12026
  17. 'Skimming-Perusal' Tracking: A Framework for Real-Time and Robust Long-term Tracking

    Bin Yan, Haojie Zhao, Dong Wang +2

    cs.CVarXiv:1909.01840v12019
  18. Hierarchical Regression Network for Spectral Reconstruction from RGB Images

    Yuzhi Zhao, Lai-Man Po, Qiong Yan +2

    eess.IVcs.CVcs.LGarXiv:2005.04703v12020
  19. PointCoT: A Multi-modal Benchmark for Explicit 3D Geometric Reasoning

    Dongxu Zhang, Yiding Sun, Pengcheng Li +12

    cs.CVcs.AIcs.MMarXiv:2602.23945v12026
  20. A Survey of World Models for Autonomous Driving

    Tuo Feng, Wenguan Wang, Yi Yang

    cs.ROcs.CVarXiv:2501.11260v42025
  21. Diverse and Accurate Image Description Using a Variational Auto-Encoder with an Additive Gaussian Encoding Space

    Liwei Wang, Alexander G. Schwing, Svetlana Lazebnik

    cs.CVarXiv:1711.07068v12017
  22. Render-in-the-Loop: Vector Graphics Generation via Visual Self-Feedback

    Guotao Liang, Zhangcheng Wang, Juncheng Hu +5

    cs.CVarXiv:2604.20730v32026
  23. Taming the Power of Diffusion Models for High-Quality Virtual Try-On with Appearance Flow

    Junhong Gou, Siyu Sun, Jianfu Zhang +3

    cs.CVarXiv:2308.06101v12023
  24. AR-Net: Adaptive Frame Resolution for Efficient Action Recognition

    Yue Meng, Chung-Ching Lin, Rameswar Panda +5

    cs.CVarXiv:2007.15796v12020
  25. VAnim: Rendering-Aware Sparse State Modeling for Structure-Preserving Vector Animation

    Guotao Liang, Zhangcheng Wang, Chuang Wang +6

    cs.CVarXiv:2605.01517v12026
  26. TopV: Compatible Token Pruning with Inference Time Optimization for Fast and Low-Memory Multimodal Vision Language Model

    Cheng Yang, Yang Sui, Jinqi Xiao +8

    cs.CVcs.AIarXiv:2503.18278v22025
  27. AerialVLN: Vision-and-Language Navigation for UAVs

    Shubo Liu, Hongsheng Zhang, Yuankai Qi +3

    cs.CVcs.AIcs.ROarXiv:2308.06735v12023
  28. MotionAGFormer: Enhancing 3D Human Pose Estimation with a Transformer-GCNFormer Network

    Soroush Mehraban, Vida Adeli, Babak Taati

    cs.CVarXiv:2310.16288v12023
  29. Air-Know: Arbiter-Calibrated Knowledge-Internalizing Robust Network for Composed Image Retrieval

    Zhiheng Fu, Yupeng Hu, Qianyun Yang +3

    cs.CVarXiv:2604.19386v22026
  30. Differentiable Manifold Reconstruction for Point Cloud Denoising

    Shitong Luo, Wei Hu

    cs.CVarXiv:2007.13551v22020
  31. Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks

    Jiazhao Zhang, Kunyu Wang, Shaoan Wang +6

    cs.ROcs.CVarXiv:2412.06224v22024
  32. GenAgent: Scaling Text-to-Image Generation via Agentic Multimodal Reasoning

    Kaixun Jiang, Yuzheng Wang, Junjie Zhou +6

    cs.CVarXiv:2601.18543v22026
  33. Rolling-Unrolling LSTMs for Action Anticipation from First-Person Video

    Antonino Furnari, Giovanni Maria Farinella

    cs.CVarXiv:2005.02190v22020
  34. ConeSep: Cone-based Robust Noise-Unlearning Compositional Network for Composed Image Retrieval

    Zixu Li, Yupeng Hu, Zhiwei Chen +3

    cs.CVarXiv:2604.20358v12026
  35. NitroGen: An Open Foundation Model for Generalist Gaming Agents

    Loïc Magne, Anas Awadalla, Guanzhi Wang +11

    cs.CVcs.AIcs.LGarXiv:2601.02427v12026
  36. Spatio-temporal Decoupled Knowledge Compensator for Few-Shot Action Recognition

    Hongyu Qu, Xiangbo Shu, Rui Yan +3

    cs.CVarXiv:2602.18043v12026
  37. VisualAD: Language-Free Zero-Shot Anomaly Detection via Vision Transformer

    Yanning Hou, Peiyuan Li, Zirui Liu +4

    cs.CVarXiv:2603.07952v12026
  38. Debiasing Vision-Language Models via Biased Prompts

    Ching-Yao Chuang, Varun Jampani, Yuanzhen Li +2

    cs.LGcs.CVarXiv:2302.00070v22023
  39. A Comprehensive Review of Computer Vision in Sports: Open Issues, Future Trends and Research Directions

    Banoth Thulasya Naik, Mohammad Farukh Hashmi, Neeraj Dhanraj Bokde

    cs.CVeess.IVarXiv:2203.02281v22022
  40. Semantic Relationships Guided Representation Learning for Facial Action Unit Recognition

    Guanbin Li, Xin Zhu, Yirui Zeng +2

    cs.CVarXiv:1904.09939v12019
  41. Asymmetric Phase Coding Video Watermarking

    Guang Yang, Fengchen Liu

    cs.CRcs.CVcs.GRarXiv:2608.29212v12026
  42. Sketch2Inspire: Structure-Sensitive Evaluation for Product Retrieval

    Ge Kong

    cs.CVarXiv:2608.29364v12026
  43. Video Object Segmentation and Tracking: A Survey

    Rui Yao, Guosheng Lin, Shixiong Xia +2

    cs.CVarXiv:1904.09172v32019
  44. Beyond Triplet Loss: Person Re-identification with Fine-grained Difference-aware Pairwise Loss

    Cheng Yan, Guansong Pang, Xiao Bai +2

    cs.CVcs.IRarXiv:2009.10295v12020
  45. Does Latent Planning Survive Point Clouds? Action-Conditioned JEPA World Models for Geometric Observations

    Fabio F. Oberweger, Michael Schwingshackl

    cs.LGcs.AIcs.CVarXiv:2608.29434v12026
  46. VideoAuto-R1: Video Auto Reasoning via Thinking Once, Answering Twice

    Shuming Liu, Mingchen Zhuge, Changsheng Zhao +20

    cs.CVarXiv:2601.05175v22026
  47. InfiniteWeb: Scalable Web Environment Synthesis for GUI Agent Training

    Ziyun Zhang, Zezhou Wang, Xiaoyi Zhang +4

    cs.CLcs.AIcs.CVarXiv:2601.04126v32026
  48. Predicting Driver Attention in Critical Situations

    Ye Xia, Danqing Zhang, Jinkyu Kim +3

    cs.CVarXiv:1711.06406v32017
  49. Cascaded Deep Video Deblurring Using Temporal Sharpness Prior

    Jinshan Pan, Haoran Bai, Jinhui Tang

    cs.CVarXiv:2004.02501v12020
  50. $AutoDrive\text{-}P^3$: Unified Chain of Perception-Prediction-Planning Thought via Reinforcement Fine-Tuning

    Yuqi Ye, Zijian Zhang, Junhong Lin +3

    cs.ROcs.CVarXiv:2603.28116v12026
  51. YOLOv1 to YOLOv10: The fastest and most accurate real-time object detection systems

    Chien-Yao Wang, Hong-Yuan Mark Liao

    cs.CVarXiv:2408.09332v12024
  52. Learning from Scarce Labels: Multi-View Echocardiography for Ejection Fraction Prediction

    Zhiyuan Gao, Dominic Yurk, Yaser S. Abu-Mostafa

    eess.IVcs.CVcs.LGarXiv:2609.02969v12026
  53. PolyBuild: An End-to-End Method for Polygonal Building Contour Extraction from High-Resolution Remote Sensing Images

    Yaoteng Zhang, Julin Zhang, Guangshuai Wang +4

    cs.CVcs.AIarXiv:2606.08920v12026
  54. mustGAN: Multi-Stream Generative Adversarial Networks for MR Image Synthesis

    Mahmut Yurt, Salman Ul Hassan Dar, Aykut Erdem +2

    eess.IVcs.CVarXiv:1909.11504v12019
  55. FoV-NeRF: Foveated Neural Radiance Fields for Virtual Reality

    Nianchen Deng, Zhenyi He, Jiannan Ye +4

    cs.GRcs.CVarXiv:2103.16365v22021
  56. MM-DeepResearch: A Simple and Effective Multimodal Agentic Search Baseline

    Huanjin Yao, Qixiang Yin, Min Yang +5

    cs.CVcs.AIarXiv:2603.01050v12026
  57. FairReL: Deepfake Detection using Fairness-Aware Representation Learning

    Xiaoman Lu, Jiaqi Li, Shuntian Zheng +2

    cs.CVarXiv:2608.28777v12026
  58. Building Damage Detection in Satellite Imagery Using Convolutional Neural Networks

    Joseph Z. Xu, Wenhan Lu, Zebo Li +2

    cs.CVcs.LGeess.IVarXiv:1910.06444v12019
  59. Artificial Intelligence Assistance Significantly Improves Gleason Grading of Prostate Biopsies by Pathologists

    Wouter Bulten, Maschenka Balkenhol, Jean-Joël Awoumou Belinga +17

    eess.IVcs.CVq-bio.QMarXiv:2002.04500v12020
  60. Dual-stream Spatio-Temporal GCN-Transformer Network for 3D Human Pose Estimation

    Jiawen Duan, Jian Xiang, Zhiqiang Li +2

    cs.CVarXiv:2604.17688v12026