Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
3,841 to 3,900 of 18,855
SAM-6D: Segment Anything Model Meets Zero-Shot 6D Object Pose Estimation
Jiehong Lin, Lihua Liu, Dekun Lu +1
cs.CVarXiv:2311.15707v22023DisCo: Disentangled Control for Realistic Human Dance Generation
Tan Wang, Linjie Li, Kevin Lin +6
cs.CVcs.AIarXiv:2307.00040v32023Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation
Zaijing Li, Bing Hu, Rui Shao +5
cs.ROcs.AIcs.CVarXiv:2602.20200v22026Towards Unified INT8 Training for Convolutional Neural Network
Feng Zhu, Ruihao Gong, Fengwei Yu +5
cs.LGcs.CVarXiv:1912.12607v12019Multi-institutional Collaborations for Improving Deep Learning-based Magnetic Resonance Image Reconstruction Using Federated Learning
Pengfei Guo, Puyang Wang, Jinyuan Zhou +2
eess.IVcs.CVarXiv:2103.02148v42021Topology-aware Convolutional Neural Network for Efficient Skeleton-based Action Recognition
Kailin Xu, Fanfan Ye, Qiaoyong Zhong +1
cs.CVarXiv:2112.04178v22021Structured World Models from Human Videos
Russell Mendonca, Shikhar Bahl, Deepak Pathak
cs.ROcs.AIcs.CVarXiv:2308.10901v12023Automatic Liver Lesion Segmentation Using A Deep Convolutional Neural Network Method
Xiao Han
cs.CVarXiv:1704.07239v12017SUDS: Scalable Urban Dynamic Scenes
Haithem Turki, Jason Y. Zhang, Francesco Ferroni +1
cs.CVcs.GRcs.LGarXiv:2303.14536v12023Articraft: An Agentic System for Scalable Articulated 3D Asset Generation
Matt Zhou, Ruining Li, Xiaoyang Lyu +6
cs.CVcs.GRcs.ROarXiv:2605.15187v12026Scene Text Image Super-Resolution in the Wild
Wenjia Wang, Enze Xie, Xuebo Liu +4
cs.CVarXiv:2005.03341v32020Satellite Pose Estimation with Deep Landmark Regression and Nonlinear Pose Refinement
Bo Chen, Jiewei Cao, Alvaro Parra +1
cs.CVarXiv:1908.11542v120193D Sketch-aware Semantic Scene Completion via Semi-supervised Structure Prior
Xiaokang Chen, Kwan-Yee Lin, Chen Qian +2
cs.CVarXiv:2003.14052v12020A multi-centre polyp detection and segmentation dataset for generalisability assessment
Sharib Ali, Debesh Jha, Noha Ghatwary +12
eess.IVcs.CVcs.LGarXiv:2106.04463v32021On the Connection Between Adversarial Robustness and Saliency Map Interpretability
Christian Etmann, Sebastian Lunz, Peter Maass +1
stat.MLcs.CVcs.LGarXiv:1905.04172v12019Semantic-Spatial Discriminability Enhancement for Generalized Visual Grounding
Kaiyan Lei, Xu-Yao Zhang
cs.CVarXiv:2608.30233v12026'Skimming-Perusal' Tracking: A Framework for Real-Time and Robust Long-term Tracking
Bin Yan, Haojie Zhao, Dong Wang +2
cs.CVarXiv:1909.01840v12019Hierarchical Regression Network for Spectral Reconstruction from RGB Images
Yuzhi Zhao, Lai-Man Po, Qiong Yan +2
eess.IVcs.CVcs.LGarXiv:2005.04703v12020PointCoT: A Multi-modal Benchmark for Explicit 3D Geometric Reasoning
Dongxu Zhang, Yiding Sun, Pengcheng Li +12
cs.CVcs.AIcs.MMarXiv:2602.23945v12026A Survey of World Models for Autonomous Driving
Tuo Feng, Wenguan Wang, Yi Yang
cs.ROcs.CVarXiv:2501.11260v42025Diverse and Accurate Image Description Using a Variational Auto-Encoder with an Additive Gaussian Encoding Space
Liwei Wang, Alexander G. Schwing, Svetlana Lazebnik
cs.CVarXiv:1711.07068v12017Render-in-the-Loop: Vector Graphics Generation via Visual Self-Feedback
Guotao Liang, Zhangcheng Wang, Juncheng Hu +5
cs.CVarXiv:2604.20730v32026Taming the Power of Diffusion Models for High-Quality Virtual Try-On with Appearance Flow
Junhong Gou, Siyu Sun, Jianfu Zhang +3
cs.CVarXiv:2308.06101v12023AR-Net: Adaptive Frame Resolution for Efficient Action Recognition
Yue Meng, Chung-Ching Lin, Rameswar Panda +5
cs.CVarXiv:2007.15796v12020VAnim: Rendering-Aware Sparse State Modeling for Structure-Preserving Vector Animation
Guotao Liang, Zhangcheng Wang, Chuang Wang +6
cs.CVarXiv:2605.01517v12026TopV: Compatible Token Pruning with Inference Time Optimization for Fast and Low-Memory Multimodal Vision Language Model
Cheng Yang, Yang Sui, Jinqi Xiao +8
cs.CVcs.AIarXiv:2503.18278v22025AerialVLN: Vision-and-Language Navigation for UAVs
Shubo Liu, Hongsheng Zhang, Yuankai Qi +3
cs.CVcs.AIcs.ROarXiv:2308.06735v12023MotionAGFormer: Enhancing 3D Human Pose Estimation with a Transformer-GCNFormer Network
Soroush Mehraban, Vida Adeli, Babak Taati
cs.CVarXiv:2310.16288v12023Air-Know: Arbiter-Calibrated Knowledge-Internalizing Robust Network for Composed Image Retrieval
Zhiheng Fu, Yupeng Hu, Qianyun Yang +3
cs.CVarXiv:2604.19386v22026Differentiable Manifold Reconstruction for Point Cloud Denoising
Shitong Luo, Wei Hu
cs.CVarXiv:2007.13551v22020Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks
Jiazhao Zhang, Kunyu Wang, Shaoan Wang +6
cs.ROcs.CVarXiv:2412.06224v22024GenAgent: Scaling Text-to-Image Generation via Agentic Multimodal Reasoning
Kaixun Jiang, Yuzheng Wang, Junjie Zhou +6
cs.CVarXiv:2601.18543v22026Rolling-Unrolling LSTMs for Action Anticipation from First-Person Video
Antonino Furnari, Giovanni Maria Farinella
cs.CVarXiv:2005.02190v22020ConeSep: Cone-based Robust Noise-Unlearning Compositional Network for Composed Image Retrieval
Zixu Li, Yupeng Hu, Zhiwei Chen +3
cs.CVarXiv:2604.20358v12026NitroGen: An Open Foundation Model for Generalist Gaming Agents
Loïc Magne, Anas Awadalla, Guanzhi Wang +11
cs.CVcs.AIcs.LGarXiv:2601.02427v12026Spatio-temporal Decoupled Knowledge Compensator for Few-Shot Action Recognition
Hongyu Qu, Xiangbo Shu, Rui Yan +3
cs.CVarXiv:2602.18043v12026VisualAD: Language-Free Zero-Shot Anomaly Detection via Vision Transformer
Yanning Hou, Peiyuan Li, Zirui Liu +4
cs.CVarXiv:2603.07952v12026Debiasing Vision-Language Models via Biased Prompts
Ching-Yao Chuang, Varun Jampani, Yuanzhen Li +2
cs.LGcs.CVarXiv:2302.00070v22023A Comprehensive Review of Computer Vision in Sports: Open Issues, Future Trends and Research Directions
Banoth Thulasya Naik, Mohammad Farukh Hashmi, Neeraj Dhanraj Bokde
cs.CVeess.IVarXiv:2203.02281v22022Semantic Relationships Guided Representation Learning for Facial Action Unit Recognition
Guanbin Li, Xin Zhu, Yirui Zeng +2
cs.CVarXiv:1904.09939v12019Asymmetric Phase Coding Video Watermarking
Guang Yang, Fengchen Liu
cs.CRcs.CVcs.GRarXiv:2608.29212v12026Sketch2Inspire: Structure-Sensitive Evaluation for Product Retrieval
Ge Kong
cs.CVarXiv:2608.29364v12026Video Object Segmentation and Tracking: A Survey
Rui Yao, Guosheng Lin, Shixiong Xia +2
cs.CVarXiv:1904.09172v32019Beyond Triplet Loss: Person Re-identification with Fine-grained Difference-aware Pairwise Loss
Cheng Yan, Guansong Pang, Xiao Bai +2
cs.CVcs.IRarXiv:2009.10295v12020Does Latent Planning Survive Point Clouds? Action-Conditioned JEPA World Models for Geometric Observations
Fabio F. Oberweger, Michael Schwingshackl
cs.LGcs.AIcs.CVarXiv:2608.29434v12026VideoAuto-R1: Video Auto Reasoning via Thinking Once, Answering Twice
Shuming Liu, Mingchen Zhuge, Changsheng Zhao +20
cs.CVarXiv:2601.05175v22026InfiniteWeb: Scalable Web Environment Synthesis for GUI Agent Training
Ziyun Zhang, Zezhou Wang, Xiaoyi Zhang +4
cs.CLcs.AIcs.CVarXiv:2601.04126v32026Predicting Driver Attention in Critical Situations
Ye Xia, Danqing Zhang, Jinkyu Kim +3
cs.CVarXiv:1711.06406v32017Cascaded Deep Video Deblurring Using Temporal Sharpness Prior
Jinshan Pan, Haoran Bai, Jinhui Tang
cs.CVarXiv:2004.02501v12020$AutoDrive\text{-}P^3$: Unified Chain of Perception-Prediction-Planning Thought via Reinforcement Fine-Tuning
Yuqi Ye, Zijian Zhang, Junhong Lin +3
cs.ROcs.CVarXiv:2603.28116v12026YOLOv1 to YOLOv10: The fastest and most accurate real-time object detection systems
Chien-Yao Wang, Hong-Yuan Mark Liao
cs.CVarXiv:2408.09332v12024Learning from Scarce Labels: Multi-View Echocardiography for Ejection Fraction Prediction
Zhiyuan Gao, Dominic Yurk, Yaser S. Abu-Mostafa
eess.IVcs.CVcs.LGarXiv:2609.02969v12026PolyBuild: An End-to-End Method for Polygonal Building Contour Extraction from High-Resolution Remote Sensing Images
Yaoteng Zhang, Julin Zhang, Guangshuai Wang +4
cs.CVcs.AIarXiv:2606.08920v12026mustGAN: Multi-Stream Generative Adversarial Networks for MR Image Synthesis
Mahmut Yurt, Salman Ul Hassan Dar, Aykut Erdem +2
eess.IVcs.CVarXiv:1909.11504v12019FoV-NeRF: Foveated Neural Radiance Fields for Virtual Reality
Nianchen Deng, Zhenyi He, Jiannan Ye +4
cs.GRcs.CVarXiv:2103.16365v22021MM-DeepResearch: A Simple and Effective Multimodal Agentic Search Baseline
Huanjin Yao, Qixiang Yin, Min Yang +5
cs.CVcs.AIarXiv:2603.01050v12026FairReL: Deepfake Detection using Fairness-Aware Representation Learning
Xiaoman Lu, Jiaqi Li, Shuntian Zheng +2
cs.CVarXiv:2608.28777v12026Building Damage Detection in Satellite Imagery Using Convolutional Neural Networks
Joseph Z. Xu, Wenhan Lu, Zebo Li +2
cs.CVcs.LGeess.IVarXiv:1910.06444v12019Artificial Intelligence Assistance Significantly Improves Gleason Grading of Prostate Biopsies by Pathologists
Wouter Bulten, Maschenka Balkenhol, Jean-Joël Awoumou Belinga +17
eess.IVcs.CVq-bio.QMarXiv:2002.04500v12020Dual-stream Spatio-Temporal GCN-Transformer Network for 3D Human Pose Estimation
Jiawen Duan, Jian Xiang, Zhiqiang Li +2
cs.CVarXiv:2604.17688v12026