Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

5,101 to 5,160 of 18,830

  1. Large-scale and Fine-grained Vision-language Pre-training for Enhanced CT Image Understanding

    Zhongyi Shui, Jianpeng Zhang, Weiwei Cao +8

    cs.CVarXiv:2501.14548v12025
  2. FPGA/DNN Co-Design: An Efficient Design Methodology for IoT Intelligence on the Edge

    Cong Hao, Xiaofan Zhang, Yuhong Li +5

    cs.CVarXiv:1904.04421v12019
  3. Depth-Based 3D Hand Pose Estimation: From Current Achievements to Future Goals

    Shanxin Yuan, Guillermo Garcia-Hernando, Bjorn Stenger +21

    cs.CVarXiv:1712.03917v22017
  4. Characterizing Text Branch Sensitivity in Medical Vision-Language Segmentation via Evidence Decoupling

    Ziquan Liu, Zhewei Zhu, Xuyang Shi

    cs.CVarXiv:2609.02663v12026
  5. DriveAdapter: Breaking the Coupling Barrier of Perception and Planning in End-to-End Autonomous Driving

    Xiaosong Jia, Yulu Gao, Li Chen +3

    cs.ROcs.CVarXiv:2308.00398v22023
  6. LaST-SR: Laplace-Inspired Steady-Transient Complex-Frequency Decomposition for Single Image Super-Resolution

    Linhao Li, Zhaojie Pan, Langkun Chen

    cs.CVarXiv:2609.02063v12026
  7. Uni-Sign: Toward Unified Sign Language Understanding at Scale

    Zecheng Li, Wengang Zhou, Weichao Zhao +3

    cs.CVarXiv:2501.15187v32025
  8. Towards Causal VQA: Revealing and Reducing Spurious Correlations by Invariant and Covariant Semantic Editing

    Vedika Agarwal, Rakshith Shetty, Mario Fritz

    cs.CVcs.CLcs.LGarXiv:1912.07538v32019
  9. Automatic Detection of Knee Joints and Quantification of Knee Osteoarthritis Severity using Convolutional Neural Networks

    Joseph Antony, Kevin McGuinness, Kieran Moran +1

    cs.CVarXiv:1703.09856v12017
  10. AlignSeg: Feature-Aligned Segmentation Networks

    Zilong Huang, Yunchao Wei, Xinggang Wang +3

    cs.CVeess.IVarXiv:2003.00872v22020
  11. TempoGround: State-Aware Streaming Visual Grounding with Vision-Language Models

    Leqian Ding, Junning Qiu, Manwen Yang +2

    cs.CVarXiv:2609.02359v12026
  12. MOSEv2: A More Challenging Dataset for Video Object Segmentation in Complex Scenes

    Henghui Ding, Kaining Ying, Chang Liu +5

    cs.CVarXiv:2508.05630v22025
  13. UniK3D: Universal Camera Monocular 3D Estimation

    Luigi Piccinelli, Christos Sakaridis, Mattia Segu +4

    cs.CVarXiv:2503.16591v12025
  14. AutoPresent: Designing Structured Visuals from Scratch

    Jiaxin Ge, Zora Zhiruo Wang, Xuhui Zhou +8

    cs.CVcs.CLarXiv:2501.00912v22025
  15. Grounded Reinforcement Learning for Visual Reasoning

    Gabriel Sarch, Snigdha Saha, Naitik Khandelwal +4

    cs.CVarXiv:2505.23678v32025
  16. UFPMP-Det: Toward Accurate and Efficient Object Detection on Drone Imagery

    Yecheng Huang, Jiaxin Chen, Di Huang

    cs.CVarXiv:2112.10415v22021
  17. InterMimic: Towards Universal Whole-Body Control for Physics-Based Human-Object Interactions

    Sirui Xu, Hung Yu Ling, Yu-Xiong Wang +1

    cs.CVcs.GRcs.ROarXiv:2502.20390v22025
  18. Spatial-Adaptive Network for Single Image Denoising

    Meng Chang, Qi Li, Huajun Feng +1

    eess.IVcs.CVarXiv:2001.10291v22020
  19. Dense Relation Distillation with Context-aware Aggregation for Few-Shot Object Detection

    Hanzhe Hu, Shuai Bai, Aoxue Li +2

    cs.CVarXiv:2103.17115v12021
  20. PromptHMR: Promptable Human Mesh Recovery

    Yufu Wang, Yu Sun, Priyanka Patel +3

    cs.CVarXiv:2504.06397v22025
  21. SBNet: Sparse Blocks Network for Fast Inference

    Mengye Ren, Andrei Pokrovsky, Bin Yang +1

    cs.CVarXiv:1801.02108v22018
  22. Your ViT is Secretly an Image Segmentation Model

    Tommie Kerssies, Niccolò Cavagnero, Alexander Hermans +5

    cs.CVarXiv:2503.19108v12025
  23. Connecting Image Denoising and High-Level Vision Tasks via Deep Learning

    Ding Liu, Bihan Wen, Jianbo Jiao +3

    cs.CVarXiv:1809.01826v12018
  24. Universal Actions for Enhanced Embodied Foundation Models

    Jinliang Zheng, Jianxiong Li, Dongxiu Liu +7

    cs.ROcs.AIcs.CVarXiv:2501.10105v22025
  25. PVNet: A Joint Convolutional Network of Point Cloud and Multi-View for 3D Shape Recognition

    Haoxuan You, Yifan Feng, Rongrong Ji +1

    cs.CVarXiv:1808.07659v12018
  26. SparseTT: Visual Tracking with Sparse Transformers

    Zhihong Fu, Zehua Fu, Qingjie Liu +2

    cs.CVarXiv:2205.03776v12022
  27. Regularized Fine-grained Meta Face Anti-spoofing

    Rui Shao, Xiangyuan Lan, Pong C. Yuen

    cs.CVarXiv:1911.10771v12019
  28. Airbert: In-domain Pretraining for Vision-and-Language Navigation

    Pierre-Louis Guhur, Makarand Tapaswi, Shizhe Chen +2

    cs.CVcs.AIcs.CLarXiv:2108.09105v12021
  29. InstEditSeg: Instruction-Driven Image Editing for Polyp and Skin Lesion Segmentation

    Ziquan Liu, Zhewei Zhu, Xuyang Shi

    cs.CVcs.AIarXiv:2609.02004v12026
  30. FreeTimeGS: Free Gaussian Primitives at Anytime and Anywhere for Dynamic Scene Reconstruction

    Yifan Wang, Peishan Yang, Zhen Xu +6

    cs.CVarXiv:2506.05348v22025
  31. Seaweed-7B: Cost-Effective Training of Video Generation Foundation Model

    Team Seawead, Ceyuan Yang, Zhijie Lin +52

    cs.CVcs.AIarXiv:2504.08685v22025
  32. Joint Learning of Saliency Detection and Weakly Supervised Semantic Segmentation

    Yu Zeng, Yunzhi Zhuge, Huchuan Lu +1

    cs.CVarXiv:1909.04161v12019
  33. Less is more: zero-shot learning from online textual documents with noise suppression

    Ruizhi Qiao, Lingqiao Liu, Chunhua Shen +1

    cs.CVarXiv:1604.01146v12016
  34. Easi3R: Estimating Disentangled Motion from DUSt3R Without Training

    Xingyu Chen, Yue Chen, Yuliang Xiu +2

    cs.CVarXiv:2503.24391v32025
  35. DiffuEraser: A Diffusion Model for Video Inpainting

    Xiaowen Li, Haolan Xue, Peiran Ren +1

    cs.CVarXiv:2501.10018v12025
  36. F1: A Vision-Language-Action Model Bridging Understanding and Generation to Actions

    Qi Lv, Weijie Kong, Hao Li +7

    cs.ROcs.CVarXiv:2509.06951v22025
  37. 3D Instance Segmentation via Multi-Task Metric Learning

    Jean Lahoud, Bernard Ghanem, Marc Pollefeys +1

    cs.CVarXiv:1906.08650v22019
  38. ReTrack: Evidence-Driven Dual-Stream Directional Anchor Calibration Network for Composed Video Retrieval

    Zixu Li, Yupeng Hu, Zhiwei Chen +4

    cs.CVarXiv:2604.17898v12026
  39. Image Labeling on a Network: Using Social-Network Metadata for Image Classification

    Julian McAuley, Jure Leskovec

    cs.CVcs.SIphysics.soc-pharXiv:1207.3809v12012
  40. Spot the Fake: Large Multimodal Model-Based Synthetic Image Detection with Artifact Explanation

    Siwei Wen, Junyan Ye, Peilin Feng +7

    cs.CVarXiv:2503.14905v22025
  41. Few-Shot Learning with Embedded Class Models and Shot-Free Meta Training

    Avinash Ravichandran, Rahul Bhotika, Stefano Soatto

    cs.LGcs.CVstat.MLarXiv:1905.04398v22019
  42. XVerse: Consistent Multi-Subject Control of Identity and Semantic Attributes via DiT Modulation

    Bowen Chen, Mengyi Zhao, Haomiao Sun +4

    cs.CVarXiv:2506.21416v12025
  43. Visual Planning: Let's Think Only with Images

    Yi Xu, Chengzu Li, Han Zhou +4

    cs.LGcs.AIcs.CLarXiv:2505.11409v32025
  44. Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy

    Zhi Hou, Tianyi Zhang, Yuwen Xiong +8

    cs.ROcs.CVarXiv:2503.19757v22025
  45. Implicit Latent Variable Model for Scene-Consistent Motion Forecasting

    Sergio Casas, Cole Gulino, Simon Suo +3

    cs.CVcs.LGcs.ROarXiv:2007.12036v12020
  46. PP-LCNet: A Lightweight CPU Convolutional Neural Network

    Cheng Cui, Tingquan Gao, Shengyu Wei +10

    cs.CVarXiv:2109.15099v12021
  47. Populating 3D Scenes by Learning Human-Scene Interaction

    Mohamed Hassan, Partha Ghosh, Joachim Tesch +2

    cs.CVarXiv:2012.11581v22020
  48. Exploiting Fine-grained Face Forgery Clues via Progressive Enhancement Learning

    Qiqi Gu, Shen Chen, Taiping Yao +3

    cs.CVarXiv:2112.13977v12021
  49. LEGION: Learning to Ground and Explain for Synthetic Image Detection

    Hengrui Kang, Siwei Wen, Zichen Wen +8

    cs.CVarXiv:2503.15264v12025
  50. Influence-Balanced Loss for Imbalanced Visual Classification

    Seulki Park, Jongin Lim, Younghan Jeon +1

    cs.CVcs.LGarXiv:2110.02444v12021
  51. Words or Vision: Do Vision-Language Models Have Blind Faith in Text?

    Ailin Deng, Tri Cao, Zhirui Chen +1

    cs.CVcs.AIcs.CLarXiv:2503.02199v12025
  52. Convex Sparse Spectral Clustering: Single-view to Multi-view

    Canyi Lu, Shuicheng Yan, Zhouchen Lin

    cs.CVarXiv:1511.06860v32015
  53. Dolphin: Document Image Parsing via Heterogeneous Anchor Prompting

    Hao Feng, Shu Wei, Xiang Fei +10

    cs.CVarXiv:2505.14059v12025
  54. Real-World Blind Super-Resolution via Feature Matching with Implicit High-Resolution Priors

    Chaofeng Chen, Xinyu Shi, Yipeng Qin +4

    cs.CVarXiv:2202.13142v32022
  55. Are We Ready for Service Robots? The OpenLORIS-Scene Datasets for Lifelong SLAM

    Xuesong Shi, Dongjiang Li, Pengpeng Zhao +15

    cs.ROcs.CVarXiv:1911.05603v22019
  56. Ditto: Building Digital Twins of Articulated Objects from Interaction

    Zhenyu Jiang, Cheng-Chun Hsu, Yuke Zhu

    cs.CVcs.AIcs.ROarXiv:2202.08227v32022
  57. Neural Pruning via Growing Regularization

    Huan Wang, Can Qin, Yulun Zhang +1

    cs.CVcs.AIcs.LGarXiv:2012.09243v22020
  58. Spatiotemporal Relationship Reasoning for Pedestrian Intent Prediction

    Bingbin Liu, Ehsan Adeli, Zhangjie Cao +4

    cs.CVarXiv:2002.08945v12020
  59. ArtGS: Building Interactable Replicas of Complex Articulated Objects via Gaussian Splatting

    Yu Liu, Baoxiong Jia, Ruijie Lu +3

    cs.CVcs.GRcs.LGarXiv:2502.19459v22025
  60. Efficient Neural Radiance Fields for Interactive Free-viewpoint Video

    Haotong Lin, Sida Peng, Zhen Xu +4

    cs.CVarXiv:2112.01517v32021