Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
5,101 to 5,160 of 18,830
Large-scale and Fine-grained Vision-language Pre-training for Enhanced CT Image Understanding
Zhongyi Shui, Jianpeng Zhang, Weiwei Cao +8
cs.CVarXiv:2501.14548v12025FPGA/DNN Co-Design: An Efficient Design Methodology for IoT Intelligence on the Edge
Cong Hao, Xiaofan Zhang, Yuhong Li +5
cs.CVarXiv:1904.04421v12019Depth-Based 3D Hand Pose Estimation: From Current Achievements to Future Goals
Shanxin Yuan, Guillermo Garcia-Hernando, Bjorn Stenger +21
cs.CVarXiv:1712.03917v22017Characterizing Text Branch Sensitivity in Medical Vision-Language Segmentation via Evidence Decoupling
Ziquan Liu, Zhewei Zhu, Xuyang Shi
cs.CVarXiv:2609.02663v12026DriveAdapter: Breaking the Coupling Barrier of Perception and Planning in End-to-End Autonomous Driving
Xiaosong Jia, Yulu Gao, Li Chen +3
cs.ROcs.CVarXiv:2308.00398v22023LaST-SR: Laplace-Inspired Steady-Transient Complex-Frequency Decomposition for Single Image Super-Resolution
Linhao Li, Zhaojie Pan, Langkun Chen
cs.CVarXiv:2609.02063v12026Uni-Sign: Toward Unified Sign Language Understanding at Scale
Zecheng Li, Wengang Zhou, Weichao Zhao +3
cs.CVarXiv:2501.15187v32025Towards Causal VQA: Revealing and Reducing Spurious Correlations by Invariant and Covariant Semantic Editing
Vedika Agarwal, Rakshith Shetty, Mario Fritz
cs.CVcs.CLcs.LGarXiv:1912.07538v32019Automatic Detection of Knee Joints and Quantification of Knee Osteoarthritis Severity using Convolutional Neural Networks
Joseph Antony, Kevin McGuinness, Kieran Moran +1
cs.CVarXiv:1703.09856v12017AlignSeg: Feature-Aligned Segmentation Networks
Zilong Huang, Yunchao Wei, Xinggang Wang +3
cs.CVeess.IVarXiv:2003.00872v22020TempoGround: State-Aware Streaming Visual Grounding with Vision-Language Models
Leqian Ding, Junning Qiu, Manwen Yang +2
cs.CVarXiv:2609.02359v12026MOSEv2: A More Challenging Dataset for Video Object Segmentation in Complex Scenes
Henghui Ding, Kaining Ying, Chang Liu +5
cs.CVarXiv:2508.05630v22025UniK3D: Universal Camera Monocular 3D Estimation
Luigi Piccinelli, Christos Sakaridis, Mattia Segu +4
cs.CVarXiv:2503.16591v12025AutoPresent: Designing Structured Visuals from Scratch
Jiaxin Ge, Zora Zhiruo Wang, Xuhui Zhou +8
cs.CVcs.CLarXiv:2501.00912v22025Grounded Reinforcement Learning for Visual Reasoning
Gabriel Sarch, Snigdha Saha, Naitik Khandelwal +4
cs.CVarXiv:2505.23678v32025UFPMP-Det: Toward Accurate and Efficient Object Detection on Drone Imagery
Yecheng Huang, Jiaxin Chen, Di Huang
cs.CVarXiv:2112.10415v22021InterMimic: Towards Universal Whole-Body Control for Physics-Based Human-Object Interactions
Sirui Xu, Hung Yu Ling, Yu-Xiong Wang +1
cs.CVcs.GRcs.ROarXiv:2502.20390v22025Spatial-Adaptive Network for Single Image Denoising
Meng Chang, Qi Li, Huajun Feng +1
eess.IVcs.CVarXiv:2001.10291v22020Dense Relation Distillation with Context-aware Aggregation for Few-Shot Object Detection
Hanzhe Hu, Shuai Bai, Aoxue Li +2
cs.CVarXiv:2103.17115v12021PromptHMR: Promptable Human Mesh Recovery
Yufu Wang, Yu Sun, Priyanka Patel +3
cs.CVarXiv:2504.06397v22025SBNet: Sparse Blocks Network for Fast Inference
Mengye Ren, Andrei Pokrovsky, Bin Yang +1
cs.CVarXiv:1801.02108v22018Your ViT is Secretly an Image Segmentation Model
Tommie Kerssies, Niccolò Cavagnero, Alexander Hermans +5
cs.CVarXiv:2503.19108v12025Connecting Image Denoising and High-Level Vision Tasks via Deep Learning
Ding Liu, Bihan Wen, Jianbo Jiao +3
cs.CVarXiv:1809.01826v12018Universal Actions for Enhanced Embodied Foundation Models
Jinliang Zheng, Jianxiong Li, Dongxiu Liu +7
cs.ROcs.AIcs.CVarXiv:2501.10105v22025PVNet: A Joint Convolutional Network of Point Cloud and Multi-View for 3D Shape Recognition
Haoxuan You, Yifan Feng, Rongrong Ji +1
cs.CVarXiv:1808.07659v12018SparseTT: Visual Tracking with Sparse Transformers
Zhihong Fu, Zehua Fu, Qingjie Liu +2
cs.CVarXiv:2205.03776v12022Regularized Fine-grained Meta Face Anti-spoofing
Rui Shao, Xiangyuan Lan, Pong C. Yuen
cs.CVarXiv:1911.10771v12019Airbert: In-domain Pretraining for Vision-and-Language Navigation
Pierre-Louis Guhur, Makarand Tapaswi, Shizhe Chen +2
cs.CVcs.AIcs.CLarXiv:2108.09105v12021InstEditSeg: Instruction-Driven Image Editing for Polyp and Skin Lesion Segmentation
Ziquan Liu, Zhewei Zhu, Xuyang Shi
cs.CVcs.AIarXiv:2609.02004v12026FreeTimeGS: Free Gaussian Primitives at Anytime and Anywhere for Dynamic Scene Reconstruction
Yifan Wang, Peishan Yang, Zhen Xu +6
cs.CVarXiv:2506.05348v22025Seaweed-7B: Cost-Effective Training of Video Generation Foundation Model
Team Seawead, Ceyuan Yang, Zhijie Lin +52
cs.CVcs.AIarXiv:2504.08685v22025Joint Learning of Saliency Detection and Weakly Supervised Semantic Segmentation
Yu Zeng, Yunzhi Zhuge, Huchuan Lu +1
cs.CVarXiv:1909.04161v12019Less is more: zero-shot learning from online textual documents with noise suppression
Ruizhi Qiao, Lingqiao Liu, Chunhua Shen +1
cs.CVarXiv:1604.01146v12016Easi3R: Estimating Disentangled Motion from DUSt3R Without Training
Xingyu Chen, Yue Chen, Yuliang Xiu +2
cs.CVarXiv:2503.24391v32025DiffuEraser: A Diffusion Model for Video Inpainting
Xiaowen Li, Haolan Xue, Peiran Ren +1
cs.CVarXiv:2501.10018v12025F1: A Vision-Language-Action Model Bridging Understanding and Generation to Actions
Qi Lv, Weijie Kong, Hao Li +7
cs.ROcs.CVarXiv:2509.06951v220253D Instance Segmentation via Multi-Task Metric Learning
Jean Lahoud, Bernard Ghanem, Marc Pollefeys +1
cs.CVarXiv:1906.08650v22019ReTrack: Evidence-Driven Dual-Stream Directional Anchor Calibration Network for Composed Video Retrieval
Zixu Li, Yupeng Hu, Zhiwei Chen +4
cs.CVarXiv:2604.17898v12026Image Labeling on a Network: Using Social-Network Metadata for Image Classification
Julian McAuley, Jure Leskovec
cs.CVcs.SIphysics.soc-pharXiv:1207.3809v12012Spot the Fake: Large Multimodal Model-Based Synthetic Image Detection with Artifact Explanation
Siwei Wen, Junyan Ye, Peilin Feng +7
cs.CVarXiv:2503.14905v22025Few-Shot Learning with Embedded Class Models and Shot-Free Meta Training
Avinash Ravichandran, Rahul Bhotika, Stefano Soatto
cs.LGcs.CVstat.MLarXiv:1905.04398v22019XVerse: Consistent Multi-Subject Control of Identity and Semantic Attributes via DiT Modulation
Bowen Chen, Mengyi Zhao, Haomiao Sun +4
cs.CVarXiv:2506.21416v12025Visual Planning: Let's Think Only with Images
Yi Xu, Chengzu Li, Han Zhou +4
cs.LGcs.AIcs.CLarXiv:2505.11409v32025Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy
Zhi Hou, Tianyi Zhang, Yuwen Xiong +8
cs.ROcs.CVarXiv:2503.19757v22025Implicit Latent Variable Model for Scene-Consistent Motion Forecasting
Sergio Casas, Cole Gulino, Simon Suo +3
cs.CVcs.LGcs.ROarXiv:2007.12036v12020PP-LCNet: A Lightweight CPU Convolutional Neural Network
Cheng Cui, Tingquan Gao, Shengyu Wei +10
cs.CVarXiv:2109.15099v12021Populating 3D Scenes by Learning Human-Scene Interaction
Mohamed Hassan, Partha Ghosh, Joachim Tesch +2
cs.CVarXiv:2012.11581v22020Exploiting Fine-grained Face Forgery Clues via Progressive Enhancement Learning
Qiqi Gu, Shen Chen, Taiping Yao +3
cs.CVarXiv:2112.13977v12021LEGION: Learning to Ground and Explain for Synthetic Image Detection
Hengrui Kang, Siwei Wen, Zichen Wen +8
cs.CVarXiv:2503.15264v12025Influence-Balanced Loss for Imbalanced Visual Classification
Seulki Park, Jongin Lim, Younghan Jeon +1
cs.CVcs.LGarXiv:2110.02444v12021Words or Vision: Do Vision-Language Models Have Blind Faith in Text?
Ailin Deng, Tri Cao, Zhirui Chen +1
cs.CVcs.AIcs.CLarXiv:2503.02199v12025Convex Sparse Spectral Clustering: Single-view to Multi-view
Canyi Lu, Shuicheng Yan, Zhouchen Lin
cs.CVarXiv:1511.06860v32015Dolphin: Document Image Parsing via Heterogeneous Anchor Prompting
Hao Feng, Shu Wei, Xiang Fei +10
cs.CVarXiv:2505.14059v12025Real-World Blind Super-Resolution via Feature Matching with Implicit High-Resolution Priors
Chaofeng Chen, Xinyu Shi, Yipeng Qin +4
cs.CVarXiv:2202.13142v32022Are We Ready for Service Robots? The OpenLORIS-Scene Datasets for Lifelong SLAM
Xuesong Shi, Dongjiang Li, Pengpeng Zhao +15
cs.ROcs.CVarXiv:1911.05603v22019Ditto: Building Digital Twins of Articulated Objects from Interaction
Zhenyu Jiang, Cheng-Chun Hsu, Yuke Zhu
cs.CVcs.AIcs.ROarXiv:2202.08227v32022Neural Pruning via Growing Regularization
Huan Wang, Can Qin, Yulun Zhang +1
cs.CVcs.AIcs.LGarXiv:2012.09243v22020Spatiotemporal Relationship Reasoning for Pedestrian Intent Prediction
Bingbin Liu, Ehsan Adeli, Zhangjie Cao +4
cs.CVarXiv:2002.08945v12020ArtGS: Building Interactable Replicas of Complex Articulated Objects via Gaussian Splatting
Yu Liu, Baoxiong Jia, Ruijie Lu +3
cs.CVcs.GRcs.LGarXiv:2502.19459v22025Efficient Neural Radiance Fields for Interactive Free-viewpoint Video
Haotong Lin, Sida Peng, Zhen Xu +4
cs.CVarXiv:2112.01517v32021