Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
481 to 540 of 18,830
Matryoshka Representation Learning
Aditya Kusupati, Gantavya Bhatt, Aniket Rege +8
cs.LGcs.CVarXiv:2205.13147v42022Generalized Few-Shot Object Detection without Forgetting
Zhibo Fan, Yuchen Ma, Zeming Li +1
cs.CVarXiv:2105.09491v12021ST3D: Self-training for Unsupervised Domain Adaptation on 3D Object Detection
Jihan Yang, Shaoshuai Shi, Zhe Wang +2
cs.CVcs.LGarXiv:2103.05346v22021A Self-supervised Approach for Adversarial Robustness
Muzammal Naseer, Salman Khan, Munawar Hayat +2
cs.CVarXiv:2006.04924v12020Rethinking Class-Balanced Methods for Long-Tailed Visual Recognition from a Domain Adaptation Perspective
Muhammad Abdullah Jamal, Matthew Brown, Ming-Hsuan Yang +2
cs.CVcs.LGstat.MLarXiv:2003.10780v12020Combating noisy labels by agreement: A joint training method with co-regularization
Hongxin Wei, Lei Feng, Xiangyu Chen +1
cs.CVcs.LGstat.MLarXiv:2003.02752v32020Suppressing Uncertainties for Large-Scale Facial Expression Recognition
Kai Wang, Xiaojiang Peng, Jianfei Yang +2
cs.CVarXiv:2002.10392v22020Adversarial Domain Adaptation with Domain Mixup
Minghao Xu, Jian Zhang, Bingbing Ni +4
cs.CVcs.LGarXiv:1912.01805v12019Monocular 3D Object Detection with Pseudo-LiDAR Point Cloud
Xinshuo Weng, Kris Kitani
cs.CVarXiv:1903.09847v42019Topological Map Extraction from Overhead Images
Zuoyue Li, Jan Dirk Wegner, Aurélien Lucchi
cs.CVarXiv:1812.01497v32018Pose-Guided Multi-Granularity Attention Network for Text-Based Person Search
Ya Jing, Chenyang Si, Junbo Wang +3
cs.CVarXiv:1809.08440v32018Distractor-aware Siamese Networks for Visual Object Tracking
Zheng Zhu, Qiang Wang, Bo Li +3
cs.CVarXiv:1808.06048v1201830m resolution Global Annual Burned Area Mapping based on Landsat images and Google Earth Engine
Tengfei Long, Zhaoming Zhang, Guojin He +6
cs.CVarXiv:1805.02579v12018Spatio-Temporal Graph Convolution for Skeleton Based Action Recognition
Chaolong Li, Zhen Cui, Wenming Zheng +2
cs.CVarXiv:1802.09834v12018Perceptual Generative Adversarial Networks for Small Object Detection
Jianan Li, Xiaodan Liang, Yunchao Wei +3
cs.CVarXiv:1706.05274v22017Learning Proximal Operators: Using Denoising Networks for Regularizing Inverse Imaging Problems
Tim Meinhardt, Michael Moeller, Caner Hazirbas +1
cs.CVarXiv:1704.03488v22017Monocular 3D Human Pose Estimation In The Wild Using Improved CNN Supervision
Dushyant Mehta, Helge Rhodin, Dan Casas +4
cs.CVarXiv:1611.09813v52016The Quest for Generalizable Motion Generation: Data, Model, and Evaluation
Jing Lin, Ruisi Wang, Junzhe Lu +10
cs.CVarXiv:2510.26794v22025Ming-Flash-Omni: A Sparse, Unified Architecture for Multimodal Perception and Generation
Inclusion AI, :, Bowen Ma +73
cs.CVcs.AIarXiv:2510.24821v32025Looking Outside the Window: Wide-Context Transformer for the Semantic Segmentation of High-Resolution Remote Sensing Images
Lei Ding, Dong Lin, Shaofu Lin +5
cs.CVarXiv:2106.15754v62021Video-Thinker: Sparking "Thinking with Videos" via Reinforcement Learning
Shijian Wang, Jiarui Jin, Xingjian Wang +6
cs.CVarXiv:2510.23473v12025UltraCUA: A Foundation Model for Computer Use Agents with Hybrid Action
Yuhao Yang, Zhen Yang, Zi-Yi Dou +10
cs.CVcs.CLarXiv:2510.17790v32025Fill My Mirror: Geometry-Constrained Mirror Inpainting
Ofek Basson, Shimon Vainer, Yacov Hel-Or +1
cs.CVarXiv:2609.03740v12026Learning to Generate Diverse Dance Motions with Transformer
Jiaman Li, Yihang Yin, Hang Chu +4
cs.CVcs.GRarXiv:2008.08171v12020Multimodal ArXiv: A Dataset for Improving Scientific Comprehension of Large Vision-Language Models
Lei Li, Yuqi Wang, Runxin Xu +4
cs.CVcs.CLarXiv:2403.00231v32024SALAD: Achieve High-Sparsity Attention via Efficient Linear Attention Tuning for Video Diffusion Transformer
Tongcheng Fang, Hanling Zhang, Ruiqi Xie +8
cs.CVarXiv:2601.16515v220263AM: 3egment Anything with Geometric Consistency in Videos
Yang-Che Sun, Cheng Sun, Chin-Yang Lin +4
cs.CVarXiv:2601.08831v52026GeoReason: Aligning Thinking And Answering In Remote Sensing Vision-Language Models Via Logical Consistency Reinforcement Learning
Wenshuai Li, Xiantai Xiang, Zixiao Wen +6
cs.CVarXiv:2601.04118v22026VINO: A Unified Visual Generator with Interleaved OmniModal Context
Junyi Chen, Tong He, Zhoujie Fu +3
cs.CVarXiv:2601.02358v22026Stronger Normalization-Free Transformers
Mingzhi Chen, Taiming Lu, Jiachen Zhu +2
cs.LGcs.AIcs.CLarXiv:2512.10938v22025SceneWeaver: All-in-One 3D Scene Synthesis with an Extensible and Self-Reflective Agent
Yandan Yang, Baoxiong Jia, Shujie Zhang +1
cs.GRcs.CVcs.LGarXiv:2509.20414v22025SQN: Weakly-Supervised Semantic Segmentation of Large-Scale 3D Point Clouds
Qingyong Hu, Bo Yang, Guangchi Fang +4
cs.CVcs.AIcs.ROarXiv:2104.04891v32021Thyme: Think Beyond Images
Yi-Fan Zhang, Xingyu Lu, Shukang Yin +17
cs.CVarXiv:2508.11630v12025OpenGAN: Open-Set Recognition via Open Data Generation
Shu Kong, Deva Ramanan
cs.CVarXiv:2104.02939v32021OmniPart: Part-Aware 3D Generation with Semantic Decoupling and Structural Cohesion
Yunhan Yang, Yufan Zhou, Yuan-Chen Guo +7
cs.CVarXiv:2507.06165v12025Multimodal Object Detection via Probabilistic Ensembling
Yi-Ting Chen, Jinghao Shi, Zelin Ye +3
cs.CVarXiv:2104.02904v32021High-Fidelity Pluralistic Image Completion with Transformers
Ziyu Wan, Jingbo Zhang, Dongdong Chen +1
cs.CVcs.GRarXiv:2103.14031v12021Joint 3D Face Reconstruction and Dense Alignment with Position Map Regression Network
Yao Feng, Fan Wu, Xiaohu Shao +2
cs.CVcs.GRarXiv:1803.07835v12018MagFace: A Universal Representation for Face Recognition and Quality Assessment
Qiang Meng, Shichao Zhao, Zhida Huang +1
cs.CVarXiv:2103.06627v42021Zero-Shot Object Detection: Learning to Simultaneously Recognize and Localize Novel Concepts
Shafin Rahman, Salman Khan, Fatih Porikli
cs.CVarXiv:1803.06049v12018Counterfactual Zero-Shot and Open-Set Visual Recognition
Zhongqi Yue, Tan Wang, Hanwang Zhang +2
cs.CVcs.AIarXiv:2103.00887v12021Discriminability objective for training descriptive captions
Ruotian Luo, Brian Price, Scott Cohen +1
cs.CVarXiv:1803.04376v22018DeepVideo-R1: Video Reinforcement Fine-Tuning via Difficulty-aware Regressive GRPO
Jinyoung Park, Jeehye Na, Jinyoung Kim +1
cs.CVcs.AIarXiv:2506.07464v52025Transformer in Transformer
Kai Han, An Xiao, Enhua Wu +3
cs.CVcs.AIarXiv:2103.00112v32021Vision Language Models are Biased
An Vo, Khai-Nguyen Nguyen, Mohammad Reza Taesiri +3
cs.LGcs.CVarXiv:2505.23941v42025Tree-CNN: A Hierarchical Deep Convolutional Neural Network for Incremental Learning
Deboleena Roy, Priyadarshini Panda, Kaushik Roy
cs.CVcs.AIeess.IVarXiv:1802.05800v32018PointCNN: Convolution On $\mathcal{X}$-Transformed Points
Yangyan Li, Rui Bu, Mingchao Sun +3
cs.CVcs.AIcs.GRarXiv:1801.07791v52018Cross-Modal Contrastive Learning for Text-to-Image Generation
Han Zhang, Jing Yu Koh, Jason Baldridge +2
cs.CVarXiv:2101.04702v52021Stacked Conditional Generative Adversarial Networks for Jointly Learning Shadow Detection and Shadow Removal
Jifeng Wang, Xiang Li, Le Hui +1
cs.CVarXiv:1712.02478v12017Dense 3D Regression for Hand Pose Estimation
Chengde Wan, Thomas Probst, Luc Van Gool +1
cs.CVarXiv:1711.08996v12017Seed1.5-VL Technical Report
Dong Guo, Faming Wu, Feida Zhu +194
cs.CVcs.AIarXiv:2505.07062v12025PackNet: Adding Multiple Tasks to a Single Network by Iterative Pruning
Arun Mallya, Svetlana Lazebnik
cs.CVarXiv:1711.05769v22017Deep Learning for Medical Anomaly Detection -- A Survey
Tharindu Fernando, Harshala Gammulle, Simon Denman +2
cs.LGcs.CVeess.IVarXiv:2012.02364v22020Causal Contextual Prediction for Learned Image Compression
Zongyu Guo, Zhizheng Zhang, Runsen Feng +1
cs.CVeess.IVarXiv:2011.09704v52020Soft Proposal Networks for Weakly Supervised Object Localization
Yi Zhu, Yanzhao Zhou, Qixiang Ye +2
cs.CVarXiv:1709.01829v12017Pixel-Level Matching for Video Object Segmentation using Convolutional Neural Networks
Jae Shin Yoon, Francois Rameau, Junsik Kim +3
cs.CVarXiv:1708.05137v12017TimeChat-Online: 80% Visual Tokens are Naturally Redundant in Streaming Videos
Linli Yao, Yicheng Li, Yuancheng Wei +11
cs.CVarXiv:2504.17343v12025Learning and Evaluating Representations for Deep One-class Classification
Kihyuk Sohn, Chun-Liang Li, Jinsung Yoon +2
cs.CVarXiv:2011.02578v22020PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding
Jang Hyun Cho, Andrea Madotto, Effrosyni Mavroudi +26
cs.CVcs.AIcs.LGarXiv:2504.13180v32025Optimization for Medical Image Segmentation: Theory and Practice when evaluating with Dice Score or Jaccard Index
Tom Eelbode, Jeroen Bertels, Maxim Berman +4
eess.IVcs.CVcs.LGarXiv:2010.13499v12020