Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

481 to 540 of 18,830

  1. Matryoshka Representation Learning

    Aditya Kusupati, Gantavya Bhatt, Aniket Rege +8

    cs.LGcs.CVarXiv:2205.13147v42022
  2. Generalized Few-Shot Object Detection without Forgetting

    Zhibo Fan, Yuchen Ma, Zeming Li +1

    cs.CVarXiv:2105.09491v12021
  3. ST3D: Self-training for Unsupervised Domain Adaptation on 3D Object Detection

    Jihan Yang, Shaoshuai Shi, Zhe Wang +2

    cs.CVcs.LGarXiv:2103.05346v22021
  4. A Self-supervised Approach for Adversarial Robustness

    Muzammal Naseer, Salman Khan, Munawar Hayat +2

    cs.CVarXiv:2006.04924v12020
  5. Rethinking Class-Balanced Methods for Long-Tailed Visual Recognition from a Domain Adaptation Perspective

    Muhammad Abdullah Jamal, Matthew Brown, Ming-Hsuan Yang +2

    cs.CVcs.LGstat.MLarXiv:2003.10780v12020
  6. Combating noisy labels by agreement: A joint training method with co-regularization

    Hongxin Wei, Lei Feng, Xiangyu Chen +1

    cs.CVcs.LGstat.MLarXiv:2003.02752v32020
  7. Suppressing Uncertainties for Large-Scale Facial Expression Recognition

    Kai Wang, Xiaojiang Peng, Jianfei Yang +2

    cs.CVarXiv:2002.10392v22020
  8. Adversarial Domain Adaptation with Domain Mixup

    Minghao Xu, Jian Zhang, Bingbing Ni +4

    cs.CVcs.LGarXiv:1912.01805v12019
  9. Monocular 3D Object Detection with Pseudo-LiDAR Point Cloud

    Xinshuo Weng, Kris Kitani

    cs.CVarXiv:1903.09847v42019
  10. Topological Map Extraction from Overhead Images

    Zuoyue Li, Jan Dirk Wegner, Aurélien Lucchi

    cs.CVarXiv:1812.01497v32018
  11. Pose-Guided Multi-Granularity Attention Network for Text-Based Person Search

    Ya Jing, Chenyang Si, Junbo Wang +3

    cs.CVarXiv:1809.08440v32018
  12. Distractor-aware Siamese Networks for Visual Object Tracking

    Zheng Zhu, Qiang Wang, Bo Li +3

    cs.CVarXiv:1808.06048v12018
  13. 30m resolution Global Annual Burned Area Mapping based on Landsat images and Google Earth Engine

    Tengfei Long, Zhaoming Zhang, Guojin He +6

    cs.CVarXiv:1805.02579v12018
  14. Spatio-Temporal Graph Convolution for Skeleton Based Action Recognition

    Chaolong Li, Zhen Cui, Wenming Zheng +2

    cs.CVarXiv:1802.09834v12018
  15. Perceptual Generative Adversarial Networks for Small Object Detection

    Jianan Li, Xiaodan Liang, Yunchao Wei +3

    cs.CVarXiv:1706.05274v22017
  16. Learning Proximal Operators: Using Denoising Networks for Regularizing Inverse Imaging Problems

    Tim Meinhardt, Michael Moeller, Caner Hazirbas +1

    cs.CVarXiv:1704.03488v22017
  17. Monocular 3D Human Pose Estimation In The Wild Using Improved CNN Supervision

    Dushyant Mehta, Helge Rhodin, Dan Casas +4

    cs.CVarXiv:1611.09813v52016
  18. The Quest for Generalizable Motion Generation: Data, Model, and Evaluation

    Jing Lin, Ruisi Wang, Junzhe Lu +10

    cs.CVarXiv:2510.26794v22025
  19. Ming-Flash-Omni: A Sparse, Unified Architecture for Multimodal Perception and Generation

    Inclusion AI, :, Bowen Ma +73

    cs.CVcs.AIarXiv:2510.24821v32025
  20. Looking Outside the Window: Wide-Context Transformer for the Semantic Segmentation of High-Resolution Remote Sensing Images

    Lei Ding, Dong Lin, Shaofu Lin +5

    cs.CVarXiv:2106.15754v62021
  21. Video-Thinker: Sparking "Thinking with Videos" via Reinforcement Learning

    Shijian Wang, Jiarui Jin, Xingjian Wang +6

    cs.CVarXiv:2510.23473v12025
  22. UltraCUA: A Foundation Model for Computer Use Agents with Hybrid Action

    Yuhao Yang, Zhen Yang, Zi-Yi Dou +10

    cs.CVcs.CLarXiv:2510.17790v32025
  23. Fill My Mirror: Geometry-Constrained Mirror Inpainting

    Ofek Basson, Shimon Vainer, Yacov Hel-Or +1

    cs.CVarXiv:2609.03740v12026
  24. Learning to Generate Diverse Dance Motions with Transformer

    Jiaman Li, Yihang Yin, Hang Chu +4

    cs.CVcs.GRarXiv:2008.08171v12020
  25. Multimodal ArXiv: A Dataset for Improving Scientific Comprehension of Large Vision-Language Models

    Lei Li, Yuqi Wang, Runxin Xu +4

    cs.CVcs.CLarXiv:2403.00231v32024
  26. SALAD: Achieve High-Sparsity Attention via Efficient Linear Attention Tuning for Video Diffusion Transformer

    Tongcheng Fang, Hanling Zhang, Ruiqi Xie +8

    cs.CVarXiv:2601.16515v22026
  27. 3AM: 3egment Anything with Geometric Consistency in Videos

    Yang-Che Sun, Cheng Sun, Chin-Yang Lin +4

    cs.CVarXiv:2601.08831v52026
  28. GeoReason: Aligning Thinking And Answering In Remote Sensing Vision-Language Models Via Logical Consistency Reinforcement Learning

    Wenshuai Li, Xiantai Xiang, Zixiao Wen +6

    cs.CVarXiv:2601.04118v22026
  29. VINO: A Unified Visual Generator with Interleaved OmniModal Context

    Junyi Chen, Tong He, Zhoujie Fu +3

    cs.CVarXiv:2601.02358v22026
  30. Stronger Normalization-Free Transformers

    Mingzhi Chen, Taiming Lu, Jiachen Zhu +2

    cs.LGcs.AIcs.CLarXiv:2512.10938v22025
  31. SceneWeaver: All-in-One 3D Scene Synthesis with an Extensible and Self-Reflective Agent

    Yandan Yang, Baoxiong Jia, Shujie Zhang +1

    cs.GRcs.CVcs.LGarXiv:2509.20414v22025
  32. SQN: Weakly-Supervised Semantic Segmentation of Large-Scale 3D Point Clouds

    Qingyong Hu, Bo Yang, Guangchi Fang +4

    cs.CVcs.AIcs.ROarXiv:2104.04891v32021
  33. Thyme: Think Beyond Images

    Yi-Fan Zhang, Xingyu Lu, Shukang Yin +17

    cs.CVarXiv:2508.11630v12025
  34. OpenGAN: Open-Set Recognition via Open Data Generation

    Shu Kong, Deva Ramanan

    cs.CVarXiv:2104.02939v32021
  35. OmniPart: Part-Aware 3D Generation with Semantic Decoupling and Structural Cohesion

    Yunhan Yang, Yufan Zhou, Yuan-Chen Guo +7

    cs.CVarXiv:2507.06165v12025
  36. Multimodal Object Detection via Probabilistic Ensembling

    Yi-Ting Chen, Jinghao Shi, Zelin Ye +3

    cs.CVarXiv:2104.02904v32021
  37. High-Fidelity Pluralistic Image Completion with Transformers

    Ziyu Wan, Jingbo Zhang, Dongdong Chen +1

    cs.CVcs.GRarXiv:2103.14031v12021
  38. Joint 3D Face Reconstruction and Dense Alignment with Position Map Regression Network

    Yao Feng, Fan Wu, Xiaohu Shao +2

    cs.CVcs.GRarXiv:1803.07835v12018
  39. MagFace: A Universal Representation for Face Recognition and Quality Assessment

    Qiang Meng, Shichao Zhao, Zhida Huang +1

    cs.CVarXiv:2103.06627v42021
  40. Zero-Shot Object Detection: Learning to Simultaneously Recognize and Localize Novel Concepts

    Shafin Rahman, Salman Khan, Fatih Porikli

    cs.CVarXiv:1803.06049v12018
  41. Counterfactual Zero-Shot and Open-Set Visual Recognition

    Zhongqi Yue, Tan Wang, Hanwang Zhang +2

    cs.CVcs.AIarXiv:2103.00887v12021
  42. Discriminability objective for training descriptive captions

    Ruotian Luo, Brian Price, Scott Cohen +1

    cs.CVarXiv:1803.04376v22018
  43. DeepVideo-R1: Video Reinforcement Fine-Tuning via Difficulty-aware Regressive GRPO

    Jinyoung Park, Jeehye Na, Jinyoung Kim +1

    cs.CVcs.AIarXiv:2506.07464v52025
  44. Transformer in Transformer

    Kai Han, An Xiao, Enhua Wu +3

    cs.CVcs.AIarXiv:2103.00112v32021
  45. Vision Language Models are Biased

    An Vo, Khai-Nguyen Nguyen, Mohammad Reza Taesiri +3

    cs.LGcs.CVarXiv:2505.23941v42025
  46. Tree-CNN: A Hierarchical Deep Convolutional Neural Network for Incremental Learning

    Deboleena Roy, Priyadarshini Panda, Kaushik Roy

    cs.CVcs.AIeess.IVarXiv:1802.05800v32018
  47. PointCNN: Convolution On $\mathcal{X}$-Transformed Points

    Yangyan Li, Rui Bu, Mingchao Sun +3

    cs.CVcs.AIcs.GRarXiv:1801.07791v52018
  48. Cross-Modal Contrastive Learning for Text-to-Image Generation

    Han Zhang, Jing Yu Koh, Jason Baldridge +2

    cs.CVarXiv:2101.04702v52021
  49. Stacked Conditional Generative Adversarial Networks for Jointly Learning Shadow Detection and Shadow Removal

    Jifeng Wang, Xiang Li, Le Hui +1

    cs.CVarXiv:1712.02478v12017
  50. Dense 3D Regression for Hand Pose Estimation

    Chengde Wan, Thomas Probst, Luc Van Gool +1

    cs.CVarXiv:1711.08996v12017
  51. Seed1.5-VL Technical Report

    Dong Guo, Faming Wu, Feida Zhu +194

    cs.CVcs.AIarXiv:2505.07062v12025
  52. PackNet: Adding Multiple Tasks to a Single Network by Iterative Pruning

    Arun Mallya, Svetlana Lazebnik

    cs.CVarXiv:1711.05769v22017
  53. Deep Learning for Medical Anomaly Detection -- A Survey

    Tharindu Fernando, Harshala Gammulle, Simon Denman +2

    cs.LGcs.CVeess.IVarXiv:2012.02364v22020
  54. Causal Contextual Prediction for Learned Image Compression

    Zongyu Guo, Zhizheng Zhang, Runsen Feng +1

    cs.CVeess.IVarXiv:2011.09704v52020
  55. Soft Proposal Networks for Weakly Supervised Object Localization

    Yi Zhu, Yanzhao Zhou, Qixiang Ye +2

    cs.CVarXiv:1709.01829v12017
  56. Pixel-Level Matching for Video Object Segmentation using Convolutional Neural Networks

    Jae Shin Yoon, Francois Rameau, Junsik Kim +3

    cs.CVarXiv:1708.05137v12017
  57. TimeChat-Online: 80% Visual Tokens are Naturally Redundant in Streaming Videos

    Linli Yao, Yicheng Li, Yuancheng Wei +11

    cs.CVarXiv:2504.17343v12025
  58. Learning and Evaluating Representations for Deep One-class Classification

    Kihyuk Sohn, Chun-Liang Li, Jinsung Yoon +2

    cs.CVarXiv:2011.02578v22020
  59. PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding

    Jang Hyun Cho, Andrea Madotto, Effrosyni Mavroudi +26

    cs.CVcs.AIcs.LGarXiv:2504.13180v32025
  60. Optimization for Medical Image Segmentation: Theory and Practice when evaluating with Dice Score or Jaccard Index

    Tom Eelbode, Jeroen Bertels, Maxim Berman +4

    eess.IVcs.CVcs.LGarXiv:2010.13499v12020