Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

16,321 to 16,380 of 18,866

  1. Dual-stream Multiple Instance Learning Network for Whole Slide Image Classification with Self-supervised Contrastive Learning

    Bin Li, Yin Li, Kevin W. Eliceiri

    cs.CVcs.LGarXiv:2011.08939v32020
  2. Mask Scoring R-CNN

    Zhaojin Huang, Lichao Huang, Yongchao Gong +2

    cs.CVarXiv:1903.00241v12019
  3. Stream3Dv2: Geometric-Semantic Fusion Enhanced Streaming Zero-Shot 3D Scene Understanding

    Jie Xu, Na Zhao

    cs.CVarXiv:2608.21136v12026
  4. Agent Banana: High-Fidelity Image Editing with Agentic Thinking and Tooling

    Ruijie Ye, Jiayi Zhang, Zhuoxin Liu +10

    cs.CVarXiv:2602.09084v22026
  5. VT-MUSE: Multimodal Unified Sequential Visuotactile Representation Learning for Manipulation

    Congsheng Xu, Qiaochu Yang, Fangyuan Shi +7

    cs.ROcs.CVarXiv:2608.21290v12026
  6. VGGRPO: Towards World-Consistent Video Generation with 4D Latent Reward

    Zhaochong An, Orest Kupyn, Théo Uscidda +5

    cs.CVarXiv:2603.26599v22026
  7. GANSpace: Discovering Interpretable GAN Controls

    Erik Härkönen, Aaron Hertzmann, Jaakko Lehtinen +1

    cs.CVcs.GRarXiv:2004.02546v32020
  8. Relation-Shape Convolutional Neural Network for Point Cloud Analysis

    Yongcheng Liu, Bin Fan, Shiming Xiang +1

    cs.CVcs.AIcs.CGarXiv:1904.07601v32019
  9. Diversity-Preserved Distribution Matching Distillation for Fast Visual Synthesis

    Tianhe Wu, Ruibin Li, Lei Zhang +1

    cs.CVarXiv:2602.03139v22026
  10. When Adaptation Hurts: Connecting Representational Drift to OOD Failures in MedSAM Fine-Tuning

    Marko Haralović, Sounic Akkaraju, Carlo Baretta +2

    cs.CVarXiv:2608.21300v12026
  11. VLANeXt: Recipes for Building Strong VLA Models

    Xiao-Ming Wu, Bin Fan, Kang Liao +6

    cs.CVcs.AIcs.ROarXiv:2602.18532v22026
  12. fastai: A Layered API for Deep Learning

    Jeremy Howard, Sylvain Gugger

    cs.LGcs.CVcs.NEarXiv:2002.04688v22020
  13. EffectErase: Joint Video Object Removal and Insertion for High-Quality Effect Erasing

    Yang Fu, Yike Zheng, Ziyun Dai +1

    cs.CVarXiv:2603.19224v12026
  14. Kinema4D: Kinematic 4D World Modeling for Spatiotemporal Embodied Simulation

    Mutian Xu, Tianbao Zhang, Tianqi Liu +3

    cs.ROcs.CVarXiv:2603.16669v12026
  15. On Detecting Adversarial Perturbations

    Jan Hendrik Metzen, Tim Genewein, Volker Fischer +1

    stat.MLcs.AIcs.CVarXiv:1702.04267v22017
  16. DenseGRPO: From Sparse to Dense Reward for Flow Matching Model Alignment

    Haoyou Deng, Keyu Yan, Chaojie Mao +4

    cs.CVarXiv:2601.20218v22026
  17. Single Path One-Shot Neural Architecture Search with Uniform Sampling

    Zichao Guo, Xiangyu Zhang, Haoyuan Mu +4

    cs.CVarXiv:1904.00420v42019
  18. Drive-JEPA: Video JEPA Meets Multimodal Trajectory Distillation for End-to-End Driving

    Linhan Wang, Zichong Yang, Chen Bai +6

    cs.CVarXiv:2601.22032v22026
  19. Difficulty-Calibrated Interpolation Paths for Conditional Flow Matching

    Airin Akter Tania, Md Raihan Khan

    cs.CVarXiv:2608.21286v12026
  20. MMDeepResearch-Bench: A Benchmark for Multimodal Deep Research Agents

    Peizhou Huang, Zixuan Zhong, Zhongwei Wan +12

    cs.CVarXiv:2601.12346v12026
  21. Retinex-inspired Unrolling with Cooperative Prior Architecture Search for Low-light Image Enhancement

    Risheng Liu, Long Ma, Jiaao Zhang +2

    cs.CVarXiv:2012.05609v12020
  22. MONAI: An open-source framework for deep learning in healthcare

    M. Jorge Cardoso, Wenqi Li, Richard Brown +54

    cs.LGcs.AIcs.CVarXiv:2211.02701v12022
  23. Identity-Preserving Text-to-Video Generation via Agentic Enhancement and Semantic Repair

    Jiayi Gao, Changcheng Hua, Jiaqi Tang +2

    cs.CVarXiv:2608.20749v12026
  24. On Evaluation of Embodied Navigation Agents

    Peter Anderson, Angel Chang, Devendra Singh Chaplot +8

    cs.AIcs.CVcs.LGarXiv:1807.06757v12018
  25. Vision-DeepResearch Benchmark: Rethinking Visual and Textual Search for Multimodal Large Language Models

    Yu Zeng, Wenxuan Huang, Zhen Fang +14

    cs.CVcs.AIcs.CLarXiv:2602.02185v22026
  26. Neural Scene Flow Fields for Space-Time View Synthesis of Dynamic Scenes

    Zhengqi Li, Simon Niklaus, Noah Snavely +1

    cs.CVarXiv:2011.13084v32020
  27. MotionDiffuse: Text-Driven Human Motion Generation with Diffusion Model

    Mingyuan Zhang, Zhongang Cai, Liang Pan +4

    cs.CVarXiv:2208.15001v12022
  28. Multi-Scale Boosted Dehazing Network with Dense Feature Fusion

    Hang Dong, Jinshan Pan, Lei Xiang +4

    cs.CVarXiv:2004.13388v12020
  29. Defense against Adversarial Attacks Using High-Level Representation Guided Denoiser

    Fangzhou Liao, Ming Liang, Yinpeng Dong +3

    cs.CVarXiv:1712.02976v22017
  30. Masked Depth Modeling for Spatial Perception

    Bin Tan, Changjiang Sun, Xiage Qin +8

    cs.CVcs.ROarXiv:2601.17895v12026
  31. ViTPose: Simple Vision Transformer Baselines for Human Pose Estimation

    Yufei Xu, Jing Zhang, Qiming Zhang +1

    cs.CVarXiv:2204.12484v32022
  32. TransFusion: Robust LiDAR-Camera Fusion for 3D Object Detection with Transformers

    Xuyang Bai, Zeyu Hu, Xinge Zhu +4

    cs.CVarXiv:2203.11496v12022
  33. Implicit Geometric Regularization for Learning Shapes

    Amos Gropp, Lior Yariv, Niv Haim +2

    cs.LGcs.CVcs.GRarXiv:2002.10099v22020
  34. Deep Learning for Precipitation Nowcasting: A Benchmark and A New Model

    Xingjian Shi, Zhihan Gao, Leonard Lausen +4

    cs.CVarXiv:1706.03458v22017
  35. Omni-Scale Feature Learning for Person Re-Identification

    Kaiyang Zhou, Yongxin Yang, Andrea Cavallaro +1

    cs.CVarXiv:1905.00953v62019
  36. Render-of-Thought: Rendering Textual Chain-of-Thought as Images for Visual Latent Reasoning

    Yifan Wang, Shiyu Li, Peiming Li +3

    cs.CLcs.CVarXiv:2601.14750v42026
  37. Out of Sight but Not Out of Mind: Hybrid Memory for Dynamic Video World Models

    Kaijin Chen, Dingkang Liang, Xin Zhou +4

    cs.CVcs.AIarXiv:2603.25716v22026
  38. Joint 2D-3D-Semantic Data for Indoor Scene Understanding

    Iro Armeni, Sasha Sax, Amir R. Zamir +1

    cs.CVcs.ROarXiv:1702.01105v22017
  39. Sparse Light Field Sampling Improves Casual 3D and 4D Reconstruction

    Shamus Li, Ruiming Cao, Laura Waller +2

    eess.IVcs.CVarXiv:2608.20602v12026
  40. VM-UNet: Vision Mamba UNet for Medical Image Segmentation

    Jiacheng Ruan, Jincheng Li, Suncheng Xiang

    eess.IVcs.CVarXiv:2402.02491v22024
  41. Look, Listen and Learn

    Relja Arandjelović, Andrew Zisserman

    cs.CVcs.LGarXiv:1705.08168v22017
  42. Circle Loss: A Unified Perspective of Pair Similarity Optimization

    Yifan Sun, Changmao Cheng, Yuhan Zhang +4

    cs.CVarXiv:2002.10857v22020
  43. Multiple Object Tracking: A Literature Review

    Wenhan Luo, Junliang Xing, Anton Milan +3

    cs.CVarXiv:1409.7618v52014
  44. VisionTrim: Unified Vision Token Compression for Training-Free MLLM Acceleration

    Hanxun Yu, Wentong Li, Xuan Qu +3

    cs.CVarXiv:2601.22674v32026
  45. Unsupervised Cross-Domain Image Generation

    Yaniv Taigman, Adam Polyak, Lior Wolf

    cs.CVarXiv:1611.02200v12016
  46. Aristotelian Manifolds: Leveraging Platonic Perceptual Features for Backpropagation Free Rapid Concept Learning

    Michael Karnes, Alper Yilmaz

    cs.CVarXiv:2608.20682v12026
  47. RealWonder: Real-Time Physical Action-Conditioned Video Generation

    Wei Liu, Ziyu Chen, Zizhang Li +3

    cs.CVcs.AIcs.GRarXiv:2603.05449v12026
  48. Adversarial Examples for Semantic Segmentation and Object Detection

    Cihang Xie, Jianyu Wang, Zhishuai Zhang +3

    cs.CVarXiv:1703.08603v32017
  49. A review of deep learning in medical imaging: Imaging traits, technology trends, case studies with progress highlights, and future promises

    S. Kevin Zhou, Hayit Greenspan, Christos Davatzikos +6

    cs.CVeess.IVarXiv:2008.09104v22020
  50. MM-Zero: Self-Evolving Multi-Model Vision Language Models From Zero Data

    Zongxia Li, Hongyang Du, Chengsong Huang +8

    cs.CVcs.LGarXiv:2603.09206v12026
  51. DreamGaussian: Generative Gaussian Splatting for Efficient 3D Content Creation

    Jiaxiang Tang, Jiawei Ren, Hang Zhou +2

    cs.CVarXiv:2309.16653v22023
  52. EnhanceNet: Single Image Super-Resolution Through Automated Texture Synthesis

    Mehdi S. M. Sajjadi, Bernhard Schölkopf, Michael Hirsch

    cs.CVcs.AIstat.MLarXiv:1612.07919v22016
  53. DetectoRS: Detecting Objects with Recursive Feature Pyramid and Switchable Atrous Convolution

    Siyuan Qiao, Liang-Chieh Chen, Alan Yuille

    cs.CVarXiv:2006.02334v22020
  54. Anchoring Instruction Outside Mask: Exact Reference Caching for Efficient In-Context Diffusion Transformers

    Yangshuai Liu, Zheming Li, Jiaao Li +4

    cs.CVarXiv:2608.21229v12026
  55. STEP3-VL-10B Technical Report

    Ailin Huang, Chengyuan Yao, Chunrui Han +90

    cs.CVarXiv:2601.09668v22026
  56. Concurrent Spatial and Channel Squeeze & Excitation in Fully Convolutional Networks

    Abhijit Guha Roy, Nassir Navab, Christian Wachinger

    cs.CVarXiv:1803.02579v22018
  57. A VLM Answer Is Not an Anomaly Score: Rank Compression in Training-Free Video Anomaly Detection

    Inpyo Song, Jangwon Lee

    cs.CVarXiv:2608.21244v12026
  58. Efficient Autoregressive Video Diffusion with Dummy Head

    Hang Guo, Zhaoyang Jia, Jiahao Li +5

    cs.CVarXiv:2601.20499v12026
  59. BiFormer: Vision Transformer with Bi-Level Routing Attention

    Lei Zhu, Xinjiang Wang, Zhanghan Ke +2

    cs.CVarXiv:2303.08810v12023
  60. DiGS-Avatar: Single-Image Animatable 3D Human Reconstruction via UV-Space Diffusion

    Jiakun Li, Li Fang, Hao Zhu +4

    cs.CVarXiv:2608.20759v12026