Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
16,321 to 16,380 of 18,866
Dual-stream Multiple Instance Learning Network for Whole Slide Image Classification with Self-supervised Contrastive Learning
Bin Li, Yin Li, Kevin W. Eliceiri
cs.CVcs.LGarXiv:2011.08939v32020Mask Scoring R-CNN
Zhaojin Huang, Lichao Huang, Yongchao Gong +2
cs.CVarXiv:1903.00241v12019Stream3Dv2: Geometric-Semantic Fusion Enhanced Streaming Zero-Shot 3D Scene Understanding
Jie Xu, Na Zhao
cs.CVarXiv:2608.21136v12026Agent Banana: High-Fidelity Image Editing with Agentic Thinking and Tooling
Ruijie Ye, Jiayi Zhang, Zhuoxin Liu +10
cs.CVarXiv:2602.09084v22026VT-MUSE: Multimodal Unified Sequential Visuotactile Representation Learning for Manipulation
Congsheng Xu, Qiaochu Yang, Fangyuan Shi +7
cs.ROcs.CVarXiv:2608.21290v12026VGGRPO: Towards World-Consistent Video Generation with 4D Latent Reward
Zhaochong An, Orest Kupyn, Théo Uscidda +5
cs.CVarXiv:2603.26599v22026GANSpace: Discovering Interpretable GAN Controls
Erik Härkönen, Aaron Hertzmann, Jaakko Lehtinen +1
cs.CVcs.GRarXiv:2004.02546v32020Relation-Shape Convolutional Neural Network for Point Cloud Analysis
Yongcheng Liu, Bin Fan, Shiming Xiang +1
cs.CVcs.AIcs.CGarXiv:1904.07601v32019Diversity-Preserved Distribution Matching Distillation for Fast Visual Synthesis
Tianhe Wu, Ruibin Li, Lei Zhang +1
cs.CVarXiv:2602.03139v22026When Adaptation Hurts: Connecting Representational Drift to OOD Failures in MedSAM Fine-Tuning
Marko Haralović, Sounic Akkaraju, Carlo Baretta +2
cs.CVarXiv:2608.21300v12026VLANeXt: Recipes for Building Strong VLA Models
Xiao-Ming Wu, Bin Fan, Kang Liao +6
cs.CVcs.AIcs.ROarXiv:2602.18532v22026fastai: A Layered API for Deep Learning
Jeremy Howard, Sylvain Gugger
cs.LGcs.CVcs.NEarXiv:2002.04688v22020EffectErase: Joint Video Object Removal and Insertion for High-Quality Effect Erasing
Yang Fu, Yike Zheng, Ziyun Dai +1
cs.CVarXiv:2603.19224v12026Kinema4D: Kinematic 4D World Modeling for Spatiotemporal Embodied Simulation
Mutian Xu, Tianbao Zhang, Tianqi Liu +3
cs.ROcs.CVarXiv:2603.16669v12026On Detecting Adversarial Perturbations
Jan Hendrik Metzen, Tim Genewein, Volker Fischer +1
stat.MLcs.AIcs.CVarXiv:1702.04267v22017DenseGRPO: From Sparse to Dense Reward for Flow Matching Model Alignment
Haoyou Deng, Keyu Yan, Chaojie Mao +4
cs.CVarXiv:2601.20218v22026Single Path One-Shot Neural Architecture Search with Uniform Sampling
Zichao Guo, Xiangyu Zhang, Haoyuan Mu +4
cs.CVarXiv:1904.00420v42019Drive-JEPA: Video JEPA Meets Multimodal Trajectory Distillation for End-to-End Driving
Linhan Wang, Zichong Yang, Chen Bai +6
cs.CVarXiv:2601.22032v22026Difficulty-Calibrated Interpolation Paths for Conditional Flow Matching
Airin Akter Tania, Md Raihan Khan
cs.CVarXiv:2608.21286v12026MMDeepResearch-Bench: A Benchmark for Multimodal Deep Research Agents
Peizhou Huang, Zixuan Zhong, Zhongwei Wan +12
cs.CVarXiv:2601.12346v12026Retinex-inspired Unrolling with Cooperative Prior Architecture Search for Low-light Image Enhancement
Risheng Liu, Long Ma, Jiaao Zhang +2
cs.CVarXiv:2012.05609v12020MONAI: An open-source framework for deep learning in healthcare
M. Jorge Cardoso, Wenqi Li, Richard Brown +54
cs.LGcs.AIcs.CVarXiv:2211.02701v12022Identity-Preserving Text-to-Video Generation via Agentic Enhancement and Semantic Repair
Jiayi Gao, Changcheng Hua, Jiaqi Tang +2
cs.CVarXiv:2608.20749v12026On Evaluation of Embodied Navigation Agents
Peter Anderson, Angel Chang, Devendra Singh Chaplot +8
cs.AIcs.CVcs.LGarXiv:1807.06757v12018Vision-DeepResearch Benchmark: Rethinking Visual and Textual Search for Multimodal Large Language Models
Yu Zeng, Wenxuan Huang, Zhen Fang +14
cs.CVcs.AIcs.CLarXiv:2602.02185v22026Neural Scene Flow Fields for Space-Time View Synthesis of Dynamic Scenes
Zhengqi Li, Simon Niklaus, Noah Snavely +1
cs.CVarXiv:2011.13084v32020MotionDiffuse: Text-Driven Human Motion Generation with Diffusion Model
Mingyuan Zhang, Zhongang Cai, Liang Pan +4
cs.CVarXiv:2208.15001v12022Multi-Scale Boosted Dehazing Network with Dense Feature Fusion
Hang Dong, Jinshan Pan, Lei Xiang +4
cs.CVarXiv:2004.13388v12020Defense against Adversarial Attacks Using High-Level Representation Guided Denoiser
Fangzhou Liao, Ming Liang, Yinpeng Dong +3
cs.CVarXiv:1712.02976v22017Masked Depth Modeling for Spatial Perception
Bin Tan, Changjiang Sun, Xiage Qin +8
cs.CVcs.ROarXiv:2601.17895v12026ViTPose: Simple Vision Transformer Baselines for Human Pose Estimation
Yufei Xu, Jing Zhang, Qiming Zhang +1
cs.CVarXiv:2204.12484v32022TransFusion: Robust LiDAR-Camera Fusion for 3D Object Detection with Transformers
Xuyang Bai, Zeyu Hu, Xinge Zhu +4
cs.CVarXiv:2203.11496v12022Implicit Geometric Regularization for Learning Shapes
Amos Gropp, Lior Yariv, Niv Haim +2
cs.LGcs.CVcs.GRarXiv:2002.10099v22020Deep Learning for Precipitation Nowcasting: A Benchmark and A New Model
Xingjian Shi, Zhihan Gao, Leonard Lausen +4
cs.CVarXiv:1706.03458v22017Omni-Scale Feature Learning for Person Re-Identification
Kaiyang Zhou, Yongxin Yang, Andrea Cavallaro +1
cs.CVarXiv:1905.00953v62019Render-of-Thought: Rendering Textual Chain-of-Thought as Images for Visual Latent Reasoning
Yifan Wang, Shiyu Li, Peiming Li +3
cs.CLcs.CVarXiv:2601.14750v42026Out of Sight but Not Out of Mind: Hybrid Memory for Dynamic Video World Models
Kaijin Chen, Dingkang Liang, Xin Zhou +4
cs.CVcs.AIarXiv:2603.25716v22026Joint 2D-3D-Semantic Data for Indoor Scene Understanding
Iro Armeni, Sasha Sax, Amir R. Zamir +1
cs.CVcs.ROarXiv:1702.01105v22017Sparse Light Field Sampling Improves Casual 3D and 4D Reconstruction
Shamus Li, Ruiming Cao, Laura Waller +2
eess.IVcs.CVarXiv:2608.20602v12026VM-UNet: Vision Mamba UNet for Medical Image Segmentation
Jiacheng Ruan, Jincheng Li, Suncheng Xiang
eess.IVcs.CVarXiv:2402.02491v22024Look, Listen and Learn
Relja Arandjelović, Andrew Zisserman
cs.CVcs.LGarXiv:1705.08168v22017Circle Loss: A Unified Perspective of Pair Similarity Optimization
Yifan Sun, Changmao Cheng, Yuhan Zhang +4
cs.CVarXiv:2002.10857v22020Multiple Object Tracking: A Literature Review
Wenhan Luo, Junliang Xing, Anton Milan +3
cs.CVarXiv:1409.7618v52014VisionTrim: Unified Vision Token Compression for Training-Free MLLM Acceleration
Hanxun Yu, Wentong Li, Xuan Qu +3
cs.CVarXiv:2601.22674v32026Unsupervised Cross-Domain Image Generation
Yaniv Taigman, Adam Polyak, Lior Wolf
cs.CVarXiv:1611.02200v12016Aristotelian Manifolds: Leveraging Platonic Perceptual Features for Backpropagation Free Rapid Concept Learning
Michael Karnes, Alper Yilmaz
cs.CVarXiv:2608.20682v12026RealWonder: Real-Time Physical Action-Conditioned Video Generation
Wei Liu, Ziyu Chen, Zizhang Li +3
cs.CVcs.AIcs.GRarXiv:2603.05449v12026Adversarial Examples for Semantic Segmentation and Object Detection
Cihang Xie, Jianyu Wang, Zhishuai Zhang +3
cs.CVarXiv:1703.08603v32017A review of deep learning in medical imaging: Imaging traits, technology trends, case studies with progress highlights, and future promises
S. Kevin Zhou, Hayit Greenspan, Christos Davatzikos +6
cs.CVeess.IVarXiv:2008.09104v22020MM-Zero: Self-Evolving Multi-Model Vision Language Models From Zero Data
Zongxia Li, Hongyang Du, Chengsong Huang +8
cs.CVcs.LGarXiv:2603.09206v12026DreamGaussian: Generative Gaussian Splatting for Efficient 3D Content Creation
Jiaxiang Tang, Jiawei Ren, Hang Zhou +2
cs.CVarXiv:2309.16653v22023EnhanceNet: Single Image Super-Resolution Through Automated Texture Synthesis
Mehdi S. M. Sajjadi, Bernhard Schölkopf, Michael Hirsch
cs.CVcs.AIstat.MLarXiv:1612.07919v22016DetectoRS: Detecting Objects with Recursive Feature Pyramid and Switchable Atrous Convolution
Siyuan Qiao, Liang-Chieh Chen, Alan Yuille
cs.CVarXiv:2006.02334v22020Anchoring Instruction Outside Mask: Exact Reference Caching for Efficient In-Context Diffusion Transformers
Yangshuai Liu, Zheming Li, Jiaao Li +4
cs.CVarXiv:2608.21229v12026STEP3-VL-10B Technical Report
Ailin Huang, Chengyuan Yao, Chunrui Han +90
cs.CVarXiv:2601.09668v22026Concurrent Spatial and Channel Squeeze & Excitation in Fully Convolutional Networks
Abhijit Guha Roy, Nassir Navab, Christian Wachinger
cs.CVarXiv:1803.02579v22018A VLM Answer Is Not an Anomaly Score: Rank Compression in Training-Free Video Anomaly Detection
Inpyo Song, Jangwon Lee
cs.CVarXiv:2608.21244v12026Efficient Autoregressive Video Diffusion with Dummy Head
Hang Guo, Zhaoyang Jia, Jiahao Li +5
cs.CVarXiv:2601.20499v12026BiFormer: Vision Transformer with Bi-Level Routing Attention
Lei Zhu, Xinjiang Wang, Zhanghan Ke +2
cs.CVarXiv:2303.08810v12023DiGS-Avatar: Single-Image Animatable 3D Human Reconstruction via UV-Space Diffusion
Jiakun Li, Li Fang, Hao Zhu +4
cs.CVarXiv:2608.20759v12026