Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
15,661 to 15,720 of 18,855
LoST: Level of Semantics Tokenization for 3D Shapes
Niladri Shekhar Dutt, Zifan Shi, Paul Guerrero +4
cs.CVcs.GRcs.LGarXiv:2603.17995v12026CogVLM: Visual Expert for Pretrained Language Models
Weihan Wang, Qingsong Lv, Wenmeng Yu +13
cs.CVarXiv:2311.03079v22023SOLO: Segmenting Objects by Locations
Xinlong Wang, Tao Kong, Chunhua Shen +2
cs.CVarXiv:1912.04488v32019Spanning the Visual Analogy Space with a Weight Basis of LoRAs
Hila Manor, Rinon Gal, Haggai Maron +2
cs.CVcs.AIcs.GRarXiv:2602.15727v22026Aligning Large Multimodal Models with Factually Augmented RLHF
Zhiqing Sun, Sheng Shen, Shengcao Cao +9
cs.CVcs.CLarXiv:2309.14525v12023VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs
Zesen Cheng, Sicong Leng, Hang Zhang +8
cs.CVcs.CLarXiv:2406.07476v32024DyaDiT: A Multi-Modal Diffusion Transformer for Socially Favorable Dyadic Gesture Generation
Yichen Peng, Jyun-Ting Song, Siyeol Jung +7
cs.CVarXiv:2602.23165v22026Weakly Supervised Deep Detection Networks
Hakan Bilen, Andrea Vedaldi
cs.CVarXiv:1511.02853v42015Segment Anything Model for Medical Image Analysis: an Experimental Study
Maciej A. Mazurowski, Haoyu Dong, Hanxue Gu +3
cs.CVcs.AIcs.LGarXiv:2304.10517v32023LGM: Large Multi-View Gaussian Model for High-Resolution 3D Content Creation
Jiaxiang Tang, Zhaoxi Chen, Xiaokang Chen +3
cs.CVarXiv:2402.05054v12024Contrastive Clustering
Yunfan Li, Peng Hu, Zitao Liu +3
cs.LGcs.CVstat.MLarXiv:2009.09687v12020Future Optical Flow Prediction Improves Robot Control & Video Generation
Kanchana Ranasinghe, Honglu Zhou, Yu Fang +7
cs.CVarXiv:2601.10781v12026Joint Optic Disc and Cup Segmentation Based on Multi-label Deep Network and Polar Transformation
Huazhu Fu, Jun Cheng, Yanwu Xu +3
cs.CVarXiv:1801.00926v32018VideoLoom: A Video Large Language Model for Joint Spatial-Temporal Understanding
Jiapeng Shi, Junke Wang, Zuyao You +2
cs.CVarXiv:2601.07290v12026SeeThrough3D: Occlusion Aware 3D Control in Text-to-Image Generation
Vaibhav Agrawal, Rishubh Parihar, Pradhaan Bhat +2
cs.CVcs.AIarXiv:2602.23359v12026DreamWorld: Unified World Modeling in Video Generation
Boming Tan, Xiangdong Zhang, Ning Liao +5
cs.CVarXiv:2603.00466v12026Toward Sub-1 kB Identity-Preserving Face Compression: A Benchmark of Codecs, a Custom Learned Codec, and Studies of Resolution, Demographic Fairness, Recompression, and Adversarial Robustness
Petr Hurtik, Jakub Sochor
cs.CVarXiv:2608.22866v12026WildActor: Unconstrained Identity-Preserving Video Generation
Qin Guo, Tianyu Yang, Xuanhua He +5
cs.CVarXiv:2603.00586v22026VGGT-Det: Mining VGGT Internal Priors for Sensor-Geometry-Free Multi-View Indoor 3D Object Detection
Yang Cao, Feize Wu, Dave Zhenyu Chen +3
cs.CVarXiv:2603.00912v12026CoDance: An Unbind-Rebind Paradigm for Robust Multi-Subject Animation
Shuai Tan, Biao Gong, Ke Ma +5
cs.CVarXiv:2601.11096v12026Adversarial Diffusion Distillation
Axel Sauer, Dominik Lorenz, Andreas Blattmann +1
cs.CVarXiv:2311.17042v12023SVD-Based Typicality Maps for Out-of-Distribution Detection in Vision Transformers
Aldo Sean Sartor, Leandro de Souza Rosa, Andriy Enttsel +2
cs.CVarXiv:2608.23499v12026Dense Contrastive Learning for Self-Supervised Visual Pre-Training
Xinlong Wang, Rufeng Zhang, Chunhua Shen +2
cs.CVarXiv:2011.09157v22020Road Damage Detection Using Deep Neural Networks with Images Captured Through a Smartphone
Hiroya Maeda, Yoshihide Sekimoto, Toshikazu Seto +2
cs.CVcs.CYarXiv:1801.09454v22018Penguin-VL: Exploring the Efficiency Limits of VLM with LLM-based Vision Encoders
Boqiang Zhang, Lei Ke, Ruihan Yang +5
cs.CVarXiv:2603.06569v22026Object-Uni: A Unified Model for Object-Centric Spatial Understanding and Controllable Generation
Mining Tan, Yinuo Wang, Ziqi Zhou +6
cs.CVcs.AIarXiv:2608.22757v12026Synthetic Data Augmentation using GAN for Improved Liver Lesion Classification
Maayan Frid-Adar, Eyal Klang, Michal Amitai +2
cs.CVarXiv:1801.02385v12018Attention Bottlenecks for Multimodal Fusion
Arsha Nagrani, Shan Yang, Anurag Arnab +3
cs.CVarXiv:2107.00135v32021Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models
Jinlong Li, Liyuan Jiang, Haonan Zhang +1
cs.CVarXiv:2603.01400v22026Cryo-Bench: Benchmarking Foundation Models for Cryosphere Applications
Saurabh Kaushik, Lalit Maurya, Beth Tellman +1
cs.CVarXiv:2603.01576v32026CubeComposer: Spatio-Temporal Autoregressive 4K 360° Video Generation from Perspective Video
Lingen Li, Guangzhi Wang, Xiaoyu Li +5
cs.CVcs.AIarXiv:2603.04291v12026Toward a Foundation Plug-and-Play Prior for Computed Tomography Reconstruction via a Multimodal Diffusion Model
Haley Duba-Sullivan, Patxi Fernandez-Zelaia, Obaidullah Rahman +1
cs.CVarXiv:2608.23190v12026Joint Discriminative and Generative Learning for Person Re-identification
Zhedong Zheng, Xiaodong Yang, Zhiding Yu +3
cs.CVarXiv:1904.07223v32019Diffusion Model Alignment Using Direct Preference Optimization
Bram Wallace, Meihua Dang, Rafael Rafailov +7
cs.CVcs.AIcs.GRarXiv:2311.12908v12023NoLan: Mitigating Object Hallucinations in Large Vision-Language Models via Dynamic Suppression of Language Priors
Lingfeng Ren, Weihao Yu, Runpeng Yu +1
cs.CVcs.AIcs.CLarXiv:2602.22144v12026DenseCLIP: Language-Guided Dense Prediction with Context-Aware Prompting
Yongming Rao, Wenliang Zhao, Guangyi Chen +5
cs.CVcs.AIcs.LGarXiv:2112.01518v22021PadChest: A large chest x-ray image dataset with multi-label annotated reports
Aurelia Bustos, Antonio Pertusa, Jose-Maria Salinas +1
eess.IVcs.CVarXiv:1901.07441v22019An end-to-end-trained vision-language model for native-language prostate pathology report generation
Christian Grashei, Fabian Gülhan, Maximilian Legnar +4
cs.CVarXiv:2608.23143v12026Synthetic Visual Genome 2: Extracting Large-scale Spatio-Temporal Scene Graphs from Videos
Ziqi Gao, Jieyu Zhang, Wisdom Oluchi Ikezogwo +10
cs.CVarXiv:2602.23543v32026CAST: Modeling Visual State Transitions for Consistent Video Retrieval
Yanqing Liu, Yingcheng Liu, Fanghong Dong +3
cs.CVarXiv:2603.08648v12026ViperGPT: Visual Inference via Python Execution for Reasoning
Dídac Surís, Sachit Menon, Carl Vondrick
cs.CVarXiv:2303.08128v12023HyperNet: Towards Accurate Region Proposal Generation and Joint Object Detection
Tao Kong, Anbang Yao, Yurong Chen +1
cs.CVarXiv:1604.00600v12016Geometric Loss Functions for Camera Pose Regression with Deep Learning
Alex Kendall, Roberto Cipolla
cs.CVarXiv:1704.00390v22017Video Generation Models as World Models: Efficient Paradigms, Architectures and Algorithms
Muyang He, Hanzhong Guo, Junxiong Lin +1
eess.IVcs.CVarXiv:2603.28489v32026Multi-level Wavelet-CNN for Image Restoration
Pengju Liu, Hongzhi Zhang, Kai Zhang +2
cs.CVarXiv:1805.07071v22018Conditional Positional Encodings for Vision Transformers
Xiangxiang Chu, Zhi Tian, Bo Zhang +2
cs.CVcs.AIcs.LGarXiv:2102.10882v32021VLM-SubtleBench: How Far Are VLMs from Human-Level Subtle Comparative Reasoning?
Minkyu Kim, Sangheon Lee, Dongmin Park
cs.CVcs.AIcs.LGarXiv:2603.07888v12026SlowBA: An efficiency backdoor attack towards VLM-based GUI agents
Junxian Li, Tu Lan, Haozhen Tan +2
cs.CRcs.CLcs.CVarXiv:2603.08316v32026SVG-EAR: Parameter-Free Linear Compensation for Sparse Video Generation via Error-aware Routing
Xuanyi Zhou, Qiuyang Mang, Shuo Yang +7
cs.CVarXiv:2603.08982v22026Online Tracking by Learning Discriminative Saliency Map with Convolutional Neural Network
Seunghoon Hong, Tackgeun You, Suha Kwak +1
cs.CVarXiv:1502.06796v12015On Distillation of Guided Diffusion Models
Chenlin Meng, Robin Rombach, Ruiqi Gao +4
cs.CVcs.AIcs.LGarXiv:2210.03142v32022Just-in-Time: Training-Free Spatial Acceleration for Diffusion Transformers
Wenhao Sun, Ji Li, Zhaoqiang Liu
cs.CVarXiv:2603.10744v22026PointContrast: Unsupervised Pre-training for 3D Point Cloud Understanding
Saining Xie, Jiatao Gu, Demi Guo +3
cs.CVarXiv:2007.10985v32020Interpretable Convolutional Neural Networks
Quanshi Zhang, Ying Nian Wu, Song-Chun Zhu
cs.CVarXiv:1710.00935v42017COVID-19 Image Data Collection: Prospective Predictions Are the Future
Joseph Paul Cohen, Paul Morrison, Lan Dao +3
q-bio.QMcs.CVcs.LGarXiv:2006.11988v32020Accelerating Very Deep Convolutional Networks for Classification and Detection
Xiangyu Zhang, Jianhua Zou, Kaiming He +1
cs.CVcs.LGcs.NEarXiv:1505.06798v22015Spatial-TTT: Streaming Visual-based Spatial Intelligence with Test-Time Training
Fangfu Liu, Diankun Wu, Jiawei Chi +7
cs.CVcs.LGarXiv:2603.12255v12026MultiPath: Multiple Probabilistic Anchor Trajectory Hypotheses for Behavior Prediction
Yuning Chai, Benjamin Sapp, Mayank Bansal +1
cs.LGcs.CVcs.ROarXiv:1910.05449v12019Why Steering Works: Toward a Unified View of Language Model Parameter Dynamics
Ziwen Xu, Chenyan Wu, Hengyu Sun +9
cs.CLcs.AIcs.CVarXiv:2602.02343v32026MedSAM-Agent: Empowering Interactive Medical Image Segmentation with Multi-turn Agentic Reinforcement Learning
Shengyuan Liu, Liuxin Bao, Qi Yang +6
cs.CVcs.AIarXiv:2602.03320v12026