Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

15,661 to 15,720 of 18,855

  1. LoST: Level of Semantics Tokenization for 3D Shapes

    Niladri Shekhar Dutt, Zifan Shi, Paul Guerrero +4

    cs.CVcs.GRcs.LGarXiv:2603.17995v12026
  2. CogVLM: Visual Expert for Pretrained Language Models

    Weihan Wang, Qingsong Lv, Wenmeng Yu +13

    cs.CVarXiv:2311.03079v22023
  3. SOLO: Segmenting Objects by Locations

    Xinlong Wang, Tao Kong, Chunhua Shen +2

    cs.CVarXiv:1912.04488v32019
  4. Spanning the Visual Analogy Space with a Weight Basis of LoRAs

    Hila Manor, Rinon Gal, Haggai Maron +2

    cs.CVcs.AIcs.GRarXiv:2602.15727v22026
  5. Aligning Large Multimodal Models with Factually Augmented RLHF

    Zhiqing Sun, Sheng Shen, Shengcao Cao +9

    cs.CVcs.CLarXiv:2309.14525v12023
  6. VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs

    Zesen Cheng, Sicong Leng, Hang Zhang +8

    cs.CVcs.CLarXiv:2406.07476v32024
  7. DyaDiT: A Multi-Modal Diffusion Transformer for Socially Favorable Dyadic Gesture Generation

    Yichen Peng, Jyun-Ting Song, Siyeol Jung +7

    cs.CVarXiv:2602.23165v22026
  8. Weakly Supervised Deep Detection Networks

    Hakan Bilen, Andrea Vedaldi

    cs.CVarXiv:1511.02853v42015
  9. Segment Anything Model for Medical Image Analysis: an Experimental Study

    Maciej A. Mazurowski, Haoyu Dong, Hanxue Gu +3

    cs.CVcs.AIcs.LGarXiv:2304.10517v32023
  10. LGM: Large Multi-View Gaussian Model for High-Resolution 3D Content Creation

    Jiaxiang Tang, Zhaoxi Chen, Xiaokang Chen +3

    cs.CVarXiv:2402.05054v12024
  11. Contrastive Clustering

    Yunfan Li, Peng Hu, Zitao Liu +3

    cs.LGcs.CVstat.MLarXiv:2009.09687v12020
  12. Future Optical Flow Prediction Improves Robot Control & Video Generation

    Kanchana Ranasinghe, Honglu Zhou, Yu Fang +7

    cs.CVarXiv:2601.10781v12026
  13. Joint Optic Disc and Cup Segmentation Based on Multi-label Deep Network and Polar Transformation

    Huazhu Fu, Jun Cheng, Yanwu Xu +3

    cs.CVarXiv:1801.00926v32018
  14. VideoLoom: A Video Large Language Model for Joint Spatial-Temporal Understanding

    Jiapeng Shi, Junke Wang, Zuyao You +2

    cs.CVarXiv:2601.07290v12026
  15. SeeThrough3D: Occlusion Aware 3D Control in Text-to-Image Generation

    Vaibhav Agrawal, Rishubh Parihar, Pradhaan Bhat +2

    cs.CVcs.AIarXiv:2602.23359v12026
  16. DreamWorld: Unified World Modeling in Video Generation

    Boming Tan, Xiangdong Zhang, Ning Liao +5

    cs.CVarXiv:2603.00466v12026
  17. Toward Sub-1 kB Identity-Preserving Face Compression: A Benchmark of Codecs, a Custom Learned Codec, and Studies of Resolution, Demographic Fairness, Recompression, and Adversarial Robustness

    Petr Hurtik, Jakub Sochor

    cs.CVarXiv:2608.22866v12026
  18. WildActor: Unconstrained Identity-Preserving Video Generation

    Qin Guo, Tianyu Yang, Xuanhua He +5

    cs.CVarXiv:2603.00586v22026
  19. VGGT-Det: Mining VGGT Internal Priors for Sensor-Geometry-Free Multi-View Indoor 3D Object Detection

    Yang Cao, Feize Wu, Dave Zhenyu Chen +3

    cs.CVarXiv:2603.00912v12026
  20. CoDance: An Unbind-Rebind Paradigm for Robust Multi-Subject Animation

    Shuai Tan, Biao Gong, Ke Ma +5

    cs.CVarXiv:2601.11096v12026
  21. Adversarial Diffusion Distillation

    Axel Sauer, Dominik Lorenz, Andreas Blattmann +1

    cs.CVarXiv:2311.17042v12023
  22. SVD-Based Typicality Maps for Out-of-Distribution Detection in Vision Transformers

    Aldo Sean Sartor, Leandro de Souza Rosa, Andriy Enttsel +2

    cs.CVarXiv:2608.23499v12026
  23. Dense Contrastive Learning for Self-Supervised Visual Pre-Training

    Xinlong Wang, Rufeng Zhang, Chunhua Shen +2

    cs.CVarXiv:2011.09157v22020
  24. Road Damage Detection Using Deep Neural Networks with Images Captured Through a Smartphone

    Hiroya Maeda, Yoshihide Sekimoto, Toshikazu Seto +2

    cs.CVcs.CYarXiv:1801.09454v22018
  25. Penguin-VL: Exploring the Efficiency Limits of VLM with LLM-based Vision Encoders

    Boqiang Zhang, Lei Ke, Ruihan Yang +5

    cs.CVarXiv:2603.06569v22026
  26. Object-Uni: A Unified Model for Object-Centric Spatial Understanding and Controllable Generation

    Mining Tan, Yinuo Wang, Ziqi Zhou +6

    cs.CVcs.AIarXiv:2608.22757v12026
  27. Synthetic Data Augmentation using GAN for Improved Liver Lesion Classification

    Maayan Frid-Adar, Eyal Klang, Michal Amitai +2

    cs.CVarXiv:1801.02385v12018
  28. Attention Bottlenecks for Multimodal Fusion

    Arsha Nagrani, Shan Yang, Anurag Arnab +3

    cs.CVarXiv:2107.00135v32021
  29. Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models

    Jinlong Li, Liyuan Jiang, Haonan Zhang +1

    cs.CVarXiv:2603.01400v22026
  30. Cryo-Bench: Benchmarking Foundation Models for Cryosphere Applications

    Saurabh Kaushik, Lalit Maurya, Beth Tellman +1

    cs.CVarXiv:2603.01576v32026
  31. CubeComposer: Spatio-Temporal Autoregressive 4K 360° Video Generation from Perspective Video

    Lingen Li, Guangzhi Wang, Xiaoyu Li +5

    cs.CVcs.AIarXiv:2603.04291v12026
  32. Toward a Foundation Plug-and-Play Prior for Computed Tomography Reconstruction via a Multimodal Diffusion Model

    Haley Duba-Sullivan, Patxi Fernandez-Zelaia, Obaidullah Rahman +1

    cs.CVarXiv:2608.23190v12026
  33. Joint Discriminative and Generative Learning for Person Re-identification

    Zhedong Zheng, Xiaodong Yang, Zhiding Yu +3

    cs.CVarXiv:1904.07223v32019
  34. Diffusion Model Alignment Using Direct Preference Optimization

    Bram Wallace, Meihua Dang, Rafael Rafailov +7

    cs.CVcs.AIcs.GRarXiv:2311.12908v12023
  35. NoLan: Mitigating Object Hallucinations in Large Vision-Language Models via Dynamic Suppression of Language Priors

    Lingfeng Ren, Weihao Yu, Runpeng Yu +1

    cs.CVcs.AIcs.CLarXiv:2602.22144v12026
  36. DenseCLIP: Language-Guided Dense Prediction with Context-Aware Prompting

    Yongming Rao, Wenliang Zhao, Guangyi Chen +5

    cs.CVcs.AIcs.LGarXiv:2112.01518v22021
  37. PadChest: A large chest x-ray image dataset with multi-label annotated reports

    Aurelia Bustos, Antonio Pertusa, Jose-Maria Salinas +1

    eess.IVcs.CVarXiv:1901.07441v22019
  38. An end-to-end-trained vision-language model for native-language prostate pathology report generation

    Christian Grashei, Fabian Gülhan, Maximilian Legnar +4

    cs.CVarXiv:2608.23143v12026
  39. Synthetic Visual Genome 2: Extracting Large-scale Spatio-Temporal Scene Graphs from Videos

    Ziqi Gao, Jieyu Zhang, Wisdom Oluchi Ikezogwo +10

    cs.CVarXiv:2602.23543v32026
  40. CAST: Modeling Visual State Transitions for Consistent Video Retrieval

    Yanqing Liu, Yingcheng Liu, Fanghong Dong +3

    cs.CVarXiv:2603.08648v12026
  41. ViperGPT: Visual Inference via Python Execution for Reasoning

    Dídac Surís, Sachit Menon, Carl Vondrick

    cs.CVarXiv:2303.08128v12023
  42. HyperNet: Towards Accurate Region Proposal Generation and Joint Object Detection

    Tao Kong, Anbang Yao, Yurong Chen +1

    cs.CVarXiv:1604.00600v12016
  43. Geometric Loss Functions for Camera Pose Regression with Deep Learning

    Alex Kendall, Roberto Cipolla

    cs.CVarXiv:1704.00390v22017
  44. Video Generation Models as World Models: Efficient Paradigms, Architectures and Algorithms

    Muyang He, Hanzhong Guo, Junxiong Lin +1

    eess.IVcs.CVarXiv:2603.28489v32026
  45. Multi-level Wavelet-CNN for Image Restoration

    Pengju Liu, Hongzhi Zhang, Kai Zhang +2

    cs.CVarXiv:1805.07071v22018
  46. Conditional Positional Encodings for Vision Transformers

    Xiangxiang Chu, Zhi Tian, Bo Zhang +2

    cs.CVcs.AIcs.LGarXiv:2102.10882v32021
  47. VLM-SubtleBench: How Far Are VLMs from Human-Level Subtle Comparative Reasoning?

    Minkyu Kim, Sangheon Lee, Dongmin Park

    cs.CVcs.AIcs.LGarXiv:2603.07888v12026
  48. SlowBA: An efficiency backdoor attack towards VLM-based GUI agents

    Junxian Li, Tu Lan, Haozhen Tan +2

    cs.CRcs.CLcs.CVarXiv:2603.08316v32026
  49. SVG-EAR: Parameter-Free Linear Compensation for Sparse Video Generation via Error-aware Routing

    Xuanyi Zhou, Qiuyang Mang, Shuo Yang +7

    cs.CVarXiv:2603.08982v22026
  50. Online Tracking by Learning Discriminative Saliency Map with Convolutional Neural Network

    Seunghoon Hong, Tackgeun You, Suha Kwak +1

    cs.CVarXiv:1502.06796v12015
  51. On Distillation of Guided Diffusion Models

    Chenlin Meng, Robin Rombach, Ruiqi Gao +4

    cs.CVcs.AIcs.LGarXiv:2210.03142v32022
  52. Just-in-Time: Training-Free Spatial Acceleration for Diffusion Transformers

    Wenhao Sun, Ji Li, Zhaoqiang Liu

    cs.CVarXiv:2603.10744v22026
  53. PointContrast: Unsupervised Pre-training for 3D Point Cloud Understanding

    Saining Xie, Jiatao Gu, Demi Guo +3

    cs.CVarXiv:2007.10985v32020
  54. Interpretable Convolutional Neural Networks

    Quanshi Zhang, Ying Nian Wu, Song-Chun Zhu

    cs.CVarXiv:1710.00935v42017
  55. COVID-19 Image Data Collection: Prospective Predictions Are the Future

    Joseph Paul Cohen, Paul Morrison, Lan Dao +3

    q-bio.QMcs.CVcs.LGarXiv:2006.11988v32020
  56. Accelerating Very Deep Convolutional Networks for Classification and Detection

    Xiangyu Zhang, Jianhua Zou, Kaiming He +1

    cs.CVcs.LGcs.NEarXiv:1505.06798v22015
  57. Spatial-TTT: Streaming Visual-based Spatial Intelligence with Test-Time Training

    Fangfu Liu, Diankun Wu, Jiawei Chi +7

    cs.CVcs.LGarXiv:2603.12255v12026
  58. MultiPath: Multiple Probabilistic Anchor Trajectory Hypotheses for Behavior Prediction

    Yuning Chai, Benjamin Sapp, Mayank Bansal +1

    cs.LGcs.CVcs.ROarXiv:1910.05449v12019
  59. Why Steering Works: Toward a Unified View of Language Model Parameter Dynamics

    Ziwen Xu, Chenyan Wu, Hengyu Sun +9

    cs.CLcs.AIcs.CVarXiv:2602.02343v32026
  60. MedSAM-Agent: Empowering Interactive Medical Image Segmentation with Multi-turn Agentic Reinforcement Learning

    Shengyuan Liu, Liuxin Bao, Qi Yang +6

    cs.CVcs.AIarXiv:2602.03320v12026