Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

3,721 to 3,780 of 18,855

  1. Vision Transformers Need More Than Registers

    Cheng Shi, Yizhou Yu, Sibei Yang

    cs.CVarXiv:2602.22394v22026
  2. Visual prompting reimagined: The power of the Activation Prompts

    Yihua Zhang, Hongkang Li, Yuguang Yao +5

    cs.CVcs.LGarXiv:2604.06440v12026
  3. CentripetalNet: Pursuing High-quality Keypoint Pairs for Object Detection

    Zhiwei Dong, Guoxuan Li, Yue Liao +3

    cs.CVarXiv:2003.09119v12020
  4. Multimodal Transfer: A Hierarchical Deep Convolutional Neural Network for Fast Artistic Style Transfer

    Xin Wang, Geoffrey Oxholm, Da Zhang +1

    cs.CVcs.AIarXiv:1612.01895v22016
  5. LongStream: Long-Sequence Streaming Autoregressive Visual Geometry

    Chong Cheng, Xianda Chen, Tao Xie +5

    cs.CVarXiv:2602.13172v22026
  6. Multiple Inputs and Mixwd data for Alzheimer's Disease Classification Based on 3D Vision Transformer

    Juan A. Castro-Silva, Maria N. Moreno Garcia, Diego H. Peluffo-Ordoñez

    cs.CVarXiv:2603.00545v12026
  7. How well are open sourced AI-generated image detection models out-of-the-box: A comprehensive benchmark study

    Simiao Ren, Yuchen Zhou, Xingyu Shen +9

    cs.CVcs.AIarXiv:2602.07814v12026
  8. Hand2World: Autoregressive Egocentric Interaction Generation via Free-Space Hand Gestures

    Yuxi Wang, Wenqi Ouyang, Tianyi Wei +3

    cs.CVarXiv:2602.09600v22026
  9. ClearAIR: A Human-Visual-Perception-Inspired All-in-One Image Restoration

    Xu Zhang, Huan Zhang, Guoli Wang +2

    cs.CVarXiv:2601.02763v22026
  10. Video-based Person Re-identification with Accumulative Motion Context

    Hao Liu, Zequn Jie, Karlekar Jayashree +4

    cs.CVarXiv:1701.00193v22017
  11. No-Reference Quality Assessment for 3D Colored Point Cloud and Mesh Models

    Zicheng Zhang, Wei Sun, Xiongkuo Min +3

    cs.CVcs.GReess.IVarXiv:2107.02041v62021
  12. Pyramid R-CNN: Towards Better Performance and Adaptability for 3D Object Detection

    Jiageng Mao, Minzhe Niu, Haoyue Bai +3

    cs.CVarXiv:2109.02499v12021
  13. Speech2Face: Learning the Face Behind a Voice

    Tae-Hyun Oh, Tali Dekel, Changil Kim +4

    cs.CVcs.MMarXiv:1905.09773v12019
  14. SVIT: Scaling up Visual Instruction Tuning

    Bo Zhao, Boya Wu, Muyang He +1

    cs.CVarXiv:2307.04087v32023
  15. DexMimicGen: Automated Data Generation for Bimanual Dexterous Manipulation via Imitation Learning

    Zhenyu Jiang, Yuqi Xie, Kevin Lin +5

    cs.ROcs.AIcs.CVarXiv:2410.24185v22024
  16. Neural Inverse Rendering of an Indoor Scene from a Single Image

    Soumyadip Sengupta, Jinwei Gu, Kihwan Kim +3

    cs.CVarXiv:1901.02453v32019
  17. Measuring Similarity between Artistic and AI Generated Images using Siamese Neural Networks

    Diego Castro Elvira, Navil Pineda Rugerio, Jesús García-Ramírez +2

    cs.CVcs.AIarXiv:2608.28671v12026
  18. VLABench: A Large-Scale Benchmark for Language-Conditioned Robotics Manipulation with Long-Horizon Reasoning Tasks

    Shiduo Zhang, Zhe Xu, Peiju Liu +8

    cs.ROcs.AIcs.CLarXiv:2412.18194v12024
  19. Memory-Efficient Training-Free Acceleration of Diffusion Transformers with BaryCache

    Chengjie Lu, Tianchi Deng, Zhengqi He +3

    cs.CVarXiv:2608.28670v12026
  20. 3D Dilated Multi-Fiber Network for Real-time Brain Tumor Segmentation in MRI

    Chen Chen, Xiaopeng Liu, Meng Ding +2

    cs.CVarXiv:1904.03355v52019
  21. Stochastic Variance Reduced Ensemble Adversarial Attack for Boosting the Adversarial Transferability

    Yifeng Xiong, Jiadong Lin, Min Zhang +2

    cs.LGcs.CRcs.CVarXiv:2111.10752v22021
  22. Improving Spatial-Temporal Reasoning in Video-Language Models with Structured Video Prompting

    Sadegh Mohammadian

    cs.CVarXiv:2608.28666v12026
  23. SpArSe: Sparse Architecture Search for CNNs on Resource-Constrained Microcontrollers

    Igor Fedorov, Ryan P. Adams, Matthew Mattina +1

    cs.LGcs.CVarXiv:1905.12107v12019
  24. D3TW: Discriminative Differentiable Dynamic Time Warping for Weakly Supervised Action Alignment and Segmentation

    Chien-Yi Chang, De-An Huang, Yanan Sui +2

    cs.CVarXiv:1901.02598v22019
  25. BiomedParse: a biomedical foundation model for image parsing of everything everywhere all at once

    Theodore Zhao, Yu Gu, Jianwei Yang +12

    cs.CVarXiv:2405.12971v32024
  26. Multi-branch Convolutional Neural Network for Multiple Sclerosis Lesion Segmentation

    Shahab Aslani, Michael Dayan, Loredana Storelli +4

    cs.CVarXiv:1811.02942v42018
  27. Learning Texture Manifolds with the Periodic Spatial GAN

    Urs Bergmann, Nikolay Jetchev, Roland Vollgraf

    cs.CVstat.MLarXiv:1705.06566v22017
  28. HiDrop: Hierarchical Vision Token Reduction in MLLMs via Late Injection, Concave Pyramid Pruning, and Early Exit

    Hao Wu, Yingqi Fan, Jinyang Dai +3

    cs.CVcs.CLarXiv:2602.23699v12026
  29. CONQUER: Context-Aware Representation with Query Enhancement for Text-Based Person Search

    Zequn Xie

    cs.CVarXiv:2601.18625v12026
  30. PN-Net: Conjoined Triple Deep Network for Learning Local Image Descriptors

    Vassileios Balntas, Edward Johns, Lilian Tang +1

    cs.CVarXiv:1601.05030v12016
  31. OpenRT: An Open-Source Red Teaming Framework for Multimodal LLMs

    Xin Wang, Yunhao Chen, Juncheng Li +7

    cs.CRcs.CVarXiv:2601.01592v22026
  32. Evo-Depth: A Lightweight Depth-Enhanced Vision-Language-Action Model

    Tao Lin, Yuxin Du, Jiting Liu +14

    cs.CVcs.ROarXiv:2605.14950v12026
  33. Sharpness-Aware Gradient Matching for Domain Generalization

    Pengfei Wang, Zhaoxiang Zhang, Zhen Lei +1

    cs.CVarXiv:2303.10353v12023
  34. TEMA: Anchor the Image, Follow the Text for Multi-Modification Composed Image Retrieval

    Zixu Li, Yupeng Hu, Zhiheng Fu +3

    cs.CVarXiv:2604.21806v22026
  35. Unleashing VLA Potentials in Autonomous Driving via Explicit Learning from Failures

    Yuechen Luo, Qimao Chen, Fang Li +5

    cs.CVarXiv:2603.01063v12026
  36. PlasticineLab: A Soft-Body Manipulation Benchmark with Differentiable Physics

    Zhiao Huang, Yuanming Hu, Tao Du +4

    cs.LGcs.AIcs.CVarXiv:2104.03311v12021
  37. CIPS-3D: A 3D-Aware Generator of GANs Based on Conditionally-Independent Pixel Synthesis

    Peng Zhou, Lingxi Xie, Bingbing Ni +1

    cs.CVeess.IVarXiv:2110.09788v12021
  38. Improved Conditional VRNNs for Video Prediction

    Lluis Castrejon, Nicolas Ballas, Aaron Courville

    cs.CVcs.LGarXiv:1904.12165v12019
  39. Unrestricted Adversarial Examples via Semantic Manipulation

    Anand Bhattad, Min Jin Chong, Kaizhao Liang +2

    cs.CVarXiv:1904.06347v22019
  40. Patchwork: Concentric Zone-based Region-wise Ground Segmentation with Ground Likelihood Estimation Using a 3D LiDAR Sensor

    Hyungtae Lim, Minho Oh, Hyun Myung

    cs.ROcs.CVarXiv:2108.05560v22021
  41. Image Compressive Sensing Recovery Using Adaptively Learned Sparsifying Basis via L0 Minimization

    Jian Zhang, Chen Zhao, Debin Zhao +1

    cs.CVarXiv:1404.7566v12014
  42. Re-labeling ImageNet: from Single to Multi-Labels, from Global to Localized Labels

    Sangdoo Yun, Seong Joon Oh, Byeongho Heo +3

    cs.CVarXiv:2101.05022v22021
  43. Revealing the Invisible with Model and Data Shrinking for Composite-database Micro-expression Recognition

    Zhaoqiang Xia, Wei Peng, Huai-Qian Khor +2

    cs.CVarXiv:2006.09674v12020
  44. Devil is in Narrow Policy: Unleashing Exploration in Driving VLA Models

    Canyu Chen, Yuguang Yang, Zhewen Tan +10

    cs.CVcs.ROarXiv:2603.06049v12026
  45. S4G: Amodal Single-view Single-Shot SE(3) Grasp Detection in Cluttered Scenes

    Yuzhe Qin, Rui Chen, Hao Zhu +3

    cs.ROcs.CVarXiv:1910.14218v12019
  46. 3D AffordanceNet: A Benchmark for Visual Object Affordance Understanding

    Shengheng Deng, Xun Xu, Chaozheng Wu +2

    cs.CVarXiv:2103.16397v22021
  47. A Survey on Graph Neural Networks and Graph Transformers in Computer Vision: A Task-Oriented Perspective

    Chaoqi Chen, Yushuang Wu, Qiyuan Dai +5

    cs.CVcs.AIcs.LGarXiv:2209.13232v42022
  48. Low-Latency Video Semantic Segmentation

    Yule Li, Jianping Shi, Dahua Lin

    cs.CVarXiv:1804.00389v12018
  49. Rethinking Video-Language Model from the Language Input Perspective

    Xiang Fang, Wanlong Fang, Changshuo Wang +2

    cs.CVarXiv:2605.27920v12026
  50. ShakeDrop Regularization for Deep Residual Learning

    Yoshihiro Yamada, Masakazu Iwamura, Takuya Akiba +1

    cs.CVarXiv:1802.02375v32018
  51. HALP: Detecting Hallucinations in Vision-Language Models without Generating a Single Token

    Sai Akhil Kogilathota, Sripadha Vallabha E G, Luzhe Sun +1

    cs.CVarXiv:2603.05465v12026
  52. HotSpotter - Patterned Species Instance Recognition

    Jonathan P. Crall, Charles V. Stewart, Tanya Y. Berger-Wolf +2

    cs.CVarXiv:2508.17605v12025
  53. TriTransNet: RGB-D Salient Object Detection with a Triplet Transformer Embedding Network

    Zhengyi Liu, Yuan Wang, Zhengzheng Tu +2

    cs.CVarXiv:2108.03990v12021
  54. The autoPET3 Challenge: Automated Lesion Segmentation in Whole-Body PET/CT $\unicode{x2013}$ Multitracer Multicenter Generalization

    Jakob Dexl, Katharina Jeblick, Andreas Mittermeier +27

    cs.CVcs.AIarXiv:2605.05775v22026
  55. Cross Language Image Matching for Weakly Supervised Semantic Segmentation

    Jinheng Xie, Xianxu Hou, Kai Ye +1

    cs.CVcs.CLarXiv:2203.02668v22022
  56. An Attention-Fused Network for Semantic Segmentation of Very-High-Resolution Remote Sensing Imagery

    Xuan Yang, Shanshan Li, Zhengchao Chen +5

    cs.CVarXiv:2105.04132v22021
  57. Reconstruction or Semantics? What Makes a Latent Space Useful for Robotic World Models

    Nilaksh, Saurav Jha, Artem Zholus +1

    cs.CVcs.LGcs.ROarXiv:2605.06388v12026
  58. SpanVLA: Efficient Action Bridging and Learning from Negative-Recovery Samples for Vision-Language-Action Model

    Zewei Zhou, Ruining Yang, Xuewei +8

    cs.CVarXiv:2604.19710v12026
  59. An Approach for Thyroid Nodule Analysis Using Thermographic Images

    J. R. González, É. O. Rodrigues, C. P. Damião +6

    cs.CVarXiv:2605.29221v12026
  60. Channel Interaction Networks for Fine-Grained Image Categorization

    Yu Gao, Xintong Han, Xun Wang +2

    cs.CVarXiv:2003.05235v12020