Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
3,721 to 3,780 of 18,855
Vision Transformers Need More Than Registers
Cheng Shi, Yizhou Yu, Sibei Yang
cs.CVarXiv:2602.22394v22026Visual prompting reimagined: The power of the Activation Prompts
Yihua Zhang, Hongkang Li, Yuguang Yao +5
cs.CVcs.LGarXiv:2604.06440v12026CentripetalNet: Pursuing High-quality Keypoint Pairs for Object Detection
Zhiwei Dong, Guoxuan Li, Yue Liao +3
cs.CVarXiv:2003.09119v12020Multimodal Transfer: A Hierarchical Deep Convolutional Neural Network for Fast Artistic Style Transfer
Xin Wang, Geoffrey Oxholm, Da Zhang +1
cs.CVcs.AIarXiv:1612.01895v22016LongStream: Long-Sequence Streaming Autoregressive Visual Geometry
Chong Cheng, Xianda Chen, Tao Xie +5
cs.CVarXiv:2602.13172v22026Multiple Inputs and Mixwd data for Alzheimer's Disease Classification Based on 3D Vision Transformer
Juan A. Castro-Silva, Maria N. Moreno Garcia, Diego H. Peluffo-Ordoñez
cs.CVarXiv:2603.00545v12026How well are open sourced AI-generated image detection models out-of-the-box: A comprehensive benchmark study
Simiao Ren, Yuchen Zhou, Xingyu Shen +9
cs.CVcs.AIarXiv:2602.07814v12026Hand2World: Autoregressive Egocentric Interaction Generation via Free-Space Hand Gestures
Yuxi Wang, Wenqi Ouyang, Tianyi Wei +3
cs.CVarXiv:2602.09600v22026ClearAIR: A Human-Visual-Perception-Inspired All-in-One Image Restoration
Xu Zhang, Huan Zhang, Guoli Wang +2
cs.CVarXiv:2601.02763v22026Video-based Person Re-identification with Accumulative Motion Context
Hao Liu, Zequn Jie, Karlekar Jayashree +4
cs.CVarXiv:1701.00193v22017No-Reference Quality Assessment for 3D Colored Point Cloud and Mesh Models
Zicheng Zhang, Wei Sun, Xiongkuo Min +3
cs.CVcs.GReess.IVarXiv:2107.02041v62021Pyramid R-CNN: Towards Better Performance and Adaptability for 3D Object Detection
Jiageng Mao, Minzhe Niu, Haoyue Bai +3
cs.CVarXiv:2109.02499v12021Speech2Face: Learning the Face Behind a Voice
Tae-Hyun Oh, Tali Dekel, Changil Kim +4
cs.CVcs.MMarXiv:1905.09773v12019SVIT: Scaling up Visual Instruction Tuning
Bo Zhao, Boya Wu, Muyang He +1
cs.CVarXiv:2307.04087v32023DexMimicGen: Automated Data Generation for Bimanual Dexterous Manipulation via Imitation Learning
Zhenyu Jiang, Yuqi Xie, Kevin Lin +5
cs.ROcs.AIcs.CVarXiv:2410.24185v22024Neural Inverse Rendering of an Indoor Scene from a Single Image
Soumyadip Sengupta, Jinwei Gu, Kihwan Kim +3
cs.CVarXiv:1901.02453v32019Measuring Similarity between Artistic and AI Generated Images using Siamese Neural Networks
Diego Castro Elvira, Navil Pineda Rugerio, Jesús García-Ramírez +2
cs.CVcs.AIarXiv:2608.28671v12026VLABench: A Large-Scale Benchmark for Language-Conditioned Robotics Manipulation with Long-Horizon Reasoning Tasks
Shiduo Zhang, Zhe Xu, Peiju Liu +8
cs.ROcs.AIcs.CLarXiv:2412.18194v12024Memory-Efficient Training-Free Acceleration of Diffusion Transformers with BaryCache
Chengjie Lu, Tianchi Deng, Zhengqi He +3
cs.CVarXiv:2608.28670v120263D Dilated Multi-Fiber Network for Real-time Brain Tumor Segmentation in MRI
Chen Chen, Xiaopeng Liu, Meng Ding +2
cs.CVarXiv:1904.03355v52019Stochastic Variance Reduced Ensemble Adversarial Attack for Boosting the Adversarial Transferability
Yifeng Xiong, Jiadong Lin, Min Zhang +2
cs.LGcs.CRcs.CVarXiv:2111.10752v22021Improving Spatial-Temporal Reasoning in Video-Language Models with Structured Video Prompting
Sadegh Mohammadian
cs.CVarXiv:2608.28666v12026SpArSe: Sparse Architecture Search for CNNs on Resource-Constrained Microcontrollers
Igor Fedorov, Ryan P. Adams, Matthew Mattina +1
cs.LGcs.CVarXiv:1905.12107v12019D3TW: Discriminative Differentiable Dynamic Time Warping for Weakly Supervised Action Alignment and Segmentation
Chien-Yi Chang, De-An Huang, Yanan Sui +2
cs.CVarXiv:1901.02598v22019BiomedParse: a biomedical foundation model for image parsing of everything everywhere all at once
Theodore Zhao, Yu Gu, Jianwei Yang +12
cs.CVarXiv:2405.12971v32024Multi-branch Convolutional Neural Network for Multiple Sclerosis Lesion Segmentation
Shahab Aslani, Michael Dayan, Loredana Storelli +4
cs.CVarXiv:1811.02942v42018Learning Texture Manifolds with the Periodic Spatial GAN
Urs Bergmann, Nikolay Jetchev, Roland Vollgraf
cs.CVstat.MLarXiv:1705.06566v22017HiDrop: Hierarchical Vision Token Reduction in MLLMs via Late Injection, Concave Pyramid Pruning, and Early Exit
Hao Wu, Yingqi Fan, Jinyang Dai +3
cs.CVcs.CLarXiv:2602.23699v12026CONQUER: Context-Aware Representation with Query Enhancement for Text-Based Person Search
Zequn Xie
cs.CVarXiv:2601.18625v12026PN-Net: Conjoined Triple Deep Network for Learning Local Image Descriptors
Vassileios Balntas, Edward Johns, Lilian Tang +1
cs.CVarXiv:1601.05030v12016OpenRT: An Open-Source Red Teaming Framework for Multimodal LLMs
Xin Wang, Yunhao Chen, Juncheng Li +7
cs.CRcs.CVarXiv:2601.01592v22026Evo-Depth: A Lightweight Depth-Enhanced Vision-Language-Action Model
Tao Lin, Yuxin Du, Jiting Liu +14
cs.CVcs.ROarXiv:2605.14950v12026Sharpness-Aware Gradient Matching for Domain Generalization
Pengfei Wang, Zhaoxiang Zhang, Zhen Lei +1
cs.CVarXiv:2303.10353v12023TEMA: Anchor the Image, Follow the Text for Multi-Modification Composed Image Retrieval
Zixu Li, Yupeng Hu, Zhiheng Fu +3
cs.CVarXiv:2604.21806v22026Unleashing VLA Potentials in Autonomous Driving via Explicit Learning from Failures
Yuechen Luo, Qimao Chen, Fang Li +5
cs.CVarXiv:2603.01063v12026PlasticineLab: A Soft-Body Manipulation Benchmark with Differentiable Physics
Zhiao Huang, Yuanming Hu, Tao Du +4
cs.LGcs.AIcs.CVarXiv:2104.03311v12021CIPS-3D: A 3D-Aware Generator of GANs Based on Conditionally-Independent Pixel Synthesis
Peng Zhou, Lingxi Xie, Bingbing Ni +1
cs.CVeess.IVarXiv:2110.09788v12021Improved Conditional VRNNs for Video Prediction
Lluis Castrejon, Nicolas Ballas, Aaron Courville
cs.CVcs.LGarXiv:1904.12165v12019Unrestricted Adversarial Examples via Semantic Manipulation
Anand Bhattad, Min Jin Chong, Kaizhao Liang +2
cs.CVarXiv:1904.06347v22019Patchwork: Concentric Zone-based Region-wise Ground Segmentation with Ground Likelihood Estimation Using a 3D LiDAR Sensor
Hyungtae Lim, Minho Oh, Hyun Myung
cs.ROcs.CVarXiv:2108.05560v22021Image Compressive Sensing Recovery Using Adaptively Learned Sparsifying Basis via L0 Minimization
Jian Zhang, Chen Zhao, Debin Zhao +1
cs.CVarXiv:1404.7566v12014Re-labeling ImageNet: from Single to Multi-Labels, from Global to Localized Labels
Sangdoo Yun, Seong Joon Oh, Byeongho Heo +3
cs.CVarXiv:2101.05022v22021Revealing the Invisible with Model and Data Shrinking for Composite-database Micro-expression Recognition
Zhaoqiang Xia, Wei Peng, Huai-Qian Khor +2
cs.CVarXiv:2006.09674v12020Devil is in Narrow Policy: Unleashing Exploration in Driving VLA Models
Canyu Chen, Yuguang Yang, Zhewen Tan +10
cs.CVcs.ROarXiv:2603.06049v12026S4G: Amodal Single-view Single-Shot SE(3) Grasp Detection in Cluttered Scenes
Yuzhe Qin, Rui Chen, Hao Zhu +3
cs.ROcs.CVarXiv:1910.14218v120193D AffordanceNet: A Benchmark for Visual Object Affordance Understanding
Shengheng Deng, Xun Xu, Chaozheng Wu +2
cs.CVarXiv:2103.16397v22021A Survey on Graph Neural Networks and Graph Transformers in Computer Vision: A Task-Oriented Perspective
Chaoqi Chen, Yushuang Wu, Qiyuan Dai +5
cs.CVcs.AIcs.LGarXiv:2209.13232v42022Low-Latency Video Semantic Segmentation
Yule Li, Jianping Shi, Dahua Lin
cs.CVarXiv:1804.00389v12018Rethinking Video-Language Model from the Language Input Perspective
Xiang Fang, Wanlong Fang, Changshuo Wang +2
cs.CVarXiv:2605.27920v12026ShakeDrop Regularization for Deep Residual Learning
Yoshihiro Yamada, Masakazu Iwamura, Takuya Akiba +1
cs.CVarXiv:1802.02375v32018HALP: Detecting Hallucinations in Vision-Language Models without Generating a Single Token
Sai Akhil Kogilathota, Sripadha Vallabha E G, Luzhe Sun +1
cs.CVarXiv:2603.05465v12026HotSpotter - Patterned Species Instance Recognition
Jonathan P. Crall, Charles V. Stewart, Tanya Y. Berger-Wolf +2
cs.CVarXiv:2508.17605v12025TriTransNet: RGB-D Salient Object Detection with a Triplet Transformer Embedding Network
Zhengyi Liu, Yuan Wang, Zhengzheng Tu +2
cs.CVarXiv:2108.03990v12021The autoPET3 Challenge: Automated Lesion Segmentation in Whole-Body PET/CT $\unicode{x2013}$ Multitracer Multicenter Generalization
Jakob Dexl, Katharina Jeblick, Andreas Mittermeier +27
cs.CVcs.AIarXiv:2605.05775v22026Cross Language Image Matching for Weakly Supervised Semantic Segmentation
Jinheng Xie, Xianxu Hou, Kai Ye +1
cs.CVcs.CLarXiv:2203.02668v22022An Attention-Fused Network for Semantic Segmentation of Very-High-Resolution Remote Sensing Imagery
Xuan Yang, Shanshan Li, Zhengchao Chen +5
cs.CVarXiv:2105.04132v22021Reconstruction or Semantics? What Makes a Latent Space Useful for Robotic World Models
Nilaksh, Saurav Jha, Artem Zholus +1
cs.CVcs.LGcs.ROarXiv:2605.06388v12026SpanVLA: Efficient Action Bridging and Learning from Negative-Recovery Samples for Vision-Language-Action Model
Zewei Zhou, Ruining Yang, Xuewei +8
cs.CVarXiv:2604.19710v12026An Approach for Thyroid Nodule Analysis Using Thermographic Images
J. R. González, É. O. Rodrigues, C. P. Damião +6
cs.CVarXiv:2605.29221v12026Channel Interaction Networks for Fine-Grained Image Categorization
Yu Gao, Xintong Han, Xun Wang +2
cs.CVarXiv:2003.05235v12020