Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
5,581 to 5,640 of 18,795
Revisiting Face Recognition for Monozygotic Twins: The Celeb Twins Test Set
Michael Zang, Haiyu Wu, Mrinal Sharma +1
cs.CVcs.AIarXiv:2609.01141v12026Modulated Periodic Activations for Generalizable Local Functional Representations
Ishit Mehta, Michaël Gharbi, Connelly Barnes +3
cs.CVcs.GRarXiv:2104.03960v12021Summaries:한국어LLaVA-3D: A Simple yet Effective Pathway to Empowering LMMs with 3D-awareness
Chenming Zhu, Tai Wang, Wenwei Zhang +2
cs.CVarXiv:2409.18125v32024Cameras as Relative Positional Encoding
Ruilong Li, Brent Yi, Junchen Liu +3
cs.CVcs.AIarXiv:2507.10496v22025VideoRFT: Incentivizing Video Reasoning Capability in MLLMs via Reinforced Fine-Tuning
Qi Wang, Yanrui Yu, Ye Yuan +2
cs.CVarXiv:2505.12434v42025Localizing Anomalies from Weakly-Labeled Videos
Hui Lv, Chuanwei Zhou, Chunyan Xu +2
cs.CVarXiv:2008.08944v32020Challenge-Aware RGBT Tracking
Chenglong Li, Lei Liu, Andong Lu +2
cs.CVarXiv:2007.13143v12020Self-Rewarding Vision-Language Model via Reasoning Decomposition
Zongxia Li, Wenhao Yu, Chengsong Huang +8
cs.CVarXiv:2508.19652v22025Generalization in diffusion models arises from geometry-adaptive harmonic representations
Zahra Kadkhodaie, Florentin Guth, Eero P. Simoncelli +1
cs.CVcs.LGarXiv:2310.02557v32023Probing the 3D Awareness of Visual Foundation Models
Mohamed El Banani, Amit Raj, Kevis-Kokitsi Maninis +7
cs.CVarXiv:2404.08636v12024Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
Zhixuan Liang, Yizhuo Li, Tianshuo Yang +9
cs.CVcs.LGcs.ROarXiv:2508.20072v42025VITA: Towards Open-Source Interactive Omni Multimodal LLM
Chaoyou Fu, Haojia Lin, Zuwei Long +16
cs.CVcs.AIcs.CLarXiv:2408.05211v32024HunyuanWorld 1.0: Generating Immersive, Explorable, and Interactive 3D Worlds from Words or Pixels
HunyuanWorld Team, Zhenwei Wang, Yuhao Liu +52
cs.CVarXiv:2507.21809v22025Learning-based Video Motion Magnification
Tae-Hyun Oh, Ronnachai Jaroensri, Changil Kim +4
cs.CVcs.GRarXiv:1804.02684v32018InstantAvatar: Learning Avatars from Monocular Video in 60 Seconds
Tianjian Jiang, Xu Chen, Jie Song +1
cs.CVarXiv:2212.10550v12022Interactive Post-Training for Vision-Language-Action Models
Shuhan Tan, Kairan Dou, Yue Zhao +1
cs.LGcs.AIcs.CVarXiv:2505.17016v12025Self-supervised Video Object Segmentation by Motion Grouping
Charig Yang, Hala Lamdouar, Erika Lu +2
cs.CVcs.LGarXiv:2104.07658v22021Denoising Diffusion Bridge Models
Linqi Zhou, Aaron Lou, Samar Khanna +1
cs.CVcs.AIarXiv:2309.16948v32023UniIR: Training and Benchmarking Universal Multimodal Information Retrievers
Cong Wei, Yang Chen, Haonan Chen +5
cs.CVcs.AIcs.CLarXiv:2311.17136v12023Voyager: Long-Range and World-Consistent Video Diffusion for Explorable 3D Scene Generation
Tianyu Huang, Wangguandong Zheng, Tengfei Wang +8
cs.CVarXiv:2506.04225v12025Lumina-DiMOO: An Omni Diffusion Large Language Model for Multi-Modal Generation and Understanding
Yi Xin, Qi Qin, Siqi Luo +29
cs.CVarXiv:2510.06308v12025TASED-Net: Temporally-Aggregating Spatial Encoder-Decoder Network for Video Saliency Detection
Kyle Min, Jason J. Corso
cs.CVarXiv:1908.05786v12019RealCAD: Towards Real-World Image-to-CAD Reconstruction under Domain Shift and Parameter Bias
Yihe Sun, Ziyu Lu, Kaihua Tang +1
cs.CVarXiv:2608.30617v12026RELIC: Interactive Video World Model with Long-Horizon Memory
Yicong Hong, Yiqun Mei, Chongjian Ge +11
cs.CVarXiv:2512.04040v12025A Large Scale Event-based Detection Dataset for Automotive
Pierre de Tournemire, Davide Nitti, Etienne Perot +2
cs.CVcs.LGcs.ROarXiv:2001.08499v32020Latent Visual Reasoning
Bangzheng Li, Ximeng Sun, Jiang Liu +7
cs.CVcs.CLarXiv:2509.24251v22025DCFace: Synthetic Face Generation with Dual Condition Diffusion Model
Minchul Kim, Feng Liu, Anil Jain +1
cs.CVarXiv:2304.07060v12023Fast Video Generation with Sliding Tile Attention
Peiyuan Zhang, Yongqi Chen, Runlong Su +4
cs.CVarXiv:2502.04507v32025LayoutTransformer: Layout Generation and Completion with Self-attention
Kamal Gupta, Justin Lazarow, Alessandro Achille +3
cs.CVcs.LGarXiv:2006.14615v22020OmniHuman-1: Rethinking the Scaling-Up of One-Stage Conditioned Human Animation Models
Gaojie Lin, Jianwen Jiang, Jiaqi Yang +2
cs.CVarXiv:2502.01061v32025TempFlow-GRPO: When Timing Matters for GRPO in Flow Models
Xiaoxuan He, Siming Fu, Yuke Zhao +5
cs.CVarXiv:2508.04324v42025Street Scene: A new dataset and evaluation protocol for video anomaly detection
Bharathkumar Ramachandra, Michael Jones
cs.CVarXiv:1902.05872v32019DriveTransformer: Unified Transformer for Scalable End-to-End Autonomous Driving
Xiaosong Jia, Junqi You, Zhiyuan Zhang +1
cs.LGcs.CVcs.ROarXiv:2503.07656v22025A Richly Annotated Dataset for Pedestrian Attribute Recognition
Dangwei Li, Zhang Zhang, Xiaotang Chen +2
cs.CVarXiv:1603.07054v32016GoalFlow: Goal-Driven Flow Matching for Multimodal Trajectories Generation in End-to-End Autonomous Driving
Zebin Xing, Xingyu Zhang, Yang Hu +5
cs.CVarXiv:2503.05689v62025Alleviating Over-segmentation Errors by Detecting Action Boundaries
Yuchi Ishikawa, Seito Kasai, Yoshimitsu Aoki +1
cs.CVarXiv:2007.06866v12020Natural Image Matting via Guided Contextual Attention
Yaoyi Li, Hongtao Lu
cs.CVarXiv:2001.04069v12020Are VLMs Ready for Autonomous Driving? An Empirical Study from the Reliability, Data, and Metric Perspectives
Shaoyuan Xie, Lingdong Kong, Yuhao Dong +5
cs.CVcs.ROarXiv:2501.04003v12025Temporal-Relational CrossTransformers for Few-Shot Action Recognition
Toby Perrett, Alessandro Masullo, Tilo Burghardt +2
cs.CVarXiv:2101.06184v32021PixelDiT: Pixel Diffusion Transformers for Image Generation
Yongsheng Yu, Wei Xiong, Weili Nie +3
cs.CVarXiv:2511.20645v22025PARTFIELD: Learning 3D Feature Fields for Part Segmentation and Beyond
Minghua Liu, Mikaela Angelina Uy, Donglai Xiang +4
cs.CVarXiv:2504.11451v12025AA-CLIP: Enhancing Zero-shot Anomaly Detection via Anomaly-Aware CLIP
Wenxin Ma, Xu Zhang, Qingsong Yao +6
cs.CVcs.AIarXiv:2503.06661v12025Evidence-Guided Detection, Localization and Explanation for Text-Centric Image Forensics
Peifeng Liu, Bin Li, Qingsong Zhang +3
cs.CVarXiv:2609.02097v12026Orthogonal Ensembles and Tested Explanations for Performer-Independent Body-Motion Emotion Recognition
Naoto Nishida, Yoshio Ishiguro
cs.CVcs.HCcs.LGarXiv:2609.02510v12026HAMSTER: Hierarchical Action Models For Open-World Robot Manipulation
Yi Li, Yuquan Deng, Jesse Zhang +9
cs.ROcs.AIcs.CVarXiv:2502.05485v42025Learning Spatial-Aware Regressions for Visual Tracking
Chong Sun, Dong Wang, Huchuan Lu +1
cs.CVarXiv:1706.07457v22017Learning Deep Networks from Noisy Labels with Dropout Regularization
Ishan Jindal, Matthew Nokleby, Xuewen Chen
cs.CVcs.LGstat.MLarXiv:1705.03419v12017Instance-Guided Report Anchoring for Text-Free 3D Abnormality Segmentation in Chest CT
Zhenyu Bu, Haoyan Ding, Chushu Shen +7
cs.CVarXiv:2609.00447v12026Monet: Reasoning in Latent Visual Space Beyond Images and Language
Qixun Wang, Yang Shi, Yifei Wang +5
cs.CVcs.AIarXiv:2511.21395v22025Who Drives the Probability Game of VLMs? A Temporal Causal Drive Evaluation Framework
Shuyao Xiao, Shengling Wang, Haoyu Niu +4
cs.CVarXiv:2609.02000v12026A Survey on Deep Learning for Neuroimaging-based Brain Disorder Analysis
Li Zhang, Mingliang Wang, Mingxia Liu +1
eess.IVcs.CVcs.LGarXiv:2005.04573v12020Efficient Active Learning for Image Classification and Segmentation using a Sample Selection and Conditional Generative Adversarial Network
Dwarikanath Mahapatra, Behzad Bozorgtabar, Jean-Philippe Thiran +1
cs.CVarXiv:1806.05473v42018Hardware-Accelerated Instance Segmentation for Resource-Constrained Space Robotics with Criticality Analysis
Siddhant Shete, Hilmi Dogu Kücüker, Udo Frese +1
cs.ROcs.ARcs.CVarXiv:2609.02219v12026Test-Time Training Done Right
Tianyuan Zhang, Sai Bi, Yicong Hong +6
cs.LGcs.CLcs.CVarXiv:2505.23884v12025Spatial-Spectral Feature Extraction via Deep ConvLSTM Neural Networks for Hyperspectral Image Classification
Wen-Shuai Hu, Heng-Chao Li, Lei Pan +3
cs.CVarXiv:1905.03577v22019Wan-Animate: Unified Character Animation and Replacement with Holistic Replication
Gang Cheng, Xin Gao, Li Hu +23
cs.CVarXiv:2509.14055v12025FlexTok: Resampling Images into 1D Token Sequences of Flexible Length
Roman Bachmann, Jesse Allardice, David Mizrahi +6
cs.CVcs.LGarXiv:2502.13967v22025UniVideo: Unified Understanding, Generation, and Editing for Videos
Cong Wei, Quande Liu, Zixuan Ye +5
cs.CVarXiv:2510.08377v42025HealthGPT: A Medical Large Vision-Language Model for Unifying Comprehension and Generation via Heterogeneous Knowledge Adaptation
Tianwei Lin, Wenqiao Zhang, Sijing Li +12
cs.CVcs.AIarXiv:2502.09838v32025Second-order Non-local Attention Networks for Person Re-identification
Bryan, Xia, Yuan Gong +2
cs.CVcs.AIcs.LGarXiv:1909.00295v12019