Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
301 to 360 of 18,815
Joint Semantic Segmentation and Boundary Detection using Iterative Pyramid Contexts
Mingmin Zhen, Jinglu Wang, Lei Zhou +5
cs.CVarXiv:2004.07684v12020Uncertainty-Aware Unsupervised Domain Adaptation in Object Detection
Dayan Guan, Jiaxing Huang, Aoran Xiao +2
cs.CVarXiv:2103.00236v22021A Lightweight Deep Learning Model for Human Activity Recognition on Edge Devices
Preeti Agarwal, Mansaf Alam
eess.SPcs.CVarXiv:1909.12917v12019ORCA: Occlusion-Aware Refinement and Completion for Novel View Synthesis
Weronika Jakubowska, Maciej Zięba, Przemysław Spurek
cs.CVarXiv:2609.17450v12026Gauge Equivariant Mesh CNNs: Anisotropic convolutions on geometric graphs
Pim de Haan, Maurice Weiler, Taco Cohen +1
cs.LGcs.CVstat.MLarXiv:2003.05425v32020PiPS: Post-Hoc Prototypical Explanations for Interpretable Semantic Segmentation
Miłosz Adamczyk, Tymoteusz Zapala, Piotr Borycki +1
cs.CVarXiv:2609.16909v12026Det-LIME: Detector-Aware, Multi-Instance Local Interpretable Model-Agnostic Explanations for Automated Marine Mammal Detection
Jiayi Zhou, David W. Johnston, Brinnae Bent
cs.CVcs.AIarXiv:2609.17479v12026Jointly Learning Structured Analysis Discriminative Dictionary and Analysis Multiclass Classifier
Zhao Zhang, Weiming Jiang, Jie Qin +4
cs.CVarXiv:1905.11543v12019Pretraining boosts out-of-domain robustness for pose estimation
Alexander Mathis, Thomas Biasi, Steffen Schneider +4
cs.CVcs.LGarXiv:1909.11229v22019From Handcrafted to Deep Features for Pedestrian Detection: A Survey
Jiale Cao, Yanwei Pang, Jin Xie +2
cs.CVarXiv:2010.00456v22020Goal-GAN: Multimodal Trajectory Prediction Based on Goal Position Estimation
Patrick Dendorfer, Aljoša Ošep, Laura Leal-Taixé
cs.CVarXiv:2010.01114v12020Knowledge as Orbit: Finite Collections as Phases of an Exactly Periodic Latent Generator
Siddharth Pal, Viktoria Rojkova
cs.LGcs.CVeess.IVarXiv:2609.17417v12026Zing-0.5: Toward Playable Worlds with Real-Time Joint Action and Text Control
Mingyang Chen, Shengdong Chen, Xiaoxiao Fu +13
cs.CVcs.LGarXiv:2609.17909v12026PANORAMA: Panoptic Grounded Captioning via Mask Proposal Selection
Sara Pieri, Evangelos Kazakos, Shizhe Chen +2
cs.CVcs.CLarXiv:2609.19143v12026Lightweight Real-time Semantic Segmentation Network with Efficient Transformer and CNN
Guoan Xu, Juncheng Li, Guangwei Gao +3
cs.CVarXiv:2302.10484v12023Physically Aware Radiomics Without Interpolation: Disentangling Voxel Geometry and Signal Modification in CT and MRI
David Corral Fontecha, Juan Miranda Bautista, Pablo Menendez Fernández-Miranda +3
cs.CVcs.AIarXiv:2607.12399v12026FaceVerse: a Fine-grained and Detail-controllable 3D Face Morphable Model from a Hybrid Dataset
Lizhen Wang, Zhiyuan Chen, Tao Yu +3
cs.CVarXiv:2203.14057v32022InfoTaxa: Information-Calibrated Label-Free Clustering for Fine-Grained Visual Taxonomy
David Ahmedt-Aristizabal, Mohammad Ali Armin, Lars Petersson
cs.CVarXiv:2609.17218v12026Physics-Aware Video Generation via Agentic Planning and Graph-Guided Optimization
Minh-Loi Nguyen, Xuan-Vu Le, Thanh-Toan Do +3
cs.CVarXiv:2609.13006v12026Deep Multimodal Learning with Missing Modality: A Survey
Renjie Wu, Hu Wang, Hsiang-Ting Chen +1
cs.CVcs.AIcs.LGarXiv:2409.07825v42024Temporally Consistent Graph Extraction and Matching for Longitudinal Angiographic Images
Linus Kreitner, Laurin Lux, Carmen Baumann +2
cs.CVarXiv:2609.16889v12026JewelTry: Mask-Free Scale Aware Jewelry Virtual Try-On
Xinlei Niu, Peixia Li, Jun Wang +5
cs.CVarXiv:2609.16626v12026Navigating Text-To-Image Customization: From LyCORIS Fine-Tuning to Model Evaluation
Shih-Ying Yeh, Yu-Guan Hsieh, Zhidong Gao +3
cs.CVcs.AIcs.GRarXiv:2309.14859v22023Generative Retrieval for Unsupervised Text-Based Person Search
Mang Ye, Yucheng Ji, Yang Bai +4
cs.CVcs.AIarXiv:2609.12965v12026Learning Human-Perceived Fakeness in AI-Generated Videos via Multimodal LLMs
Xingyu Fu, Siyi Liu, Yinuo Xu +13
cs.CVcs.AIcs.CLarXiv:2509.22646v22025Taming Preference Mode Collapse via Directional Decoupling Alignment in Diffusion Reinforcement Learning
Chubin Chen, Sujie Hu, Jiashu Zhu +8
cs.CVarXiv:2512.24146v22025MHSA-Net: Multi-Head Self-Attention Network for Occluded Person Re-Identification
Hongchen Tan, Xiuping Liu, Baocai Yin +1
cs.CVarXiv:2008.04015v42020Thinking with Programming Vision: Towards a Unified View for Thinking with Images
Zirun Guo, Minjie Hong, Feng Zhang +2
cs.CVcs.CLarXiv:2512.03746v12025ActionPiece: Rethinking Action Tokenization for Autoregressive Vision-Language-Action Models
Shijie Lian, Bin Yu, Zhaolong Shen +5
cs.ROcs.AIcs.CLarXiv:2609.18487v12026Deep Reflectance Volumes: Relightable Reconstructions from Multi-View Photometric Images
Sai Bi, Zexiang Xu, Kalyan Sunkavalli +4
cs.CVcs.GRarXiv:2007.09892v12020From Google Maps to a Fine-Grained Catalog of Street trees
Steve Branson, Jan Dirk Wegner, David Hall +3
cs.CVcs.LGarXiv:1910.02675v12019NeRFusion: Fusing Radiance Fields for Large-Scale Scene Reconstruction
Xiaoshuai Zhang, Sai Bi, Kalyan Sunkavalli +2
cs.CVcs.GRarXiv:2203.11283v12022Scenario-Independent Criticality Assessment and Prediction for Vulnerable Road Users in Autonomous Driving
Jörg Gamerdinger, Victor Schwarzenberger, Philipp Schmid +2
cs.ROcs.CVcs.CYarXiv:2609.11947v12026SensatUrban: Learning Semantics from Urban-Scale Photogrammetric Point Clouds
Qingyong Hu, Bo Yang, Sheikh Khalid +3
cs.CVcs.ROarXiv:2201.04494v12022Pixel Decodability Is Not a Compression Signal: Causally Evaluating Importance Proxies for Visual KV-Cache Eviction
Chenyu Zhou, Qiliang Jiang, Shuning Wu +1
cs.CVarXiv:2609.13012v12026Lightweight Bimodal Network for Single-Image Super-Resolution via Symmetric CNN and Recursive Transformer
Guangwei Gao, Zhengxue Wang, Juncheng Li +3
cs.CVarXiv:2204.13286v12022PDNet: Prior-model Guided Depth-enhanced Network for Salient Object Detection
Chunbiao Zhu, Xing Cai, Kan Huang +2
cs.CVcs.AIcs.MMarXiv:1803.08636v22018VC-Attention: Value Smoothing and Softmax Casting for Low-bit Attention
Xingyang Li, Dongyun Zou, Shining Zhang +8
cs.CVarXiv:2609.15810v12026Light Field Reconstruction Using Convolutional Network on EPI and Extended Applications
Gaochang Wu, Yebin Liu, Lu Fang +2
eess.IVcs.CVarXiv:2103.13043v12021CLDA: Contrastive Learning for Semi-Supervised Domain Adaptation
Ankit Singh
cs.CVarXiv:2107.00085v22021SPEAR NeXT Causal Latent Forecasting Across Multiple Horizons for Spectral Temporal Earth Representation Learning
Rajiv Ranjan, Udaiveer Singh, Shashank Tamaskar +1
cs.CVarXiv:2609.16871v12026Temporal Convolutional Neural Network for the Classification of Satellite Image Time Series
Charlotte Pelletier, Geoffrey I. Webb, Francois Petitjean
cs.CVarXiv:1811.10166v22018EventEgoHands++: Event-based Egocentric 3D Hand Mesh Reconstruction with Real Dataset
Ryosei Hara, Wataru Ikeda, Masashi Hatano +1
cs.CVarXiv:2609.17189v12026ModaLens: Measuring Image Sensitivity in Report-Conditioned Medical VLMs
Sebastián Andrés Cajas Ordóñez, Maximin Lange, Quang Bui +9
cs.CVcs.AIarXiv:2609.15635v12026Adapting Pretrained Vision-Language Foundational Models to Medical Imaging Domains
Pierre Chambon, Christian Bluethgen, Curtis P. Langlotz +1
cs.CVcs.AIcs.CLarXiv:2210.04133v12022Temporal Memory Relation Network for Workflow Recognition from Surgical Video
Yueming Jin, Yonghao Long, Cheng Chen +3
cs.CVcs.AIarXiv:2103.16327v12021HouseDiffusion: Vector Floorplan Generation via a Diffusion Model with Discrete and Continuous Denoising
Mohammad Amin Shabani, Sepidehsadat Hosseini, Yasutaka Furukawa
cs.CVcs.AIarXiv:2211.13287v12022See, Hear, and Understand: Benchmarking Audiovisual Human Speech Understanding in Multimodal Large Language Models
Le Thien Phuc Nguyen, Zhuoran Yu, Samuel Low Yu Hang +8
cs.CVcs.AIcs.LGarXiv:2512.02231v22025Visual Search at Alibaba
Yanhao Zhang, Pan Pan, Yun Zheng +4
cs.CVarXiv:2102.04674v12021EVOLVE-VLA: Test-Time Training from Environment Feedback for Vision-Language-Action Models
Zechen Bai, Chen Gao, Mike Zheng Shou
cs.ROcs.CVarXiv:2512.14666v12025Next-Embedding Prediction Makes Strong Vision Learners
Sihan Xu, Ziqiao Ma, Wenhao Chai +5
cs.CVarXiv:2512.16922v22025SpaceTools: Tool-Augmented Spatial Reasoning via Double Interactive RL
Siyi Chen, Mikaela Angelina Uy, Chan Hee Song +6
cs.CVcs.ROarXiv:2512.04069v22025UniREditBench: A Unified Reasoning-based Image Editing Benchmark
Feng Han, Yibin Wang, Chenglin Li +7
cs.CVarXiv:2511.01295v32025Predicting Human Disagreement for Calibrated Dynamic Facial Expression Recognition
Yiming Wang, Frederick W. B. Li, Jingyun Wang
cs.CVarXiv:2609.17130v12026EgoPathBench: Evaluating Zero-Shot Egocentric Waypoint Decision-Making in Vision-Language Models
Yang Zhao, Zhuo Chen, Xubo Yang
cs.CVarXiv:2609.16610v12026Semantic Classification of 3D Point Clouds with Multiscale Spherical Neighborhoods
Hugues Thomas, Jean-Emmanuel Deschaud, Beatriz Marcotegui +2
cs.CVarXiv:1808.00495v12018Photo Wake-Up: 3D Character Animation from a Single Photo
Chung-Yi Weng, Brian Curless, Ira Kemelmacher-Shlizerman
cs.CVcs.GRarXiv:1812.02246v12018Crowd Counting Using Scale-Aware Attention Networks
Mohammad Asiful Hossain, Mehrdad Hosseinzadeh, Omit Chanda +1
cs.CVarXiv:1903.02025v12019YOLO-Master: MOE-Accelerated with Specialized Transformers for Enhanced Real-time Detection
Xu Lin, Jinlong Peng, Zhenye Gan +2
cs.CVarXiv:2512.23273v22025PanoGS-SLAM: Panoramic 3D Gaussian Splatting SLAM
Yongqi Mao, Hao Shi, Yufan Zhang +3
cs.CVarXiv:2609.17387v12026