Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

301 to 360 of 18,815

  1. Joint Semantic Segmentation and Boundary Detection using Iterative Pyramid Contexts

    Mingmin Zhen, Jinglu Wang, Lei Zhou +5

    cs.CVarXiv:2004.07684v12020
  2. Uncertainty-Aware Unsupervised Domain Adaptation in Object Detection

    Dayan Guan, Jiaxing Huang, Aoran Xiao +2

    cs.CVarXiv:2103.00236v22021
  3. A Lightweight Deep Learning Model for Human Activity Recognition on Edge Devices

    Preeti Agarwal, Mansaf Alam

    eess.SPcs.CVarXiv:1909.12917v12019
  4. ORCA: Occlusion-Aware Refinement and Completion for Novel View Synthesis

    Weronika Jakubowska, Maciej Zięba, Przemysław Spurek

    cs.CVarXiv:2609.17450v12026
  5. Gauge Equivariant Mesh CNNs: Anisotropic convolutions on geometric graphs

    Pim de Haan, Maurice Weiler, Taco Cohen +1

    cs.LGcs.CVstat.MLarXiv:2003.05425v32020
  6. PiPS: Post-Hoc Prototypical Explanations for Interpretable Semantic Segmentation

    Miłosz Adamczyk, Tymoteusz Zapala, Piotr Borycki +1

    cs.CVarXiv:2609.16909v12026
  7. Det-LIME: Detector-Aware, Multi-Instance Local Interpretable Model-Agnostic Explanations for Automated Marine Mammal Detection

    Jiayi Zhou, David W. Johnston, Brinnae Bent

    cs.CVcs.AIarXiv:2609.17479v12026
  8. Jointly Learning Structured Analysis Discriminative Dictionary and Analysis Multiclass Classifier

    Zhao Zhang, Weiming Jiang, Jie Qin +4

    cs.CVarXiv:1905.11543v12019
  9. Pretraining boosts out-of-domain robustness for pose estimation

    Alexander Mathis, Thomas Biasi, Steffen Schneider +4

    cs.CVcs.LGarXiv:1909.11229v22019
  10. From Handcrafted to Deep Features for Pedestrian Detection: A Survey

    Jiale Cao, Yanwei Pang, Jin Xie +2

    cs.CVarXiv:2010.00456v22020
  11. Goal-GAN: Multimodal Trajectory Prediction Based on Goal Position Estimation

    Patrick Dendorfer, Aljoša Ošep, Laura Leal-Taixé

    cs.CVarXiv:2010.01114v12020
  12. Knowledge as Orbit: Finite Collections as Phases of an Exactly Periodic Latent Generator

    Siddharth Pal, Viktoria Rojkova

    cs.LGcs.CVeess.IVarXiv:2609.17417v12026
  13. Zing-0.5: Toward Playable Worlds with Real-Time Joint Action and Text Control

    Mingyang Chen, Shengdong Chen, Xiaoxiao Fu +13

    cs.CVcs.LGarXiv:2609.17909v12026
  14. PANORAMA: Panoptic Grounded Captioning via Mask Proposal Selection

    Sara Pieri, Evangelos Kazakos, Shizhe Chen +2

    cs.CVcs.CLarXiv:2609.19143v12026
  15. Lightweight Real-time Semantic Segmentation Network with Efficient Transformer and CNN

    Guoan Xu, Juncheng Li, Guangwei Gao +3

    cs.CVarXiv:2302.10484v12023
  16. Physically Aware Radiomics Without Interpolation: Disentangling Voxel Geometry and Signal Modification in CT and MRI

    David Corral Fontecha, Juan Miranda Bautista, Pablo Menendez Fernández-Miranda +3

    cs.CVcs.AIarXiv:2607.12399v12026
  17. FaceVerse: a Fine-grained and Detail-controllable 3D Face Morphable Model from a Hybrid Dataset

    Lizhen Wang, Zhiyuan Chen, Tao Yu +3

    cs.CVarXiv:2203.14057v32022
  18. InfoTaxa: Information-Calibrated Label-Free Clustering for Fine-Grained Visual Taxonomy

    David Ahmedt-Aristizabal, Mohammad Ali Armin, Lars Petersson

    cs.CVarXiv:2609.17218v12026
  19. Physics-Aware Video Generation via Agentic Planning and Graph-Guided Optimization

    Minh-Loi Nguyen, Xuan-Vu Le, Thanh-Toan Do +3

    cs.CVarXiv:2609.13006v12026
  20. Deep Multimodal Learning with Missing Modality: A Survey

    Renjie Wu, Hu Wang, Hsiang-Ting Chen +1

    cs.CVcs.AIcs.LGarXiv:2409.07825v42024
  21. Temporally Consistent Graph Extraction and Matching for Longitudinal Angiographic Images

    Linus Kreitner, Laurin Lux, Carmen Baumann +2

    cs.CVarXiv:2609.16889v12026
  22. JewelTry: Mask-Free Scale Aware Jewelry Virtual Try-On

    Xinlei Niu, Peixia Li, Jun Wang +5

    cs.CVarXiv:2609.16626v12026
  23. Navigating Text-To-Image Customization: From LyCORIS Fine-Tuning to Model Evaluation

    Shih-Ying Yeh, Yu-Guan Hsieh, Zhidong Gao +3

    cs.CVcs.AIcs.GRarXiv:2309.14859v22023
  24. Generative Retrieval for Unsupervised Text-Based Person Search

    Mang Ye, Yucheng Ji, Yang Bai +4

    cs.CVcs.AIarXiv:2609.12965v12026
  25. Learning Human-Perceived Fakeness in AI-Generated Videos via Multimodal LLMs

    Xingyu Fu, Siyi Liu, Yinuo Xu +13

    cs.CVcs.AIcs.CLarXiv:2509.22646v22025
  26. Taming Preference Mode Collapse via Directional Decoupling Alignment in Diffusion Reinforcement Learning

    Chubin Chen, Sujie Hu, Jiashu Zhu +8

    cs.CVarXiv:2512.24146v22025
  27. MHSA-Net: Multi-Head Self-Attention Network for Occluded Person Re-Identification

    Hongchen Tan, Xiuping Liu, Baocai Yin +1

    cs.CVarXiv:2008.04015v42020
  28. Thinking with Programming Vision: Towards a Unified View for Thinking with Images

    Zirun Guo, Minjie Hong, Feng Zhang +2

    cs.CVcs.CLarXiv:2512.03746v12025
  29. ActionPiece: Rethinking Action Tokenization for Autoregressive Vision-Language-Action Models

    Shijie Lian, Bin Yu, Zhaolong Shen +5

    cs.ROcs.AIcs.CLarXiv:2609.18487v12026
  30. Deep Reflectance Volumes: Relightable Reconstructions from Multi-View Photometric Images

    Sai Bi, Zexiang Xu, Kalyan Sunkavalli +4

    cs.CVcs.GRarXiv:2007.09892v12020
  31. From Google Maps to a Fine-Grained Catalog of Street trees

    Steve Branson, Jan Dirk Wegner, David Hall +3

    cs.CVcs.LGarXiv:1910.02675v12019
  32. NeRFusion: Fusing Radiance Fields for Large-Scale Scene Reconstruction

    Xiaoshuai Zhang, Sai Bi, Kalyan Sunkavalli +2

    cs.CVcs.GRarXiv:2203.11283v12022
  33. Scenario-Independent Criticality Assessment and Prediction for Vulnerable Road Users in Autonomous Driving

    Jörg Gamerdinger, Victor Schwarzenberger, Philipp Schmid +2

    cs.ROcs.CVcs.CYarXiv:2609.11947v12026
  34. SensatUrban: Learning Semantics from Urban-Scale Photogrammetric Point Clouds

    Qingyong Hu, Bo Yang, Sheikh Khalid +3

    cs.CVcs.ROarXiv:2201.04494v12022
  35. Pixel Decodability Is Not a Compression Signal: Causally Evaluating Importance Proxies for Visual KV-Cache Eviction

    Chenyu Zhou, Qiliang Jiang, Shuning Wu +1

    cs.CVarXiv:2609.13012v12026
  36. Lightweight Bimodal Network for Single-Image Super-Resolution via Symmetric CNN and Recursive Transformer

    Guangwei Gao, Zhengxue Wang, Juncheng Li +3

    cs.CVarXiv:2204.13286v12022
  37. PDNet: Prior-model Guided Depth-enhanced Network for Salient Object Detection

    Chunbiao Zhu, Xing Cai, Kan Huang +2

    cs.CVcs.AIcs.MMarXiv:1803.08636v22018
  38. VC-Attention: Value Smoothing and Softmax Casting for Low-bit Attention

    Xingyang Li, Dongyun Zou, Shining Zhang +8

    cs.CVarXiv:2609.15810v12026
  39. Light Field Reconstruction Using Convolutional Network on EPI and Extended Applications

    Gaochang Wu, Yebin Liu, Lu Fang +2

    eess.IVcs.CVarXiv:2103.13043v12021
  40. CLDA: Contrastive Learning for Semi-Supervised Domain Adaptation

    Ankit Singh

    cs.CVarXiv:2107.00085v22021
  41. SPEAR NeXT Causal Latent Forecasting Across Multiple Horizons for Spectral Temporal Earth Representation Learning

    Rajiv Ranjan, Udaiveer Singh, Shashank Tamaskar +1

    cs.CVarXiv:2609.16871v12026
  42. Temporal Convolutional Neural Network for the Classification of Satellite Image Time Series

    Charlotte Pelletier, Geoffrey I. Webb, Francois Petitjean

    cs.CVarXiv:1811.10166v22018
  43. EventEgoHands++: Event-based Egocentric 3D Hand Mesh Reconstruction with Real Dataset

    Ryosei Hara, Wataru Ikeda, Masashi Hatano +1

    cs.CVarXiv:2609.17189v12026
  44. ModaLens: Measuring Image Sensitivity in Report-Conditioned Medical VLMs

    Sebastián Andrés Cajas Ordóñez, Maximin Lange, Quang Bui +9

    cs.CVcs.AIarXiv:2609.15635v12026
  45. Adapting Pretrained Vision-Language Foundational Models to Medical Imaging Domains

    Pierre Chambon, Christian Bluethgen, Curtis P. Langlotz +1

    cs.CVcs.AIcs.CLarXiv:2210.04133v12022
  46. Temporal Memory Relation Network for Workflow Recognition from Surgical Video

    Yueming Jin, Yonghao Long, Cheng Chen +3

    cs.CVcs.AIarXiv:2103.16327v12021
  47. HouseDiffusion: Vector Floorplan Generation via a Diffusion Model with Discrete and Continuous Denoising

    Mohammad Amin Shabani, Sepidehsadat Hosseini, Yasutaka Furukawa

    cs.CVcs.AIarXiv:2211.13287v12022
  48. See, Hear, and Understand: Benchmarking Audiovisual Human Speech Understanding in Multimodal Large Language Models

    Le Thien Phuc Nguyen, Zhuoran Yu, Samuel Low Yu Hang +8

    cs.CVcs.AIcs.LGarXiv:2512.02231v22025
  49. Visual Search at Alibaba

    Yanhao Zhang, Pan Pan, Yun Zheng +4

    cs.CVarXiv:2102.04674v12021
  50. EVOLVE-VLA: Test-Time Training from Environment Feedback for Vision-Language-Action Models

    Zechen Bai, Chen Gao, Mike Zheng Shou

    cs.ROcs.CVarXiv:2512.14666v12025
  51. Next-Embedding Prediction Makes Strong Vision Learners

    Sihan Xu, Ziqiao Ma, Wenhao Chai +5

    cs.CVarXiv:2512.16922v22025
  52. SpaceTools: Tool-Augmented Spatial Reasoning via Double Interactive RL

    Siyi Chen, Mikaela Angelina Uy, Chan Hee Song +6

    cs.CVcs.ROarXiv:2512.04069v22025
  53. UniREditBench: A Unified Reasoning-based Image Editing Benchmark

    Feng Han, Yibin Wang, Chenglin Li +7

    cs.CVarXiv:2511.01295v32025
  54. Predicting Human Disagreement for Calibrated Dynamic Facial Expression Recognition

    Yiming Wang, Frederick W. B. Li, Jingyun Wang

    cs.CVarXiv:2609.17130v12026
  55. EgoPathBench: Evaluating Zero-Shot Egocentric Waypoint Decision-Making in Vision-Language Models

    Yang Zhao, Zhuo Chen, Xubo Yang

    cs.CVarXiv:2609.16610v12026
  56. Semantic Classification of 3D Point Clouds with Multiscale Spherical Neighborhoods

    Hugues Thomas, Jean-Emmanuel Deschaud, Beatriz Marcotegui +2

    cs.CVarXiv:1808.00495v12018
  57. Photo Wake-Up: 3D Character Animation from a Single Photo

    Chung-Yi Weng, Brian Curless, Ira Kemelmacher-Shlizerman

    cs.CVcs.GRarXiv:1812.02246v12018
  58. Crowd Counting Using Scale-Aware Attention Networks

    Mohammad Asiful Hossain, Mehrdad Hosseinzadeh, Omit Chanda +1

    cs.CVarXiv:1903.02025v12019
  59. YOLO-Master: MOE-Accelerated with Specialized Transformers for Enhanced Real-time Detection

    Xu Lin, Jinlong Peng, Zhenye Gan +2

    cs.CVarXiv:2512.23273v22025
  60. PanoGS-SLAM: Panoramic 3D Gaussian Splatting SLAM

    Yongqi Mao, Hao Shi, Yufan Zhang +3

    cs.CVarXiv:2609.17387v12026