Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

961 to 1,020 of 18,825

  1. MedSAM3: Delving into Segment Anything with Medical Concepts

    Anglin Liu, Rundong Xue, Xu R. Cao +5

    cs.CVcs.AIarXiv:2511.19046v12025
  2. A 3D Coarse-to-Fine Framework for Volumetric Medical Image Segmentation

    Zhuotun Zhu, Yingda Xia, Wei Shen +2

    cs.CVarXiv:1712.00201v22017
  3. Efficiently Reconstructing Dynamic Scenes One D4RT at a Time

    Chuhan Zhang, Guillaume Le Moing, Skanda Koppula +11

    cs.CVarXiv:2512.08924v22025
  4. AnyUp: Universal Feature Upsampling

    Thomas Wimmer, Prune Truong, Marie-Julie Rakotosaona +4

    cs.CVcs.LGarXiv:2510.12764v22025
  5. MathCanvas: Intrinsic Visual Chain-of-Thought for Multimodal Mathematical Reasoning

    Weikang Shi, Aldrich Yu, Rongyao Fang +11

    cs.CVcs.CLarXiv:2510.14958v12025
  6. DreamID-V:Bridging the Image-to-Video Gap for High-Fidelity Face Swapping via Diffusion Transformer

    Xu Guo, Fulong Ye, Xinghui Li +6

    cs.CVarXiv:2601.01425v12026
  7. Particle Filter Networks with Application to Visual Localization

    Peter Karkus, David Hsu, Wee Sun Lee

    cs.ROcs.AIcs.CVarXiv:1805.08975v32018
  8. Multi-Scale Attention with Dense Encoder for Handwritten Mathematical Expression Recognition

    Jianshu Zhang, Jun Du, Lirong Dai

    cs.CVarXiv:1801.03530v22018
  9. Brain-PACE: A Deep Siamese MRI Framework for Modelling Longitudinal Brain Acceleration

    Samuel Maddox, Jacob Newman, Saber Sami +4

    cs.CVarXiv:2609.11378v12026
  10. Vision Transformer with Attentive Pooling for Robust Facial Expression Recognition

    Fanglei Xue, Qiangchang Wang, Zichang Tan +2

    cs.CVarXiv:2212.05463v12022
  11. DINO-Med: A Unified Patch-Based Adaptation Framework for Multi-Modal Medical Image Analysis Applied to Liver Fibrosis Staging

    Boya Wang, Ruizhe Li, Chao Chen +1

    cs.CVarXiv:2609.11380v12026
  12. Vision Transformer-Based Multi-Level Feature Fusion for Multi-Label Sewer Defect Classification

    Xu Fang, Zhuoran Wang, Qing Li +4

    cs.CVarXiv:2609.11375v12026
  13. Identity-Preserving Talking Face Generation with Landmark and Appearance Priors

    Weizhi Zhong, Chaowei Fang, Yinqi Cai +4

    cs.CVcs.MMarXiv:2305.08293v12023
  14. Multi-Modal Controlled Coherent Motion Generation

    Yifei Liu, Qiong Cao, Hongwei Yi +2

    cs.CVarXiv:2609.11439v12026
  15. BruNet: A Cross-Domain Transfer Framework for Bruise Segmentation

    Qiming Wang, Richard J. Motley, Ebube E. Obi +2

    cs.CVarXiv:2609.11463v12026
  16. Generating Long Videos of Dynamic Scenes

    Brooks, Tim, Hellsten, Janne, Aittala, Miika +6

    cs.CVcs.AIcs.LGarXiv:2206.03429v22022
  17. Order-Aware 2.5D Multiple Instance Learning for Preoperative MRI-Based Perineural Invasion Risk Assessment in Intrahepatic Cholangiocarcinoma

    Go, Hyunsu, Han, Youngung, Kim, Kyeonghun +11

    cs.CVarXiv:2609.11271v12026
  18. Qwen-Image-Layered: Towards Inherent Editability via Layer Decomposition

    Yin, Shengming, Zhang, Zekai, Tang, Zecheng +11

    cs.CVarXiv:2512.15603v12025
    Summaries:한국어
  19. GRIPNet: Gaussian Radial Intensity Prior Guided Architecture for Pulmonary Nodule Detection in CT

    Yang, Haojie, Su, Ran

    cs.CVcs.AIarXiv:2609.11312v12026
  20. SAMV-DUSt3R: Instance-Centric 3D Scene Decoupling from Sparse Multi-Views

    Zhao, Langxu, Gu, Zuan, Zhang, Yingdan +2

    cs.CVarXiv:2609.11279v12026
  21. Predictive Multi-Landmark OCT Tracking for Increased Motion Robustness

    Konrad Reuter, Suresh Guttikonda, Chaitali Uday Karekar +2

    cs.CVarXiv:2609.11330v12026
  22. Recurrent Neural Network Transducer for Audio-Visual Speech Recognition

    Takaki Makino, Hank Liao, Yannis Assael +4

    eess.AScs.CLcs.CVarXiv:1911.04890v12019
  23. R4Tun: LLM-guided adaptive segmental tunnel lining segmentation in point clouds

    Xinghui Tao, Zehao Ye, Guangming Wang +2

    cs.CVarXiv:2609.11360v12026
  24. HALDETECT at ImageEval 2026 Shared Tasks: Answer-First Contrastive Grounding with QLoRA

    Syed Mohaiminul Hoque, Md Sakhawat Hossain

    cs.CVcs.AIarXiv:2609.11236v12026
  25. UniPixel: Unified Object Referring and Segmentation for Pixel-Level Visual Reasoning

    Ye Liu, Zongyang Ma, Junfu Pu +4

    cs.CVcs.AIarXiv:2509.18094v42025
  26. SCINTILLA-SNN: A Spiking Multi-Scale Selective Aggregation Network for Perineural Invasion Prediction

    Youngung Han, Yului Jeong, Kyeonghun Kim +11

    cs.CVarXiv:2609.11237v12026
  27. Uncertainty DMD: Restoring Diversity in Few-Step Autoregressive Video Distillation

    Zixuan Duan, Xunzhi Xiang, Yabo Chen +6

    cs.CVarXiv:2609.11265v12026
  28. From Evaluation to Enhancement: Benchmarking and Improving Think-with-Video Reasoning for Video Generative Models

    Meng Luo, Yicheng Liu, Jiahao Wang +5

    cs.CVcs.AIarXiv:2609.11242v12026
  29. Fast and Accurate Monomodal 3D High Resolution Deep Registration of Drosophila Larval Brain Volumes

    Daniel Reisenbüchler, Yousef Sadegheih, Michael Dittrich +3

    cs.CVarXiv:2609.11240v12026
  30. TILT: Transform Invariant Low-rank Textures

    Zhengdong Zhang, Arvind Ganesh, Xiao Liang +1

    cs.CVarXiv:1012.3216v12010
  31. Tri-DehazeGS: Scene--Medium Decoupled Gaussian Splatting with Transmittance-Aware Optimization

    Kui Jiang, Yang Gu, Jiacheng Liu +3

    cs.CVarXiv:2609.11223v12026
  32. CEM-TUDASR: Computationally efficient multi-modality transformer based unsupervised domain adaptive super-resolution approach

    Anjali Sarvaiya, Jay Kadel, Kishor Upla +1

    cs.CVarXiv:2609.11201v12026
  33. PhysX-Anything: Simulation-Ready Physical 3D Assets from Single Image

    Ziang Cao, Fangzhou Hong, Zhaoxi Chen +2

    cs.CVcs.ROarXiv:2511.13648v12025
  34. When is Test-Time Adaptation Identifiable From Unlabeled Evidence?

    Kartik Jhawar, Lipo Wang

    cs.CVarXiv:2609.11235v12026
  35. DreamOmni2: Multimodal Instruction-based Editing and Generation

    Bin Xia, Bohao Peng, Yuechen Zhang +10

    cs.CVarXiv:2510.06679v12025
  36. A Multi-View and Confusion-Guided Ensemble Framework for Robust Synthetic Image Attribution

    Zuomin Qu

    cs.CVarXiv:2609.11188v12026
  37. Beyond Visual Quality: Evaluating Physical Consistency under Ego-Motion with EgoGenEval

    Yilin Long, Chenming Zhu, Zitang Gou +2

    cs.CVcs.AIarXiv:2609.11172v12026
  38. MultiShotMaster: A Controllable Multi-Shot Video Generation Framework

    Qinghe Wang, Xiaoyu Shi, Baolu Li +7

    cs.CVarXiv:2512.03041v12025
  39. Human3R: Everyone Everywhere All at Once

    Yue Chen, Xingyu Chen, Yuxuan Xue +3

    cs.CVarXiv:2510.06219v22025
  40. ReconPlusGen: Injecting Reconstruction Prior into Multi-view 3D Generation through Noise Inversion and Modulation

    Jiarui Liu, Heng Li, Weiyu Li +7

    cs.CVarXiv:2609.11129v12026
  41. LAION-Mobile: Evaluating Deepfake Detectors On One Million Smartphone Photos

    Achim von Stryk, Janis Keuper

    cs.CVarXiv:2609.11134v12026
  42. Beyond Benchmarks: Using VLMs to Reveal Systematic Classification Failures Under Real World Conditions

    Dieuwertje Alblas, Alma M. Liezenga, Jan Erik van Woerden +3

    cs.CVcs.AIcs.ETarXiv:2609.11126v12026
  43. Toward Interpretable Multimodal Fusion: Heat Conduction Modeling for Hyperspectral and LiDAR Joint Classification

    Kan Wei, Jiahui Cui, Jing Yao +3

    cs.CVcs.AIarXiv:2609.11040v12026
  44. GRPO-Guard: Mitigating Implicit Over-Optimization in Flow Matching via Regulated Clipping

    Jing Wang, Jiajun Liang, Jie Liu +10

    cs.CVcs.LGarXiv:2510.22319v22025
  45. CamPilot: A Multi-Agent Cinematic Assistant for Camera-Controlled Movie Generation

    Yang Wu, Stefano Petrangeli, Ishita Dasgupta +1

    cs.CVarXiv:2609.10943v12026
  46. Decoupled DMD: CFG Augmentation as the Spear, Distribution Matching as the Shield

    Dongyang Liu, Peng Gao, David Liu +8

    cs.CVarXiv:2511.22677v12025
  47. TrajFusionNet+: Transformer-Based Prediction of Pedestrian Crossing Intention via Fusion of Trajectory Representations and Scene Graphs

    François G. Landry, Moulay A. Akhloufi

    cs.CVarXiv:2609.10806v12026
  48. StoryMem: Multi-shot Long Video Storytelling with Memory

    Kaiwen Zhang, Liming Jiang, Angtian Wang +6

    cs.CVarXiv:2512.19539v12025
  49. Overpainting: Localized Context-aware Diffusion Image Editing

    Sam Sartor, Iliyan Georgiev, Michael Fischer +2

    cs.CVarXiv:2609.10811v12026
  50. HiPerViT: A Hierarchical Perceiver-Vision Transformer Architecture for Multi-Scale Texture Recognition

    João Pedro C. A. de Sá, Odemir Martinez Bruno

    cs.CVarXiv:2609.10917v12026
  51. Evaluation of Vision-Language Models Across Diverse Coastal Environments

    Seth Knoop, Chad R. Samuelson, Gabriel R. Slade +2

    cs.CVcs.ROarXiv:2609.10855v12026
  52. Spotlight on Token Perception for Multimodal Reinforcement Learning

    Siyuan Huang, Xiaoye Qu, Yafu Li +4

    cs.CVarXiv:2510.09285v22025
  53. MixFormer: Mixing Features across Windows and Dimensions

    Qiang Chen, Qiman Wu, Jian Wang +5

    cs.CVarXiv:2204.02557v22022
  54. Two-Parameter Flow Map Learning for Continuous-Time Diffeomorphic Image Registration

    Mohammadjavad Matinkia, Nilanjan Ray

    cs.CVarXiv:2609.10789v12026
  55. FlashVSR: Towards Real-Time Diffusion-Based Streaming Video Super-Resolution

    Junhao Zhuang, Shi Guo, Xin Cai +4

    cs.CVarXiv:2510.12747v12025
  56. Shedding Light: A Benchmark for Evaluating Lighting Understanding in Generative Image Models

    Justine Giroux, Jack Oliver Hilliard, Yannick Hold-Geoffroy +2

    cs.CVarXiv:2609.10787v12026
  57. GRADE: Single-Frame Generative Radar Depth Estimation Under Visual Degradation

    Bin Zhao, Patrick Chiou, Nakul Garg

    cs.CVcs.ROarXiv:2609.10756v12026
  58. MHE-Former: Multi-Hypothesis Transformers via Entropy Maximization for 3D Mesh Recovery

    Boshu Jia, Rongyu Chen, Linlin Yang +9

    cs.CVarXiv:2609.10743v12026
  59. Rethinking Handwritten Character Recognition

    Ranjit Raut, Aarav Subedi, Ashim Shrestha

    cs.CVeess.IVarXiv:2609.10572v12026
  60. 3D Point Splatting for mmWave Radar Novel View Synthesis

    Adnan Armouti, Yixuan Gao, Rajalakshmi Nandakumar

    cs.CVcs.GRcs.LGarXiv:2609.11894v12026