Computer Vision and Pattern Recognition

Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.

Search paper metadata (including unsummarized papers)

901 to 960 of 18,792

  1. DepthLM: Metric Depth From Vision Language Models

    Zhipeng Cai, Ching-Feng Yeh, Hu Xu +7

    cs.CVarXiv:2509.25413v22025
  2. BridgeMatch: Conditional Transport Bridges in Matching Matrix Space for 3D Deformable Registration

    Qianliang Wu, Haobo Jiang, Guangwei Gao +4

    cs.CVarXiv:2609.11472v12026
  3. Pre- and Post-Treatment Brain Metastases Segmentation Using nnU-Net with Post-Processing for BraTS 2026

    Haobin Liu, Xin Wang

    cs.CVarXiv:2609.11477v12026
  4. UBone3D: Physics-Rectified Conditional Flow Matching for Anatomical 3D Shape Completion from Ultrasound

    Weiying Chen, Yuchong Gao, Siyuan Li +3

    cs.CVeess.IVarXiv:2609.11506v12026
  5. Pillar-0: A New Frontier for Radiology Foundation Models

    Kumar Krishna Agrawal, Longchao Liu, Long Lian +11

    cs.CVcs.AIarXiv:2511.17803v12025
  6. MMSI-Video-Bench: A Holistic Benchmark for Video-Based Spatial Intelligence

    Jingli Lin, Runsen Xu, Shaohao Zhu +11

    cs.CVcs.AIarXiv:2512.10863v12025
  7. DeepMMSearch-R1: Empowering Multimodal LLMs in Multimodal Web Search

    Kartik Narayan, Yang Xu, Tian Cao +7

    cs.CVcs.IRarXiv:2510.12801v12025
  8. TIR-Bench: A Comprehensive Benchmark for Agentic Thinking-with-Images Reasoning

    Ming Li, Jike Zhong, Shitian Zhao +6

    cs.CVarXiv:2511.01833v22025
  9. Skyra: AI-Generated Video Detection via Grounded Artifact Reasoning

    Yifei Li, Wenzhao Zheng, Yanran Zhang +5

    cs.CVarXiv:2512.15693v22025
  10. Are Video Models Ready as Zero-Shot Reasoners? An Empirical Study with the MME-CoF Benchmark

    Ziyu Guo, Xinyan Chen, Renrui Zhang +7

    cs.CVcs.AIcs.CLarXiv:2510.26802v12025
  11. X-Part: high fidelity and structure coherent shape decomposition

    Xinhao Yan, Jiachen Xu, Yang Li +8

    cs.GRcs.CVarXiv:2509.08643v22025
  12. AlphaFlow: Understanding and Improving MeanFlow Models

    Huijie Zhang, Aliaksandr Siarohin, Willi Menapace +4

    cs.CVcs.LGarXiv:2510.20771v12025
  13. AlignTok: Aligning Visual Foundation Encoders to Tokenizers for Diffusion Models

    Bowei Chen, Sai Bi, Hao Tan +6

    cs.CVarXiv:2509.25162v22025
  14. G$^2$VLM: Geometry Grounded Vision Language Model with Unified 3D Reconstruction and Spatial Reasoning

    Wenbo Hu, Jingli Lin, Yilin Long +7

    cs.CVcs.AIcs.CLarXiv:2511.21688v22025
  15. Unified Diffusion VLA: Vision-Language-Action Model via Joint Discrete Denoising Diffusion Process

    Jiayi Chen, Wenxuan Song, Pengxiang Ding +5

    cs.ROcs.CVarXiv:2511.01718v22025
  16. Knowledge Distillation in Generations: More Tolerant Teachers Educate Better Students

    Chenglin Yang, Lingxi Xie, Siyuan Qiao +1

    cs.CVarXiv:1805.05551v22018
  17. A deep learning framework for quality assessment and restoration in video endoscopy

    Sharib Ali, Felix Zhou, Adam Bailey +4

    cs.CVcs.AIarXiv:1904.07073v12019
  18. Mask-Guided Portrait Editing with Conditional GANs

    Shuyang Gu, Jianmin Bao, Hao Yang +3

    cs.CVarXiv:1905.10346v12019
  19. Concerto: Joint 2D-3D Self-Supervised Learning Emerges Spatial Representations

    Yujia Zhang, Xiaoyang Wu, Yixing Lao +4

    cs.CVarXiv:2510.23607v22025
  20. Latent-Shift: Latent Diffusion with Temporal Shift for Efficient Text-to-Video Generation

    Jie An, Songyang Zhang, Harry Yang +4

    cs.CVarXiv:2304.08477v22023
  21. SimScale: Learning to Drive via Real-World Simulation at Scale

    Haochen Tian, Tianyu Li, Haochen Liu +11

    cs.CVcs.ROarXiv:2511.23369v32025
  22. DiP: Taming Diffusion Models in Pixel Space

    Zhennan Chen, Junwei Zhu, Xu Chen +6

    cs.CVarXiv:2511.18822v32025
  23. AdvCLIP: Downstream-agnostic Adversarial Examples in Multimodal Contrastive Learning

    Ziqi Zhou, Shengshan Hu, Minghui Li +3

    cs.CVarXiv:2308.07026v12023
  24. MiMo-Embodied: X-Embodied Foundation Model Technical Report

    Xiaoshuai Hao, Lei Zhou, Zhijian Huang +41

    cs.ROcs.CLcs.CVarXiv:2511.16518v22025
  25. VideoScore2: Think before You Score in Generative Video Evaluation

    Xuan He, Dongfu Jiang, Ping Nie +21

    cs.CVcs.AIcs.CLarXiv:2509.22799v12025
  26. TurboDiffusion: Accelerating Video Diffusion Models by 100-200 Times

    Jintao Zhang, Kaiwen Zheng, Kai Jiang +5

    cs.CVcs.AIcs.LGarXiv:2512.16093v12025
  27. Fara-7B: An Efficient Agentic Model for Computer Use

    Ahmed Awadallah, Yash Lara, Raghav Magazine +9

    cs.AIcs.CLcs.CVarXiv:2511.19663v12025
  28. MedSAM3: Delving into Segment Anything with Medical Concepts

    Anglin Liu, Rundong Xue, Xu R. Cao +5

    cs.CVcs.AIarXiv:2511.19046v12025
  29. A 3D Coarse-to-Fine Framework for Volumetric Medical Image Segmentation

    Zhuotun Zhu, Yingda Xia, Wei Shen +2

    cs.CVarXiv:1712.00201v22017
  30. Efficiently Reconstructing Dynamic Scenes One D4RT at a Time

    Chuhan Zhang, Guillaume Le Moing, Skanda Koppula +11

    cs.CVarXiv:2512.08924v22025
  31. AnyUp: Universal Feature Upsampling

    Thomas Wimmer, Prune Truong, Marie-Julie Rakotosaona +4

    cs.CVcs.LGarXiv:2510.12764v22025
  32. MathCanvas: Intrinsic Visual Chain-of-Thought for Multimodal Mathematical Reasoning

    Weikang Shi, Aldrich Yu, Rongyao Fang +11

    cs.CVcs.CLarXiv:2510.14958v12025
  33. DreamID-V:Bridging the Image-to-Video Gap for High-Fidelity Face Swapping via Diffusion Transformer

    Xu Guo, Fulong Ye, Xinghui Li +6

    cs.CVarXiv:2601.01425v12026
  34. Particle Filter Networks with Application to Visual Localization

    Peter Karkus, David Hsu, Wee Sun Lee

    cs.ROcs.AIcs.CVarXiv:1805.08975v32018
  35. Multi-Scale Attention with Dense Encoder for Handwritten Mathematical Expression Recognition

    Jianshu Zhang, Jun Du, Lirong Dai

    cs.CVarXiv:1801.03530v22018
  36. Brain-PACE: A Deep Siamese MRI Framework for Modelling Longitudinal Brain Acceleration

    Samuel Maddox, Jacob Newman, Saber Sami +4

    cs.CVarXiv:2609.11378v12026
  37. Vision Transformer with Attentive Pooling for Robust Facial Expression Recognition

    Fanglei Xue, Qiangchang Wang, Zichang Tan +2

    cs.CVarXiv:2212.05463v12022
  38. DINO-Med: A Unified Patch-Based Adaptation Framework for Multi-Modal Medical Image Analysis Applied to Liver Fibrosis Staging

    Boya Wang, Ruizhe Li, Chao Chen +1

    cs.CVarXiv:2609.11380v12026
  39. Vision Transformer-Based Multi-Level Feature Fusion for Multi-Label Sewer Defect Classification

    Xu Fang, Zhuoran Wang, Qing Li +4

    cs.CVarXiv:2609.11375v12026
  40. Identity-Preserving Talking Face Generation with Landmark and Appearance Priors

    Weizhi Zhong, Chaowei Fang, Yinqi Cai +4

    cs.CVcs.MMarXiv:2305.08293v12023
  41. Multi-Modal Controlled Coherent Motion Generation

    Yifei Liu, Qiong Cao, Hongwei Yi +2

    cs.CVarXiv:2609.11439v12026
  42. BruNet: A Cross-Domain Transfer Framework for Bruise Segmentation

    Qiming Wang, Richard J. Motley, Ebube E. Obi +2

    cs.CVarXiv:2609.11463v12026
  43. Generating Long Videos of Dynamic Scenes

    Brooks, Tim, Hellsten, Janne, Aittala, Miika +6

    cs.CVcs.AIcs.LGarXiv:2206.03429v22022
  44. Order-Aware 2.5D Multiple Instance Learning for Preoperative MRI-Based Perineural Invasion Risk Assessment in Intrahepatic Cholangiocarcinoma

    Go, Hyunsu, Han, Youngung, Kim, Kyeonghun +11

    cs.CVarXiv:2609.11271v12026
  45. Qwen-Image-Layered: Towards Inherent Editability via Layer Decomposition

    Yin, Shengming, Zhang, Zekai, Tang, Zecheng +11

    cs.CVarXiv:2512.15603v12025
    Summaries:한국어
  46. GRIPNet: Gaussian Radial Intensity Prior Guided Architecture for Pulmonary Nodule Detection in CT

    Yang, Haojie, Su, Ran

    cs.CVcs.AIarXiv:2609.11312v12026
  47. SAMV-DUSt3R: Instance-Centric 3D Scene Decoupling from Sparse Multi-Views

    Zhao, Langxu, Gu, Zuan, Zhang, Yingdan +2

    cs.CVarXiv:2609.11279v12026
  48. Predictive Multi-Landmark OCT Tracking for Increased Motion Robustness

    Konrad Reuter, Suresh Guttikonda, Chaitali Uday Karekar +2

    cs.CVarXiv:2609.11330v12026
  49. Recurrent Neural Network Transducer for Audio-Visual Speech Recognition

    Takaki Makino, Hank Liao, Yannis Assael +4

    eess.AScs.CLcs.CVarXiv:1911.04890v12019
  50. R4Tun: LLM-guided adaptive segmental tunnel lining segmentation in point clouds

    Xinghui Tao, Zehao Ye, Guangming Wang +2

    cs.CVarXiv:2609.11360v12026
  51. HALDETECT at ImageEval 2026 Shared Tasks: Answer-First Contrastive Grounding with QLoRA

    Syed Mohaiminul Hoque, Md Sakhawat Hossain

    cs.CVcs.AIarXiv:2609.11236v12026
  52. UniPixel: Unified Object Referring and Segmentation for Pixel-Level Visual Reasoning

    Ye Liu, Zongyang Ma, Junfu Pu +4

    cs.CVcs.AIarXiv:2509.18094v42025
  53. SCINTILLA-SNN: A Spiking Multi-Scale Selective Aggregation Network for Perineural Invasion Prediction

    Youngung Han, Yului Jeong, Kyeonghun Kim +11

    cs.CVarXiv:2609.11237v12026
  54. Uncertainty DMD: Restoring Diversity in Few-Step Autoregressive Video Distillation

    Zixuan Duan, Xunzhi Xiang, Yabo Chen +6

    cs.CVarXiv:2609.11265v12026
  55. From Evaluation to Enhancement: Benchmarking and Improving Think-with-Video Reasoning for Video Generative Models

    Meng Luo, Yicheng Liu, Jiahao Wang +5

    cs.CVcs.AIarXiv:2609.11242v12026
  56. Fast and Accurate Monomodal 3D High Resolution Deep Registration of Drosophila Larval Brain Volumes

    Daniel Reisenbüchler, Yousef Sadegheih, Michael Dittrich +3

    cs.CVarXiv:2609.11240v12026
  57. TILT: Transform Invariant Low-rank Textures

    Zhengdong Zhang, Arvind Ganesh, Xiao Liang +1

    cs.CVarXiv:1012.3216v12010
  58. Tri-DehazeGS: Scene--Medium Decoupled Gaussian Splatting with Transmittance-Aware Optimization

    Kui Jiang, Yang Gu, Jiacheng Liu +3

    cs.CVarXiv:2609.11223v12026
  59. CEM-TUDASR: Computationally efficient multi-modality transformer based unsupervised domain adaptive super-resolution approach

    Anjali Sarvaiya, Jay Kadel, Kishor Upla +1

    cs.CVarXiv:2609.11201v12026
  60. PhysX-Anything: Simulation-Ready Physical 3D Assets from Single Image

    Ziang Cao, Fangzhou Hong, Zhaoxi Chen +2

    cs.CVcs.ROarXiv:2511.13648v12025