Computer Vision and Pattern Recognition
Papers filed under cs.CV on arXiv, each one already summarized by Paperlayer. Open any of them to read the summary beside the original PDF, with every point linked to the line, figure, or table it came from.
Search paper metadata (including unsummarized papers)
901 to 960 of 18,792
DepthLM: Metric Depth From Vision Language Models
Zhipeng Cai, Ching-Feng Yeh, Hu Xu +7
cs.CVarXiv:2509.25413v22025BridgeMatch: Conditional Transport Bridges in Matching Matrix Space for 3D Deformable Registration
Qianliang Wu, Haobo Jiang, Guangwei Gao +4
cs.CVarXiv:2609.11472v12026Pre- and Post-Treatment Brain Metastases Segmentation Using nnU-Net with Post-Processing for BraTS 2026
Haobin Liu, Xin Wang
cs.CVarXiv:2609.11477v12026UBone3D: Physics-Rectified Conditional Flow Matching for Anatomical 3D Shape Completion from Ultrasound
Weiying Chen, Yuchong Gao, Siyuan Li +3
cs.CVeess.IVarXiv:2609.11506v12026Pillar-0: A New Frontier for Radiology Foundation Models
Kumar Krishna Agrawal, Longchao Liu, Long Lian +11
cs.CVcs.AIarXiv:2511.17803v12025MMSI-Video-Bench: A Holistic Benchmark for Video-Based Spatial Intelligence
Jingli Lin, Runsen Xu, Shaohao Zhu +11
cs.CVcs.AIarXiv:2512.10863v12025DeepMMSearch-R1: Empowering Multimodal LLMs in Multimodal Web Search
Kartik Narayan, Yang Xu, Tian Cao +7
cs.CVcs.IRarXiv:2510.12801v12025TIR-Bench: A Comprehensive Benchmark for Agentic Thinking-with-Images Reasoning
Ming Li, Jike Zhong, Shitian Zhao +6
cs.CVarXiv:2511.01833v22025Skyra: AI-Generated Video Detection via Grounded Artifact Reasoning
Yifei Li, Wenzhao Zheng, Yanran Zhang +5
cs.CVarXiv:2512.15693v22025Are Video Models Ready as Zero-Shot Reasoners? An Empirical Study with the MME-CoF Benchmark
Ziyu Guo, Xinyan Chen, Renrui Zhang +7
cs.CVcs.AIcs.CLarXiv:2510.26802v12025X-Part: high fidelity and structure coherent shape decomposition
Xinhao Yan, Jiachen Xu, Yang Li +8
cs.GRcs.CVarXiv:2509.08643v22025AlphaFlow: Understanding and Improving MeanFlow Models
Huijie Zhang, Aliaksandr Siarohin, Willi Menapace +4
cs.CVcs.LGarXiv:2510.20771v12025AlignTok: Aligning Visual Foundation Encoders to Tokenizers for Diffusion Models
Bowei Chen, Sai Bi, Hao Tan +6
cs.CVarXiv:2509.25162v22025G$^2$VLM: Geometry Grounded Vision Language Model with Unified 3D Reconstruction and Spatial Reasoning
Wenbo Hu, Jingli Lin, Yilin Long +7
cs.CVcs.AIcs.CLarXiv:2511.21688v22025Unified Diffusion VLA: Vision-Language-Action Model via Joint Discrete Denoising Diffusion Process
Jiayi Chen, Wenxuan Song, Pengxiang Ding +5
cs.ROcs.CVarXiv:2511.01718v22025Knowledge Distillation in Generations: More Tolerant Teachers Educate Better Students
Chenglin Yang, Lingxi Xie, Siyuan Qiao +1
cs.CVarXiv:1805.05551v22018A deep learning framework for quality assessment and restoration in video endoscopy
Sharib Ali, Felix Zhou, Adam Bailey +4
cs.CVcs.AIarXiv:1904.07073v12019Mask-Guided Portrait Editing with Conditional GANs
Shuyang Gu, Jianmin Bao, Hao Yang +3
cs.CVarXiv:1905.10346v12019Concerto: Joint 2D-3D Self-Supervised Learning Emerges Spatial Representations
Yujia Zhang, Xiaoyang Wu, Yixing Lao +4
cs.CVarXiv:2510.23607v22025Latent-Shift: Latent Diffusion with Temporal Shift for Efficient Text-to-Video Generation
Jie An, Songyang Zhang, Harry Yang +4
cs.CVarXiv:2304.08477v22023SimScale: Learning to Drive via Real-World Simulation at Scale
Haochen Tian, Tianyu Li, Haochen Liu +11
cs.CVcs.ROarXiv:2511.23369v32025DiP: Taming Diffusion Models in Pixel Space
Zhennan Chen, Junwei Zhu, Xu Chen +6
cs.CVarXiv:2511.18822v32025AdvCLIP: Downstream-agnostic Adversarial Examples in Multimodal Contrastive Learning
Ziqi Zhou, Shengshan Hu, Minghui Li +3
cs.CVarXiv:2308.07026v12023MiMo-Embodied: X-Embodied Foundation Model Technical Report
Xiaoshuai Hao, Lei Zhou, Zhijian Huang +41
cs.ROcs.CLcs.CVarXiv:2511.16518v22025VideoScore2: Think before You Score in Generative Video Evaluation
Xuan He, Dongfu Jiang, Ping Nie +21
cs.CVcs.AIcs.CLarXiv:2509.22799v12025TurboDiffusion: Accelerating Video Diffusion Models by 100-200 Times
Jintao Zhang, Kaiwen Zheng, Kai Jiang +5
cs.CVcs.AIcs.LGarXiv:2512.16093v12025Fara-7B: An Efficient Agentic Model for Computer Use
Ahmed Awadallah, Yash Lara, Raghav Magazine +9
cs.AIcs.CLcs.CVarXiv:2511.19663v12025MedSAM3: Delving into Segment Anything with Medical Concepts
Anglin Liu, Rundong Xue, Xu R. Cao +5
cs.CVcs.AIarXiv:2511.19046v12025A 3D Coarse-to-Fine Framework for Volumetric Medical Image Segmentation
Zhuotun Zhu, Yingda Xia, Wei Shen +2
cs.CVarXiv:1712.00201v22017Efficiently Reconstructing Dynamic Scenes One D4RT at a Time
Chuhan Zhang, Guillaume Le Moing, Skanda Koppula +11
cs.CVarXiv:2512.08924v22025AnyUp: Universal Feature Upsampling
Thomas Wimmer, Prune Truong, Marie-Julie Rakotosaona +4
cs.CVcs.LGarXiv:2510.12764v22025MathCanvas: Intrinsic Visual Chain-of-Thought for Multimodal Mathematical Reasoning
Weikang Shi, Aldrich Yu, Rongyao Fang +11
cs.CVcs.CLarXiv:2510.14958v12025DreamID-V:Bridging the Image-to-Video Gap for High-Fidelity Face Swapping via Diffusion Transformer
Xu Guo, Fulong Ye, Xinghui Li +6
cs.CVarXiv:2601.01425v12026Particle Filter Networks with Application to Visual Localization
Peter Karkus, David Hsu, Wee Sun Lee
cs.ROcs.AIcs.CVarXiv:1805.08975v32018Multi-Scale Attention with Dense Encoder for Handwritten Mathematical Expression Recognition
Jianshu Zhang, Jun Du, Lirong Dai
cs.CVarXiv:1801.03530v22018Brain-PACE: A Deep Siamese MRI Framework for Modelling Longitudinal Brain Acceleration
Samuel Maddox, Jacob Newman, Saber Sami +4
cs.CVarXiv:2609.11378v12026Vision Transformer with Attentive Pooling for Robust Facial Expression Recognition
Fanglei Xue, Qiangchang Wang, Zichang Tan +2
cs.CVarXiv:2212.05463v12022DINO-Med: A Unified Patch-Based Adaptation Framework for Multi-Modal Medical Image Analysis Applied to Liver Fibrosis Staging
Boya Wang, Ruizhe Li, Chao Chen +1
cs.CVarXiv:2609.11380v12026Vision Transformer-Based Multi-Level Feature Fusion for Multi-Label Sewer Defect Classification
Xu Fang, Zhuoran Wang, Qing Li +4
cs.CVarXiv:2609.11375v12026Identity-Preserving Talking Face Generation with Landmark and Appearance Priors
Weizhi Zhong, Chaowei Fang, Yinqi Cai +4
cs.CVcs.MMarXiv:2305.08293v12023Multi-Modal Controlled Coherent Motion Generation
Yifei Liu, Qiong Cao, Hongwei Yi +2
cs.CVarXiv:2609.11439v12026BruNet: A Cross-Domain Transfer Framework for Bruise Segmentation
Qiming Wang, Richard J. Motley, Ebube E. Obi +2
cs.CVarXiv:2609.11463v12026Generating Long Videos of Dynamic Scenes
Brooks, Tim, Hellsten, Janne, Aittala, Miika +6
cs.CVcs.AIcs.LGarXiv:2206.03429v22022Order-Aware 2.5D Multiple Instance Learning for Preoperative MRI-Based Perineural Invasion Risk Assessment in Intrahepatic Cholangiocarcinoma
Go, Hyunsu, Han, Youngung, Kim, Kyeonghun +11
cs.CVarXiv:2609.11271v12026Qwen-Image-Layered: Towards Inherent Editability via Layer Decomposition
Yin, Shengming, Zhang, Zekai, Tang, Zecheng +11
cs.CVarXiv:2512.15603v12025Summaries:한국어GRIPNet: Gaussian Radial Intensity Prior Guided Architecture for Pulmonary Nodule Detection in CT
Yang, Haojie, Su, Ran
cs.CVcs.AIarXiv:2609.11312v12026SAMV-DUSt3R: Instance-Centric 3D Scene Decoupling from Sparse Multi-Views
Zhao, Langxu, Gu, Zuan, Zhang, Yingdan +2
cs.CVarXiv:2609.11279v12026Predictive Multi-Landmark OCT Tracking for Increased Motion Robustness
Konrad Reuter, Suresh Guttikonda, Chaitali Uday Karekar +2
cs.CVarXiv:2609.11330v12026Recurrent Neural Network Transducer for Audio-Visual Speech Recognition
Takaki Makino, Hank Liao, Yannis Assael +4
eess.AScs.CLcs.CVarXiv:1911.04890v12019R4Tun: LLM-guided adaptive segmental tunnel lining segmentation in point clouds
Xinghui Tao, Zehao Ye, Guangming Wang +2
cs.CVarXiv:2609.11360v12026HALDETECT at ImageEval 2026 Shared Tasks: Answer-First Contrastive Grounding with QLoRA
Syed Mohaiminul Hoque, Md Sakhawat Hossain
cs.CVcs.AIarXiv:2609.11236v12026UniPixel: Unified Object Referring and Segmentation for Pixel-Level Visual Reasoning
Ye Liu, Zongyang Ma, Junfu Pu +4
cs.CVcs.AIarXiv:2509.18094v42025SCINTILLA-SNN: A Spiking Multi-Scale Selective Aggregation Network for Perineural Invasion Prediction
Youngung Han, Yului Jeong, Kyeonghun Kim +11
cs.CVarXiv:2609.11237v12026Uncertainty DMD: Restoring Diversity in Few-Step Autoregressive Video Distillation
Zixuan Duan, Xunzhi Xiang, Yabo Chen +6
cs.CVarXiv:2609.11265v12026From Evaluation to Enhancement: Benchmarking and Improving Think-with-Video Reasoning for Video Generative Models
Meng Luo, Yicheng Liu, Jiahao Wang +5
cs.CVcs.AIarXiv:2609.11242v12026Fast and Accurate Monomodal 3D High Resolution Deep Registration of Drosophila Larval Brain Volumes
Daniel Reisenbüchler, Yousef Sadegheih, Michael Dittrich +3
cs.CVarXiv:2609.11240v12026TILT: Transform Invariant Low-rank Textures
Zhengdong Zhang, Arvind Ganesh, Xiao Liang +1
cs.CVarXiv:1012.3216v12010Tri-DehazeGS: Scene--Medium Decoupled Gaussian Splatting with Transmittance-Aware Optimization
Kui Jiang, Yang Gu, Jiacheng Liu +3
cs.CVarXiv:2609.11223v12026CEM-TUDASR: Computationally efficient multi-modality transformer based unsupervised domain adaptive super-resolution approach
Anjali Sarvaiya, Jay Kadel, Kishor Upla +1
cs.CVarXiv:2609.11201v12026PhysX-Anything: Simulation-Ready Physical 3D Assets from Single Image
Ziang Cao, Fangzhou Hong, Zhaoxi Chen +2
cs.CVcs.ROarXiv:2511.13648v12025