Source-linked AI summary
From Reasoning to Pixels: Grounded Medical Multimodal LLMs for VQA and Segmentation
Haowen Gu, Gensheng Pei, Junzhu Mao, Qiong Wang, Mingwu Ren, Yazhou Yao
TL;DR
现有医学多模态系统通常缺乏像素级证据,而分割方法难以处理复杂的临床推理。MedREAL 通过 SARP 和 R2V 连接推理与定位,在 MedRAVS-13K 上达到 68.49% gIoU 和 70.47% cIoU。
问题
现有 Med-VQA 系统通常只能提供答案,缺乏像素级证据;而分割方法缺少问题驱动定位所需的复杂临床推理能力。
方法
MedREAL 利用 [SEG] tokens、SARP 和 R2V fusion 提取推理感知的语义证据,并引导 mask decoding。
结果
在 MedRAVS-13K 上达到 68.49% gIoU 和 70.47% cIoU,生成的证据 masks 在语义上与预测的临床答案一致。
要点与局限
MedREAL 提供了一个统一框架,用于在四种医学成像模态中对齐临床推理与空间证据。
要点与局限
MedSAM3 的高指标在很大程度上得益于显式的 ground-truth category prompts,以及在原始源数据集上的大规模 extensive pretraining。
Abstract
from arXiv · showhide
Although Multimodal Large Language Models (MLLMs) have demonstrated impressive performance in Medical Visual Question Answering (Med-VQA), their reliance on global image features often lacks precise pixel-level grounding, thereby limiting clinical trustworthiness. To bridge the semantic gap between high-level clinical reasoning and spatial localization, we propose \textsc{\textsc{MedREAL}} (\textbf{Med}ical \textbf{RE}asoning-driven \textbf{A}nswering and \textbf{L}ocalization), a unified framework that seamlessly aligns linguistic reasoning with spatial grounding. Specifically, \textsc{MedREAL} introduces \textbf{S}eg \textbf{A}nchored \textbf{R}easoning \textbf{P}ooling (SARP) to distill task-relevant semantic evidence directly from \texttt{[SEG]} tokens within the MLLM's hidden states. Furthermore, a \textbf{R}easoning-to-\textbf{V}isual (R2V) fusion mechanism is proposed to effectively inject these reasoning-aware features into a segmentation pipeline for accurate mask decoding. To facilitate this paradigm, we construct MedRAVS-13K, a comprehensive dataset comprising 13,824 expertly validated samples across four diverse imaging modalities. Extensive experiments demonstrate that \textsc{MedREAL} significantly outperforms state-of-the-arts, achieving 68.49\% gIoU and 70.47\% cIoU on benchmark evaluations. By generating evidence masks that are strictly consistent with textual diagnoses, \textsc{MedREAL} provides a robust, interpretable framework for reasoning-driven medical image analysis.
1 引言
MedREAL 通过显式的 [SEG] 推理锚点、推理感知特征融合和统一分割框架,弥合 Med-VQA 推理与像素级证据之间的鸿沟。MedRAVS-13K 以 13,824 个样本支持这一范式,实验结果表明其具备 state-of-the-art 的定位性能,并能生成与答案一致的证据掩码。
- 引言: 现有 Med-VQA 系统通常能够回答临床问题,却无法提供像素级证据;而分割方法通常只能定位空间区域,缺乏复杂的临床推理能力。SAM3 和 MedSAM3 [32] 等可提示模型支持文本条件分割,但主要依赖浅层词汇对齐。
- 引言: MedREAL 将显式的 [SEG] tokens 作为推理锚点,从 MLLM 隐状态中提取与答案相关的语义证据,以实现像素级定位。该设计针对 MLLM 表征主要受全局上下文和宽泛语言模式支配、从而掩盖具体视觉证据的问题。
- 引言: 68.49% gIoU 和 70.47% cIoU:MedREAL 达到 state-of-the-art 性能,同时生成与预测临床答案在语义上保持一致的证据掩码。这些结果在 MedRAVS-13K 上报告,针对的是缺乏像素级 grounding 的答案在可解释性和临床可信度方面的局限。
- 引言: SARP 提取与推理相关的特征,而 R2V fusion 将其注入基于 SAM 的分割流程,以实现精确且与答案一致的掩码解码。该框架连接语言推理与空间 grounding,而不是依赖浅层词汇对齐或直接拼接文本嵌入。
- 引言: MedRAVS-13K 包含来自四种成像模态的 13,824 samples,以及临床问答对和经过验证的像素级掩码。该数据集解决了同时评估临床推理与空间 grounding 的基准数据稀缺问题。
2 相关工作
医学 VQA 已从融合静态图像与语言特征,发展到具备复杂跨模态推理能力的 MLLM 。推理引导的分割将语义推理扩展到像素级预测,但既有工作主要面向自然场景,并使用单个 [seg] token 表示目标掩码 [36]。
- 医学视觉问答: 早期医学 VQA 将静态图像特征与语言编码融合 ,而近期 MLLM 通过大规模预训练实现复杂的跨模态推理 。这一转变推动了临床推理与空间定位的连接。
- 推理引导的分割: 推理引导的分割将高层语义推理纳入像素级预测,但现有研究主要处理自然场景,并使用一个 [seg] token 表示目标掩码 [36]。单 token 设计实现了语言与目标语义掩码之间的粗粒度对齐。
- 推理引导的分割: MedREAL 通过 R2V 将源自推理的特征注入分割过程,使掩码直接由诊断推理驱动。该框架将源自推理的特征与分割流程结合,使掩码与诊断保持一致。
3 方法
MedREAL 在具备推理能力的潜在空间中统一医学 VQA 与像素级分割,并以 MLLM 的诊断逻辑为条件生成局部化证据。SARP 从以 [SEG] 为锚点的隐藏状态中提取任务相关推理,R2V 则将其与视觉上下文融合,实现语义引导的掩码解码。
- 总体架构: MedREAL 联合生成临床答案与分割掩码,确保局部化视觉证据在语义上与 MLLM 的诊断推理保持一致。当需要进行定位时,该框架会提示一个专用的 [SEG] token,并以由此得到的推理表征作为掩码解码的条件。
- Seg-Anchored Reasoning Pooling (SARP): SARP 将 [SEG] 隐藏状态作为注意力锚点,从前置推理序列中聚合与诊断相关的语义,而不是依赖单个 token。掩码平均池化计算 hseg,随后查询-键-值注意力过滤语言噪声,生成紧凑的推理表征 hreason。
- Reasoning-to-Visual Fusion (R2V): R2V 将 hreason 与全局池化的多尺度视觉特征融合,并将融合结果投影为用于 SAM-based 掩码解码器的条件伪提示。该设计提供解剖学上下文,并以语义知情的引导替代点或框等几何提示。
- 训练目标: MedREAL 采用端到端训练,通过加权目标函数将自回归文本交叉熵与掩码 Binary Cross-Entropy 和 Dice 损失结合起来。Dice 分量用于处理医学病灶中的类别不平衡,而复合目标则使语言逻辑与像素级边界保持一致。
4 数据集
MedRAVS-13K 汇集跨模态、跨器官的异质医学图像,用于支持推理驱动的分割。其生成流程借助 [SEG] tokens,将临床生成的问答推理依据锚定到标注区域,并结合自动与人工质量保证。
- 数据集构成: MedRAVS-13K 覆盖超声、X-ray、皮肤镜和内镜图像,涉及乳腺、肺、皮肤和结肠,构成具有挑战性的多模态测试平台。数据涵盖异质的成像物理特性与病灶形态,从低对比度的超声边界到复杂的内镜黏膜纹理。
- 数据集生成: 该数据集流程将原始医学图像和真实标注掩膜,与模态和器官特异的提示相结合,生成具备推理感知能力的 QA 对。该流程整合图像与掩膜,生成推理感知文本,并实施严格的质量保证。
- 数据集生成: 每个生成序列都显式嵌入一个 [SEG] token,用于指示感兴趣区域,并将文本推理依据锚定到标注的解剖结构或病灶。该 token 机制旨在确保文本推理依据以分割标注为基础。
- 质量保证: 质量保证结合自动筛选与人工核验:自动筛选评估医学合理性、语义一致性和视觉相关性,人工核验 10% 的样本以确认临床与空间对齐。人工复核同时检查临床准确性,以及文本查询与分割掩膜之间的对齐情况。
5 实验
实验在 MedRAVS-13K 上将 MedREAL 与结构化、基于 agent 及 reasoning-segmentation 基线进行比较,表明具备 reasoning 感知能力的空间 grounding 可提升鲁棒性以及 mask–diagnosis 一致性。消融实验进一步表明,空间先验、SARP–R2V 耦合和更大的 reasoning backbone 是重要贡献因素。
- 比较评估: MedSAM3-Agent 的 overall gIoU 仅为 55.71%,而 oracle-prompted MedSAM3 达到 70.99%,揭示了以自主 reasoning 替代显式类别标签的严重代价。在 COVID-QU-Ex 上,MedSAM3-Agent 从 71.56% 降至 46.88%,显示出 decoupled reasoning 设置的脆弱性。
- 消融研究: 仅使用 Box Guidance 时,gIoU 从不含三个组件时的 11.35% 提升至 45.02%,但不含 R2V 的 SARP 仅达到 45.50% gIoU,且 cIoU 仍然较低。这些结果表明,粗粒度空间先验能够带来显著帮助,而精确的语义对齐需要将 reasoning 提取与视觉融合结合起来。
- Scaling 行为: 将 Qwen3-VL-2B-Instruct 替换为 frozen architecture 的 4B-Instruct backbone 后,gIoU 从 68.49% 提升至 75.96%,证实了 MLLM scaling 带来的收益。实验将这一改进归因于更强的 reasoning 能力被转化为更准确的定位。
- 跨模态鲁棒性: MedREAL 在 BUSI、COVID-QU-Ex、ISIC-2018 和 Kvasir-SEG 上均生成精确且具 artifact 鲁棒性的 masks,而竞争模型在低对比度、弥漫性感染、视觉噪声或不规则边界下表现失效。MedREAL 通过 SARP 和 R2V 将诊断 reasoning 注入 visual decoder,从而支持 artifact 去除和边界精度提升。
- Reasoning-to-Mask 一致性: MedREAL 依据 clinical logic 而非视觉显著性定位病理区域,相较于 LISA,提升了生成的 VQA 文本与 segmentation masks 之间的一致性。Figure 6 突出了 LISA 在错误文本预测与 false-positive masks 之间的不匹配,而 MedREAL 保持了语义一致性。
6 结论
MedREAL 在医学多模态大语言模型中衔接高层诊断推理与像素级空间定位。它结合 SARP 和 R2V Fusion,提取局部化语义证据并指导精确掩码解码。
- 结论: MedREAL 弥合了医学多模态大语言模型中诊断推理与像素级空间定位之间的语义鸿沟。该方法被提出为连接高层推理与空间定位的统一框架。
- 结论: SARP 从模型的内部推理序列中提炼局部化语义证据。该机制的全称为 Seg-Anchored Reasoning Pooling。
- 结论: R2V Fusion 利用推理感知证据指导精确掩码解码。它与 SARP 共同将内部推理连接至视觉分割输出。
- 结论: 该框架得到新近整理的 MedRAVS-13K 基准的支持。