Source-linked AI summary
Breaking Failure Cascades: Step-Aware Reinforcement Learning for Medical Multimodal Reasoning
Junha Jung, Minbyul Jeong, Suhyeon Lim, Sungwook Jung, Jaehoon Yun, Taeyun Roh, Mujeen Sung, Jaewoo Kang
TL;DR
Outcome-centric post-training은 open-ended medical VQA에서 단계별 추론에 필요한 감독을 희소하고 지연된 형태로 제공한다. MRPO는 더 이른 invalid reasoning에 더 강한 패널티를 부여하는 step-wise reward를 추가하며, 세 multimodal backbone에서 GRPO와 GDPO를 일관되게 능가하고 Qwen3-VL-8B-Instruct에서 HuatuoGPT-Vision-34B를 2.79점 앞선다.
문제
Outcome-centric post-training은 open-ended medical VQA에서 중간 추론 실패를 식별하기 위한 차별화된 감독이 부족하다.
방법
MRPO는 step-wise process reward를 도입하고 최종 답변이 틀리면 더 이른 invalid reasoning step에 지수적으로 더 큰 패널티를 부여한다.
결과
세 multimodal backbone에서 MRPO는 GRPO와 GDPO보다 높은 평균 성능을 달성하며, Qwen3-VL-8B-Instruct에서 HuatuoGPT-Vision-34B를 2.79점 앞선다.
시사점 및 한계
MRPO는 초기 단계 추론 실패를 64.0%에서 13.0%로 줄이며, 더 높은 medical VQA 성능과 함께 추론 실패 양상도 개선됨을 보여준다.
시사점 및 한계
MRPO의 step-wise reward 구성은 MedThink의 gold reasoning annotation에 의존하므로, gold rationale이 없는 환경에 직접 적용하기 어렵다.
Abstract
from arXiv · showhide
Recent multimodal large language models have shown great promise in clinical image reasoning, but existing post-training pipelines remain predominantly outcome-centric, relying on final answer correctness or sequence-level preferences. This suffers from sparse credit assignment, making it difficult to optimize the reasoning process essential for clinical applications. Our analysis reveals that cascading errors from early-stage reasoning failures are a leading cause of incorrect predictions in medical visual question answering (VQA) benchmarks. Motivated by this, we propose Medical Reasoning-aware Policy Optimization (MRPO), an RL algorithm that incorporates step-wise process rewards. When the final answer is incorrect, MRPO assigns exponentially larger penalties to tokens in earlier invalid reasoning steps, breaking failure cascades without compromising successful paths. Across three multimodal LLM backbones, MRPO consistently outperforms standard GRPO and a recent RL baseline, and on Qwen3-VL-8B-Instruct even surpasses substantially larger medical MLLMs such as HuatuoGPT-Vision-34B by 2.79 points. Moreover, MRPO reduces early-stage reasoning failures from 64.0% to 13.0%, showing that targeted mitigation of cascading failures improves both reasoning quality and final answer accuracy. Our code is available at https://github.com/dmis-lab/MRPO
1 서론
Medical MLLM의 post-training은 희소한 outcome-centric 피드백과 초기 reasoning failure의 연쇄로 제약된다. MRPO는 step-wise process reward와 초기 invalid step에 대한 지수적으로 강화된 penalty로 두 문제를 해결해, 세 backbone 전반에서 reasoning과 answer accuracy를 향상한다.
- 동기: Medical MLLM의 post-training은 여전히 outcome-centric이므로, final 또는 sequence-level reward로는 실패한 intermediate reasoning step을 식별할 수 없어 sparse credit assignment가 발생한다.이 문제는 response가 완료될 때까지 reward가 희소하고 지연되는 free-form generation에서 특히 심각하다.
- 실패 분석: 초기 reasoning failure는 전파되고 누적되어 failure cascade를 일으키며, 첫 invalid step은 incorrect final answer와 강한 상관을 보인다.이 분석은 open-ended medical VQA benchmark에서 기존 MLLM이 생성한 sentence-level reasoning trace를 기반으로 한다.
- 방법: MRPO는 answer reward와 step-wise process reward를 결합하고, prediction이 incorrect일 때 초기 invalid step에 지수적으로 더 큰 penalty를 부여한다.이 방법은 성공적인 trajectory를 보존하면서 GRPO (Shao et al., 2024) 기반 advantage를 재구성하고, 첫 invalid step에서의 correction을 유도한다.
- 실험 결과: MRPO는 세 multimodal LLM backbone 전반에서 가장 높은 average performance를 달성하며, 13K training sample만으로 GRPO와 GDPO를 능가한다.평가는 다양한 open-ended medical VQA benchmark에서 Qwen2.5-VL-7B-Instruct, Qwen3-VL-8B-Instruct, InternVL3-8B-Instruct를 사용해 수행한다.
- 실험 결과: MRPO는 early-stage reasoning failure를 64.0%에서 13.0%로 줄이는 동시에 downstream failure accumulation을 완화한다.이 개선은 초기 invalid reasoning이 전파되어 final answer를 무너뜨리는 failure pattern을 겨냥한다.
- 실험 결과: Qwen3-VL-8B-Instruct에서 MRPO는 더 큰 모델인 HuatuoGPT-Vision-34B를 2.79 points 차이로 능가한다.이 비교는 cross-backbone evaluation의 일부로 보고된다.
2 관련 연구
의료 multimodal language model은 vision-language task에서 supervised fine-tuning에서 GRPO 기반 reinforcement learning으로 발전해 왔다. 최근 방법들은 reasoning step을 process reward, inference-time verifier 또는 offline preference로 평가함으로써 final-answer supervision을 넘어선다.
- Multimodal large language model은 의료 vision-language task에 맞게 조정되었다 (Li et al., 2023; Sellergren et al., 2025).
- 의료 vision-language training은 DeepSeek-R1 에 이어 supervised fine-tuning (Sun et al., 2025; Kim et al., 2025)에서 GRPO 기반 reinforcement learning (Lai et al., 2025; Pan et al., 2025; Su et al., 2025)으로 발전했다.
- 최근 연구는 final-answer supervision을 넘어 개별 reasoning step을 평가하고, 이를 reinforcement learning의 process reward (Fan et al., 2025; Zhi et al., 2025), inference-time verifier (Yun et al., 2025) 또는 offline preference로 활용한다.
3 예비 실험
네 개의 멀티모달 LLM과 세 개의 의료 VQA 벤치마크를 대상으로 한 예비 실험에서 초기 추론 실패가 오답 및 이후 실패 누적과 강하게 연관됨을 보였다. 이러한 결과는 학습 신호를 모든 토큰에 균등하게 분배하기보다 앞선 잘못된 추론 단계에 초점을 맞춘 단계별 패널티의 필요성을 뒷받침한다.
- 모델 및 벤치마크: 분석 대상은 VQA-RAD, SLAKE, PathVQA에서 평가된 범용 또는 의료 특화 MLLM 네 개이며, MedThink가 정렬된 gold rationale을 제공한다.모델은 Qwen3-VL-8B-Instruct, InternVL3-8B-Instruct, HuatuoGPT-Vision-7B, Lingshu-7B다.
- 결과 및 분석: 첫 추론 실패가 더 일찍 발생할수록 오답률이 높았으며, 오답 사례는 FFP 구간 전반에서 실패 누적이 더 크게 나타났다.Figure 1은 FFP와 FAR을 분석한다. FFP는 첫 번째 잘못된 단계의 상대적 위치 k/K로 정의되며, FAR은 해당 실패 이후 남은 단계 중 실패한 단계의 비율이다.
- 평가 지표: 단계의 타당성은 GPT-5-mini가 Groundedness 또는 Answer Contribution을 사용해 문장 수준에서 판단하며, gold rationale과 다른 타당한 추론 경로도 허용한다.평가 프로토콜은 도메인 관련 관찰 또는 추론과 해당 단계가 정답을 직접 뒷받침하는지를 평가하며, 사람 평가에서 두 프로토콜 모두와 상당한 일치도가 확인됐다.
- 결과 및 분석: 관찰된 오류 cascade는 MRPO의 동기를 제공한다. MRPO는 추론을 단계별로 평가하고 trajectory가 실패하면 앞선 잘못된 단계의 토큰에 더 큰 패널티를 부여한다.이는 추론 실패의 근본 원인을 겨냥하며, 토큰 전반에 학습 신호를 균등하게 분배하는 표준 GRPO 기반 방법과 다르다.
4 접근법
MRPO는 answer, step-wise reasoning, length reward와 step-aware advantage shaping을 결합해 medical VQA의 초기 reasoning failure를 교정한다. 최종 answer가 틀린 경우에만 더 이른 invalid step을 강하게 penalize하고, 성공적인 reasoning path는 보존한다.
- Reward Design: 이 방법은 answer, step-averaged reasoning-process, length reward를 total training reward로 결합한다.Answer quality는 lexical overlap과 semantic similarity를 사용하고, length component는 reasoning-trace 크기를 regularize한다.
- Reasoning Process Reward: Reasoning-process reward는 한 step이 gold finding과 일치하거나 correct answer에 직접 기여할 때 해당 step을 valid로 표시한다.이를 통해 exact gold-path matching을 요구하지 않고도 동일한 diagnosis에 도달하는 alternative reasoning trajectory를 허용한다.
- Length Reward: Length reward는 4–10 sentence-level step을 벗어나는 trace를 penalize해 적절한 길이의 reasoning을 유도한다.Diagnostic step을 생략한 insufficient trace와 redundant information을 포함한 excessively long trace를 모두 penalize한다.
- Policy Optimization: MRPO는 reasoning step별 learning signal을 구분해 사용하는 방식으로 sequence-level GRPO supervision을 보완하며, τ = 0.6으로 final answer를 분류한다.GRPO (Shao et al., 2024)는 그렇지 않으면 동일한 sequence-level signal을 모든 token에 균일하게 적용하므로 early-stage failure의 완화를 제한한다.
- Step-wise Advantage Shaping: MRPO는 token-level advantage를 재구성해 final answer가 틀린 경우 더 이른 invalid reasoning step에 exponentially larger penalty가 부여되도록 한다.Correct-answer trajectory에는 reweighting을 적용하지 않아 성공적인 reasoning path를 보존하면서 failed trace를 집중적으로 다룬다.
5 실험
서로 비교 가능한 세 가지 multimodal LLM backbone에서 MRPO는 baseline보다 medical VQA 성능을 높였고, 대안적 training method를 일관되게 능가한다. Step-wise optimization은 failure onset을 늦추고 downstream failure accumulation도 줄인다.
- 실험 설정: 실험은 VQA-RAD, SLAKE, PathVQA, MedThink의 open-ended medical VQA data로 학습하고, 세 가지 open-source backbone을 평가하며, GPT-5-mini의 이진 answer judgment를 사용한다.평가는 in-distribution 및 unseen-modality out-of-distribution benchmark를 포함하며, judging protocol에 대한 human alignment validation 결과도 보고한다.
- MLLM과의 비교: MRPO는 세 backbone 모두에서 성능을 높였으며, Qwen3-VL-8B-Instruct에서 평가 모델 평균 최고치를 기록해 25.61에서 28.94로 상승했다.5개 benchmark 중 3개에서 최고 점수를 달성했고, RadImageNet-VQA에서는 baseline보다 7.05 points 향상됐다.
- Backbone 간 Ablation: MRPO는 세 backbone 모두에서 가장 높은 평균을 달성했으며, 각각 GRPO를 0.73, 0.40, 1.10 points씩 능가한다.SFT는 in-distribution 성능을 높이지만 out of distribution으로 안정적으로 transfer되지 않는 반면, RL method는 두 distribution 모두를 개선한다.
- First Failure Point 분석: MRPO는 early-stage failure를 64.0%에서 13.0%로 줄였으며, GRPO의 21.2%, GDPO의 21.4%와 비교된다. 동시에 late-stage failure는 47.0%로 이동했다.FFP distribution은 세 backbone에 걸쳐 평균을 내고, failure를 Early, Mid, Late-Stage 구간으로 그룹화한다.
- Failure Accumulation 분석: MRPO는 FFP 0.0에서 0.6까지 가장 낮은 FAR을 기록했으며, 0.0–0.2 bin에서 baseline의 64.6%, GRPO의 62.9%, GDPO의 58.4%에 비해 43.3%에 도달했다.낮은 FAR은 first failure 이후 더 효과적으로 recovery한다는 의미이며, 특히 failure가 일찍 시작될 때 그렇다.
6 결론
개방형 medical VQA에서는 초기 단계의 reasoning failure가 체계적으로 전파되며 최종 예측 오류를 지배한다. 이는 outcome-centric 접근법의 핵심 한계를 드러낸다. MRPO는 step-wise reasoning reward를 통합하고 최종 답변이 틀린 경우 더 이른 invalid step에 지수적으로 더 큰 penalty를 부여함으로써 이를 해결한다.
- 6 결론: 개방형 medical VQA에서 초기 단계의 reasoning failure가 체계적으로 전파되며 최종 예측 오류를 지배한다.이는 outcome-centric 접근법의 핵심 한계를 드러낸다.
- 6 결론: MRPO는 step-wise reasoning reward를 policy optimization에 통합해 reasoning failure가 처음 발생한 지점을 겨냥한다.최종 답변이 틀린 경우 더 이른 invalid step에 지수적으로 더 큰 penalty를 부여한다.
제한사항 … B.1 인간–LLM 평가자 정렬
이 논문은 MRPO를 의료 멀티모달 추론 및 process supervision 연구의 맥락에 위치시키는 한편, GPT-5-mini의 평가자 정렬이 인간의 판단과 일치하는지 검증한다. 또한 외부 평가자, gold rationale, medical-VQA에 한정된 평가에 대한 의존성을 제한사항으로 지적한다.
- 제한사항: MRPO는 문장 수준 process reward에 GPT-5-mini를 사용하므로 API 비용이 발생하고 외부 평가자에 의존한다. 다만 평가한 세 가지 reward model 중 성능 상한은 가장 높다.상세한 비용 분석은 Appendix C.3에 제시되며, 평가자 비교 결과는 Appendix D.4에 보고된다.
- 제한사항: MRPO의 step-wise reward는 MedThink (Gai et al., 2024)의 gold reasoning annotation에 의존하므로, annotation된 rationale이 없는 환경으로 직접 확장하기 어렵다.향후 확장에는 annotation-free reward 또는 더 약한 형태의 step-level supervision이 필요하다.
- 제한사항: 평가는 medical VQA에 한정되어 있어, MRPO가 scientific question answering과 legal reasoning으로 일반화될 가능성에 대한 실증적 검증은 향후 과제로 남는다.제안된 cascading-failure 및 step-wise advantage-reshaping 메커니즘은 다른 multi-step reasoning domain에도 적용될 수 있지만, 이는 아직 검증되지 않았다.
- A.1 의료 멀티모달 대규모 언어 모델의 추론: 의료 멀티모달 추론은 supervised fine-tuning에서 GRPO 기반 reinforcement learning으로 발전했지만, 대부분의 접근법은 여전히 sequence-level advantage를 계산한다.초기 시스템은 선별된 또는 합성된 의료 데이터를 사용했으며, 이후 방법들은 DeepSeek-R1 (Shao et al., 2024)에 따라 GRPO를 적용했다.
- A.2 의료 추론을 위한 Process Supervision: 기존 의료 process supervision 방법은 개별 reasoning step을 평가하지만, failure location에 따라 학습을 재분배하지 않고 그 신호를 sequence level에서 집계한다.이 간극은 신뢰할 수 있는 임상 추론을 위한 step-aware credit assignment의 필요성을 제기한다 (Fan et al., 2025; Zhi et al., 2025; Yun et al., 2025; Zhou et al., 2025).
- A.3 Step-wise Credit Assignment: General-domain 연구에서는 token-level credit assignment를 탐색하기 시작했으며, supported reasoning에는 선택적으로 보상하고 hallucinated step에는 불이익을 주는 step-wise factual verification 등이 이에 포함된다.이러한 접근법은 reasoning trajectory 전반에 더 선택적인 학습 신호를 제공할 수 있다는 선례가 된다 (Tan et al., 2025; Parthasarathi et al., 2025; Xie et al., 2025a; Li and Ng, 2025).
- B.1 인간–LLM 평가자 정렬: VQA-RAD와 SLAKE에서 답변 정확도에 대한 Cohen’s κ exceeds 0.7로 나타나 GPT-5-mini와 인간 평가 사이에 상당한 정렬이 있음을 보여준다.세 벤치마크 모두에서 일치율은 90%에 근접하며, PathVQA의 더 낮은 κ는 더 심한 class imbalance에 기인한 것으로 해석된다.
B.2 교차 판정자 평가 … C.2 구현 세부사항
교차 판정자 평가에서 MRPO의 정확도 향상과 cascading failure 감소가 GPT-5-mini, GPT-5.4, Claude-4.5-haiku 전반에서 지속됨을 확인했다. 이 방법은 세 multimodal backbone에 동일하게 맞춘 RL 설정으로 open-ended medical VQA 데이터에서 학습·평가된다.
- B.2 교차 판정자 평가: MRPO는 세 backbone과 세 판정자 모두에서 answer accuracy 기준으로 GRPO를 일관되게 능가하며, 점수 엄격도가 달라도 동일한 상대적 순서를 유지한다.판정자에 따라 절대 점수는 달라지지만, MRPO가 GRPO보다 높은 순서는 변하지 않는다.
- B.2 교차 판정자 평가: MRPO는 모든 판정자에서 early-stage failure 비율이 가장 낮고 late-stage 비율이 가장 높아, 판정자에 강건한 cascading failure 완화를 확인한다.baseline-to-GRPO-to-MRPO 진행은 판정자 전반에서 동일한 단조 추세를 유지한다.
- C.1 데이터셋: 학습에는 VQA-RAD, SLAKE, PathVQA의 open-ended instance를 사용하며, exact image·question·answer matching으로 MedThink gold reasoning annotations와 일대일 정렬한다.binary 및 multiple-choice question은 학습 데이터에서 제외한다.
- C.1 데이터셋: 평가는 VQA-RAD, SLAKE, PathVQA의 4,263개 open-ended in-distribution sample과 5개 out-of-distribution medical VQA benchmark를 포함한다.in-distribution test set은 각각 200개, 706개, 3,357개 sample로 구성된다.
- C.1 데이터셋: out-of-distribution 평가에는 PMC-VQA, VQA-Med-2021, Quilt-VQA, RadImageNet-VQA, MIMIC-Ext-MIMIC-CXR-VQA가 포함되며, open-ended testing을 위해 명시된 기준으로 필터링한다.예를 들어 수동 검증한 PMC-VQA sample 2,000개, single-answer VQA-Med-2021 pair 425개, open-ended Quilt-VQA pair 724개를 사용한다.
- C.2 구현 세부사항: 실험은 FlashAttention-2와 VLM-R1 GRPO framework를 사용해 8×NVIDIA A100 GPU에서 PyTorch로 수행하며, SFT에는 gold reasoning annotations와 함께 LoRA를 사용한다.LoRA는 rank 8, alpha 32, dropout 0.05, learning rate 2 × 10^-5, 3 epoch을 사용하며, Table 6에서 RL training resource를 비교한다.
- C 실험 설정: MRPO, GRPO, GDPO는 Qwen2.5-VL-7B-Instruct, Qwen3-VL-8B-Instruct, InternVL3-8B-Instruct에서 동일한 설정으로 학습한다.각 RL method는 batch size 64, learning rate 10^-6, prompt당 8 rollouts로 1 epoch 학습한다.
C.3 학습 비용 및 효율성 … D.3 Advantage Reweighting Strategy
MRPO는 실용적으로 감당 가능한 비용을 유지하며, ablation 결과 성능이 cold-start 선택, position-aware token shaping, selective advantage reweighting에 좌우됨을 보인다. 테스트한 backbone과 medical VQA benchmark 전반에서 exponential shaping과 selective reweighting이 가장 강력한 대안으로 보고된다.
- C.3 학습 비용 및 효율성: 총 비용 $215.48로 MRPO는 GRPO의 $192.96보다 약 12%만 더 비싸다. 이는 추가 judge query가 아니라 더 긴 reasoning trace가 token 사용량을 늘리기 때문이다.MRPO, GRPO, GDPO는 각각 rollout당 API call 1회를 사용하며, 13K sample과 8개 rollout을 기준으로 epoch당 총 약 107K call이 발생한다.
- D Ablation Study: Ablation에서는 두 backbone에 대해 세 개의 in-distribution benchmark와 다섯 개의 out-of-distribution benchmark에서 SFT cold-start initialization, token-level advantage shaping, advantage reweighting, process reward model을 변화시킨다.비교한 process reward model은 GRPO 및 MRPO 학습에서 MedGemma-27B, Med-PRM, GPT-5-mini다.
- D.1 SFT Cold-Start Initialization: Qwen3-VL-8B-Instruct에서 SFT 후 MRPO를 적용하면 PathVQA가 20.43에서 26.57로, SLAKE가 68.27에서 68.41로 상승해 가장 높은 in-distribution 평균을 달성한다.동일한 설정은 out-of-distribution 평균을 28.94에서 25.05로 낮추며, 이는 SFT cold-start를 사용하지 않은 MRPO보다 낮다.
- D.1 SFT Cold-Start Initialization: SFT cold-start는 in-distribution 성능을 향상시키지만 out-of-distribution 성능을 저하시킨다. 이는 학습 분포의 gold reasoning pattern에 과적합되는 현상과 일치한다.이 효과는 PathVQA에서 특히 두드러지는데, 해당 test distribution이 MedThink gold reasoning annotation과 가장 밀접하게 일치하기 때문이다.
- VQA-RAD SLAKE PathVQA PMC-VQA VQA-Med Quilt-VQA Rad-VQA MIMIC-VQA: Table 8은 Qwen2.5-VL-7B-Instruct와 Qwen3-VL-8B-Instruct에서 in-distribution 및 out-of-distribution 평균을 대상으로 uniform, linear, quadratic, exponential token-level penalty를 비교한다.Exponential function은 MRPO가 제안한 shaping strategy다.
- D.2 Token-Level Shaping Function: Exponential token shaping은 Qwen2.5-VL-7B-Instruct에서 uniform shaping보다 2.63 points, Qwen3-VL-8B-Instruct에서 3.90 points 향상되어 linear 및 quadratic 대안을 능가한다.모든 position-aware function이 uniform shaping보다 우수해, 더 이른 failed reasoning step에 더 강한 penalty를 부여하는 것이 유익함을 보여준다.
- D.3 Advantage Reweighting Strategy: MRPO는 answer reward가 threshold τ 아래로 떨어질 때만 advantage를 reshape하는 반면, full 및 soft reweighting은 모든 instance에 각각 1.0과 0.5로 scaling하여 reshaping을 적용한다.Ablation에서는 Soft Reweighting, Full Reweighting, MRPO의 selective strategy를 비교하며, 무차별적인 reshaping은 성능을 저하시킨다.
- D.3 Advantage Reweighting Strategy: MRPO의 selective reweighting은 Qwen3-VL-8B-Instruct에서 29.09에 도달해, full reweighting의 27.34와 soft reweighting의 27.29를 각각 1.75 및 1.80 points 차이로 능가한다.Qwen2.5-VL-7B-Instruct에서 MRPO는 26.79에 도달하며, full reweighting은 25.55, soft reweighting은 25.00이다.
D.4 Process Reward Model · E 추론 분석
MRPO는 process reward model 전반에서 GRPO보다 우수한 성능을 보이며, GPT-5-mini가 가장 높은 평균 성능을 제공해 기본 judge로 채택된다. 추론 분석에서는 backbone과 training method에 따른 first-failure-stage 분포와 failure accumulation을 살펴보고, MedGemma-27B를 API 없이 사용할 수 있는 실용적 대안으로 제시한다.
- D.4 Process Reward Model: Process-reward 연구에서는 stepwise reasoning reward Rproc를 계산하기 위해 GRPO와 MRPO에서 MedGemma-27B, Med-PRM, GPT-5-mini를 비교한다.MedGemma-27B는 로컬 medical multimodal judge이고, Med-PRM은 medical reasoning에 특화되며, GPT-5-mini는 API로 접근하는 general-purpose judge다.
- D.4 Process Reward Model: Qwen3-VL-8B-Instruct에서 MRPO는 세 process reward model 모두를 사용했을 때 GRPO보다 우수하며, MedGemma, Med-PRM, GPT-5-mini에서 각각 0.12, 0.75, 0.40점 향상된다.Qwen2.5-VL-7B-Instruct에서도 MedGemma와 GPT-5-mini에서는 같은 경향이 나타나지만, Med-PRM에서는 나타나지 않는다.
- D.4 Process Reward Model: GPT-5-mini는 두 backbone과 training paradigm 모두에서 가장 높은 평균을 달성하며, Qwen2.5-VL-7B-Instruct에서 26.79, Qwen3-VL-8B-Instruct에서 29.09에 도달한다.이 점수는 각각 25.49와 28.26인 MedGemma, 그리고 23.16과 24.34인 Med-PRM을 상회한다.
- E 추론 분석: 추론 분석에서는 세 multimodal backbone에 대해 baseline, GRPO, GDPO, MRPO의 Early, Mid, Late-Stage First Failure Point 분포를 비교한다.Figure 5는 Qwen2.5-VL-7B-Instruct, Qwen3-VL-8B-Instruct, InternVL3-8B-Instruct를 다룬다.
- E 추론 분석: Failure Accumulation Rate는 Qwen2.5-VL-7B-Instruct, Qwen3-VL-8B-Instruct, InternVL3-8B-Instruct에서 baseline, GRPO, GDPO, MRPO의 First Failure Point bin별로 분석된다.이 분석은 제공된 본문에서 추가적인 수치 없이 FFP bin별 FAR을 보고한다.
- D.4 Process Reward Model: GPT-5-mini는 step-level evaluation이 가장 높은 performance ceiling을 제공하고 Cohen’s κ above 0.7에서 human judgment와 일치하기 때문에 MRPO의 기본 process reward model로 채택된다.MedGemma-27B는 더 약한 judge로 설명되며, Med-PRM은 image 없이 question과 reasoning text만 평가한다.
- D.4 Process Reward Model: API access가 제한될 때 MedGemma-27B는 여전히 viable alternative이며, external API 의존 없이 dedicated medical VQA process reward model을 개발하는 일은 future work로 남겨 둔다.그 결과는 GPT-5-mini의 결과에 근접한다.
E.1 백본 전반의 추론 분석 … F.1 단계별 실패 taxonomy
세 multimodal backbone에서 MRPO는 초기 실패를 가장 강하게 억제하고 초기 오류의 cascading을 방지한다. 또한 paired 분석을 통해 GRPO 오류의 회복을 보이고, 초기·중기·후기 실패 유형을 구분한다. MRPO가 새로 유발한 실패는 후기에 집중되며, 일부 비교는 실제 추론 오류가 아니라 표면적 답변 불일치에 해당한다.
- E.1 백본 전반의 추론 분석: MRPO는 Qwen2.5-VL-7B-Instruct, Qwen3-VL-8B-Instruct, InternVL3-8B-Instruct에서 각각 초기 단계 실패를 8.0%, 14.3%, 12.8%로 낮춘다.세 backbone 모두에서 MRPO는 baseline 및 다른 RL 방법 대비 가장 큰 감소를 달성한다.
- E.1 백본 전반의 추론 분석: MRPO는 세 backbone에서 가장 이른 bin의 FAR이 각각 43.9%, 39.0%, 47.1%로 가장 낮으며, 이는 cascading failure를 더 강하게 방지함을 의미한다.이 값들은 FFP 0.0–0.2 bin에 해당하며, 모든 경쟁 방법과 baseline보다 낮다.
- E.2 GRPO와 MRPO의 paired 비교: paired instance-level 평가는 세 backbone 전체에서 pooled VQA-RAD, SLAKE, PathVQA test trace를 사용해 GRPO와 MRPO를 비교한다.이 비교는 MRPO가 재구성한 step-wise advantage가 개별 예측에 미치는 효과를 분리해 보여준다.
- E.2 GRPO와 MRPO의 paired 비교: MRPO-only-correct instance에서 transition 분석은 GRPO에서 관찰된 큰 초기 및 중기 실패 집중을 MRPO가 줄임을 보여준다.Table 12는 행에 GRPO 실패 단계를, 열에 MRPO 단계를 배치한다.
- E.2 GRPO와 MRPO의 paired 비교: 일부 MRPO-only-correct 사례에는 GRPO failure point가 없다. 추론이 본질적으로 타당하고 오답이 surface-level expression mismatch를 반영하기 때문이다.이 사례들은 paired 비교에서 분석한 step-level reasoning behavior의 범위를 벗어난다.
- E.2 GRPO와 MRPO의 paired 비교: GRPO-only-correct instance에서 MRPO가 유발한 실패는 후기에 25.0%로 집중되며, 중기는 18.9%, 초기는 8.7%이고, 47.4%에서는 감지된 failure point가 없다.이 instance에서는 GRPO가 정답이므로, 분석 대상은 MRPO가 실패하는지 여부가 아니라 MRPO 실패가 발생한 단계다.
- F.1 단계별 failure taxonomy: failure taxonomy는 수동으로 검토한 300개 trace를 FFP 범위 0.0–0.4, 0.4–0.7, 0.7–1.0에 따라 초기, 중기, 후기 단계로 분류한다.유사한 FFP 위치를 가진 trace는 유사한 실패 패턴을 보여 각 범위 내 오류 유형이 대체로 동질적이다.
- F.1 단계별 failure taxonomy: 초기 실패는 잘못된 visual premise를 통해 이후 추론을 오염시키고, 중기 실패는 국소적인 해석 또는 진단 판단 오류를 반영하며, 후기 실패는 거의 cascading하지 않는 국소적 terminal-answer 붕괴다.예시로는 modality에 대한 default 가정, 잘못된 장기 식별, 구조적 오인식, 비결정적인 terminal conclusion이 있다.
F.2 정성적 사례 연구
정성적 paired case study는 MRPO가 오류가 연쇄적으로 확산되기 전에 잘못된 시각적 전제를 바로잡고 초기 오류에서 회복함으로써 추론을 개선한다는 점을 보여준다. MRPO의 잔여 실패는 대체로 연쇄적 추론 실패가 아니라 후기 단계의 국소적 붕괴다.
- 사례 1: 연쇄 오류 교정: MRPO는 GRPO의 잘못된 초기 시각적 전제를 바로잡아 후속 추론 단계가 해당 오류를 물려받지 않도록 하고, 오답으로 이어지는 것을 막는다.paired trace는 동일한 입력을 사용하며 모든 단계가 valid 또는 invalid로 주석 처리되어 있어 divergence point를 확인할 수 있다.
- 사례 2: 초기 회복: MRPO는 초기 실패 후 이미지를 재검토하고 오류가 답에 도달하기 전에 이를 뒤집어 회복할 수 있지만, GRPO는 잘못된 전제를 고수한다.MRI-weighting 예시에서 두 trace는 처음에는 모두 T2로 결론 내리지만 이후 행동에서 divergence가 발생한다.
- 사례 3: MRPO 손실: MRPO의 잔여 손실은 대체로 타당한 추론이 이어진 뒤 발생하는 후기 단계의 국소적 붕괴이며, 연쇄적 오류가 아니다.설명된 실패는 답을 생성할 때 발생하는 Terminal Label/Term Mismatch와 관련된다.
G RL Training Plots · H Prompts
MRPO의 training dynamics는 세 multimodal backbone 전반에서 안정적인 optimization을 유지하면서 GRPO보다 강한 reasoning-process reward를 보이며, prompts는 구조화된 binary evaluation을 통해 answer correctness와 step-wise reasoning quality를 구체화한다. Step-wise evaluator는 gold reasoning과 ground-truth answer에 대한 기여를 별도로 점검해 stage-specific failure와 recovery pattern을 포괄한다.
- G RL Training Plots: MRPO의 더 높은 KL divergence는 더 강한 step-wise advantage reshaping을 반영하지만, 세 backbone 모두에서 training은 발산하지 않고 안정적으로 유지된다.제공된 training-dynamics 논의에 따르면 completion length는 backbone에 따라 달라지며 MRPO와 GRPO 사이에 일관된 순서는 없다.
- Answer Correctness Check Prompt: Answer-correctness prompt는 generated answer를 medical-image question 및 ground-truth answer와 비교하고, 정답이면 ‘O’, 오답이면 ‘X’만 반환한다.충분히 좋은 answer는 정답으로 처리하며 single-character output을 요구한다.
- H.2 Step-wise Reasoning Evaluation Prompt: Gold Alignment는 extracted modality, context, findings, anatomy, laterality, diagnostic direction과의 일관성을 점검하며, early premise, middle finding, late diagnostic agreement를 요구한다.Wrong laterality, contradiction, misdirection, unsupported content, omitted pathology, specificity mismatch에는 alignment failure가 부여된다.
- H.2 Step-wise Reasoning Evaluation Prompt: Answer Contribution은 ground-truth diagnosis, location, structure를 직접 진술하거나 뒷받침하는 step을 표시하며, generic, irrelevant, evasive 또는 context-only statement에는 zero를 부여한다.이 criterion은 해당 step이 gold reasoning과 일치하는지와 독립적이다.
- H.2 Step-wise Reasoning Evaluation Prompt: 이 prompt는 reasoning cascade를 유발하거나 제한할 수 있는 early premise failure, mid-stage structural 또는 pathology error, late terminal uncertainty 또는 label mismatch를 구분한다.예로는 incorrect modality로 defaulting하기, anatomy 오인, lesion 누락, hedging, wrong final term 할당이 있다.
- H.2 Step-wise Reasoning Evaluation Prompt: Case illustration은 MRPO가 erroneous premise를 교정하고, initial misread 이후 회복하며, 앞선 reasoning이 온전한데도 final terminal term mismatch로 간혹 패배하는 양상을 보여준다.이 사례들은 cascade correction, early recovery, MRPO loss를 대조한다.
- G RL Training Plots: 세 backbone에서 MRPO는 reasoning process reward에서 GRPO보다 더 뚜렷한 우위, answer reward에서 slight advantage, 그리고 초기에 상승한 뒤 안정화되는 stable KL dynamics를 달성한다.이 plots는 Qwen2.5-VL-7B-Instruct, Qwen3-VL-8B-Instruct, InternVL3-8B-Instruct의 answer reward, reasoning process reward, KL divergence, completion length를 다룬다.