Source-linked AI summary

PRM-as-a-Judge 1.5: A Toolkit for Robot Process Assessment

Yuyang Liu, Yanqing Shen, Ruike Chen, Jifan Zhao, Yuxuan Tian, Yichi Zhang, Tianfeng Long, Zixuan Yin, Yipu Wang, Ziheng Qin, Wenxing Tan, Yang Shi, Mingyu Cao, Runze Xiao, Ziqi Wang, Zhixin Yin, Shiwei Chu, Yi-Fan Zhang, Yao Mu, Yuheng Ji, Yihao Wang, Jun Yan, Zhongyuan Wang, Pengwei Wang, Xiaolong Zheng

arXiv:2608.14284v1cs.ROcs.CV

TL;DR

Embodied model 평가는 최종 성공률이나 rule-based score를 넘어 진행 양상과 실패 패턴을 포착해야 한다. PRM-as-a-Judge 1.5는 rollout video를 progress curve, process metric, report로 변환하며, 그 평가를 통해 세부적인 행동 특성을 드러내는 동시에 더 큰 model이 반드시 더 우수한 성능을 보이지는 않음을 보여준다.

  • 문제

    Binary success rate와 rule-based score만으로는 embodied model rollout에서 나타나는 다양한 진행 및 실패 패턴을 충분히 특성화하기 어렵다.

  • 방법

    PRM-as-a-Judge 1.5는 rollout video를 progress curve로 변환하고, 조건부 process metric을 계산하며, 평가 report를 생성한다.

  • 결과

    대규모 평가를 통해 세부적인 행동 특성이 드러났으며, model parameter 수와 embodied 성능 사이에는 뚜렷한 양의 상관관계가 없었다.

  • 시사점 및 한계

    Process assessment는 구체적인 실패 패턴을 식별하고, 실패 표적형 데이터 수집 및 training 전략을 수립하는 데 기여할 수 있다.

  • 시사점 및 한계

    평가 report의 해석 가능성을 높이려면 더 풍부한 시각적·상태·접촉·의미적 증거가 필요하다.

Abstract

from arXiv · show

Fine-grained robotic evaluation matters for understanding embodied models, going beyond binary success rates and rule-based process scores. We present PRM-as-a-Judge 1.5, a toolkit for robot process assessment that turns rollout videos into dense progress curves and derives multiple fine metrics. PRM-as-a-Judge 1.5 introduces three metrics, building on version 1.0, that characterize failure-side progress, post-drawdown recovery, and success-side execution quality, helping users understand embodied model capability. Based on the rollout videos from benchmarks, we perform a comprehensive assessment of the embodied models, providing some fine-grained metric results and key findings. We further introduce RoboPulse++ to evaluate the reliability of process reward models (PRM), providing evaluators with a more accurate testing platform. Moreover, we release a user-friendly assessment suite, including the benchmark, metric implementation, and visualization tools, to support reproducible manipulation process evaluation. We call on the community to rethink how robots are evaluated and establish transparent, procedural, and reproducible assessment as a foundation for the next generation of embodied intelligence.

1. 서론

Embodied task가 더 길고 복잡해짐에 따라, 이진 성공률과 수작업으로 정의된 rule-based score만으로는 progress, 실패, recovery, execution quality를 포착할 수 없다. PRM-as-a-Judge 1.5는 process-curve metric, 종합적인 benchmark assessment, RoboPulse++, open-source evaluation suite를 통해 이 간극을 해소한다.

  • 동기: 장기적인 multi-task manipulation에는 최종 task 성공 여부만이 아니라 progress, hesitation, regression, recovery를 드러내는 evaluation이 필요하다.실행 복잡도가 증가하면 failure pattern이 더욱 다양해지므로, trajectory evolution이 embodied model을 평가하는 데 중요해진다.
  • 문제: 이진 성공률과 수작업으로 정의된 rule-based score(Mees et al., 2022; Liu et al., 2023; Li et al., 2024; Chen et al., 2025a; Fei et al., 2025; Zhang et al., 2025; Yakefu et al., 2025; Chen et al., 2026a)는 복잡한 trajectory를 거친 결과로 축약하고 execution quality를 놓친다.실패한 rollout은 초기에 실패할 수도 있고 task의 대부분을 완료할 수도 있으며, 성공한 rollout도 smoothness, efficiency, hesitation, recovery behavior에서 서로 다를 수 있다.
  • 기여: PRM-as-a-Judge 1.5는 rollout video를 progress curve로 변환하고 metric을 계산하며 fine-grained assessment report를 생성함으로써 PRM-as-a-Judge 1.0 (Ji et al., 2026)을 확장한다.확장된 metric system은 reachability, efficiency, stagnation, failure-side progress, recovery, success-side quality를 포괄한다.
  • 기여: 이 toolkit은 mainstream embodied model의 rollout을 reachability, failure-side progress, recovery behavior, success-side quality, failure fingerprint 전반에 걸쳐 종합적으로 평가하여, official success-rate ranking을 넘어서는 통찰을 제공한다.이 assessment는 mainstream benchmark에서 이용 가능한 rollout video를 사용한다(Chen et al., 2026a).
  • 기여: RoboPulse++는 robot rollout의 interval-level sample로 process reward model을 평가하며, open-source suite는 benchmark, metric implementation, visualization tool과 reproducible assessment를 위한 지침을 제공한다.이 platform은 process evaluator를 비교하고 더욱 transparent하고 fair하며 process-aware한 evaluation을 지원하도록 설계되었다.

2. PRM-as-a-Judge 1.5

PRM-as-a-Judge 1.5는 rollout video를 사용해 embodied model을 평가하는 end-to-end framework다. 지정된 task input과 선택적 view로부터 progress를 추정하고 process metric을 계산하며 assessment report를 생성한다.

  • 2. PRM-as-a-Judge 1.5: PRM-as-a-Judge 1.5는 rollout video를 process metric과 model assessment report로 변환하는 end-to-end assessment framework를 제공한다.이 framework는 rollout video를 입력으로 받아 embodied model assessment를 위한 metric과 report를 모두 산출한다.
  • 2. PRM-as-a-Judge 1.5: 이 pipeline은 process reward model로 progress curve를 추정하고 process metric을 계산하며 embodied model assessment를 위한 report를 생성한다.Figure 2는 이 전체 pipeline을 제시한다.
  • 2. PRM-as-a-Judge 1.5: 입력에는 case ID, task instruction, rollout video, optional additional view가 포함된다.이 입력들은 framework의 assessment process를 지원한다.

Metrics

PRM-as-a-Judge 1.5는 rollout video를 progress curve로 변환하고, outcome, process, failure diagnosis, recovery, execution quality를 포괄하는 종합적인 OPD 기반 평가를 수행한다. 보고서는 video와 progress curve를 동기화해 embodied model이 어디서, 왜 실패·정체·회복하거나 성공에 접근하는지 드러낸다.

  • Metrics: PRM은 각 frame 또는 timestamp에서 task completion을 추정해, paired, sequential 또는 multi-frame input으로부터 process curve를 생성한다.예로 Robo-Dopamine (Tan et al., 2025), RoboReward (Lee et al., 2026), RoboMeter (Liang et al., 2026), RynnValue (Huang et al., 2026)가 있다.
  • Metrics: 이 toolkit은 PRM-as-a-Judge 1.0 (Ji et al., 2026)을 넘어 조건부 metric인 Failure Near-Success (FNS), Drawdown Recovery Ratio (DRR), Success Quality Score (SQS)를 도출한다.이 metric들은 효과성, 실패 원인, 회복, execution quality를 평가한다.
  • Metrics: 보고서는 rollout video와 progress curve를 동기화하고, 세밀한 평가를 위해 failure location, rollback analysis, trajectory exploration을 제공한다.이를 통해 early failure, near success, stagnation, recovery를 드러낼 수 있다.
  • Metrics: PRM-as-a-Judge 1.5는 progress curve를 실행 가능한 actionable assessment로 전환해, model이 task를 어떻게 진행하고 실패·회복하며 안정적으로 완료하는지 보여준다.OPD system은 Outcome, Process, Diagnosis를 결합해 reachability, progress efficiency, regression 또는 stagnation pattern을 정량화한다.

3. 평가

PRM-as-a-Judge 1.5는 binary success rate를 넘어선 dense process metric을 사용해 real-world 및 simulation manipulation benchmark에서 embodied model을 평가한다. 평가 결과, model ranking은 metric에 따라 달라지므로 success rate만으로는 충분하지 않다.

  • 평가 범위: PRM-as-a-Judge 1.5는 model이 얼마나 진전하는지, 얼마나 효율적으로 실행하는지, 그리고 퇴보·정체·회복 여부를 보여준다.평가는 binary success rate를 넘어 process-level behavior를 특성화한다.
  • Benchmark: 평가는 generalization, memory, long-horizon result, instruction following을 대상으로 하는 RoboDojo-RealWorld deployment task와 RoboDojo-Sim task를 포괄한다.benchmark에는 real-world 및 simulation manipulation setting이 모두 포함된다.
  • Metric: Tables 2와 3은 milestone completion, MaxProcess, success rate, path-weighted progress length, drawdown recovery, failure-near-success metric을 사용한 RoboDojo-RealWorld 및 RoboDojo-Sim의 평가 성능을 보고한다.이 metric들은 progress, execution directness, drawdown 이후 recovery, failure-side behavior를 포착한다.
  • 평가 결과: model ranking은 metric에 따라 달라지며, binary success rate는 SQS, DRR, FNS와 같은 process metric과 완전히 일치하지 않는다.이는 SR에만 의존하는 것이 embodied model 평가에 충분하지 않음을 보여준다.

4. 핵심 발견

발견 결과, VLA가 대체로 WAM보다 우수하지만 모델 규모가 크다고 해서 embodied 성능이 더 뛰어난 것은 아니다. 모델, 태스크, 배포 분석 전반에서 π0.5가 대체로 가장 강하고, Precision 태스크가 가장 높은 성능을 보이며, simulation과 실제 환경 성능의 상관관계는 약하다.

  • 발견 1: RoboDojo-Sim의 Top-3, Top-5, Top-10 순위 전반에서 VLA가 WAM보다 일관되게 우수하다.VLA는 각 순위 수준에서 훨씬 높은 비중을 보인다.
  • 발견 2: 모델 규모가 크다고 해서 더 뛰어난 성능이 보장되지는 않으며, 파라미터 수와 embodied-model 순위 사이에 뚜렷한 양의 상관관계가 없다.상대적으로 작은 여러 모델이 더 큰 모델보다 훨씬 뛰어난 성능을 보인다.
  • 발견 3: π0.5는 다양한 metric에서 대체로 가장 우수한 모델이며 여러 차원에서 강한 성능을 보인다.비교에는 Table 4와 Figure 5의 결과를 사용한다.
  • 발견 4: Precision 태스크가 가장 높은 성능을 보이고, Open-vocabulary 태스크가 가장 어렵며, Long-Horizon 태스크는 모델 의존적 성능 편차가 가장 크다.MC@25, MP, FNS 전반에서 Precision이 Long-Horizon과 Generalization을 앞선다. Open-vocabulary 점수는 낮은 구간에 모이는 반면, Long-Horizon의 분산은 모델 역량을 가장 잘 구분한다.
  • 발견 5: Simulation과 실제 환경 성능의 상관관계는 약하며, Spearman ρ=0.18–0.58이고 정밀 정렬 또는 복잡한 접촉이 필요한 태스크에서 성능 저하가 더 크다.허용 오차가 크고 접촉이 단순한 태스크에서는 Sim–Real 격차가 더 작지만, Classify objects, Hang mugs, Insert tubes에서는 대부분의 모델에서 큰 음의 격차가 나타난다.

5. 결론

PRM-as-a-Judge 1.5는 더 포괄적인 conditioned metric suite를 통해 이진 성공률과 규칙 기반 점수를 넘어 세밀한 robot process assessment를 가능하게 한다. 이 process diagnosis는 개선된 progress judge, 더 풍부한 evidence, 그리고 evaluation–data–training의 closed loop 구축을 촉진한다.

  • 결론: PRM-as-a-Judge 1.5는 OPD system을 더 포괄적으로 만드는 세 가지 conditioned metric을 통해 robotic evaluation을 이진 성공률과 규칙 기반 점수 너머로 확장한다.대규모 assessment는 process assessment가 더 세밀한 behavioral signature를 드러낼 수 있음을 보여준다.
  • 논의 및 향후 방향: 동일한 local motion도 이전 state에 따라 progress 또는 regression을 나타낼 수 있으므로, future progress judge는 temporal context를 모델링해야 한다.Sequence-style modeling과 과거 및 미래 observation의 offline 활용은 더 안정적인 judgment를 제공할 수 있다.
  • 논의 및 향후 방향: Future assessment system은 process diagnosis를 더 해석 가능하게 만들기 위해 progress curve를 visual, state, contact 또는 semantic evidence와 결합할 수 있다.추가 evidence는 관찰된 execution pattern에 대해 더 명확한 설명을 제공할 수 있다.
  • 논의 및 향후 방향: Process assessment는 구체적인 failure pattern을 식별하고 data reweighting 및 objective design을 포함한 failure-targeted data collection과 training을 유도할 수 있다.이를 통해 evaluation, data, training 사이의 loop가 닫힌다.

6. 저자 목록 · 부록 · A. 관련 연구

논문의 여섯 번째 절에는 저자 목록이 수록되어 있으며, 이어서 관련 연구와 추가 자료를 다루는 부록이 나온다. 제시된 부분에서는 부록 A를 관련 연구로 명시하고, 부록 B–F를 주제별로 나열한다.

  • 6. 저자 목록: 저자 목록은 논문의 결론 뒤이자 참고문헌 앞에 나온다.
  • 부록: 부록 부분에는 “관련 연구”라는 제목의 부록 A가 포함된다.
  • 부록: 부록 B는 metric을 다루는 것으로 명시된다.
  • 부록: 부록 C는 RoboPulse++를 다루는 것으로 명시된다.
  • 부록: 부록 D–F는 각각 효율성, 일관성, 시각화를 다룬다.

A.1. 로보틱스의 평가 지표와 패러다임 … B.1. 진행 곡선 구성

로봇 평가 방법은 궤적을 성공 또는 실패로 축약하는 이진 결과 점수부터 시간에 따른 조밀한 진행을 모델링하는 과정 중심 접근법까지 다양하다. PRM 기반 진행 곡선은 논문의 과정 지표에 공통으로 사용되는 평활화된 입력을 제공하며, 진전, 정체, 퇴행, 회복을 포착한다.

  • A.1. 로보틱스의 평가 지표와 패러다임: Binary Success Rate (SR)는 전체 조작 궤적을 하나의 성공 또는 실패 레이블로 압축하여, 매끄러운 성공을 반복 시도 끝의 성공과 동일하게 취급하고 실패 직전의 진행을 가린다.
  • A.2. 로보틱스의 Process Reward Models: Process Reward Models (PRMs)는 희소한 과제 결과를 조밀한 단계 수준 보상으로 변환하며, 에피소드 전체에 걸친 예측이 과정 평가를 위한 진행 곡선을 형성한다.
  • A.2. 로보틱스의 Process Reward Models: PRMs는 주로 예측에 사용하는 시간적 맥락이 다르므로, 시간적 맥락은 과정 보상 접근법 간의 핵심적인 구분 기준이 된다.
  • B. 지표 정의: 논문의 과정 지표는 공통 입력으로서 샘플링된 비디오 시간 단계에 맞춰 정렬된 정규화된 과제 진행 곡선을 공유한다.
  • B.1. 진행 곡선 구성: 각 rollout에 대해 judge 출력을 정규화된 과제 진행으로 변환하고 샘플링된 비디오 시간 단계에 맞춰 정렬하여 진행 곡선을 구성한다.
  • B. 지표 정의: 진행 값이 1에 가까울수록 rollout이 과제 완료에 가까움을 나타내며, 이를 통해 궤적의 변화하는 상태에 대한 지표를 계산할 수 있다.
  • B.1. 진행 곡선 구성: 구성된 진행 곡선의 국소적인 예측 잡음을 줄이기 위해 지표 계산 전에 Gaussian smoothing을 적용한다.

B.2. OPD Metrics … C.4.3. Metric Computation

이 toolkit은 다양한 로봇 실행에서 progress judge를 평가하는 interval-level benchmark인 RoboPulse++와 함께 outcome, process, diagnosis metric을 결합해 rollout을 세밀하게 평가한다. RoboPulse++는 human-annotated Rising/Falling interval과 specialized PRM 및 general-purpose VLM을 위한 공통 evaluation protocol을 사용한다.

  • B.2. OPD Metrics: PRM-as-a-Judge는 rollout 평가를 Outcome, Process, Diagnosis 수준으로 구성하고, 평가 가능한 각 rollout에 대해 연속 metric을 보고한 뒤 task 및 model 수준에서 median으로 집계한다.Outcome은 task 도달 가능성을 포착하고, Process는 전체 rollout의 효율성을 측정하며, Diagnosis는 regression, stagnation, recovery, success quality를 특성화한다.
  • B.2. OPD Metrics: OPD metric은 MP, MC@q, PPL, CRA, STR, FNS, DRR, SQS를 통해 도달 가능성, 효율성, 실행 실패 패턴을 정량화한다.MP와 MC@q는 maximum progress와 milestone 도달 가능성을 측정하고, PPL은 path efficiency를 측정한다. CRA, STR, FNS는 regression, stagnation, near-success failure를 특성화하며, DRR은 post-drawdown recovery를 측정하고 SQS는 successful execution quality를 요약한다.
  • B.2. OPD Metrics: DRR은 가장 큰 progress loss 이후의 recovery를 측정하며, full recovery에서는 1에 도달하고 drawdown이 없는 rollout은 집계에서 제외한다.분자는 이후에 달성한 최선의 recovery이고 분모는 가장 큰 progress loss다.
  • C.1. From Pairwise Comparison to Interval-Level Progress Assessment: RoboPulse++는 다양한 task에서 absolute completion percentage에 일관된 ground truth가 없기 때문에 RoboPulse (Ji et al., 2026)를 pairwise state comparison에서 temporal interval-level progress-direction assessment로 확장한다.각 interval에 Rising 또는 Falling을 부여해 전체 robot trajectory에 걸쳐 process judge를 평가할 수 있다.
  • C.2. Dataset Construction and Composition: RoboPulse++는 real-world 및 simulated manipulation setting을 아우르는 700 manipulation trajectories, 275 task entries, 17,052 frames, 2,244 human-annotated intervals로 구성된다.dataset에는 real-world trajectory 439개(62.7%)와 simulation trajectory 261개(37.3%)가 포함되며, grasping, pushing, tool use, multi-stage manipulation과 같은 atomic, compositional, long-horizon task를 다룬다.
  • C.3. Interval Annotation Protocol: Annotator는 complete trajectory를 서로 이어진 interval로 나누고, task와 관련된 state change에 따라 각 interval을 Rising (+1) 또는 Falling (−1)으로 라벨링하며, 미세한 fluctuation을 판별하기 위해 full-video context를 사용한다.interface는 video scrubbing과 interval boundary 직접 표시를 지원한다.
  • C.4. Evaluation Protocol; C.4.1. PRM Evaluation; C.4.2. General-Purpose VLM Evaluation: RoboPulse++는 Pair Style을 사용해 adjacent observation을, Sequence Style을 사용해 temporally ordered sequence를 평가하며, human interval label을 기준으로 specialized PRM과 general-purpose VLM을 평가한다.PRM evaluation에는 Robo-Dopamine, RoboMeter, LRM, TOPReward, VLAC, GVL, PRIMO가 포함되며, 해당되는 경우 여러 inference formulation을 사용한다. continuous output은 direction classification 전에 five-frame causal smoothing을 적용한다.
  • C.4.2. General-Purpose VLM Evaluation; C.4.3. Metric Computation: Metric computation은 각 annotated interval 내부의 prediction을 해당 interval의 단일 Rising/Falling ground-truth label과 매칭하고, 처음과 마지막 두 sampled step을 필터링한 뒤 Macro-F1, Accuracy 및 class-wise metric을 보고한다.General-purpose VLM에는 두 evaluation style 모두에서 GPT-5.4, Gemini 3.1 Pro, Qwen 3.6 Plus, Claude Sonnet 4.6이 포함된다.

C.5. 실험 결과 · C.5.1. Falling 오류 분석 · C.5.2. 맥락 의존적 과제 분석

특화된 PRM은 가장 강력한 progress 판단을 제공하지만, falling progress는 rising progress보다 탐지가 현저히 어렵다. Falling 오류는 interaction-relation 실패에 집중되며, sequence-level context는 이전 subgoal과 연관된 regression 인식을 향상한다.

  • C.5. 실험 결과: Robo-Dopamine (Forward)는 전반적인 Macro-F1과 Accuracy에서 최고 성능을 달성하며, Pair Style에서 Gemini 3.1 Pro를 크게 능가한다.
  • C.5. 실험 결과: 최고 Falling F1은 0.63인 반면 Rising F1은 0.92이며, 낮은 Falling recall로 인해 regression 탐지가 주요 한계로 남는다.
  • C.5.1. Falling 오류 분석: Falling progress 분석은 155개 구간을 샘플링하고 interaction-relation 실패와 task-order 실패를 구분한다.Interaction-relation 실패에는 grasp한 물체를 떨어뜨리거나 target에 배치하지 못하는 경우가 포함되며, task-order 실패는 예상된 실행 순서를 위반한다.
  • C.5.1. Falling 오류 분석: Falling 구간은 interaction-relation 실패에 강하게 집중되며, 이는 현재 embodied model에서 정밀한 실제 환경 상호작용이 high-level task logic보다 어렵다는 것을 보여준다.
  • C.5.2. 맥락 의존적 과제 분석: 맥락 의존적 progress 변화에서는 execution history가 필요할 수 있다. Pairwise state 판단은 이전에 달성한 subgoal을 되돌리는 regression을 놓칠 수 있기 때문이다.분석에서는 Pair Style PRM인 Robo-Dopamine (Forward)와 Sequence Style PRM인 RoboMeter를 비교한다.
  • C.5.2. 맥락 의존적 과제 분석: RoboMeter는 맥락 의존적 사례에서 Robo-Dopamine (Forward)를 능가하며, Falling accuracy 차이는 0.901 vs. 0.408로 가장 크다.이 결과는 sequence-level context가 이전에 달성한 state 또는 subgoal에 따라 의미가 달라지는 regression을 인식하는 데 특히 유용함을 시사한다.

D. Progress Judge의 계산 비용 … F.1. 사례 연구

이 논문은 progress judge의 효율성을 분석하고, progress curve가 기존 RoboDojo 성공률을 복원하는지 검증하며, 세분화된 metric이 recovery, execution quality, failure proximity를 어떻게 구분하는지 보여준다. 이러한 분석은 계산 예산, model-level consistency, 대표적인 rollout 사례 연구를 아우른다.

  • D. Progress Judge의 계산 비용: Batch size를 늘리면 H100 GPU 하나에서 Robo-Dopamine-4B의 실행 시간이 29.3분에서 7.8분으로, Robo-Dopamine-8B의 실행 시간이 31.7분에서 9.1분으로 감소한다.충분한 GPU memory를 사용할 수 있다면 batched inference로 throughput을 높일 수 있다.
  • F. 시각화 및 사례 연구: Progress curve는 대표적인 robot rollout 전반에서 failure proximity, drawdown recovery, successful-trajectory quality를 세분화해 시각화한다.사례 연구에서는 metric별 progress curve의 거동을 활용해 binary success rate라면 유사하게 취급했을 trajectory를 구분한다.
  • E.1. Evaluation Setup: RoboDojo 분석은 42개의 simulation task와 18개의 real-world task에 걸쳐 공개된 6,076개의 rollout을 정렬하며, maximum predicted progress가 1에 도달하면 (MP = 1) 해당 rollout을 successful로 센다.PRM-derived success rate를 MAE, signed mean difference, Spearman correlation을 사용해 model-level benchmark rate와 비교한다.
  • E.2. Success-Rate Consistency: PRM-derived success rate는 benchmark에 보고된 RoboDojo rate와 밀접하게 일치하며, Simulation과 Real-World 설정에서 각각 MAE는 1.57과 1.32 percentage points, Spearman correlation은 0.88과 0.96이다.이는 세분화된 process assessment를 가능하게 하면서도 기존 outcome-level 정보를 유지할 수 있음을 뒷받침한다.
  • F.1. 사례 연구: DRR 사례는 π0.5-SF가 progress가 거의 0에 도달한 뒤 pre-regression level을 넘어 회복하는 반면, Xiaomi Robotics 0은 잃은 progress를 되찾지 못해 DRR ≈0을 달성함을 보여준다.Figures 10과 11은 drawdown 및 recovery 구간을 표시해 drawdown 이후의 지속적인 recovery와 partial recovery를 구분한다.
  • F.1. 사례 연구: SQS는 지속적이고 regression이 적은 completion에 대해 InternVLA-A1과 X-WAM을 높게 평가하는 반면, π0.5와 GalaxeaVLA는 completion을 지연시키는 unsuccessful attempt와 regression을 보인다. FNS 역시 near-complete failure를 initial grasping에서 멈춘 trajectory보다 높게 평가한다.Figures 12–15는 SQS가 비효율적인 corrective behavior를 감점하고 FNS가 later-stage failure state에 도달하는 것을 보상함을 보여준다.

F.2. 평가 시각화 스위트

PRM-as-a-Judge 1.5는 모델 수준의 결과 개요부터 행동 검사까지 연속적인 워크플로를 지원하는 통합 시각화 스위트를 제공한다. 자동 생성 보고서는 평가 결과를 요약하고 process metrics, 성공 및 실패 프로파일, 실패 진행도, 회복, 개별 trajectory를 시각화한다.

  • F.2. 평가 시각화 스위트: 통합 스위트는 간결한 모델 비교와 metric 시각화부터 행동 검사까지 평가 결과를 검토할 수 있도록 지원한다.Model Leaderboard는 평가 대상 모델을 비교하고, Metric Results는 해당 평가 결과를 시각적으로 제시한다.
  • F.2. 평가 시각화 스위트: Success/Failure Conditional Profiles는 서로 다른 trajectory 결과 간 비교를 용이하게 한다.
  • F.2. 평가 시각화 스위트: 자동 생성 보고서는 모델 수준의 결과를 요약하고 process metrics, 성공 및 실패 프로파일, 실패 진행도, 회복, 개별 trajectory를 시각화한다.
Loading 2608.14284v1…