Source-linked AI summary
SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning
Jinyang Wu, Shuo Yang, Zhengxi Lu, Fan Zhang, Yuhao Shen, Lang Feng, Haoran Luo, Zheng Lian, Shuai Zhang, Zhengqi Wen, Jianhua Tao
TL;DR
희소한 trajectory-level reward는 장기 에이전트 RL에서 중간 의사결정에 제한적인 지침만 제공한다. SEED는 완료된 on-policy trajectory에서 진화하는 hindsight skill을 추출하고 그 효과를 token-level supervision으로 distill해, 에이전트 benchmark 전반에서 성능, sample efficiency, 강건성을 일관되게 향상한다.
문제
Outcome-based agentic RL은 희소하고 지연된 trajectory-level reward가 어떤 중간 관찰, 행동, tool call이 중요한지 식별하지 못하기 때문에 거친 supervision만 제공한다.
방법
SEED는 현재 policy를 사용해 완료된 on-policy trajectory를 분석하여 hindsight skill로 변환한 뒤, skill로 유도된 probability shift를 outcome-based RL과 함께 조밀한 token-level supervision으로 distill한다.
결과
SEED는 embodied interaction, web navigation, search-based QA, visual reasoning, planning benchmark 전반에서 성능, sample efficiency, 강건성을 일관되게 향상한다.
시사점 및 한계
SEED는 policy와 동기화된 hindsight distillation이 inference time에 skill을 요구하지 않고도 장기 agentic RL에 재사용 가능한 지침을 제공할 수 있음을 보인다.
시사점 및 한계
Actor와 analyzer가 하나의 policy를 공유하므로, 내부적으로 생성된 supervision은 공유 model error를 물려받을 수 있으며 oracle-supervised training보다 낮은 수준에서 정체될 수 있다.
Abstract
from arXiv · showhide
Large language models are increasingly trained as interactive agents for long-horizon tasks involving multi-turn interaction, tool use, and environment feedback. Outcome-based reinforcement learning (RL) provides a practical optimization paradigm, but its sparse trajectory-level rewards offer limited guidance on intermediate decisions, leaving a supervision gap between episode-level outcomes and token-level policy learning. We propose SEED (SElf-Evolving On-Policy Distillation), a self-evolving framework that converts completed on-policy trajectories into training-time hindsight skills and distills their behavioral effect back into the policy model. SEED first fine-tunes the policy to analyze completed trajectories and generate natural-language skills that capture reusable workflows, decisive observations, or failure-avoidance rules. During RL, the current policy both collects trajectories and serves as the analyzer that extracts hindsight skills from them. Policy updates therefore improve subsequent decision making and skill analysis together, allowing hindsight supervision to evolve with the policy. SEED then re-scores the sampled actions under ordinary and skill-augmented contexts, converting the skill-induced probability shift into a dense token-level on-policy distillation signal. This signal is jointly optimized with outcome-based RL, keeping the auxiliary supervision aligned with the current trajectory distribution. Extensive experiments on text-based and vision-based agentic tasks show that SEED consistently improves performance and sample efficiency, exhibiting robust generalization to unseen scenarios. Our code is available at https://github.com/jinyangwu/SEED.
1 서론
SEED는 완료된 on-policy trajectory를 hindsight skill로 변환하고 그 행동 효과를 조밀한 token-level guidance로 distill하여 장기 horizon agentic RL의 supervision gap을 해소한다. 이 self-evolving loop는 policy의 의사결정과 trajectory 분석을 함께 개선하며, 다양한 agentic benchmark에서 task performance, sample efficiency, robustness 향상을 보인다.
- 동기: Outcome-based agentic RL은 희소하고 지연된 trajectory-level reward가 성공 또는 실패를 유발한 중간 observation, action, tool call을 식별하지 못하기 때문에 supervision gap을 남긴다.실패한 trajectory에도 유용한 부분 행동이 포함될 수 있고, 성공한 trajectory에도 scalar reward로는 드러나지 않는 재사용 가능한 전략이 포함될 수 있다.
- SEED 프레임워크: SEED는 완료된 on-policy trajectory를 재사용 가능한 workflow, 결정적 observation, 실패 회피 규칙을 기술하는 자연어 hindsight skill로 변환한다.현재 policy는 trajectory를 수집하고 분석하는 역할을 모두 수행하므로, policy update는 의사결정과 skill 분석을 함께 개선한다.
- On-Policy Distillation: SEED는 sampled action에서 skill이 유도한 log-probability shift를 조밀한 token-level supervision으로 변환하고, 이를 outcome-based RL과 함께 공동 최적화한다.이 policy-synchronized on-policy distillation mechanism은 trajectory-level hindsight를 decision-level learning signal로 변환한다.
- 설계 원칙: 이 프레임워크는 policy의 역량과 그로 인해 유도되는 trajectory distribution이 변화하더라도 on-policy, 조밀성, self-evolving 특성을 유지하도록 설계되었다.고정된 teacher, 정적 skill dataset, 일회성 distillation은 evolving policy에 지속적으로 적응할 수 없다.
- 실험: SEED는 embodied interaction, web navigation, search-based QA, visual perception and planning 전반에서 task performance, sample efficiency, robustness를 향상한다.평가는 다양한 장기 horizon agentic benchmark를 포괄하며 SEED를 대표적인 baseline과 비교한다.
2 관련 연구
기존 연구는 agentic language model에 outcome-based reinforcement learning, hindsight learning, on-policy self-distillation을 적용해 왔지만, privileged supervision은 policy가 진화함에 따라 정적으로 유지되거나 불일치할 수 있다. SEED는 self-evolving training loop에서 hindsight skill extraction과 skill-conditioned on-policy distillation을 결합한다.
- Agentic LLM을 위한 reinforcement learning: Outcome-based reinforcement learning은 추론하고, 도구를 사용하며, 장기 horizon에 걸쳐 행동하는 interactive language agent의 task-level outcome을 직접 최적화한다.
- Language agent를 위한 hindsight learning: 완료된 trajectory는 재사용 가능한 전략, 결정적인 관찰, 실패 원인을 드러내며, hindsight relabeling, return decomposition, process supervision, verbal reflection, experience memory를 촉진한다.
- Agentic RL을 위한 on-policy self-distillation: On-policy self-distillation은 token- 또는 sequence-level supervision을 통해 teacher의 행동을 전달하는 동시에, learner가 샘플링한 출력으로 학습해 distribution mismatch를 줄인다.
- Agentic RL을 위한 on-policy self-distillation: SEED는 policy가 완료된 trajectory에서 hindsight skill을 추출하도록 하고, self-evolving loop에서 outcome-based RL과 skill-conditioned on-policy distillation을 공동 최적화한다.
- Agentic RL을 위한 on-policy self-distillation: 최근 agentic RL 방법의 privileged supervision은 정적이거나 외부에서 생성되거나 policy와 독립적으로 업데이트되는 경우가 많아, 행동과 마주치는 failure mode가 변함에 따라 오래되거나 불일치할 위험이 있다.
3 방법
SEED는 완료된 trajectory를 자연어 hindsight skill로 변환하고 그 행동 효과를 token-level supervision으로 distill하는 self-evolving on-policy distillation framework다. 먼저 공유 policy를 학습해 trajectory를 분석한 뒤, skill-conditioned distillation을 적용한 on-policy RL을 공동 최적화하며 deployment 시에는 모든 analyzer 구성요소를 제거한다.
- 개요: SEED는 완료된 agent trajectory에서 재사용 가능한 hindsight skill을 추출하고 그 행동 효과를 ordinary policy에 distill해, 희소한 trajectory-level feedback을 token-level supervision으로 변환한다.완료된 trajectory는 중간 단계에서는 드러나지 않는 행동 패턴, 실패 원인, 재사용 가능한 전략을 보여줄 수 있다.
- 추론: Hindsight skill은 only during training 사용되므로 deployment에는 analyzer나 skill storage, retrieval, augmented decision prompt가 필요하지 않다.추론 시점에는 행동 효과가 policy에 distill된 뒤 analyzer를 제거한다.
- Hindsight-skill supervised fine-tuning: Stage 1에서는 단일 autoregressive policy를 fine-tune해 완료된 trajectory에서 자연어 hindsight skill을 생성하도록 하며, 성공 사례의 전략과 실패 사례의 교정 또는 회피 지침을 모두 포함한다.생성된 checkpoint는 이후 RL policy와 동기화된 trajectory analyzer를 모두 초기화한다.
- On-policy reinforcement learning: Stage 2에서는 현재 policy snapshot을 freeze해 on-policy trajectory를 수집하고 이를 skill로 분석하는 한편, trainable copy를 environment-driven GRPO 및 OPD objective로 최적화한다.Snapshot을 갱신하면 actor의 experience distribution과 모델의 skill-analysis capability가 함께 발전한다.
- On-policy distillation objective: SEED는 각 sampled action을 ordinary context와 skill-augmented context에서 다시 scoring하고, skill이 유도한 log-probability shift를 detached한 confidence-gated token-level distillation signal로 사용한다.Skill-conditioned branch는 training-time teacher로 작동하고 gradient는 ordinary student branch로만 흐르며, positive shift에는 더 큰 gate가 부여된다.
4 실험
ALFWorld, Search-based QA, WebShop에서 SEED는 outcome-only, prompt-based, static distillation baseline을 일관되게 앞선다. 이러한 향상은 더 빠른 최적화, 높은 sample efficiency, unseen-task transfer, 그리고 각 핵심 구성 요소의 기여로까지 확장된다.
- 주요 결과: SEED는 세 backbone 모두에서 ALFWorld, Search-based QA, WebShop 전반에 걸쳐 outcome-only RL을 일관되게 앞선다.GRPO 대비 SEED는 ALFWorld macro-average를 14.9–45.9 points, Search-based QA를 1.4–9.3 points, WebShop task-completion을 8.7–19.8 points, WebShop success rate를 5.5–39.0 points 향상시킨다.
- 주요 결과: SEED의 internalized hindsight skills는 aggregate metrics 전반에서 evaluation-time prompting과 static distillation을 앞선다.SEED는 모든 aggregate metric에서 Skill-Prompt를 앞서고, 12개 비교 중 11개에서 Skill-GRPO*를 넘으며, static-distillation 비교 12개 중 10개에서 최선 또는 공동 최선의 결과를 달성한다.
- 학습 동역학: SEED는 training step 40에서 약 57%의 success에 도달하는 반면 GRPO는 약 35%에 그치며, 최종 mean episode length도 약 16 turns에서 약 13 turns로 줄인다.success 우위는 학습 전반에 걸쳐 지속되며, 더 짧은 trajectory가 더 높은 success와 함께 나타나므로 더 효율적인 task execution을 보여준다.
- Sample efficiency: training data의 60%만 사용해도 SEED는 full-data GRPO의 75.0 대비 80.7을 달성해 더 높은 sample efficiency를 입증한다.데이터 40%에서는 SEED가 58.9에 도달해 80% 데이터에서의 GRPO 58.6과 근접하게 일치한다.
- 일반화: ALFWorld Unseen에서 SEED는 macro-average success를 70.9에서 86.2로 높이며, 여섯 task family 중 다섯 개에서 GRPO를 15.3 points 앞선다.가장 큰 향상은 Heat (+35.0), Look (+18.3), Pick (+16.5)에서 나타난다.
- Ablation 분석: Ablation 결과는 hindsight-skill SFT, self-evolving OPD, on-policy skills가 각각 SEED 성능에 실질적으로 기여함을 보여준다.이들을 제거하면 ALFWorld average performance가 각각 86.0, 87.0, 84.4로 낮아지며, 이에 따른 하락폭은 각각 5.8, 4.8, 7.4 points다.
5 결론 · 이론적 분석 · A.1 온폴리시 hindsight가 occupancy-matched adaptive target을 생성
SEED는 온폴리시 경험에서 hindsight skill을 추출하고 그 효과를 dense supervision으로 distill해 trajectory-level outcome과 token-level learning을 연결한다. 이 분석은 이러한 supervision이 occupancy-matched이고 skill-selective하며 distribution staleness에 민감한 방식을 정식화한다.
- 5 결론: SEED의 최신 policy는 trajectory actor이자 analyzer로 작동하므로, behavior와 경험에서 도출된 supervision이 함께 진화한다.이 설계는 dense hindsight supervision을 통해 sparse trajectory-level outcome과 token-level policy learning을 연결한다.
- 5 결론: ALFWorld에서 SEED는 “put a candle in toilet”을 five steps 만에 완료하는 반면, GRPO는 비효율적으로 탐색하고 관련 없는 item을 집은 뒤 off-task loop에 들어간다.이 정성적 비교는 SEED가 가능한 선반을 체계적으로 확인하고 candle을 찾아 요구된 배치를 완료함을 보여준다.
- 5 결론: SEED는 embodied interaction, web navigation, search-based QA, visual reasoning, planning task 전반에서 performance, sample efficiency, robustness를 일관되게 향상시킨다.이 framework는 완료된 on-policy trajectory에서 hindsight skill을 추출하고, inference time에 skill을 요구하지 않으면서 그 behavioral effect를 distill한다.
- A 이론적 분석: 이론적 분석은 occupancy matching, decision-specific credit, analyzer refreshing을 통해 SEED의 hindsight supervision이 on-policy이고 dense하며 self-evolving함을 확립한다.이러한 특성은 auxiliary supervision을 current policy behavior에 정렬해야 한다는 framework의 요구사항에 대응한다.
- A 이론적 분석: iteration k에서 frozen current policy π_k가 trajectory를 생성하고 synchronized analyzer A_k가 각 completed trajectory를 skill-augmented context에서 사용하는 hindsight skill로 변환한다.이 skill은 realized token, subsequent rollout, environment feedback, analyzer randomness에 의존할 수 있으므로, 분석은 이러한 conditional dependence를 유지한다.
- A.1 온폴리시 hindsight가 occupancy-matched adaptive target을 생성: 기대 OPD update는 sampled token을 균일하게 모방하는 대신 current policy 자체의 token-context occupancy에서 skill-reweighted target을 향해 distill한다.occupancy factor는 현재 방문되는 context, action, failure mode에 학습을 집중시키고, conditional gate는 skill-supported action에 상대적으로 더 큰 mass를 부여한다.
- A.1 온폴리시 hindsight가 occupancy-matched adaptive target을 생성: earlier trajectory를 사용하면 auxiliary gradient가 current trajectory-token distribution과의 divergence에 따라 편향되는 반면, on-policy collection은 rollout-stage distribution mismatch를 제거한다.따라서 synchronized data generation은 occupancy-matched adaptive target을 보존하는 데 필수적이다.
- A.1 온폴리시 hindsight가 occupancy-matched adaptive target을 생성: reweighted target이 더 높은 local expected value를 갖는 것은 hindsight support가 current-policy action value와 positively correlated일 때뿐이다.이 theorem은 on-policy target을 보장하지만, empirical improvement는 skill이 더 나은 decision에 더 큰 support를 부여하는지에 달려 있다.
A.2 희소하거나 동률인 보상에서도 조밀한 skill credit은 유용하게 유지됨 · A.3 자기 진화적 동기화가 analyzer의 노후화를 제어함 · B 추가 실험 세부 사항
SEED는 결과 보상이 희소하거나 동률이어도 유용한 token-level credit을 유지하며, supervision 노후화를 제한하기 위해 analyzer를 current policy와 동기화한다. 추가 실험 세부 사항에서는 dataset, baseline, algorithm, 추출된 skill, 구현을 기술한다.
- A.2 희소하거나 동률인 보상에서도 밀집 skill credit은 여전히 정보를 제공한다: 보상이 동률이면 reward-driven policy gradient는 영이지만, 후보 토큰별 expected hindsight support가 달라지는 경우에만 OPD gradient는 영이 아니다.별도의 KL regularizer가 여전히 gradient에 기여할 수 있지만, task outcome에 대한 credit을 제공하지는 않는다.
- A.2 희소하거나 동률인 보상에서도 조밀한 skill credit은 유용하게 유지됨: Softmax normalization은 hindsight support의 변동을 부호가 있는 상대적 credit으로 변환해, expected support보다 높은 token을 촉진하고 낮은 token을 억제한다.hindsight gate의 variance는 이 token-level signal의 강도를 정량화한다.
- A.2 희소하거나 동률인 보상에서도 조밀한 skill credit은 유용하게 유지됨: SEED는 context와 token에 의존하는 credit을 할당해, terminal reward가 이를 구분하지 못할 때에도 국소적으로 유용한 행동을 보존하고 비효율적인 선택을 약화한다.Outcome-based RL은 하나의 trajectory-level advantage를 전체에 전달하는 반면, skill-conditioned OPD는 w_k(c, v)를 통해 그 계수를 변화시킨다.
- A.3 자기 진화적 동기화가 analyzer의 노후화를 제어함: 고정된 analyzer는 이후 policy와 불일치할 수 있으므로, Proposition 3은 skill-induced probability shift의 차이를 통해 analyzer가 유발한 OPD-gradient discrepancy를 bound한다.이 bound는 score-norm bound와 sigmoid gate의 β_opd/4 Lipschitz factor를 사용한다.
- A.3 자기 진화적 동기화가 analyzer의 노후화를 제어함: current checkpoint의 analyzer를 사용하면 rollout과 analysis 중 cross-iteration analyzer mismatch가 0이 되며, 더 최신 analyzer가 항상 더 정확하다고 가정하지 않아도 된다.노후화는 parameter distance가 아니라 current policy trajectory에 미치는 behavioral effect로 측정한다.
- A.3 자기 진화적 동기화가 analyzer의 노후화를 제어함: SEED는 각 outer iteration에서 on-policy trajectory μ_k와 갱신된 analyzer A_k를 짝지어 experience와 supervision의 노후화를 모두 초기화한다.이후 inner policy optimization 동안 analyzer는 고정되므로, optimization 전체에서 lag가 항등적으로 0인 것은 아니다.
- B 추가 실험 세부 사항: 추가 실험 세부 사항에서는 dataset, baseline method, SEED algorithm 전체, 대표적으로 추출된 skill, 구현 세부 사항을 다룬다.이 자료는 해당 방법의 실험적·절차적 맥락을 제공한다.
B.1 데이터셋 · B.2 베이스라인 · B.3 알고리즘 및 추출된 스킬 예시
실험은 embodied household reasoning, 웹 탐색, search-augmented question answering을 포괄하며, prompting, outcome-based RL, self-distillation 베이스라인과 비교한다. SEED는 synchronized on-policy skill analysis와 paired contextual re-scoring을 사용해 dense distillation과 KL-regularized GRPO를 공동 최적화한다.
- B.1 데이터셋: 평가는 household reasoning, interactive e-commerce, search-based question answering을 대표하는 ALFWorld, WebShop, Search-Augmented QA를 대상으로 한다.ALFWorld는 seen task 140개와 unseen task 134개를 보고하며, WebShop은 test sample 128개를 평가하고, Search-Augmented QA는 7개 데이터셋을 결합한다.
- B.1 데이터셋: 학습에서는 benchmark별로 선택한 task 180개에 대해 SFT용 rollout을 각각 8회 수행한 뒤, benchmark별 RL set 2,400개, 2,400개, 19,200개를 사용한다.그 결과 SFT construction set은 각 benchmark configuration마다 trajectory 1,440개로 구성되며, SFT와 RL 데이터는 각 configuration에 대해 별도로 구축된다.
- B.2 베이스라인: SEED는 표준화된 backbone, interface, 정렬된 training budget하에서 prompting-only, outcome-based RL, self-distillation 또는 skill-distillation 방법과 비교된다.∗ 표시가 없는 방법은 평가 중 standard task prompt와 environment interaction history만 사용하며, 재현한 베이스라인은 지원되는 경우 batch size, rollout budget, group size, update 횟수, protocol을 맞춘다.
- B.2 베이스라인: 베이스라인군에는 Vanilla와 Skill-Prompt∗, GRPO 및 skill-conditioned GRPO 변형, 그리고 OPSD, GRPO+OPSD, Skill-SD, RLSD, SDAR가 포함된다.이 베이스라인들은 inference-time skill, training-time skill conditioning, generic on-policy self-distillation, privileged-teacher objective를 구분한다.
- B.3 알고리즘 및 추출된 스킬 예시: 알고리즘은 skill-induced token probability difference를 gated OPD signal로 변환하고, 이를 clipped GRPO objective와 결합한다.결합 손실은 L_SEED = L_rl + λ_opd L_opd이며, OPD 항에는 detached skill-branch output을 사용한다.
- B.3 알고리즘 및 추출된 스킬 예시: SEED의 frozen policy snapshot은 trajectory를 수집하고 완료된 interaction을 분석하며, trainable policy는 ordinary 및 skill-augmented context에서 동일하게 sampling된 token을 재평가한다.gradient는 ordinary branch로만 흐르고, 생성된 OPD loss는 KL-regularized GRPO와 공동 최적화된 후 다음 snapshot을 업데이트한다.
- B.3 알고리즘 및 추출된 스킬 예시: Table 4는 ALFWorld, WebShop, Search-based QA에서 성공 및 실패 trajectory로부터 추출한 대표적인 skill을 제시한다.예시는 세 benchmark family에서 사용된 extracted-skill material을 보여준다.
B.4 구현 세부 사항 · C 추가 결과
구현 세부 사항에서는 SEED의 벤치마크별 평가 지표, 단계적 trajectory-to-skill 주석화, RL prompting, 재현성 설정을 정의한다. 추가 자료에서는 성공 및 실패 에피소드에서 추출한 skill을 예시로 제시한다.
- B.4 구현 세부 사항: ALFWorld는 6개 task category의 성공률을 동일한 가중치로 평균내는 반면, Search-based QA는 데이터셋별 정확도를 데이터셋 균형 aggregate로 집계한다.
- B.4 구현 세부 사항: 성공한 에피소드에서는 재사용 가능한 workflow를, 실패한 에피소드에서는 trajectory analyzer가 추출한 skill에 실행 가능한 failure-avoidance rule을 담는다.
- B.4 구현 세부 사항: WebShop은 상호보완적인 completion metric을 보고한다. 정규화된 requirement satisfaction score와 모든 requirement를 정확히 충족한 에피소드의 비율이다.
- B.4 구현 세부 사항: SFT 단계에서는 external analyzer가 직렬화된 완료 rollout(task, 전체 trajectory, terminal outcome)을 자연어 hindsight skill로 offline 변환한다.
- B.4 구현 세부 사항: RL 중에는 actor가 benchmark-specific environment prompt를 사용하고, analyzer는 SFT에서 사용한 trajectory-analysis prompt를 재사용한다.
- B.4 구현 세부 사항: 정확한 재현을 위해 training hyperparameter를 기록하며, 학습에는 8 Nvidia A800 80G GPU를 사용한다.
C.1 상세 샘플 효율성 비교
Table 6은 ALFWorld와 WebShop 모두에서 5가지 training-data fraction에 걸쳐 SEED가 GRPO를 일관되게 능가하며, 더 적은 데이터를 사용할 때도 상당한 향상을 보임을 보여준다.
- ALFWorld: ALFWorld 데이터의 60%만 사용한 80.7은 전체 dataset을 사용한 GRPO의 75.0을 상회하며, SEED의 향상 폭은 13.4에서 30.2 point에 이른다.이 결과는 full-data GRPO training 대비 ALFWorld에서 강한 샘플 효율성을 보여준다.
- WebShop: WebShop 데이터의 80%만 사용한 75.0은 전체 dataset을 사용한 GRPO의 63.3을 상회하며, 향상 폭은 5.5에서 15.6 point에 이른다.따라서 SEED는 더 작은 training-data fraction을 사용하면서도 더 높은 WebShop 성능을 달성한다.
- 샘플 효율성 비교: SEED는 ALFWorld와 WebShop 모두에서 5가지 training-data fraction 전반에 걸쳐 GRPO를 일관되게 능가한다.Table 6은 두 benchmark 모두에서 GRPO 대비 절대 성능 향상을 보고한다.
C.2 교차 도메인 일반화 · C.3 멀티모달 확장
SEED는 학습 환경을 넘어 일반화되어, 보지 못한 ALFWorld task family의 성능을 높이고 시각적 grounding이 필요한 agentic benchmark로도 효과적으로 확장된다. 두 설정 모두에서 hindsight supervision은 text-only 및 multimodal task에 재사용 가능한 행동 지침을 전이한다.
- C.2 교차 도메인 일반화: SEED는 ALFWorld Unseen 평균 성공률을 70.9에서 86.2로 높이며, 6개 task family 중 5개에서 GRPO를 앞선다.Table 7은 Qwen2.5-3B-Instruct를 사용해 평균 15.3포인트 향상을 보고한다.
- C.2 교차 도메인 일반화: ALFWorld Unseen에서 가장 큰 task family 향상은 Heat의 35.0포인트이며, 그다음은 Look의 18.3포인트와 Pick의 16.5포인트다.감소가 보고된 유일한 항목은 Clean으로, 2.9포인트 하락한다.
- C.2 교차 도메인 일반화: 보지 못한 ALFWorld family 전반의 폭넓은 향상은 SEED가 학습 환경을 넘어 전이되는 재사용 가능한 행동 지침을 학습함을 보여준다.Clean에서 2.9포인트 하락했음에도 이 결과는 유지된다.
- C.3 멀티모달 확장: Sokoban은 시각적 상태 추적과 장기 공간 계획을 평가한다. 상자를 잘못 밀면 되돌릴 수 없는 dead end가 발생할 수 있기 때문이다.각 상태는 플레이어, 상자, 벽, 목표물이 포함된 6 × 6 시각적 grid이며, 상자는 당길 수 없다.
- C.3 멀티모달 확장: 멀티모달 평가는 Sokoban과 EZPoints에서 Qwen2.5-VL-3B-Instruct (Bai et al., 2025)를 사용하며, 공간 계획과 시각적 산술을 다룬다.Sokoban은 Schrader (2018)가 설명한 환경이다.
- C.3 멀티모달 확장: SEED는 Sokoban에서 82.0%, EZPoints에서 100.0%를 달성하며, 각각 GRPO보다 14.9포인트와 13.1포인트 향상된다.평균 성공률은 77.0%에서 91.0%로 상승하는 반면, ReAct는 평균 7.4%에 그친다.
- C.3 멀티모달 확장: Figure 7은 연속된 6개의 action을 통해 대표적인 Sokoban trajectory를 보여주며, 시간적 진행과 각 action을 해당 observation 아래에 표시한다.이 시각화는 추가적인 성능 비교를 보고하기보다 agent-environment interaction의 순서를 기록한다.
C.4 추가 학습 동역학
SEED는 평가한 모든 backbone과 도메인에서 성공률을 높이는 동시에, 동일한 9개 설정에서 OPD loss가 감소하고 안정화되도록 한다. 이러한 동역학은 일관된 학습을 보여 주며 SEED의 self-evolving loop가 안정적으로 작동함을 뒷받침한다.
- 학습 동역학: 모델 계열과 환경 전반에서 일관되게 성공률이 향상된다는 점은 SEED가 특정 backbone이나 agentic interaction 방식에 종속되지 않음을 보여 준다.수렴 양상은 도메인에 따라 다르다. Search-based QA는 초기에 빠르게 향상되는 반면, WebShop은 더 꾸준한 상승 추세를 따른다.
- 학습 동역학: 세 backbone과 모든 도메인에서 성공률이 증가하며, ALFWorld는 0.9에 근접하고 Search-based QA는 0.47–0.55에서 안정화되며 WebShop은 0.68–0.75로 마무리된다.결과는 9개의 backbone–domain 설정을 포괄하며, 다양한 model scale과 agentic task에서 일관된 학습이 이루어짐을 보여 준다.
- 학습 동역학: 모든 9개 설정에서 OPD loss가 감소하고 안정화되며, 이는 ordinary policy가 hindsight supervision이 선호하는 action에 점점 더 높은 확률을 할당함을 의미한다.Qwen2.5 모델은 점진적으로 수렴하는 반면, Qwen3-1.7B는 특히 ALFWorld에서 초기에 더 가파른 감소를 보인다.
D 사례 연구
사례 연구는 SEED가 행동 지침을 내재화하고, 장기 ALFWorld 상호작용, 증거 적응형 Search-based QA, 제약이 있는 WebShop 구매 과정에서 skill 입력 없이 이를 적용함을 보여준다. OPD loss dynamics는 또한 이러한 지침이 학습 중 점진적으로 내재화됨을 나타낸다.
- D 사례 연구: skill 입력 없이 SEED는 장기 ALFWorld task 전반에서 상태를 추적하고 precondition을 관리하며, 다단계 배치와 반복적인 책 검색 subgoal을 완료한다.예를 들어 서랍을 열기 전에 국자를 찾아 세척하고, subgoal 간 진행 상황을 유지하면서 책 두 권을 검색한다.
- D 사례 연구: OPD loss는 학습 중 일반적으로 감소하고 안정화되며, hindsight skill에서 비롯된 행동 지침이 점진적으로 내재화됨을 나타낸다.이러한 dynamics는 Figure 9에 제시되어 있다.
- D 사례 연구: Search-based QA는 이용 가능한 증거에 맞춰 정보 수집을 조정하는 반면, WebShop은 검색부터 구매까지 요청된 속성과 가격 제한을 유지한다.검색된 문단만으로 충분한 경우 policy는 직접 답하지만, 두 번째 질문에 답하기 전 Finding Neverland를 식별하고 감독을 구체적으로 검색한다.
E 추가 논의
SEED의 추가 논의는 자기 진화형 supervision을 확장할 때의 미해결 과제로 더 광범위한 장기 horizon benchmark, actor–analyzer 간 공유 오류, 학습 중 계산 비용을 제시한다. 예시 trajectory는 agentic environment 전반에서 task decomposition, progress tracking, targeted search, constraint preservation을 보여준다.
- 한계: SEED는 더 긴 workflow, 더 풍부한 state space, 더 높은 interaction complexity, 더 희소한 terminal success를 포함하는 더 광범위한 benchmark에서 평가되어야 한다.논의에서는 DeepPlanning, Long-Horizon-Terminal-Bench, OdysseyArena, RobotEQ를 더 까다로운 평가 대상으로 언급한다.
- 한계: 공유 actor–analyzer policy는 blind spot을 전파할 수 있다. 부정확한 analysis가 반복되는 실수를 재사용 가능한 rule로 바꾸고 이를 강화할 수 있기 때문이다.On-policy alignment와 confidence gating은 distribution mismatch와 noisy supervision을 줄이지만 semantic correctness를 보장하지는 않는다. 또한 self-preference가 evaluation에 편향을 유발할 수 있다.
- 한계: SEED는 deployment overhead를 추가하지 않지만, trajectory를 분석하고 paired context에서 action을 score하므로 trajectory length와 multimodal context에 따라 training cost가 증가한다.Speculative decoding, cached representation, batched paired scoring을 통해 rollout, skill-generation, scoring 비용을 줄이는 방안이 제안된다.
- 예시: 예시 trajectory는 decomposition, progress tracking, verification, preserved requirement를 통해 SEED가 multi-step embodied task, targeted search, constrained shopping을 수행하는 과정을 보여준다.예시에는 7단계 ladle task, 반복적인 book placement, 2단계 factual search, color·size·price constraint를 만족하는 WebShop purchase가 포함된다.