Source-linked AI summary

SPADE: Self-Play in Adaptive Synthetic Executable Environments

Bo Liu, Simon Yu, Yiding Jiang, Ao Qu, Andrew Zhao, Zichen Liu, Junsu Kim, Zijian Zhou, Seungone Kim, Tongzheng Ren, Mickel Liu, Hanfei Yu, Zhaorun Chen, Weiyan Shi, Paul Pu Liang, Luke Zettlemoyer, Yejin Choi, Natasha Jaques

arXiv:2608.19197v1cs.CLcs.AI

TL;DR

고정된 training environment는 역량이 계속 향상되는 language agent와 함께 확장되지 않아 adaptive하고 검증 가능한 goal의 공급을 제한한다. SPADE는 self-play를 통해 environment design을 학습 가능하게 만들어, games와 tool-use setting 전반에서 fixed-environment baseline을 상회하며 30B-A3B에서 ACEBench-Agent 기준 +13.9 향상을 보인다.

  • 문제

    기존의 수작업 선별, synthetic, frozen-verifier environment pool은 goal distribution을 고정된 상태로 유지하며, generator와 grounding되지 않은 self-play는 범위와 적응성에 여전히 한계가 있다.

  • 방법

    SPADE는 corpus grounding, environment memory, hint-based regret를 활용해 executable adaptive environment를 생성하면서 Environment Designer와 Reasoning Agent를 self-play로 학습시킨다.

  • 결과

    games와 tool-use setting 전반에서 SPADE는 fixed-environment baseline을 상회하며, 30B-A3B에서 ACEBench-Agent 기준 +13.9 향상을 포함한다.

  • 시사점 및 한계

    SPADE는 단일 model이 training environment를 설계하고 그 환경에서 개선될 수 있음을 보여주며, fixed benchmark를 넘어 open-ended continual self-improvement로 나아간다.

  • 시사점 및 한계

    Environment complexity는 designer의 base model과 generation budget에 의해 여전히 bounded by the designer’s base model이며, fixed-task benchmark는 open-ended reasoning growth를 형식적으로 확립하지 못한다.

Abstract

from arXiv · show

Continuous self-improvement requires an ever-expanding pool of self-generated, diverse, adaptive goals. For language agents, existing training environment pools (hand-curated, statically synthesized, or frozen-verifier) keep the goal distribution fixed as the learner scales. We introduce SPADE (Self-Play in Adaptive Synthetic Executable Environments), a self-play RL framework in which a single LLM plays two roles: an Environment Designer that writes complete, long-horizon training environments as executable code with an OpenAI Gym-style reset()/step() interface, and a Reasoning Agent that learns to act in them. Each is a stateful, multi-turn environment (state transitions, reward functions, and verification code), so one interface spans reasoning problems and multi-step agentic tool use. The Reasoning Agent's regret is estimated using the gap between its reward with and without privileged hints; in optimizing this regret signal the Environment Designer learns to target environments at the edge of the agent's capabilities while keeping them feasible. Through extensive experimentation, we find several components critical to success: grounding the Environment Designer on documents sampled from a large pretraining corpus, and giving it an accumulated environment memory. Scaling to 30B-parameter models, SPADE improves over the strongest fixed-environment baseline by +5.3 on average across eight held-out math, science, code, and reasoning benchmarks, and lifts the tool-use setting by +5.7 on BFCL-v4 multi-turn and +13.9 on ACEBench-Agent; on the games setting, the margin over the strongest baseline grows with model scale. By making environment design itself a learnable component, SPADE takes a concrete step toward open-ended self-improvement.

1 서론

SPADE는 self-play를 통해 실행 가능한 environment designer와 reasoning agent를 공동 진화시키며, 고정되었거나 인간의 역량에 제한된 training pool 문제를 adaptive하고 corpus에 기반한 environment로 해결한다. 30B+ 규모에서 games와 tool-use 성능을 향상시키면서 지속적인 self-improvement를 지원한다.

  • 동기: 기존 접근법은 harness가 model weight를 업데이트하지 않고, human-curated pool은 authoring capacity에 따라 확장되며, frozen synthetic generator는 agent와 함께 확장되지 않기 때문에 여전히 제한적이다.Grounding이 없는 self-play 역시 model 자체의 사전 지식에 의해 제한된다.
  • 프레임워크: SPADE는 하나의 LLM을 완전한 executable Python environment를 작성하는 Environment Designer와 그 안에서 행동하며 학습하는 Reasoning Agent로 사용한다.두 역할은 공동 진화한다. 향상된 agent는 점점 더 강력한 environment를 제공받으므로 environment design 자체가 post-training의 학습 가능한 구성 요소가 된다.
  • 프레임워크: 각 environment는 Gym-style reset()/step() interface를 노출하고 완전한 MDP를 나타내므로, single-turn reasoning과 multi-turn agentic interaction을 통합한다.계산 가능한 MDP는 program으로 표현할 수 있으므로 SPADE는 hand-designed environment parameterization에 제한되지 않는다.
  • 학습 신호: hint-based regret reward는 privileged hint가 있을 때와 없을 때 Reasoning Agent의 성능 격차를 바탕으로 Environment Designer를 학습시킨다.이는 agent의 capability frontier 근처에 있는 해결 가능한 environment를 목표로 하여, unsolvable adversarial task와 reward를 부풀리는 협력을 모두 피한다.
  • 설계 파이프라인: SPADE는 pretraining-corpus knowledge와 축적된 경험을 environment design의 기반으로 삼아, 단일 domain이 아니라 cognitive-skill game과 tool-use task를 포괄한다.또한 소규모 model을 넘어 확장하기 위해 environment validation, reward hacking 회피, curriculum design을 포함한다.
  • 결과: 30B-A3B에서 가장 강력한 fixed-environment baseline보다 평균 +5.3 points 향상되었고, 개별 games benchmark에서는 최대 +7.5를 기록했다. tool-use 향상폭은 BFCL v4 multi-turn에서 +5.7, ACEBench-Agent에서 +13.9에 이른다.Games 향상은 세 backbone 모두에서 유지되며, BFCL v4 역시 4B에서 +10.3 향상된다.

2 관련 연구

기존 연구는 LLM을 위한 self-play, 비지도 환경 설계, agentic RL을 위한 synthetic environment를 아우르지만, 대체로 사람이 선별하거나 고정된 환경 생성 과정에 의존한다. 반면 SPADE는 hint-based regret를 사용해 Environment Designer와 Reasoning Agent를 online에서 공동 학습하고, agent의 역량과 함께 실행 가능한 multi-turn environment를 공동 진화시킨다.

  • LLM을 위한 Self-Play: 초기 LLM self-play 방법은 사람이 선별한 seed data 또는 evaluation set에 의존한 반면, 최근 연구 흐름은 이러한 의존성을 제거하고 최소 seed에서 proposer와 solver를 학습하려 한다.인용된 접근법으로는 self-distillation (Chen et al., 2024; Yuan et al., 2024; Singh et al., 2023), adversarial language game (Cheng et al., 2024), learned-proposer bootstrapping (Fang et al., 2025b; Sundaram et al., 2026)이 있다.
  • 비지도 환경 설계와 Open-Endedness: 비지도 환경 설계는 curriculum learning과 learnability 중심 adaptation을 기반으로 하며, POET (Wang et al., 2019)는 paired environment-agent co-evolution을, PAIRED (Dennis et al., 2020)는 minimax regret를 활용한 adversarial design을 도입했다.이러한 기반은 static task pool을 넘어서는 adaptive environment generation을 뒷받침한다.
  • 환경 합성과 Scaling: 최근 environment-synthesis system은 world와 toolset을 생성해 agentic-RL의 environment-pool bottleneck을 해결하려 하지만, 그 generator는 대체로 frozen, hand-engineered되었거나 별도의 signal로 학습된다.본 연구는 검증 가능한 reward를 사용하는 single-turn RL에서 multi-turn agentic RL로 이동하는 흐름을 따른다.
  • 환경 합성과 Scaling: SPADE는 hint-based regret를 사용해 Environment Designer와 Reasoning Agent를 online에서 공동 학습하며, agent의 capability frontier와 함께 distribution이 co-evolve하는 executable Python multi-turn MDP environment를 생성한다.이는 대체로 frozen, hand-engineered되었거나 별도의 signal로 학습되는 generator와 대조된다.

3 사전 지식

SPADE는 학습 환경을 Gym-style Markov decision process로 표현하고, 검증 가능한 보상을 사용해 GRPO로 LLM policy를 학습한다. 환경 interface는 초기화를 위한 reset()과 state transition 및 reward를 위한 step(a)를 노출한다.

  • Markov decision process: SPADE는 Gym-style reset()/step() 함수로 노출되는 state, action, transition, reward, initial-state 구성 요소를 갖는 MDP로 환경을 모델링한다.reset()은 initial observation을 sample하고, step(a)는 환경을 진행시켜 그 결과인 interaction output을 반환한다.
  • Gym-style 환경 예시: 생성된 Wordle-style 환경은 stateful multi-turn execution을 보여주며, 정답 추측 시 종료되고 6턴 후 truncation되며 각각 reward는 1 또는 0이다.각 추측은 추론을 돕는 글자별 feedback을 생성하고, 환경은 숨겨진 target과 남은 턴 수를 추적한다.
  • 검증 가능한 보상으로부터의 reinforcement learning: Policy πθ는 Group Relative Policy Optimization (GRPO) (Shao et al., 2024)을 사용해 검증 가능한 보상으로부터의 reinforcement learning을 통해 학습된다.각 prompt에 대해 GRPO는 G개 response로 구성된 group을 sample하고, clipped policy-gradient update를 KL regularization과 함께 적용하기 전에 group-normalized advantage를 계산한다.

4 SPADE: Self-Play in Adaptive Synthetic Executable Environments

SPADE는 하나의 LLM을 Environment Designer와 Reasoning Agent 역할에 번갈아 배치해 실행 가능한 환경을 생성하고 그 안에서 학습한다. Hint 기반 regret, corpus grounding, environment memory가 학습 커리큘럼을 adaptive하고 diverse하게 만든다.

  • Framework: SPADE는 하나의 LLM이 실행 가능한 Gym-style environments를 설계하고 Reasoning Agent로서 이를 해결하는 과정을 번갈아 수행해, single-turn reasoning과 multi-turn tool use를 통합한다.생성된 환경은 reset()/step()을 구현하며, 학습 전에 syntax와 executability를 검증받는다.
  • Adaptive curriculum: Hint-based regret는 hinted와 unhinted 성능을 대조해 Reasoning Agent의 learning frontier에 해당하는 환경을 설계하도록 Environment Designer를 유도한다.쌍으로 구성된 trajectory는 hint가 task pattern을 드러내거나, 그렇지 않으면 반복적인 실패 시도가 필요한 탐색 범위를 좁히는 모습을 보여준다.
  • Optimization: 이 framework는 role-specific advantage를 정규화하고 reward를 centering하며 빈도가 낮은 Environment Designer trajectory에 더 높은 가중치를 부여해 joint two-role training을 안정화한다.이 기법들은 결합된 objective들이 optimization 중 비슷한 수준으로 기여하도록 돕는다.
  • Results: 다양한 synthetic game으로 학습하면 backbone scale 전반에서 held-out competition-math, science, code-generation, procedural-reasoning benchmark 성능이 향상된다.Table 1은 네 capability family를 아우르는 여덟 개 held-out benchmark를 사용해 SPADE를 retrained fixed-environment baseline과 비교한다.
  • Curriculum sources: Corpus grounding은 novelty를 제공하고, cross-episode environment memory는 regret-scored·skill-tagged seed를 제공해 repetition과 지나치게 쉽거나 어려운 환경을 피하도록 돕는다.이 memory를 활용하면 각 round가 처음부터 시작하는 대신 Reasoning Agent가 현재 어렵게 느끼는 task에서 시작할 수 있다.

5 실험 설정

실험에서는 세 가지 Qwen3 백본으로 SPADE를 학습하고, 실행 가능한 게임 및 멀티턴 tool-use 환경을 고정 환경 또는 synthetic-environment baseline과 비교 평가한다. 모든 benchmark는 학습에서 제외했으며, 환경은 대규모 수학·과학·코드 corpus를 바탕으로 grounding하고 task-specific interval마다 재생성했다.

  • 학습 설정: SPADE는 Qwen3-4B-Instruct-2507, Qwen3-8B, Qwen3-30B-A3B-Instruct-2507을 학습하며, 변경하지 않은 stabilization procedure로 24개 환경에 대해 400회 rollout을 수행하고 GRPO를 사용한다.30B 모델이 주 모델이다. 8B run에서는 두 역할 모두 thinking을 활성화하고, 4B 및 30B run에서는 instruct 모델을 사용한다.
  • 환경: 게임 설정에서는 검증 가능한 reward를 갖춘 self-contained Python environments를 사용하고, 15k-document 수학·과학 corpus에 k=4로 grounding한 뒤 24개 게임에서 6개 cognitive-skill category 중 3개를 순환시킨다.게임은 syntax 및 execution check를 통과해야 하며, pool에 들어가기 전에 Reasoning Agent의 win rate를 target band 안으로 유지한다.
  • Baseline 및 평가: 고정 환경 비교에서는 각 백본에서 RLVE와 static GPT-5.5-generated GRPO baseline을 400 iteration 동안 재학습하며, Section 6 전체에서 RLVE가 더 강하다.평가는 hard procedural reasoning과 out-of-distribution AIME 2025/2026, GPQA-Diamond, LiveCodeBench-v6를 포함하며, 8개 benchmark 모두를 각 백본에 대해 보고한다.
  • 환경: tool-use 설정에서는 simulated function-calling tool, mutable backend state, state check가 포함된 sequential natural-language instruction을 생성하고, 15k-document code corpus에 grounding한 뒤 k=8로 재생성한다.Reasoning Agent는 멀티턴 tool call을 통해 이러한 환경을 완료한다.
  • Baseline 및 평가: tool-use 평가는 BFCL v4 multi-turn, τ 2-bench, ACEBench-Agent에서 SPADE를 AgentScaler, Agent-World, Agent World Model, EnvScaler와 비교한다.인용된 reference result는 training data, budget, base model, evaluation protocol에 따라 달라질 수 있다.

6 실험 결과

SPADE는 synthetic game 및 tool-use environment design 전반에서 held-out 성능을 향상시키며, 더 큰 scale에서 성능 향상이 커지고 생성된 task를 넘어 전이된다. 또한 training을 통해 점점 더 learnable하고 다양한 environment가 생성되며, Reasoning Agent는 evidence-driven interaction으로 이동한다.

  • 6.1 Held-out benchmark 성능: 30B-A3B에서 Fixed-env RLVE 대비 suite 평균 성능이 +5.3 향상되어 58.3에 도달하며, competition math 성능을 유지한 채 science, code, procedural reasoning으로 향상이 전이된다.SPADE는 synthetic game에서만 training하지만, 400-step run 후반에도 이러한 향상이 유지된다.
  • 6.1 Held-out benchmark 성능: ACEBench-Agent의 +13.9가 가장 큰 30B-A3B tool-use 향상이며, BFCL v4 multi-turn의 +5.7, τ 2-bench의 +3.6이 뒤따른다.향상 폭은 각 benchmark의 task structure가 생성된 stateful, multi-step environment와 얼마나 밀접하게 일치하는지를 따른다. BFCL v4 multi-turn은 4B에서 +10.3 향상된다.
  • 6.2 학습 동역학: Full SPADE는 400-step 게임 실행 후반에 생성된 환경 중 학습 가능한 환경의 비율을 대략 삼분의 일까지 높이는 반면, 구성요소 ablation에서는 그 비율이 감소하거나 붕괴한다.학습 가능한 환경은 Reasoning Agent가 20%에서 80% 사이의 확률로 승리하는 환경이다. corpus, memory, designer training이 함께 이 공급을 지속한다.
  • 6.2 Training dynamics: Corpus grounding은 environment 다양성을 유지하며, corpus를 사용하면 Vendi/n이 0.68에 도달하지만 사용하지 않으면 0.04에 그친다.이 비교는 SBERT로 embedding한 environment에 대해 보정된 Vendi score를 사용한다. t-SNE projection은 예시를 위한 것이다.
  • 6.2 Training dynamics: Step 300에 이르면 Reasoning Agent는 답을 거부하는 interface에서 upfront reasoning이 실패했던 것과 달리, 추론하기 전에 evidence를 수집한다.Step 200에서는 짧은 hypothesis를 test하고 결과가 돌아오면 이를 revise한다. 이러한 변화는 task가 inference에 보상을 주는 지점에서 나타난다.

7 절제 실험

절제 실험은 SPADE의 성능 향상이 Environment Designer와 Reasoning Agent의 공동 적응에 달려 있으며, hint 기반 regret가 더 저렴한 EMA 기반 reward를 크게 능가함을 보여준다. Designer 학습과 memory를 함께 제거하면 학습되지 않은 base보다 성능이 낮아지는 반면, EMA 대안은 hint 기반 reward 향상의 상당 부분을 회복한다.

  • 7.1 Environment Designer 적응: Environment Designer를 고정하고 memory를 제거하면 8개 benchmark 평균이 40.5로 낮아져, 학습되지 않은 base보다 9.7점 낮다.Figure 10은 학습과 memory를 함께 제거하면 self-play 성능이 base 아래로 떨어지는 반면, 둘 중 하나만 제거하면 초기에 정점에 도달한 뒤 나중에 base 아래로 하락함을 보여준다.
  • 7.1 Environment Designer 적응: 공동 적응은 curriculum과 downstream 향상을 이끈다. self-play Environment Designer를 고정하면 이러한 향상을 잃으며, 절제 실험에서는 corpus grounding, environment memory, 또는 designer adaptation을 제거한다.절제 변형에는 corpus grounding과 memory를 유지하는 고정된 GPT-5.5 designer도 포함되어, self-play adaptation과 고정 control을 대조한다.
  • 7.2 Reward 설계: EMA 기반 learning potential은 skill의 최근 평균 성공률과의 편차로 environment를 평가하지만, 부호 없는 신호는 일관되게 해결된 environment와 일관되게 실패한 environment 모두에 보상을 줄 수 있다.이 방식은 skill별 history가 필요하며 environment-design 효과를 agent drift나 sampling noise와 구분할 수 없다. 빠른 moving average는 진단 목적으로만 기록된다.
  • 7.2 Reward 설계: Hint 기반 regret는 8개 benchmark 평균을 50.2에서 58.3으로 (+8.1) 높이는 반면, EMA 기반 learning potential은 55.9 (+5.7)에 도달한다.EMA reward는 hint 기반 향상의 약 70%를 달성하고 더 느리게 상승하며, 두 신호는 최초 ∼50 steps 이후 분리된다.

8 스케일링 결과

고정된 환경과 달리 adaptive Environment Designer가 frontier 수준의 training environment를 계속 생성하므로, SPADE의 base model 대비 향상 폭은 model size가 커질수록 증가한다. 더 폭넓은 cognitive-skill curriculum이 향상의 대부분을 설명하는 반면, regret estimate는 작은 model에서 여전히 noisy하다.

  • curriculum diversity 스케일링: six-skill curriculum은 two-skill curriculum을 능가하며, 더 좁은 버전은 Reasoning-Gym 향상의 약 절반만 포착한다.여섯 skill은 regeneration마다 세 개를 활성화하는 round-robin schedule로 겨냥한다. 더 폭넓은 curriculum의 향상은 특정 game family가 아니라 diversity를 반영한다.
  • model size 스케일링: 30B-A3B에서 평균 향상은 +8.1로, 4B의 +5.2와 8B의 +5.7에서 증가하며, 동일 budget의 Fixed-env GRPO는 +1.2 부근에 머문다.adaptive curriculum은 Reasoning Agent의 capability frontier 부근에서 environment를 계속 생성하는 반면, static environment는 더 큰 model에 빠르게 포화된다.
  • model size 스케일링: 30B-A3B designer-hint regret estimate만 training 전반에서 양수를 유지한다. 더 작은 model도 장기간의 음수 estimate에도 불구하고 +5.2와 +5.7의 향상을 얻는다.음의 finite-sample estimate는 noisy한 regret estimation을 반영하지만, optimum에서는 regret가 non-negative다.
  • curriculum diversity 스케일링: 여덟 benchmark suite는 best checkpoint에서 53.7 versus 58.3을 보고하며, curriculum diversity와 함께 향상이 증가한다.제공된 passage는 이를 best-checkpoint suite 값으로 식별하지만, 주변의 curriculum-scaling 논의 외에는 비교 대상 후보를 명시하지 않는다.

9 논의

SPADE의 논의는 성능 향상의 원인을 adaptive environment design과 설정 간 transfer를 지원하는 shared executable interface로 설명한다. 또한 향후 연구를 촉진하는 scale, optimizer, evaluation, designer-improvement의 한계를 제시한다.

  • 논의: Adaptive environments는 fixed pools와 frozen designers를 능가하며, 더 강력한 GPT-5.5-based designer를 포함한다. 이는 지속적인 adaptation이 fixed pools가 정체된 뒤에도 향상을 유지하기 때문이다.이 비교는 Table 1과 Table 3에 보고되어 있으며, 논의에서는 그 우위를 adaptivity에 기인한 것으로 설명한다.
  • 논의: 단일 code-as-environment interface는 games와 reasoning tasks를 아우르며, game-trained planning, constraint satisfaction, strategic thinking은 held-out mathematics, science, and code로 generalize한다.
  • 한계: SPADE의 environment complexity는 designer의 model scale과 generation budget에 의해 제한되고, learning rule은 여전히 human-authored GRPO이며, regret objective는 fixed-task evaluation에서 formal optimality를 갖지 않는다.논의에서는 이러한 complexity constraint를 invisible leash(Chae et al., 2025)라고도 설명한다.
  • 향후 방향: 향후 연구에서는 gradient-updated designers와 weight updates 없이 전략을 축적하고 개선하는 in-context designers를 비교하고, SPADE를 추가 post-training stages와 결합할 수 있다.어떤 접근법이 더 나은 designer를 생성하는지, 그리고 어느 scale에서 그러한지는 여전히 미해결 문제다.

10 결론 … 표기법

SPADE는 self-play를 통해 environment design을 LLM post-training에서 학습 가능한 구성 요소로 만들며, 단일 모델이 training environment를 설계하고 이를 통해 향상되도록 한다. 이 framework는 hint 기반 regret, corpus 및 memory에 기반한 code environment, 실용적인 30B+ recipe를 결합한다.

  • 10 결론: SPADE는 self-play를 통해 environment design을 LLM post-training의 학습 가능한 구성 요소로 만든다.이 framework는 고정 benchmark를 넘어 open-ended continual self-improvement로 나아간다.
  • 10 결론: SPADE의 hint 기반 regret reward는 minimax regret theory를 사용해 Environment Designer가 Reasoning Agent의 learning frontier를 겨냥하도록 학습시킨다.이 reward는 SPADE를 가능하게 하는 세 가지 기여 중 하나로 식별된다.
  • 10 결론: SPADE는 pretraining corpus와 누적된 environment memory에 environment design을 기반하며, code-as-environment interface로 single-turn과 multi-turn setting을 통합한다.이러한 design choice는 framework의 핵심 구성 요소로 제시된다.
  • 10 결론: 이 논문은 Qwen3 model의 30B+ scale에서 사용할 수 있는 실용적인 SPADE recipe를 제공한다.이 recipe는 framework를 가능하게 하는 세 번째 기여로 제시된다.
  • 10 결론: SPADE는 fixed-envi… 이후에도 성능 향상을 유지한다.제공된 문장은 “fixed-envi” 뒤의 조건에서 잘려 있으므로 추가 주장을 덧붙이지 않는다.
  • A 표기법: Table 4는 논문 전체에서 사용된 symbols를 종합한다.notation appendix에는 논문 전체에서 사용된 symbols 표가 포함된다.

B 이론적 분석 · B.1 설정과 가정

SPADE의 힌트-후회 게임은 Environment Designer가 실행 가능한 환경 분포를 선택하고 Reasoning Agent가 정책을 선택하는 상황을 모델링하며, 보수는 기대 verifier return으로 정의된다. sound generation, 명시적 힌트, internalizability가 성립하면 모든 순수 내시 균형에서 designer regret은 0이고 힌트 없는 최적 agent가 존재한다.

  • B 이론적 분석: 분석에서는 self-play를 Environment Designer가 D ∈∆(M)를 선택하고 Reasoning Agent가 π ∈Π를 선택하는 two-player game으로 나타내며, payoff에는 기대 verifier return을 사용한다.designer의 payoff는 기대 hint-based regret이고, agent의 payoff는 힌트가 없는 기대 return이다.
  • B 이론적 분석: 모든 순수 내시 균형에서 Environment Designer의 expected regret is zero이며, Reasoning Agent는 M의 모든 환경에서 힌트 없는 최적 정책을 취하고, 힌트는 무의미해진다.어디에서든 양의 hint-regret이 남아 있으면 힌트 없는 agent는 그곳에서 최적이 아니므로, designer는 해당 환경에 집중해 이득을 얻을 수 있다.
  • B.1 설정과 가정: valid environment class M은 외부 verifier가 시도된 해를 평가할 수 있는 실행 가능하고 내부적으로 일관된 환경들로 구성된다.구현에서는 syntax check, executability check, tool-use solvability filtering을 통해 M을 근사한다.
  • B.1 설정과 가정: 분석에서는 유한한 trajectory space YBinf를 정의하는 inference budget Binf와 유한한 attainable policy set Π를 정의하는 fine-tuning budget F를 고정한다.이 budget에는 model 및 tool access와 같은 평가 시점의 선택, 그리고 optimizer, objective, update, regularization과 같은 학습 시점의 선택이 포함된다.
  • B.1 설정 및 가정: 각 환경에서 designer가 방출한 고정 hint는 hinted 및 unhinted policy return을 유도하며, 분석을 위해 [0, 1]로 정규화되지만 학습에는 [−1, 1] 범위의 shaped reward가 사용된다.hint map은 고정되어 있으므로 전략적 hint 선택은 이상화의 범위 밖에 있으며, 확률적 inference는 expected return을 통해 처리된다.
  • B.1 설정과 가정: 가정 B.1은 designer가 mathematically valid executable environments로 제한되도록 하여, 게임이 ∆(M)의 분포 위에서 정의되도록 보장한다.운용상의 구현에서는 syntax, executability, tool-use solvability check를 사용한다.
  • B.1 설정과 가정: 가정 B.2와 B.3은 명시적 힌트가 최적의 힌트 없는 값을 달성하도록 요구하고, 힌트가 없어도 일부 정책으로 hinted behavior를 달성할 수 있도록 요구한다.이 두 가정은 regret이 0일 때 privileged hint가 불필요해진다는 균형 결론을 뒷받침한다.

B.2 주요 결과 · C 방법 및 실험 세부사항 · C.1 시스템 프롬프트 및 템플릿

SPADE의 hint-regret game은 이론적으로 모든 환경에서 pure Nash equilibrium을 hint-free optimality 방향으로 강제하며, executable environment-generation template은 solvable single-turn task, stateful multi-turn game, grounded tool-use interaction을 보장한다. 프롬프트는 생성된 환경의 상호작용 구조, reward 및 termination 동작, robustness 요구사항, corpus 기반 grounding을 지정한다.

  • B.2 주요 결과: Hint-regret는 hint-free regret와 같으며, 해결된 환경이나 해결 불가능한 환경에서는 소멸하고, hint가 Agent의 수행 격차를 해소할 때만 양수로 남는다.이 특성화에 따라 Environment Designer는 도움 없이 수행하는 Reasoning Agent는 실패하지만 지원을 받으면 해결할 수 있는 환경을 겨냥할 수 있다.
  • B.2 주요 결과: 모든 pure Nash equilibrium은 hint-regret을 0으로 만들고 모든 M의 environment에서 Reasoning Agent를 optimal하게 만든다.Hint-regret은 음이 아닌 값이며 agent의 reward가 optimal reward보다 낮을 때 정확히 양수이고, 명시된 가정하에서 equilibrium이 존재한다.
  • C.1 시스템 프롬프트 및 템플릿: Single-turn generation prompt는 visible observation에서 답을 도출하되 initial prompt에는 숨겨지고 Gym-style reset()/step() interface를 통해 검증되는 deterministic, multi-step reasoning task를 요구한다.Episode는 시도마다 하나의 task를 고정하고, 올바른 boxed answer에서 종료되며, turn limit에서 truncate되고, 실패 후에는 구체적인 feedback을 제공하거나 solution을 공개한다.
  • C.1 시스템 프롬프트 및 템플릿: Generic multi-turn game prompt는 evolving state, 매 turn마다 최소 두 개의 의미 있는 action, strategic branching, 대략 10–15-turn의 solution, 명시적인 win 또는 lose condition을 요구한다.Observation은 current state, action result, available action, progress를 노출하며, reward는 win, loss, intermediate turn, truncation을 구분한다.
  • C.1 시스템 프롬프트 및 템플릿: Corpus-grounded multi-turn prompt는 sampled document를 hidden-state discovery, sequential action, changing observation, progress에 대한 partial reward가 필요한 standalone interactive environment로 변환한다.프롬프트는 task를 one-shot question answering으로 축약하는 것을 명시적으로 금지하며, source document를 언급하지 않고 document concept 또는 technique이 상호작용에 구현되도록 요구한다.
  • C.1 시스템 프롬프트 및 템플릿: 모든 template에서 implementation contract는 complete executable Python, 일관된 5-tuple step return, malformed action의 graceful handling, initialized state, safe arithmetic, standard-library-compatible import를 요구한다.Self-verification은 action sequence가 observation을 변화시키는지, boxed input이 turn별 command를 나타내는지, partial reward가 [0, 1] 안에 유지되는지를 확인한다.
  • C.1 시스템 프롬프트 및 템플릿: Tool-use template은 실제 workflow를 한 번에 하나씩 공개되는 3–5 atomic user instruction으로 모델링하며, tool call이 state를 변경하고 각 criterion이 충족될 때만 진행되도록 한다.생성된 environment는 ToolUseBaseEnv를 subclassing하고, tool과 message criterion을 정의하며, 완료 후 다음 instruction을 추가하고, 최종 done response를 확인한다.

C.2 구현 세부사항 … E 확장된 관련 연구

SPADE는 신뢰성 있는 학습을 지원하기 위해 실행 가능한 환경 검증, 통제된 풀 관리, privileged hint 생성을 사용한다. 또한 논문은 시스템 간 비교와 backbone 전이를 위한 재현성 자료와 적격성 한계를 기록한다.

  • C.2 구현 세부사항: Section 7.2에서 평가한 독립형 EMA 대체를 제외하면, 전체 SPADE 실행에서는 EMA learning-potential, frontier, variance bonus를 비활성화한다.frontier bonus는 빠른 EMA와 느린 EMA의 차이를 사용하며, 별도의 mixed-outcome variance reward는 사용하지 않는다.
  • C.2 구현 세부사항: 환경 풀은 재생성 시 완전히 교체되고, memory에서는 가장 오래된 기록부터 200개 항목에서 제거되며, 거부된 후보는 유지되고, 생성은 최대 5회까지 재시도된다.이러한 수명주기 규칙은 학습 중 환경 후보와 누적 memory가 유지되는 방식을 정의한다.
  • C.2 구현 세부사항: Privileged hint는 환경 source code를 조건으로 하는 별도의 designer 측 호출로 생성되며, source code는 Reasoning Agent에 계속 숨겨진다.hint writer는 생성된 code를 보지만, 행동하는 agent는 이를 보지 못한다.
  • C.2 구현 세부사항: 모든 환경 후보는 parsing, reset, probe-step smoke test를 통과해야 하며, tool-use 환경은 reset-gate 실패와 impossibility에 대해서도 추가 선별된다.의미 검사는 테스트한 seed에서 새로 reset된 상태의 성공 기준을 충족하지 못하거나 과제에 도달할 수 없는 환경을 거부한다.
  • C.3 재현성: 학습 및 평가 code, 모든 run configuration, evaluation JSON, figure-generation script를 공개한다.재현을 지원하기 위해 이러한 자료는 공개된 code와 함께 제공된다.
  • C.3.1 Table 2 비교 가능성 주석: Table 2의 비교에서는 저자들이 발표한 score를 재수록하지만, BFCL version과 data-snapshot 차이로 인해 reference system 간 직접 비교에는 한계가 있다.논문은 자체 BFCL v4 multi-turn 결과와 v3로 표시된 reference 행을 구분하고 protocol 차이를 기록한다.
  • C.3.1 Table 2 비교 가능성 주석: Curriculum breadth가 더 큰 held-out benchmark 향상을 이끈다. 전체 6-skill curriculum이 제한된 2-skill variant보다 우수하다.이 비교는 games 설정에서 Qwen3-30B-A3B-Instruct-2507에 대해 AIME, GPQA-Diamond, LiveCodeBench-v6, Reasoning-Gym 전반에 걸쳐 제시된다.
  • C.3.1 Table 2 비교 가능성 주석: Nemotron transfer는 네 가지 Reasoning-Gym category를 모두 학습되지 않은 base보다 높이며, 향상 폭은 +9.6, +9.3, +2.6, and +3.2다.이 향상 폭은 각각 RG-Cognition, RG-Algorithmic, RG-Math, RG-Logic에 해당하며, 나열된 다른 benchmark는 이 backbone에서 평가되지 않았다.

E.1 LLM을 위한 Self-Play … E.5 Agentic Memory 설계와 자기개선형 코드 시스템

SPADE는 힌트 기반 regret로 LLM Environment Designer를 학습시켜, 개선되는 Reasoning Agent를 위한 실행 가능한 full-MDP 환경을 생성함으로써 self-play와 비지도 환경 설계를 확장한다. 관련 연구 전반에서 open-ended 코드 기반 환경, gradient 학습 적응, adaptive curricula를 통해 고정적이거나 휴리스틱한 환경 생성을 다룬다.

  • E.1 LLM을 위한 Self-Play: 고전적 self-play는 TD-Gammon과 AlphaGo에서 AlphaZero 및 대규모 multi-agent system으로 발전하며, 점점 더 높은 역량을 갖춘 agent를 위한 기반으로 self-play를 확립했다.이러한 시스템은 backgammon, Go, chess, shogi, Dota 2, StarCraft를 아우른다.
  • E.1 LLM을 위한 Self-Play: 최근 LLM self-play 방법은 self-generated supervision으로 model을 개선하지만, human demonstration, self-judgment, minimal seed, curated evaluation set에 의존하는지에 따라 서로 다르다.SPIN은 model output과 human demonstration을 구분하는 반면, Self-Rewarding Language Models는 자체 output을 평가해 preference data를 생성한다.
  • E.1 LLM을 위한 Self-Play: SPADE는 실행 가능한 Python으로 full MDP environment를 생성하고, proxy statistic이 아니라 Reasoning Agent return에 기반한 hint-based regret로 Environment Designer를 학습한다.이는 sparse terminal reward로 task statement를 생성하고 frozen generator 또는 heuristic reward를 사용하는 data-free self-play 방법과 대조된다.
  • E.2 비지도 환경 설계와 Open-Endedness: Open-endedness 연구는 환경 parameterization이 고갈되면 시스템이 정체할 수 있으므로 unbounded environment space가 필요하다고 보며, 풍부한 경쟁 설정은 더욱 정교한 tool use를 산출할 수 있다.이는 고정된 환경 vocabulary를 넘어야 하는 더 넓은 근거를 제공한다.
  • E.2 비지도 환경 설계와 Open-Endedness: SPADE는 parameterized space나 trained antagonist 대신 LLM Designer와 hint-based co-evolution을 사용해 regret-based UED를 unbounded code environment로 확장한다.고전적 UED 방법은 maze dimension, terrain friction, grid layout과 같은 작고 고정된 design vocabulary에서 작동한다.
  • E.3 Synthetic Environment Generation: LLM 환경 생성 시스템은 유용한 training material을 만들고 때로는 agent progress에 맞춰 distribution을 조정하지만, generator에는 일반적으로 RL-gradient-based joint optimization이 없다.반면 SPADE는 reinforcement learning을 통해 Environment Designer를 학습한다.
  • E.4 Environment Scaling: 환경 scaling 연구는 diverse하고 abundant한 environment와 adaptive curricula를 generalization의 핵심으로 규정하며, SPADE는 gradient-trained design과 code-as-environment representation을 결합한다.관련 시스템은 performance statistic, accuracy, problem category를 사용해 difficulty 또는 sampling policy를 조정한다.
  • E.5 Agentic Memory 설계와 자기개선형 코드 시스템: Agentic memory 연구는 runtime episodic memory와 learned Python memory architecture를 탐구하며, self-improving code system을 위한 관련 방향을 제시한다.MemRL은 저장된 interaction experience를 통해 decision을 개선하고, ALMA는 update-and-retrieve memory program을 탐색한다.

F 확장 정량 분석 · F.1 게임 · F.1.1 환경 품질

SPADE의 게임 환경은 학습 중 더 학습 가능해지는 동시에 well-posed하고 검증 가능하며 구조적으로 풍부한 상태를 유지한다. 확장 분석에서는 reward granularity, skill별 학습, embedding robustness, 그리고 matched 30B 학습 동역학도 살펴본다.

  • F 확장 정량 분석: 명시된 multi-embedding robustness protocol에서 SBERT와 TF-IDF with LSA-128을 사용한 embedding 기반 결론은 동일하다.Step-level 동역학은 matched 30B-A3B 실행을 사용하며, full SPADE는 steps 0–399를 포괄하고 ablation은 더 일찍 종료된다.
  • F.1 게임: 게임 설정 분석은 본문에서 다룬 환경 품질 및 다양성 분석을 확장한다.이 블록은 게임의 환경 품질과 관련 다양성 신호에 초점을 둔다.
  • F.1.1 환경 품질: 환경 품질은 다섯 가지 신호로 평가한다. 네 가지는 학습 전반에 걸쳐 추적하고, executability는 raw generation에서 한 번 측정한다.추적 신호에는 learnability, well-posedness, verifiability, structural richness가 포함된다.
  • F.1.1 환경 품질: 환경 중 0.16→0.31이 learnable band에 진입하는 동안 Reasoning Agent win rate는 0.30→0.62로 상승하며, 이는 학습 중 frontier targeting이 더 정교해짐을 나타낸다.Well-posedness는 97에서 98%로 유지되고 verifiability는 90에서 93%로 상승한다. Table 7은 품질 향상이 더 단순한 환경이 아니라 난이도 targeting에 기인한다고 설명한다.
  • F.1.1 환경 품질: 환경당 평균 distinct reward levels와 전체 및 domain별 early-to-late 변화를 기준으로 측정한 Reward granularity는 학습 중 증가한다.분석에는 canonical 30B games run에서 strictly partial reward levels도 포함된다.
  • F.1.1 환경 품질: Logical Deduction과 Spatial Reasoning이 가장 크게 향상되는 반면, Causal Inference는 높은 수준에서 시작했음에도 소폭 하락한다.Figure 17은 canonical SPADE-30B run의 학습 전반에 걸친 skill별 win rate와 향상 폭을 보고한다.

F.1.2 환경 다양성

SPADE는 학습 전반에 걸쳐 거의 ceiling 수준의 stationary 환경 다양성을 유지하며, 13개 도메인을 모두 포괄하고 높은 novelty를 지속한다. 핵심 동인은 corpus grounding이다. 이를 제거하면 다양성이 붕괴하지만, memory와 Environment Designer training은 그렇지 않다.

  • 다양성 동역학: 초기 및 후기 학습 전반에서 Vendi Score가 20.8 versus 21.0으로 나타났고, 평균 pairwise cosine distance는 0.94, 100개 step 중 97개는 완전히 novel했다.각 step의 다양성은 전체 run 동안 mixed-population ceiling에 머문다.
  • 도메인 커버리지: 13개 taxonomy domain이 모두 step 0부터 나타났으며, batch당 24개 environment 중 평균 8.4개를 차지하고, Mathematics는 30%, Physics는 20%였다.나머지 비중은 Medicine 11%, Chemistry 10%, CS 7%, Engineering 6%, 기타 16%다.
  • 분포의 stationary 특성: 5-fold AUC가 0.551 ± 0.024라는 결과는 seed-document reuse를 제거한 뒤에도 초기 절반과 후기 절반의 environment를 구분하기 어렵다는 것을 보여준다.이는 학습 전반에서 stationary environment distribution을 뒷받침한다.
  • Corpus ablation: matched ablation에서 Vendi Score가 0.70 versus 0.04로 나타난 것은 corpus grounding이 다양성을 보존하는 반면, 이를 제거하면 environment distribution이 붕괴함을 보여준다.이 비교에서는 skill set과 기타 지정 조건을 동일하게 유지했으며, 해당 표는 TF-IDF/LSA embedding에서도 corpus/no-corpus 분리를 재현한다.
  • 범위와 한계: 다양성은 batch size 24로 평가하며, 한계로는 per-environment learnability가 아닌 step-level learnability, rubric 기반 난이도, raw-generation executability 측정이 있다.비교 가능성을 위해 더 큰 boot-step batch는 subsample한다.

G 확장 정성 분석 · G.1 게임 · G.1.1 추가 Privileged-Hint 예시

부록에서는 canonical SPADE-30B 실행의 전체 3,310개 environment를 정성적으로 분석해, 다양한 문서에 기반한 서로 다른 executable program을 확인하고 privileged-hint 예시를 통해 게임을 살펴본다. 이 예시들은 frontier gap부터 near-mastery gap까지 positive-regret regime을 아우르므로, task 맥락에서 hint utility를 해석할 수 있다.

  • G 확장 정성 분석: canonical SPADE-30B 실행은 3,310개 environment를 생성했으며, 다른 나열된 quality property가 일정하게 유지되는 동안 learnable-band 비율은 0.16에서 0.31로 거의 두 배 증가했다.분석은 생성된 모든 environment를 다루며 stable well-posedness, verifiability, program richness를 보고한다.
  • G 확장 정성 분석: 부록 요약에 따르면 semantic diversity는 400개 training step 전체에서 mixed-population ceiling에 머물렀다.이 결과는 canonical run에 대해 보고된 네 가지 결과 중 하나다.
  • G 확장 정성 분석: 생성된 3,310개 environment는 모두 서로 다른 program이었으며, 2,388개의 서로 다른 initial state와 1,513개의 서로 다른 seed document로 구성되었다.따라서 분석은 class name과 같은 표면 identifier가 아니라 environment content를 대상으로 수행된다.
  • G 확장 정성 분석: 정성 분석은 표면 identifier에 의존하지 않고 각 environment의 seed document, generated program, opening observation을 조사한다.naming instruction에도 불구하고 58%가 scaffold default를 유지했으므로 class name은 content evidence로 취급하지 않았다.
  • G.1 게임: 게임 부록은 privileged-hint 예시를 추가하고, 하나의 environment가 초기 training에서 후기 training으로 어떻게 변화하는지 추적한다.이는 aggregate result를 넘어 qualitative environment trajectory까지 게임 분석을 확장한다.
  • G.1.1 추가 Privileged-Hint 예시: Figure 19는 큰 frontier gap부터 작은 mastery-regime gap까지 아우르는 네 개의 동일 record positive-regret game task–hint pair를 제시한다.task summary는 goal, hidden information, usable interaction을 보존하며, hint excerpt는 실질적인 guidance를 유지한다. header에는 mean return without hint / with hint가 보고된다.

G.1.2 학습 중 환경 진화 … G.3.3 생성된 Tool-Use 환경 전체 소스

SPADE는 corpus grounding을 통해 다양성이 확장되는 실행 가능하고 상태를 유지하는 환경을 생성하며, 공유된 reset()/step() 인터페이스로 추론, 게임, multi-turn tool use를 아우른다. 이 gallery는 완전히 생성된 프로그램에서 hidden state, 중간 feedback, programmatic verification, terminal reward를 보여준다.

  • G.1.2 학습 중 환경 진화: 학습이 진행되면서 생성된 게임은 29개 state variable을 갖는 370-line car-ownership 환경에서 19개 state variable을 갖는 376-line thermodynamics 환경으로 진화하며, 두 환경 모두 seed document에 grounding된다.예시는 web-scraped document를 사용하며, 여기에는 주제에서 벗어난 personal-finance document와 thermodynamics problem이 포함된다. 또한 Gym-style program을 통해 hidden state를 노출한다.
  • G.1.3 일치된 Step별 생성 대조: SPADE의 corpus-grounded designer는 다양한 domain을 생성한 반면, no-corpus run은 일치된 training step에서 동일한 rotating-maze family를 41회 반복했다.290–312 step에서 corpus run은 probability theory, quantum tomography, volcanology, hematology, radar processing, hypoelliptic operator를 아우른 반면, no-corpus run은 rotating-maze environment 41개를 생성했다.
  • G.2 Tool Use: Tool-use environment는 banking, retail, support, telecom, smart-home API를 시뮬레이션하며, hidden-state criterion이 완료를 programmatically verify한 뒤에만 하나의 atomic instruction을 진행한다.예시에는 banking transfer와 invoice payment, 그리고 ticket assignment, note addition, status update, resolution check가 포함된다.
  • G.3.3 생성된 Tool-Use 환경 전체 소스: Tool-use source exemplar는 account transfer, invoice payment, ticket update, final resolution을 포함해 hidden state에 대한 per-step message criterion으로 long-horizon workflow를 구체화한다.이 criterion은 다음 단계로 진행하기 전에 정확한 account identifier, transfer amount, invoice ID, ticket assignment, note, status transition을 강제한다.
  • G.2 Tool Use: 30B tool-use run은 구조적으로 stationary하게 유지된다. program length는 247에서 226 line으로, tool 수는 7.6에서 5.9로 감소하지만 instruction은 environment당 4.7개로 유지된다.Per-step criterion complexity는 1.9–2.0 condition 부근에 머물며, 대략 5개 environment 중 1개가 guarded failure case를 포함한다.
  • G.3 생성된 환경 Gallery: 생성된 환경 gallery는 하나의 executable interface가 stateful deduction, mathematical reasoning, verifiable episode outcome을 갖는 multi-turn tool-use environment까지 아우른다는 점을 보여준다.완전한 source example은 emitted format으로 재현되며, hidden state, action handling, feedback, terminal verification을 포함한다.
  • G.3.1 Minimal Generated Environment: Minimal generated environment는 Gym-style reset()/step(), stateful multi-turn feedback, verifiable terminal reward를 갖는 단일 Python class이며, six-turn Wordle-like game이 그 예다.정답 추측은 reward 1로 종료되고, 여섯 turn을 모두 소진하면 reward 0으로 episode가 truncation된다. 동일한 pipeline은 answer grading과 tool use를 지원한다.
  • G.3.2 두 Exemplar Generated Environment의 전체 소스: 전체 exemplar program은 reset()에서 hidden state를 초기화하고, intermediate feedback과 함께 multi-turn action을 처리하며, clipped terminal return을 계산해 car title 확보와 같은 multi-step goal을 가능하게 한다.Car environment는 car가 agent에게 단독으로 title된 terminal state를 verify하고 reward 1.0을 보고한다. Thermodynamics environment는 system parameter를 숨기고 zero net entropy change를 목표로 한다.
Loading 2608.19197v1…