Source-linked AI summary
SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs
Kejian Zhu, Zhuoran Jin, Shangqing Tu, Hongbang Yuan, Yushi Bai, Kang Liu, Juanzi Li, Jun Zhao
TL;DR
Multi-task LLM training에서 SFT가 단계 간 충돌을 일으키는 반면 RL은 태스크 전반에서 안정적인 이유는 아직 명확히 설명되지 않았다. 이 논문은 두 방법의 gradient interference를 비교하고, RL의 준직교 업데이트를 설명하며, single-task 성능을 유지하면서 효율성을 높이는 Parallel-RL을 제안한다.
문제
Multi-task training에서 SFT와 RL의 차이, 특히 SFT의 단계별 충돌과 RL의 안정적인 공존은 아직 충분히 연구되지 않았다.
방법
이 논문은 gradient interference를 이론적·실증적으로 분석한 뒤, 업데이트를 병합하기 전에 태스크를 독립적으로 병렬 학습하는 Parallel-RL을 제안한다.
결과
Multi-stage training에서 SFT는 평균 23.1% 하락하는 반면, RL은 24.9% 향상되고 태스크 간 거의 직교하는 업데이트를 생성한다.
시사점 및 한계
Parallel-RL은 single-task 성능을 유지하면서 학습 효율성을 높이고 태스크별 능력을 분리한다.
시사점 및 한계
이론적 분석은 각 태스크의 expected gradient norm과 variance가 유계라는 가정을 둔다.
Abstract
from arXiv · showhide
Supervised Fine-Tuning (SFT) and Reinforcement Learning (RL) exhibit fundamentally different behaviors in enhancing multi-task reasoning for large language models (LLMs). Our preliminary experiments revealed a phenomenon: SFT suffers from severe task conflicts under multi-stage training, whereas RL enables stable coexistence across diverse tasks. Empirically, we trace this to the parameter level, observing that RL induces sparse and approximately orthogonal updates across tasks. We provide a theoretical explanation for this mechanism by analyzing multi-task gradient interference. Our results reveal a distinction: interference in SFT is norm-limited, scaling with the absolute gradient magnitude, whereas interference in RL is variance-limited, bounded by the gradient variance induced by advantage normalization and on-policy optimization. This small variance bound yields near-orthogonal optimization directions across tasks. Leveraging this insight, we propose Parallel-RL, a paradigm that decouples multi-task training, significantly improving efficiency and flexibility.
1. 서론
서론은 SFT에서 심각한 multi-stage task conflict가 발생하는 반면 RL에서는 task 간 안정적인 공존이 나타남을 확인하고, 이러한 차이를 RL의 더 작고 대략적으로 직교하는 update와 연결한다. 이어 이 현상을 설명할 이론적 분석과, task를 병렬로 독립 학습한 뒤 update를 병합하는 Parallel-RL을 제시한다.
- 실증적 동기: Figure 1은 SFT의 task conflicts가 성능을 저해하는 반면, RL은 multi-stage training 동안 task 전반에서 성능을 꾸준히 향상함을 보여준다.SFT update는 single-stage training에서 개별 task를 향상시키지만 stage 간에는 충돌하며, RL update는 대략 직교하여 공존한다.
- 실증적 동기: SFT의 multi-stage training은 base model 대비 평균 23.1% 하락을 초래하는 반면, RL은 동일한 설정에서 24.9%의 robustness 향상을 보인다.이 대조는 mixed-data 및 multi-stage 전략을 적용한 multi-task training에서 보고된다.
- Parameter-level analysis: RL이 유도하는 update는 SFT의 update보다 평균적으로 두 자릿수만큼 작으며, task 간 similarity는 10^-5에 가깝고 SFT에서는 약 10^-1이다.이러한 parameter-update 관찰은 update sparsity와 interference에 대한 본 논문의 분석을 뒷받침한다.
- 이론적 분석: 이 논문은 advantage function과 policy source에서의 gradient-descent 차이를 통해 이러한 대조를 설명하고, advantage normalization과 on-policy optimization이 sparse하고 interference가 낮은 RL update를 생성하는 방식을 분석한다.이론적 분석은 이러한 메커니즘을 정성적으로 검토하고 interference의 upper bound를 도출한다.
- Parallel-RL: Parallel-RL은 task를 병렬로 독립 학습한 뒤 update를 병합하여 single-task 성능을 유지하면서 training efficiency를 높이고 task-specific capability를 분리한다.Ablation study는 task-specific capability를 분리하는 이 framework의 능력을 추가로 뒷받침한다.
2. 예비 분석
예비 실험에서 multi-stage SFT는 task 간 심각한 성능 저하를 일으키는 반면, RL은 task 전반에서 안정적인 향상을 뒷받침하는 것으로 나타난다. Single-task training에서도 SFT의 task conflict와 RL의 task coexistence가 유사하게 관찰된다.
- 실험 설정: 실험에서는 수학, 과학, coding, logic task에 LoRA를 적용한 DeepSeek-R1-Distill-Qwen-1.5B를 사용하고, RL에는 GRPO와 task-specific benchmark를 사용한다.benchmark는 MATH500, MMLU, Knights & Knaves, LiveCodeBench다.
- Multi-task training 전략: 연구에서는 Mixed-Data joint training과 Multi-Stage sequential training을 대비하며, SFT는 일반적으로 전자를, RL은 후자를 사용하는 점을 지적한다.Mixed-Data는 다양한 task의 dataset을 집계하는 반면, Multi-Stage는 서로 다른 task를 별도 단계에서 학습한다.
- Multi-task training 전략: base model보다 23.1% 낮아지는 multi-stage SFT는 task 전반에서 붕괴하지만, 동일한 설정에서 RL은 24.9% 향상된다. mixed-data SFT와 RL은 각각 7.4%와 12.6% 향상된다.결과는 RL의 안정적이고 누적적인 성능 향상과 multi-stage SFT의 성능 붕괴를 뒷받침한다.
- Single-task generalization: RL의 평균 target-task 향상 6.8%는 학습하지 않은 task도 2.3% 향상시키는 반면, SFT는 target task에서 4.0% 향상되지만 다른 task의 성능은 5.1% 낮춘다.이 양상은 single-task training에서 RL의 task coexistence와 SFT의 task conflict를 나타낸다.
3. 파라미터 수준의 실증 분석
파라미터 수준의 분석에 따르면 RL은 태스크 전반에서 희소하고 최소한의 업데이트를 생성하며, 업데이트 방향도 거의 직교한다. 이는 크고 조밀하며 서로 강하게 정렬된 SFT 업데이트와 대조된다. 이러한 기하학적 차이가 RL의 낮은 태스크 간섭과 견고한 다단계 학습을 설명한다.
- 업데이트 크기와 희소성: RL 업데이트의 L2 norm은 평균 3×10−2로 SFT의 7.4보다 작으며, 10−5를 초과하는 파라미터 비율도 각각 20%와 93%에 불과하다.RL이 SFT보다 훨씬 작고 희소한 파라미터 변화를 유도한다는 결과다.
- 업데이트 방향: RL 태스크 업데이트의 pairwise cosine similarity는 평균적으로 10−5 안팎인 반면, SFT 업데이트는 10−1에서 1.0 범위에 있으며 서로 반대 방향을 가리킬 수도 있다.Math와 Code를 서로 반대되는 SFT 업데이트 방향의 예로 제시한다.
- 시사점: RL의 희소하고 거의 직교하는 업데이트는 태스크 최적화를 서로 분리하며, 이를 통해 낮은 간섭과 견고한 다단계 학습이 설명된다.분석은 RL이 다른 태스크에 미치는 간섭을 줄이는 핵심 요인으로 희소성과 준직교성을 지목한다.
4. 이론적 분석
분석은 sparse한 고차원 residual, advantage normalization, on-policy sampling을 통해 RL의 거의 직교적인 저 magnitude task update를 설명한다. 또한 SFT interference는 norm-limited인 반면 RL interference는 variance-limited임을 보인다.
- Sparse하고 직교적인 update: 고차원 parameter space에서 RL의 작고 sparse한 update는 task 간 직교성으로 수렴하는 경향이 있어, overlap을 최소화하면서 task-specific adjustment를 가능하게 한다.이 추론은 고차원에서의 sparse-vector orthogonality와 연결되며, RL의 감소하는 update norm을 SFT의 더 큰 update와 대조한다.
- Advantage mechanism: Advantage normalization은 mean gradient direction을 제거하고 residual score-function inner product만 남겨, SFT에 비해 RL의 multi-task interference를 줄인다.zero-sum advantage 특성은 dense한 common-mode gradient를 필터링하는 반면, SFT는 expert score-function inner product를 직접 유지한다.
- Policy 및 sampling mechanism: On-policy sampling은 task distribution 간 independent한 zero-mean residual을 생성하는 반면, off-policy SFT는 서로 overlap하고 충돌하는 dense한 high-magnitude update를 생성한다.이 on-policy와 off-policy의 구분이 task 간 gradient inner product가 서로 다른 이유를 설명한다.
- Gradient interference bound: RL gradient interference는 intra-group residual diversity에 의해 variance-limited되는 반면, SFT interference는 absolute score-function magnitude에 의해 norm-limited된다.Theorem 4.5는 RL bound를 residual variance V_i와, SFT bound를 score-function norm M_i와 연결한다.
- Empirical validation: Table 3은 RL에서 약 10^-3, SFT에서 10^-1의 cosine similarity를 보고하며, Figure 3은 분리 가능한 RL score-function cluster와 서로 겹치는 SFT distribution을 보여준다.이 측정 결과는 RL update가 거의 직교하는 subspace를 차지하는 반면 SFT update는 dense하고 충돌한다는 점을 뒷받침한다.
5. 응용: Parallel-RL Framework
Parallel-RL은 각 reasoning task를 독립적으로 학습한 뒤 결과 update를 병합하여 multi-task RL을 분리하고, 이들의 근사적으로 직교하는 부분공간을 활용한다. Naive 및 adapted variant는 Parallel-SFT에서 관찰된 심각한 충돌을 피하면서 task 향상을 유지하거나 개선한다.
- 동기: 이 framework는 근사적으로 직교하는 task-update 부분공간에 기반하며, 이로 인해 task 간 interference가 무시할 수 있을 정도로 작아지고 parallel training이 multi-stage training을 근사할 수 있음을 시사한다.
- Framework: Parallel-RL은 각 task를 독립적으로 학습하고 task-specific update를 병합하며, 호환 가능한 task와 task-specific training technique도 선택한다는 점에서 이 paradigm을 단순한 model merging보다 넓은 개념으로 다룬다.
- 결과: Naive Parallel-RL은 single-task RL gain의 95%를 유지하고 base model을 5.0% 향상시키는 반면, Parallel-SFT는 심각한 task conflict로 인해 66%만 유지한다.
- 결과: Adapted Parallel-RL은 대부분의 task에서 가장 높은 성능을 달성하며, base model 대비 9.4% 향상되고 개별 task-specific model을 능가한다.
- 절제 실험: 하나의 task update를 제거하면 해당 task의 성능이 평균 7.1% 낮아지는 반면 다른 task는 견고하게 유지되어, decoupled task representation을 뒷받침한다.
6. 관련 연구
최근 연구는 LLM 추론을 점점 더 중점적으로 다루고 있으며, SFT와 RL은 여전히 지배적인 학습 전략으로 자리 잡고 있다. 또한 연구자들은 single-task 설정에서 두 방법의 메커니즘을 구분하기 시작했다.
- 6. 관련 연구: LLM 추론 능력 향상은 최근 연구의 주요 관심사가 되었다.이 맥락에서 Guo et al. (2025)와 Jaech et al. (2024)를 인용한다.
- 6. 관련 연구: SFT와 RL은 LLM의 지배적인 학습 전략으로 남아 있다.SFT에 대해서는 Xu et al. (2025)와 Hugging Face (2025)를, RL에 대해서는 Zheng et al. (2025)와 Ouyang et al. (2022)를 인용한다.
- 6. 관련 연구: 최근 연구는 single-task 설정에서 SFT와 RL의 메커니즘을 구분하고자 했다.이는 새롭게 부상하는 연구 방향으로 제시되지만, 한 연구에 대해서는 불완전한 인용만 제공한다.
7. 결론
이 연구는 다단계 멀티태스크 학습에서 SFT가 심각한 태스크 충돌을 겪는 반면, RL은 태스크 간 안정적인 공존과 성능 향상을 가능하게 함을 보인다. 이러한 차이는 advantage function과 on-policy 학습에 의해 형성되는 RL의 대략적으로 직교하는 최적화 방향에 기인하며, Parallel-RL의 동기를 제공한다.
- SFT는 다단계 학습에서 심각한 태스크 충돌을 보이는 반면, RL은 태스크 전반에서 안정적인 성능 향상과 공존을 보인다.
- 서로 다른 태스크에 대한 RL 최적화 방향은 SFT보다 유사도가 유의하게 낮으며, 대략적으로 직교하는 것으로 보인다.
- advantage function과 RL의 on-policy 특성이 이러한 태스크 공존의 기반 메커니즘을 이끈다.
- Parallel-RL은 멀티태스크 학습을 분리하여, 더 나은 성능과 최소한의 적응으로 효율적이고 모듈화된 학습을 가능하게 한다.
영향 진술 · A. 실험 세부 사항 · A.1. 과제 및 데이터셋 설명
이 논문은 네 가지 추론 과제에서 LLM의 효율적인 multi-task learning을 연구하며, 책임 있는 배포를 위한 안전성과 신뢰성을 강조한다. 과제에 적합한 training dataset과 널리 인정된 여섯 가지 evaluation benchmark를 사용하며, 규모가 작은 AIME2025 set에는 avg@16을 사용한다.
- 영향 진술: 이 연구는 다양한 LLM 과제 시나리오에서 multi-task learning efficiency and effectiveness를 향상하고 AGI를 향한 발전을 지원하고자 한다.책임 있는 배포를 위해 각 개별 과제의 안전성과 신뢰성을 유지하는 데 중점을 둔다.
- 영향 진술: 이 논문은 효율적인 multi-task training이 책임 있는 배포를 위해 개별 과제의 safety and reliability를 보존해야 한다고 강조한다.
- A.1. 과제 및 데이터셋 설명: 실험은 Math, Science, Code, and Logic이라는 네 가지 대표 추론 과제를 다룬다.이 과제들은 multi-task learning의 추론 향상 연구에서 널리 사용된다.
- A.1. 과제 및 데이터셋 설명: Training에는 SFT와 RL을 위해 별도로 선정한 datasets selected separately for SFT and RL이 사용되며, OpenR1-Math-220k, AM-DeepSeek-Distilled-40M, AM-Thinking-v1-Distilled, knights-and-knaves가 포함된다.제시된 문단은 이들을 수학, 코드, 과학, 논리 추론을 위한 subset 또는 과제별 dataset으로 설명한다.
- A.1. 과제 및 데이터셋 설명: Evaluation은 수학, 과학, 코드, 논리를 포괄하는 six mainstream benchmarks에 걸쳐 수행된다.수학 평가는 MATH500과 AIME2025를 포함하며, 과학 평가는 MMLU와 GPQA-Diamond를 사용한다.
- A.1. 과제 및 데이터셋 설명: AIME2025는 문항 수가 적어 단일 test evaluation이 randomness의 영향을 받기 쉬우므로 avg@16을 보고한다.
A.2. 학습 세부 사항 … C.3. 다른 RL 알고리즘으로의 일반화
논문은 SFT, GRPO, 평가 및 다단계 학습 설정을 명시한 뒤, task 간 interference가 SFT에서는 norm-limited이고 GRPO 방식의 RL에서는 variance-limited임을 증명한다. 또한 동일한 residual 기반 mechanism과 variance bound가 PPO 및 기타 group-normalized reasoning RL 알고리즘으로 확장됨을 보인다.
- A.2. 학습 세부 사항: SFT는 teacher CoT trajectory를 1 × 10−5 learning rate로 사용하고, GRPO는 3 × 10−6 learning rate, prompt당 16 rollouts, 8K-token output limit을 사용한다.실험에는 DeepSeek-R1-Distill-Qwen-1.5B와 7B를 사용하며, 해당되는 경우 LoRA rank는 r = 64, scaling은 α = 32이다. 다단계 학습에서는 Math, Science, Code, Logic 순으로 task를 학습한다.
- A.3. 평가 세부 사항: 평가는 주로 Hugging Face의 lighteval toolkit을 사용하며, logical reasoning task에는 Logic-RL의 specialized suite를 사용하고, generation에는 temperature 0.6과 top-p 0.95를 적용한다.
- B. 관련 연구 추가 논의: 기존 연구는 SFT를 supervised reasoning path에 대한 fitting으로, RL을 generalization을 강조하는 방법으로 설명한다. 또한 multi-task SFT 연구는 adaptive data와 conflict-aware training을 촉발한 심각하고 변화하는 conflict를 보고한다.관련 연구 논의에서는 retraining 없이 task capability를 결합하는 효율적인 방법으로 model merging도 다룬다.
- C.1. RL Inner Product 분해: GRPO에서 task 간 gradient inner product는 standardized advantage가 mean score direction을 제거하기 때문에 within-group rollout difference에 좌우된다.score를 Si,k = ¯Si + δSi,k로 쓰면 interference를 지배하는 residual component가 드러난다.
- C.2.1. SFT 증명 (NORM-LIMITED): SFT interference는 task gradient-norm bound의 곱으로 제한된다. 즉, |ISFT(i, j)| ≤Mi · Mj이며, 이는 norm-limited 결과를 확립한다.증명에는 Jensen’s inequality, Cauchy–Schwarz, independence, 그리고 bound Mi와 Mj가 사용된다.
- C.2.2. RL 증명 (VARIANCE-LIMITED): GRPO interference는 variance-limited이다. advantage normalization이 공통 score component를 제거하여 |IRL(i, j)| ≤Vi · Vj라는 bound를 얻는다.유도 과정에서는 mean이 0이고 mean squared value가 1인 standardized within-group advantage와 bounded expected intra-group variance를 함께 사용한다.
- C.3. 다른 RL 알고리즘으로의 일반화: variance-limited mechanism은 rollout group을 생성하고 advantage를 group-wise로 normalize하는 GSPO와 DAPO 같은 reasoning-oriented 알고리즘으로도 확장된다.따라서 이 알고리즘들은 명시된 group-normalization structure하에서 동일한 유도를 만족한다.
- C.3. 다른 RL 알고리즘으로의 일반화: PPO의 batch-level advantage normalization도 batch mean score를 걸러내어 |IPPO(i, j)| ≤Vi · Vj라는 bound를 만든다.GRPO의 within-prompt residual과 달리 PPO residual은 full batch에서 prompt 간 score deviation을 측정하지만, 핵심적인 mean-removal mechanism은 변하지 않는다.
C.4. 보충 분석: Multi-Task Gradients의 Cosine Similarity · D. Parallel RL · D.1. 서로 다른 Task를 판별하는 방법
분석 결과, SFT는 공유된 gradient 방향을 보존하는 반면 RL은 zero-sum advantage weighting을 통해 이를 상쇄하며, residual coupling이 약할 때 task gradient가 거의 직교하게 된다. 따라서 Parallel-RL에는 task-pair selection이 필요하며, 간섭하는 task가 성능을 크게 저하시킬 수 있으므로 score-function distribution의 t-SNE 분리를 휴리스틱으로 제안한다.
- C.4. 보충 분석: Multi-Task Gradients의 Cosine Similarity: 보충 분석에서는 gradient scale을 제거하고 SFT와 RL에서 cosine similarity를 사용해 task-gradient 방향을 직접 비교한다.이는 본문에서 분석한 gradient inner-product interference를 보완한다.
- C.4. 보충 분석: Multi-Task Gradients의 Cosine Similarity: RL gradient는 zero-sum normalized advantage를 통해 공유된 지배적 방향을 상쇄하므로, task 간 cosine similarity는 residual coupling에 의해서만 제어되며 coupling이 약할 때 거의 직교하게 된다.이는 averaging 후에도 공유 방향이 남아 있는 SFT와 대조된다.
- C.4. 보충 분석: Multi-Task Gradients의 Cosine Similarity: 고차원 분해에서 uniform averaging은 공유된 지배적 방향을 보존하므로 SFT는 양의 task 간 cosine-similarity lower bound를 유지한다.residual component는 공유 방향보다 훨씬 작다고 가정하며, residual norm은 σ = ηMµ이고 η ≪1이다.
- D.1. 서로 다른 Task를 판별하는 방법: 모든 task pair가 공존하는 것은 아니므로 Parallel-RL의 효율은 task selection에 민감하며, 상당한 interference가 있는 pair는 parallel training에 적합하지 않다.task-pair criterion은 본문 interference analysis를 바탕으로 한 예비적 탐색으로 제시된다.
- D.1. 서로 다른 Task를 판별하는 방법: 서로 다른 task의 high-reward trajectory는 서로 다른 neural circuit과 pattern을 활성화하므로, score-function distribution의 t-SNE visualization을 활용할 수 있다.t-SNE latent space에서의 분리는 task가 parallel training을 수행할 만큼 충분히 독립적인지 판단하는 실용적 휴리스틱으로 기능한다.
D.2. 단일 task 학습 기법: Parallel RL의 절충 · E. 추가 실험 결과
결과는 Parallel-RL의 절충 관계를 보여준다. 탐색을 강화하면 단일 task 학습은 향상되지만 그룹 내 분산과 task 간 간섭이 증가해 최적의 중간 temperature가 형성된다. 추가 실험은 전체 본 실험 결과와 확장 ablation을 포함해 Parallel-RL의 효과와 견고성을 뒷받침한다.
- D.2. 단일 task 학습 기법: Parallel RL의 절충: task 간 RL 간섭은 각 task의 그룹 내 rollout 분산의 곱으로 제한된다: |I_RL(i, j)| ≤ V_i · V_j.이 bound는 Parallel-RL에서 단일 task 탐색과 multi-task 공존 사이의 절충 관계를 드러낸다.
- D.2. 단일 task 학습 기법: Parallel RL의 절충: 탐색을 강화하면 output 다양성이 증가하며, 낮은 확률이지만 높은 보상을 얻는 reasoning trajectory를 발견함으로써 단일 task RL 수렴이 향상될 수 있다 (Guo et al., 2025).이러한 이점은 rollout temperature를 탐색을 조절하는 control variable로 사용하는 근거가 된다.
- D.2. 단일 task 학습 기법: Parallel RL의 절충: 동일한 탐색은 각 prompt에 대한 G개 trajectory 사이의 다양성도 증가시켜 V를 확대하고 Theorem 4.5에 따른 task 간섭을 키운다.간섭이 커지면 merging phase에서 충돌과 성능 저하가 발생할 수 있다.
- D.2. 단일 task 학습 기법: Parallel RL의 절충: Parallel-RL accuracy는 τ가 증가함에 따라 non-monotonic trend를 따른다. 처음에는 향상되지만 탐색이 과도해지면 저하된다.낮은 temperature에서는 간섭이 작지만 단일 task 학습이 충분하지 않다. 높은 temperature에서는 증가한 간섭이 성능을 저해한다.
- D.2. 단일 task 학습 기법: Parallel RL의 절충: τ를 증가시키면 Math Model 성능은 향상되는 반면 −log V는 감소하며, 이는 더 큰 그룹 내 분산과 더 큰 간섭 upper bound를 의미한다.다른 task는 고정한 채 τ를 0.4에서 0.8까지 변화시키고, MATH500에서 Naive Parallel-RL accuracy를 평가했다.
- D.2. 단일 task 학습 기법: Parallel RL의 절충: τ ≈0.65에서 Parallel-RL은 단일 task 역량과 multi-task 간섭의 균형을 맞춰 best performance를 달성한다.단일 task 탐색만 최적화하는 것으로는 충분하지 않다. 손실이 적은 효과적인 task merging을 위해서는 간섭 제어도 equally important하다.
- E. 추가 실험 결과: 추가 실험은 본 실험의 전체 결과와 Table 5를 보완하는 확장 ablation을 포함해 Parallel-RL의 efficacy and robustness를 뒷받침한다.Section E.1은 Table 4에 대응하는 전체 결과를 보고하며, Section E.2는 ablation study를 확장한다.
E.1. 추가 주요 실험 결과 … E.4. Pass@K 분석
추가 LoRA 및 PPO 설정에서도 Parallel-RL은 멀티태스크 성능을 유지하거나 향상하며, task-update ablation, task-cluster 시각화, pass@k 분석은 낮은 간섭과 안정적인 reasoning capability를 뒷받침한다.
- E.1. 추가 주요 실험 결과: LoRA Parallel-RL은 direct update summation에서 대응하는 single-task accuracy의 98%를 유지하며, Adapted Parallel-RL은 평균적으로 Single-Task RL의 103%에 도달한다.이 결과는 merging 과정에서 task-specific LoRA reasoning capability가 대부분 보존됨을 나타낸다.
- E.1. 추가 주요 실험 결과: PPO에서 Naive Parallel-RL은 base model 대비 평균 성능을 5.3% 향상시키며, Adapted Parallel-RL은 9.1% 향상시킨다.Naive Parallel PPO는 single-task model 성능의 92.9%를 유지하며, 이는 Table 4에 보고된 GRPO의 94.2%보다 낮다.
- E.2. 추가 Ablation Study 결과: task update를 제거하면 해당 target task에서 평균 −6.0%의 변화가 발생하는 반면, 나머지 task의 성능은 견고하게 유지되거나 소폭 향상된다.이 ablation은 특정 update를 제외하는 것이 학습된 Naive Parallel-RL model에 미치는 영향을 평가한다.
- E.3. 추가 시각화: t-SNE가 보여주듯, RL score-function distribution은 시각화된 더 다양한 task에서 overlap이 최소화된 채 뚜렷하게 분리된 task cluster를 형성한다.비교에는 Math, Code, Logic이 포함되며 RL distribution과 SFT distribution을 대조한다.
- E.4. Pass@K 분석: Pass@k는 k개 sample 중 적어도 하나가 정답일 확률을 평가하며, decoding-sensitive accuracy를 넘어서는 reasoning potential의 proxy를 제공한다.분석에는 64개 sample pool에서 얻은 unbiased estimator가 사용되며, 평가된 k 중 가장 큰 값까지 다룬다.
- E.4. Pass@K 분석: Naive Parallel-RL은 Pass@1에서 task-specific RL에 뒤처질 수 있지만, sample 수가 증가하면 두 모델의 pass@k curve가 수렴하여 reasoning boundary가 거의 동일함을 나타낸다.분석은 주로 1.5B 및 7B full-parameter GRPO model과 1.5B LoRA model을 다룬다.
- E.4. Pass@K 분석: 대부분의 task에서 Naive Parallel-RL과 Single-Task RL은 Pass@16에서 성능 격차가 무시할 수 있을 정도로 작으며, 이는 제한된 adaptation data로 Adapted Parallel-RL을 지원한다.adaptation은 prompt당 G = 16 rollouts를 사용하므로, Pass@16 결과는 merged capability가 보존되고 다시 정렬될 수 있음을 시사한다.
F. 사례 연구 · G. 프롬프트 템플릿
사례 연구는 Parallel-RL이 수학과 논리 예시에 모두 올바르게 답하는 반면, base 및 single-task 모델은 학습한 영역 밖에서 실패함을 보여준다. 또한 부록은 네 가지 대표 task의 training 및 evaluation prompt를 명시한다.
- F. 사례 연구: 사례 연구는 수학 및 논리 task의 response example을 사용해 base model, math model, logic model, multi-task model을 비교한다.수학 예시는 MATH500 sample을, 논리 예시는 Knights-and-Knaves question을 사용한다.
- F. 사례 연구: Parallel-RL은 MATH500 problem과 Knights-and-Knaves question에 모두 올바르게 답하지만, base 및 task-specific model은 그렇지 못하다.제시된 Parallel-RL model은 네 task로 학습한 model을 직접 평균해 생성된다.
- F. 사례 연구: base model은 두 test task 모두에서 실패하는 반면, math 및 logic model은 각각의 domain에서만 성공하고 학습하지 않은 task에서는 오류를 낸다.그림은 MATH500과 Knights-and-Knaves logic question에 대한 response를 다룬다.
- F. 사례 연구: Parallel-RL response는 네 개의 sixth roots of unity를 식별해 MATH500 equation을 풀고, smallest positive integer가 6이라고 결론짓는다.response는 roots를 e^iπ/3, e^i4π/3, e^i2π/3, e^i5π/3로 나열한다.
- G. 프롬프트 템플릿: Training prompt는 deepscaler settings를 통해 Math와 Science를, Logic-RL을 통해 Logic을, DeepCoder-aligned template을 통해 Code를 다룬다.구체적인 template은 Figures 15, 20, 21에 제시된다.
- G. 프롬프트 템플릿: Evaluation은 AIME, MATH500, MMLU, GPQA에 Lighteval-style prompt를 사용하며, task-specific Logic 및 Code evaluation template도 제공된다.Figures 16–19는 Math와 Science evaluation prompt를 보여주고, Logic과 Code는 각각의 task configuration을 따른다.
- G. 프롬프트 템플릿: Code task는 specification과 일치하고 모든 test를 통과하는 correct Python program을 요구하는 prompt를 사용한다.template은 helpful-assistant system message로 시작하며 LiveCodeBench training 및 evaluation에 사용된다.