Source-linked AI summary

Self-Distillation Enables Continual Learning

Idan Shenfeld, Mehul Damani, Jonas Hübotter, Pulkit Agrawal

arXiv:2601.19897v2cs.LG

TL;DR

Foundation model은 기존 능력을 저하시키지 않으면서 새로운 기술과 지식을 지속적으로 습득하는 데 어려움을 겪는다. SDFT는 demonstration-conditioned model을 교사로 활용해 on-policy training signal을 생성하며, skill-learning 및 knowledge-acquisition 과제 전반에서 SFT를 능가하는 동시에 catastrophic forgetting을 줄인다.

  • 문제

    Foundation model은 기존 능력을 보존하면서 시간이 지남에 따라 새로운 기술과 지식을 습득해야 한다.

  • 방법

    SDFT는 demonstration-conditioned teacher model의 예측을, 자신의 trajectory에서 unconditioned student로 작동하는 동일한 model에 distillation한다.

  • 결과

    skill-learning 및 knowledge-acquisition 과제 전반에서 SDFT는 new-task performance를 향상시키면서 catastrophic forgetting을 크게 줄인다. 엄격한 knowledge-acquisition accuracy에서는 SFT의 80%에 비해 89%에 도달한다.

  • 시사점 및 한계

    SDFT는 단일 model이 performance regression 없이 여러 기술을 순차적으로 축적하도록 하며, demonstration으로부터의 continual learning을 위한 실용적 접근법으로 on-policy distillation을 뒷받침한다.

  • 시사점 및 한계

    SDFT는 base model의 in-context learning capabilities에 결정적으로 의존하며, adaptation에 generation pattern의 근본적 전환이 필요할 때 어려움을 겪는다.

Abstract

from arXiv · show

Continual learning, enabling models to acquire new skills and knowledge without degrading existing capabilities, remains a fundamental challenge for foundation models. While on-policy reinforcement learning can reduce forgetting, it requires explicit reward functions that are often unavailable. Learning from expert demonstrations, the primary alternative, is dominated by supervised fine-tuning (SFT), which is inherently off-policy. We introduce Self-Distillation Fine-Tuning (SDFT), a simple method that enables on-policy learning directly from demonstrations. SDFT leverages in-context learning by using a demonstration-conditioned model as its own teacher, generating on-policy training signals that preserve prior capabilities while acquiring new skills. Across skill learning and knowledge acquisition tasks, SDFT consistently outperforms SFT, achieving higher new-task accuracy while substantially reducing catastrophic forgetting. In sequential learning experiments, SDFT enables a single model to accumulate multiple skills over time without performance regression, establishing on-policy distillation as a practical path to continual learning from demonstrations.

1 서론

SDFT는 self-distillation을 통해 expert example을 on-policy signal로 변환함으로써 demonstration으로부터의 continual learning을 수행하며, catastrophic forgetting을 줄이면서 새로운 skill과 knowledge를 습득하게 한다. 명시적 reward function 없이 off-policy SFT의 한계를 해결하는 것을 목표로 한다.

  • 동기: Foundation model은 일반적으로 deployment 이후에도 parameter-static 상태로 남아 skill 습득, knowledge 내재화, 경험을 통한 성능 향력을 제한한다.Inference-time retrieval과 prompting은 behavior를 바꿀 수 있지만 model parameter를 업데이트하지는 않는다.
  • 동기: Off-policy SFT는 sequential adaptation 중 낮은 generalization과 심각한 catastrophic forgetting을 일으킬 수 있어, demonstration으로부터의 on-policy learning이 필요하다.기존 on-policy method는 주로 reinforcement learning에서 등장하며, 이때 명시적 reward function이 feedback을 제공한다. Demonstration만으로는 이러한 reward를 제공할 수 없다.
  • 관련 연구: SDFT는 demonstration에서 명시적 reward를 추론하는 대신 사용할 수 있는 방법으로, inverse reinforcement learning의 실제 활용을 제한할 수 있는 강한 reward-structure prior를 피한다.대신 demonstration에서 직접 on-policy distillation을 수행한다.
  • 방법: SDFT는 동일한 model을 student와 teacher로 사용하며, teacher를 expert demonstration에 conditioning해 student를 위한 on-policy learning signal을 생성한다.이는 demonstration conditioning 중 parameter update를 요구하지 않고 model의 in-context learning 능력을 활용한다.
  • 평가: Skill learning과 knowledge acquisition 전반에서 SDFT는 supervised learning과 비교해 안정적인 update를 가능하게 하면서 catastrophic forgetting을 크게 줄인다.이러한 설정은 새로운 task performance를 학습하고 model에 새로운 information을 통합하는 능력을 평가한다.

2 관련 연구

선행 연구는 누적 오류를 피하고 일반화와 전이를 향상하며 catastrophic forgetting을 줄이기 위해 on-policy 학습을 사용해야 한다는 동기를 제공하는 한편, IRL은 구조적 가정을 통해 누락된 보상 문제를 다룬다. SDFT는 context distillation 및 동시기에 수행된 self-distillation 연구와도 관련되지만, 기존 context-distillation 방법은 대체로 오프라인의 정적 context supervision을 사용한다.

  • Off-policy와 On-policy 학습: On-policy 학습은 off-policy 모방 정책이 demonstration에 없는 상태를 마주칠 때 발생하는 누적 오류를 피한다.Ross et al. (2011)은 이러한 추론 시점의 실패 모드를 식별했으며, on-policy 알고리즘은 모델이 유도한 trajectory를 지속적으로 학습함으로써 이를 피한다.
  • Off-policy와 On-policy 학습: On-policy reinforcement learning은 순수한 off-policy 학습에 비해 분포 외 일반화, 관련 task 전이, continual-learning 유지 성능을 향상시키는 것으로 보고되었다.이러한 실증적 발견은 Agarwal et al. (2024), Han et al. (2025), Chu et al. (2025), Li et al. (2025), Huan et al. (2025), Shenfeld et al. (2025), Lai et al. (2025)에 기인한다.
  • Inverse Reinforcement Learning: Inverse reinforcement learning은 demonstration을 사용해 underlying reward를 추론하므로, expert action을 직접 cloning하지 않고도 on-policy update를 수행할 수 있다 (Xu et al., 2020).성공적인 IRL formulation은 reward 식별 가능성을 위해 soft-optimal expert behavior, 구별 가능한 trajectory, preference access를 포함한 구조적 가정에 의존한다 (Wulfmeier et al., 2015; Ho & Ermon, 2016; Ziegler et al., 2019; Ouyang et al., 2022).
  • Context Distillation: Context distillation은 추가 정보에 조건화된 모델을, 그 외에는 동일한 student를 위한 teacher로 사용한다 (Bai et al., 2022; Snell et al., 2022).기존 접근법은 대체로 few-shot example이나 behavioral guideline과 같은 정적 context에서 오프라인 distillation을 수행하며, teacher가 분포를 형성한 trajectory로 student를 supervision한다.
  • Self-Distillation: 동시기에 발표된 두 논문은 Self-Distillation algorithm을 독립적으로 제안했으며, 이를 language model 학습에서의 잠재력을 뒷받침하는 상호보완적 증거로 본다 (Zhao et al., 2026; H¨ubotter et al., 2026).

3 자기 증류 미세조정

SDFT는 demonstration-conditioned 모델을 teacher로 사용하고 reverse-KL distillation을 통해 student를 on-policy로 학습한다. 이 방법은 모델의 demonstration-conditioned behavior에서 추론한 암묵적 보상을 사용하는 on-policy reinforcement learning과 수학적으로 동등하며, 기존 성능을 유지하면서 순차적으로 skill을 학습할 수 있게 한다.

  • 방법: SDFT는 동일한 모델을 teacher와 student로 사용한다. demonstration-conditioned teacher가 on-policy target을 생성하고, student는 해당 teacher와의 reverse KL divergence를 최소화한다.teacher는 in-context learning을 통해 형성되며, student response는 현재 student policy에서 sampling된다.
  • Teacher 가정: 이 접근법은 expert demonstration에 conditioning하면 optimal next policy를 근사한다고 가정하며, near-optimal task reward와 current policy로부터의 minimal KL deviation을 모두 요구한다.minimal-deviation 조건은 teacher가 demonstration을 단순히 복사하는 것을 막고, base model에 기반한 behavior를 보존한다.
  • 순차적 continual learning: 세 task에 대한 sequential training에서 SDFT는 다른 task의 성능을 유지하면서 각 task를 학습하는 반면, SFT 성능은 subsequent task를 학습할수록 하락한다.Figure 3은 base-model accuracy와 두 algorithm에서의 maximum accuracy를 기준으로 성능을 선형 정규화한다.
  • 암묵적 보상 해석: self-distillation objective는 student와 demonstration-conditioned counterpart 사이의 token-level probability 변화로 정의한 intrinsic reward를 사용하는 policy-gradient optimization과 expectation에서 동등하다.이는 SDFT를 모델 자체의 demonstration-aware behavior에서 추론한 reward를 최대화하는 on-policy RL algorithm으로 해석할 수 있게 한다.
  • 경험적 검증: ToolAlpaca에서 demonstration-conditioned teacher는 SFT보다 base policy에 더 가깝게 유지되며, KL divergence는 0.68 nats 대 1.26 nats다.비교에서는 training 중 policy로부터의 거리를 나타내는 proxy로 D_KL(π∥π_0)를 사용하며, teacher의 minimal-deviation property를 검증한다.

4 실험

기술 학습과 지식 습득 전반에서 SDFT는 offline baseline보다 기존 능력을 더 잘 유지하면서 새 과제 성능을 향상시킨다. 또한 순차적 기술 축적, 명시적 trace 없는 reasoning model 적응, 그리고 model scale과 on-policy learning에 따라 강화되는 성능 향상을 지원한다.

  • 기술 학습: SDFT는 기존 능력의 유의미한 저하 없이 새 과제 성능을 향상시키는 유일한 평가 방법이며, SFT는 상당한 forgetting을 일으키고 다른 방법들은 이를 부분적으로만 회복한다.Figure 4는 세 가지 기술 학습 과제 모두에서 더 우수한 Pareto efficiency를 보인다. DFT와 Re-invocation은 base model의 성능 보존에서 SDFT에 미치지 못한다.
  • 지식 습득: SFT의 80%에 비해 89% strict accuracy를 보인다는 점은 SDFT가 새로 주입된 지식의 습득을 크게 향상시키고 oracle RAG와의 격차를 거의 좁힌다는 것을 보여준다.base model은 처음에는 질문에 답하지 못하고, continual pretraining은 성능이 낮다. SFT는 크게 향상되지만 여전히 SDFT보다 뒤처진다.
  • 강건성과 Ablation: SDFT의 기술 학습 향상은 pass@k가 128까지 증가해도 유지되며 base model과 SFT를 모두 능가한다. 이는 표면적인 distributional sharpening을 넘어선 향상을 의미한다.Offline distillation은 SFT보다 향상되지만 on-policy SDFT보다 일관되게 낮은 성능을 보여, teacher quality만이 아니라 on-policy learning이 중요함을 부각한다.
  • 장기 Continual Learning: SDFT는 세 기술 모두를 안정적으로 순차 축적하며, 새로 도입된 각 과제의 성능을 향상시키면서 이전에 학습한 성능을 유지한다. 반면 SFT는 심각한 interference를 보인다.Figure 3은 SFT가 새 과제로 전환할 때 이전 기술의 성능이 빠르게 저하되어 진동하는 성능을 낳는다는 것을 보고한다.
  • Scaling: 7B와 14B에서 SDFT는 SFT보다 각각 4점과 7점 향상되지만, 작은 3B model은 in-context learning이 약한 teacher guidance를 제공하기 때문에 뒤처진다.단조로운 scaling 추세는 SDFT의 효과가 model의 in-context reasoning 수행 능력과 연결됨을 보여준다.
  • Reasoning Model: 시작 accuracy가 31.2%일 때 SFT의 23.5%에 비해 43.7% accuracy를 달성한다는 점은 SDFT가 명시적인 intermediate reasoning trace 없이도 reasoning model을 효과적으로 적응시킨다는 것을 보여준다.SFT는 응답도 급격히 짧게 만들어 reasoning behavior가 붕괴했음을 시사한다. 반면 제안 방법은 supervision이 final answer만 포함하는데도 accuracy를 향상시킨다.

5 논의 및 한계

SDFT는 on-policy RL을 대체하기보다 보완한다. 보상 없이 demonstration에서 학습하고, 생성 품질을 향상시키며, 효율적인 token-level supervision을 제공한다. 한계로는 높은 학습 비용, in-context learning 의존성, 언어적 artifact의 계승, 그리고 잔존하는 망각이 있다.

  • on-policy RL과의 관계: 명시적 보상 없이 expert demonstration을 사용할 수 있을 때 SDFT를 적용할 수 있는 반면, on-policy RL은 보상을 전제로 exploration을 통해 expected return을 최적화한다.
  • on-policy RL과의 관계: SDFT는 모든 k에 대해 pass@k를 일관되게 향상시키며, 이는 더 강한 policy로 후속 RL fine-tuning을 초기화할 수 있음을 시사한다.이러한 향상은 high-probability generation의 다양성과 품질이 더 높음을 나타낸다.
  • 계산 비용: SDFT는 prompt마다 하나의 on-policy generation을 필요로 하며 token- 또는 logit-level supervision을 제공한다. 이는 generation cost를 높이는 group-based advantage estimation과 다르다.SFT와 비교하면 SDFT는 약 2.5× 더 많은 FLOPs와 대략 4× 더 긴 wall-clock training time을 소요한다.
  • 학습된 artifact와 향후 연구: 원래 context가 없어도 student는 “Based on the text...”와 같은 spurious teacher phrase를 물려받을 수 있으며, 실용적인 우회책은 여전히 heuristic에 머문다.더 원칙적인 해결책은 여전히 미해결 문제이며, 망각이 줄어들었음에도 이전 capability의 일부 저하도 남아 있다.
  • 모델 capability 요구사항: SDFT의 효과는 base model의 in-context learning에 의존한다. ICL이 약한 소형 모델은 의미 있는 teacher signal을 제공하지 못한다.이 방법의 설계는 지원할 수 있는 adaptation 유형도 제한한다.

A 추가 절제 실험 · A.1 KL 그래디언트 추정

절제 실험에서는 sequence-level KL 그래디언트를 위한 세 가지 추정량을 비교하며, 실제 계산에서 발생하는 편향, 분산, 비용 간 trade-off를 분석한다. 주 실험에는 가장 안정적인 최적화와 최고 downstream 성능을 제공하는 full analytic per-token estimator를 사용하고, 단일 trajectory sampling으로 비용이 큰 미미한 성능 향상을 피한다.

  • A.1 KL 그래디언트 추정: sequence-level KL 그래디언트는 current policy가 sampling distribution과 logarithm 항을 모두 결정하기 때문에 추정하기 어렵다.따라서 추정량마다 편향, 분산, 계산 비용 간 trade-off가 발생한다.
  • A.1 KL 그래디언트 추정: token-level estimator는 KL을 독립적으로 미분되는 token 항으로 분해하지만, 앞선 token이 이후 distribution에 미치는 영향을 무시하므로 편향된다.이 추정량은 sequence-level KL의 partial derivative에 해당한다.
  • A.1 KL 그래디언트 추정: full analytic per-token estimator는 각 timestep에서 vocabulary 전체에 대해 marginalization하여, sample-based token estimator보다 분산을 줄이면서도 sequence-level bias는 유지한다.forward pass에서 이미 생성된 quantities를 사용하므로 계산 측면에서도 매력적이다.
  • A.1 KL 그래디언트 추정: Rao–Blackwellized estimator는 prefix를 sampling하면서 next-token distribution에 대해 analytic integration을 수행하여, standard Monte Carlo보다 provably lower variance를 갖는 unbiased KL 및 gradient estimates를 산출한다.이 장점에는 더 높은 계산 비용이 따르며, 이 설정에서는 결과가 측정 가능하게 개선되지 않았다.
  • A.1 KL 그래디언트 추정: full analytic per-token estimator는 sequence-level bias에도 불구하고 일관되게 가장 안정적인 최적화와 최고 downstream 성능을 제공한다.token-level estimator는 더 높은 분산과 더 약한 KL 제어를 보이는 반면, Rao–Blackwellization은 추가된 복잡성에 비해 측정 가능한 이점을 제공하지 않는다.
  • A.1 KL 그래디언트 추정: 주 실험에서는 analytic per-token KL estimator를 사용해 prompt당 one trajectory만 사용한다. 추가 trajectory는 결과를 미미하게만 개선하면서 compute를 크게 증가시키기 때문이다.여러 sample은 이론적으로 Monte Carlo 분산을 줄일 수 있지만, prompt당 sample 수를 늘려도 실제 개선은 미미했다.

A.2 시연 조건부 컨텍스트의 중요성 · A.3 Teacher Model 선택

절제 실험은 효과적인 지식 전달을 위해 전체 demonstration context를 조건으로 하는 teacher가 필요하며, teacher-policy 선택이 training stability에 결정적인 영향을 미침을 보여준다. 전체 text-plus-answer conditioning은 부분적 context보다 우수하고, frozen-base와 self-teacher 선택 모두 중요한 한계를 지닌다.

  • A.2 시연 조건부 컨텍스트의 중요성: 이 방법은 teacher를 source text와 풀이된 answer 모두에 조건화하고 on-policy로 distillation을 수행한다는 점에서 최근의 offline knowledge-injection distillation과 다르다.인용된 기존 접근법은 teacher context로 raw corpus만 사용한다.
  • A.2 시연 조건부 컨텍스트의 중요성: 전체 text-plus-answer conditioning에서의 89% strict accuracy는 text-only conditioning에서의 75%보다 우수하며, 지식 전달에 전체 demonstration context가 핵심임을 확립한다.전체 context는 answers-only conditioning보다도 우수하며, text-only conditioning은 answers-only context보다 성능이 높지만 여전히 약하다.
  • A.2 시연 조건부 컨텍스트의 중요성: 이 context ablation은 on-policy training procedure를 고정한 채 article-text-only, answer-only, full text-plus-answer teacher conditioning을 비교한다.offline distillation과의 직접 비교는 Section 4.6으로 미룬다.
  • A.3 Teacher Model 선택: framework가 external teacher를 요구하지 않더라도 teacher-policy 선택은 stability에 결정적인 영향을 미친다.이 절제 실험은 distillation 중 teacher가 어떻게 구현되는지를 평가한다.
  • A.3 Teacher Model 선택: frozen base model을 teacher로 사용하면 training은 안정적이지만, learning 중 획득한 개선을 반영하지 못하기 때문에 일관되게 성능이 낮다.그 한계는 teacher가 student의 새롭게 학습된 능력과 계속 분리되어 있다는 점이다.
  • A.3 Teacher Model 선택: student 자체를 teacher로 사용하면 심각한 불안정성이 발생한다. stochastic token-level fluctuation이 on-policy feedback loop를 통해 증폭되어 training이 발산할 수 있기 때문이다.본문은 대안적인 teacher 구현으로 exponential moving average (EMA)를 유지하는 방안을 조사한다고 보고한다.

B 훈련 및 평가 세부사항 · B.1 훈련 세부사항

실험에서는 단일 NVIDIA H200 GPU에서 full-parameter fine-tuning을 수행했으며, validation 성능을 기준으로 hyperparameter를 선택했다. SDFT는 여러 training epoch에서 이점을 보인 반면, SFT는 대체로 한 epoch 이후 overfit했으며, 훈련에는 example당 하나의 on-policy rollout을 사용하는 analytic KL estimator를 적용했다.

  • B.1 훈련 세부사항: 실험에서는 Hugging Face TRL library를 사용해 단일 NVIDIA H200 GPU에서 모든 model parameter를 fine-tuning했다.각 방법에 대해 learning rate, batch size, training epoch를 sweep했다.
  • B.1 훈련 세부사항: 보고된 test 결과는 target task에서 best validation performance를 보인 checkpoint에서 얻었다.
  • B.1 훈련 세부사항: EMA teacher는 안정적이고 효과적인 훈련을 제공한 반면, frozen base model은 learning progress를 추적하지 못해 성능이 낮았다.
  • B.1 훈련 세부사항: 현재 student를 teacher로 직접 사용하면 training instabilities가 발생했다.
  • B.1 훈련 세부사항: SDFT는 Skill Learning task에서 2 epochs, Knowledge Acquisition task에서 4 epochs를 적용할 때 대체로 이점을 보였지만, SFT는 대부분의 경우 one epoch를 넘어서는 추가 이득을 보이지 않았다.Tables 3 and 4에 해당 search space와 선택된 hyperparameter가 보고되어 있다.
  • B.1 훈련 세부사항: SDFT는 Section 3의 prompt template으로 teacher context를 구성하고, example당 one on-policy rollout을 사용하는 analytic per-token KL gradient estimator를 적용했다.

B.2 평가 세부 사항

평가는 각 metric에 맞춘 decoding 설정을 사용했으며, 3개의 random seed에서 95% 신뢰구간과 함께 결과를 보고하고 6개 표준 benchmark에서 기존 능력을 평가했다.

  • Sampling 전략: Accuracy에는 greedy decoding(temperature = 0)을 사용했고, pass@k에는 nucleus sampling(top-p = 0.95)과 temperature = 1.0을 사용했다.
  • 통계 보고: 달리 명시하지 않는 한, 실험에는 3개의 random seed를 사용했으며 95% 신뢰구간과 함께 평균 성능을 보고했다.
  • 기존 능력 평가: 기존 능력은 Language Model Evaluation Harness를 사용해 HellaSwag, TruthfulQA, MMLU, IFEval, Winogrande, HumanEval에서 평가했다.

B.3 데이터셋 세부 정보

실험에서는 과학 Q&A, 도구 사용, 의학적 추론, 지식 습득에 서로 다른 데이터셋을 사용하며, 과제별 분할, demonstration 구성, 자동 또는 exact-match 평가 절차를 적용한다.

  • Science Q&A: Science Q&A에서는 Chemistry L-3 SciKnowEval subset을 사용하며, 이를 train, validation, test set으로 약 75%/5%/20%씩 분할하고, 모든 training example에 대해 GPT-4o가 생성한 유효한 demonstration을 사용한다.각 prompt마다 최대 8개의 GPT-4o 응답을 샘플링하고, 최종 정답과 일치하는 응답 하나를 유지했다. 객관식 과제의 accuracy는 exact matching으로 계산했다.
  • Tool Use: Tool-use 실험에서는 demonstration이 포함된 ToolAlpaca의 original train-test split을 사용하고, argument 순서의 변형을 허용하면서 regex matching으로 API call을 평가한다.
  • Medical: Medical 실험에서는 약 20,000개의 English HuatuoGPT-o1 question으로 학습하고, 무작위로 샘플링한 검증 가능한 1,000개의 question을 GPT-5-mini로 평가하여 reference answer와 비교해 정답 여부를 판단한다.평가자는 응답에 핵심 의학 정보가 포함되어 있으면 표현이 다르거나 추가적인 올바른 세부 정보가 있더라도 CORRECT로 표시하고, 그렇지 않으면 INCORRECT로 표시한다.
  • Knowledge Acquisition: Knowledge acquisition에서는 model의 knowledge cutoff 이후 발생한 2025년 자연재해 9건에 관한 Wikipedia article을 사용하고, GPT-5가 생성한 multi-fact question-answer pair와 수동 중복 question 검사를 적용한다.목록에 포함된 사건은 지진, 홍수, 폭풍, 토네이도, 허리케인이며, GPT-5-mini가 자동 평가자 역할을 했다.
Loading 2601.19897v2…