Source-linked AI summary
Crosslingual On-Policy Self-Distillation for Multilingual Reasoning
Yihong Liu, Raoyuan Zhao, Michael A. Hedderich, Hinrich Schütze
TL;DR
저자원 언어는 추론 감독을 덜 받아 모델의 수학 문제 해결 능력에 대한 접근성이 제한된다. COPSD는 특권적 다언어 교사 문맥을 통해 고자원 언어의 추론을 전이하며, 17개 아프리카 언어와 다양한 모델 규모에서 일관되게 성능을 향상시킨다.
문제
저자원 언어는 고품질 추론 감독을 제한적으로 받아 모델의 잠재적 수학 문제 해결 능력에 대한 접근성이 제한된다.
방법
COPSD는 학생과 교사가 동일한 모델을 공유하도록 하며, 학생에게는 저자원 언어 문제만 제공하고 교사에게는 조밀한 감독을 위해 영어 번역과 참조 해를 제공한다.
결과
COPSD는 다양한 모델 규모와 언어에서 저자원 언어 추론을 일관되게 향상시키며, Qwen3-1.7B의 평균 Pass@12가 9.11에서 15.53으로 상승하는 결과를 보인다.
시사점 및 한계
17개 아프리카 언어 전반에서 COPSD는 GRPO를 능가하며 형식 준수, 테스트 시점 스케일링, 더 어려운 다언어 벤치마크로의 일반화를 향상시킨다.
시사점 및 한계
COPSD는 영어 참조 해에 의존하므로, 고품질 영어 감독을 이용할 수 없거나 다른 언어가 더 나은 추론 신호를 제공하는 경우 적용 가능성이 제한된다.
Abstract
from arXiv · showhide
Large language models (LLMs) have achieved remarkable progress in mathematical reasoning, but this ability is not equally accessible across languages. Especially low-resource languages exhibit much lower reasoning performance. To address this, we propose Crosslingual On-Policy Self-Distillation (COPSD), which transfers a model's own high-resource reasoning behavior to low-resource languages. COPSD uses the same model as student and teacher: the student sees only the low-resource problem, while the teacher receives privileged crosslingual context, including the problem translation and reference solution in English. Training minimizes full-distribution token-level divergence on the student's own rollouts, providing dense supervision while avoiding the sparsity and instability of outcome-only reinforcement learning (RL). Experiments on 17 low-resource African languages show that COPSD consistently improves low-resource mathematical reasoning across model sizes and substantially outperforms Group Relative Policy Optimization (GRPO). Further analyses show that COPSD improves answer-format adherence, strengthens test-time scaling, and generalizes to harder multilingual reasoning benchmarks, with especially large gains for lower-resource languages. We make our code and data available at: https://github.com/cisnlp/COPSD.
1 서론
저자원 언어는 다국어 추론 감독에 대한 모델의 노출이 제한적이어서 수학적 추론에서 계속 불리하다. COPSD는 교차언어 on-policy self-distillation을 통해 이 격차를 해소하며, 언어와 모델 규모 전반에서 base model보다 일관되게 성능을 높이고 GRPO를 크게 앞선다.
- 1 서론: COPSD는 17개 저자원 아프리카 언어 전반에서 base model 및 GRPO로 학습한 model을 일관되게 앞서며, 더 어려운 다국어 추론 설정과 특히 자원이 더 부족한 언어에서도 성능 향상이 일반화된다.평가는 AfriMGSM에서 1.7B, 4B, 8B 규모의 Qwen3 model을 대상으로 수행되며, PolyMath의 8개 언어도 포함한다.
- 1 서론: 저자원 언어는 pretraining 노출과 고품질 추론 감독이 제한적이어서, model이 잠재된 문제 해결 능력에 접근하지 못하는 경우가 많다.이는 model이 문제를 해결할 기본 능력을 보유하고 있더라도 다국어 격차를 만든다.
- 1 서론: 영어 추론을 직접 번역해 supervised fine-tuning에 사용하면 수학적·논리적 오류가 발생하고 train-inference distribution mismatch가 생길 수 있다.또 다른 대안으로 outcome-based reinforcement learning이 제시되며, model 자체 trajectory에서 더 조밀한 감독을 얻는 동기가 된다.
- 1 서론: COPSD는 서로 다른 context에서 하나의 model을 student와 teacher로 사용하고, on-policy self-distillation을 통해 고자원 언어의 추론 행동을 저자원 언어로 전이한다.이 framework는 고자원 언어 context를 privileged information으로 취급하면서 model이 생성한 trajectory에서 학습한다.
- 1 서론: COPSD는 빠르게 수렴하고 answer-format adherence를 향상하며, model이 더 큰 test-time generation budget을 활용하도록 돕는다.보고된 방법의 이점은 aggregate accuracy를 넘어 training dynamics와 inference-time scaling에도 확장된다.
2 관련 연구
선행 연구는 LLM reasoning 향상을 위해 on-policy distillation을 supervised fine-tuning과 outcome-based reinforcement learning의 대안으로 제시해 왔으며, multilingual reasoning 연구는 상당한 crosslingual 격차를 기록해 왔다. 본 연구는 OPSD를 확장해 영어로 접근 가능한 reasoning behavior를 low-resource languages로 전이한다.
- On-Policy Distillation: OPD는 LLM reasoning 향상을 위한 SFT와 outcome-based RL의 효과적인 대안으로 부상했다 (Gu et al., 2024; Agarwal et al., 2024; Lu and Lab, 2025; Yang et al., 2026).
- On-Policy Distillation: COPSD는 영어로 접근 가능한 reasoning behavior를 low-resource languages로 전이함으로써 OPSD를 multilingual settings로 확장한다.이 접근법은 low-resource reasoning을 향상하는 효과적이고 새로운 방법으로 제시된다.
- Multilingual Reasoning: Multilingual reasoning은 language models가 주로 영어 또는 다른 high-resource languages에 의존하지 않고 언어 간 reasoning problems를 일관되게 해결하는지를 평가한다 (Ghosh et al., 2025).선행 연구는 특히 low-resource languages에서 상당한 crosslingual performance gaps와 일관되지 않거나 language-mixed reasoning traces를 보고한다 (Tam et al., 2025; Zhao et al., 2026a; Liu et al., 2026; Ki et al., 2026).
3 사전 지식: On-Policy Self-Distillation
On-Policy Self-Distillation (OPSD)는 서로 다른 conditioning context에서 하나의 모델을 student와 teacher로 함께 사용하며, student가 생성한 자체 trajectory에 대해 privileged teacher distribution을 학습한다. 이를 통해 train-test mismatch를 줄이고, 외부 teacher나 outcome-only reward 없이 중간 단계에 대한 조밀한 supervision을 제공한다.
- Framework: OPSD는 동일한 모델을 student와 teacher로 사용하며, student는 문제만 보고 teacher는 reference solution과 같은 privileged information을 추가로 받는다.Teacher의 privileged context는 문제를 더 잘 rationalization할 수 있게 해 더 강한 learning signal을 제공한다. OPSD는 별도의 teacher model을 요구하지 않는다 (Zhao et al., 2026b; Zhang et al., 2026a).
- On-policy training: OPSD는 student에서 on-policy trajectory를 샘플링한 뒤, 각 decoding step에서 두 policy가 동일한 student-generated prefix를 평가하게 한다.이는 학습 중 inference-time student behavior를 유지하면서 rollout에 대한 teacher-conditioned evaluation을 가능하게 한다.
- Objective: 학습은 teacher와 student distribution 사이의 trajectory-averaged token-level divergence를 최소화하며, gradient는 student를 통해서만 흐른다.이 divergence는 KL divergence로 구현할 수 있으며, teacher는 privileged information에 조건화된 고정 distributional target으로 유지된다.
- Motivation: OPSD는 SFT나 off-policy distillation에 비해 train-test mismatch를 줄이고, outcome-based RL의 희소한 최종 답변 reward 대신 조밀한 중간 단계 feedback을 제공한다.이러한 장점은 on-policy student rollout, privileged information, 그리고 reasoning trajectory 전반에 걸친 teacher supervision을 결합한 데서 나온다.
- COPSD overview: COPSD는 student에게 low-resource translation을 제공하고, teacher가 privileged English context와 reference solution을 사용해 rollout을 평가하도록 함으로써 이 framework를 적용한다.Per-token divergence는 English로 접근 가능한 reasoning behavior를 low-resource-language reasoning으로 전달한다.
4 방법론
COPSD는 teacher에게 privileged information으로 영어 context를 제공하고 student에게는 low-resource problem만 보게 함으로써 on-policy self-distillation을 multilingual reasoning으로 확장한다. Teacher의 token-level distribution과 student 자신의 rollout을 일치시키며 student를 학습해 inference-time condition을 유지한다.
- COPSD 개요: COPSD는 teacher에게 영어 context를 제공하고 student는 low-resource problem으로 제한해 high-resource reasoning behavior를 전달한다.두 policy는 동일한 language model로 구성되지만, translated problem과 reference solution을 받는 것은 teacher뿐이다.
- 문제 정식화: 일반적인 LLM post-training이 영어 중심으로 이루어지므로 영어를 high-resource language로 사용한다 (Shaham et al., 2024; Dang et al., 2024).이 정식화는 각 low-resource problem x(L)을 영어 counterpart x(H) 및 reference solution y∗과 짝짓는다.
- 학습 목적: COPSD는 student 자신의 on-policy reasoning trajectory에서 teacher와 student distribution 사이의 token-level divergence를 최소화한다.각 단계에서 policy는 동일한 student-generated prefix를 평가하며, D는 KL divergence와 같은 distributional divergence로 설정된다.
- 학습 목적: Gradient는 student policy를 통해서만 흐르며, teacher는 privileged supervision을 제공하는 동시에 low-resource language의 reasoning을 향상시킨다.따라서 student는 inference-time condition을 따르는 반면, teacher는 추가적인 crosslingual information을 통해 더 신뢰할 수 있는 reasoning behavior를 유도할 수 있다.
- 학습 목적: 두 policy의 명시적 reasoning language는 학습 중 student input language와 일치하도록 제어된다.이 language-control condition은 §5.2에서 언급된다.
5 실험
세 가지 크기의 Qwen3 모델과 17개 아프리카 언어를 대상으로 한 실험에서 COPSD는 저자원 수학적 추론을 일관되게 향상했으며, GRPO를 능가하고 소형 모델에서 가장 큰 이점을 보였다. 평가는 AfriMGSM Pass@12를 사용했으며, 추가 평가를 위한 더 어려운 다국어 벤치마크로 PolyMath를 포함했다.
- 설정: 실험에는 Qwen3-1.7B, Qwen3-4B, Qwen3-8B가 사용되며, 이들의 post-training 데이터는 English와 같은 고자원 언어에 편중되어 있다.Qwen3 모델은 다국어 코퍼스로 사전학습된 후 supervised fine-tuning과 reinforcement learning으로 추가 학습된다.
- 데이터 및 벤치마크: 학습에는 0.5K개의 OpenThoughts 수학 문제가 17개 저자원 아프리카 언어로 번역되어 사용되며, English 질문과 해답은 teacher context로, 번역문은 student 입력으로 제공된다.주요 벤치마크는 17개 아프리카 언어를 대상으로 언어별 250개 문제를 포함하는 AfriMGSM이며, PolyMath는 언어별 125개 질문으로 더 어려운 후속 평가를 제공한다.
- 평가: 성능은 문제당 12개 응답을 샘플링하는 Pass@12로 측정하고, \boxed{} 안에 포함된 답을 추출한 뒤 Math-Verify로 gold answer와 대조해 검증한다.이 연구는 학습과 추론 중 <think> 토큰 뒤에 언어별 prefix를 삽입해 추론 언어를 제어한다.
- 결과: COPSD는 모든 Qwen3 크기에서 최상의 평균 Pass@12를 달성했으며, Qwen3-1.7B는 9.11에서 15.53으로, Qwen3-4B는 19.20에서 20.61로, Qwen3-8B는 19.41에서 23.55로 향상됐다.소형 모델은 base model 대비 평균 Pass@12에서 70% 이상의 상대적 향상을 보였으며, 거의 모든 언어에서 성능이 개선됐다.
- 결과: GRPO는 저자원 언어에서 미미한 향상만 제공하는 반면, COPSD는 정답인 추론 궤적이 드물게 샘플링되는 상황에서 더 조밀하고 신뢰할 수 있는 supervision을 제공한다.Qwen3-1.7B에서 GRPO는 Pass@12를 9.11에서 9.18로 높였지만, 여러 언어에서는 base model보다 낮은 성능을 보였다.
6 보완 분석
보완 분석에 따르면 COPSD는 빠르게 학습되고, 형식 준수와 test-time scaling을 개선하며, 반복적 퇴화를 줄이고, 더 어려운 다국어 추론 과제로 일반화한다. 특히 저자원 언어에서 큰 향상을 보인다.
- 학습 동역학: COPSD는 초기 학습 단계에서 Pass@12와 형식 비율을 개선하는 반면, GRPO에서는 뚜렷한 개선 추세가 나타나지 않는다.Qwen3-4B와 Qwen3-8B는 몇 번의 gradient update만으로 최상의 성능에 도달한 뒤 점차 하락하며, 이는 dense teacher signal을 빠르게 흡수하는 현상과 일치한다.
- 형식 준수: Pass@12는 답변 형식 준수와 강한 연관을 보이며, 언어별 평균 Pearson correlation은 Qwen3-1.7B, Qwen3-4B, Qwen3-8B에서 각각 0.628, 0.838, 0.728이다.통합한 correlation은 더 낮지만 여전히 양수로 유지된다.
- Test-time scaling: COPSD는 모델 크기와 generation budget 전반에서 가장 높은 평균 Pass@12를 달성하며, 더 긴 budget에 따른 향상을 Qwen3-8B에서 가장 크게 증폭한다.Qwen3-8B COPSD는 1,024 token에서 4,096 token으로 늘릴 때 30.0% 향상되며, GRPO의 향상 폭은 13.8%다.
- 반복적 퇴화: COPSD는 학습 중 일관되게 가장 낮은 4-gram 반복률을 유지하여, base model과 GRPO에 비해 반복 루프와 중복 추론 단편을 줄인다.반복은 다국어 추론에서 잘 알려진 실패 양상이며, 특히 저자원 언어에서 두드러진다 (Barua et al., 2026; Tran et al., 2025).
- 더 어려운 추론으로의 일반화: COPSD는 더 어려운 PolyMath 추론 과제로 일반화되어 거의 모든 언어에서 base model을 능가하며, 특히 저자원 언어에서 큰 향상을 보인다.중간 난이도에서 향상 폭은 스와힐리어의 +32.0 Pass@12 points와 텔루구어의 +32.8에 이르며, 벵골어에서는 +15.2다.
7 결론
결론은 dense token-level supervision을 위해 privileged English context를 활용함으로써, 특히 low-resource languages에서 multilingual mathematical reasoning을 향상하는 프레임워크로 COPSD를 제시한다. 또한 format adherence 개선, 빠른 수렴, 강화된 test-time scaling, 더 어려운 multilingual benchmarks로의 일반화를 보고하며, 언어 접근성과 표현이 latent reasoning ability를 부분적으로 제약한다는 점을 시사한다.
- 결론: COPSD는 teacher supervision 중 privileged English questions와 reference solutions를 활용해, low-resource languages에 초점을 두고 multilingual mathematical reasoning을 향상한다.student는 low-resource problem만으로 추론하는 반면, 동일 모델의 teacher는 dense token-level supervision을 제공한다.
- 결론: COPSD는 format adherence를 개선하고, 빠르게 수렴하며, test-time scaling을 강화하고, 더 어려운 multilingual reasoning benchmarks로 일반화한다.
- 결론: 이 결과는 low-resource reasoning 실패가 underrepresented languages를 통해 latent reasoning ability에 접근하고 이를 표현하는 데 따르는 어려움을 부분적으로 반영한다는 점을 시사하며, COPSD를 더욱 multilingual한 reasoning models로 나아가는 효과적인 경로로 자리매김한다.
한계
COPSD는 언어 전반에서 baseline보다 일관되게 향상되지만, English supervision, 번역된 문제 진술, 그리고 역량이 낮은 target language에 대한 불완전한 same-model teacher에 의존한다는 한계가 있다.
- 이러한 한계에도 불구하고 COPSD는 언어 전반에서 baseline보다 일관되게 향상되며, 남은 제약을 해결하기 위한 향후 연구의 필요성을 제기한다.
- COPSD는 English privileged context와 reference solution에 의존하므로, English supervision을 이용할 수 없거나 다른 high-resource language가 더 적합한 환경에서는 적용 가능성이 제한된다.이 방법은 임의의 privileged language를 허용하기보다 English reasoning supervision에 대한 접근을 전제로 한다.
- 번역된 training question에는 training quality와 downstream performance에 영향을 미치는 artifact가 포함될 수 있지만, COPSD에는 번역된 reasoning trace가 필요하지 않다.
- teacher로 동일한 model을 사용하면 해당 model의 역량이 제한된 language에서 불완전한 guidance가 발생할 수 있으며, training을 계속할수록 성능 포화 또는 저하가 나타날 수 있다.English context와 reference solution이 제공되더라도 일부 language와 model size에서 이러한 현상이 관찰되었다.
윤리적 고려사항
저자들은 언어 다듬기와 사소한 코드 구현 지원에 ChatGPT를 사용했으며, 모든 기술적 기여, 실험 설계 선택, 최종 결정에 대한 책임은 직접 맡았다.
- 저자들은 언어 다듬기와 사소한 코드 구현 지원에 ChatGPT를 사용했지만 [7], 모든 기술적 기여, 실험 설계 선택, 최종 결정은 직접 수행했다.
A 실험 세부 사항 · A.1 언어 범위 · A.2 언어 제어
실험은 다양한 언어 계통과 문자 체계에 걸친 AfriMGSM의 17개 아프리카 언어 전체를 ISO 639-3 식별자와 함께 다룬다. 언어별 지시문과 prompt-hacking 접두사는 명시적 추론을 대상 언어로 유도하고 최종 답을 박스 안에 제시하도록 요구한다.
- A.1 언어 범위: 실험은 여러 언어 계통과 문자 체계에 걸친 AfriMGSM의 17개 아프리카 언어 전체를 다룬다.이 범위는 상당히 다른 언어적·정서법적 조건에서 COPSD를 검증한다.
- A.1 언어 범위: ISO 639-3 코드는 학습, 평가, 결과 보고 전반에서 언어 식별자로 사용된다.
- A.2 언어 제어: 실험은 각 대상 저자원 언어에서 명시적 추론 과정을 유도하기 위해 상호보완적인 prompting 전략을 사용한다.이 접근법은 Qi et al. (2025)와 Zhao et al. (2026a)를 따른다.
- A.2 언어 제어: 대상 언어 prompt는 모델이 단계별로 추론하고 최종 답을 \boxed{} 안에 넣도록 요구한다.언어별 지시문은 각 대상 언어에 대해 제공된다.
- A.2 언어 제어: 명시적 언어 지시가 있더라도 영어 전환이나 혼합 언어 추론이 발생할 수 있어 추론 행동 비교가 복잡해진다.이 한계는 기존 다국어 추론 및 언어 혼용 연구(Wang et al., 2025a; Qi et al., 2025; Zhao et al., 2026a)에 기록되어 있다.
- A.2 언어 제어: <think> 직후에 삽입된 prompt-hacking 접두사는 </think>까지 추론을 대상 언어에 고정하는 데 도움을 준다.접두사에는 스와힐리어로 생각하기 시작한다는 내용과 같은 대상 언어 문장이 포함된다.
B 전체 결과 · C 프롬프트 템플릿 · D 환경 및 하이퍼파라미터
전체 결과는 COPSD가 언어 전반에서 추론, 형식 준수, 테스트 시점 스케일링, 반복을 대체로 개선함을 보여준다. 프롬프트 템플릿과 학습 설정은 다국어 supervision 및 평가 설정을 규정한다. 효과는 언어와 모델 규모에 따라 달라지며, 생성 예산이 증가할수록 대규모 모델이 더 일관되게 이점을 얻는다.
- B 전체 결과: COPSD는 일반적으로 학습 초기에 Pass@12와 형식 준수율을 개선하는 반면, GRPO는 언어와 모델 규모 전반에서 더 평탄하거나 불안정한 궤적을 보이는 경우가 많다.언어별 효과와 포화 양상은 모델 규모와 대상 언어의 생성 품질에 따라 달라진다.
- B 전체 결과: COPSD는 n = 1부터 6까지의 모든 모델 규모와 n-gram 세분화 수준에서 base model과 GRPO 모두보다 일관되게 더 낮은 반복률을 달성한다.이는 저자원 언어 추론에서 반복이 견고하게 감소함을 나타낸다.
- C.1 번역 프롬프트: translation prompt는 수학적 내용, 숫자, LATEX 표현을 보존하면서 영어 수학 문제를 17개의 저자원 아프리카 언어로 변환한다.Gemini-3-Flash는 문제 텍스트만 번역한다.
- C.2 Student-Policy 프롬프트: student-policy prompt는 저자원 언어 문제만 제공하고, 모델이 대상 언어로 단계별 추론을 수행하도록 지시한다.프롬프트는 언어별 지시문을 사용하며 Swahili로 예시를 제시한다.
- C.3 Teacher-Policy 프롬프트: teacher-policy prompt는 대상 언어 문제, 그 영어 번역, 영어 reference solution을 제공한 뒤 대상 언어로 해답을 작성하도록 요청한다.동일한 구조를 언어별 지시문, 레이블, 추론 접두사를 사용해 언어마다 조정한다.
- D 환경 및 하이퍼파라미터: 학습에는 17개 언어와 세 가지 규모 각각에 대해 별도 모델을 사용해 총 51개 모델을 구성하며, LoRA, AdamW, bfloat16, fixed-teacher full-vocabulary distillation, 8 A100 또는 4 H200 GPU를 사용한다.COPSD는 2,048-token 최대 completion length와 두 policy 모두의 thinking mode를 사용하며, 5 training steps마다 checkpoint를 저장한다.
- D 환경 및 하이퍼파라미터: 평가에서는 방법 간 동일한 decoding을 사용하며, thinking mode, temperature 1.0, top-p = 0.95로 문제당 12개의 응답을 샘플링한다.AfriMGSM은 1,024-, 2,048-, 4,096-token 예산을 사용하며, 다른 예산을 보고하기 전에 1,024-token 성능으로 checkpoint를 선택한다.