Source-linked AI summary
Teaching Language Models to Think in Code
Hyeon Hwang, Jiwoo Lee, Jaewoo Kang
TL;DR
중간 계산에 오류가 포함될 수 있어 자연어 추론 모델의 정밀한 다단계 수학 추론은 여전히 어렵다. THINC는 짧은 계획 수립 이후 code를 주된 추론자로 사용하며, THINC-4B는 5개 competition-level 수학 benchmark에서 78.1%를 달성해 평가된 모든 baseline을 앞선다.
문제
자연어 추론 모델은 정밀한 다단계 수학 계산에서 여전히 오류에 취약하다.
방법
THINC는 짧은 자연어 계획 수립을 한 번 거친 뒤, interpreter output으로 연결된 code block을 통해 이후의 모든 추론을 수행한다.
결과
평균 정확도 78.1%: THINC-4B는 5개 competition-level 수학 benchmark 전반에서 평가된 모든 tool-integrated reasoning baseline을 앞선다.
시사점 및 한계
THINC-4B 최종 답변의 99.2%는 interpreter output에서 나오며, 3회 연속 code failure 이후에도 64–69%의 recovery를 유지한다.
시사점 및 한계
실험은 1.7B 및 4B model과 competition-level 수학으로 제한되어 있어, 확장성과 다른 tool-integrated domain으로의 transfer는 검증되지 않았다.
Abstract
from arXiv · showhide
Tool-integrated reasoning (TIR) has emerged as a dominant paradigm for mathematical problem solving in language models, combining natural language (NL) reasoning with code execution. However, this interleaved setup has three key limitations: code often acts as a post-hoc verifier, intermediate NL computations are error-prone, and NL and code play overlapping rather than clearly distinct roles. We propose ThinC (Thinking in Code), a framework in which code itself serves as the reasoner rather than as a tool invoked by NL. A ThinC trajectory begins with a brief NL planning step, after which all reasoning unfolds through code blocks connected only by their execution outputs. We distill 12.2k code-centric trajectories from a teacher model and train ThinC-1.7B and ThinC-4B with supervised fine-tuning followed by reinforcement learning. ThinC-4B consistently outperforms every TIR baseline on five competition-level math benchmarks and even surpasses the much larger Qwen3-235B-A22B-Thinking. Further analysis shows that ThinC reasons through code: 99.2% of its final answers are grounded in interpreter output, and the model recovers reliably from code execution failures without intermediate NL reasoning. Our code and models will be released soon.
1 서론
THINC는 짧은 NL 계획 이후 code를 주된 reasoner로 삼아 interleaved tool-integrated reasoning의 구조적 약점을 해결한다. THINC-4B는 5개 competition-level math benchmark에서 평균 정확도 78.1%를 달성해 평가된 모든 TIR baseline을 능가했으며, 4개 benchmark에서는 훨씬 큰 NL reasoner보다 우수한 성능을 보인다.
- 관련 연구: PAL 과 PoT [2] 같은 기존 접근법은 신뢰할 수 있는 executable computation을 확립했지만, 일반적으로 execution result와 반복적으로 상호작용하지 않는 single-pass program을 생성했다.이후 ReTool [4], ASTER, Tool-Star [3]를 포함한 시스템은 tool interaction, reinforcement-learning optimization, 또는 multi-tool collaboration을 확장했다.
- 동기: Interleaved tool-integrated reasoning은 code를 post-hoc verification에 사용하는 경우가 많고, NL arithmetic error를 하드코딩된 상수로 전파하며, NL과 code에 알고리즘을 중복해 작성한다.이 세 가지 한계는 Figure 1에 요약되어 있으며, 해당 패러다임에서 반복적으로 나타나는 구조적 문제로 설명된다.
- THINC framework: THINC는 하나의 짧은 NL planning step으로 시작한 뒤, execution output만으로 연결된 code block을 통해 모든 reasoning을 수행한다.이 framework는 code를 NL reasoning이 구동하는 tool이 아니라 reasoner로 취급하며, trajectory distillation, supervised fine-tuning, reinforcement learning을 verifiable reward와 결합한다.
- 평가: 5개 competition-level math benchmark에서 평균 정확도 78.1%를 달성한 THINC-4B는 평가된 모든 TIR baseline과 5개 benchmark 중 4개에서 Qwen3-235B-A22B-Thinking을 능가한다.THINC-1.7B는 평균 정확도 42.8%를 달성해 Qwen3-1.7B보다 10.6 percentage point 높았다.
2 사전 지식
이 절에서는 tool-integrated reasoning (TIR)을 언어 모델의 텍스트 생성과 외부 도구 실행을 번갈아 수행하는 방식으로 정의하고, Python 기반 수학 추론에 초점을 둔다. 또한 TIR 시스템 학습에 사용되는 SFT와 검증 가능한 보상 기반 RL 절차를 요약한다.
- 2 사전 지식: TIR은 최종 답을 출력하기 전에 여러 turn에 걸쳐 자연어 사고 블록과 Python-interpreter 출력을 번갈아 생성한다.trajectory는 τ_TIR = (q, t_1, c_1, o_1, …, t_N, c_N, o_N, a)로 표현되며, 이는 최근 TIR 시스템이 공유하는 구조다 [6] [4].
- 2 사전 지식: SFT는 next-token prediction을 사용해 teacher-distilled demonstration trajectory로 학습하며, trajectory selection이 학습된 tool-use behavior를 형성한다 [4].도구 출력 token을 masking해도 성능 차이가 유의미하지 않았으므로, 본 연구에서는 모든 token에 대해 loss mask m_k = 1을 적용한다.
- 2 사전 지식: RL은 exact-match verifiable reward를 사용해 추출된 답이 알려진 groundtruth와 같을 때 r(τ) = 1을 부여하며, 학습된 reward model은 사용하지 않는다.보상은 r(τ) = 1[a(τ) = a⋆(q)]다.
- 2 사전 지식: GRPO [16]는 critic 없이 각 문제에 대해 trajectory 그룹을 sampling하고, 각 그룹 내 reward를 기준으로 advantage를 계산해 학습한다.sampling된 trajectory는 현재 policy π_θ에서 나온다.
- 2 사전 지식: DAPO 에 따라 RL objective는 그룹 내 token을 normalize하고 ε_low < ε_high인 asymmetric clipping을 사용해 더 큰 positive policy update를 허용한다.objective는 현재 policy와 이전 policy 사이의 per-token importance ratio를 사용한다.
3 THINC: 코드로 사고하도록 모델 가르치기
THINC는 모델이 code를 수학적 추론기로 사용하도록 가르치며, natural language는 고수준 planning으로 제한하고 code block은 execution output을 통해 연결한다. teacher distillation, supervised fine-tuning, multi-stage reinforcement learning으로 이 형식을 학습한다.
- 3.1 Code-centric trajectory: Programming language의 variable, operation, function은 수학적 object에 직접 대응하고 정밀하게 실행할 수 있으므로, code가 추론기 역할을 한다.Interpreter가 검증된 intermediate value를 생성해 NL에서 검증되지 않은 수치 계산을 제거한다.
- 3.1 Code-centric trajectory: THINC는 interleaved TIR을 code-centric reasoning으로 대체한다. 하나의 초기 NL strategy 뒤에 앞선 execution output을 바탕으로 구축되는 code block이 이어진다.Code는 derivation step을 직접 표현하고 실행하며, NL과 code는 특화된 역할을 맡는다.
- 3.2 Distillation 및 supervised fine-tuning: Teacher model filtering을 통해 최소 세 개의 code block을 포함하는, 정확하고 실행 가능한 trajectory 12,200개로 구성된 THINC-SFT dataset을 생성한다.문제는 Skywork-OR1 [8]과 OpenMathReasoning [11]에서 가져오며, trajectory는 Qwen3.5-27B에서 sampling한다.
- 3.2 Distillation 및 supervised fine-tuning: THINC는 THINC-SFT로 Qwen3-1.7B와 Qwen3-4B-Thinking-2507을 fine-tuning해 THINC-1.7B-SFT와 THINC-4B-SFT를 얻는다.모델은 32K-token context length로 세 epoch 동안 학습한다.
- 3.3 Reinforcement learning: SFT checkpoint에서 시작해 DAPO-Math-17k 로 multi-stage GRPO training을 수행하면 최종 THINC-1.7B와 THINC-4B checkpoint가 생성된다.학습에서는 context budget을 점진적으로 늘려 32K token과 더 어려운 문제에서 최대 40회의 tool call에 도달한다.
4 실험
다섯 개의 competition-level 수학 벤치마크에서 THINC-4B가 전반적으로 가장 높은 성능을 달성하며, 더 큰 tool-integrated 및 NL-only reasoner를 능가한다. 추가 분석에 따르면 이러한 성능 향상은 code-centric reasoning, reinforcement learning, 그리고 execution failure에 대한 견고성에서 비롯된다.
- 주요 결과: THINC-4B는 평균 78.1%를 기록하고 다섯 벤치마크 중 네 곳에서 선두를 차지하며, 모든 tool-integrated baseline을 능가하고 Qwen3-235B-A22B-Thinking보다 2.9포인트 높다.평가는 AIME 2024, AIME 2025, AIME 2026, HMMT 2025 February, BeyondAIME을 포함한다.
- 추론 형식: 동일 조건에서 THINC-4B는 모든 벤치마크에서 interleaved ASTER-4B baseline을 평균 4.1포인트 앞서며, 더 적은 tool call을 요구한다.비교에서는 base model, teacher capacity, reinforcement-learning pipeline을 공유하여 trajectory structure의 효과만 분리했다.
- 학습 동역학: supervised fine-tuning으로 THINC format을 확립한 뒤, reinforcement learning은 4B에서 29.9포인트, 1.7B에서 24.6포인트의 향상을 추가한다.THINC-4B-SFT는 평균 48.1%를 기록하고 THINC-1.7B는 18.1%에 도달하며, 두 모델 모두 reinforcement learning을 통해 크게 향상된다.
- Code-centric reasoning: THINC-4B는 sample당 349 code lines를 사용하며, ASTER는 102줄, CoRT는 40줄, ReTool은 261줄을 사용해 훨씬 더 적극적인 code use를 보인다.비교는 전체 benchmark trajectory를 아우르며 tool use 강화를 명시적으로 목표로 설계된 baseline도 포함한다.
- Code-centric reasoning: THINC-4B trajectory의 99.2%에서는 final answer가 execution output에 나타나며, ReTool은 88.4%, rStar2는 74.3%다.이는 THINC의 answer가 비교 대상 baseline보다 interpreter execution에 더 직접적으로 근거한다는 것을 의미한다.
- Failure recovery: 초기 execution failure가 발생한 경우에도 THINC-4B는 k = 3까지 64–69%의 Recovery@k 구간을 유지하고, k = 5에서 33.3%에 도달해 어떤 interleaved baseline보다 거의 두 배 높다.ASTER는 k = 1에서 52.1%였던 성능이 k = 5에서 18.5%로 하락하고, rStar2-Agent는 39.1%에서 0%로 하락한다.
5 논의 및 결론 … A.3 Stage 2 — 코드 중심 추론
THINC는 짧은 자연어 계획 이후 code를 주된 추론 매체로 삼아, 경시대회 수준 수학에서 강력한 성능을 달성하고 답을 인터프리터 출력에 근거하며 code 실패에서 회복한다. 한 롤아웃은 code만을 이용한 수정, 검증, 재도출을 통해 이 설계를 보여주지만, 평가는 소형 모델과 경시대회 수학에 한정되어 있다.
- 5 논의 및 결론: 다섯 경시대회 수준 수학 벤치마크에서 78.1%를 기록한 THINC-4B는 모든 baseline을 상회한다.보고된 향상은 최종 답의 99.2%가 인터프리터 출력에서 나오고, 연속된 세 번의 code 실패를 거쳐 64–69%가 회복되는 결과와 관련된다.
- 5 논의 및 결론: THINC의 평가는 1.7B and 4B models와 경시대회 수준 수학에만 적용되어, 더 큰 규모와 도메인 간 적용 가능성은 미해결로 남는다.논문은 더 큰 모델로의 scaling과 다른 tool-integrated reasoning 도메인으로의 확장을 향후 방향으로 제시한다.
- A 사례 연구: AIME 2026 Problem 3에서의 THINC-4B trajectory: A THINC-4B AIME 2026 Problem 3 롤아웃은 one brief strategic plan으로 시작한 뒤, 실행 결과가 답을 산출할 때까지 각 code 단계를 이전 인터프리터 출력에 조건화한다.이 trajectory에는 계획 이후 NL 수준 계산이 없으며, code가 추론을 수행하고 최종 답을 산출한다.
- A.1 문제: 사례 연구의 문제는 서로 다른 양의 정수 a와 b를 사용해 a+b+ab로 나타낼 수 있는 ≤100인 정수의 개수를 묻고, reference answer 70을 제시한다.이는 이후 code 중심 롤아웃이 해결해야 할 목표를 설정한다.
- A.2 Stage 1 — 전략적 계획 (t1): 초기 NL 계획은 a+b+ab를 (a+1)(b+1)−1로 인수분해하고 제약된 탐색을 지정하지만, 산술을 수행하거나 경우를 열거하지는 않는다.이 계획은 code로 한 번 전환하기 전에 m,n′ ≥2, m≠n′, m·n′ ≤101을 고정한다.
- A.3 Stage 2 — 코드 중심 추론: Five code/result exchanges가 블록 사이에 NL 추론 없이 열거, 자기 수정, 구조 점검, 독립적 재도출, 여집합 감사를 수행한다.code-only 과정은 단조성을 이용해 loop bound를 수정하고, parity로 개수를 검증하며, 변수를 이동해 다시 도출한다.
A.4 이 궤적이 보여주는 것
이 rollout은 THINC의 설계를 보여준다. natural language는 산술 없이 전략을 제시하고, 이후의 모든 reasoning은 execution outputs를 조건으로 code를 통해 진행된다. 최종 답은 code-grounded하며, 70은 natural language로 생성된 것이 아니라 interpreter outputs에 나타난다.
- 전략만 제시하는 t1: 초기 think channel은 NL에서 산술을 수행하지 않은 채 하나의 대수적 통찰과 탐색 제약을 표현하므로, derivation이 아니라 전략을 제공한다.이는 첫 planning step이 전략만 표현한다는 THINC의 제약을 구현한다.
- reasoner로서의 code: 초기 plan 이후의 모든 reasoning step—self-correction, structural verification, re-derivation, complement auditing을 포함한다—은 중간 NL reasoning 없이 code에서 수행된다.NL은 inline code comments에만 나타나며, 이후 turn들은 execution outputs를 통해 연결된다.
- execution outputs를 조건으로 하기: 각 subsequent turn은 앞선 execution output을 조건으로 하며, 이는 Turn 2의 repair로 예시되고 Eq. 6에서 형식화된다.따라서 이 rollout은 code outputs가 이후 reasoning을 이끄는 trajectory structure를 구현한다.
- code-grounded 최종 답: 70은 Turns 2, 4, 5의 interpreter outputs에 나타나므로, 확정된 답은 NL-generated가 아니라 code-grounded하다.이 rollout은 interleaved TIR baselines 대비 THINC-4B의 격차와 99.2% code-grounded answer rate를 정성적으로 반영한다.
B 궤적 증류를 위한 Few-Shot Prompt
부록은 Qwen3.5-27B에서 THINC 궤적을 유도하는 데 사용한 3-shot prompt를 제시하며, 수학적 추론이 Python 실행을 통해 진행되도록 요구한다. 예시는 code 기반 유도, 검증, 새로운 프로세스에서의 복구, 최종 boxed answer를 보여준다.
- B.1 궤적 증류를 위한 Few-Shot Prompt: 3-shot prompt는 Qwen3.5-27B teacher model에서 THINC 궤적을 유도한다.부록은 trajectory distillation에 사용한 전체 prompt를 제시한다.
- B.1 궤적 증류를 위한 Few-Shot Prompt: Solver는 Python 실행만을 통해 작업해야 하며, code는 <python> 태그 안에 넣고 output은 <result> 태그로 받는다.최종 응답에는 Python block과 하나의 <answer> block만 포함되며, 간결한 추론은 code comment로 삽입된다.
- B.1 궤적 증류를 위한 Few-Shot Prompt: 각 code block은 fresh process에서 실행되므로, solver는 library를 다시 import하고 이전 output의 값을 재정의하거나 hardcode해야 한다.turn 사이에 variable이 유지되지 않으므로, 명시적 state reconstruction이 prompting protocol의 일부가 된다.
- B.1 궤적 증류를 위한 Few-Shot Prompt: Grid 예시는 row bound, block construction, 그리고 104-cell color limit 아래의 exhaustive feasibility check를 결합해 k=12를 유도한다.10x10 block construction은 100개의 color와 color당 최대 100개의 cell로 모든 11-window를 통과하지만, 11x11은 104를 초과한다.
- B.1 궤적 증류를 위한 Few-Shot Prompt: Geometric-area 예시는 두 영역과 그 intersection을 계산해 symmetric-difference region을 구하고, 최종 답 24를 산출한다.Code는 area_A = 24, area_B = 24, intersection area = 12, area_K = 24를 보고한다.
- B.1 궤적 증류를 위한 Few-Shot Prompt: Triangle 예시는 symbolic coordinates, perpendicularity, shoelace formula를 사용해 triangle PQR의 area를 계산한다.궤적은 먼저 t = 2/3와 R = (5a/6, sqrt(3)a/6)를 구한 뒤, area를 symbolic하게 단순화한다.
C 벤치마크별 Tool Call 및 Response Length
이 절에서는 각 평가 벤치마크에서 trajectory당 평균 tool-call 횟수와 response length를 보고한다.
- C 벤치마크별 Tool Call 및 Response Length: 이 절에서는 trajectory당 평균 tool-call 횟수를 측정한다.
- C 벤치마크별 Tool Call 및 Response Length: 또한 각 평가 벤치마크의 평균 response length를 보고한다.
- C 벤치마크별 Tool Call 및 Response 길이: 분석에서는 모든 평가 벤치마크에 대해 두 지표를 각각 제시한다.
C.1 벤치마크별 Tool Calls · C.2 벤치마크별 Response Length · D OOD 일반화
THINC-4B는 GPQA-Diamond에서도 일반화되어 ASTER-4B와 base model보다 두 보고 정확도 지표에서 모두 앞선다. 또한 네 가지 수학 벤치마크에서 interpreter 호출 빈도와 trajectory 길이를 비교한다.
- D OOD 일반화: THINC-4B는 GPQA-Diamond의 avg@16 및 best@16 정확도에서 앞서며, avg@16에서는 ASTER-4B보다 3.1점, best@16에서는 base model보다 7.6점 높다.GPQA-Diamond는 대학원 수준의 물리학, 화학, 생물학을 아우르는 OOD 테스트로 사용되며, Table 2에 정확도 지표가 보고된다.
- D OOD 일반화: GPQA-Diamond 평가는 THINC-4B의 code-centric reasoning 형식이 수학 학습 도메인을 넘어 일반화되는지를 검증한다.제공된 결과는 이러한 일반화가 interleaved 대안보다 효과적임을 보여준다.
- C.1 벤치마크별 Tool Calls: Figure 6은 AIME 2024–2026, HMMT 2025 February, BeyondAIME에서 평균 Python-interpreter tool calls를 비교한다.이 비교는 각 벤치마크에서 모델이 interpreter를 호출하는 빈도를 측정한다.
- C.1 벤치마크별 Tool Calls: Tool-call 분석은 AIME 2024–2026, HMMT 2025 February, BeyondAIME를 서로 다른 벤치마크 설정으로 다룬다.Figure 6은 이들 벤치마크의 평균 interpreter 호출 횟수를 보고한다.
- C.2 벤치마크별 Response Length: Figure 7은 AIME 2024–2026, HMMT 2025 February, BeyondAIME에서 평균 trajectory 길이를 보고한다.이 그림은 벤치마크별 response length를 비교한다.
- C.2 벤치마크별 Response Length: Response-length 분석은 동일한 네 가지 수학 벤치마크 설정을 다루며, 각 설정의 평균 trajectory 길이를 보고한다.Figure 7은 벤치마크 수준의 비교를 제시한다.
E 훈련 세부 사항 · E.1 지도 미세 조정 · E.2 강화학습
학습에는 두 ThinC 모델 크기 모두에 대해 공유 단일 노드 설정을 사용하며, supervised fine-tuning 이후 reinforcement learning을 수행한다. SFT와 RL 설정은 Tables 3과 4에 정리되어 있고, RL은 DAPO에서 영감을 받은 여러 최적화 선택을 따른다.
- E 훈련 세부 사항: THINC-1.7B와 THINC-4B는 8× NVIDIA H200 GPUs를 탑재한 단일 노드에서 각 단계마다 동일한 하이퍼파라미터 설정으로 훈련된다.SFT에는 LLaMA-Factory [24]를, RL에는 verl [17]을 사용한다.
- E.1 지도 미세 조정: 지도 미세 조정 단계에서는 LLaMA-Factory 프레임워크 [24]를 사용한다.
- E.2 강화학습: 강화학습 단계에서는 verl 프레임워크 [17]를 사용한다.
- E.2 강화학습: RL은 rollout 그룹 전반에 토큰 수준 손실 정규화를 적용하고, ϵlow = 0.20 및 ϵhigh = 0.28을 사용하는 비대칭 clipping을 적용하며, KL penalty는 사용하지 않는다.이러한 선택은 DAPO 를 따른다.
- E.1 지도 미세 조정: THINC-1.7B-SFT와 THINC-4B-SFT의 SFT 하이퍼파라미터는 Table 3에 보고되어 있다.
- E.2 강화학습: Table 4는 THINC-1.7B와 THINC-4B의 전체 RL 하이퍼파라미터 설정과 3단계 curriculum을 보고한다.