Source-linked AI summary
SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPOD
Dongfang Li, Xiaodong Luo, Ruoyu Sun, Xuhui Chen, Linyuan Qiu, Jian Meng, Zhengxuan Lu, Yiting Wang, Yucheng Xie, Tao Guo, Tianxiang Fang, Jing Li, Sihang Chen, Shihao Hong, Chang Liu, Weihua Dai, Zirong Zeng, Ziwei Zhu, Zhuohan Wang, Zhengjun Yue, Igor Vasilyev, Min Liu, Weijian Sun, Xin Chen, Yingmeng Gao, Jinhua Zhou, Taolue Chen, Chenwei Wu, Dong Zhang, Wenlong Jin, Jinmin Xiang, Barkova Maria, Ushakov Anton, Xianfei Jin, Tian Ding, Zhihang Lin, Qian Chen, Linxin Yang, Mingzhe Yang, Bingwei Zhang, Hongzhang Yang, Fangxue Zhang, Shijun Qin, Jie Yu, Cuihua Hu, Tolstykh Vasiliy, Nosov Ivan, Abdullin Amir, Zhicheng Zhou, Xin Zhang, Zhixiong Ning, Xutong Zhao, Junjie Huang, Jiajun Liu, Weiyan Kong, Zheng Zhang, Wenhan Luo, Lin Hu, Yangbo Guo, Li Zeng, Shihao Zhang, Baotian Hu, Min Zhang, Haizhou Li, Zhiquan Luo
TL;DR
Trillion-parameter MoE post-training은 비GPU 하드웨어에서 아직 충분히 탐구되지 않았고, Operations Research는 LLM post-training에서 과소대표되어 있다. SLAI T-Rex는 Ascend SuperPOD 최적화와 solver-grounded OR specialization을 결합해 34.22% MFU와 향상된 OR 성능을 달성한다.
문제
SIMD 하드웨어에서의 trillion-parameter MoE post-training과 LLM의 Operations Research 통합은 상대적으로 충분히 탐구되지 않았다.
방법
SLAI T-Rex는 full-stack Ascend SuperPOD training optimization과 solver-grounded CPT–SFT specialization을 결합해 Operations Research에 적용한다.
결과
trillion-parameter MoE training에서 34.22% MFU를 달성했으며, CPT initialization은 평가된 benchmark 전반에서 OR 성능을 향상했다.
시사점 및 한계
이 결과는 Ascend SuperPOD에서 large-scale post-training의 실용적 실행 가능성과 DeepSeek-V4-Pro까지 OR workflow를 효과적으로 확장할 수 있음을 보여준다.
시사점 및 한계
평가는 보고된 OR problem family와 general-capability benchmark로 제한되어 있어, 향후 더 폭넓은 평가가 필요하다.
Abstract
from arXiv · showhide
Full-parameter post-training of trillion-parameter-scale MoE models introduces substantial system-level challenges for large-scale distributed training, including severe memory pressure, non-overlapped communication overhead, and inefficient kernel execution. While most large-scale LLM training systems are built around GPU-based clusters, this report presents an end-to-end optimization practice on the Ascend NPU SuperPOD. Using the DeepSeek-V4 model family as the target workload, we develop a hierarchical optimization framework spanning model-level parallelism, computation-communication orchestration, and low-level kernel execution. The resulting system achieves 34.22% Model FLOPs Utilization (MFU) with a 2.93x improvement over the open-source baseline recipe while maintaining training stability. Building on this optimized infrastructure, we further establish a CPT and SFT workflow for complex Operations Research (OR) tasks. We refer to the integrated framework as SLAI T-Rex. Using DeepSeek-V4-Flash, we develop OR-oriented CPT and SFT data pipelines that combine collected domain resources with solver-verified synthetic optimization documents. The resulting dataset contains 10K high-quality SFT samples spanning four task categories and three problem representations. The specialized model achieves the highest average zero-shot Pass@1 score among the evaluated models, reaching 71.81% and outperforming GPT-5.4-Mini and the base DeepSeek-V4-Flash model by 3.98 and 11.27 percentage points, respectively. Overall, this work demonstrates a full-stack pathway from efficient trillion-parameter model post-training on Ascend infra to domain-specialized Flash models for solver-grounded mathematical modeling, advancing frontier-model systems for complex reasoning.
1. 서론
SLAI T-Rex는 trillion-parameter DeepSeek-V4 post-training을 위한 Ascend-native 시스템 최적화와 solver-grounded Operations Research용 CPT–SFT 특화를 결합한다. DeepSeek-V4-Flash와 DeepSeek-V4-Pro 전반에서 training efficiency와 OR reasoning performance를 함께 향상한다.
- 동기와 범위: SLAI T-Rex는 SIMD Ascend hardware에서 충분히 탐구되지 않은 trillion-parameter MoE post-training 문제를 다룬다. 기존 연구는 주로 CUDA 또는 TPU 지향 인프라를 대상으로 한다.이 framework는 system optimization과 scale-up validation에 DeepSeek-V4-Pro를, OR workflow에 DeepSeek-V4-Flash를 사용한다.
- 시스템 최적화: 34.22% MFU는 DeepSeek-V4-Pro를 11.67%에서 끌어올리고, open-source baseline recipe 대비 2.93× improvement를 달성한다.이 system은 Ascend SuperPOD에서 multi-dimensional parallelism, communication orchestration, memory management, kernel execution을 공동 최적화한다.
- OR 특화: 71.81% average OR score로 SLAI T-Rex-Flash는 GPT-5.4-Mini보다 3.98 points, original DeepSeek-V4-Flash보다 11.27 points 높은 성능을 보인다.이 workflow를 DeepSeek-V4-Pro에 적용하면 average OR score도 70.16%에서 77.33%로 상승한다.
- CPT–SFT workflow: 동일한 SFT 설정에서 CPT initialization은 DeepSeek-V4-Flash의 direct-SFT scores를 B4O-Feasible과 B4O-ORGEval에서 각각 65.93%와 48.73%에서 71.22%와 59.39%로 향상한다.이 workflow는 solver-grounded CPT data, self-distilled SFT generation, contract-aware cleaning, benchmark evaluation을 결합한다. CPT는 task-specific SFT를 넘어 OR-domain knowledge를 추가한다.
- 커널 및 하드웨어 최적화: AuraKernel은 DeepSeek-V4의 주요 bottleneck operators를 위해 solver-guided AscendC tiling optimization을 도입하여, kernel optimization을 수동 및 heuristic methods의 범위 너머로 확장한다.OR solver와 전용 harness는 정확한 tiling selection을 가능하게 하며, 더 넓은 분석은 MoE, sparse attention, memory hierarchy, communication, kernel execution을 연결한다.
2. Ascend CloudMatrix384 SuperPOD의 학습 인프라
Ascend SuperPOD 프로파일링은 통신 지연, 아키텍처 특화 sparse-attention 커널, launch로 세분화된 데이터 이동을 주요 학습 비효율 요인으로 식별한다. 인프라는 virtual pipeline parallelism, overlapped state swapping, AuraKernel 기반 AscendC 최적화를 통해 이를 해결한다.
- 통신 오케스트레이션: 프로파일링 결과 TP/DP 결과 수집과 기존 1F1B pipeline send-receive 지연이 주요 step-time 병목으로 나타났으며, SuperPOD 인터커넥트에서 MoE 통신은 여전히 미미하다.따라서 최적화는 MoE 통신을 지배적인 오버헤드로 간주하기보다 통신 오케스트레이션을 우선한다.
- 커널 최적화: AuraKernel은 메모리 및 제어에 의해 제한되는 커널에 end-to-end AscendC 최적화를 제공하며, 커널 내부 튜닝을 fragmented operator chain의 fusion 또는 재표현으로 보완한다.이 접근법은 아키텍처 고유의 compute-heavy 커널과 cast, view, tensor 이동, reduction으로 구성된 PyTorch 수준의 연산 시퀀스를 모두 대상으로 한다.
- Pipeline parallelism: Virtual pipeline parallelism은 지배적인 pipeline bubble을 억제하면서 디바이스별 메모리를 하드웨어 예산 안에 유지하고 학습 안정성을 보존한다.DualPipeV는 end-to-end 지연에 미미하게 기여하는 구성 요소를 가속하기 위해 상당한 메모리 페널티를 초래한다.
- 메모리 관리: Double-buffered swap optimizer는 chunk 단위 비동기 swap-in 및 swap-out stream을 통해 host-state 전송과 fused AdamW 계산을 중첩한다.한 chunk를 업데이트하는 동안 다음 chunk는 prefetch되고 이전 chunk는 비동기적으로 다시 기록된다.
- 커널 병목: 206,503개의 compute-kernel launch와 39.84 s의 device compute는 아키텍처 특화 head와 launch로 세분화된 PyTorch-eager tail을 드러낸다.Non-matmul eager 연산은 launch의 91.3%를 차지하지만 Task Duration의 66.7%를 차지하며, vector kernel은 계산에 약 15%의 utilization을 사용하는 반면 load와 store에는 각각 약 68%와 40%를 사용한다.
- 커널 병목: 전체 kernel computation time의 16.86%가 SparseAttnSharedkvGrad에서 발생하므로 sparse-attention backward가 개별 device compute 기여도가 가장 큰 요소다.sparse-attention kernel은 비통신 kernel 시간의 대략 사분의 일을 차지하며, dense MatMulV3와 MoE GroupedMatmul의 합산 기여도를 웃돈다.
3. OR 중심 Post-Training Workflow
OR 중심 workflow는 원본 checkpoint 진단, CPT–SFT 설계, 단계별 평가를 연결해 protocol 준수, solver 지향 구현, 수학적 정식화, 구조적 동치 문제를 다룬다. 진단 결과, prompting으로 일부 행동은 복원할 수 있지만 안정적인 one-pass 생성에는 표적 학습과 solver 검증 데이터 합성이 필요하다.
- 원본 checkpoint 진단: B4O-Feasible은 60.47% Pass@1에 도달한 반면 B4O ORGEval은 34.26%에 그쳤으며, code/build pass rate는 79.19%였고, 이는 실행 가능성과 구조적 동치 사이의 정렬이 약함을 드러낸다.이 결과는 단순한 program execution이 아니라 구조 보존이 핵심 checkpoint 병목임을 보여준다.
- 단계별 평가: 5-shot은 B4O-ORGEval을 34.26%에서 71.57%로 높였지만, Pass@16은 여러 value-based benchmark에서 개선되더라도 B4O ORGEval에서는 5-shot보다 낮게 유지된다.이 결과는 contextual example이 기존 solver 지향 protocol과 정식화 template을 활성화하는 반면, sampling만으로는 canonical formulation을 안정적으로 선택하지 못함을 보여준다.
- CPT–SFT 설계: 학습 설계에서 CPT는 OR-domain modeling prior와 구조 지식을 확장하고, SFT는 code-only generation, API 사용, objective extraction, schema 처리, prompt로 활성화되는 행동을 안정화한다.Pass@16에서 복원 가능한 출력은 verifier-guided SFT와 rejection-sampled distillation을 뒷받침하지만, 남아 있는 구조 오류는 sampling만으로는 불충분함을 보여준다.
- 오류 분석: 1,456개 실패 사례에서 structural equivalence가 가장 큰 오류군이며, Pass@1은 특히 5-shot prompting으로 크게 감소하는 protocol/API/schema 오류의 영향을 크게 받는다.분석은 세 가지 inference setting과 네 개의 benchmark cell에서 실패를 묶어, distribution shift를 prompt로 해결 가능한 문제와 더 깊은 modeling 문제로 연결한다.
- 오류 분석: 분류 체계는 canonical structure mismatch, protocol 및 schema 오류, 이산변수 의미론, 보존 제약, ratio 및 unit coupling, solver 호환 nonlinear reformulation을 포괄한다.예로는 잘못된 variable 또는 constraint family, 누락된 integrality, 왜곡된 loss semantics, 손상된 savings relation, solver가 지원하지 않는 nonlinear objective가 있다.
- CPT 데이터 구축: OR-CPT Data Engine은 solver 검증 bidirectional synthesis를 사용해 구조화된 optimization instance를 진단된 capability gap을 겨냥하는 자연어 modeling document로 변환한다.이는 variable-domain 모호성, 약한 parameter grounding, 불완전한 constraint, nonlinear 또는 ratio-based modeling 실패, 구조 불일치를 다룬다.
4. 실험 결과
실험 결과, SFT는 프로토콜 지향 OR 과제의 성능을 높이지만 자연어 모델링 성능을 저하시킬 수 있으며, contract-aware cleaning과 CPT 초기화가 네 가지 벤치마크 전반에서 성능을 회복하고 확장한다. 결과는 재현 가능한 8-node Ascend workflow를 뒷받침하며, 가장 큰 성능 향상은 단순한 scale이 아니라 검증된 domain-specific supervision에서 비롯된다.
- 실험 workflow: 전처리 pipeline, MindSpeed-LLM training script, DeepSeek-V4-Flash, 그리고 8-node 910C environment가 후속 data-scale 및 distillation 실험을 위한 재현 가능한 full-parameter SFT workflow를 구성한다.최종 SFT label은 정제되지 않은 SFT-10K scale-analysis 실행과 transfer 및 end-to-end 비교에 사용된 정제된 CoT-enhanced checkpoint를 구분한다.
- SFT data scale: SFT-10K는 B4O-Feasible을 60.47에서 65.07로, B4O-ORGEval을 34.26에서 47.21로 향상시키지만, NL4OPT는 84.08에서 81.66으로, OptiBench는 63.33에서 62.67로 낮춘다.SFT-50K로 확장해도 자연어 성능 저하는 해소되지 않으며, 오히려 OptiBench는 58.68로 하락한다.
- Contract-aware cleaning: Clean-CoT는 정제되지 않은 SFT-10K보다 NL4OPT에서 5.27 percentage points, OptiBench에서 1.50, B4O-Feasible에서 0.86, B4O-ORGEval에서 1.52 향상된다.명시적 reasoning format을 허용하는 과제에서 향상이 가장 크게 나타나며, modeling checklist가 variable domain, objective direction, constraint direction을 학습시킨다.
- 오류 분석: Cleaning은 NL4OPT에서 wrong_objective_or_model error를 52에서 31로, OptiBench에서 154에서 128로 줄이지만, OptiBench의 nonlinear_or_bad_- gurobi_form error는 49에서 56으로 증가한다.따라서 chain-of-thought enhancement는 단순히 reasoning을 길게 하기보다 reviewer 및 validator check를 통해 contract-aware하게 유지하고 gating해야 한다.
- CPT 및 SFT transfer: B4O-ORGEval의 +10.66 pp는 CPT-over-SFT gain 중 가장 크며, NL4OPT의 +2.59 pp, OptiBench의 +2.95 pp, B4O-Feasible의 +5.29 pp가 뒤따른다.CPT 초기화는 네 가지 벤치마크 모두를 향상시켜 solver executability와 structural equivalence를 함께 강화한다.
5. 결론, 한계, 향후 방향
SLAI T-Rex는 Ascend NPU SuperPOD에서 안정적인 trillion-parameter 모델 post-training을 수행하는 동시에 DeepSeek-V4-Flash와 DeepSeek-V4-Pro 전반의 solver-grounded OR modeling을 개선한다. 이 보고서는 재현성 artifact를 공개하고, 더 효율적인 full-parameter training과 AgenticRL을 향후 방향으로 제시한다.
- 결론: 90.00% AIME 2024, 86.67% AIME 2025, 67.00% LiveCodeBench는 일반 능력 보존이 향상되었음을 보여주며, HumanEval은 변함없고 CMMLU는 93.12%로 소폭 감소한다.SLAI T-Rex-Pro는 이에 대응하는 83.33%, 70.00%, 55.00% baseline을 개선하며, SFT-only checkpoint가 가장 높은 LiveCodeBench 결과를 기록한다.
- 결론: 34.22% MFU는 Ascend NPU SuperPOD에서 trillion-parameter MoE의 full-parameter post-training이 효율적이고 실용적으로 가능함을 입증한다.최적화는 non-GPU platform에서 system-level training orchestration과 bottleneck-level kernel optimization을 아우른다.
- 결론: 완전한 SLAI T-Rex-Pro configuration은 77.33% average OR score를 달성하며, post-training 이전의 70.16%와 SFT만 적용한 76.74%를 상회한다.Scale-up validation은 DeepSeek-V4-Flash에서 개발한 workflow가 더 큰 Pro model에서도 효과적임을 보여준다.
- 한계: Targeted contract-aware cleaning과 간결한 CoT enhancement는 10K self-distilled SFT data를 50K로 확장하는 것보다 더 안정적으로 개선한다.10K에서 50K로의 확장은 non-monotonic하며 natural-language modeling benchmark를 저하시킬 수 있으므로, modeling error의 수정과 엄격한 output contract가 특히 중요하다.
- 향후 방향: 향후 연구에서는 end-to-end full-parameter training을 개선하고, workflow를 AgenticRL로 확장하며, operations-research modeling을 활용해 multi-dimensional parallel configuration을 탐색한다.공개된 artifact에는 prompt template, format-contract specification, curriculum configuration, monitoring callback, 그리고 구성 가능한 Cleaner, Reviewer, Diagnostic Resolver module이 포함된다.
- 결론: SLAI T-Rex는 trillion-scale MoE와 hybrid-attention model의 안정적인 full-parameter post-training을 지원하며, DeepSeek-V4-Flash와 DeepSeek-V4-Pro에서 측정 가능한 OR 향상을 달성한다.이 workflow는 domain knowledge acquisition, solver-grounded data construction, supervised adaptation을 vertical-domain modeling에 맞춰 통합한다.
부록 · A 저자 목록
부록에는 이 연구에 참여한 프로젝트 책임자, 핵심 기여자, 추가 기여자가 정리되어 있다.
- A 저자 목록: 핵심 기여자로 Dongfang Li, Xiaodong Luo, Ruoyu Sun, Xuhui Chen, Linyuan Qiu가 있다.
- A 저자 목록: 핵심 기여자로 Jian Meng, Zhengxuan Lu, Yiting Wang, Yucheng Xie, Tao Guo도 있다.
- A 저자 목록: 핵심 기여자 명단에는 Tianxiang Fang, Jing Li, Sihang Chen, Shihao Hong, Chang Liu도 포함된다.
- A 저자 목록: 추가 기여자로 Yingmeng Gao, Jinhua Zhou, Taolue Chen, Chenwei Wu, Dong Zhang이 있다.
- A 저자 목록: 추가 기여자 명단에는 Wenlong Jin, Jinmin Xiang, Barkova Maria, Ushakov Anton, Xianfei Jin도 포함된다.
- A 저자 목록: 프로젝트 책임자는 Baotian Hu, Min Zhang, Haizhou Li, Zhiquan Luo다.
B Post-training Recipe 세부 사항
이 부록은 CPT, SFT, agentic rollout의 recipe 수준 설정을 최적화, 병렬 실행, 메모리 사용량, 추론 동작 및 재현성 측면에서 상세히 다룬다. CPT는 긴 컨텍스트 continued pretraining을 사용하고, SFT는 프롬프트 토큰에 loss masking을 적용해 instruction-response trajectory를 학습한다.
- 개요: 이 부록은 최적화, 병렬 실행, 메모리 사용량 및 재현성을 중심으로 post-training 설정을 구성한다.
- CPT recipe: CPT는 최적화, 병렬화 및 메모리 절감 메커니즘을 포함하는 긴 컨텍스트 Ascend 기반 continued-pretraining recipe를 사용한다.Table 18은 domain-adaptive continued pretraining을 위한 구성을 보고한다.
- SFT recipe: SFT는 instruction-response trajectory를 최적화하고 프롬프트 토큰의 loss를 마스킹해 gradient가 target response에만 적용되도록 한다.Table 19는 instruction following 및 solver 지향 modeling을 지원하는 recipe 구성을 보고한다.
- Agentic rollout 구성: Agentic rollout은 parameter update 없이 inference mode에서 평가되므로, 해당 구성은 CPT 및 SFT recipe와 분리된다.보고된 rollout parameter는 추론 시 동작과 향후 reinforcement learning 재현성을 설명해야 한다.
C Solver-Verified OR-CPT 데이터 합성: 엔진 설계와 예시 사례
이 방법은 양방향 language-model 변환을 통해 매개변수화된 최적화 인스턴스를 독립적으로 완결된 CPT 문서로 변환하며, generator contract, 정적 검사, 불변량 보존, 독립 solver 실행으로 수학적으로 잘못된 샘플을 필터링한다.
- 엔진 설계: 이 합성 방법은 language-model 변환 전반에서 수학적 불변량을 보존하고, 그럴듯하지만 잘못된 문서가 CPT 코퍼스에 유입되는 것을 방지한다.각 매개변수화된 최적화 generator를 독립적으로 완결된 CPT 문서로 변환한다.
- 엔진 설계: 이 파이프라인은 검증된 최적화 인스턴스를 비즈니스 문제로 변환한 뒤 다시 수학적 모델과 실행 가능한 프로그램으로 변환하며, 적합성은 generator contract, 정적 검사, 독립 solver 실행으로 판정한다.language-model의 유창성은 수학적 정확성의 증거로 명시적으로 간주하지 않는다.
C.1 post-training workflow에서의 역할
OR-CPT Engine은 Ascend 910C training stack에 앞서 수학적으로 충실하고 의미 범위를 포괄하며 출처를 보존하는 문서를 구축한다. continued-pretraining data와 이후의 SFT data는 서로 다른 목표를 수행한다. 먼저 OR 지식을 노출한 뒤, task instruction과 output contract에 따라 이를 이끌어낸다.
- post-training workflow에서의 역할: OR-CPT Engine은 Ascend 910C training stack과 분리되어 있으며, continued pre-training을 위한 수학적으로 충실하고 의미 범위를 포괄하며 출처를 보존하는 문서를 구축한다.training stack은 대신 결과 corpus를 tokenization하고 packing·sampling한 뒤 최적화한다. engine은 instruction–response conversation이 아니라 독립적으로 완결된 문서를 export한다.
- post-training workflow에서의 역할: CPT는 OR terminology, formulation pattern, solver API, verification habit을 노출하는 반면, SFT는 task instruction과 output contract에 따라 이를 이끌어내는 방법을 학습시킨다.동일한 OR taxonomy가 두 단계 모두를 이끌지만, data representation과 optimization objective는 서로 구별된다.
C.2 엔드투엔드 엔진 아키텍처 … C.5 통제된 시나리오와 CPT 렌더링
SLAI T-Rex는 독립적으로 검증된 최적화 seed, 통제된 양방향 합성, 실행 가능한 검증을 활용해 solver-grounded CPT 문서를 생성한다. 이 pipeline은 수학적 구조를 보존하면서 도메인 서사와 완전한 business, modeling, code, solution, validation content를 다양하게 렌더링한다.
- C.2 엔드투엔드 엔진 아키텍처: 엔진은 샘플링된 최적화 instance를 독립적으로 풀고, 유효하지 않은 seed를 필터링하며, 검증된 seed를 business problem으로 역변환하고, 재구성 전에 언어 품질 검사를 적용한다.필터링 대상은 infeasibility, degeneracy, numerical instability, duplication, numeric coverage, unit consistency, business grounding, solution leakage다.
- C.3 수학적 seed와 도메인 contract: 각 seed는 structured optimization data, 실행 가능한 artifact 또는 LP artifact, semantic metadata를 저장하며, deterministic random seed를 통해 재생성과 감사를 지원한다.저장되는 수학적 content에는 set, coefficient, objective, domain, bound, constraint family가 포함되며, metadata에는 task family, concept, difficulty, formulation variant가 포함된다.
- C.3 수학적 seed와 도메인 contract: Generator profile은 canonical mathematical signature를 정의하고, family contract는 balance equation, linking rule, conservation law, required variable family와 같은 공통 invariant를 강제한다.이 계층들은 선언된 seed fact에 기반하며 관련 generator 사이에서 유효한 해석을 제한한다.
- C.3 수학적 seed와 도메인 contract: Seed 적격성에는 feasibility 이상의 조건이 필요하다: 엔진은 solution 및 constraint activity, objective recomputation, numerical precision, duplicate signature를 검사한다.이를 통해 inactive decision, fixed variable, 또는 실질적인 trade-off가 없는, 풀 수는 있지만 정보성이 낮은 instance를 제외한다.
- C.4 Prompt-controlled 양방향 합성: 역변환은 coefficient, bound, unit, indexed relation을 보존하면서 solver status, solution, objective value, implementation artifact, code를 숨긴다.원천 수학을 바꾸지 않고 industry, stakeholder perspective, planning trigger, horizon, naming style, unit을 바꿀 수 있다.
- C.4 Prompt-controlled 양방향 합성: Forward modeling은 선언된 index와 coefficient만 사용해 explanation, formulation, executable code를 재구성하고, structured self-check를 반환하며, optimum을 hard-code해서는 안 된다.생성된 prose가 필수 constraint를 누락하거나 잘못된 index를 사용할 수 있으므로 static inspection과 independent execution이 최종 기준으로 남는다.
- C.5 통제된 시나리오와 CPT 렌더링: Scenario control은 underlying OR structure를 보존하면서 industry lens, decision trigger, organization type, planning frame, naming style, unit을 바꾼다.Negative guidance는 유창한 서사가 vehicle과 sequencing 없이 transportation을 routing으로 바꾸는 등 model family를 조용히 변경하지 못하도록 한다.
- C.5 통제된 시나리오와 CPT 렌더링: 실행 가능한 검증 후 renderer는 business data, model explanation, formulation, solver code, interpreted solution, validation check를 포함하는 self-contained CPT document를 생성한다.Style과 section order는 달라질 수 있지만 필수 mathematical content와 validation content는 고정된다.
C.6 예시 사례 I: 용량 제약 시설 입지
용량 제약 시설 입지 예시는 고정 활성화 비용, 용량 한도, 수요 충족 조건하에서 입지를 선정하고 수요를 공동으로 할당해 목적함수 값 590을 도출한다. 이 사례는 유효한 재구성이 이러한 구조적 불변조건을 보존하고 허용 오차 내에서 기준 목적함수를 재현해야 함을 강조한다.
- C.6 예시 사례 I: 용량 제약 시설 입지: B와 C를 개설하면 모든 수요를 충족할 수 있으며, B는 Z1에 30단위, Z2에 35단위를 공급하고 C는 Z1에 10단위, Z3에 25단위를 공급한다. 이때 B는 용량 65에 도달한다.이에 따른 목적함수는 95 + 80 + 6(30) + 8(10) + 3(35) + 2(25) = 590이다.
- C.6 예시 사례 I: 용량 제약 시설 입지: 고정비용 절충은 각 수요 구역에서 가장 저렴한 계수를 독립적으로 선택하는 것이 아니라, 개설할 입지와 서비스 할당을 함께 선택하도록 요구한다.C는 고정비용이 가장 낮고 Z3에 대한 서비스 비용도 가장 저렴한 반면, B는 Z2에 가장 저렴하다. 그러나 용량 제약 때문에 어느 한 입지도 총수요를 단독으로 처리할 수 없다.
- C.6 예시 사례 I: 용량 제약 시설 입지: 유효한 재구성은 고정 활성화, 수요 충족, 용량 연계를 보존하면서 허용 오차 내에서 기준 목적함수를 재현해야 한다.개체와 단위가 달라지더라도 동일한 정식화로 클리닉 입지, 지역 수리 거점, 컴퓨팅 서비스 허브를 나타낼 수 있다.
C.7 예시 사례 II: 실행 가능하지만 구조적으로 잘못된 모델
실행 가능한 최적화 모델도 구조적으로 충실하지 않을 수 있다. OPTIMAL 상태는 구성된 프로그램만을 보증하므로, 임의로 데이터를 만들어내기보다 검증 게이트와 보수적 수리가 필요하다.
- 구조 검증: 충실한 정식화는 정적 항 검사, family-level contract, 독립적인 목적함수 비교를 사용해 두 가지 실행 가능한 구조적 오류와 구별된다.Table 21은 각 재구성 오류를 어떤 검증 게이트가 탐지하는지 식별한다.
- 구조 검증: 문법적으로 유효하고 실행 가능한 프로그램이 OPTIMAL status로 해를 구했더라도 의도한 비즈니스 문제를 잘못 나타낼 수 있다.최적성은 실제로 구성된 프로그램에만 적용되며, 그 프로그램의 충실성에는 적용되지 않는다.
- 안전한 수리: 누락된 계수나 경계는 모델의 범위를 단순히 제한하거나 참조 목적함수에 접근하도록 임의의 값을 넣기보다 재생성, 거부 또는 권위 있는 출처 복구를 유발해야 한다.수리는 원하는 결과를 향해 최적화하는 대신 문제 명세를 보존해야 한다.
D CPT–SFT–Deployment–Evaluation Provenance … D.4 신뢰도 수준
SLAI T-Rex는 manifest와 중앙 registry를 통해 CPT, SFT, artifact 변환, deployment, evaluation을 연결하는 경량 provenance 시스템을 도입한다. 단계별 기록은 legacy run을 포함해 모델 식별, 계보, 재현성, 감사 가능성, 단계 간 연결의 신뢰도를 보존한다.
- D CPT–SFT–Deployment–Evaluation Provenance: provenance 시스템은 단계별 manifest와 로컬 파일 기반 registry를 통해 CPT, SFT, 변환, deployment, evaluation artifact를 연결한다.이 설계는 benchmark 향상을 training configuration, checkpoint, deployed weight, upstream output에 귀속할 수 있게 한다.
- D.1 설계 원칙: 모델 식별은 served model name, IP address, port가 아니라 artifact manifest와 upstream lineage로 정의된다.여러 모델 버전이 하나의 endpoint를 공유하면서도 weight를 모호함 없이 식별할 수 있다.
- D.1 설계 원칙: 각 단계는 완료 즉시 실제 경로, environment variable, upstream 관계를 구조화된 manifest에 기록한다.실행 시점 기록은 취약한 사후 재구성을 방지하고 CANN version과 parallelism configuration 같은 환경 세부 정보를 보존한다.
- D.1 설계 원칙: 기존 configuration snapshot, checkpoint directory, 변환된 artifact를 사후 등록할 수 있어 legacy experiment를 cross-run comparison과 trend analysis에 보존한다.
- D.2 Provenance chain과 registry layout: 5단계 chain은 output location과 training run, artifact, deployment, evaluation run별로 구성된 중앙화된 JSON registry에 manifest를 저장한다.경량 index는 집계 count를 유지하며, manifest는 artifact와 같은 위치에 둔다.
- D.3 단계별 연결 메커니즘: CPT-to-SFT lineage는 SFT checkpoint load path와 CPT checkpoint save path를 일치시켜 확립하며, path_match confidence 또는 missing status를 기록한다.이 연결을 통해 transfer gain을 특정 CPT initialization checkpoint까지 추적할 수 있다.
- D.3 단계별 연결 메커니즘: Conversion 및 deployment manifest는 HuggingFace shard를 training provenance에 연결하고 artifact version을 served endpoint에 결속하며, evaluation은 deployment manifest reference가 주어지면 full lineage를 전달할 수 있다.해당 reference가 없으면 evaluation은 계속 실행되지만 score를 특정 weight 또는 dashboard experiment에 자동으로 추적할 수 없다.
- D.4 신뢰도 수준: 각 provenance link는 정확한 manifest 기반 연결과 경로 기반 또는 heuristic matching을 구분하는 confidence annotation을 포함한다.
D.5 대시보드 모니터링 및 사후 등록
provenance registry는 training metrics, provenance 상태, confidence annotation과 함께 experiment run을 시각화하는 대시보드에 데이터를 제공한다. rebuild script는 새로 완료된 run을 반영하며, legacy run은 기존 artifact에서 사후 등록할 수 있다.
- 대시보드 모니터링: 대시보드는 전체 experiment graph를 시각화하며, 각 run에 identifier, job type, iteration, 핵심 metric, provenance 상태, confidence annotation을 표시한다.manifest coverage가 완전한 run에는 exact_manifest 또는 path_match confidence label이 부여된다.
- 대시보드 모니터링: build script는 training archive와 중앙화된 registry를 스캔하고, manifest 내용을 JSON으로 집계한 뒤 frontend를 갱신하여 새로 완료된 run이 다음 rebuild에 표시되도록 한다.
- 사후 등록: 기존 configuration file, checkpoint directory 또는 artifact output을 registration tooling에 지정하면 legacy run을 사후 등록할 수 있다.
E 학습 일정 및 모니터링 설계
학습 설계는 사전 정의된 curriculum과 모니터링 대시보드를 활용해 OR 적응과 수학, 코드, 일반 도메인 데이터를 균형 있게 조정하고, 역량을 보존하며 안정성을 추적한다.
- E 학습 일정 및 모니터링 설계: OR 도메인에 지나치게 집중해 적응시키면 일반 역량이 약화될 수 있으므로, OR, 수학, 코드, 일반 도메인 데이터를 균형 있게 혼합한다.
- E 학습 일정 및 모니터링 설계: 사전 정의된 curriculum을 사용해 균형 잡힌 학습 데이터 혼합을 구성한다.
- E 학습 일정 및 모니터링 설계: 모니터링 대시보드는 학습 중 학습 안정성과 역량 보존을 추적한다.
E.1 정적 Curriculum Learning 설계 · E.2 Monitoring Dashboard
학습 mixture는 수학적 추론과 일반 code에서 Operations Research 형식으로 초점을 옮기는 수동 고정 3단계 curriculum을 따른다. WandB monitoring dashboard는 자동 제어가 아니라 사람이 확인할 수 있도록 학습 상태와 capability retention을 추적한다.
- E.1 정적 Curriculum Learning 설계: curriculum은 OR, mathematics, code, general data에 대한 step 의존적 mixing vector를 사용하는 사전 정의 3단계 schedule로 구성된다.mixture 비율, threshold, stage 경계는 학습 전에 고정되며 동적으로 변경되지 않는다.
- E.1 정적 Curriculum Learning 설계: 첫 30% steps를 포괄하는 foundation stage에서는 mathematics와 clean general code에 각각 0.35, general data에 0.20, OR data에 0.10의 weight가 부여된다.이 단계는 정밀한 token 생성과 algorithmic logic을 강화하기 위한 것이다.
- E.1 정적 Curriculum Learning 설계: 30–70% domain ramp-up 동안 OR weight는 선형적으로 0.40까지 증가하고 code는 점진적으로 0.15까지 감소하며, OR 형식은 DP, DT, DPS 순서로 도입된다.세 형식은 Data-in-Problem, Data-in-Table, Data-Problem-Separate다.
- E.1 정적 Curriculum Learning 설계: curriculum은 preliminary runs와 Section 4.4 data-mixture ablation을 바탕으로 구성을 선택한 수동 설계 기본 trajectory다.관련 curriculum 유사 전략으로 Tzannetos et al., 2026; Zhao et al., 2026; Liang et al., 2025가 인용된다.
- E.2 Monitoring Dashboard: monitoring dashboard는 매 500 training steps마다 두 metric group을 기록하며, closed-loop controller가 아니라 human developer를 위한 observability layer로 기능한다.training-health metric에는 loss, gradient norm, NaN counts, MFU가 포함되며, gradient spike 또는 NaN loss가 발생하면 수동 조사를 수행한다.
- E.2 Monitoring Dashboard: capability-retention metric에는 OR validation perplexity와 proxy rewards, held-out Python syntax health, general-domain perplexity가 포함된다.OR proxy에는 NL4OPT와 OptiBench를 사용하고, syntax health는 200개의 pure-Python algorithmic problem을 평가한다.
- E.2 Monitoring Dashboard: metric은 수동 검사를 위해 WandB에서 시각화되며, capability degradation이 지속되면 engineer가 OR 중심 학습을 일시 중지하고 data를 조사하거나 mixture를 조정할 수 있다.threshold와 그에 따른 결정은 automated state machine이 아니라 human engineer가 내리며, 이 설계는 Qi et al., 2026에서 영감을 받았다.
F 대표 원본 체크포인트 오류 사례
원본 DeepSeek-V4-Flash 체크포인트는 구조적·프로토콜·도메인 의미 오류로 인해 실행은 가능하지만 잘못된 최적화 모델을 생성한다. 이러한 사례는 canonical formulation, schema-safe code, conservation pattern, solver-aware reformulation을 포함한 template 중심 CPT와 SFT의 필요성을 뒷받침한다.
- ORGEval에서의 Canonical LP-Graph 불일치: 구조적 ORGEval 실패는 실행 가능한 LP가 잘못된 제약식 계열이나 그래프 구조를 사용할 때 발생하며, domain template을 위한 CPT와 canonical formulation을 위한 SFT의 필요성을 보여준다.변수와 제약식 개수가 일치하더라도 WL graph는 잘못된 상태로 남을 수 있다.
- Output-Contract 및 Schema 실패: 프로토콜 및 스키마 오류는 안정적인 실행을 방해한다. markdown fence는 syntax failure를 일으키고, list index로 사용된 string shift label은 TypeError를 일으키므로 SFT가 필요하다.이러한 실패는 모델이 유용한 OR 지식을 보유하고 있음에도 발생한다. Pass@1 동작이 code-only contract와 schema-safe data access를 위반하기 때문이다.
- NL4OPT의 이산 의미 오류: NL4OPT 사례는 정답 28250에 비해 28125를 예측한다. 연속 변수가 정수 workforce 결정을 완화해 fractional optimum을 산출하기 때문이다.오류는 의미론적이다. 작업자 수는 continuous variable이 아니라 integer variable로 모델링해야 한다.
- Loss/Yield 기반 Conservation 오류: water-network 사례에서 Pass@1은 정답 531.1536797183472에 비해 265.5768398591736을 예측한다. evaporation을 additive cost이자 conservation loss로 잘못 처리하기 때문이다.코드는 optimum에 도달하지만 잘못된 물리 시스템을 나타내며, stable loss, yield, shrinkage, evaporation conservation template이 필요하다.
- Ratio, Unit 및 Total-Quantity 결합 오류: OptiBench 사례는 Pass@1과 Pass@16에서 정답 18000.0에 비해 10000.0을 예측한다. investment, ratio, units, total savings가 잘못 결합되었기 때문이다.이 실패를 방지하려면 일반적인 API 지식이 아니라 numerator, denominator, units, scale variable을 명시적으로 추적해야 한다.
- Solver-Aware Reformulation: 추가 실패 사례는 auxiliary variable, 정당한 nonconvex constraint, 또는 코딩 전 analytic simplification을 포함한 solver-aware reformulation이 여전히 필요함을 보여준다.이후 inference 설정에서는 초기 build error를 피하면서도 잘못된 distance를 반환할 수 있으므로, 한계는 단순한 Gurobi API 사용 문제가 아니다.