Source-linked AI summary

Puro-2B: Poor Lab's Qwen2-1.5B Trained on RTX 5090 within $5090

Kairong Luo, Jiarui Cui, Yaorui Yin, Shengqi Chen, Yiming Yang, Linxiang Gao, Yanmohan Wang, Mingzhe Zhang, Kaiyue Wen, Kaifeng Lyu, Wenguang Chen

arXiv:2608.27370v1cs.CLcs.LG

TL;DR

手頃で再現可能なlanguage-model pretrainingは、既存のopen recipeでも依然として法外なcompute budgetを要しうるため、なお困難である。本論文では、hardware-accessibleかつcost-efficientなpretraining recipeを提示し、consumer RTX 5090 GPU上でPuro-2B modelsを学習する。約$4.4KでQwen2-1.5B performanceに到達し、最良checkpointは約$6.9KでQwen2.5-1.5Bに迫る。

  • 問題

    既存のopen pretraining recipeは、多くのacademicおよびresource-constrainedな研究者にとって依然として高コストであり、complete training pipelineの再現可能な研究を制限している。

  • 手法

    本論文では、system、algorithm、data designにまたがるreproducibility recipeを開発し、consumer-grade RTX 5090 GPU上で2B-parameter modelsをfrom scratchで学習する。

  • 結果

    Puro-2B modelは約$4.4KでQwen2-1.5B performanceに到達し、最良checkpointは約$6.9KでQwen2.5-1.5Bに迫る。

  • 示唆と限界

    この結果は、billion-parameter scaleにおける有用なfrom-scratch pretrainingが、低コストのconsumer-GPU pipelineで実現可能であることを示している。

  • 示唆と限界

    MuonHおよびFP8 ablationではTPP=20を用いる一方、production trainingではTPP=700を用いており、これらのablation結果をproductionへ直接外挿することには限界がある。

Abstract

from arXiv · show

Language model pretraining has become almost synonymous with prohibitive cost, placing it out of reach for much of the academic and open-source communities. Although strong open-source efforts already exist, including open-weight models and open-source training recipes, a cost-efficient, hardware-accessible, and open-source pretraining recipe has long been missing. Even at a small scale, training Llama-3.2-3B costs over \$1.5M, and reproducing SmolLM3-3B needs over \$700K. In this report, we present an open pretraining recipe designed to lower this barrier. Using this recipe, we train a collection of Puro-2B models from scratch on up to 1.4 trillion tokens with FP8 precision on consumer-grade RTX 5090 GPUs. The models in the collection differ in token budgets and selected recipe variants. Our best model is trained at a compute cost of less than \$6.9K and approaches Qwen2.5-1.5B performance under our evaluation protocol. This cost efficiency is enabled by a combination of approaches, including hardware selection, low-precision training, hyperball optimization, curriculum model averaging, and the data recipe. Beyond the recipe itself, we provide two additional results. First, across the Puro-2B collection, we derive a Puro Cost Scaling Law that relates training cost to average model performance; the fitted law suggests that about \$4.4K, less than \$5,090, is sufficient to reach the performance of Qwen2-1.5B. Second, as an end-to-end case study, we examine how pretraining data curricula shape downstream performance after post-training. Such controlled studies are enabled by having access to the full pretraining pipeline rather than model weights alone. We release the full training recipe for Puro-2B, including data, code, and model weights under Apache 2.0 at https://huggingface.co/collections/thu-pacman/puro-2b.

1 Introduction

本論文は、既存の言語モデル訓練における高コストと不十分な透明性を解消する、Puro-2B向けの低コストで再現可能なオープン事前学習レシピを提示する。最良のチェックポイントは$6.9KでQwen2.5-1.5Bに迫り、コレクション全体では約$4.4KでQwen2-1.5Bを上回る。また、関連成果物をApache 2.0で公開する。

  • 動機: Open-weightの公開が進んだ現在も、既存の事前学習コストはなお法外であり、学術研究者がパイプラインを再現し、訓練挙動を研究する能力を制限している。再現可能性にはモデル重みだけでなく、データ、ソフトウェア、インフラ、訓練の詳細、透明なコスト計上が必要だと論じる。
  • レシピ: このレシピでは、利用しやすいインフラ上で、2B-parameter Puro-2Bのチェックポイント群をゼロから訓練し、訓練予算とレシピのバリアントを変化させる。このコレクションは、denseなbillion-parameter/trillion-token事前学習向けに設計され、Qwen2-1.5BおよびQwen2.5-1.5Bと比較評価される。
  • オープンな公開: 著者らは、レシピの再現と検証を可能にするため、データセット、モデル重み、中間チェックポイント、設定、実装を公開する。公開物には10種類のチェックポイント、データマニフェストと構成要素、訓練コード、データ処理コードが含まれる。一方、上流データの利用条件は構成要素ごとに異なる。
  • 手法: 効率化スタックは、RTX 5090ハードウェア、blockwise FP8、MuonH最適化、Curriculum Model Averaging、proxy-guided data selectionを組み合わせる。各要素はそれぞれ、計算当たりコスト、スループット、token効率、訓練データの順序付け、データセット混合の設計を対象とする。
  • スケーリング則: Puro Cost Scaling Lawは、CMAを用いないuniformなPhase 2データを使い、scale-downシナリオにおけるレンタル相当の訓練予算とモデル能力の関係を表す。この法則は、異なるPhase 2 token予算で訓練したPhase 1チェックポイントを再開して適合される。
  • Post-trainingのケーススタディ: 条件を揃えたpost-trainingでもカリキュラムの優位性は維持され、カリキュラム初期化はより高いGSM8K accuracyをもたらし、15-task aggregateおよび大半の個別評価を改善する。比較は、限定的および大規模な数学設定と、より広範なinstruction設定にわたって報告される。
  • 結果: 約$4.4KでPuro-2BモデルはQwen2-1.5Bを上回り、最良のチェックポイントは$6.9KでQwen2.5-1.5Bに迫る。これらの結果は、低コストなオープン事前学習が現在実用可能であるという本論文の主張を支持する。

2 概要

Puro-2Bのrecipeは、公開ソースから収集したdata、consumer-grade RTX 5090 hardware、two-phase pretraining、curriculum-aware optimization and averaging、post-training、evaluationを組み合わせる。報告された比較では、提示されたbudget accountingの下でQwen2-1.5BとGemma-2-2Bを上回る一方、reproduction costに含まれるのは最終的なproduction pretrainingのcomputeのみである。

  • 概要: 完全なpipelineは、公開アクセス可能なソースからcorpusを構築し、cost-efficientなhardwareを選択し、two pretraining phasesを実行し、modelをaverageし、post-trainingとevaluationを行い、costを計上する。Figure 3では、このopenかつlow-costなworkflowを一般的な実践と対比する。
  • Two-phase pretraining、curriculum、optimization: Phase 1では438.8B tokens、Phase 2では960.0B tokensを処理し、canonical runではPhase 2 dataに対してcurriculumを適用する。curriculumでは、各scored sourceのより優先される部分をtrainingの後半に提示する。
  • Two-phase pretraining、curriculum、optimization: Hyperball optimizationでは、選択したおおむねscale-invariantなmatrixをMuonHで更新し、残りのparameterは共有されたbase learning-rate scheduleの下でAdamWにより更新する。MuonHは、更新したmatrixを初期Frobenius radiusへ投影し直す。また、そのweight learning-rate scheduleはbase scheduleの10倍である。
  • Evaluation and post-training: PuRo-2Bは、比較対象となるオープンなrecipeで示されたtraining costの六分の一未満でありながら、Qwen2-1.5BとGemma-2-2Bを上回る。比較は、reasoning、mathematics、codingの各領域において、同程度の規模を持つopen-weight modelおよび再現可能なopen recipe modelを用いて行われる。
  • Cost accounting: headline reproduction costに含まれるのは、最終的なtwo-phase pretraining rerun 1回分のcomputeのみであり、data作業、experiments、post-training、evaluation、averaging、labor、non-accelerator resourcesは除外される。実測したGPU-hoursは、正規化したRTX 5090 rental-equivalent rateを用いて換算する。

3 学習レシピ

このレシピは、コンシューマ向けRTX 5090ハードウェア、通信および並列化の最適化、FP8学習、Hyperballによる実効学習率制御、データや平均化に関する選択を組み合わせ、コスト効率の高い事前学習を可能にする。これらの要素により、BF16相当の品質を維持しつつ高い利用率を実現し、記載した条件下で下流レシピの性能を向上させる。

  • ハードウェア選択: RTX 5090はH200に対してBF16およびFP8の計算効率が約2.7×であり、ピークスループットが低いにもかかわらず、コンシューマGPUによる事前学習を採用する動機となる。対象モデルは、構成したクラスタで約73%の混合精度実効MFUに到達できる規模である。
  • ハードウェア最適化: P2P最適化により、一方向帯域幅は31.5から56 GB/sへ、双方向帯域幅は32から111 GB/sへ向上し、レイテンシは14.3から0.4 µsへ低下する。これらの変更はPCIeの制約を受けるため、ハードウェアトポロジーが対応している場合にのみ有効化すべきである。
  • 並列学習: 選択した並列構成は、24 GPU上でglobal batch size 1536、MBS = 2、PP = 2、DP = 12を用い、GPUあたり中央値238 TFLOP/sを維持する。この構成はlayout (18|10)5を用い、全数列挙で見つかった最速の戦略と一致する。
  • FP8学習: Blockwise FP8は、5つのモデルサイズ全体でBF16に対するvalidation lossの増加を0.0031–0.0039に抑え、BF16相当の計算保持率98.0%に相当する。モデル重みはBF16のままであり、公開またはデプロイ用の表現は別個の学習後変換によって生成する。
  • Hyperball最適化: Hyperballにより実効学習率を直接スケジュール可能になり、整列済み実効LRのMuonは最終validation loss 3.030に到達し、MuonHの3.029に近い。通常のMuonでは整列されていない実効学習率が初期に急速に減衰する一方、MuonHは指定された線形減衰スケジュールに従い、学習終盤近くでこれを上回る。
  • レシピのアブレーション: カリキュラムの順序付けにより、model averagingなしではスコアが1.18 points、対応するmodel averagesでは1.61 points向上する一方、より長いpeakまたはhorizonではより長いdecayが有利になる。カリキュラム比較は、averagingなしでは57.17対55.99、averagingありでは57.18対55.57であり、decayに関する知見はFigures 6 and 18に基づく。

4 評価

PuRo-2Bは、15ベンチマークにわたる共通の決定論的パイプラインを用いて小規模言語モデルと比較評価され、数学・コードおよび推論・知識の双方でQwen2-1.5Bを上回り、Qwen2.5-1.5Bに迫る。また、RTX 5090ハードウェア、MuonH、FP8、Puro Cost Scaling Lawを含む、レシピ固有のコストおよび効率要因も分析する。

  • 評価設定: 15ベンチマークで、数学・コードに加えて推論・知識におけるpretrained/base modelsを比較し、全モデルを一貫したrevision、prompt、decoding、postprocessingの下で評価する。パイプラインでは6タスクに対してgeneration-based evaluationを用い、対応している場合はcloze形式とmultiple-choice形式の双方を評価する。集計では各モデルのより良い形式を選択し、スコアはパーセンテージ、平均は非加重とする。
  • 数学・コード: 数学・コードでの平均は43.50で、Qwen2-1.5Bを3.21 points上回り、Qwen2.5-1.5Bとの差は4.02 points以内である。PuRo-2Bは、Instella-3B、OLMoE-A1B/7B、MiniCPM5-1B-Baseを含む複数のopen-recipe baselineを上回る一方、Yulan-Mini-2.4B、SmolLM3-3B-Base、MobileLLM-R1-950M-baseには及ばない。
  • ハードウェア効率: H200に対して、単位価格当たりのpeak BF16 computeは2.77×、peak FP8 computeは2.74×高く、mixed-precision trainingでは73% MFUを達成する。これらの数値は、レシピで記述されたRTX 5090の仕様・価格proxyと調整済みtraining configurationに基づく。
  • レシピ効率: 完全なMuonH recipeのcompute-equivalent multiplierは1.19×であり、validation lossを一致させた場合、理論上のcomputeが16.1% lessとなる。この推定はTPP=20で一致させたscaling ladderから得られ、fitした水平multiplierをproduction settingへ移すものである。これは反実仮想的なquality-equivalent savingであり、逐次的なend-to-end speedupではない。
  • レシピ効率: blockwise FP8ではBF16-equivalent computeを98.0%保持し、BF16 qualityに一致させるには約2.0%のadditional nominal computeが必要となる。この推定は5つのladder scaleにわたるshared-shape fitに基づき、precision quality retentionとthroughput speedupを分離する。
  • Puro Cost Scaling Law: Puro Cost Scaling Lawは、複数の予算で継続したPhase 2 runsから、モデルファミリーをまたぐ普遍的な法則ではなく、レシピ固有のcost–performance relationshipを特徴づける。この分析は、computeと時間に制約のあるコミュニティにおけるscale-down behaviorの記述を目的とする。

5 ポストトレーニング

コストスケーリング分析によれば、約$4.4Kのuniform checkpointは、curriculum model averagingなしでもQwen2-1.5Bをすでに上回る。一方、PuRo-2Bは、提示された会計プロトコルの下で比較対象のfrontierより上かつ左に位置する。

  • コストスケーリング: CMAなしのuniform checkpointでは、約$4.4KですでにQwen2-1.5Bを上回る。shifted fitにより、in-sample RMSEは0.452から0.209に低下する。
  • 推定プロトコル: 分析では、主にreported GPU-hoursからcomputeを見積もり、Table 6のreference rental ratesを用いて換算する。それ以外の場合は、reported acceleratorおよびMFU informationが利用可能であれば、C = 6NDを用いる。これらの統計値が利用できない場合は、70% MFUにおけるH100-equivalent GPU-hoursを仮定する。
  • Pareto frontier: 提示されたaccelerator-cost assumptionsの下では、PuRo-2Bのrental-equivalent cost–performance pointは、比較対象のfrontierより有利である。この分離は、fully-open comparatorsの間で特に顕著である。

5 Post-Training Results and Analysis

Curriculum/CMA による pretraining initialization は supervised adaptation 後も優位性を維持し、focused および scaled settings における数学性能と、ほとんどの評価における広範な instruction-tuning 結果を改善する。

  • 実験範囲: uniform global-reshuffle と curriculum/CMA Phase 2 の endpoint を、次第に広範になる supervised settings の下で比較した結果、recipe の違いは adaptation 後も持続する。curriculum/CMA endpoint には、late constant-LR continuation と six-checkpoint averaging が含まれる。
  • Focused mathematics experiment: step 172 における平均 GSM8K accuracy は 68.66% 対 66.89% であり、反復 run 全体で curriculum initialization が 1.77 percentage-point gain をもたらした。focused comparison では、pretraining replay を含まない uniform global-reshuffle と curriculum/CMA endpoint を用いる。
  • Scaled mathematics experiment: step 2,431 における平均 GSM8K accuracy は 76.12% 対 74.10% であり、curriculum initialization が 2.02 percentage-point gain をもたらし、すべての run で上回った。この scaled setting では、より大規模な mathematics SFT mixture、small replay component、longer budget を用いる。絶対スコアは focused setting と直接比較できない。
  • Broad instruction experiment: 15-task macro-average は 56.58% 対 54.99% であり、curriculum は 15 個中 13 個の component evaluation と、全 18 個中 15 個の evaluation を改善した。この改善は mathematics-focused SFT を超えて IFEval、BBH、MMLU-Pro にも及ぶが、個別の regression は appendix に見られる。

6 関連研究

既存のopen modelおよびopen recipeの取り組みは透明性と再現性を高めてきたが、実用上のアクセシビリティは依然として大規模なハードウェアおよび学習コストに制約されている。PuRo-2Bは、ゼロからFP8で学習した2Bモデルと、コストを明示的に算出したエンドツーエンドのRTX 5090パイプラインによって、この隔たりに取り組む。

  • Open recipes: open recipeプロジェクトは、学習ダイナミクス、データ選択、スケーリングに関する研究を可能にするdata、checkpoints、code、logs、再現可能な設定を公開している。例として、Pythia、OLMo、OLMoE、SmolLM3、Yulan-Mini-2.4B、Instellaがある [10] [35] [64] [52]
  • アクセシビリティの隔たり: このように開かれているにもかかわらず、代表的なopen recipeプロジェクトには大規模な専用クラスターが必要であり、再現性と実用上のアクセシビリティの間には隔たりが残る。Yulan-Mini-2.4Bは48基のA800 GPU、SmolLM3は384基のH100 GPU、Instella-3Bの最初の段階では128基のMI300X GPUを使用した [52]
  • コスト算定: 低コスト学習には、token数やFLOPsだけに依拠するのではなく、workload、実効ハードウェアスループット、ハードウェア価格、モデル品質を一体として考慮することが必要である。本論文では、明示的な算定境界の下でのみコストを意味のある指標として扱う。
  • 効率化手法: 関連する効率化研究は、低精度化、アーキテクチャ、データ選択、段階的学習、システム最適化によって、実行コストまたは学習workloadを削減する [63] [26] [73] [111] [84] [55]これらの手法は、固定されたworkloadのコスト、またはworkloadそのもののいずれかを対象とするものであり、必ずしもアクセシブルなエンドツーエンドの事前学習パイプラインを提供するものではない。
  • コンシューマー向けハードウェア: Consumer GPUを用いた研究は、関連する学習処理の実行可能性を示しているが、QLoRAでは元の事前学習コストは変わらず、従来研究も主に個別の技術に焦点を当てている [28] [83] [73]LLMQはRTX 4090 GPU上でモデル全体の事前学習を検討し、Quartet IIは単一のRTX 5090におけるNVFP4スループットを測定している。
  • PuRo-2Bの位置づけ: PuRo-2Bは、ゼロから学習した2Bモデル、more than 1.4T training tokens、FP8精度、測定されたアクセラレーター使用量、明示的な複製コストの算定境界を組み合わせる。エンドツーエンド評価では、得られたモデル品質と複製コストの両方を測定する。

7 結論と今後の方向性 · B コスト仮定

本報告では、PuRo-2Bコレクションを通じて検証した、コスト効率が高くハードウェアへのアクセス性に優れたpretraining recipeを提示するとともに、検証可能なpretraining curriculumがpost-trainingの結果に影響することを示した。今後はpost-training、より広範なアーキテクチャ、拡張したハードウェアrecipeに取り組む。

  • 7 結論と今後の方向性: PuRo-2Bモデルは、consumer-grade RTX 5090 GPU上で再現可能なrecipeを用いることで、約$4.4KでQwen2-1.5Bの性能に到達する。このモデルコレクションは、異なるtraining budgetとrecipe variantにまたがり、pipelineのコスト–性能トレードオフを明らかにする。
  • 7 結論と今後の方向性: PuRo-2Bコレクションは、training budgetとrecipe variant全体にわたるコスト–性能トレードオフを直接示す。このコレクションはconsumer-grade RTX 5090 GPU上でゼロから学習される。
  • 7 結論と今後の方向性: Phase 2のpretraining recipeの違いは、教師ありpost-training adaptation後も測定可能なまま残る。このcase studyは、モデル重みだけでなく、完全に検証可能なpretraining pipelineによって実施可能になった。
  • 7 結論と今後の方向性: Curriculum initializationは、adaptation後のfocused-mathematics endpoint accuracyを平均1.77パーセントポイント改善する。この結果は、異なるPhase 2 pretraining recipeを教師ありpost-trainingまで追跡したことから得られた。
  • 7 結論と今後の方向性: より大規模なmathematics recipeは、教師ありpost-training後に平均2.02ポイントの向上をもたらす。この比較は、Phase 2 pretraining recipeがdownstream performanceをどのように形成するかを調べるcase studyの一部である。
  • 7 結論と今後の方向性: 今後は、agentic capabilitiesを重視し、再現可能なrecipeをpretrainingからpost-trainingへ拡張する。本報告では、基盤を拡張する最初の方向性としてpost-trainingを挙げている。
  • 7 結論と今後の方向性: 今後の方向性には、looped Transformers、linear-attention models、mixture-of-experts architectures、およびその他の新興設計が含まれる。これらの取り組みにより、標準的なdense Transformersを超えてアーキテクチャの範囲を広げる。
  • 7 結論と今後の方向性: 著者らは、ハードウェアrecipeをRTX 5090 GPU beyondにも拡張する予定である。これは、再現可能な基盤を拡張するさらなる方向性として位置づけられている。

A 限界 · B 再現コストの仮定

本報告の主張は、処理済みデータのカリキュラム比較、基礎的な中国語カバレッジ、固定2Bの過学習 regime、recipe固有のコストスケーリング曲線に限定される。コスト–性能座標は、15タスク平均と、報告値または推定値によるアクセラレータコストの階層から構成される。

  • A 限界: カリキュラム比較では、訓練データの大半が処理済みまたはフィルタリング済みの公開データセットに由来するため、すべての proxy と最終 benchmark に対する厳密な corpus-wide exact-duplicate または near-duplicate audit が欠けている。この限界によりカリキュラム比較の証拠力は弱まり得るが、提示された文章では、post-training 後の優位性が base check を超えて持続すると記されている。
  • A 限界: 中国語能力は基礎的なカバレッジ目標にとどまるため、release 向け比較表では中国語スコアを省略しつつ、データ混合の判断を監査するために中国語 proxy 軸は残している。提示された文章の記述どおり、主要な評価は数学、コード、推論の各軸に焦点を置く。
  • A 限界: Puro-2B は 2B parameters に対して約 1.4T tokens、すなわち parameter あたり約 700 tokens を用いるため、compute-optimal design ではなく、データ豊富な過学習 regime となっている。この点は、RTX 5090 のメモリおよび通信の制約、達成可能な benchmark 品質、dense base model に対するコミュニティの支援をバランスさせたものである。
  • A 限界: Puro-2B の固定2Bコストスケーリング則は recipe 固有であり、model-size scale-up law を確立するものではない。また、RTX 5090 の HBM 容量が、より大きな model の制約となる可能性がある。model size または world size の拡大には、新たな通信・メモリ設計が必要となり、vocabulary の縮小や embedding/LM-head の partition などが必要になる可能性がある。
  • B 再現コストの仮定: Figure 1 では、Puro-2B uniform の終点を ($4.4K)、canonical curriculum の終点を ($6.9K) とし、より広範な uniform および curriculum variant は Figure 13b にまとめている。2つの終点コストは Table 1 にまとめられ、curriculum model averaging は Figure 7 で説明されている。
  • B 再現コストの仮定: 性能座標は15 benchmark にわたる unweighted arithmetic mean であり、プロット対象の各 model には15個すべてのスコアが存在しなければならない。benchmark 集合には GSM8K、MATH、sanitized-MBPP、HumanEval、MMLU、MMLU-Pro、ARC-Challenge、ARC-Easy、BoolQ、CommonsenseQA、HellaSwag、PIQA、SocialIQA、WinoGrande、BBH が含まれる。
  • B 再現コストの仮定: 再現コストでは、まず報告された金銭的コストを用い、次に Table 6 のレートで報告 GPU-hours を換算するか、GPU 数と経過時間から GPU-hours を H = GT として計算する。換算後のコストは audit ledger では RMB のまま保持し、USD 座標については 6.8067 で除算する。
  • B 再現コストの仮定: token 数しか得られない場合、H100-equivalent の Fa = 989.5 TFLOP/s と η = 0.70 を用い、C = 6ND でコストを推定する。利用可能なコスト根拠を欠く項目は除外する。model 固有の token 数を優先し、family-level budget は推定値として扱う。また、ideal MFU の仮定により、対応する推定値はコストの下限となる。

C 学習の詳細

Puro-2Bの報告学習コストは、実測した実学習時間と現地のRTX 5090価格に基づき、合計$6,891である。比較フロンティアには、Puro-2Bを除外したうえで、コスト–スコアで非劣なモデルを残す。

  • コスト計上: 報告されたPuro-2Bの学習コストは$6,891であり、22,514.41 GPU-hoursにGPU-hours当たり2.0833 RMBを乗じて算出される。実測した実学習時間は、Phase 1の6,009.46 GPU-hoursとPhase 2の16,504.95 GPU-hoursから成る。
  • Paretoフロンティア: 破線の比較フロンティアではPuro-2Bを除外し、他の比較モデルの中に、より低コストかつより高スコアのモデルが存在しないモデルを残す。コストが同一の場合は、最高スコアの点のみを残す。それ以外の点は、すべての低コストモデルのスコアを上回る場合に残す。

C 生産学習の詳細

標準的なPuRo-2Bの生産実行では、MuonH/AdamW最適化と固定長4,096トークン系列を用いる2段階の混合精度設定を採用する。Phase 2は共有されたPhase 1の終端点から再開し、減衰期間を変化させる一方、パイプラインでは計算要素ごとにFP8、BF16、FP32を割り当てる。

  • 生産実行の設定: 標準的な実行では、系列長4,096、global batch size 1,536、micro-batch size 2を用い、選択した行列weightにはMuonH、残りのparameterにはAdamW、さらにblockwise E4M3 FP8を適用する。MuonHではweight decayを0とし、AdamWではweight decayを0.1とする。Hyperballのweight learning rateはbase rateの10倍である。
  • Phase 1のlearning rate schedule: Phase 1では、p = 1/2、τ = 1,000 steps、1,000-step warmup、および5 × 10−4の漸近的floorを持つpower-decay scheduleを用い、継続学習を支える。warmupは1,536,000 samplesに相当し、MuonHが制御する行列groupには10×のoptimizer multiplierを適用する。
  • FP8実装pipeline: FP8 pipelineでは、linear layerのGEMMにblockwise E4M3を、hidden/residual flow、LayerNorm、embeddingにはBF16を用いる一方、gradient、optimizer state、softmaxはFP32のままとする。列挙したGEMMには、forward propagation、data-gradient、weight-gradientの計算が含まれる。
  • Phase 2のlearning rate schedule: Phase 2は共有されたPhase 1の終端点からη0 = 1.04 × 10−3で再開し、約60.1、120.1、240.2、480.5、および960.9B tokensという5つの減衰期間を用いる。すべてのscheduleでηmin = 10−5を共有する。標準的な実行では、最終29B-tokenのlearning-rate decayを、step 218,000から始まるcurriculum model averagingに置き換える。

D MuonH Scaling-Ladder Analysis

MuonH scaling-ladder分析では、制御されたTPP=20設定のもと、0.17Bから1.7Bまでの5モデルについてoptimizerとprecisionの効率を比較する。MuonHはupdated Muonに対して1.19×のcompute-equivalent multiplierを達成し、blockwise FP8はeffective computeの98.0%を維持しながら、1.7Bのthroughputを1.36×向上させる。

  • Experimental setup: このladderは0.17Bから1.7Bまでの5モデルで構成され、すべてmatched data、tokenizer、sequence length、batch size、validation set、learning-rate decayを用い、scaling parameterあたり20 tokensでfrom scratch学習された。各runではsequence length 4,096、global batch size 512、warmup 1%を用いる。validation setはNemotron-CC [89] [8]のsubsetである。
  • Compute-equivalent fitting: compute-equivalent比較では、baselineとvariantの観測値をshared loss-shape parametersおよびvariant-specific amplitudeとともにjoint fitし、horizontal efficiency shiftを推定する。このrestricted fitはlearning-rate scheduleの選択にも、2B production runのabsolute lossの予測にも用いない。
  • MuonH scaling result: 1.19×のcompute-equivalent efficiencyにより、MuonHはupdated Muon baseline lossに16.1% less computeで到達する。これは5サイズのladderと、1.68 × 10^22-FLOPの2B/1.4T-token transferに基づく。Leave-one-model-out fitは1.17–1.28×の範囲だが、このtransferではhorizontal efficiency factorがladderのTPP=20 regimeを超えて持続すると仮定する。
  • Precision and throughput decomposition: Blockwise FP8は、theoretical computeを固定した場合にvalidation lossが0.0031–0.0039高くなるにもかかわらず、BF16に対してeffective computeの98.0%を維持する。Leave-one-size-out fitは97.6–98.1%の範囲で、matched qualityではnominal-computeの2.0% penaltyに相当する。

E Post-Trainingの詳細 · F Learning Rate Schedule Diagnostics

focused mathematics、scaled mathematics、broad instructionの各設定において、curriculum initializationはuniform initializationを一貫して上回るpost-training性能をもたらすが、transfer gainは一様ではない。さらに、learning-rate scheduleに関する追加のdiagnosticsとfitting結果も示す。

  • E Post-Trainingの詳細: curriculum initializationは、endpointsを含む6つすべてのfocused mathematics比較で優位となり、改善幅は1.36〜2.12 points、平均は1.77 pointsである。focused experimentでは、3種類のSFT data orderを再現し、事前定義したintermediateおよびendpoint stepsで測定する。
  • E Post-Trainingの詳細: focused post-training configurationでは、MuonH、10^-5のbase learning rate、10-times Hyperball matrix-group multiplierを用いて8基のRTX 5090 GPUで学習する。指定したoptimizerおよびparallelism configurationの下で、base learning rateは最終的に10^-7となる。
  • E Post-Trainingの詳細: focused GSM8K evaluationでは、zero-shot ChatML prompting、greedy BF16 generation、512-token limitにより、1,319 test examplesをすべて採点する。正解判定は、normalizationとstructured answer extractionの後の厳密な数値同値性に基づく。
  • E Post-Trainingの詳細: focused GSM8Kのすべての行で、curriculum-only correct answersがuniform-only correct answersを上回っており、改善が単なるaveraging effectsだけでなく、question coverageの変化を反映することを示す。分析ではIoUと非対称なC-only/U-only countsを用い、manual inspectionによって数値的正しさとterminationおよびparsing behaviorを切り分ける。
  • E Post-Trainingの詳細: 3つすべてのscaled mathematics endpoint runsでcurriculumが優位となり、GSM8Kの平均改善幅は2.02 percentage points、範囲は1.21〜3.26 pointsである。scaled settingには2,014,933 conversations(99,989 replay recordsを含む)が含まれ、2,431 optimizer steps実行する。
  • E Post-Trainingの詳細: curriculumはbroad instructionのmacro-averageを1.59 percentage points改善し、15個のcomponent evaluationsのうち13個で高い値を示す。macro-averageは15 task scoresのunweighted averageであり、基礎となるunrounded scoresから計算する。
  • E Post-Trainingの詳細: curriculumは報告された18個のevaluationsのうち15個で高い値を示し、IFEvalとMMLU-Proを改善する一方、BBHでは小幅に低下する。これらの追加taskでは個別のpromptsとscorersを用い、primary 15-task macro-averageから除外する。
  • F Learning Rate Schedule Diagnostics: learning-rate schedule diagnostics sectionでは、追加のdiagnosticsとfitting結果を提示する。提示されたpassageには、これ以上のdiagnostic findingsは含まれていない。

F.1 Effective Learning Rate ScheduleのMulti-Power Law

Multi-Power Lawは、schedule-loss modelingをscalarまたはeffective learning-rate exposureへ適用し、learning-rateの減少に対する遅延補正を加える。2-run diagnosticでは、effective learning rateは平均してordinary learning rateよりheld-out validation lossをよく予測し、early effective-rate decayはrun間の差の説明に寄与する。

  • Model construction: MPLは、累積learning-rate exposureをeffective optimization-time coordinateとして扱い、learning-rate signalの減少に対するschedule-shape correctionを加える。baselineはChinchilla-likeであるのに対し、この補正は、exposureが類似していてもdecay patternが異なるscheduleを区別する。
  • Model construction: response modelは、各learning-rate decreaseによるloss benefitをsubsequent exposureに応じて遅延させ、未実現の割合は(1 + x)^-βとして減衰する。G(x)はexposureの蓄積に伴ってoneに近づき、時刻tまでに実現した最終的なreductionの割合を表す。
  • Analytical simplification: G(x) = 1のsimplificationではresponse-weighted sumがtelescopesし、累積exposureとqwarmからqtへのnet decreaseだけが残る。B > 0のdecaying scheduleでは、final termがpredicted lossを低下させるが、このapproximationでは個々のreductionがいつ生じたかを捨てる。
  • Empirical transfer: diagnosticでは、2つのBF16 ordinary-Muon runにおけるηtとρtのpost-warmup validation curveをfitし、各signalを自身のpost-warmup peakでnormalizeしたうえで、final 20%をheld outにする。3段階のprotocolでは、power-only、power-plus-schedule-drop、full-response MPL variantをfitする。
  • Empirical transfer: 平均held-out RMSEは0.0210 versus 0.0265となり、ordinary LRよりeffective LRが優れる。最大のgainはbase Muonで、0.0270 versus 0.0422である。aligned Muonでは、2つのrepresentationの予測性能は同程度であり、RMSEは0.0149と0.0108である。
  • Empirical interpretation: Early effective LR decayは、ordinary Muonがさらなるdecay potentialを失うことと関連する一方、MuonHとaligned Muonはlinear LR decayを用い、最終的にはordinary Muonを上回る。この解釈はEquation (17)とFigure 5に示されたschedule behaviorに基づく。

F.2 WSD Sweep と限定計算量スケジュール推定 … H.4 利用可能な比較の範囲

本稿では、限定計算量下でWSDスケジュールをスクリーニングするためにformal MPLを用いる一方、Puro-2Bのcurriculum、continuation、averaging pipelineを記録している。利用可能な比較はjoint configurationを支持するが、個々の設計選択による利得は分離しない。

  • F.2 WSD Sweep と限定計算量スケジュール推定: 未知のWSDスケジュール15本に対して、two-anchor estimatorは平均curve RMSE 0.0157、endpoint MAE 0.0067を達成し、予測された最適ratioは0.33から0.85へ上昇する。このestimatorは候補となるpeak-rateおよびdecay設定のスクリーニングを支援するが、広いplateau、ノイズを含むminima、設定ごとに1 seedであることが精度を制限するため、最適性を保証するものではない。
  • F.2 WSD Sweep と限定計算量スケジュール推定: WSD diagnosticはlong-decay featuresを支持するが、open-ended Phase 1 scheduleの正確なpower exponentを確立するものではない。Phase 1 power scheduleのcontinual-trainingにおける役割は、推定された最適性ではなく、設計上の特性として残る。
  • F.3 Hyperball: Hyperballなしで所定のeffective LRを維持すると、weight normの増加に伴ってhill-like scalar LRが生じる一方、orthogonalized Muon-update normはおおむね一定に保たれる。構成したWSD例ではeffective LRを0.02までrampし、その値を保持した後、step 4,000でterminal decayを開始する。これは実現可能性を示すものであり、最適性や普遍性を示すものではない。
  • G SCALING CHECKPOINT LEDGER; G Puro-2B Scaling Checkpoint Ledger: scaling checkpoint ledgerはFigure 2(b)のaccounting coordinatesを固定する。Phase 1は各rowで共有され、Phase 2 tokensは重複したpool dataではなくschedule consumptionとして数えられる。endpoint比較はFigures 7 and 13bで可視化され、Table 16にはcheckpoint lineageとnormalized RTX 5090 cost accountingが記録されている。
  • H Curriculum Construction and Model Averaging; H.1 Scalable Construction of Component-Local Curriculum Buckets: curriculumはcomponent-local token-percentile coordinatesを割り当て、同一のpercentile範囲を376 production bucketsに整列し、source間に単一のglobal quality rankingを課すことを避ける。各bucketはおよそ2.5B tokensを含み、各componentからおよそ同じtoken fractionを保持する。
  • H.2 Phase Transition and Uniform-Order Control: Phase 2 transitionはおよそ43.9B tokensを含む。その内訳は、deterministic Phase 1 replay由来の21.9Bと、Phase 2の最初の2.34%由来の21.9Bである。一方、uniform controlは同じtoken multisetを保持したまま順序をreshuffleする。Phase 2 early rangeはすでにcomponent pool内にあるため、production totalに追加されるのはPhase 1 replayのみである。完全な再現にはmanifests、source revisions、checksumsも必要となる。
  • H.3 Constant-LR Continuation and Checkpoint Averaging: production exportでは、step 218,000から再開したconstant-LR continuationと、late checkpoint 6個のequal-weight averageを用いるが、これらの設定はmatched ablationではない。continuationではgroup-level effective LRを4.08 × 10−4に固定する。six-checkpoint averageは469 optimizer steps、すなわちおよそ2.95B tokensにわたり、optimizer statesは除外する。
  • H.4 Scope of the Available Comparison: 利用可能な証拠はcurriculum ordering、continuation、averagingを分離せず、完全なPhase 2 configurationsを比較するため、結果はjoint curriculum-and-averaging configurationとして解釈される。分離した帰属にはmatched factorial runs、continuation branchまたはrate controls、repeated seedsが必要である。下流分析では代わりに、matched post-training下でcurriculumとuniformのendpointを比較する。

I データレシピの詳細 … I.3 Proxyから混合比への意思決定監査

本論文は、具体化されたデータコンポーネントとライセンス範囲を明示し、制御されたQwen3-0.6B proxyで候補ソースを評価し、相関PCAによって能力集約を監査したうえで、その証拠に基づき数学ソースを比較し、Phase 2の混合比変更を位置づける。

  • I データレシピの詳細: Dataset accountingは、上流トークンのユニーク数の推定ではなく、具体化・トークン化されたコンポーネントへの曝露量を報告し、family行には重複する構成が集約される場合がある。Tableは定常的なPhase 1およびPhase 2のコンポーネントプールを対象とし、ライセンス項目では、確認済みの条件と欠落または未確認のライセンスを区別する。一部のNVIDIA対象データは学習を許可するが、raw dataの再配布を禁止する
  • I.1 Proxy測定プロトコル: 各proxy条件は86B-token Qwen3-0.6B checkpointから開始し、約8.4Bの継続トークンを受け取り、候補ソースまたはソース内スライスのみが異なる。プロトコルでは、2,000 steps、sequence length 4,096、global batch size 1,024を用い、固定suiteのbenchmarkをMath、Code、Chinese、Generalの軸に集約する。
  • I.1 Proxy測定プロトコル: 利用可能トークンが5B未満のソースは除外し、スコア付けされた大規模ソースは0th、25th、50th、75thのscore quantilesでprobeする。未スコアのソース、および5B–50Bトークンを含むスコア済みソースには、約4Bトークンを目標とするadaptive sampleを1つ割り当て、必要に応じて最大5回retryする。
  • I.1 Proxy測定プロトコル: 候補のshareは最初の1,600 stepsで0%から80%へ段階的に増加し、最後の400 stepsでは80%に維持して、分布の急激な変化を避ける。得られるfeature vectorは、proxy scale、継続スケジュール、候補share、評価スイートに条件づけられたままである。
  • I.2 Proxy Capability Aggregation and PCA Audit: 四つの能力軸では、標準化したベンチマーク群を平均した後、相関PCAの前に二回目の標準化を行う。最初の二つの主成分は、分散の34.5%および28.1%を説明する。PC1は主にGeneralとCodeを対比し、PC2は主に、loadingsで記述される残りの能力方向を対比する。
  • I.2 Proxy能力集約とPCA監査: PCAは最適化目的ではなく記述的なものである。componentの符号は任意であり、分散を最大化するrotationはutilityを定義しないためである。したがってレシピ比較には、Figure 20のMath–General比較を含め、元の集約軸を用いる。Figure 20は、これらの比較が因果的な改善を立証するものではないと明示的に注意している。
  • I.3 Proxyから混合比への意思決定監査: Phase 2では13.5B MegaMath-Web-Pro tokensを追加し、FineMathを除外するとともに、Nemotron-CC-Math 4+およびSwallowMathの混合比を、それぞれ2.62%から0.26%、1.64%から0.26%へ削減する。proxy比較では、MegaMath-Web-ProのMathおよびGeneral集約値は2.884および0.667であり、Nemotron-CC-Math 4+は(2.821, 0.345)、SwallowMathは(2.746, −0.387)、FineMathは(1.269, −0.317)である。
  • I.3 Proxyから混合比への意思決定監査: proxy監査では、DCLM q00、MegaMath-Web-Pro、MegaMath-Code、FineWeb-Edu-CN q00が、それぞれGeneral、Math、Code、Chinese集約値で首位となる。ただし、これは選定規則ではなく事後的な評価である。実運用時の範囲はproxyスライスと同一ではなく、各軸の首位ソースおよび実運用の混合比には、seedを反復した不確実性推定がない。
Loading 2608.27370v1…