模型訓練與蒸餾
TIDEが教師—生徒間のミスマッチを修正、Qwen3の推論Avg@8が6.9%から20.3%に向上
TIDEは、高いtoken一致率をそのまま蒸留の成功とは見なさず、生徒による過剰生成と、教師が選好するtokenの取りこぼしを個別に処理する。強いミスマッチ設定では、平均回答長も同時に3.6分の1へ短縮した。一方、完全な訓練の再現には依然として8基のGPUが必要で、著者らはcheckpointを公開していない。

8月10日に公開されたTIDEは、既存のon-policy distillation(OPD)に「退化的一致」という抜け穴があると指摘した。生徒モデルが反復ループに陥ると、教師も生徒が生成したそのprefixに基づいて同じ続きを予測するため、回答全体がすでに意味を失っていても、局所的なKL divergenceはゼロに近づく。論文中のある事例では、反復prefixによって教師—生徒間のKLが63分の1に低下した一方、訓練後にループを含むrolloutの割合は16.8%から48.4%へ上昇した。
そこで研究者らは、ミスマッチを2方向に分けて扱った。「生徒過剰」token、すなわち生徒が高い確率を割り当てる一方で教師がほぼ拒否する出力に対して、TIDEは際限なく増大し得るlog-ratio penaltyを、有界なHellinger shapingで置き換える。これにより、少数の極端なtokenがgradientを支配するのを防ぐ。「生徒不足」tokenについては、教師のtop-K distributionを直接調べてprobability massを補い、生徒が極めて低い確率で該当tokenをsampleするのを待つ必要をなくした。batch quantile gateはミスマッチが最も深刻な位置だけを残し、すでに一致しているtokenはlossに含めない。
Qwen3の教師—生徒ペアを用い、AIME 2024、AIME 2025、AMC 2023で評価したところ、強いミスマッチ設定におけるAvg@8は、標準OPDの6.87%から約20.2%へ向上し、平均出力長は22,395 tokenから7,294 tokenへ短縮された。この結果は、蒸留の監視で平均KLやtoken agreementだけを確認していると、モデルの崩壊を収束と誤認しかねないことを示している。
コードは著者らが保守するverl forkに統合されており、CPU unit test、vLLM rollout、rule-based scoring pipelineが含まれる。ただし、デフォルトのrecipeには8基のGPU、問題ごとに4本のrollout、最大7,168-tokenの応答が必要だ。訓練用parquet、完成済みweights、完全な実行ログはrepositoryで提供されておらず、現時点のエビデンスは小規模な数学推論モデルに集中している。今後は、コード生成、tool calling、実製品により近い教師—生徒の組み合わせでも、TIDEが同等の安定性を維持できるかを検証する必要がある。