ホームへ戻る

模型工程

Microsoft、製品内強化学習でMAI-Codeを特化し、同一チェックポイントをExcelエージェントへ展開

Microsoftは「hill-climbing」ポストトレーニング・プロセスを公開し、製品ツール、grader、実利用シグナルをモデルの反復改善へフィードバックしている。MAI-Code-1-FlashはExcel環境で再トレーニングした後、旧世代のGPUでも提供可能だが、パラメータ規模、評価セット、元の実験データは公表されていない。

Steven C. Price · CC BY-SA 4.0 · Image source
zh-Hant

Microsoftは7月23日、2つのMAIモデルについて、製品内ポストトレーニングの成果を明らかにした。同社の「hill-climbing machine」は、ベースチェックポイント、エージェントharness、ツール実行環境、製品評価、更新済みの重みをループとして接続し、汎用ベンチマークだけでモデルのバージョンを決める方式から脱却している。チームはまず、小型エージェントモデルのMAI-Code-1-FlashをGitHub Copilotにデプロイ。その後、同じチェックポイントをExcelの強化学習環境に移し、ツールの選択やスプレッドシート操作の実行をモデルに学習させ、graderが結果に基づいて方策を更新した。

Microsoftによると、VS CodeにおけるMAI-Code-1-Flashのコード受け入れ率は、GPT-5.4 MiniおよびClaude Haiku 4.5を約10%上回り、トークン使用量の中央値は10%少なかった。日をまたいだ再訪率は、それぞれ6%および11%高かったという。Excel向けバリアントは、一般的なタスクにおける製品フィードバックがGPT-5.6と同等とされ、最新世代のアクセラレータに限定せず、NVIDIA H100またはA100にデプロイできる。これは、エージェントモデルの効率が単なるパラメータ数の削減だけでなく、固定されたツールセット、状態遷移、成功条件に特化したポストトレーニングからも生まれることを示している。

技術的な要点は、製品の所有者がモデル、harness、評価シグナルを一体的に管理し、失敗した軌跡を次のトレーニングラウンドのデータへ迅速に変換できることにある。一方で、モデルが特定のインターフェースに過剰適合する可能性がある。ツールのバージョンやワークフローが変われば、オンラインでの優位性が維持されるとは限らない。Microsoftはモデルのパラメータ数、Excelタスクの分布、統計区間、GPT-5.6との比較条件も公開しておらず、受け入れ率や再訪率もコードの正確性と同義ではない。今後、エンジニアリングチームは、オフライン評価とオンライン指標によってreward hackingをどう防ぐか、また製品データをプライバシー、ライセンス、バイアス管理を確保しながら安全にフィードバックできるかに注目すべきだ。

出典

  1. Hill-Climbing MAI models for GitHub Copilot and Excel
  2. MAI-Code-1-Flash available on more Copilot surfaces
  3. Getting more from each token: How Copilot improves context handling and model routing