模型工程
Microsoft 用產品內強化學習專門化 MAI-Code,將同一檢查點延伸至 Excel 代理
Microsoft 公開「hill-climbing」後訓練流程,把產品工具、評分器與真實使用訊號接回模型迭代。MAI-Code-1-Flash 經 Excel 環境再訓練後可在較舊 GPU 上服務,但官方未披露參數規模、評測集或原始實驗資料。

Microsoft 7 月 23 日披露兩項 MAI 模型的產品內後訓練結果。其「hill-climbing machine」把基礎檢查點、代理 harness、工具執行環境、產品評測與更新後的權重串成迴圈,不再只用通用基準決定模型版本。團隊先在 GitHub Copilot 中部署小型代理模型 MAI-Code-1-Flash,再以該檢查點進入 Excel 強化學習環境,讓模型練習選擇工具、執行試算表操作,並由 grader 根據結果更新策略。
Microsoft 表示,MAI-Code-1-Flash 在 VS Code 的程式接受率約比 GPT-5.4 Mini 與 Claude Haiku 4.5 高 10%,中位 token 用量低 10%;跨日回訪率則分別高 6% 與 11%。Excel 變體在常見任務上的產品回饋被描述為與 GPT-5.6 相若,且可部署於 NVIDIA H100 或 A100,不必限定最新一代加速器。這顯示代理模型的效率不只取決於縮小參數量,也來自針對固定工具集合、狀態轉移及成功條件進行後訓練。
技術上的關鍵,是產品擁有者同時控制模型、harness 和評分訊號,能把失敗軌跡快速轉成下一輪訓練資料。代價則是模型可能過度適配特定介面;工具版本或工作流程一變,線上優勢未必能保留。官方也沒有公開模型參數、Excel 任務分布、統計區間或 GPT-5.6 的對照設定,而接受率與回訪率亦不等同程式正確性。工程團隊接下來應關注離線評測與線上指標如何防止 reward hacking,以及產品資料能否在隱私、授權和偏差控制下安全回流。