最新模型
MiMo-V2.6 開放權重,以群組評分強化跨框架代理訓練
小米將多類代理任務與工具框架混入同一次強化學習,並用評分器區分已通過測試的解法。同步釋出的 9B 蒸餾模型仍是 SFT 權重,不能直接套用後續 RL 成績。

小米的 9 月 22 日發布紀錄列出 MiMo-V2.6 Pro 與 Flash,系列權重也已公開。這次技術重點是把程式開發、一般代理、視覺與資安任務放入同一次混合強化學習,連代理使用的工具框架也一起混合,嘗試讓學到的策略跨框架移轉。[發布紀錄](https://mimo.mi.com/docs/en-US/updates/model)、[官方公告](https://mimo.mi.com/docs/en-US/news/latest/v2-6)
模型卡描述的訓練採完全非同步 GRPO,每步包含 1,568 個提示、各產生 16 條執行軌跡。團隊也擴大評分器的運算量:GRS 從不同軌跡離線建立任務評分規準,再結合測試結果;GAR 則在線比較已通過測試的解法,把優勢訊號分配給品質較好的軌跡。這讓「測試通過」之後,仍有縮短操作路徑與減少 token 的學習訊號。[訓練設計](https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Pro-RL)
維持訓練穩定也需要額外工程。官方表示會凍結 MoE 路由器,以抑制專家負載漂移,並透過對抗評估、異常偵測與驗證器交叉檢查降低獎勵駭取。其公告另提出逾七千個代理任務環境,以及基於 verl 等工具的端到端訓練資源;這些材料能否完整重現訓練,仍應以實際可取得的環境、程式與評分設定逐項核對。[官方公告](https://mimo.mi.com/docs/en-US/news/latest/v2-6)
較容易供研究者起步的是同步公開的 MiMo-V2.6-Distill-Qwen-9B。模型卡明確標示,這是以 MiMo 生成資料微調 Qwen3.5-9B 的 SFT 權重,作為後續代理強化學習起點。其 SWE Pro 為 44.6、採 avg@3;Terminal Bench 2.1 為 37.1、採 avg@1。公告所列後續 RL 成績,不能直接當成這份下載權重的能力。[9B 模型卡](https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Distill-Qwen-9B)
對開發團隊而言,這提供了研究「任務、代理框架與評分器如何共同影響學習」的具體入口。公開成績仍主要來自供應商評測,部分測試集屬內部資料;導入時應固定權重、聊天模板、工具與重試預算,再檢查繁體中文任務成功率、每題總成本及失敗後的復原行為。若要比較訓練方法,還應分開記錄環境互動、評分器呼叫與策略更新的耗時;即使每題使用更少 token,新增的評分成本仍可能改變整體效益。這些是評估設計上的推論。自我改進的說法,也應理解為受訓練環境與獎勵設計約束的迭代成果。