最新模型
MiMo-V2.6の重みを公開、グループ評価でフレームワーク横断のエージェント学習を強化
Xiaomiは複数種類のエージェントタスクとツールフレームワークを同一の強化学習に組み込み、評価器でテストに合格した解法の質を見分ける。同時公開の9B蒸留モデルはSFT段階の重みであり、その後のRL成績をそのまま当てはめることはできない。

Xiaomiの9月22日のリリース履歴にはMiMo-V2.6 ProとFlashが記載されており、シリーズの重みも公開された。今回の技術的な焦点は、ソフトウェア開発、汎用エージェント、視覚、サイバーセキュリティのタスクを同一の混合強化学習に組み込むことにある。エージェントが使うツールフレームワークも混在させ、学習した方策をフレームワーク間で転用できるようにする試みだ。[リリース履歴](https://mimo.mi.com/docs/en-US/updates/model)、[公式発表](https://mimo.mi.com/docs/en-US/news/latest/v2-6)
モデルカードによると、学習には完全非同期のGRPOを採用し、各ステップで1,568件のプロンプトを用い、それぞれ16本の実行軌跡を生成する。チームは評価器に割り当てる計算量も増やした。GRSは異なる実行軌跡からタスクの評価基準をオフラインで構築し、テスト結果と組み合わせる。一方、GARはテストに合格した解法をオンラインで比較し、質の高い軌跡にアドバンテージ信号を割り当てる。これにより、「テスト合格」後も、操作手順の短縮やトークン使用量の削減につながる学習信号が得られる。[学習設計](https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Pro-RL)
学習の安定性を維持するためにも、追加の技術的な工夫が必要になる。公式説明では、MoEルーターを凍結してエキスパートの負荷分布のドリフトを抑え、敵対的評価、異常検知、検証器によるクロスチェックを通じて報酬ハッキングを減らすとしている。公式発表では、7,000を超えるエージェントタスク環境と、verlなどのツールに基づくエンドツーエンドの学習リソースも提示された。これらの資料で学習を完全に再現できるかどうかは、実際に入手できる環境、コード、評価設定を項目ごとに照合する必要がある。[公式発表](https://mimo.mi.com/docs/en-US/news/latest/v2-6)
研究者が取り組み始めやすいのは、同時公開されたMiMo-V2.6-Distill-Qwen-9Bだ。モデルカードには、MiMoが生成したデータでQwen3.5-9BをファインチューニングしたSFTの重みであり、その後のエージェント強化学習の出発点となることが明記されている。SWE Proのスコアは44.6でavg@3、Terminal Bench 2.1は37.1でavg@1を採用している。発表に記載された後続のRL成績を、このダウンロード可能な重みの能力とそのまま見なすことはできない。[9Bモデルカード](https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Distill-Qwen-9B)
開発チームにとって、これは「タスク、エージェントフレームワーク、評価器が、組み合わさって学習にどう影響するか」を研究する具体的な足がかりとなる。公開されている成績は依然として主に提供元による評価に基づき、一部のテストセットには内部データが使われている。導入時には、重み、チャットテンプレート、ツール、再試行の予算を固定したうえで、繁体字中国語のタスク成功率、問題ごとの総コスト、失敗後の復旧動作を確認すべきだ。学習手法を比較する場合は、環境との相互作用、評価器の呼び出し、方策更新に要する時間も分けて記録する必要がある。問題ごとのトークン使用量が減っても、追加の評価コストによって全体の費用対効果が変わる可能性がある。これらは評価設計上の推論である。自己改善という主張も、学習環境と報酬設計の制約を受ける反復的な取り組みの成果として理解すべきだ。