AI 研究
XiaomiがHySparse2を公開、100万トークンのプリフィル演算量を基準の約5分の1に
2段階のKV共有により、長い入力のプリフィルを早期に完了できるアーキテクチャ。5倍の差は演算量の分析に基づくもので、品質評価は最大256kまで。実際のサービスでのレイテンシは今後の検証が必要だ。

XiaomiのMiMoチームに所属する羅福莉は9月23日、HySparse2を公開し、MiMo-V3の中核アーキテクチャと位置づけた。この研究は、エージェントでよく見られる入力負荷を対象としている。モデルが出力するのは短い指示でも、ツールは大量の文書、Webページ、実行ログを返すため、各ターンのプリフィルと履歴のキャッシュにかかるコストが増大する。関連論文は9月22日に投稿されている。[著者の発表のミラー](https://twstalker.com/_LuoFuli)、[論文情報](https://arxiv.org/abs/2609.26368)
HySparse2はモデルをセルフデコーダーとクロスデコーダーに分割する。外側のKV Bridgingでは、後半のフルアテンション層が前半の隠れ状態からキー・バリューキャッシュを投影によって生成する。内側では、フルアテンション層のキャッシュと選択インデックスを後続のスパースアテンション層で再利用する。これにより、入力のキャッシュ構築に必要な情報が早い段階でそろい、セルフデコーダーの処理完了時点でプリフィルを終了できる。[著者によるアーキテクチャの説明](https://twstalker.com/_LuoFuli)
もう一つの変更は、ブロック単位の選択をトークン単位の選択に置き換え、従来の独立したスライディングウィンドウ分岐の代わりに、直近のコンテキストを必ずスパースアテンションの対象に含める点だ。これにより、近傍と遠方の情報でキャッシュを共有でき、少数の関連位置を取得するために周辺の内容をブロックごと読み込む無駄も減らせる。[著者による技術説明](https://twstalker.com/_LuoFuli)
論文では、総パラメータ数800億、トークン当たりのアクティブパラメータ数が約30億のMoE構成を3種類比較している。100万トークン、FP8キャッシュという条件では、HySparse2のプリフィルの浮動小数点演算量はHybrid SWAの約5分の1となり、KVキャッシュは12.09 GBから2.69 GBに減少する。ただし、構成は同時にGQAからMQAへ変更されているため、キャッシュ削減の効果をすべて層間共有に帰することはできない。[実験設定と分析](https://arxiv.org/html/2609.26368v1)
品質の結果も分けて見る必要がある。ポストトレーニング後の長文コンテキスト評価は最大256kまでで、この長さでのRULER-v2スコアは58.45、Hybrid SWAは35.74だった。一方、一般的な推論能力とコーディング能力には向上した項目と低下した項目がある。100万トークンという条件はリソース分析に用いられたものであり、論文は同じ長さでの品質テストによって十分な実用性を確認したわけではない。[評価結果](https://arxiv.org/html/2609.26368v1)
推論システムのエンジニアにとって、これは長い入力の処理経路を短縮する設計の方向性を示している。ただし、5倍の差は演算量の分析によるもので、実際のレイテンシはカーネルの効率、データ転送、スケジューリングにも左右される。今後は、再現可能な実装、実際の複数ターンにわたるタスクの成功率、最初のトークンが出力されるまでの時間に注目すべきだ。これらの条件を踏まえると、導入評価ではバッチサイズとツールが返す内容の長さも記録し、中国語の文書や複数ファイルにまたがるコーディングタスクも検証する必要がある。合成検索タスクのスコアだけから、エージェントが実際にタスクを完遂する能力を推し量ることは避けるべきだ。