開放模型與推論系統
Muse Glimmer 30B、17GBの量子化ウェイトとDFlashドラフトモデルでマルチモーダルエージェントを単一GPU上に実現
MetaはMuse Glimmer 30Bのウェイト、ビジョンエンコーダー、DFlashドラフトモデルを公開した。17GB版では、24GBのVRAM内でテキスト、画像、投機的デコーディングを同時に実行できる。公式測定ではRTX 5090上で平均233.4 token/sを記録したが、安全性評価とデプロイの詳細から、依然として外部の保護策と新しいruntimeが必要であることが分かる。

Metaは、約296億パラメータのMuse Glimmerをリリースした。一般的なチャットモデルではなく、ローカルのエージェントフレームワーク上で長期的な推論、ツール呼び出し、エラーリカバリー、画面/文書理解を実行できるオープンウェイトモデルと位置付けられている。アーキテクチャは52層のdense Transformerで、32個のquery head、2個のKV headを採用し、3層の局所attentionと1層の大域attentionを組み合わせた構成を繰り返す。さらに、約18億パラメータのViT-G/14知覚エンコーダーを接続し、コンテキスト長は131,072 tokenとされている。
デプロイ面での要点は、公式が約4-bitのGGUFを2種類直接提供していることだ。16.8GB版は24GB VRAM向け、19.7GBの動的量子化版は32GB VRAM向けとなる。ビジョンエンコーダーは別途1.4GB、5層のDFlashドラフトモデルは1.6GBを使用する。DFlashは一度に16 tokenを提案し、メインモデルがそれらを並列検証する。Metaの測定では、batch size 1、greedy decodingの条件下で、RTX 5090における平均速度が74.9 token/sから233.4 token/sへ向上した。M4 MaxとM5 Maxでは、それぞれ1.5倍と1.8倍に高速化した。ただし、これらは指定されたハードウェアとプロンプトセットを用いたベンダー測定であり、マルチユーザーサービスのスループットを示すものではない。
互換性にも明確な要件がある。llama.cppは、8月10日にMuse Glimmerアーキテクチャの対応がマージされた後のb10353以降を使用する必要があり、古いバージョンではモデルを認識できない。チャットテンプレートではJinjaを有効にする必要があるほか、モデルの推論チャンネルを完全に無効化することはできず、reasoning strengthを調整するかtoken上限を設定する必要がある。サーバーで複数のslotを有効にすると、`-c`の値は均等に分割されるため、長時間の推論では明確なエラーが出ないままコンテキストを使い切る可能性がある。
公式スコアでは、SWE-Bench Proが51.2、MCP Atlasが75.5となっている一方、OSWorld-VerifiedやTerminalBench 2.1などでは依然としてQwen3.6-27Bを下回る。また、Siren AgentDojoにおけるプロンプトインジェクション攻撃の成功率は28.4%に達した。したがって、エンジニアリングチームは本モデルを、完全な権限管理とセキュリティ境界を備えた完成品ではなく、オフラインでデプロイ可能なエージェント基盤として扱うべきだ。