開放模型與端側推論
Meta、Muse Glimmer 30Bをオープン化:17GB量子化版とDFlashによりRTX 5090で233 token/sを達成
Muse Glimmerは、マルチモーダル入力、ツール呼び出し、失敗時の再試行を、コンシューマー向けハードウェアにデプロイ可能な30BのDenseモデルに統合した。Apache 2.0ライセンスの重みと公式GGUFはすでに公開されているが、性能および安全性の数値は現時点で主にMeta自身の評価に基づいている。

Metaは8月10日、約296億パラメータを持ち、テキストと画像の入力に対応するDense Causal Transformer「Muse Glimmer」を公開し、Apache 2.0ライセンスで重みをオープン化した。モデルは52層、32個のQuery Head、2個のKV Headを備えたGQAを採用。Attentionは3層のLocal Attentionと1層のGlobal Attentionを交互に配置し、Sliding Windowは2,048 token、コンテキスト長は131K超とされている。約18億パラメータのViT-G/14 Perception Encoderが画像を処理する一方、出力は引き続きテキストに限定される。
デプロイ面での焦点は元の精度ではなく、約4-bitの2種類のK-Quantバージョンにある。小型のK-Quant-17GBでは言語モデルを24GB VRAMに収めることができ、Metaによれば15種類のベンチマークにおける平均精度の低下はわずか1%。32GB版では0.2%の低下にとどまる。Metaはさらに5層のDFlash Draft Modelを同梱しており、毎回16-tokenのブロックを提案し、メインモデルが並列に検証する。Batch Size 1、Greedy Decodingによる公式テストでは、RTX 5090のスループットが74.9から233.4 token/sへ、M5 Maxでは26.6から50.2 token/sへ向上した。
エージェント評価について、MetaはMuse GlimmerがMCP Atlasで75.5、SWE-Bench Proで51.2を記録し、同社が比較対象として掲載したGemma4-31BとQwen3.6-27Bをそれぞれ上回ったと報告している。一方、OSWorld-Verified、TerminalBench 2.1、および一部の文書理解タスクでは、依然としてQwenに後れを取っている。安全性の表でも、Siren AgentDojoにおけるAttack Success Rateは28.4%と示されており、ローカルで実行するだけで自動的に安全になるわけではない。
重み、Model Card、GGUFはすでにダウンロード可能で、vLLM、SGLang、Transformersについても起動方法が案内されている。llama.cpp、MLX、ExecuTorch、Ollamaなどへの最適化統合は、順次提供予定とされている。エンジニアリングチームは次に、量子化ファイル、Vision Encoder、Draft Modelを合わせた総メモリ使用量を確認し、自社のAgent Harness、ツール構成、プロンプト長を用いてスループットと安全性のテストを再実施すべきだ。