返回首頁

開放模型與推論系統

Muse Glimmer 30B 以 17GB 量化權重與 DFlash 草稿模型,把多模態代理搬上單張顯卡

Meta 公開 Muse Glimmer 30B 權重、視覺編碼器及 DFlash 草稿模型,17GB 版本可在 24GB VRAM 內同時執行文字、影像與推測解碼。官方在 RTX 5090 測得平均 233.4 token/s,但安全評測與部署細節顯示它仍需要外部防護及新版 runtime。

The GGML authors · Public domain · Image source
zh-Hant

Meta 發布約 296 億參數的 Muse Glimmer,定位不是一般聊天模型,而是可在本機代理框架中執行長程推理、工具呼叫、錯誤復原與螢幕/文件理解的開放權重模型。架構為 52 層 dense Transformer,採 32 個 query head、2 個 KV head,以及三層局部注意力搭配一層全域注意力的重複配置;另接約 18 億參數 ViT-G/14 感知編碼器,標示上下文長度為 131,072 token。

部署重點是官方直接提供兩款約 4-bit GGUF:16.8GB 版本鎖定 24GB VRAM,19.7GB 動態量化版鎖定 32GB。視覺編碼器另占 1.4GB,五層 DFlash 草稿模型占 1.6GB。DFlash 每次提出 16 個 token,再由主模型並行驗證;Meta 在 batch size 1、greedy decoding 下,於 RTX 5090 將平均速度由 74.9 提升至 233.4 token/s,M4 Max 與 M5 Max 則分別提升 1.5 倍及 1.8 倍。這些是指定硬體與提示集的供應商測量,不代表多使用者服務吞吐。

相容性也有明確門檻:llama.cpp 必須使用 8 月 10 日合併 Muse Glimmer 架構後的 b10353 或更新版本;舊版會直接無法辨識模型。聊天模板必須啟用 Jinja,且模型的推理通道不能完全關閉,只能調整 reasoning strength 或設定 token 上限。伺服器若開多個 slot,`-c` 會被平均分割,長推理可能在沒有明顯錯誤的情況下耗盡上下文。

官方分數顯示其 SWE-Bench Pro 為 51.2、MCP Atlas 為 75.5,但在 OSWorld-Verified、TerminalBench 2.1 等項目仍落後 Qwen3.6-27B。Siren AgentDojo 的提示注入攻擊成功率亦達 28.4%,因此工程團隊應把它視為可離線部署的代理基座,而不是自帶完整權限與安全邊界的成品。

來源

  1. Muse Glimmer 30B GGUF model card
  2. Muse Glimmer evaluation methodology
  3. llama.cpp Muse Glimmer support pull request #26841