開放模型與端側推論
Meta 開放 Muse Glimmer 30B:17GB 量化版搭 DFlash 在 RTX 5090 達 233 token/s
Muse Glimmer 將多模態輸入、工具呼叫與失敗重試放進可在消費級硬體部署的 30B 密集模型。Apache 2.0 權重與官方 GGUF 已上線,但性能與安全數字目前仍主要來自 Meta 自評。

Meta 於 8 月 10 日發布 Muse Glimmer,一款約 296 億參數、支援文字與圖片輸入的密集型因果 Transformer,並以 Apache 2.0 授權開放權重。模型採 52 層、32 個查詢頭與兩個 KV 頭的 GQA,注意力以三層區域、一層全域的模式交替,滑動視窗為 2,048 token,標示上下文長度超過 131K。約 18 億參數的 ViT-G/14 感知編碼器負責圖片,輸出仍限文字。
部署重點不是原始精度,而是兩種約 4-bit 的 K-Quant 版本。較小的 K-Quant-17GB 可把語言模型壓進 24GB VRAM,官方稱在 15 項基準的平均準確率只下降 1%;32GB 版本則下降 0.2%。Meta 另附五層 DFlash 草稿模型,每次提議一個 16-token 區塊,再由主模型平行驗證。批次一、貪婪解碼的官方測試中,RTX 5090 由 74.9 提高至 233.4 token/s,M5 Max 由 26.6 提至 50.2 token/s。
代理評測方面,Meta 報告 Muse Glimmer 在 MCP Atlas 得 75.5、SWE-Bench Pro 得 51.2,分別高於其列出的 Gemma4-31B 與 Qwen3.6-27B;但在 OSWorld-Verified、TerminalBench 2.1 與部分文件理解任務仍落後 Qwen。安全表格也顯示其 Siren AgentDojo 攻擊成功率為 28.4%,並非本機執行就自然安全。
權重、模型卡與 GGUF 已可下載,vLLM、SGLang 和 Transformers 也列出啟動方式;llama.cpp、MLX、ExecuTorch、Ollama 等最佳化整合則被標為陸續到來。工程團隊接下來應核對量化檔、視覺編碼器與草稿模型的合計記憶體,並在自己的代理外殼、工具結構及提示長度下重跑吞吐與安全測試。