返回首頁

模型與推論系統

GLM-5.3-Flash 以混合稀疏/線性注意力壓縮百萬 token 推論成本

智譜公開 320B、每 token 啟用 18B 參數的原生多模態 GLM-5.3-Flash,並以 MIT 授權釋出權重。新架構宣稱較 GLM-5.3 減少三倍注意力計算與 4.4 倍 KV cache,但「Flash」不代表一般工作站能輕易部署。

Dmitry A. Mottl · CC BY-SA 3.0 · Image source
zh-Hant

智譜補充公開 GLM-5.3-Flash 的架構、部署方式與評測資料。模型共有 320B 參數,但混合專家路徑每個 token 僅啟用 18B,層數也由相近規模 GLM-4.5 系列的 92 層降至 45 層;它不是從 GLM-5.3 直接裁切,而是以 30T-token 圖文語料重新預訓練的原生多模態基礎模型,可接收文字、圖片、影片與文件。

長上下文是這次最具體的工程變更。模型交錯使用線性注意力與稀疏注意力:前者以狀態建模保留局部依賴,後者由輕量 indexer 從全域上下文選取相關位置。處理最長一百萬 token 時,IndexPool 再把四個已快取的 key 向量加權壓成一個。智譜稱相較 GLM-5.3,注意力計算量縮至約三分之一、KV cache 縮至約 1/4.4;服務端另採 ReplaySSM、W8A8、混合 INT8/FP8/BF16 cache,以及編碼、prefill、decode 分離部署。

權重以 MIT 授權放上 Hugging Face,現可由 Transformers、vLLM、SGLang、KTransformers 與 TokenSpeed 啟動,並提供 `reasoning_effort` 三級控制。模型卡提醒:未明確指定時會使用最高推理強度,聊天工作負載則宜設定 `clear_thinking=true`,否則多輪部署的延遲與輸出行為可能和預期不同。

官方在 Terminal Bench 2.1、DeepSWE v1.1 與 Toolathlon Verified 分別報告 84.3、63.4、78.4,但這些仍是供應商評測。Artificial Analysis 顯示不同 API 供應商的生成速度可相差逾十倍,說明模型架構只是實際吞吐量的一部分。工程團隊下一步應確認量化後的視覺與工具能力、真實 KV 占用,以及相同推理強度下的成本與準確率;320B 總權重也使完整自架仍屬伺服器級工作負載。

來源

  1. GLM-5.3-Flash: More Intelligence with Less Compute
  2. zai-org/GLM-5.3-Flash model card
  3. GLM-5.3-Flash API Provider Benchmarking & Analysis