模型與推論系統
GLM-5.3-Flash 以線性/稀疏混合注意力,把啟用參數降至 18B
Z.ai 開放首款原生多模態 GLM-5 模型,320B 總參數中每次僅啟用 18B,並支援最長 100 萬 token。官方量測顯示注意力運算與 KV cache 分別較 GLM-5.3 減少 3 倍及 4.4 倍,但成績與成本仍主要由廠商自行評估。

Z.ai 於 8 月 26 日發布並開放 [GLM-5.3-Flash 權重](https://huggingface.co/zai-org/GLM-5.3-Flash)。它不是既有模型的量化版,而是重新預訓練的原生文字、圖像及影片模型;總參數量為 320B,MoE 路由每個 token 啟用約 18B,網路亦由 GLM-4.5 系列的 92 層縮至 45 層。訓練語料規模由官方列為 30T 個多模態 token。
核心改動是把線性注意力與稀疏全域檢索交錯使用。前者以固定狀態保存局部依賴,避免 KV cache 隨上下文等比例增長;後者透過輕量索引器找回遠距資訊。新的 IndexPool 再以加權池化把四個索引 key 壓成一個,針對 100 萬 token 情境降低索引延遲與記憶體。官方按每層、每個 head 計算,宣稱注意力運算量及平均 BF16 KV cache 較完整 GLM-5.3 分別降低 3.0 倍和 4.4 倍,但其 cache 仍大於 Kimi-K3、DeepSeek-V4-Flash。
能力方面,廠商報告 DeepSWE v1.1 得分由 GLM-5.2 的 46.2 升至 63.4,AutomationBench 由 26.2 升至 48.8;不同測試使用 400K 至 1M 上下文、最長六小時執行預算,部分項目亦採 LLM 裁判,因此不能把表格視為統一成本下的獨立排名。
工程端已可透過 vLLM、SGLang、Transformers、TokenSpeed 及 KTransformers 部署,且提供 `reasoning_effort` 控制推理預算。Z.ai 的生產系統另把多模態編碼、prefill 與 decode 拆成獨立資源池,搭配 W8A8、混合 cache 量化及張量平行。接下來應觀察第三方能否重現百萬 token 的準確率、實際 KV 佔用與吞吐量;320B 權重規模也意味著「18B 啟用」並不等於單卡即可完整常駐。