開放模型/AI 程式設計
GLM-5.3 開放 744B MoE 權重,百萬 token 部署仍需資料中心級資源
Z.ai 在 API 上線兩週後釋出 GLM-5.3 權重,模型沿用 GLM-5.2 基礎架構,能力增益主要來自代理式程式設計與資安後訓練。FP8 檔案仍約 756GB,加上自訂授權與廠商主導評測,實際採用前需另做效能、安全及法律驗證。

Z.ai 於 8 月 28 日兌現先前承諾,將 GLM-5.3 權重上傳至 Hugging Face。這不是已經報道過的 320B、每次啟用 18B 的 GLM-5.3-Flash,而是完整的資料中心級版本;[模型檔案](https://huggingface.co/zai-org/GLM-5.3/tree/main)由 141 個 safetensors 分片組成,FP8 版本合計約 756GB,外部報道列出的規模為 744B 總參數、每個 token 啟用約 40B。
設定檔顯示模型有 78 層、256 個 routed experts,每個 token 選取八個專家,另有一個共享專家;原生位置上限為 1,048,576 token。它沿用 GLM-5.2 的基礎模型,新增能力主要來自後訓練,而非重新預訓練。[官方技術文章](https://z.ai/blog/glm-5.3)指出,團隊以 slime 串接 Megatron 訓練端、SGLang rollout、沙箱與 verifier,持續加入長時程程式設計及資安環境。模型亦提供 `low`、`high`、`max` 三級 reasoning effort,vLLM、SGLang、Transformers、KTransformers及昇騰 NPU 路徑已列入部署說明。
官方評測中,Terminal-Bench 3.0 由 GLM-5.2 的 4.6 升至 28.3,DeepSWE v1.1 由 46.2 升至 66.9;ExploitBench 則由 24.4 升至 54.4。不過同一表格也顯示它在多項測試仍落後封閉模型,且部分成績、代理 harness 與私有 Z.ai Code Bench 均由開發團隊控制,不能當作獨立重現結果。
工程團隊還要注意兩項門檻。首先,這種權重尺寸即使量化也不等於一般工作站模型,完整吞吐測試需要多卡、expert parallelism 與長上下文 KV-cache 規劃。其次,GLM-5.3 使用自訂授權;[授權摘要與發布報道](https://gigazine.net/gsc_news/en/20260829-glm-5-3-open)指出,年營收超過 100 億美元的使用者另受安全審查條件約束。接下來值得觀察的是第三方能否用固定版本的 serving stack 重現程式設計與資安成績,以及百萬 token 負載下的實際延遲、顯存和失效模式。