模型發布與AI資安
GLM-5.3 沿用 5.2 基座擴大後訓練,資安能力暴增令開放權重延後兩週
Z.ai 表示 GLM-5.3 未重新預訓練,程式與資安能力提升均來自更大規模的後訓練。模型在 CyberGym 報告 84.5%成功率,但權重須待雙重用途風險評估完成才會釋出。

Z.ai 於 8 月14日推出 GLM-5.3,但目前只透過 ZCode 與 Coding Plan 提供服務,原定的開放權重延後約兩週。技術上最值得注意的是,它沿用 GLM-5.2 的 MoE 基座與一百萬 token 上下文,沒有增加預訓練參數;官方稱效能增幅全部來自擴大後訓練,包括更多可執行環境、更長的代理任務,以及由執行結果提供回饋的程式與資安訓練。
官方數字顯示,Terminal-Bench 3.0 由 4.6 升至28.3,DeepSWE v1.1 由46.2升至66.9;ExploitBench 則由24.4%升至54.4%。GLM-5.3 在 CyberGym 報告84.5%成功率。不過,CyberGym Level 1 並非從零尋找漏洞:代理會取得漏洞描述與修補前的程式碼,目標是生成能在舊版本觸發、在修補版本失效的 PoC。排行榜亦明確警告,各團隊自行提交結果、試跑次數及代理 harness 不同,零點幾個百分點的領先不宜解讀為模型本體的確定優勢。
雙重用途風險來自能力已超出單純重現舊漏洞。Z.ai 的披露帳本列出2,436項發現,涵蓋269個開源專案,其中1,097項被標為嚴重或高危;但截至發布時只有53項公開,外界尚無法逐項核對真陽性率、重複計算及協調披露狀態。公司因此先讓選定資安夥伴在受控環境使用,並提供 OpenVuln 服務供維護者掃描公開儲存庫。
工程團隊接下來應關注權重釋出條件、推論與訓練 harness 是否公開,以及獨立研究者能否在固定工具、步數與試跑次數下重現結果。若後訓練確實能在不更換基座下令利用能力倍增,模型發布審查便不能只依參數量或預訓練算力分級。