開放模型與代理
LLaDA 2.2 讓擴散模型在生成途中增刪 token,瞄準可反覆修正的代理迴圈
inclusionAI 開放 100B 級 LLaDA2.2-flash,以 Levenshtein Editing 讓平行解碼可插入、刪除及替換內容。模型在部分代理測試與吞吐上勝過自家自回歸基線,但程式修復與函式呼叫準確率仍落後,服務支援也尚未齊備。

螞蟻集團旗下 inclusionAI 於 7 月 27 日正式發布 LLaDA2.2-flash,試圖修補擴散語言模型用於代理時的一項結構性弱點。傳統自回歸模型由左至右鎖定 token;一般文字擴散模型雖能平行去噪,卻不擅長在環境回傳錯誤後改變既有序列長度。LLaDA 2.2 引入 Levenshtein Editing,除保留與替換外,還以 `DELETE`、`INSERT` 控制 token 移除冗餘片段或建立新的可編輯位置,因此可以在生成過程重寫草稿結構。
模型採 100B 非嵌入參數的 MoE 架構、32 層與 128K context。團隊另提出 Block Routing,把專家啟用限制在擴散區塊層級;訓練端則以 L-EBPO,把代理環境獎勵用於區塊級策略最佳化,目標是學會在多輪工具使用中修正失敗動作,而非只改善單輪文字品質。
官方以 Claude Code scaffold、固定 128K 上下文及五次平均評測,報告 SWE-bench Verified 49.28、BFCL-V4 60.78、τ²-Bench 80.33。對照自家自回歸 Ling-2.6-flash,LLaDA 2.2 在 τ²-Bench、MCP-Atlas 與部分代理任務略高,卻在 SWE-bench Verified、Multilingual 和 BFCL-V4 落後。吞吐差距較明顯:BFCL-V4 為 703.82 token/s,Ling 為 331.5;但比較沒有完整揭露硬體、並行度與端到端延遲,且部分 Ling 分數使用不同 scaffold,不能當成嚴格同條件勝負。
Apache 2.0 權重與技術報告已公開,Transformers 需要啟用 `trust_remote_code`;模型卡同時稱長上下文應採 SGLang,部署章節卻標示支援仍在準備中。工程團隊接下來應觀察正式 serving 核心、KV/prefill 成本、結構化輸出穩定性,以及獨立測試能否重現其多輪自我修正能力。既有研究曾發現擴散代理容易陷入重試迴圈與產生畸形 JSON,LLaDA 2.2 是否真正解除這些限制,仍需直接對照。