開放模型/程式代理
KAT-Coder-V2.5-Dev 開放 35B MoE 權重,以 3B 啟用參數執行程式代理
Kwaipilot 釋出 KAT-Coder-V2.5-Dev 權重,將 Qwen3.6-35B-A3B 經 12.7 萬筆樣本微調,再以代理任務強化學習。官方自測在 SWE-bench Verified 達 69.40%,但分數對代理框架與工具配置相當敏感。

Kwaipilot 在 7 月 24 日開放 KAT-Coder-V2.5-Dev。這是一款文字限定的程式代理模型,採混合專家架構,總參數量 350 億、每個 token 啟用約 30 億參數;模型卡提供 Hugging Face Transformers 格式權重,並列出 Transformers、vLLM、SGLang 與 KTransformers 的部署方式。多模態元件不在這次釋出範圍內。
模型以 Qwen3.6-35B-A3B 為基礎,先用 12.7 萬筆資料進行監督式微調,再接續強化學習。配套技術報告描述更完整的 KAT-V2.5 訓練系統:AutoBuilder 把真實儲存庫重建成可執行沙箱,以 fail-to-pass 與 pass-to-pass 測試建立可驗證獎勵;KwaiClawEnv 則從服務與真實任務種子合成工具使用軌跡。訓練還加入代理框架隨機化,降低模型只適應單一 harness 的風險。
團隊在自建統一管線中報告 SWE-bench Verified 69.40%、Multilingual 63.00%、Pro 45.96%,另在 Terminal-Bench 2.1 取得 41.02%。工具標籤異常率也由 9.34% 降至 0.28%。不過這些比較全部由發布團隊重跑,每個模型通常只測一次;模型卡也承認,Qwen3.6 在其環境中的 SWE-bench 成績比官方數字低約 10 個百分點,可能來自 harness 版本與測試集處理差異。
工程團隊因此不應把榜單差距直接視為模型能力差距。更值得驗證的是:相同代理框架、容器映像、工具集合與 token 預算下,模型的修補成功率、重試成本和錯誤工具呼叫率是否仍有優勢。後續也要觀察社群能否重現成績,以及開放權重是否足以重建官方後訓練結果。