AI 模型與程式代理
Cognition 推出 SWE-2:在同一次強化學習中訓練多種推理成本
SWE-2 以 2.8T 參數的 Kimi K3 為底模,利用成本懲罰、低精度 rollout 與同步更新的草稿模型改善程式代理效率。官方基準顯示它接近前沿閉源模型,但成績主要由 Cognition 自行執行,且目前沒有獨立 API 或權重。

Cognition 於 9 月 10 日發布程式代理模型 SWE-2,並先整合至 Devin Desktop 與 CLI,Web 和 Fusion 則分階段推出。它不是新預訓練底模,而是在 Moonshot AI 的 Kimi K3 上繼續後訓練;後者是總計 2.8T、每個 token 啟用 104B 參數的 MoE,具 100 萬 token 上下文與原生視覺能力。
這次最值得注意的是強化學習目標。Cognition 不再為不同推理強度各自訓練模型,而是在同一次 RL 中使用 `R = S − λₑC`:`S` 表示任務是否成功,`C` 同時納入推論費用與執行時間,`λₑ` 則依各 effort level 在成本—解題率 Pareto 曲線上的局部斜率設定。團隊另採用按 rollout 長度加權的 reward baseline,以降低梯度變異及訓練、推論策略之間的 KL 偏移。
系統層面,排程器會短暫延後 prefill,將鄰近請求組批;官方測得單卡 TPM 與單請求 TPS 提高 10% 至 20%,代價是首 token 延遲增加。Rollout 使用 DSpark 推測解碼,並讓 draft model 在訓練期間持續追蹤變動中的 policy,避免接受長度逐步下降。MoE rollout 則混用 NVFP4、FP8 與量化感知訓練,MLA 的 Q、K、V 及分數計算皆採 FP8。
官方報告 SWE-2 在 FrontierCode 1.1 Main 得 50.0%、DeepSWE 1.1 得 73.0%;medium 模式相較 SWE-1.7 少用 58% 步驟、平均成本低 81%。不過比較表會在缺乏公開結果時改用 Cognition 內部 harness,且選取各模型最佳推理強度,尚非完全一致的第三方評測。工程團隊下一步應觀察實際 Devin 工作負載的延遲、成本與回歸率,以及 Cognition 是否提供 API、可重現評測或更完整的安全資料。