AI 代理與開發工具
Argus 讓固定權重代理累積經驗,SWE-Bench Pro 準確率由 59% 升至約 78%
Argus 把長期任務拆成受限 mission,並由 Manager、Planner、Engineer 與 Reviewer 共同維護可持久化狀態。作者報告它以 1.41 倍 token 成本提高程式修復成績,代理產生的 RWKV6 核心亦經外部修正後合併至開源專案。

Argus 的核心並非更新模型權重,而是把代理執行層變成可累積、可審查的狀態機。Manager 保存使用者原始意圖,Planner、Engineer 與 Reviewer 則在一個個有明確預算、目標及驗證條件的 mission 中工作;記憶、技能、驗證器、路由決策乃至失敗方案,只有經角色審查或任務原生測試後才寫入長期狀態。這可避免一次錯誤直接污染後續工作,也讓系統在跨 session 任務中保留已排除的路線。
論文在七類任務上使用不同的原生指標。其中 GPT-5.5 驅動的 SWE-Bench Pro 實驗取得約 78% 準確率,直接使用 Copilot 的對照組為 59%,但 Argus 消耗的總 token 是對照組的 1.41 倍。隨著狀態累積,成熟階段每題的解題輸入 token 比啟動階段少 21%,代理活躍時間少 15%;Reviewer 流程記錄到 34 次驗證器挽救及 22 次嚴格審查迴圈挽救。這些數字支持「前期投入換取後續重用」,但不能直接推論所有工作負載都會降低成本。
較具體的外部證據是代理為 Flash Linear Attention 產生 TileLang RWKV6 核心:H100 指定工作負載的前向延遲由 0.199 毫秒降至 0.168 毫秒。維護者審查時發現長序列指數溢位風險,要求加入區塊局部中心化;代理修正並重跑測試後,程式才獲合併。這同時顯示驗證閘門的價值與限制:代理能產生可採用成果,卻仍需要領域專家抓出基準測試未暴露的數值問題。工程團隊接下來應關注完整 runtime、執行軌跡及可重現評測是否公開,以及持久記憶在任務或模型切換後會否帶來錯誤累積。