代理框架與評測
Recuris 凍結代理權重、遞迴改寫技能記憶,35 組長任務測試錄得提升
Recuris 把工作狀態、技能選擇與失敗證據拆成可局部更新的記憶元件,再以保留資料驗證每次修改。作者在 37 組已完成的模型—基準配對中錄得 35 組提升,但部分增益未達統計顯著,測試亦依賴 LLM 模擬使用者與裁判。

Recuris 嘗試把代理的「自我改進」移到模型權重和單一巨型提示詞之外。它為凍結的下游代理配置經驗記憶與工作記憶:後者保存已驗證的任務狀態,再按當前缺口選取技能;每一步則記錄狀態、取出的經驗、動作與觀察,讓失敗能歸因至特定記憶元件,而非只得到一次終局分數。
改進迴圈由固定的 Meta-Agent 讀取失敗軌跡,只修改相關技能卡或路由元件。候選修改必須在成對的保留證據上通過確定性驗證閘門,才會寫回 Skill Memory;下游模型本身不微調,也不由模型投票判斷自己的修改是否成功。這種設計的工程價值,在於記憶套件可版本化、回退並跨模型重用,同時避免對持續增長的完整聊天歷史做無差別檢索。
作者在 τ²-Bench、SkillFlow 與 Terminal-Bench 2.1 等四個設定、十款模型上,以每題四次試驗的 `avg@4` 比較原代理和加裝 Recuris 的代理。37 組完成配對中有 35 組提高;τ²-Retail 上,GPT-5.6 Sol 增加 17.8 個百分點,Claude Opus 5 增加 15.6 點至 87.9%。Qwen3.6-27B 與 35B 在 SkillFlow 分別增加 16.6 與 13.5 點,最長互動區間的差距最高達 32.2 點。
數字仍不可解讀成代理已能可靠地無限自我改進。表中若干小幅增益的信賴區間包含零,Granite 在 SkillFlow 更下降 0.3 點;Terminal-Bench 的動態記憶相對固定記憶只增加 2.3 點,作者也承認樣本量下不顯著。τ² 評分另依賴固定的 LLM 使用者模擬器和 assertion judge,而重現部分報告結果需採用以樣本內資料選出的模型家族路由覆寫。下一步應觀察跨組織工作負載、記憶污染與長期累積成本,以及驗證閘門能否阻止錯誤技能在多輪演化後擴散。