返回首頁

AI 研究

外部記憶讓凍結權重代理從部署回饋學習,τ-bench 單次成功率最高增至 2.6 倍

新研究把每次代理執行的成敗與事後修正蒸餾成可檢索規則,不必更新模型權重即可累積經驗。在 τ-bench 銀行任務中效果跨 Mistral Large 與 Claude Sonnet 5 重現,但評測使用完美回饋且每個情境重複四次。

Universal Pictures · Public domain · Image source
zh-Hant

一項新研究提出以外部記憶替代持續微調:代理完成任務後,由同一模型把對話、工具軌跡及回饋整理成一條 `WHEN–THEN` 自然語言規則,之後遇到相關情境時再主動搜尋。模型權重全程凍結,寫入只發生在任務結束後;失敗且沒有標準答案時,記憶只能記錄應避免的做法,取得經驗證的修正後才可保存正確動作,以降低代理把猜測寫成長期知識的風險。

作者在 τ-bench 的銀行領域測試 97 個任務,每項執行四次。對 Mistral Large,完整政策文件的靜態 RAG 基線 `pass^1` 為 0.064;只加入成敗一個 bit 的回饋後升至 0.103,加入失敗後的正確動作序列則達 0.170,約為基線 2.6 倍。基線四次皆未解出的 84 題中,修正記憶讓代理至少解出一次的有 22 題。Claude Sonnet 5 的 `pass^1` 亦由 0.248 升至 0.397。

研究還交換兩個模型建立的唯讀記憶庫。Mistral 讀取 Sonnet 的規則後達 0.289,Sonnet 讀取 Mistral 規則後達 0.314,顯示部分經驗可跨模型傳遞,而不只是保存特定模型的提示捷徑。實驗 harness、資料與提示片段已公開,便於重跑。

限制同樣明確:每種條件只有一次完整執行,回饋由確定性評分器提供,沒有模擬延遲、錯誤或惡意的人類修正;同一任務重複四次也比多數正式流量更容易形成可重用規則。此外,Mistral 的三種條件在 `pass^4` 都是 0.031,代表學會部分重複情境不等於取得連續四次可靠成功。下一步應測試噪音回饋、跨任務泛化、記憶衝突、刪除與來源追蹤,以及長期記憶庫遭提示注入污染時的復原能力。

來源

  1. Learning on the Job: Continual Learning from Deployment Feedback for Frozen-Weights Agents
  2. Spark continual-learning paper data and evaluation harness