返回首頁

AI 代理與評測

自我改進代理遇上隨機任務順序,平均增益由 +1.5% 反轉為 -4.5%

Salesforce 重新評測兩種文字記憶方法,發現加入自我改進迴圈後,71% 的設定出現更高跨次執行變異。原本隱含由易至難課程的固定題序一經打亂,ReasoningBank 不但未改善代理,反而降低通過率。

The original uploader was RichardSocher at English Wikipedia. · CC BY 2.5 · Image source
zh-Hant

Salesforce AI Research 重新檢驗 Agent Workflow Memory(AWM)與 ReasoningBank:代理完成每項任務後,把成功工作流程或推理經驗寫入文字記憶庫,供後續任務檢索。團隊以 GPT-5-mini 作為代理及記憶建構模型,在 WebArena、VisualWebArena 與企業 CRM 環境 SCUBA 上測試,並把過往常見的單次固定題序,擴充為每組三次執行及兩種隨機排序。

結果顯示,無記憶代理本身已有不可忽略的隨機性;加入會累積狀態的記憶迴圈後,早期採樣差異還會沿任務序列放大。在比較的 24 組領域/方法設定中,17 組、約 71% 的標準差增加,其中 11 組增幅超過 50%。WebArena GitLab 子集的最佳與最差執行差距,亦由基線的 4.44 個百分點擴大至 ReasoningBank 的 7.78 個百分點;部分領域差距更超過 10 點。這意味只跑一次便宣布數個百分點進步,很可能把執行噪音誤當方法成效。

更關鍵的是題序效應。預設排序隱含由易至難的課程,ReasoningBank 在此條件平均增加 1.5%;隨機打亂後則平均下降 4.5%。人工檢查發現,代理會把規格不足的經驗寫成看似合理、實際不可執行的規則,例如在只能操作瀏覽器的環境建議直接呼叫 API。把詳細評分規則、環境回饋及能力限制加入記憶建構,可收回約 31% 的排序退化,但仍未消除差距。

工程上,長期記憶因此應被視為會漂移的可變狀態,而非免費的能力升級:評測需報告多次執行、隨機題序及記憶內容稽核,部署端也要保留刪除或修正錯誤經驗的介面。作者已公開實驗程式與 39,343 條代理軌跡;不過結論目前限於三個網頁環境、三次重跑及使用真實任務獎勵的設定,尚不能直接外推至程式代理或沒有可靠回饋的生產系統。

來源

  1. On the Fragility of Self-Improving Agents: Variance, Task Order, and Underspecification
  2. SalesforceAIResearch/self-improve-fragility
  3. Salesforce/self-improve-fragility Dataset