返回首頁

AI 代理可靠性

VaG 在技能寫入前攔截代理污染,Terminal-Bench 子集達 72% pass@1

新研究發現代理無條件累積技能會在第三輪後退步,刪除最初的錯誤技能也無法清除其衍生內容。Verifier-as-Gatekeeper 以格式、行為與語意檢查控制技能升級,但結果來自 50 題子集,且尚無公開實作。

Havang(nl) · CC0 · Image source
zh-Hant

讓代理把成功軌跡整理成持久技能,常被視為無須更新權重的持續學習方法;新研究指出,這種能力並非隨技能數量單調增加。只要錯誤技能先進入執行上下文,後續技能蒸餾就可能把其推理吸收進新的條目,形成跨回合污染鏈。事後刪除源頭時,錯誤邏輯仍留在後代技能中。

研究者在 Terminal-Bench 2.0 的 50 題 Event-50 子集進行五輪演化。未設閘門的代理在第三輪達到高點,之後回落;由高點到第五輪約損失 12.3 個百分點。只移除八項被判定有害的源技能,僅找回約 1.7 點;即使以完整來源資訊清除整條衍生鏈,仍有接近一半跌幅無法恢復。這說明技能庫需要記錄產生時使用過的上下文與 lineage,不能只保留最後文字。

團隊因此設計 Verifier-as-Gatekeeper(VaG)。新技能先進入不會注入提示的 Cold 層,必須通過 frontmatter schema 檢查、在保留題上的單技能 A/B replay,以及一次檢查虛構、矛盾與危險建議的 LLM 語意審查,才升到 Warm。第二道閘門再以邊際增益貪婪選擇測試技能組合;只有確實改善聯合表現者能進入執行期 Hot 層。

VaG 在第五輪以 37 項技能得到 72% pass@1;取消閘門的技能庫增至約五倍,成績反而較低。消融實驗中,移除行為 replay、聯合選擇及語意審查分別降低 10、8、4 個百分點。凍結的技能庫在五款骨幹上均帶來 8 至 16 點增益,並在 InterCode NL2Bash 得到 69.0%,高於未設閘門的 65.5%。

不過主實驗只有 50 題,論文自己報告中間輪次的 95% 信賴區間寬約 30 點;它使用的 Terminal-Bench 2.0 後來也有 28 題在 2.1 版修正。VaG 尚未公開程式與完整軌跡,因此目前更適合作為技能生命週期設計警訊,而非可直接採用的成熟方案。

來源

  1. When Self-Evolution Backfires: Pre-Commit Gating against Skill Contamination in LLM Agents
  2. Terminal-Bench benchmark catalogue
  3. Terminal-Bench 2.1 task corrections