AI 研究
代理自我修正研究加入外部驗證,揭示規則更新的回歸風險
研究觀察到,部分修正规則改善了原先失敗,卻破壞已成功的案例。公開實作提供重驗入口,但角色分工與論文描述有差異,成效及成本仍須按版本核對。

9 月 21 日提交 arXiv 的一項代理自我修正研究,把「是否保留新規則」交給代理外部的執行環境。作者在 AppWorld、Terminal-Bench 與 τ²-Bench 測試中發現,383 項經重播驗證而遭拒的提案,有 211 項改善了觸發修正的失敗,卻損害原本成功的案例。約 55% 的比例僅以被拒提案為分母,不能解讀成所有自我修正的失敗率。[論文](https://arxiv.org/abs/2609.24130)
論文的方法維持模型權重不變,讓新規則先取得暫時效力,再用失敗案例與受保護案例決定是否長期保留。十六組配對測試的完成分數均上升,但僅兩組的信賴區間排除零;同步監督也使執行時間增至約 1.7 至 7 倍。研究未完成「同樣規則直接保留」的對照組,因此尚不能單獨量化驗證關卡的效果。此外,研究假設代理無法竄改評分器,並未驗證對抗性繞過。[方法與限制](https://arxiv.org/html/2609.24130v1)
重現時還有實作版本需要釐清。作者所屬團隊公開的 PandaProbe Harness,目前由獨立修復代理提出候選規則;執行任務的代理只取得讀取、搜尋、列舉與查詢狀態四種唯讀工具,無權新增或淘汰規則。規則內容也不會自動插入提示,須由任務代理自行取用。這與論文描述由原代理撰寫修正的角色分工有差異,不能把目前主分支直接視為論文實驗配置。[專案說明](https://github.com/chirpz-ai/pandaprobe-harness/blob/main/README.md)
公開的執行指南固定安裝套件 0.9.0,並在每次實驗的清單記錄套件版本與有效設定。指南同時指出,規則會在整個資料集執行期間持續累積,沒有另切訓練與測試階段;任務順序由資料集及隨機種子決定,因此排序本身就是重現條件。[評測指南](https://github.com/chirpz-ai/pandaprobe-harness/blob/main/benchmarks/RUNNING.md)
對正在導入長期記憶或自動技能更新的團隊,這項研究提供一個具體測試方向:保存修正前已成功的工作案例,讓新規則接受回歸檢查。後續應核對論文使用的套件與實驗清單,再測試更多任務順序及受保護案例;除了完成率,也需分開記錄規則是否被讀取、驗證是否完成,以及額外延遲是否符合實際工作需求。