返回首頁

AI 代理研究

PILOT 讓監督代理在任務途中改道,並把執行經驗即時寫回持久技能

PILOT 以雙向通道連接監督者與工作代理,允許前者在長任務尚未結束時提供指示或中止錯誤路徑。作者在三項代理基準報告準確率與 token 效率提升,但「自我改進」只更新 harness、技能與記憶,沒有修改模型參數。

Łukasz Golowanow, Maciej Hypś, Konflikty.pl · Attribution · Image source
zh-Hant

香港理工大學等研究者提出 PILOT,把常見的事後反思改成任務執行中的閉環監督。系統由獨立 supervisor 與 worker 組成:worker 保留工具輸出、試錯過程及實作細節;supervisor 維持較乾淨的目標視角,接收進度通知、問題、完成結果、執行錯誤與閒置警報。它可在 worker 下一輪前插入 steering 指令,也能直接 abort 已無繼續價值的分支。

另一個機制是 live self-evolution。監督者若在軌跡中辨識出可重用程序、專案慣例或反覆出現的失敗模式,可立即寫入持久技能庫或記憶;之後於同一任務或未來任務啟動的 worker 會載入更新後的 harness。這裡的「自我改進」因此是上下文與執行框架演化,模型權重全程凍結,與線上微調或遞迴訓練不同。

研究以 GLM-5.1 與 Kimi-K2.6 分別同時扮演兩種角色,測試 Terminal-Bench 2.0、SWE-bench Multilingual 與 SWE-bench Pro。PILOT 在六種模型—基準組合中有五種排名第一;Terminal-Bench 2.0 兩模型平均通過率為 71.6%,比最強單代理平均基線高 5.3 個百分點。跨迭代自我改進設定中,作者報告兩模型分別增加 14.6 與 12.4 點,平均輸出 token 減少 42.9% 與 47.4%。人工分析亦顯示監督介入集中於困難任務,簡單任務的成功軌跡沒有依賴 steering。

不過,雙代理會引入額外延遲與推論成本,論文只測兩個開放權重模型及三項 coding/terminal 基準;同模型監督同模型也未回答「昂貴監督者搭配便宜 worker」是否划算。公開論文目前亦未提供完整可重跑實作,因此工程團隊下一步應關注成本拆分、錯誤監督造成的負遷移,以及持久技能遭污染後的回滾與稽核機制。

來源

  1. PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents
  2. PILOT in the Loop paper discussion
  3. PILOT technical analysis