返回首頁

代理框架與評測

IBM 以單條軌跡找出代理不穩定步驟,ALTK‑Evolve 將診斷轉成可重用指南

IBM Research 為 ALTK‑Evolve 加入 Consistency Analyzer,利用受控重採樣定位同一代理多次執行時容易改變的決策。AppWorld 實驗把 GPT‑4.1 代理的五次全數成功率由 53% 提至 69%,但證據仍集中於單一代理架構與模擬環境。

Simon Greig · CC BY 2.0 · Image source
zh-Hant

IBM Research 更新開源的 ALTK‑Evolve,試圖處理平均成功率掩蓋的代理「一致性缺口」。團隊在 AppWorld 的 168 項 `test_normal` 任務上,讓 GPT‑4.1 驅動的 ReAct 代理各執行五次:逐次平均成功率 Mean@5 為 77.4%,但五次全部成功的 Pass^5 僅 53.0%。對生產系統而言,前者描述一次請求的期望表現,後者更接近重複執行同一財務、合約或 API 流程時能否穩定交付。

新增的 Consistency Analyzer 不必再次操作外部環境,也不需要模型 logits 或正確答案。它取得一條既有軌跡後,在每個推理步驟重播當時的上下文,要求模型產生多個候選回應,再以工具名稱與參數等結構的相似度找出「容易翻轉」的決策。離線 Guideline Generator 隨後把這些位置改寫成自然語言規則,例如先確認搜尋結果是否唯一,或以行首正規表示式計算核取項目;規則經儲存、合併與檢索後,在相似任務的推論階段注入提示,不修改模型權重。

IBM 公布的 GPT‑4.1 結果顯示,Pass^5 由 53.0% 升至 69.0%,Mean@5 同時由 77.4% 升至 81.0%,一致性缺口由 24.4 降至 12.0 個百分點。從一個任務變體生成的指南套用到同情境的其他變體時,Pass^5 仍增加 13 個百分點;較弱的 gpt‑oss‑120b 也有改善。這表示工程團隊除了 `Pass@k` 或平均準確率,應另報告要求每次都成功的 `Pass^k`。

限制在於指南由同一模型參考自身軌跡產生,可能固化錯誤策略;相似任務的困難組亦出現輕微平均準確率下降。論文只量測 ReAct、兩個模型及 AppWorld,尚未證明結果能延伸到瀏覽器、寫碼代理或不可重播的真實交易。實務上還須觀察重採樣成本、指南衝突、記憶污染,以及模型或工具版本改變後是否需要重新診斷。

來源

  1. Your Agent Aced the Task. Will It Do It Again?
  2. Closing the Consistency Gap: Self-Evolving Agents That Learn to Stay on Course
  3. ALTK-Evolve: Self improving agents through iterations