返回首頁

代理評測與可靠性

TRACE 從成功與失敗軌跡改寫代理 Skills,隱藏測試一致通過率升至 70%

小米團隊提出 TRACE,以成功/失敗軌跡的對比結果迭代可檢索 Skill Bank,不修改底層模型權重。它在 CAR-bench 隱藏集提高三次皆成功的比例,但平均 token、成本及延遲亦同步增加。

Public domain · Image source
zh-Hant

8 月 24 日公開的 TRACE(Trajectory-Contrastive Evolution)把代理可靠性問題從「再訓練模型」改寫成「迭代行為知識」。系統先讓代理在 CAR-bench 執行多輪任務,再按實際調用的技能把軌跡分組,對照成功與失敗案例,改寫各項工具規則、澄清策略及能力邊界,形成可檢索的 Skill Bank。部署時,Actor 會依每一輪的對話及環境狀態重新選取技能,而不是在開場一次塞入整本規則。

CAR-bench 模擬車載助理,包含 58 項互相關聯的工具及 19 條領域政策,並特別測試缺少工具時是否虛構成功,以及遇到模糊要求時是否先查詢或澄清。評分除 Pass@3——三次至少成功一次——也使用 Pass^3,要求同一題三次全部通過;後者更接近生產系統對穩定性的要求。

在作者合併訓練集與公開測試集的實驗中,GPT-5.5 的 Pass^3 由 59.9% 升至 94.5%,GLM-5.2 則由 62.8% 升至 84.8%。Skill Bank 只利用 GPT-5.5 軌跡演化,套用到 GLM-5.2 時仍有增益,顯示文字化行為規則可能跨模型轉移。改善最明顯的是消歧任務:兩個模型分別增加 55.3 與 35.7 個百分點。

較具參考價值的是 30 題、每題三次的官方隱藏集。使用相同 GPT-5.6-Sol 骨幹時,TRACE 的 Pass^3 從 50% 升至 70%,但平均每次試驗 token 由 82,179 增至 141,684,估算成本由 0.17 美元升至 0.27 美元,中位延遲亦增加 22%。此外,公開資料集同時用於技能演化與評估,94.5% 不應視為純粹的未見資料泛化結果;隱藏集樣本也偏小。下一步須在更多工具領域驗證轉移能力,並公開技能演化程式與完整軌跡,確認增益不是針對 CAR-bench 規則的人工或自動過度擬合。

來源

  1. TRACE: A Self-Evolving Skill Bank for Consistent, Limit-Aware LLM Agents
  2. TRACE project page
  3. CAR-bench reference implementation