返回首頁

代理評測

GDPevo 以規則重組測試代理自我演化,完整提示仍領先自主學習逾 30 點

GDPevo 將企業流程拆成原子規則,再於保留測試題重新組合,以判斷代理能否從先前任務累積可轉移策略。公開結果顯示自主演化確有增益,但距離取得完整規則的 91.6% 上限仍遠。

Original uploader was Tomruen at en.wikipedia · Attribution · Image source
zh-Hant

代理「自我演化」常以累積記憶、技能文件或修改工作流程實作,但測試成績上升未必代表真正學會新規則,也可能只是重遇相似題目。8 月 4 日公開的 GDPevo 嘗試縮小這項歸因問題:研究團隊把 CRM、ERP、財務、醫療、法律、資料分析及工程維運流程拆成原子商業規則,將部分規則分散到五個訓練任務,再把它們重新組合成五個保留測試任務。如此一來,測試題不直接重複訓練題,卻仍要求代理轉移先前取得的流程知識。

目前儲存庫已放出 24 組、共 240 個任務,以及資料建構、規則評分器和逐次實驗報告。團隊比較不演化、只看訓練輸入、自學、取得標準答案的 few-shot,以及接受三輪評審回饋後整理工作流程等模式。以 Claude Code 搭配 Opus 4.8 為例,基線準確率為 49.11%,自學升至 57.37%,三輪反思達 62.72%;直接提供範例答案則達 70.90%。不同模型與執行框架的自主演化增益並不一致,顯示「模型能力」與記憶、工具及提示組成的 harness 難以分開衡量。

技術價值在於資料管線可快速產生新任務組,作者稱兩天內能把 V1 的 120 題擴至 240 題,讓評測方以輪替題目降低污染風險。工程團隊仍不應把它當成企業部署成功率:題目由自動管線生成、評分多依規則,尚未涵蓋真實組織中的權限、模糊需求與長期狀態漂移。下一步應觀察其他團隊能否重建結果,以及代理累積的策略在跨組、跨產業和版本更新後是否仍有效。

來源

  1. GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks
  2. GDPevo benchmark repository