返回首頁

代理評測

FinEvo-Bench 以 120 項金融任務測代理跨任務演化,Codex 配對增益 19.37 分

FinEvo-Bench 將相關但不同的金融案例交錯排列,檢查代理能否把先前回饋轉成後續可重用的記憶或技能。四種代理外殼均優於每題重設狀態的對照組,但結果只使用同一款模型骨幹。

Palauenc05 · CC BY-SA 4.0 · Image source
zh-Hant

新發布的 [FinEvo-Bench](https://arxiv.org/abs/2608.06144) 試圖把「代理會從工作經驗成長」變成可量測命題。資料集包含六個金融領域、20 種業務情境與 120 項多檔案任務,共提供 775 份輸入文件;每個情境有六個遵循相同專業流程、但事實與結論不同的案例。研究者將全部任務隨機交錯成三條序列,使相關案例之間夾入其他工作,再比較保留經驗與每題清空狀態的代理。

四種外殼均採 Qwen3.7-Max、零溫度及相同任務順序,差異在於經驗載體:Claude Code 與 Codex 可寫入技能及記憶,Letta 使用會持續注入上下文的可編輯記憶區塊,GenericAgent 則保存 Markdown 經驗檔。這也符合 [Letta 官方文件](https://docs.letta.com/v1-sdk/concepts/stateful-agents)所描述的持久狀態設計。相對於配對對照組,四種系統平均提高 9.33 至 19.37 分,每題合規問題減少 0.12 至 0.44 個;Letta 的最終分數最高,達 91.65,Codex 的增益最大,為 19.37 分。

載體消融更值得工程團隊注意:Claude Code 只演化技能時取得 93.71 分及每題 0.05 個合規問題,優於只用記憶或兩者並用。針對缺漏與違規項目的 rubric 回饋,也比提供完整參考答案高出 3.95 至 7.93 分,暗示可重用的程序與檢查規則,比保存個案答案更容易遷移。

不過,評分仍由 Claude Opus 4.6 代理執行;雖然它與一名金融專家的絕對一致性 ICC 達 0.95,驗證只涵蓋一批 120 份輸出。全部實驗也僅使用一款骨幹、金融領域及非參數式更新,不能據此判定哪種代理架構在其他模型或專業工作中最佳。下一步應觀察跨模型重跑、公開資料與評測程式,以及長期累積後是否出現錯誤經驗污染。

來源

  1. FinEvo-Bench: A Longitudinal Benchmark for Self-Evolving Agents in Professional Financial Workflows
  2. Introduction to Stateful Agents