代理評測
FM-Bench 讓代理經營球會 20 年,15 款模型皆未能從被拒報價推斷市場價格
FM-Bench 以 26 種工具及約 340 至 400 個決策點,測試代理能否承受延遲回報、隱藏資訊與競爭者反應。15 款模型均完成 20 年賽程,但排名到後期才穩定,自主管理記憶亦出現只增不刪或反覆覆寫兩種失敗模式。

新公開的 FM-Bench 把語言模型代理放進一個可重播的足球球會模擬器,而非逐題獨立的問答環境。代理須在 20 個遊戲年度內透過 26 種工具選秀、買賣球員、談判合約、投資設施與青訓、安排陣容及回應董事會;完整流程約包含 340 至 400 個決策點。所有對手共用預算,球員真實能力被帶有固定偏差的球探區間遮蔽,市場也會因代理行動而調整。
評測分為 Solo 與 Arena。Solo 讓一款模型對抗 15 個固定腳本,Arena 則把 15 款模型與一個腳本基準放進同一世界。引擎採確定性模擬,同一亂數種子與動作日誌可逐位元重播;分數由榮譽、球會淨值增量及陣容價值組成,毋須 LLM 裁判。論文報告三個種子下,15 款模型都能完成全部賽季,腳本基準則多數提早破產或被解僱,但冠軍曾在十款模型間輪替,價格、供應商與 token 支出均不能可靠預測排名。
軌跡揭示的瓶頸比總分更值得注意。高分代理較早續約、減少閒置現金,也會在賽季末停止回收期過長的投資;然而沒有模型能從數百次遭拒報價中推斷市場隱藏價格。代理自建記憶亦走向兩個極端:檔案無限累積,或每季重寫計畫而失去持續性。
工程上,FM-Bench 提供可稽核的長流程壓力測試,適合研究記憶壓縮、狀態估計與長期信用分配。不過公開倉庫只完整提供 Solo;官方 Arena、隱藏種子及正式軌跡由作者代管。專案仍標示為 research preview,計分版本及校準尚可能改變,現有名次不宜直接視為通用代理能力排行榜。