返回首頁

AI 評測

動態預測榜揭露專用代理優勢:前沿通用模型未壟斷 ForecastBench

ForecastBench 7 月 27 日更新的初步榜單顯示,前三名全由 Torchcast AI 專用代理取得,最高 Brier Index 為 65.6。GPT-5.5 搜尋代理與超級預測者中位數落在相近區間,但題目數、提交時間及置信區間差異限制了直接排名解讀。

U.S. Air Force photo by Airman Hannah Bench · Public domain · Image source
zh-Hant

ForecastBench 最新初步榜單提供一個不同於知識或程式測驗的訊號:截至 7 月 27 日,Torchcast AI 的 `rice-demon`、`captain-jack` 與 `dragon-brother` 分居前三,Brier Index 分別為 65.6、65.3 與 65.2;Google DeepMind、Voicetree、GPT-5.5 搜尋代理及 FutureSearch 系統則形成後續梯隊。這項結果不代表小型團隊已在一般智能上超越前沿模型,而是說明搜尋、機率校準、問題分解與集成策略,可能比單一基礎模型名稱更能決定預測品質。

這套基準每兩週要求系統預測尚未揭曉的真實事件,因此答案在提交時不存在,較不容易被訓練資料污染。原始 Brier score 會依題目難度調整,再轉換為 0 至 100 的 Brier Index;50 代表完全無資訊的預測,數值愈高愈好。FutureSearch 同步整理的 preliminary leaderboard 涵蓋 304 個提交,其中 GPT-5.5 高推理加網路搜尋取得 63.8,但只完成 242 題;前三名各有 479 題。超級預測者中位數為 63.7,卻來自不同時期的 521 題,不能視為嚴格同場對照。

工程上值得注意的是,ForecastBench 的正式榜單會延後納入提交,以增加穩定性;目前畫面明確標示為 preliminary。各系統的置信區間亦大量重疊,零點幾分差距未必具統計意義。後續應觀察專用代理能否在更多輪次維持領先,以及公開搜尋紀錄、提示、集成方法與成本,否則榜單只能證明整套系統有效,無法定位增益究竟來自模型、資料來源或後處理。

來源

  1. FutureSearch Evals
  2. ForecastBench Leaderboards
  3. ForecastBench project overview