返回首頁

AI 評測

CentaurBench:最會獨立解題的模型,未必最會指導另一個代理

CentaurBench 以七類工作任務分開評估模型的自動化與輔助能力,兩種排名的相關係數僅約 0.48。無輔助的 GPT-3.5-Turbo 在三項任務勝過所有受指導版本,顯示加入強模型不必然改善代理流程。

VIA Gallery from Hsintien, Taiwan · CC BY 2.0 · Image source
zh-Hant

CentaurBench 把常被混為一談的兩種能力拆開測量:在「自動化」模式中,候選模型直接交付完整成果;在「輔助」模式中,它只能向固定的 GPT-3.5-Turbo 執行者提供需求檢查、執行計畫與自我審查清單,不得代寫最終答案。七項任務涵蓋旅遊與膳食規劃、天然氣市場分析、作業研究、報稅檢查、輔導回應及教學設計。

研究測試十款模型,針對每個任務及模式進行十次獨立執行。輸出交由四款 LLM 以任務專屬 rubric 作匿名兩兩比較;為減少同家族偏好,評審不得判定自身模型家族的答案。整體自動化與輔助排名相關係數只有約 0.48,且各任務由旅遊規劃的 -0.04 到報稅的 0.85 不等。Claude Opus 4.8 在市場分析的直接作答平均排名為 2.05,改任指導者後卻跌至 8.15;自動化冠軍更在七項輔助任務中的五項落敗。

更值得注意的是,沒有指導的 GPT-3.5-Turbo 在三項任務勝過所有受輔助版本,平均排名亦僅次於 GPT-5-mini。這表示過度複雜、未配合執行者能力的計畫,可能增加認知及上下文負擔,而不是提供有效分工。工程團隊若以「最強模型帶小模型」降低成本,不能直接沿用一般能力榜;應固定執行模型、工具與交付格式,另外量測指導產生的邊際增益。

結果仍不能直接外推至人機協作。實驗只有單輪文字指導、七個任務及單一 GPT-3.5-Turbo 執行者,且主要排名依賴 LLM 評審;多評審對同一勝者的一致率也只有 71.0%,輔助模式更降至 67.8%。下一步應加入真人工作者、反覆澄清與工具操作,並測試較豐富的輔助形式是否會改變排名。

來源

  1. CentaurBench paper
  2. CentaurBench reproducibility code
  3. CentaurBench interactive results dashboard