返回首頁

代理評測

Terminal-Bench-Science 0.1 以 70 項真實科研流程測代理,最高解題率僅 30%

Stanford 主導的開放基準把資料分析、模擬、定理證明及儀器校準等科研工作封裝成可重跑的終端任務。Claude Opus 5 配合 Claude Code 居首,但三次試跑後的解題率仍只有 30%,顯示一般 coding benchmark 高分不能直接外推至科學工作。

King of Hearts · CC BY-SA 3.0 · Image source
zh-Hant

Terminal-Bench-Science 發布 0.1 版,收錄生命、物理、地球、數學及工程科學五個領域的 70 項研究流程。任務不只要求生成程式碼,還涵蓋統計推論、模擬與最佳化、逆問題、影像重建、訊號處理、感測器校準、模型擬合及科學機器學習。每項工作在隔離終端環境執行,輸出由自動測試驗證;資料集、環境、oracle 解法及版本均可透過 Harbor 重跑。

首輪榜單讓每個模型—代理組合對全部任務各執行三次。Claude Opus 5/Claude Code 以 30.0% resolution rate 居首,GPT-5.6 Sol/Codex 為 22.4%,Claude Fable 5/Claude Code 為 21.4%;最強開放模型 GLM-5.3 只有 8.1%。同時受測於一般 Terminal-Bench 的系統,在科學版上的解題率全部下降逾 10 個百分點,反映依賴專用套件、領域假設及可驗證數值結果的工作,遠比修檔案或執行常規 shell 流程困難。

基準也公開成本與 token Pareto frontier。GPT-5.6 Sol 的全套評估成本報為 4,200 美元,以不到 Claude Fable 5 三分之一的成本取得相近成績;後者則使用約 64 億 token,少於 Sol 的 84 億。這提醒研究團隊不能只比較成功率,還要同時量度試跑次數、token、沙箱費用與失敗重現性。

資料集由 920 個提案篩至 70 項正式任務,並採領域、技術及最終門檻三層審查。不過現有任務採整體通過或失敗的二元分數,即使驗證器包含多個子條件,也可能看不出「接近完成」的進展;70 項規模及三次試跑亦不足以消除抽樣變異。0.2 版應關注部分得分、環境 flakiness、捷徑與 reward hacking,以及任務公開後是否被訓練資料吸收。

來源

  1. Terminal-Bench-Science 0.1 announcement
  2. Terminal-Bench-Science repository
  3. Terminal-Bench-Science v0.1.0 release notes