返回首頁

代理評測

SWE-bench Science 公開 119 項科學程式修復題,最佳代理完整通過率仍低於五成

新基準以私有科學測試檢查單位、數值不變量、檔案語義與跨模組資料流,而不只判斷程式能否編譯。Claude Code 搭配 Opus 5 的整體 pass@1 為 47.90%,實驗也顯示加入領域知識有時反而令代理錨定錯誤方向。

Lothar Spurzem · CC BY-SA 2.0 de · Image source
zh-Hant

SWE-bench Science 將程式代理評測延伸至科學軟體:119 項任務取自 98 個 GitHub 專案,涵蓋 20 個領域,並分為既有 issue 修復、專家探索及跨模組工程整合三類。題目涉及單位轉換、座標系、數值不變量、光譜與模擬語義等契約;局部修改即使令公開測試通過,只要在未公開的科學案例破壞等價表示、邊界條件或資料流,pass@1 仍計為失敗。

釋出架構把每題的環境與驗證器製成按 digest 固定的獨立 Docker 映像,代理只看基線程式、問題描述及公開診斷,參考修補與私有測試不會進入工作區。執行器可在測試時選擇 Codex、Claude Code 或其他 Pier 支援的 harness,並記錄模型設定、映像版本、選題雜湊與測試輸出。公開資料預設提供 96 題;另有 23 題因上游授權條件,必須明確開啟才能物化。

八組模型與 harness 中,Claude Code/Opus 5 的整體 pass@1 最高,為 47.90%;Codex/GPT-5.6 Sol 的私有測試平均分最高,達 78.82%,但完整通過率為 46.22%。失敗主要落在科學抽象錯誤、只修表面症狀、跨模組覆蓋不足,以及無法把原理泛化至未見案例。91 題配對實驗更顯示,提供科學說明令 DeepSeek-V4-Flash 的 pass@1 上升,卻令 GPT-5.6 Sol 從 36.26% 降至 31.87%。這說明 RAG 加入更多論文或專家文字並不保證改善修復;資訊能否與可執行證據對齊,可能比知識量更重要。

來源

  1. SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?
  2. SWE-bench Science repository and evaluation tooling
  3. SWE-bench Science dataset