AI 程式代理與評測
SWE-bench Science 收錄 20 個科學領域,最佳程式代理 119 題僅解出 47.90%
SWE-bench Science 用 98 個真實科學程式庫測試單位、座標系、數值不變量及檔案格式等隱性契約。Claude Code 搭配 Opus 5 暫居首位,但 pass@1 仍未過半,且工程整合題只有 27.78%。

OpenMOSS 團隊發布 [SWE-bench Science](https://arxiv.org/abs/2608.19799),把程式代理評測擴展到科學軟體。這類程式的正確性不只取決於測試能否通過,還涉及物理單位、座標系、數值不變量、資料格式語意與模擬假設;表面合理的修補可能正常編譯,卻悄悄改變研究結果。
基準包含 119 項任務、98 個 GitHub 程式庫及 20 個科學領域,分成由既有 issue 驅動、專家探索,以及跨模組工程整合三類。[公開工具庫](https://github.com/OpenMOSS/SWE-bench-Science)為每題提供以 digest 鎖定的環境映像與獨立 verifier 映像。代理在前者修改程式,評估器再把 patch 套到乾淨基線、重新建置並執行保留測試;harness 則由 Pier 在執行時安裝,可切換 Codex、Claude Code 或 mini-swe-agent,避免把特定代理綁進映像。
截至 8 月 16 日的[排行榜](https://swescience.github.io/)中,Claude Code 搭配 Claude Opus 5(max)以 47.90% pass@1 居首,Codex 搭配 GPT-5.6-sol 為 46.22%。前者在專家探索題取得 65.31%,但 issue 題及工程整合題分別只有 38.46%與 27.78%;後者的工程整合題則為 38.89%。論文歸納的失敗包括缺乏領域抽象、探索方向錯誤、只修表層症狀,以及未涵蓋所有相依模組。移除題目中的科學提示後,結果也顯示領域知識不是愈多愈好:對齊良好的資訊能縮小搜尋空間,錯置提示卻會造成錨定。
重現門檻仍不低。23 題因上游授權限制須明確 opt-in,預設只跑 96 題;映像固定為 linux/amd64,Apple Silicon 需模擬。私有 verifier 測試與標準答案 patch 不公開,雖可降低污染,亦限制外部審核。工程團隊接下來應關注不同 harness、token 預算與領域檢索方法能否在同一鎖定映像上獨立重現提升。