返回首頁

AI 評測

254 次提交稽核顯示,SWE-bench Verified 前段名次已難以統計區分

新研究分析 SWE-bench 四個分割的逐題結果,發現 Verified 前 30 名的相鄰系統沒有一組能通過配對顯著性檢定。模型與代理 scaffold 的交互作用也足以超過榜首間距,工程採購不宜再把小數點差距當成穩定排名。

Dave O · CC BY-SA 2.0 · Image source
zh-Hant

一篇 9 月 15 日公開、已獲 ADMA 2026 接受的研究,重新分析 SWE-bench 四個公開分割、共 254 次提交的逐題判定,而非重新執行模型。結論不是 coding agent 已經「能力相同」,而是現有榜單對前段系統的解析度不足,不能可靠支持常見的嚴格名次解讀。[論文](https://arxiv.org/abs/2609.17394)

在包含 500 個人工確認可解問題的 [SWE-bench Verified](https://www.swebench.com/) 中,領先的兩個提交都解出 396 題。前十名共同解出 285 題、共同失敗 51 題,實際能區分它們的只剩 164 題;解題集合的中位巢狀係數為 0.935,高於依總分推算的 0.774,表示較強系統多半只是涵蓋較弱系統已能解的題,而非展現大量互補能力。

作者以配對 McNemar 檢定比較 Verified 前 30 名的 29 組相鄰提交,在 α=0.05 下沒有任何一組可被區分;較大的 2,294 題 Test 分割則能區分 23 組中的 14 組。單純刪掉所有領先系統都答對或答錯的題也沒有解決問題:將前 30 名重算於 209 個非退化題目後,可見分差由 8.8 擴至 18.7 個百分點,卻仍沒有相鄰配對達顯著差異。

另一個警訊是榜分屬於「模型加 scaffold」而非模型本身。同一模型搭配不同代理框架的觀察範圍最高達 29.8 個百分點,遠大於前 30 名的總分跨度;不過這是由公開中繼資料重建的觀察研究,不能證明 scaffold 是差異的因果來源。

研究建議榜單公開結構化的模型、scaffold、版本、嘗試次數與 harness 修改資料,並以描述性分層取代過度精確的排序。對工程團隊而言,下一步應測試實際準備部署的模型—代理組合,追蹤成本、穩定性與候選系統真正意見不同的題目,而不是依 0.2 或 0.4 個百分點決定採購。

來源

  1. Coding Agents Have Converged: Why the SWE-bench Leaderboard Can No Longer Order Its Top Entries, and What to Measure Instead
  2. SWE-bench Official Leaderboards