AI 編程與評測
SWE-Bench ProMax 將重構測試擴至七種語言,最佳代理仍只解出 41.2%
SWE-Bench ProMax 從 29,782 個候選提交篩出 170 項跨檔案重構任務,並由專家重寫需求及檢查測試。GPT‑5.2 配合 OpenHands 的解題率最高,但軌跡顯示代理常漏改周邊呼叫點、設定與測試檔案。

8 月 10 日公開的 SWE-Bench ProMax,把程式代理評測焦點由局部除錯轉向必須維持行為一致的大型重構。資料集涵蓋 Python、Java、TypeScript、Go、C、C++ 與 Rust,共 170 題、70 個儲存庫;每題附基準提交、參考修補、測試修補、評測腳本及容器映像資訊,可直接載入 Hugging Face 資料集。
建構流程先從 29,782 個真實提交自動收集候選,再驗證環境,最後由專家重寫問題敘述並人工檢查測試。這一步意在避免兩類常見缺陷:測試過窄、把功能正確但實作不同的修補判錯;以及測試過廣、檢查題目未要求的行為。論文表格顯示每題平均修改 15.9 個檔案,其中 11.4 個是非測試檔案,程式變更量平均 261.6 行。
六款模型分別在 mini-swe-agent 與 OpenHands 外殼執行。OpenHands 下 GPT‑5.2 以 41.2% 居首;Claude Sonnet 4.6 為 38.8%,GLM‑5 與 Qwen3.5 均為 36.5%。同一模型也會因外殼而大幅波動:GPT‑5.2 從 mini-swe-agent 的 21.8% 升至 OpenHands 的 41.2%,說明工具、上下文管理及執行迴圈仍是評測結果的重要變項。
失敗軌跡通常讀取及重試更多輪,實際修改的檔案卻少於參考修補。代理往往改對核心介面,卻沒有把變更傳播至周邊呼叫點、文件、設定與測試 fixture。工程團隊可利用這套資料測量跨檔案計畫與依賴追蹤,但不宜把 41.2% 當成純模型能力:樣本僅 170 題,參考修補與測試也已公開,後續仍須監測污染及重跑可重現性。