AI 評測/程式代理
Real‑SWE 以私有企業程式庫測試 coding agent,最高解題率仍只有 38.8%
新基準把稅務、計費、身分遷移等真實需求放進隔離沙箱,八組模型與代理框架的最佳 pass@1 為 38.8%。結果較接近企業開發,但程式庫、驗證器與完整軌跡未公開,外界目前無法獨立重現排名。

Specific Labs 發布 Real‑SWE,嘗試補上 SWE‑bench 類評測與企業開發之間的落差。基準目前包含十項取自或改寫自獲授權私有生產程式庫的工作,涵蓋稅率計算、API token 計量、跨區資料掃描、帳單排程及客戶身分遷移;每項工作不只要求改程式,還可能操作 PostgreSQL、MongoDB、Kubernetes、Linear MCP 或模擬雲端服務。參考解答中位數修改 11 個檔案,高於團隊統計的 FrontierCode 與 DeepSWE 中位數 6 個。
團隊將八個「模型+原生 harness」組合各跑八次,共形成 640 次 rollout。Claude Fable 5.1 配 Claude Code 的解題率最高,為 38.8%;GPT‑6 Astra 配 Codex CLI 為 33.8%,Gemini 3.8 Flash 配 Gemini CLI 為 31.2%。十題中有六題的整體解題率低於 15%,最難的串流 reducer 沒有任何模型通過。失敗不只來自寫錯語法:分類結果顯示,漏掉需求、未驗證系統假設,以及把正確概念接錯既有元件,都是主要故障型態。短時間執行也不是可靠替代指標;不足十分鐘的 rollout 仍有 71.4% 失敗。
這項工作的重要性在於,它明確評的是模型與工具框架的組合,而不是假裝把能力完全歸因於模型。對工程團隊而言,更實際的做法可能是從自身 Git 歷史抽取任務,以固定 commit、沙箱和隱藏測試建立內部回歸集。
但 Real‑SWE 現階段仍是封閉基準:完整私有程式碼、測試與軌跡不能公開,外界無法檢查資料污染、提示公平性或評分器。Hacker News 討論亦指出,把私有程式庫交給雲端模型供應商會產生資料治理問題。這些數字適合視為企業工作負載的初步壓力測試,不宜直接當成模型的通用排行榜。