程式代理評測
SWE-Gate 為程式代理加入審查約束測試,三分之一綠燈修補仍不合要求
SWE-Gate 將真實 pull request 審查意見轉成可執行的第二套測試,分開衡量功能修復與工程約束。四款模型產生的 644 個功能測試合格修補中,仍有 221 個違反已明示的審查要求。

新基準 SWE-Gate 指出,程式代理讓既有測試全部轉綠,仍不足以代表修補可以合併。研究團隊從真實 pull request 的審查留言抽取可客觀驗證的要求,例如維持既有例外語意、保留參數順序、確保冪等性、避免破壞公開 schema,並把它們轉移至 75 個開源 Python 儲存庫,建立 303 個修復案例。每個案例分別提供功能測試與約束測試,另附一個「功能正確但不合規」修補及同時通過兩者的 gold patch,以確認兩項要求確實可分離且能共同滿足。
研究以同一套 Mini-SWE-Agent、最多 100 個互動步驟,測試 GPT-5.5、GPT-5.4-mini、DeepSeek-V4-Flash 與 GPT-4o-mini。即使代理在提示中已看見自然語言約束,四款模型合計仍有 644 個修補通過功能測試,其中 221 個、即 34.3%,未通過約束測試。最強的 GPT-5.5 功能成功率為 74.9%,但聯合成功率只有 52.8%;其功能合格修補仍有 29.5% 是隱藏失敗。公開約束可把各模型的約束遵循率提高 10.2 至 25.6 個百分點,卻也使功能成功率下降 0.7 至 9.9 點,顯示代理在有限步驟內可能為滿足額外規則而犧牲原始修復。
這項工作對 CI 的直接含義,是不要把單一測試套件當成代理修補的充分驗收器。團隊可將相容性、例外型別、資源釋放與重入行為寫成獨立 merge gates,並分開追蹤功能成功率和聯合成功率。限制則是案例由 LLM 輔助合成、只涵蓋 Python,模型也只各執行一次;結果揭露的是此基準下的落差,不能直接推算所有真實 PR 的拒絕率。