AI 研究
SWE-Serve 加入實際服務測試,揭示程式代理修補的驗證落差
新基準以 53 項 SGLang 任務評測程式代理,發現部分通過其他檢查的修補仍無法正常提供模型服務。結果限於特定測試環境,通過基準也不代表程式已可上線。

NVIDIA 與加州大學柏克萊分校研究者於 9 月 22 日公開 SWE-Serve 論文,翌日發布技術說明。基準將 SGLang 的 83 個已合併拉取請求整理成 53 項任務,涵蓋模型接入、解碼、快取、排程與服務 API,讓程式代理在既有程式庫中完成跨元件修改。[官方公告](https://developer.nvidia.com/blog/how-swe-serve-exposes-the-gap-between-local-tests-and-live-serving/)
核心結果來自 19 項會啟動真實模型服務的任務。研究固定同一批 627 份代理修補,只改變計分時是否納入端到端測試:完整驗證通過率為 45.9%,移除服務測試後升至 69.4%。換言之,通過其他檢查的修補中,約三分之一仍無法通過實際服務驗證;這是測試範圍造成的分數差異,不能解讀為模型能力提升。[論文](https://arxiv.org/html/2609.26777v1)
每題先確認未修改版本無法通過新增功能測試、卻能通過回歸測試,再要求參考修補通過全部檢查。代理產出的程式依執行行為評分,無須與參考解法相同。這讓模型載入、公開介面回應,以及跨請求狀態等問題有機會被檢出,而非只檢查局部函式。[評測方法](https://research.nvidia.com/benchmarks/swe-serve)
研究以 mini-SWE-agent 測量 11 個模型、31 組模型與推理設定,每組完整執行三次,單次任務上限為 210 分鐘及 350 步。執行時限制公開網路與上游程式庫存取,保留取得模型權重的必要通道。最高平均單次通過率約 75%,仍只代表這套任務與代理框架下的結果。[實驗設定](https://arxiv.org/html/2609.26777v1)
重現者須注意,公開執行器要明確加入 `--closed-book` 才符合榜單的網路限制;省略後屬開卷測試,不能混為同一條件。專案也要求固定發布標籤,因不同標籤的任務與驗證器可能不同。[執行說明](https://github.com/NVIDIA/swe-serve)
工程上的啟示是把真實權重載入、請求路徑與回歸行為納入代理驗收。不過,目前僅涵蓋 SGLang、CPU 或單張 H100,未驗證多卡、多節點部署;通過基準也不等於修補已達可合併或上線標準。後續應觀察其他推論引擎的重現,以及驗證器修訂後結果是否穩定。研究者也應區分測試覆蓋不足與代理實作錯誤,避免把所有失敗都歸因於模型能力。[範圍限制](https://developer.nvidia.com/blog/how-swe-serve-exposes-the-gap-between-local-tests-and-live-serving/)