返回首頁

AI 程式代理/評測

語義不變改寫令程式代理成本最高增 22.9%,穩健排名隨框架翻轉

研究把控制流程、識別字及無效程式碼改寫套用至相同修復題,最高令解題率下降 6.7 個百分點。模型的穩健程度會隨 mini-SWE agent、OpenCode 與資料集互換,單一模型排行榜無法預測部署表現。

Ansgar Koreng · CC BY 3.0 de · Image source
zh-Hant

程式代理即使面對功能完全相同的程式庫,也可能因表面寫法不同而改變成功率及 token 成本。新研究建立隨機變體取樣器,對 Python 專案施加控制流程等價改寫、識別字重新命名及無效程式碼插入等 14 類語義保持轉換,再要求代理修復原本相同的 issue。變體仍須通過基礎測試,代理提交的 patch 則同時接受 FAIL_TO_PASS 與 PASS_TO_PASS 測試。

研究從 SWE-bench Verified 選取 28 題、SWE-bench Pro 選取 26 題,測試 mini-SWE agent 與 OpenCode,並分別搭配 Claude Opus 4.5、Kimi K2.5、MiniMax M2.5 及 Qwen 3.6-27B。每個題目在原始版本重跑 20 次,另產生 20 個各跑一次的變體;轉換觸及的程式碼行中位數為 6.9% 至 7.7%。這種配置刻意把模型本身的隨機性與程式變體差異分開。[論文](https://arxiv.org/abs/2608.18389)及[完整實驗程式](https://github.com/CSU-TrustLab/jagged-frontier)均已公開。

16 組「框架、模型、資料集」配置中,有 13 組解題率下降,六組的 95% 區間排除零;最大平均降幅是 mini-SWE agent 搭配 Opus 在 SWE-bench Pro 的 6.7 個百分點。不過穩健排名沒有固定贏家:Qwen 在 mini-SWE agent/Verified 僅下降 0.2 點,換成 OpenCode 卻下降 5.5 點,成為同組最脆弱模型。相反方向的翻轉亦出現在 MiniMax 與 Kimi。

成功完成的執行同樣付出額外代價。在 Verified 上,八組配置的 token 成本全部上升,幅度介乎 4.0% 至 22.9%;輸入 token/步在 16 組中有 13 組增加,表示代理不只是多走幾步,而是每一步閱讀更多上下文。這提醒採購或部署團隊,原始解題率只能量度能力,不能代表對真實程式風格的穩健性。

限制是研究只抽取 54 題,且未搜尋轉換器超參數;固定題集的 bootstrap 區間亦不能代表整個 SWE-bench 母體。下一步應跨語言、不同重構工具及實際企業程式庫重跑,並把成功率、輸入成本與框架版本一併列入持續整合評測。

來源

  1. A Jagged Frontier: Evaluating Robustness of Code Agents to Semantics-Preserving Transformations
  2. CSU-TrustLab/jagged-frontier