返回首頁

AI coding tools / evaluation

三個 Kotlin 專案實測代理 SKILL 最佳化:GEPA 平均增益僅 4.9 個百分點且未超出雜訊

新研究用已合併 PR 反向建立任務,直接量測儲存庫 SKILL 是否令同一 coding agent 更會解題。GEPA 產生的文件平均提高 4.9 個百分點,SkillOpt 幾乎沒有增益,但樣本仍不足以排除執行間變異。

Mr. Richard Nickson · CC BY-SA 4.0 · Image source
zh-Hant

coding agent 的 `SKILL.md`、`AGENTS.md` 等儲存庫說明檔,常被當作低成本提升表現的方法;問題是文件看起來專業,不代表代理真的更會修改程式。9 月 14 日進入 arXiv 最新列表的研究提出「reverse-PR mining」:選取 Kotest、Ktor 與 Koog 已合併的 PR,把相關變更反向套用到同一個凍結基準版本,將造成測試失敗的狀態轉成待修任務。這避開直接從目前程式碼合成簡單題目時,前沿代理即使沒有說明文件也能飽和的問題。

研究者再讓 GEPA 與 SkillOpt 從 rollout 回饋反覆改寫 SKILL,並以同一代理「有文件」相對「無文件」的解題差異評分。三個 Kotlin 儲存庫中,GEPA 文件平均帶來 4.9 個百分點增益;SkillOpt 僅高出起始文件 0.1 個百分點。人工結果比數字更樂觀:Koog 維護者認為產物包含通常要實際參與專案才會知道的建置與模組知識。

真正重要的發現是評分目標很容易選錯。以文字品質、儲存庫事實數量、與原 PR 的 CodeBLEU 相似度,甚至 token 成本作目標,都可能挑出讀起來完整、卻沒有改善代理行為的文件;成本目標還可能偏好空白 SKILL。工程團隊因此應以凍結版本、可執行測試和無文件基線做成對比較,而非只由另一個模型評閱文件。

不過 4.9 點增益仍無法與單一代理的執行變異分離,實驗也只涵蓋三個 JVM/Kotlin 專案。下一步需擴大儲存庫與任務數、公開逐次軌跡,並測試文件在模型或代理框架更換後是否仍能泛化。

來源

  1. Skill Issue: Lessons from Optimizing Repository SKILLs for Coding Agents
  2. Automatically Learning Skills for Coding Agents
  3. Koog: Kotlin Framework for Building AI Agents