AI 程式代理
SkillForge 先用專案測試合成故障,兩款程式代理的 SWE-bench Verified 均提高逾 5 點
SkillForge 在真實工單出現前,先從測試覆蓋的執行路徑製造可驗證故障,再把修復軌跡蒸餾成專案專屬技能。搭配 Mini-SWE-Agent 後,DeepSeek-V3.2 與 GPT-5-mini 的 SWE-bench Verified Pass@1 分別升至 72.2% 與 60.6%。

程式代理進入新程式庫時,通常只能反覆搜尋檔案、執行測試,再從錯誤中臨時摸索專案慣例。SkillForge 把這項冷啟動成本前移:它先挑選已通過且覆蓋核心功能的測試,以執行追蹤找出共同實作該功能的多個程式片段;接著遮蔽原始實作,要求 LLM 只憑周邊內容重新完成程式。若改寫造成測試失敗,系統便把版本、故障輸出、參考修補與合成問題描述封裝成可執行訓練題。
Mini-SWE-Agent 會嘗試修復這些合成故障。SkillForge 再從成功與失敗軌跡抽取兩層知識:全域技能記錄模組用途、除錯順序及相關 API,以 BM25 在處理新工單前檢索;局部技能則綁定 AST 實體,當代理讀取相應檔案時即時注入修改提示及常見陷阱。這不同於把整個儲存庫摘要塞進提示,也不必等待歷史工單累積。
研究在時間隔離的 SWE-bench Verified 上合成 577 項故障,只允許代理使用早於目標修補提交的技能。DeepSeek-V3.2 的 Pass@1 由 66.4% 升至 72.2%,GPT-5-mini 由 55.0% 升至 60.6%;攤銷合成與蒸餾後,每題成本分別由 0.049 美元增至 0.074 美元、由 0.031 美元增至 0.066 美元。較困難的 SWE-bench Pro 亦分別提高 5.8 與 4.1 個百分點。
工程價值在於可為長期維護的單一大型程式庫預先建立代理知識庫。不過收益直接受測試覆蓋率限制:沒有可執行測試的舊模組不會提供足夠訊號,LLM 產生的故障描述也未必像真實開發者工單。下一步應觀察技能在程式庫快速演進後會否失效,以及離線建庫成本能否在實際工單量下有效攤銷。