AI coding agents
CodeGrep 將程式庫搜尋拆成 14B 專用代理,修復成功案例少用 19% token
CodeGrep 先以平行 grep、glob 與檔案讀取縮小修改範圍,再把候選檔案交給凍結的 OpenHands 程式代理。它在 SWE-bench Verified 維持約 27% 修復率並降低推理成本,但模型與訓練管線尚未公開。

程式代理的成本不只來自產生修補程式,也來自找出該修改哪些檔案。新研究分析 OpenHands 30B 在 SWE-bench Verified 的軌跡:每個成功案例平均經過 23 輪、消耗 63.1 萬 token,其中大量呼叫用於 grep、glob 與檔案閱讀。研究團隊因此把探索階段抽成 CodeGrep——一個以 GRPO 端到端訓練的 14B 檢索代理。它可在多輪中平行操作搜尋工具,最後只把候選檔案交給固定不變的下游程式代理。
團隊從 6.7 萬條開源代理軌跡挖掘監督訊號,並建立以 Git worktree 隔離任務的強化學習環境。在 SWE-bench Verified 全部 500 題上,CodeGrep 的修復率為 27.0%,未使用獨立檢索器的基線為 25.8%;只看成功修復的案例,互動輪數減少 15%,token 減少 19%。這裡較重要的發現不是 1.2 個百分點差距,而是檢索精度可能存在效益門檻:BM25 的檔案精度為 0.375,反而拖累下游代理;Jina 達 0.445 時大致持平;CodeGrep 達 0.677 後才穩定節省 rollout 成本。
這為 coding-agent 架構提供一個具體拆分點:通用模型不必在每次修復中重新學習程式庫導覽,搜尋策略可以成為獨立、可訓練及可替換的元件。不過結果目前只來自作者設定的單一 30B OpenHands 下游代理,而且成本統計集中於成功案例;論文承諾釋出模型、訓練流程與評測工具,但截至發布時仍未提供下載。下一步應觀察這個精度門檻能否跨模型、語言及大型 monorepo 重現,以及檢索器本身的推論成本是否抵銷節省的 token。