AI 研究
RRSI 為代理自我改寫加入搜尋約束,測試顯示跨基準增益
研究限制修改規模,並以評測波動與推論成本篩選代理框架的變更。公開實作提供重驗入口,但節省 token 的幅度取決於比較基準。

Google Cloud AI Research 等團隊於 9 月 21 日發表 RRSI,研究如何讓代理持續改寫提示、工具與控制流程,同時減少對固定測試題的過度擬合。方法保持底層模型權重凍結,把約束加在產生及挑選修改的流程,並公開研究程式。[論文](https://arxiv.org/abs/2609.24972)
它先限制單次提案能綁入多少項修改,隨演化推進縮小變動範圍,讓改善較容易歸因。提案者會讀取歷次假設與結果,停滯時轉向尚未探索的元件;評選端則先篩除題名、答案等基準特定邏輯,再用評測波動與 token 成本限制候選方案,並標記失去效益的元件供刪除。[方法說明](https://regularized-rsi.com/)
公開實作把每個候選框架放入獨立 Git worktree,保留修改差異、分數、成本及採納結果。終端程式開發、文件工作與工程設計各有接入模組和起始框架。這讓外部團隊能追查某項工具或記憶設計為何留下,也能在自己的任務上重跑選擇流程。[程式庫](https://github.com/google-research/rrsi)
研究的主要實驗使用 Claude Opus 4.8。程式代理在用於演化的 Terminal-Bench 2.1,分數由 74.2 升至 80.2;把同一框架直接移到未參與挑選的 SWE-bench Verified,則由 82.0 升至 83.8。兩者差距提醒讀者,演化用測試集上的進步不能直接當成泛化幅度。[公開結果](https://github.com/google-research/rrsi)
成本也要看比較基準。工作任務消融實驗中,RRSI 每次試驗使用約 242 萬個策略模型 token,低於無約束演化的 380 萬,但仍高於原始框架的 156 萬。依表二計算,前者約減少 36%;摘要寫約 30%,本文採表列數字,不把它外推成整套研發流程的省費比例。[消融表](https://arxiv.org/html/2609.24972v1)
工程意義在於把自動修改納入可稽核的實驗流程,並分開觀察挑選用資料、保留測試與推論成本。結果目前來自作者評測,部分工作任務也仰賴模型評分;固定任務集、搜尋預算及門檻設定仍會影響結果。接下來應驗證跨工具環境的重現性,並將提案、審查和反覆評測的成本一併計入。