返回首頁

代理系統/自動化研究

Dream‑RSI 把代理搜尋歷史變成重播模擬器,離線改寫探索策略

Google 等研究團隊讓固定的程式代理反覆改寫搜尋排程,而非更新模型權重。八項演算法、數學與 GPU 核心任務顯示可減少探索成本,但重播只能評估歷史已走過的分支。

Internet Archive Book Images · No restrictions · Image source
zh-Hant

Google、Google DeepMind 等機構提出 Dream‑RSI,試圖改善長程程式探索最昂貴的一環:代理不只要產生候選解,還得決定哪些分支值得延伸、何時平行嘗試及何時停止。系統沒有微調底層模型,而是在固定 coding agent 與評分器之外加入可執行的探索政策,並以三階段循環更新它。

線上階段會把每次候選程式、工作區狀態、父子分支、執行結果與成本記成 discovery tree。接著,系統把這棵樹當作 replay simulator:新政策可改變既有節點的瀏覽順序、平行配置與停止條件,直接讀取已保存的結果,無須重新呼叫代理或執行評測。另一個固定 LLM 會大量產生政策程式,在重播環境中篩選後,才把最佳版本部署至下一輪線上探索。

[論文](https://arxiv.org/abs/2609.14858)在八項任務測試此方法。Lasso solver 實驗中,Gemini 3.1 Pro 的代理呼叫由固定探索的 550 次降至 317 次;KernelBench 的 VGG16、LayerNorm 任務分別以 2.43 倍及 1.79 倍較少世代達到相近速度,ConvDiv 則在相近預算下取得最高 2.09 倍效能。數學最佳化結果較不一致:Sum–Difference 改善、Circle Packing 追平強基線,但 Autocorrelation 未勝過 SimpleTES。

工程上的價值是把昂貴軌跡轉成可重複使用的控制面測試資料,適合 kernel tuning、程式搜尋及其他具有客觀評分器的工作。不過它不是能預測任意未見狀態的世界模型;重播只知道已探索節點的真實結果,因此無法可靠評估會走出歷史樹之外的反事實政策。實驗也依賴 Gemini、固定評分器與僅八項任務。[專案頁](https://www.dream-rsi.com/)雖提供論文、程式碼入口及示範,後續仍應檢驗跨模型遷移、模擬器偏差,以及計入建立初始搜尋樹後的完整成本。

來源

  1. Dream-RSI: Recursive Self-Improvement through Evolving Worlds
  2. Dream-RSI: Recursive Self-Improvement through Evolving Worlds