代理系統與評測
RSIAgent 凍結模型權重,以自主探索建立可重用的環境記憶
RSIAgent 讓課程、執行與驗證代理先廣泛探索工具,再深入測試失敗邊界,將結果保存為動作—條件—結果記憶。OSWorld 2.0 的部分得分由 71.97 升至 78.98,但比較混合不同預算與挑選後的重試,不能直接視為模型能力超越 GPT-6。

Aether Labs 公開 RSIAgent,一套不更新底層模型權重、改以環境互動累積經驗的多代理框架。系統由 curriculum、actor 與 verifier 三種角色組成:課程代理產生探索目標,actor 實際操作桌面或工具,verifier 檢查產物;通過驗證的經驗再被整理成「動作—條件—結果」規則,凍結後供正式任務檢索。
探索流程分成 broad 與 deep 兩階段。前者平行嘗試不同應用程式、工作流及錯誤模式,以擴大覆蓋;後者針對困難案例、隱藏限制與邊界條件反覆實驗。例如在 REAPER 音訊任務中,代理從探索結果修正重採樣設定,首次使用凍結記憶評測時,部分得分由 68.00 提至 94.17。程式碼包含 OSWorld 2.0、Agents’ Last Exam(ALE)的執行器、VM 隔離、記憶與復原模組,可在具備 Docker、KVM 與模型 API 的環境重現。
論文在 OSWorld 2.0 的 82 個離線任務上報告 78.98 分,相較相同框架但不做遞迴自我改進的 71.97 分;完整任務成功率則由 37.80% 升至 42.68%。ALE 的提升較小:部分得分由 83.75 增至 84.82,完整成功率由 49.25% 增至 50.75%。
這些數字必須保守解讀。OSWorld 彙總只對 41 項採用 RSI 紀錄,其餘沿用基線;ALE 也僅替換 19 項,且包含挑選後的重試、不同預算、在地重評與協定變體,並非所有任務在相同成本下重複測試。工程上真正值得追蹤的是探索成本、驗證器誤判,以及錯誤規則被長期寫入記憶後如何撤銷,而不只是排行榜名次。