返回首頁

代理與強化學習

MemHarness 在行動前重寫代理記憶,7B 模型於 ALFWorld 成功率升至 85.2%

MemHarness 不再原樣回放檢索到的歷史經驗,而是讓同一策略模型依目前狀態先批判、重組,再決定行動。以 GRPO 端到端訓練後,它在 ALFWorld 與 WebShop 分別取得 85.2% 與 75.6% 成功率,但程式與權重尚未公開。

Rufus Sarsaparilla on wikipédia en · Public domain · Image source
zh-Hant

代理記憶常採用「檢索後直接塞回上下文」的做法,但過往軌跡描述的物件位置、可用操作或中間狀態,未必適用於新一輪任務。MemHarness 將流程拆成觀察、檢索、批判、重組與行動五階段:代理先從經驗庫找出三項相關原則,再由同一個策略模型判斷哪些內容與當前狀態衝突,最後改寫成可執行指引。重點不是增加另一個通用 LLM 作文字整理,而是讓記憶適配能力與行動策略一起接受環境回饋。

研究以 Qwen2.5-7B-Instruct 為骨幹,先用 200 條多輪互動軌跡與 200 組軌跡摘要進行冷啟動,再透過 GRPO 訓練。經驗庫起初為空,訓練期間由策略模型從自身軌跡歸納原則;BGE-M3 負責向量檢索。每個提示取樣八條軌跡,總計使用 128 個平行環境,成功獎勵為 10、失敗為 0,另加入小幅格式獎勵。

在文字化家居操作環境 ALFWorld,MemHarness 的六類任務平均成功率為 85.2%,純 GRPO 為 76.4%;WebShop 購物代理則由 66.1% 升至 75.6%。若直接注入未重寫記憶,ALFWorld 反而降至 70.1%,說明更多檢索內容可能造成負遷移。未見房間配置與物件位置的 ALFWorld OOD 測試中,MemHarness 得到 85.9%,原樣回放基線為 76.3%。以通用 Qwen2.5-7B 代替內部重組模組,也會令 ALFWorld 成績由 85.2% 降至 77.7%。

這項結果對長期運行的客服、瀏覽器與機器人代理有直接含義:記憶層不能只追求召回率,還需要依狀態驗證其適用性。不過比較仍局限於兩個模擬環境,部分封閉模型分數來自特定提示與互動預算,不能視為一般能力排名。論文也未公開程式、檢查點、訓練 GPU 時數或記憶重寫造成的額外延遲;工程上仍需驗證在更長軌跡、不可逆工具操作及遭污染記憶下,重組器是否會把錯誤經驗改寫得更具說服力。

來源

  1. MemHarness: Memory Is Reconstructed, Not Replayed
  2. ALFWorld: Aligning Text and Embodied Environments for Interactive Learning