返回首頁

代理系統/長期記憶

MemChain 在檢索後重組代理記憶,以證據軌跡縮短送入回答模型的上下文

MemChain 不把向量檢索結果直接塞給語言模型,而是先規劃、排序並壓縮成具來源依據的主動記憶。研究在 LoCoMo 與 LongMemEval-S 報告領先結果,但尚未公開完整程式與實際延遲成本。

Dave Pape · Public domain · Image source
zh-Hant

長期記憶代理通常採用「檢索即證據」架構:向量搜尋取回數段歷史後,全部交給回答模型自行判斷相關性、處理重複資訊與衝突。新研究提出的 MemChain 在檢索器與回答模型之間加入可訓練的記憶政策,將這個處理過程獨立成一個可檢查的中介層。

MemChain 先依使用者問題產生 evidence plan,再按照語意角色與相依關係,把候選記憶排列成 grounded evidence trace;最後執行選取、合併或刪減等記憶動作,輸出較短的 active memory。回答模型本身可以保持凍結,因此部署者理論上能替換後端模型,而不用重新設計整套檢索管線。

訓練分成兩階段。第一階段以監督式軌跡學習,讓中介模型產生格式有效的計畫、證據鏈與動作;第二階段使用 Trace-Guided Memory Policy Optimization。這個強化學習目標不只獎勵最終答案,也同時約束證據支持度、軌跡落地性、結構有效性,以及不同 rollout 間的答案穩定度,試圖避免政策為提高分數而產生無法追溯的摘要。

作者在 LoCoMo 與 LongMemEval-S 上表示,MemChain 搭配封閉或開放權重的凍結回答模型都取得當時最佳表現,並大幅減少送入回答模型的記憶上下文。這對工程端的意義是:長期記憶的成本控制不必只靠縮小 top-k,也可以在檢索後進行具任務條件的證據編排。

不過,摘要沒有提供可直接比較的 token、延遲與訓練成本數字,完整程式及模型權重也未見同步公開。LoCoMo 本身只有十段經標註的長對話;LongMemEval-S 亦是固定問答評測。接下來應觀察證據壓縮在持續寫入、互相矛盾的真實企業記憶中是否仍可靠,以及可解釋軌跡是否真的對應模型採用的資訊,而不只是另一段看似合理的文字。

來源

  1. MemChain: Learning Interpretable Memory Traces for Memory-Augmented LLM Agents
  2. LoCoMo benchmark repository