返回首頁

代理記憶與檢索

ReFind 不建語意記憶索引,原始聊天紀錄搜尋均分反勝 HippoRAG 2 五點

ReFind 保留未改寫的對話紀錄,讓代理反覆使用關鍵字、時間及 session 篩選蒐集證據。在約 2,800 題測試中,它以 58.2% 平均準確率超過最強結構化記憶基線的 53.2%,但比較並未統一所有控制器與工具預算。

Enock4seth · GFDL · Image source
zh-Hant

多數長期記憶系統會先把對話轉成摘要、向量、樹或知識圖,再等待日後查詢。新研究提出的 ReFind 採取相反方向:原始紀錄只按對話 turn 建立詞彙索引,不生成嵌入或語意圖;ReAct 代理可以多輪改寫關鍵字,並使用 session-aware rank fusion、相鄰上下文展開、時間範圍縮窄及略過已檢查 session 四種控制,最後才把收集到的證據交給獨立推理階段作答。

研究在 MemoryAgentBench 的單跳、多跳、事件排序與事實更新等六組任務測試約 2,800 題。使用相同 GPT-4o-mini backbone 時,ReFind 的未加權平均準確率為 58.2%,高於 HippoRAG 2 的 53.2%及單次 BM25-RAG 的 48.8%;在多跳 QA 上,ReFind 為 69.0%,BM25 為 56.0%。它在 EventQA 則以 74.1%略低於 BM25 的 74.6%,顯示單一明確事件未必需要代理式搜尋。

這項結果對工程設計的意義,不是知識圖已經無用,而是「先壓縮再檢索」可能過早丟失細節。ReFind 沒有 LLM 索引建置成本,新訊息也可立即被搜尋;代價則轉移到每次查詢的多輪模型呼叫,論文未提供完整延遲與成本對照。更重要的限制是,部分基線數字取自既有研究,作者承認各系統沒有在完全相同的控制器及 tool-call 預算下重跑;LongMemEval 的部分結果也依賴 GPT-4.1-mini 裁判,且未做人類一致性研究。下一步應看公開實作、端到端成本,以及語意模糊而非精確事實問題上,詞彙搜尋是否仍能維持優勢。

來源

  1. When Your Agent Opens the Chat App: Agent-Controlled Search over Raw Chat Logs Rivals Structured Memory
  2. HippoRAG 2: From RAG to Memory
  3. MemoryAgentBench