返回首頁

代理記憶與評測

MemTrapBench:加入相關記憶後,五種代理記憶策略反而至少掉 10.66 分

MemTrapBench 不測記憶能否被找回,而是測正確、相關的舊經驗會否把模型鎖進錯誤策略或信念。五種記憶方法在兩款模型上均不如無記憶基線,簡單提示式護欄則只能追回部分損失。

S2upidOnReddit · CC BY-SA 4.0 · Image source
zh-Hant

現有代理記憶評測多把流程拆成抽取、更新與檢索,只要找回相關資訊便視為成功。8 月 20 日公布的 MemTrapBench 改問另一個部署問題:即使記憶內容本身正確、檢索結果也與當前問題相關,它是否仍會成為推理錨點,令模型錯用舊策略或把局部條件誤當成普遍事實?

資料集包含 1,050 段、每段 18 至 40 回合的對話,分成任務邊界、認知偏誤、負面回饋引發的策略迴避,以及安全信念扭曲四類。流程先由研究者設計種子,再用 GPT-5.4 擴寫、插入無關回合,最後由自動篩選與人工審核確保末題可獨立作答。關鍵不是記憶過時,而是模型即使面對已改變的條件,仍被先前成功方法、批評或沙盒假設牽引。

研究比較完整歷史、LightMem、MemOS、SimpleMem 與 EverMemOS。Gemini-3-Flash-Preview 的無記憶平均分為 85.16%,最佳記憶策略 EverMemOS 只有 71.17%;Qwen3-30B-A3B-Instruct-2507 的無記憶分數為 81.83%,最佳 LightMem 為 70.13%。安全題尤其明顯:加入記憶後,兩款模型的最佳成績皆不到 70%。控制實驗移除刻意植入的陷阱、保留其餘歷史後,分數可回復,顯示下降不只是上下文變長造成。

團隊另提出 AdaptiveMem,以提示要求模型重新判斷記憶的適用範圍。在抽樣的 200 題上,它令 Gemini 搭配三種記憶框架提高 11.3 至 14.9 分,Qwen 則提高 2.5 至 4.2 分;在 LongMemEval 未見退步。然而這仍是人工合成的壓力測試,主評分者為 GPT-5.2,且目前 GitHub 倉庫只有初始 README。工程團隊應把「是否使用記憶」視為需要校準的決策,接下來要看資料完整釋出、人工評分,以及真實客服或長期代理紀錄能否重現同類失敗。

來源

  1. MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use
  2. MemTrapBench 公開儲存庫