返回首頁

AI 評測

MemUse:模型直接問答記憶率達 78.8%,自然對話引用率卻僅 7.9%

京都大學團隊以四個月真實部署建立 MemUse,將「能否找回記憶」與「是否在適當回應中使用記憶」分開評估。結果顯示擴大記憶容量可明顯改善直接問答,卻未同步提高自然整合率或整體滿意度。

S2upidOnReddit · CC BY-SA 4.0 · Image source
zh-Hant

京都大學研究團隊發布 MemUse,挑戰目前長期對話記憶評測常用的直接問答方法。研究來自為期四個月的隨機部署:40 名使用者完成 1,872 個工作階段,系統輪替使用七種記憶配置。各配置在傳統直接問答的準確率介乎 19.7% 至 70.1%,但相對於只保留摘要的基線,使用者滿意度差異均低於 0.06 個使用者內標準差。

團隊因此從真實對話抽取 72 個「使用者主動提示舊事」的時刻,形成包含 316 條事實問題的 MemUse。主要指標 Natural Integration 不再另問「你記得甚麼」,而是檢查模型面對原始對話提示時,有沒有自然承接相關舊資訊;Direct QA 與 Reference 則分別測試模型能否被明確追問出答案,以及自然回應是否實際引用同一事實。

差距相當明顯:在相同 GPT-4.1-mini、完整歷史及重建上下文下,Direct QA 達 78.8%,自然回應引用相關事實的比例只有 7.9%。兩者逐題相關係數為 -0.009,表示檢索成功幾乎不能預測資訊會否進入回應。使用者主動喚起記憶的工作階段中,Natural Integration 與滿意度呈正相關(ρ=0.29),Direct QA 則近乎無關(ρ=0.03)。即使先抽取正確細節再生成回應,模型仍在 48 個案例中的 37 個沒有使用已抽出的資料,瓶頸因而不只在檢索器。

工程上,對話記憶系統不宜只報 recall 或問答準確率;評測還要重播自然觸發句,量測召回內容是否真正影響下一輪生成。資料集、評分提示與 runner 已公開,但資料採 CC BY-NC 4.0,僅供非商業研究。結論亦須保守解讀:基準只有 72 個正例,Natural Integration 由 GPT-5.4-nano 裁判,與滿意度的關係是觀察性關聯;所有部署條件原本也已有對話摘要,因此研究否定的是「額外容量必然改善體驗」,並非記憶本身沒有價值。

來源

  1. MemUse: Moving Memory Evaluation from Direct QA to Natural Integration in Long-Term Human-AI Conversation
  2. MemUse benchmark, judge harness and baselines
  3. RuiSumida/memuse dataset card