返回首頁

代理記憶

長期記憶摘要只保留 3.05% 時間表達,一句提示令時序問答準確率提高 31.4 點

一項 LoCoMo 實驗發現,通用摘要會保留人物與事件,卻選擇性丟掉日期、時間及持續長度。明確要求逐字保留時間錨點後,時序問題的評審準確率由 15.6%升至 47.0%。

Bernou, Claude (b. 16..–d. 17..), Abbot · Public domain · Image source
zh-Hant

長時間運作的代理通常把較舊對話濃縮成摘要,以控制上下文長度;新研究指出,問題不只是「資訊變少」,而是不同類型的資訊會被不成比例地刪除。研究者以 Salience-Weighted Consolidation(SWC)為診斷框架:先按後續內容相似度、近期程度及資訊密度替對話片段打分,高優先片段原文保留,中等片段改寫成摘要,低優先片段則捨棄。

實驗使用 LoCoMo 的十段多工作階段對話,在 4,000 token 預算下比較截斷、滑動摘要、一般 SWC 與保護時間資訊的 SWC。主要統計涵蓋 1,501 題非對抗式文字問題;回答模型為 Claude Sonnet 4.6,壓縮與評審使用 Claude Haiku。一般 SWC 的整體評審準確率為 37.9%,高於滑動摘要的 23.8%及截斷的 17.1%,顯示結構化濃縮確實能保留人物關係與事件鏈。

但分題型後出現明顯缺口:一般 SWC 在多跳與單跳題分別取得 40.7%及 45.9%,時序題卻只有 15.6%。保存率分析找到直接原因——原文中的 952 個時間表達只有 3.05%逐字進入摘要;命名實體及事件的保存率則為 8.03%與 5.03%。摘要知道「誰做了什麼」,但經常遺失「何時、多久」。

研究者只在提示加入一句要求逐字保留日期、時間、持續長度、年齡及相對時間,時間表達保存率便升至 62.39%,時序題準確率提高 0.314,從 15.6%升至 47.0%;十段對話的改善方向均一致,而人物及事件保存率幾乎不變。這對代理記憶工程的啟示很直接:壓縮規格應列出受保護的資料型別,評測也應按時間、實體、承諾及因果關係分層。

結果仍屬小規模診斷研究。它由單一研究者完成,只測一套 SWC 管線與一組 Claude 模型;逐字保存率可能漏算語意等價的改寫,完整上下文上限也只在兩段對話測量。下一步需驗證同一修正能否轉移至滑動摘要、向量記憶及其他模型,並測試時間資訊增加後是否擠掉同樣重要的權限、數值或承諾狀態。

來源

  1. The Sleeping Agent: What Gist-Based Context Compression Loses and Why
  2. kyrkewood/sleeping-agent