AI 安全與代理記憶
FACTWASH 在代理寫入記憶前攔截語氣漂移,否定詞跨域檢測 F1 達 0.91
開源工具 FACTWASH 比較來源與待寫入內容,阻止「有人聲稱」在摘要後變成確定事實。它以零依賴規則處理可枚舉線索,再把較開放的避險語與歸屬判斷交給受限模型元件。

代理記憶系統通常會把對話、郵件或文件壓縮成較短紀錄,但摘要可能保留主張內容,卻刪掉「據稱」、「可能」、「當時有效」等限制。8 月 4 日公開的 FACTWASH 將這種現象稱為 factwashing,並把檢查設在寫入端:工具先找出待存句子對應的來源句,再檢查否定、避險語、說話者歸屬、時間範圍及數值或實體變動。無法修正的內容會被拒絕,可修正的語氣偏移可重寫,找不到可靠來源對齊時則標為不可檢查,而不是直接放行。
實作是一個 Apache 2.0、零執行期依賴的 Python 套件,亦提供包裝既有 mem0 儲存層的介面。研究的重要設計判斷是:明確否定等「封閉類」線索接近可枚舉,詞表在未調校文本上仍達 0.91 F1;避險語與歸屬方式屬於「開放類」,單靠詞表的召回率約停在一半。針對後兩者加入只負責指出線索的 LLM witness,召回率分別增加 17 與 15 個百分點,而且該元件只能降低、不能提高最終安全判定,避免模型自行替可疑寫入背書。
作者以逾 10.5 萬個外部標註句子測試線索辨識,並在未修改的 mem0 2.0.7 上攔到 8 筆帶避險語之傳聞寫入中的 5 筆。不過,實際記憶寫入評估只有單一標註者,第二次盲標的一致性 κ 僅 0.47;工具目前也只處理英文,子字串規則可被改寫繞過。工程團隊應把它視為可稽核的窄型閘門,而非通用事實驗證器,下一步要觀察多語言支援、跨句來源對齊,以及第三方在真實記憶管線上的誤攔率。