返回首頁

AI 代理與安全

MemTX 把代理共享記憶改成交易式提交,窮舉 550 萬個協定狀態未見安全規則失效

MemTX 不再讓代理寫入的資訊立即成為可執行事實,而是加入證據、權限、來源、快照隔離及驗證提交。研究在五款模型上報告零下游傷害,但結果仍來自受控評測,尚未證明能修復真實外部系統的不可逆副作用。

Ralf Manteufel · GFDL 1.2 · Image source
zh-Hant

多代理系統通常把共享記憶當成普通資料庫:代理一旦寫入某項觀察,其他代理便可能據此規劃,最後觸發付款、刪除或修改權限等工具。MemTX 指出這裡缺少一道關鍵界線——「寫入」不應自動等同「相信並採取行動」。污染的工具結果、過期狀態或尚未完成的協作者筆記,都可能沿著記憶相依關係擴散,讓後續代理把不可靠資訊當成前提。

研究團隊因此提出交易式 belief-commit 協定。每筆記錄攜帶證據、權限、來源與有效期,更新先進入具快照隔離的交易,再經 validate-and-commit 管線決定是否升格為可用信念;具有不可逆副作用的工具呼叫,則必須檢查相關信念是否仍在交易中或已正式提交。若某項信念被撤回,系統會依記錄型別追蹤衍生資料,啟動級聯修復,並標記已執行的工具副作用。

作者把「動作安全閘門」與「級聯修復完整性」寫成可檢查的不變條件,以 property-based testing 和有界窮舉驗證 550 萬個協定狀態,未觀察到違規。在來自三個模型家族的五款骨幹上,MemTX 對八種基線中的多數取得顯著優勢;最強骨幹上則與最佳基線統計相當,但仍是唯一在所有骨幹都沒有下游傷害的方法。

技術價值在於把代理記憶從提示工程提升為具一致性與回滾語義的系統元件。不過,論文中的「修復」不代表外部世界一定可逆:已寄出的郵件、已公開的機密或已完成的交易不能靠資料庫級聯撤銷。工程團隊接下來應關注協定實作與效能成本、跨服務交易邊界,以及外部工具能否提供冪等操作、補償交易和可驗證回執。

來源

  1. MemTX: Transactional Belief Commit for Stateful Agent Memory
  2. MemTX paper discovery page