AI 代理與安全
MemTX、エージェントの共有メモリをトランザクション型コミットに変更、550万のプロトコル状態を網羅的に検証しても安全規則の違反なし
MemTXでは、エージェントが書き込んだ情報を即座に実行可能な事実として扱わず、証拠、権限、出所、スナップショット分離、検証付きコミットを導入する。研究では5つのモデルすべてで下流への被害がゼロだったと報告されたが、結果は依然として制御された評価環境に基づくものであり、現実の外部システムで生じる不可逆な副作用を修復できることまでは証明されていない。

マルチエージェントシステムでは通常、共有メモリを一般的なデータベースのように扱う。あるエージェントが観察結果を書き込むと、別のエージェントがそれを基に計画を立て、最終的に支払い、削除、権限変更などのツール操作を実行する可能性がある。MemTXは、ここに重要な境界が欠けていると指摘する。すなわち、「書き込み」は自動的に「信頼して行動すること」と同義であってはならない。汚染されたツールの結果、古くなった状態、未完成の共同作業者のメモは、いずれもメモリの依存関係を通じて伝播し、後続のエージェントが信頼できない情報を前提として扱う原因になり得る。
そこで研究チームは、トランザクション型のbelief-commitプロトコルを提案した。各レコードには証拠、権限、出所、有効期限が付与される。更新はまずスナップショット分離を備えたトランザクションに入り、その後、validate-and-commitパイプラインによって利用可能な信念へ昇格させるかどうかが決定される。不可逆な副作用を伴うツール呼び出しでは、関連する信念がまだトランザクション内にあるのか、正式にコミット済みなのかを確認しなければならない。信念が撤回された場合、システムはレコード型に応じて派生データを追跡し、連鎖的な修復を開始するとともに、すでに実行されたツールの副作用をマークする。
著者らは「アクション安全ゲート」と「連鎖的修復の完全性」を検査可能な不変条件として定式化し、property-based testingと有界網羅探索によって550万のプロトコル状態を検証した結果、違反は観察されなかった。3つのモデルファミリーに属する5つの基盤モデルを用いた評価では、MemTXは8種類のベースラインの大半に対して有意な優位性を示した。最も強力な基盤モデルでは最良のベースラインと統計的に同等だったものの、すべての基盤モデルで下流への被害が一度も発生しなかった手法はMemTXだけだった。
技術的な価値は、エージェントメモリをプロンプトエンジニアリングの領域から、一貫性とロールバックのセマンティクスを備えたシステムコンポーネントへと引き上げた点にある。ただし、論文でいう「修復」は、外部世界での操作が必ず可逆であることを意味しない。送信済みのメール、公開済みの機密情報、完了済みの取引は、データベース上の連鎖的な取り消しでは元に戻せない。エンジニアリングチームが次に注目すべきなのは、プロトコルの実装と性能コスト、サービス間のトランザクション境界、さらに外部ツールが冪等な操作、補償トランザクション、検証可能な受領証明を提供できるかどうかである。