代理框架與記憶
TARL、エージェントのメモリ更新を5種類のトランザクションに分解し、次状態の正解率を66.21%に向上
TARLは、エージェントのメモリを「書き込むか保持するか」という二分法で管理せず、追加、無視、修正、競合による拒否、検証の延期を明確に区別する。著者らの実験ではメモリ汚染率が25.24%に低下したが、現時点でモデルとデータは論文の補足資料としてのみ提供されている。

長期稼働するエージェントが誤った情報をメモリに書き込むと、その汚染は後続の検索や意思決定で繰り返し増幅される。そこで新たに提案されたTransaction-Aware Reliable Ledgers(TARL)は、一般的なWrite/Hold判定を、実行可能な5種類のトランザクション、`append`、`noop`、`revise`、`reject_conflict`、`defer_verify`に置き換える。2つの情報がともに「書き込み」と分類されても、新しい事実の追加と古くなった事実の置換では、必要な状態遷移が異なる。「書き込まない」という判断も、内容の重複、情報源の信頼性不足、または未検証であることを意味し得る。
TARLはまず、候補となる記述に関連する既存のメモリスロットを特定する。次に、時間範囲、情報源、信頼度、競合シグナルを組み合わせて新旧の証拠を比較し、データをaccepted、pending、rejected/historyという3つの台帳に振り分ける。新しい事実に置き換えられた内容はそのまま消去されず、情報源とともに履歴台帳へ保存される。訓練時には、候補となる各トランザクションによって生じる次状態もシミュレーションし、アクション名の分類精度だけでなく、正しい台帳の結果を教師信号として選択を学習させる。
関連データセットのTARL-Memは、HaluMem、LoCoMo、LongMemEvalを基に細粒度のラベルを生成している。論文の主要比較では、5回の独立した訓練を通じて、5クラスのMacro F1が0.8286、完全な次状態の正解率が0.6621だったと報告されており、いずれも7種類のメモリベースラインを上回った。acceptedメモリの汚染率は0.2524だったが、これは予測によって確定された情報の約4分の1が、依然として信頼済み台帳に入るべきではないことを示す。また、14系列で各200回の連続トランザクションを実行したクローズドループテストでは、Stateful Rollout Scoreが0.7258に達した。
エンジニアリング上の価値は、「メモリ更新」を監査可能な状態機械に変え、エラーが書き込み、修正、検索のどこで発生したのかを特定しやすくする点にある。ただし、これらの結果はすべて著者らが構築したデータ変換処理とエグゼキューターに依存しており、オープンWeb上の悪意ある情報源、複合的な記述、大量の並行更新を処理できることはまだ実証されていない。完全な独立リポジトリも現時点では公開されていない。今後は、トランザクションのセマンティクスを既存のベクトルデータベースに統合できるか、またpendingメモリに対する検証、期限切れ、並行処理時の競合ポリシーをどのように設計するかが注目点となる。