代理記憶與評測
MemTrapBench:関連する記憶を追加すると、5つのエージェント記憶戦略のスコアが逆に少なくとも10.66ポイント低下
MemTrapBenchが評価するのは、記憶を取り出せるかどうかではない。正しく関連性のある過去の経験が、モデルを誤った戦略や信念に縛り付けるかを検証する。5つの記憶手法はいずれも、2つのモデルで記憶なしのベースラインを下回り、単純なプロンプトベースのガードレールで回復できたのも損失の一部にとどまった。

既存のエージェント記憶ベンチマークの多くは、処理を抽出、更新、検索に分解し、関連情報を取り出せれば成功とみなしている。8月20日に発表されたMemTrapBenchは、これとは異なるデプロイ上の問題を提起する。記憶の内容自体が正しく、検索結果も現在の問題に関連している場合でさえ、それが推論のアンカーとなり、モデルに過去の戦略を誤用させたり、局所的な条件を普遍的な事実だと誤認させたりすることはないのか。
データセットには、各18~40ターンからなる1,050件の対話が収録され、タスク境界、認知バイアス、否定的フィードバックによる戦略回避、安全性に関する信念の歪曲という4カテゴリーに分類されている。研究者がまずシードを設計し、GPT-5.4で拡張して無関係なターンを挿入した後、自動選別と人手によるレビューを通じて、最後の問題が単独でも回答可能であることを確認した。重要なのは記憶が古いことではない。条件が変化した後でさえ、モデルが以前成功した手法、批判、またはサンドボックス上の仮定に引きずられる点だ。
研究では、完全な履歴、LightMem、MemOS、SimpleMem、EverMemOSを比較した。Gemini-3-Flash-Previewの記憶なしでの平均スコアは85.16%だったのに対し、最良の記憶戦略であるEverMemOSでも71.17%にとどまった。Qwen3-30B-A3B-Instruct-2507は、記憶なしでは81.83%だったが、最良のLightMemでも70.13%だった。安全性に関する問題では特に顕著で、記憶を追加すると、両モデルの最高スコアはいずれも70%未満となった。意図的に埋め込んだトラップを除去し、それ以外の履歴を残した対照実験ではスコアが回復したため、低下は単にコンテキストが長くなったことによるものではないと示された。
チームはさらに、記憶の適用範囲を再評価するようプロンプトでモデルに指示するAdaptiveMemを提案した。抽出した200問では、Geminiと3つの記憶フレームワークを組み合わせた場合に11.3~14.9ポイント、Qwenでは2.5~4.2ポイント改善し、LongMemEvalでも性能低下は見られなかった。ただし、これは依然として人為的に合成されたストレステストであり、主要な評価モデルはGPT-5.2、現在のGitHubリポジトリにあるのも初期READMEのみだ。エンジニアリングチームは「記憶を使用するかどうか」をキャリブレーションが必要な意思決定として扱うべきだ。今後は、データの完全公開、人手による評価、そして実際のカスタマーサポートや長期稼働エージェントのログで同種の失敗を再現できるかが焦点となる。