ホームへ戻る

AI 研究

JitMem、新しいタスクに応じてエージェントの記憶を整理、2つのテストで成功率が16ポイント超向上

成功したタスクの生の実行履歴を保持し、次のタスクが来てから適切な要約を生成する研究。改善は特定のベンチマークとモデル構成で得られたもので、導入評価には記憶整理モデルの追加コストも含める必要がある。

Internet Archive Book Images · No restrictions · Image source
zh-Hant

Salesforce AI Researchの研究チームは9月23日にJitMemを発表し、翌日、著者らがHugging Faceでその設計を紹介した。エージェントが過去のタスクで残した生の操作履歴を保持し、新しいタスクが来てから、その場で必要な記憶の要約を生成する。似た手順を繰り返し処理するエージェントにとって、記憶を生成するタイミングを見直す手法となる。[著者による紹介](https://huggingface.co/papers/2609.27334)

一般的な手法では、タスクの終了時に経験を固定的な振り返り、スキル、ワークフローへと整理する。その時点では将来の要求が分からないため、削除した詳細が次の問題で必要な情報である可能性がある。JitMemは、同じ元の経験からクエリに応じて異なる要約を生成し、成功と判定された実行履歴だけを記憶ストアに追加する。ここでの完全な保持は、保存を認められた履歴に限られ、すべての試行を無条件に保存するわけではない。[研究の説明](https://arxiv.org/html/2609.27334v1)

実装では、BM25でタスクの説明を照合して関連する実行履歴を取得し、記憶整理モデルに渡して要約を生成したうえで、重みを固定した実行モデルに提供する。記憶整理モデルはQwen3-8Bで初期化し、GRPOで100ステップ学習させ、同じタスクの完了結果に基づいて報酬を与える。これにより、記憶に関する判断と検証結果の結び付きを強め、要約が役立つかどうかを知るために将来のタスクを待たなければならないという難しさを軽減する。[手法と設定](https://arxiv.org/html/2609.27334v1)

著者らの報告によると、実行モデルにQwen3-8Bを用いた場合、ALFWorldの成功率はSkillOSの61.2%から77.4%に、WebShopでは16.5%から32.8%に上昇し、それぞれ16.2ポイント、16.3ポイント向上した。これは特定のベンチマークとモデル構成での比較である。別の評価であるτ²-benchでは学習不要のバージョンのみをテストしており、同じ学習済みモデルが続けて優位性を示した結果とは解釈できない。[結果表](https://arxiv.org/html/2609.27334v1)

コストも分けて考える必要がある。論文に示されたトークン数とステップ数の比較は実行モデルのみを集計しており、システム全体のコストが低いと証明するには不十分だ。導入評価には、記憶整理モデルによる要約生成、成功判定、生の実行履歴の保存にかかるコストも加える必要がある。[コストの集計範囲](https://arxiv.org/html/2609.27334v1)

製品開発チームは、まず同じタスクストリームで固定的な要約とオンデマンドの要約を比較し、実行モデル、検索で取得する件数、ツールの設定をそろえるとよい。そうしなければ、要約モデルの能力やデータ選別の違いも結果に影響し得る。受け入れ評価では、タスクが実際に成功した場合、モデルが成功したと自己判断した場合、評価器が成功と判定した場合を区別し、誤った経験が記憶ストアに繰り返し書き込まれることを防ぐ必要もある。

本稿では、次の段階として、タスクの順序を変えた場合、記憶がコールドスタートの状態にある場合、成功判定を誤った場合の性能を優先的に再検証し、エンドツーエンドのレイテンシと成功率を併せて比較すべきだと考える。新しいタスクが既存の経験と大きく異なる場合には、記憶整理モデルが適用できない操作手順を提案していないかも確認する必要がある。そのうえで、オンデマンドの記憶整理が実際のエージェントサービスに適しているかを判断できる。

出典

  1. Just-in-Time Memory: Learning to Curate Task-Adaptive Memory for LLM Agents
  2. JitMem 論文全文、實驗表與附錄
  3. JitMem 論文頁與作者介紹