ホームへ戻る

代理評測

ContextWeave、1,000件超の実行可能なオフィスタスクでエージェント記憶を再評価、Preference Scoreは41.50から70.60へ

ContextWeaveは、エージェントが過去の情報を取り出せるかだけでなく、その記憶が後続の文書作成やオフィス業務を改善できるかを検証する。実験では、行動につながる完全な経験を保持する手法が短い要約を上回った一方、誤った記憶も実行結果に影響しやすくなることが示された。

Internet Archive Book Images · No restrictions · Image source
zh-Hant

言語エージェントの記憶評価は、しばしば「過去の会話から答えを見つけられるか」という問題に単純化され、取得した内容が実際に次の作業を改善するかどうかは検証されてこなかった。8月5日に提出されたContextWeaveは、この点を縦断的なワークフローによって検証する。研究チームは、14人の参加者による数カ月分の、プライバシー処理済みの作業記録を1,005件の実行可能なタスクとして再構成し、そのうち568件を中核評価に使用した。各タスクには指示、コンテナ化された環境、操作トレース、タスク固有の採点ルールが付属しており、エージェントは孤立した質問に答えるのではなく、既存プロジェクトを引き継いで進めなければならない。

評価はWorkspace ScoreとPreference Scoreに分かれる。前者は生成されたワークスペースがタスクを完了しているかを検査し、後者は結果が特定ユーザーの過去に示した好みに合致しているかを測定する。さらに、関連性、継続性、解決可能性に加え、誤解を招く記憶に直面した際のロバスト性も診断する。基盤モデルを固定して6種類のメモリコンポーネントを比較したところ、最良の構成ではWorkspace Scoreが68.08から78.20に、Preference Scoreが41.50から70.60に向上した。逆にメモリコンポーネントを固定した場合も、評価対象となった5つのモデルすべてが記憶想起メカニズムの恩恵を受けたが、改善幅は一様ではなかった。

エンジニアリングチームにとってより重要なのは、操作の詳細、意思決定の理由、過去の成果を含む「経験型記憶」が、圧縮された要約よりも重複した探索を減らし、作業の継続性を保つうえで優れていた点だ。その代償として、誤った内容や無関係な内容も実行に持ち込みやすくなる。これは、本番環境向けエージェントではベクトル検索のヒット率だけを最適化するのでは不十分であり、記憶を利用する前に、その鮮度、出所、タスクとの適合性を検証する必要があることを意味する。現時点の結果は、依然として14人分のデータと著者が設計した採点ルールに基づいており、論文ページにも公開リポジトリへのリンクはない。今後は、完全なデータ、コンテナ、評価器の設定が公開されるか、また他のチームがスコアを再現できるかを注視する必要がある。

出典

  1. ContextWeave: A Real-World Workflow Benchmark
  2. DataCite DOI record for ContextWeave