ホームへ戻る

AI 代理與 RAG

HALT、エビデンス網羅率に基づいてRAGエージェントの停止タイミングを決定、検索ループを最大45%削減

HALTは、検索が完了したかどうかを生成モデルの確信度で判断するのではなく、マルチホップ問題に必要な各主張がエビデンスによって裏付けられているかを個別に検証する。凍結済みの検索エージェントに外付けできるが、実際の削減幅は、正確な中間主張を事前に生成できるかどうかに大きく左右される。

George Chernilevsky · CC BY-SA 4.0 · Image source
zh-Hant

検索拡張型の検索エージェントは通常、モデル自身が情報は十分だと判断するまで、クエリを繰り返し生成する。しかし、必要なエビデンスが見つかった後も検索を続け、レイテンシーや推論コストを増加させ、ノイズとなるコンテンツを取り込む可能性がある。8月3日に提出されたHALTは、停止条件を検証可能な「エビデンス網羅率」の問題として再定義した。まず、質問を達成すべき一連のマルチホップ主張に分解する。次に、小規模な教師あり検証器が、各主張と蓄積された文書との関係をMatch、Partial、Nullのいずれかに分類する。すべてがMatchとなった場合にのみ停止し、それ以外の場合は検索を継続する。

この制御レイヤーは、元のエージェントの方策、検索器、基盤モデルを変更しない。公開実装では、Qwen2.5-3B-InstructにLoRAを適用して3クラス分類の検証器を学習し、推論には4-bit NF4を採用している。評価はHotpotQA、2WikiMultihopQA、MuSiQueで実施された。人手でアノテーションされたgold hop claimsを使用した場合、検索ループは平均19〜45%減少した。一方、質問から自動生成した主張を用い、7Bエージェントへ移行すると、削減幅は約6〜9%に低下した。著者らは、paired bootstrap、Holm補正、2パーセントポイントの非劣性マージンを用いてexact matchを検証し、大半の評価条件で非劣性を維持した。

エンジニアリング上の価値は、HALTを既存のRAGエージェントに外付けするランタイムゲートとして利用でき、エージェント全体を再学習する必要がない点にある。ただし、主要な数値は依然としてクローズドなデータセットと既定のsupporting factsに基づいている。オープンWebでは、文書間の矛盾、情報源の品質、インデックスの不完全性により、検証器が回答を棄却する可能性がある。また、リポジトリにはデータや一部の成果物が直接同梱されておらず、完全な再現にはコーパスとインデックスを別途ダウンロードする必要がある。今後は、主張の自動分解におけるエラー率に加え、追加の検証モデルによるレイテンシーが、検索呼び出しの削減によって実際に相殺されるかを見極める必要がある。

出典

  1. HALT: Verification-Aware Stopping for Retrieval-Augmented Search Agents
  2. HALT official implementation and reproduction pipeline