ホームへ戻る

RAG 與檢索系統

GLM-RAG、知識グラフのテキストをGraph Transformerに入力し、クロスドメインのマルチホップ検索でGNNベースラインを上回る

GLM-RAGでは、グラフ距離だけに基づいて情報を伝播するのではなく、ノード、関係、質問が第1層のAttentionから相互作用する。未知ドメインのマルチホップ評価ではより良い結果を達成したが、シングルホップタスクでは依然として通常のベクトルRAGが優位で、コードとモデルもまだ公開されていない。

Jan Beckendorf · CC BY-SA 2.0 · Image source
zh-Hant

ハイデルベルク大学とAleph Alpha Researchは、2種類の知識グラフ検索器がそれぞれ抱える弱点を補うため、GLM-RAGを提案した。ベクトル検索はテキストの類似性を理解できる一方、文書をまたぐ推論チェーンを見落としやすい。GNNはグラフに沿って情報を伝播できるが、ノードをゼロベクトルだけで初期化した場合、ランキングは主にシードノードからの距離に左右され、ノード名や関係の意味を実際には理解していないことが多い。

GLM-RAGは、GFM-RAGの知識グラフ構築、文書ランキング、回答生成のパイプラインを踏襲し、コアとなる検索器のみを置き換える。システムはまず質問からシードエンティティを抽出し、局所サブグラフを取得したうえで、ノードとエッジのラベルをテキストtokenに変換する。基盤となるT5のAttentionには、グラフ距離に基づく相対位置情報と構造マスクが追加されている。これにより、各トリプルを文のように処理しながら、複数のトリプル間で共有されるノードのグラフ接続を維持できる。質問ベクトルとエンティティ表現は第1層から融合され、最後にscoring headが関連ノードをランキングし、それらを元の文書へマッピングする。

研究チームは、HotPotQA、2WikiMultihopQA、MuSiQueから得た28万2,000件の質問—文書ペアで検索器をfine-tuningし、回答生成には一貫してGPT-4o miniを使用した。さらに、11件の未知データセットで転移性能を評価した。Wikipedia系データセット間の転移では、GLM-RAGのRecall@2が多くのケースで2種類のGNN版を上回った。たとえば、MuSiQueのみで学習し、HotPotQAで評価した場合は65.7を記録し、比較対象はそれぞれ59.4と60.3だった。また、医療およびコンピューターサイエンス分野のG-Benchマルチホップタスクでも、公式発表によれば新たなstate-of-the-artを達成した。

実装者にとってより重要な結論は、Graph RAGがベクトルインデックスを全面的に置き換えるものではないという点だ。7件のクロスドメイン・シングルホップデータセットでは、通常のベクトルRAGがすべてグラフベースの手法を上回った。GNNには、より低い学習コストで、より大きなサブグラフを扱える利点もある。GLM-RAGの強みは、意味的な判別を必要とするマルチホップ経路に集中しており、その代償として局所サブグラフのtokenization、T5による推論、グラフ構築のコストが発生する。論文では各実験が1回しか実施されておらず、一部のG-Bench評価はLLM-as-a-judgeに依存している。さらに、コード、モデル、データはいずれも「近日公開」とされている。今後は、end-to-end latency、インデックス更新コスト、実際の企業知識グラフに対する転移能力を比較する必要がある。

出典

  1. GLM-RAG: Graph Language Models for Graph-Based Retrieval-Augmented Generation
  2. Heidelberg University computational linguistics colloquium: GLM-RAG