多模態 RAG
DualG-MRAG 將多模態知識圖拆成兩層,MMQA 的 R@5 提高至 61.9%
DualG-MRAG 以巨觀圖尋找跨文件推理路徑,再用微觀圖核對局部影像與文字證據,避免細粒度節點使知識圖快速膨脹。研究在 MMQA 將 R@5 從最佳圖式基線的 42.1% 提高至 61.9%,但尚未公開程式碼與索引建置成本。

多模態 RAG 常在兩種表示之間取捨:只替整份文件建立節點,容易遺失圖像區域、表格欄位等局部證據;把所有細節塞進同一張知識圖,又會造成節點與邊暴增,讓檢索混入大量噪音。7 月 30 日提交的 DualG-MRAG 將這兩項工作拆開,以 Macro Graph 保存文件、實體及跨模態關係,負責全域拓撲路由;Micro Graph 則保留細粒度內容,只在候選範圍內執行局部比對。
查詢進入後,GNN Retriever 透過訊息傳遞更新不同證據的相關性。系統再把 GNN 前向傳播展開成有向無環圖,以動態規劃抽取高機率證據路徑,交給 Qwen3-VL-4B 或 8B 作答,而非僅串接彼此獨立的 top-k chunks。微觀檢索先以向量索引取得 top-K 錨點,再於受限子圖中進行啟發式 branch-and-bound;論文估計查詢圖通常少於五個節點,但這仍是依賴資料結構與參數的分析。
在包含文字、圖像及表格的 MMQA 測試上,DualG-MRAG 的 R@2/R@5 為 49.4%/61.9%,相較 MMGraphRAG 的 31.8%/42.1% 明顯提高;WebQA 的 R@5 為 58.2%。平均查詢延遲約 0.44 秒,遠低於作者測得 MMGraphRAG 的約 40.5 秒,但仍慢於 VLM2Vec-V2.0 的約 0.09 秒。移除 Macro Graph 後,MMQA R@5 降至 21.8%,顯示主要收益確實來自全域路由。
工程上值得觀察的是離線建圖時間、索引容量、增量更新,以及延遲能否在不同硬體與大型企業語料重現。實驗只抽取 MMQA、WebQA 各 1,000 題,程式與完整索引尚未公開;此外,顯式路徑對 8B 模型的 MMQA EM 並無穩定收益,代表較強模型可能反而被固定路徑限制。