返回首頁

RAG 與資訊檢索

Q2D-Web 以 1.9 億篇文件測試代理式 RAG,支援查詢成為檢索弱點

Perplexity 提出的 Q2D-Web 以實際對話衍生近七萬筆機器改寫查詢,評測第一階段檢索器能否在網頁規模找回證據。實驗顯示神經檢索器普遍較不擅長代理自行生成的支援查詢,而縮小語料庫雖保留排名,仍會抬高絕對分數。

Daniells, Arthur Grosvenor, 1858- [from old catalog] · No restrictions · Image source
zh-Hant

Perplexity 研究團隊於 9 月 8 日發布 [Q2D-Web](https://arxiv.org/abs/2609.08887),試圖修正現有檢索基準與代理式 RAG 生產流量之間的落差。資料源自九個月、經個資過濾的實際查詢,包含 12,365 筆重述主要意圖的 primary query,以及 57,356 筆代理為補背景、換語言或追查實體而生成的 supporting query,合計 69,721 筆、涵蓋十種語言。研究者再合併每筆查詢的前 5,000 項結果,以 MinHash-LSH 去重後形成約 1.9 億篇文件的候選語料庫。

評測焦點不是最後顯示給使用者的十個結果,而是多階段搜尋管線的第一階段:若相關證據未進入前 1,000 名,後續 reranker 或回答模型便沒有機會使用。因此 Q2D-Web 以 Recall@1000 為主指標,另報 Recall@100 與 nDCG@10,並提供引用紀錄、生產排序、以及加入 LLM 判斷的聯合集合三套 relevance labels。13 款 BM25、dense embedding 與 late-interaction 檢索器的相對排序大致不受標籤來源影響,但會隨語言、領域和查詢類型明顯改變。

在聯合標籤下,pplx-embed-v1-4b 的 Recall@1000 最高,Nemotron-3-Embed-8B 則在 Recall@100 與 nDCG@10 領先,說明「召回更多證據」和「把證據排得更前」不是同一個最佳化目標。所有神經檢索器在 supporting query 上都明顯弱於 primary query;BM25 整體召回最低,卻找到最多其他模型完全漏掉的獨有相關文件。對 RAG 工程而言,這支持混合檢索,也顯示不能只用人類撰寫的搜尋句評估 embedding 模型。

完整跑一次 4B 模型需約 4,608 H200 GPU 小時。研究者以多檢索器的 reciprocal rank fusion 選出 31.7% 語料,仍保持完整語料的系統次序,但 Recall@1000 平均被抬高 5.1 個百分點。這個子集適合快速篩選,不能取代最終全量驗證。此外,資料為防止訓練污染而不公開,只透過[託管排行榜](https://huggingface.co/spaces/perplexity-ai/q2d-web-leaderboard)評測開放權重模型;文件只編碼前 512 tokens,標籤亦混合自家排序與 LLM 裁判,外部團隊仍難完整稽核或離線重現。

來源

  1. Q2D-Web: A Large-Scale Benchmark for Retrieval in Agentic RAG Systems
  2. Q2D-Web Leaderboard