AI 安全
RAGSieve 以檢索結果自身作基準,雙層過濾把 RAG 投毒成功率由 67.4% 壓至 14.0%
RAGSieve 不需要可信語料庫或預先標註的毒化樣本,而是分別比較查詢排名尾端與文件的局部語意鄰域。開源實驗涵蓋三個問答集、三款檢索器及六種攻擊,但單篇流暢毒文與已污染的檢索尾端仍可能繞過偵測。

新發布的 RAGSieve 把 RAG 知識投毒防線拆成查詢時與索引時兩層,核心不是判斷文件內容真偽,而是尋找攻擊者為提升排名而留下的局部統計異常。線上模組 RSQ 取得每次檢索的前 20 篇文件,將真正送進生成器的前五名,與第六至二十名組成的查詢專屬參考尾端比較;它同時量度答案錨點集中、書寫系統完整性、局部語言模型 surprisal,以及文件與查詢對齊度的突變。
離線模組 RSG 則在沒有查詢的情況下掃描整個索引。它為每篇文件尋找語意相近但詞彙不同的鄰居,再把局部密度增幅與該鄰域自身的基線相比,藉此避開不同語料庫需要不同全域相似度門檻的問題。兩個模組均以受檢系統自身建立參考,不要求一份已知乾淨的外部語料。
在 NQ、HotpotQA、MS MARCO,搭配 BGE-M3、E5-large-v2、MiniLM-L6-v2及六種投毒方法的測試中,RSQ 的宏平均 AUROC 為 95.2%,在最多移除 5%乾淨文件的預算下找出 82.2%毒文;RSG 分別達 93.3%與 79.8%。串聯兩層後,攻擊成功率由無防禦時的 67.4%降至 14.0%,未投毒檢索的答案 F1 則由 42.1微降至 41.3。代價是 RSQ 平均為每個查詢增加約 447毫秒;RSG 掃描約 12.85萬篇文件需 46.54秒。
這不是事實查核器。合法文件若集中重複某個答案,也可能被隔離;單篇流暢毒文未必形成 RSG 所需的圖密度,而大量毒文若已進入排名第六至二十名,亦會污染 RSQ 的參考組。公開倉庫包含 MIT 授權實作、測試、三個語料及小型示範,但完整攻擊集合與原始結果檔並未全部提供。部署者下一步應以自家索引的誤殺成本調校線上與離線門檻,並加入針對偵測器的自適應攻擊測試。