返回首頁

AI 安全與評測

RAG-Safety-Bench 隔離檢索品質變因,顯示安全微調未必能承受答案型文件

新基準固定檢索內容,以四種條件測量 RAG 如何改變五款開放模型回答有害問題的行為。含答案的文件讓所有模型更容易產生正確但危險的內容,而安全裁判之間也只有中度一致性。

User:Peregrine981 · CC BY-SA 3.0 · Image source
zh-Hant

渥太華大學研究團隊發布 [RAG-Safety-Bench](https://arxiv.org/abs/2609.11758),試圖回答一個部署端常被忽略的問題:基礎模型通過安全測試後,接上企業文件或其他知識庫,防護欄是否仍然有效。它不實際執行向量檢索,而是直接提供固定文件,排除召回品質造成的假性安全增益。

基準把同一批有害問題拆成四種條件:完全不使用 RAG、取得含有答案的 oracle 文件、取得同主題但不含答案的文件,以及取得安全且無關的隨機文件。完整版涵蓋 987 個問題,論文主要分析每個子類最多 20 題的 346 題平衡子集;危害類型包含暴力、詐欺、網路攻擊、武器與自我傷害等。測試模型為 Gemma 3 12B、Llama 3.1 8B、Ministral 3 8B、Qwen 2.5 7B 與 Phi-4 14B。

結果顯示,oracle 文件會提高所有模型回答有害問題的正確率。例如 Ministral 3 8B 從非 RAG 的 26.0% 升至 90.7%,Qwen 2.5 7B 從 15.9% 升至 82.9%。不過,同主題但沒有答案的安全文件只讓部分模型惡化;無關長文本反而普遍最安全,表示問題不能簡化為「上下文愈長愈危險」。工程上,這意味著輸入文件的信任等級不能取代生成後安全檢查,RAG 評測也應同時覆蓋答案型、近鄰型及控制文件。

研究以 LlamaGuard、ShieldGemma 與 WildGuard 多數決判定危害,但四方 Fleiss’s kappa 僅 0.56。更重要的是,[公開儲存庫](https://github.com/The-Safe-AI-Lab/RAG-Safety-Bench)雖提供資料、設定與本機評分程式,仍未釋出原始模型回覆、裁判軌跡及論文使用的私有 v2 重評產物。研究也未測商用模型,因此目前較適合用來設計內部紅隊矩陣,而非宣稱特定產品已被完整比較。

來源

  1. RAG-Safety-Bench: Reliable Evaluation of Retrieval-Augmented LLM Safety
  2. RAG-Safety-Bench repository
  3. RAG-Safety-Bench paper index