返回首頁

代理安全/強化學習評估

HERALD 揭露搜尋代理可引用未檢索段落,單一成員檢查將實測攻擊率降至零

HERALD 以同題反事實編輯稽核搜尋代理獎勵,發現真實但未曾檢索的引用可在基礎評分下取得不低於原軌跡的分數。加入一項引用—檢索集合成員檢查後,593 個合格問題未再觀察到成功攻擊,但強化訊號只出現在 0.03% 訓練軌跡。

DeFacto · CC BY-SA 2.5 · Image source
zh-Hant

搜尋代理的獎勵通常同時混合答案正確性、引用支持度、工具成本、格式及反作弊項目。HERALD 的核心發現是,總分看似完整仍可能允許「引用洗白」:保留答案與搜尋紀錄不變,只把引用換成語料庫中確實存在、但代理從未檢索到的段落。因為其他獎勵或被移除的懲罰可以抵銷違規項,分數不一定下降。

研究者把獎勵函式視為可接受配對單元測試的程式,分別建立刪除搜尋、偽造不存在的引用 ID,以及換入真實但未檢索 ID 三種同題介入。他們在 HotpotQA、2WikiMultiHopQA 與 MuSiQue 的四組 Qwen3-8B 軌跡池上,先排除原本已違規或介入同時改變其他條件的樣本,留下 593 個問題叢集。基礎獎勵已能拒絕刪除搜尋與假 ID;但不使用標籤的詞彙攻擊仍有 4.30% 成功率,離線 oracle 從八個候選挑選時達 6.66%。BM25 候選擴至 16 個後,oracle 上界更達 13.74%。

完整枚舉三個偵測器的八種組合後,最小修補不是加入更多規則,而是加強 `L`:檢查引用 ID 是否實際出現在先前檢索集合。加入後沒有觀察到成功攻擊,單側 95% 上界為 0.50%。相反地,包含更多 oracle 標註懲罰的完整規則仍有 3.37% 攻擊率,因為替換引用可能同時移除既有懲罰,說明規則越多不保證單調變安全。

在每組約 500 萬生成 token 的配對 Search-GRPO 實驗中,新獎勵使三套資料的平均引用精確率提高 2.02 點、支持召回提高 1.46 點,不受支持引用減少 1.69 點;但 MuSiQue 未通過答案 EM 的非劣性門檻。更重要的是,`L` 只觸發 58,368 條訓練軌跡中的 18 條,部分訊號還被群組正規化抵銷。這套稽核只能證明封閉語料與結構化 ID 下的評分漏洞;它不能驗證引用是否語意支持答案,也尚未涵蓋即時網路搜尋、自由格式引用與語料污染。

來源

  1. HERALD: Counterfactual Audits and Minimal Repairs for Proof-of-Retrieval Rewards
  2. HotpotQA Homepage and Evaluation Resources