AI safety research
SAILS 顯示後門成敗取決於毒化樣本組合,隨機抽樣可能低估最壞風險
新研究在固定模型、乾淨資料與毒化數量後,僅更換毒化樣本組合,就讓 Llama 3 8B 的攻擊成功率落在 3% 至 80%。SAILS 以少量昂貴微調評測訓練集合評分器,再從數百萬候選組合中挑出高風險集合。

9 月 14 日公開的《Pick Your Poison》挑戰了後門研究常見的評測方式:固定毒化樣本數量後,從候選池隨機抽取若干集合,再用平均攻擊成功率代表模型風險。研究團隊在三種 Llama 3 8B 指令後門設定中發現,模型、乾淨資料與毒化數量完全相同時,只改變被選中的樣本,攻擊成功率便可從 3% 跨到 80%。換言之,隨機抽樣量到的可能只是平均案例,而不是有搜尋能力攻擊者可達到的最壞案例。
研究提出 SAILS,將問題定義為受 oracle 預算限制的集合最佳化。系統先對隨機毒化集合執行少量完整的「微調—觸發測試」,取得昂貴但直接的標籤;接著以集合內原始文字訓練輕量評分器。每輪由評分器低成本排序數十萬至數百萬個候選集合,只把排名最高的一小批送回完整微調 oracle 驗證,再用新結果校正評分器。這種 propose、score、audit 迴圈可捕捉多筆樣本共同出現時的交互作用,與逐筆梯度或 influence score 後直接取前 k 名不同。
論文報告,SAILS 在未參與訓練的集合上,平均比最強 influence baseline 提高 30 個百分點的攻擊成功率,並從小規模搜尋轉移至完整微調設定。作者也把方法延伸到 Qwen3-4B 的自然語言轉 shell 指令、WebShop 多輪代理,以及透過託管 API 產生候選資料的情境。公開儲存庫包含 LoRA 微調、held-out ASR 評測、TRAK 與 SGD 等基線,以及可重跑的資料與組態。
這不是證明所有微調資料都能被少量樣本攻破。結果集中於指定觸發器、受控候選池與少數模型;集合評分器本身也依賴數百次微調評測,完整實驗每次 oracle 在 H100 上約需 30 至 60 分鐘。基於負責任發布,作者未提供預先組好的毒化集合或已植入後門的權重。對防禦方更直接的意義,是資料稽核與紅隊測試應報告跨集合分布及搜尋後的極端值,不能只依賴隨機毒化平均數。