返回首頁

AI 評測與安全

MIST 測出 23 款模型皆受錯誤提示影響,SCOPE 將 Qwen3-4B 答案翻轉率由 35.0% 降至 16.3%

新基準用四種配對情境區分模型是正確判斷證據,還是索性忽略所有外部資訊。SCOPE 只改造 DPO 的偏好資料配置,降低錯誤情境造成的答案翻轉,同時維持正確與無關情境下的準確率。

Nigel Jones · CC BY-SA 2.0 · Image source
zh-Hant

語言模型接收檢索文件、使用者意見或解題提示後,究竟是在評估證據,還是服從看似權威的文字?MIST-1000 將同一批 1,000 道推理題各自改寫成無額外資訊、錯誤提示、正確提示及無關資訊四個版本,問題、選項與標準答案均保持不變。研究者再提出 SC2W 指標,只統計模型原本答對、加入錯誤訊號後卻改答錯的案例,避免把模型本來不會的題目算成情境脆弱性。

23 款 API 與開放權重模型都出現答案翻轉,錯誤訊號使準確率平均下降 17.1 個百分點。GPT-5.5 的 SC2W 仍為 10.5%,Qwen3-4B 則達 35.0%。研究團隊因此提出 SCOPE:先找出基礎模型「無提示答對、錯誤提示答錯」的軌跡,建立正確與跟隨錯誤訊號的完整回答配對,再把同一配對平均分配到四種情境,以標準 sigmoid DPO 和 LoRA 訓練,而未發明新的最佳化損失。

SCOPE 將 Qwen3-4B 的 SC2W 降至 16.3%,Llama-3.2-3B 由 31.5% 降至 20.6%;兩者的乾淨、正確情境及無關情境準確率均未下降。相較之下,只用錯誤情境訓練的標準 DPO,會把 Llama-3.2-3B 的正確情境準確率由 78.5% 壓到 56.4%,暴露「全面不信任上下文」的副作用。程式、訓練資料與評測資料已公開。

這仍不是提示注入防禦的部署證明:MIST 是受控、純文字診斷,800 題改編自既有公開基準,而且主要緩解實驗只涵蓋兩個小型模型家族、單一解碼種子。工程團隊應關注此方法能否延伸到真實 RAG 文件、工具輸出及多輪代理,以及降低 SC2W 是否會犧牲新知更新能力。

來源

  1. Learning When to Trust via Selective Context Preference Optimization
  2. SCOPE: Selective Context Preference Optimization
  3. worldbench/SCOPE
  4. worldbench/MIST-Bench