AI 評測與後訓練
MIST 以四種配對情境測試「選擇性信任」,誤導訊息令 23 款模型平均掉 17.1 分
MIST 不只測試模型能否抵抗錯誤提示,也檢查它是否仍會採納正確的外部資訊。配套方法 SCOPE 將 Qwen3-4B 的正確轉錯誤率由 35.0% 降至 16.3%,但目前只在兩個小型開放模型家族完成訓練驗證。

語言模型接上搜尋、RAG 或使用者回饋後,真正需要的能力不是一律拒絕外部資訊,而是判斷何時應該信任。8 月 6 日公開的 [MIST/SCOPE 研究](https://arxiv.org/abs/2608.06377)因此把同一道題改寫成四個配對版本:沒有附加資訊的 clean、暗示錯誤答案的 misleading、提供正確線索的 correct-context,以及內容相近但無關的 irrelevant-context。MIST-1000 共含 1,000 道經兩階段人工審查的題目、4,000 筆情境資料;其中 800 題改編自既有推理基準,另有 200 題由人員新寫。
團隊另提出 SC2W 指標,只計算模型原本答對、加入誤導訊息後卻改答錯誤的案例。23 款 API 與開放權重模型全部受到影響,誤導情境使準確率平均降低 17.1 個百分點;即使 GPT-5.5 的 clean 準確率達 96.0%,SC2W 仍為 10.5%。這比單看誤導情境準確率更有辨識力,因為完全忽略上下文的模型也可能看似「穩健」,卻無法利用真正有用的檢索結果。
後訓練方法 SCOPE 沒有發明新損失函數,而是從 clean 答對、misleading 答錯的樣本建立偏好對,再將四種情境等量送入標準 DPO。Qwen3-4B 的 SC2W 從 35.0% 降至 16.3%,Llama-3.2-3B 則由 31.5% 降至 20.6%;兩者的 clean、正確及無關情境準確率均未下降。程式庫公開 LoRA-DPO、vLLM 評測、逐題 bootstrap 信賴區間與資料驗證流程,方便重跑。
工程上可把這套配對測試加入 RAG 或代理回歸測試:同一問題分別注入正確、錯誤與無關文件,避免只量測「有無檢索」的平均分。不過 MIST 是受控的純文字診斷,不能代表實際部署中的錯誤頻率;訓練結果也僅涵蓋兩個小模型家族,多數題目源自公開基準,資料污染仍無法完全排除。