返回首頁

AI 安全與不確定性

小型模型自報信心難以直接控風險,22 組設定僅三組通過 20% 錯誤上限

新研究在 11 款開放權重模型上檢驗「模型自報信心」能否決定何時轉交人工。Platt 校準雖可把 ECE 降至最低 0.02,嚴格的有限樣本驗證仍在 10% 風險上限下拒絕所有自主作答設定。

Aliharchick · CC BY-SA 4.0 · Image source
zh-Hant

部署小型本地模型時,常見做法是要求模型同時輸出答案與信心,再以門檻決定是否轉交人工。[最新研究](https://arxiv.org/abs/2608.05064)測試 Qwen2.5、Llama 及 Gemma 三個家族共 11 款、0.5B 至 14B 的指令模型,在 ARC-Challenge 與 [TruthfulQA](https://github.com/sylinrl/TruthfulQA)累積 25,168 次本地預測,結果顯示校準可以修正數值含義,卻無法讓信心更會辨認錯誤。

原因在於溫度縮放、Platt scaling 等嚴格單調轉換不會改變樣本的信心排序,因此風險—覆蓋率前緣與錯誤偵測 AUROC 維持不變。若模型所有自報信心都高於 0.5、實際準確率卻低於 0.5,溫度縮放甚至存在無法突破的 ECE 下限。22 個模型—任務組合中有八組逼近這個理論下限;相較之下,Platt scaling 在部分設定把 ECE 降至 0.02,但這只代表「0.9」更接近九成正確,並未增加正確與錯誤答案的可分性。

研究再以每組 200 題校準資料及 Clopper–Pearson 上界建立有限樣本風險憑證。錯誤率上限設為 20% 時,只有 Qwen2.5-7B 的 ARC,以及 Qwen2.5-14B 的 ARC、TruthfulQA 獲准自主回答;收緊至 10% 後沒有任何組合通過。ARC 學到的門檻直接移到 TruthfulQA,所有受測模型亦超出風險預算或完全拒答。

對工程團隊而言,信心校準應按模型與任務分別完成,並把「無可驗證門檻」視為正常結果。研究只涵蓋兩個選擇題基準、量化模型與零溫度解碼,而且憑證依賴校準及部署資料獨立同分布;遇到領域漂移、自由生成或工具代理時,保證不能直接沿用。

來源

  1. Provable Limits and Certified Deferral for Verbalized Uncertainty in Small Language Models
  2. TruthfulQA benchmark and dataset
  3. ARC: A Dataset of 7,787 Genuine Grade-School Level, Multiple-Choice Science Questions