返回首頁

AI 評測與安全

QuantiBias 指出量化模型可通過短式安全測試,開放式回答卻仍產生約四分之一刻板印象

QuantiBias 將模型與提示固定,只改變權重精度,測量量化前後的多語開放式偏見、拒答與選擇題表現。作者發現常見短式安全指標大致持平,但獨立評審模型仍把約 24% 至 27% 的開放式回答判為支持刻板印象。

Simon Tonge · CC0 · Image source
zh-Hant

新公開的 QuantiBias 基準把後訓練量化視為需要重新執行安全評估的部署變更,而非純粹的數值最佳化。其方法固定模型架構、訓練與提示,只替換不同精度的權重,再並列測量有害請求拒答、正常問題過度拒答、選擇題偏見,以及模型在八種語言中主動產生刻板印象的比例。

作者在 Qwen3.6-27B 的量化階梯上報告,StrongREJECT 直接拒答率約維持 0.98,XSTest 過度拒答與 BBQ 選擇題分數也大致不變;然而由不同模型家族的 Claude Sonnet-5 擔任評審時,開放式 MBTP 回答的刻板印象支持率約由 24% 升至 27%。第二個 Gemma-4-31B 骨幹則由 27.6% 升至31.7%,另一個生成式 CEB 測試由 13.5% 增至 37.6%。研究的核心結論不是所有壓縮層級都單調惡化,而是短答案檢查可能完全看不到生成行為的偏移。

公開工具可重新組合八個上游基準、產生推論結果、以跨模型評審標記立場與嚴重度,並從 GGUF 檔案計算實際 bits per weight。這點很重要,因為作者指出名義上的量化標籤可能低估整體儲存成本;部署團隊應以實際成品而非量化方法名稱比較風險。

但結果高度依賴 LLM 評審、提示抽樣與社會文化分類。作者也承認「偏見是否隨壓縮持續增加」會因評審而異;目前 Hugging Face 資料檢視器還出現結構轉換錯誤。工程團隊宜使用不同家族的多個評審、人工抽查及產品實際語言分布重測,不能把單一百分比當成安全認證。

來源

  1. QuantiBias: Benchmarking Quantization-Induced Bias in LLMs
  2. QuantiBias benchmark protocol and reproducibility artifacts