模型與 AI 安全
Shieldstral 將審核政策寫進查詢,3B 多模態模型在文字安全評測平均 F1 達 84.9%
Shieldstral 把內容審核統一成可由自然語言指定的二元問答,讓同一模型依產品情境切換判斷標準。論文報告其文字與多模態平均 F1 分別達 84.9% 與 83.8%,但模型權重與完整推論套件尚未同步公開。

Mistral AI 研究團隊公開 Shieldstral,一款以 Ministral-3B-Base-2512 為基礎的 30 億參數多模態安全分類器。它不把輸入硬套進固定的「暴力、仇恨、色情」標籤,而是接收一段自然語言政策查詢,例如「內容是否鼓勵暴力」,再針對文字、圖像或兩者組合輸出 yes/no 的正規化機率。這使同一段內容可依兒童服務、資安研究或一般聊天產品的不同政策重新判斷。
訓練資料約 5,410 萬筆,包括 4,520 萬筆公開文字資料、440 萬筆合成對比樣本及 450 萬筆多模態樣本。團隊把異質資料集轉成 instruction、query、document 三欄格式,並將同一內容配對相關與不相關的危害查詢,迫使模型辨識具體政策,而非只學會粗略的安全/不安全分界。模型以 LoRA 分別訓練公開資料與加入合成資料的 checkpoint,再透過 SLERP 與基礎 instruction 模型合併。
在涵蓋 16 個基準、21 個資料切分及 10 個比較模型的官方實驗中,Shieldstral 的文字安全平均 F1 為 84.9%,多模態平均 F1 為 83.8%;使用獨立設計、沒有一對一沿用訓練標籤的細粒度政策測試時,F1 為 91.3%。對工程團隊而言,這種介面可減少每套產品重新訓練分類頭的需求,也能把政策版本直接納入請求與稽核紀錄。
限制是所有數字目前來自作者自評,部分測試資料同樣由 LLM 生成及驗證,可能保留共同偏差;固定 0.5 門檻也不適合直接套用至誤殺成本差異很大的場景。截至發布時,論文提供完整方法,但未見對應權重或可重現推論程式。後續應觀察權重授權、延遲與校準曲線,以及面對提示注入、政策矛盾和中文隱晦表述時是否仍然穩定。