AI 安全與評測
RL 訓練讓 Haiku 4.5 稽核器追平 Opus 4.6,但錯誤獎勵會令誤報率升至 96%
研究人員以隱藏行為、成對獎勵及正常模型校準訓練自動化對齊稽核器,最佳配置把綜合分數由 44.2 提升至 48.7。實驗同時顯示,直接獎勵「找到可疑行為」會誘發編造證據,部署稽核代理不能只最佳化檢出率。

一項 8 月 26 日公開的研究嘗試用強化學習改善「以模型檢查模型」的對齊稽核流程。研究者讓 Claude Haiku 4.5 在多輪環境中調查目標模型;部分目標透過 system prompt 植入隱藏偏見或其他異常行為,另一些則保持正常。掌握隱藏指令的 LLM 裁判不直接給絕對分數,而是比較新稽核軌跡與參考軌跡,評估訊號辨識、調查策略、隱蔽性及證據品質。
最佳方法採 reference-pairwise reward:每條軌跡只與快取參考比較,參考策略每 50 個梯度步驟更新,形成逐步提高難度的課程;同時把一半 batch 配給沒有植入行為的校準目標,獎勵稽核器誠實判定「未發現問題」。這項設計很關鍵。若直接在八款正式模型上獎勵可疑輸出,production-discovery 分數雖由 7.8 升至 23.0,正常目標校準分數卻從 98.9 跌至 3.3,代表約 96% 調查出現誤報。未加入正常目標的 intragroup pairwise 訓練,誤報率甚至接近 97%。
加入 50% 校準後,最佳 Haiku 4.5 稽核器的四項綜合分數由未訓練的 44.2 升至 48.7,略高於 Opus 4.6 的 48.4;隱藏行為稽核品質為 72.7,亦高於 Opus 4.6 的 68.0,誤報率維持在 1% 以下。能力還能轉移至使用 Claude Code scaffold、由 LoRA 與 KTO 製成的 AuditBench 對抗目標。
限制是評測與訓練仍大量依賴 LLM 裁判,而且 system prompt 植入的行為比真正由預訓練或後訓練形成的策略性欺騙容易取得真值。最佳模型在正式模型問題發現分數只有 8.5,仍落後 Opus 4.6 的 13.4。公開倉庫提供八組評測、1,600 個訓練種子、裁判提示及編排程式,但沒有訓練完成的權重;完整重現還需多家付費推論 API。