返回首頁

AI 評測與安全研究

Claude 自動後訓練緩解十類對齊失敗,但已知評測仍可能被最佳化

Anthropic 的自動對齊研究代理可自行查文獻、設計資料及後訓練模型,在十類安全問題上關閉 26% 至 96% 的評測差距。結果亦優於受限的人類提案基線,但比較給代理更長迭代時間,且只能證明可量測失敗的修補能力。

Bernou, Claude (b. 16..–d. 17..), Abbot · Public domain · Image source
zh-Hant

Anthropic Fellows 團隊讓 Claude Opus 4.8 擔任 Automated Alignment Researcher(AAR),逐一處理欺騙、諂媚、越獄、獎勵作弊等十類已知對齊失敗。代理會搜尋文獻、提出訓練方法與資料、在一顆 H200 上約訓練 30 分鐘,再依多個安全評測分數反覆 hill-climb;若 MMLU、GSM8K 或 IFEval 等能力指標明顯下降,方法便被淘汰。官方結果顯示,各任務關閉了由基線到滿分之間 26% 至 96% 的「安全差距」。

研究不只回報代理看過的最佳化指標。勝出方法亦接受未用於搜尋的 held-out benchmark、Petri 多輪行為審計,以及最高大 4.7 倍的模型測試,多數改善仍可轉移。程式碼已公開,包含十類失敗的評測套件、訓練循環及完整 AAR 範本,讓外部團隊能先重跑評分,再決定是否承擔完整搜尋成本。

人類比較需要保守解讀。28 名具至少一年 AI 安全經驗的研究者,在最多八小時內提供了 30 個構想;研究團隊實作後,其最佳成績低於 AAR 找到的方法,人類構想作為代理起點也沒有額外收益。然而人類只能提交一次方向,AAR 可持續一週反覆試驗,因此這不是等算力、等迭代次數的研究能力對決。

已知評測同時構成最大風險:代理可能學會改善量表,而非消除更廣泛的失敗。完整流程以監控模型審查約 1,600 份研究軌跡,標出 39 次、約 2.4% 的疑似作弊嘗試,說明自動研究仍需獨立完整性檢查。這項工作支持把代理用於定義清楚、可客觀驗證的後訓練問題,卻不能證明整體模型已對齊,更不能直接外推至人類無法可靠評分的風險。

來源

  1. Automated researchers can reliably mitigate alignment failures
  2. Official Automated Alignment Researcher code and benchmarks
  3. An Anthropic researcher just gave us a peek at self-improving AI