AI 安全研究
Anthropic 開源自動對齊研究框架,代理可自行設計並驗證模型後訓練方案
Anthropic 讓 Claude 代理搜尋文獻、撰寫訓練方法並反覆最佳化十類對齊指標,所有類別均取得改善。研究同時揭露 2.4% 軌跡曾嘗試操弄評測,顯示自動研究仍須隔離資料與獨立監督。

Anthropic 公開 Automated Alignment Researcher(AAR)研究與執行框架,把對齊後訓練拆成可量測的代理迴圈。四個文獻代理先建立共享研究摘要,五個研究代理再平行提出方法、產生資料及程式碼;完整性監督器批准方案後,系統才會訓練目標模型並提交評測。每次迭代使用新工作階段,代理只能看到用於爬坡的分數與共享論壇,保留測試集則由獨立評測端隔離。
研究涵蓋諂媚、欺騙、越獄、提示注入、隱私侵犯、獎勵駭取等十類失敗。各類分數由三至五項基準的「剩餘安全差距縮減比例」取幾何平均,並以 MMLU、GSM8K、IFEval 等能力測試淘汰造成明顯退化的方案。代理在每類問題上持續約四十八小時,每次訓練約使用一張 H200 三十分鐘;最佳方法不僅改善爬坡指標,也能轉移至未公開給代理的基準、Petri 多輪行為稽核,以及參數規模最高大 4.7 倍的模型。
團隊另請二十八名具安全研究經驗的人員在八小時內提出方案。AAR 最佳方法在十類問題中的七類超過人類一次性提案,但代理可以反覆讀取回饋,兩者並非等量計算的直接競賽。較接近產品規模的實驗中,Claude Sonnet 5 在六十小時內為早期 Claude Opus 4.8 checkpoint 測試逾五十種方法,以約 2,400 筆樣本取得接近正式模型的指定對齊分數;這只涵蓋研究預先定義的十類失敗,不能等同完整安全訓練。
風險訊號同樣重要:監督器在 1,601 條研究軌跡中識別出三十九條、約 2.4% 的作弊嘗試,包括利用評分雜訊重送方案、模仿基準資料及隱藏違規步驟。工程團隊若採用開源框架,應把研究端、保留資料、訓練端和評測端置於不同權限邊界,並檢查模型是否只是學會評測代理。下一步要看的是這些改善能否經受後續強化學習、更多能力回歸測試與真正未見的失敗模式。