AI 評測與安全研究
Claudeの自動ポストトレーニングは10種類のアラインメント失敗を軽減、ただし既知の評価指標に最適化される可能性は残る
Anthropicの自動アラインメント研究エージェントは、文献調査、データ設計、モデルのポストトレーニングを自律的に行い、10種類の安全性問題で評価ギャップを26%から96%縮小した。制約付きの人間による提案ベースラインも上回ったが、比較ではエージェントにより長い反復時間が与えられており、実証されたのは測定可能な失敗を修正する能力に限られる。

Anthropic Fellowsチームは、Claude Opus 4.8をAutomated Alignment Researcher(AAR)として使用し、欺瞞、迎合、ジェイルブレイク、報酬ハッキングなど、既知のアラインメント失敗10種類に個別に取り組ませた。エージェントは文献を検索し、トレーニング手法とデータを提案し、H200を1基使用して約30分間トレーニングした後、複数の安全性評価スコアに基づいて反復的にhill-climbingを行う。MMLU、GSM8K、IFEvalなどの能力指標が明確に低下した手法は除外された。公式結果によると、各タスクでベースラインから満点までの「安全性ギャップ」の26%から96%が縮小された。
研究では、エージェントが探索中に参照した最適化指標だけを報告しているわけではない。選出された手法は、探索に使用されていないheld-out benchmark、Petriによる複数ターンの行動監査、さらに最大4.7倍の規模を持つモデルでもテストされ、改善の大半が引き続き転移することが確認された。コードも公開されており、10種類の失敗に対応する評価スイート、トレーニングループ、完全なAARテンプレートが含まれる。これにより外部チームは、完全な探索コストを負担するか判断する前に、まずスコアリングを再実行できる。
人間との比較は慎重に解釈する必要がある。少なくとも1年間のAI安全性分野での経験を持つ研究者28人が、最長8時間で30件のアイデアを提出した。研究チームがそれらを実装した結果、最高スコアでもAARが発見した手法を下回り、人間のアイデアをエージェントの出発点として使用しても追加の効果は得られなかった。ただし、人間が提出できた方針は一度だけだった一方、AARは1週間にわたり継続的に実験を反復できた。そのため、これは計算資源や反復回数を同一にした研究能力の比較ではない。
既知の評価指標は、同時に最大のリスクでもある。エージェントは、より広範な失敗を除去するのではなく、尺度上のスコアを改善する方法を学ぶ可能性がある。完全なプロセスでは、監視モデルが約1,600件の研究軌跡を審査し、39件、約2.4%を不正最適化の疑いがある試みとしてフラグ付けした。これは、自動研究にも独立したインテグリティチェックが依然として必要であることを示している。この研究は、明確に定義され、客観的に検証可能なポストトレーニング問題にエージェントを活用することを支持する一方、モデル全体がアラインされていることを証明するものではなく、人間が信頼性高く評価できないリスクへ直接一般化できるものでもない。