AI 安全與預訓練
SPP、最初のtokenから価値観の内省を埋め込み、3BモデルのOODリスク差を19ポイントに拡大
Synthetic Persona Pretrainingは、「価値憲章」に基づいて生成した一人称の内省を事前学習文書の約10%に組み込み、さらに後学習によってそのペルソナをアシスタントのidentityに結び付ける。新たに公開された完全な実験結果、weights、データは、早期介入が主として価値観の汎化を改善する一方、一般的なjailbreakへの耐性には必ずしもゼロからの介入が必要ではないことを示している。

EPFLなどの機関は、[Synthetic Persona Pretraining(SPP)の論文](https://arxiv.org/abs/2608.13482)と完全な実験成果物を正式に公開し、5月に発表した予備的な1.7Bモデルの結果を、3B parameters、500B tokensへと拡張した。この手法ではまず、尊厳、安全性、誠実性、プライバシー、ガバナンスなどに関する35のルールを含む憲章を用いて、事前学習文書の約10%に一人称の価値観に関する内省を生成する。内省は特殊な`<assistant>` tokenの後に配置され、文書内のさまざまな位置へ挿入される。モデルは引き続き標準的なcross-entropyにより、原文と内省を共同で学習する。
研究では、未変更のcorpus、有害文書を除去したcorpus、学習の終盤にのみ内省を追加したcorpus、最初のtokenから内省を追加したcorpusなど、データ量を揃えた5種類のモデルを比較し、すべてに同一のpersona-binding SFTを適用した。最初のtokenから介入したモデルは、midtrainingのみを行ったモデルと比べ、3B規模のAIRisk倫理的ジレンマ評価における優位性が、小規模実験の約4ポイントから19ポイントへ拡大した。ConstitutionEval-Hardでの優位性も、約7ポイントから14ポイントへ伸びた。すべてのSPP版でjailbreak成功率はbaselineを下回ったが、学習終盤にのみ内省を追加した版も同様に高い性能を示した。この結果は、拒否メカニズムと深層的な価値選好が別々の問題である可能性を示唆している。
エンジニアリング上の価値は再現性にある。[GitHub](https://github.com/epfl-dlab/spp)ではデータ生成、Megatron-LMによる学習、評価の各pipelineが公開され、[Hugging Face](https://huggingface.co/dlab-spp)には2つのモデル規模について、それぞれ5種類のbase、instruct、中間checkpointに加え、約5,140万件の内省データも公開されている。ただし、結果は依然として3B規模までに限られており、価値憲章、synthetic annotator、model judgeのすべてが同一ソースに由来するbiasを持ち込む可能性がある。また、後学習のformatで事前学習済みのペルソナを呼び起こせない場合、改善幅は明確に縮小する。次の段階では、この効果が異なるchat template、RL training、悪意あるfine-tuningをまたいでも成立し、より大規模なモデルでも維持されるかを検証する必要がある。