AI 安全與預訓練
SPP 從首個 token 植入價值反思,3B 模型的 OOD 風險差距擴至 19 點
Synthetic Persona Pretraining 把依據「價值憲章」生成的第一人稱反思寫入約 10% 預訓練文件,再以後訓練把該人格綁定至助理身份。新公開的完整實驗、權重與資料顯示,提早介入主要改善價值泛化,抵抗一般 jailbreak 則未必需要從零開始。

EPFL 等機構正式公開 [Synthetic Persona Pretraining(SPP)論文](https://arxiv.org/abs/2608.13482)及完整實驗產物,將五月份的初步 1.7B 結果擴展至 3B 參數、500B token。方法先用包含尊嚴、安全、誠信、私隱及治理等 35 條規則的憲章,為約 10% 預訓練文件生成第一人稱價值反思;反思置於特殊 `<assistant>` token 後並插入文件不同位置,模型仍以標準交叉熵共同學習原文與反思。
研究比較未修改語料、移除有害文件、只在訓練末段加入反思,以及由首個 token 開始加入反思等五組資料匹配模型,並給予相同的 persona-binding SFT。由首個 token 介入相對只做 midtraining 的模型,在 3B 規模上把 AIRisk 道德困境的優勢由小規模實驗約 4 點擴至 19 點,ConstitutionEval-Hard 優勢亦由約 7 點增至 14 點。所有 SPP 版本的 jailbreak 成功率均低於基線,但只在末段加入反思的版本同樣很強,顯示拒答機制與深層價值偏好可能是兩個不同問題。
工程價值在於可重現性:[GitHub](https://github.com/epfl-dlab/spp)已提供資料生成、Megatron-LM 訓練及評估管線,[Hugging Face](https://huggingface.co/dlab-spp)亦上架兩種規模的五組 base、instruct 與中途 checkpoint,以及約 5,140 萬筆反思資料。不過結果仍只到 3B,價值憲章、合成標註器與模型裁判都可能引入同源偏差;而且一旦後訓練格式無法喚起預訓練人格,增益會明顯縮小。下一步應觀察此效果能否跨越不同 chat template、RL 訓練及惡意微調,並在更大模型上維持。