AI safety research
Model Hypnosis 疊加無關文字線索,令推理模型的二元答案機率大幅翻轉
新研究以加性 log-odds 模型量度改寫、錯字、動物名稱及 JSON 欄位的微弱偏向,再把同方向線索組合成提示。部分最佳化提示可跨模型轉移,但目前實驗集中於人工設計的二元選擇題。

賓夕法尼亞大學研究者提出「Model Hypnosis」,測試普通文字選擇能否像對抗擾動般累積。方法先建立含多個可替換位置的提示模板,例如20句故事各有10種語意近似改寫、不同錯字版本、動物清單或看似無關的JSON中繼資料;接著對數千個隨機組合取樣,以加性模型估計每個片段對兩個答案之 log-odds 的微小貢獻,再把方向一致的片段疊加。這不是直接加入「回答是」之類指令,而是搜尋表面上不提供問題證據的措辭。
[論文](https://arxiv.org/abs/2608.16834)展示,在Qwen3-8B的道德二元題中,逐句選擇保持語意的改寫,可把回答「否」的94%基線翻成回答「是」的99.93%。另一個動物清單實驗僅更換十個動物,便令Qwen2.5-14B偏向兩個數字中任一方的機率各達0.993。研究亦測試推理模型:GPT-5.6-terra的錯字組合令「是」機率由0.31升至0.87,Gemini-3-Flash的動物清單令選擇5的機率由0.01升至0.99;這些數字均以最終候選之外的100次新生成估算。16款非推理模型的交叉測試中,多數來源—目標配對保留線索的方向,動物線索以及部分改寫、JSON線索的轉移率顯著高於隨機。
安全含意不是任何錯字都能穩定操控模型,而是大量微弱提示敏感度可被量測及組合,傳統只掃描明顯越獄字串的防線可能看不到它。作者公開了[程式、提示庫及約280MB結果封存](https://github.com/eboix/model_hypnosis),可重建圖表或重新跑完整16×4×3實驗網格。現階段評測仍以「5或7」、電車問題及自我意識等受限二元輸出為主;下一步需確認自由生成、工具選擇及長時代理行動是否同樣可被控制,並測試正規化、語意重寫或隨機化解碼能否削弱跨模型轉移。