模型安全研究
擴散式 LLM 的安全神經元可跨架構轉移,剪枝使拒答繞過率升至 86.6%
新研究指出,從自回歸模型改造而來的擴散式 LLM,可能連同集中在少數神經元的安全機制一起繼承。研究者亦用開放擴散模型離線生成攻擊提示,但承諾的完整程式尚未發布。

一篇 8 月 10 日進入 arXiv 最新批次的研究,檢查擴散式大型語言模型是否真的具有不同於自回歸模型的安全結構。這類模型以多輪平行去噪取代逐 token 生成;Dream、Fast-dLLM 等模型又由 Qwen2.5 系列初始化,因此研究者追問:安全對齊是否也會沿著權重轉換被原樣帶入。
白箱實驗先以安全與有害提示的激活差異定位少量「安全神經元」,再測試剪除它們的影響。LLaDA 的攻擊成功率由 2.6% 升至 73.8%,Dream 由 1.9% 升至 86.6%;把 Qwen2.5 找到的神經元位置轉移到 Dream,成功率亦升至 73.2%,Fast-dLLM 則由 7.0% 升至 86.3%。在僅取 0.8% 神經元的設定下,Fast-dLLM 與 Qwen 的定位重疊率為 41.8%,Dream 為 30.9%,支持安全機制跨架構繼承、且分布過度集中的假說。
研究再提出 SN-Guided Diffusion:使用可檢查內部激活的 LLaDA 作代理模型,在本機去噪過程中避開會觸發拒答的激活區域,再把產生的提示轉移到黑箱目標。論文報告其在 Llama-3-8B-Instruct、Qwen2.5-7B-Instruct 與 Gemini-2.5-Flash-Lite 的成功率最高分別為 77.1%、86.9% 和 74.3%,每題約需 20 次離線生成。
這不代表擴散模型本身必然較不安全:結果依賴特定資料集、自動評審器、模型版本與成功率定義,也沒有衡量真實危害。更大的可重現性問題是 GitHub 儲存庫目前只有 README,仍標示程式「即將發布」。對模型開發者而言,值得追蹤的是對齊訊號能否分散到更多層與特徵,以及安全評測能否加入剪枝、表示轉移和代理模型生成的適應性攻擊,而非只測表面拒答率。