返回首頁

AI 安全

LatentGuard 將安全推理壓縮至連續狀態,關鍵路徑由 268.56 個文字 token 降至 1.60 個

LatentGuard 不在每次審查時生成完整安全理由,而是以分階段訓練把理由壓縮成少量潛在狀態並直接輸出判定。獨立稽核解碼器可按需還原簡短說明,但其可解釋性與效率目前只有作者實驗支持。

Office of the Vice President of the United States · Public domain · Image source
zh-Hant

具推理能力的安全守門模型通常會先生成風險分析,再決定輸入或輸出是否允許。這類明示理由有助於複雜案例判斷與稽核,代價是每一次請求都要解碼數百個額外 token;對位於所有模型呼叫前後的內容審查層而言,這會直接增加延遲、GPU 佔用與服務成本。

LatentGuard 嘗試把安全推理移出文字空間。它先以任務對齊的文字理由訓練模型,再透過分階段課程把這些推理逐步壓縮成連續潛在狀態,最後由狀態直接預測安全判定。與單純省略理由不同,框架另設隔離的輔助解碼器:一般請求不啟動它,只有稽核或抽查時才把潛在表徵轉成簡短的審查材料。這項分離讓線上關鍵路徑追求低成本,同時保留事後檢視介面。

論文報告,LatentGuard-8B 的平均加權 F1 為 84.91,高於 GuardReasoner-8B 的 83.95;關鍵路徑的推理量則從平均 268.56 個生成理由 token 降至 1.60 個潛在推理 token。作者另為稽核解碼器報告 85.75 的 audit utility 分數。若結果可重現,內容過濾器可不必在「完整理由」與「低延遲分類器」之間二選一,尤其適合高吞吐模型閘道與代理工具授權層。

但連續狀態本身並不天然可解釋,稽核文字仍由另一個生成器產生,未必忠實反映實際判定依據。部署者還需確認對分布外攻擊、混合語言、長上下文及新型越獄的表現,並測量真實硬體上的延遲與記憶體收益。論文也尚未提供公開權重或程式碼,因此目前應視為有潛力的架構結果,而非可直接替換既有守門服務的成熟元件。

來源

  1. LatentGuard: Efficient and Inspectable Latent Reasoning for LLM Safeguards
  2. LatentGuard arXiv DOI record