返回首頁

AI 推論與安全

Speculative Probing 重用 MTP 草稿頭,以少量軟提示執行即時 LLM 安全監測

Cornell Tech 研究者把原供推測解碼使用的 MTP/Eagle3 模組改造成序列分類器,毋須重跑主模型。方法只訓練約 1.6 萬至 2 萬個參數,但效能取決於草稿頭品質及數千筆任務標註。

NASA/JPL/ESA/SSI and M. Malaska/B. Jonsson · Public domain · Image source
zh-Hant

即時檢查提示注入、有害內容或推理迴圈,通常要在便宜但資訊有限的 hidden-state probe,以及必須另跑一次 Llama Guard 類模型之間取捨。Cornell Tech 團隊提出 Speculative Probing,改用 Qwen3.5 的多 token 預測(MTP)頭或 MiniCPM4.1 的 Eagle3 草稿頭處理分類。它在輸入尾端附加一至五個可訓練軟提示,遞迴執行單層草稿頭,再以線性 sigmoid head 輸出二元分類;主模型與草稿頭權重全數凍結。

關鍵在於推測解碼已替完整前綴建立草稿頭 KV cache。監測器只新增數個 query,作者估算每項額外分類任務的邊際推論成本可低於 1%,且暫存位置不寫回正式解碼快取,因此不改變草稿接受率。Qwen3.5-27B、五個軟提示的版本僅訓練約 1.8 萬個參數,相比逐 token 處理中間層的 MultiMax 更輕。

四項測試涵蓋指令衝突、思考重複、分支推理及多語安全分類。Qwen3.5-27B 的安全 probe 得分 78.2%,接近零樣本 GPT-5.4-mini 的 78.1%,並高於論文設定下的 Qwen3Guard 與 Llama Guard;在跨資料集 WildGuardMix 測試,Qwen3.5-9B 的 SP-2 保持 79.0%,而 MultiMax 與一般 MLP 都降至 69.0%。不過這不是免訓練的通用守門員:每項任務仍使用數千至一萬筆監督資料,而且沒有高品質 MTP/草稿頭的模型無法取得相同成本優勢。Eagle3 結果也比共同預訓練的 MTP 弱約 4 至 12 個百分點;下一步應看獨立重現、真實服務延遲及分布外攻擊,而非只看作者建立的平衡分類集。

來源

  1. Speculative Probing: LLM Monitoring at Speculative-Decoding Cost
  2. SpeculativeProbing source code