返回首頁

AI 安全

惡意文字寫進系統日誌,可讓 LLM 把真實攻擊判成正常活動

新研究證明,攻擊者可利用自己能控制的日誌欄位植入提示,干擾 SOC 使用的 LLM 分析流程。研究亦發現模型解釋常會洩露受操控跡象,但這項訊號尚不足以成為可靠防線。

C.Stadler/Bwag · CC BY-SA 3.0 · Image source
zh-Hant

維也納奧地利理工學院等研究者在 7 月 27 日公開一套針對 LLM 日誌分析器的提示注入評測框架。威脅模型並不要求攻擊者存取模型或 SOC 後端:只要能讓受控文字進入稽核、存取或應用程式日誌,例如帳號名稱、URL、User-Agent、檔名或命令列參數,就可能把指令夾帶進模型上下文。

研究流程先從真實網路攻擊產生的 CAM-LDS 日誌軌跡出發,建立通用注入文字,再經過改寫與攻擊情境最佳化。實驗顯示,多款受測前沿模型可能在仍可看到明確入侵指標時,把惡意軌跡分類為良性。這與傳統「log injection」不同:目標不只是破壞解析格式,而是改變後續語言模型對事件的語意判斷。

作者同時觀察到一個可利用但尚不穩定的防禦訊號:模型雖輸出良性標籤,解釋內容卻經常提及可疑指令、操控意圖或矛盾證據。工程團隊因此可將分類與解釋分開驗證,使用規則或另一個隔離的偵測器檢查操控痕跡;更根本的作法則是把日誌視為不受信任資料,以結構化欄位、來源標記和資料/指令邊界送入模型,並禁止單一 LLM 結論直接關閉告警。

不過,論文並未證明所有商用 SOC 產品均受影響,結果也取決於提示模板、模型版本及日誌選取方式。公開程式庫提供重現材料,下一步值得觀察的是不同模型與 RAG 管線的跨版本測試,以及解釋式偵測能否在不大量增加誤報的情況下穩定攔截攻擊。

來源

  1. Just Testing, Move Along: Evasion of LLM-based System Log Interpretation by Prompt Injection
  2. log-interpretation-prompt-injection