AI 安全
ALIBI 以虛假產品敘述誤導 LLM 惡意程式分類,驗證提示仍留下誤判
研究在不改變程式執行行為的前提下,加入可被靜態分析擷取的虛假背景。結果顯示,模型即使沒有遵從惡意指令,也可能因採信不可信敘述而降低風險判定。

78ResearchLab 團隊於 9 月 17 日提交 ALIBI 預印本,研究惡意檔案如何用看似合理的產品說明,誤導負責初步分類的語言模型。研究亦出現在技術研究聚合站;核心證據仍來自作者實驗,聚合報導未提供獨立重現。[論文](https://arxiv.org/abs/2609.19722)、[研究線索](https://mindpattern.ai/f/26109)
測試管線先從二進位檔擷取中繼資料、匯入符號與可列印字串,再交給模型判斷。ALIBI 加入不執行的唯讀內容,替可疑行為提供虛假的安全產品背景,讓模型將原本的風險線索解釋成正常用途。研究重點在於攻擊者控制的敘述如何被當成可信證據;模型並非直接閱讀整個執行檔,也未必收到要求忽略指令的文字。[方法與威脅模型](https://arxiv.org/html/2609.19722v1)
在 50 個惡意 Windows PE 樣本中,Gemini 2.5 Pro 原先將 35 個判為惡意;加入敘述後,其中 30 個改判良性。GPT-5.5 Pro 與 Claude Opus 4.7 在同一組 35 個樣本中沒有給出良性判定,但仍出現風險等級降低。這組比較沿用 Gemini 選出的分母,不能直接當成三款模型的整體安全排名。[評測結果](https://arxiv.org/html/2609.19722v1)
防禦實驗另以同一快照重跑有無驗證提示的兩組條件,誤判良性的數量由 29/35 降至 15/35;前者與主實驗相差一個樣本。結果支持提醒模型質疑檔案自述有幫助,但效果仍不完整。作者提出由前處理程式核對簽章、來源與結構,再把已驗證事實和檔案自行宣稱分開輸入;完整管線尚未實測。[防禦結果](https://arxiv.org/html/2609.19722v1)
對安全工具開發者而言,這提示評測不應只問最終標籤是否正確,也要追蹤風險排序是否下降、哪些文字被用來支持結論。可將互相矛盾的產品敘述加入回歸測試,觀察模型是否要求外部證據;同時固定擷取器與模型版本,避免把前處理差異誤認為模型防禦能力。若分類結果會決定人工調查順序,還應測量被降級的樣本是否因此延後處理。
研究樣本有限,只涵蓋特定靜態分析流程;結果不能外推為繞過所有防毒或動態沙箱,也不能把模型自報的信心值當成經校準的機率。接下來值得驗證的是:加入真正可查核的來源欄位後,是否仍能在不同惡意程式家族與擷取流程中維持防禦效果。[研究限制](https://arxiv.org/html/2609.19722v1)