返回首頁

AI 安全

ElasticBack 在單一 Agent Skill 埋入條件式後門,多數模型誤觸率壓至 2% 以下

ElasticBack 把惡意規則藏進 `SKILL.md`,再以自然語句中的特定概念作為啟動開關,毋須修改模型權重。實驗顯示攻擊可避過多種靜態與執行期檢查,但 Claude 上的誤觸率仍達 20% 至 24%。

MichaelMaggs Edit by Richard Bartz · CC BY-SA 3.0 · Image source
zh-Hant

代理技能正逐漸成為新的軟體供應鏈:Agent Skills 規格容許套件除 `SKILL.md` 外,同時攜帶可執行腳本、參考文件與資產;代理判定技能適用後,會讀取完整指令並按需執行其中資源。ElasticBack 展示這套信任模型如何被改造成不修改模型權重的條件式後門。

攻擊者先在技能文件的低顯著位置植入規則 R,規定只有請求包含特定標記時才執行偽裝成正常工具的 payload;再以遺傳搜尋產生自然、符合領域語境的觸發句 T。搜尋同時考慮語意貼合度、規則相似度與文法,並用較低信賴界選擇跨多次測試都能穩定啟動的候選。正常請求不含標記,因此技能在一般審查與測試中維持原有行為。

作者在資訊外洩、未授權程式執行及輸出篡改三種行為上,各測試 50 個技能及四款模型。GLM‑5.2、MiniMax‑M3 與 GPT‑5.4 的攻擊成功率介乎 82% 至 98%,誤觸率多為 0% 至 2%;Claude Sonnet 4.6 的成功率只有 72% 至 76%,誤觸率則升至 20% 至 24%。這個差異顯示攻擊並非模型無關,也不能把「接近零誤觸」概括至所有結果。

對工程團隊而言,僅檢查文字困惑度、讓另一個 LLM 審閱技能,或用少量正常案例試跑都不足夠。技能應像第三方程式碼般鎖定版本與來源、隔離腳本權限,並以變異及對抗輸入測試條件分支。論文目前未提供公開實作,所有數字亦來自作者建立的技能集;下一步要看獨立重現,以及簽章、能力清單和沙箱能否真正切斷 payload。

來源

  1. ElasticBack: Stealthy Conditional Backdoor in LLM-Agent Skills via Coupled Trigger–Rule Optimization
  2. Agent Skills Specification