返回首頁

AI 代理安全

CompoSkill 顯示逐件通過掃描的代理技能,串接後仍可形成八成風險鏈

CompoSkill 把技能安全從單一套件判定改寫成跨技能資料流與副作用的路徑問題。其 1,140 筆測試中,白箱及黑箱攻擊形成風險鏈的最高比例分別達 83.3% 與 80.6%,但這不等同真實入侵成功率。

Sgt. Emmanuel Ramos · Public domain · Image source
zh-Hant

代理技能市集通常逐件掃描套件:只要每個 `SKILL.md`、腳本及依賴均未被判定為惡意,安裝組合便被視為安全。8 月 17 日提交的 CompoSkill 指出,這個模型忽略了代理會在長流程中主動連接不同技能的輸出、權限與副作用;單獨無害的檔案讀取、雲端上傳或訊息發送能力,經模型規劃串接後可能形成資料外洩或未授權操作路徑。

研究建立兩種攻擊器。白箱版本知道受害者已安裝的技能集合,可直接注入明確的技能 ID 序列;黑箱版本只取得使用者角色描述,從熱門市集技能建立 Skill Composition Graph,再搜尋高風險鏈,產生不直接點名技能的隱性誘導。這項設計測試的是代理能否自行補齊攻擊路徑,而不只是掃描器能否辨認單一惡意文字。

CompoSkill-Bench 收錄 1,140 筆長時專業工作流,涵蓋五類威脅、六種情境,並在 OpenClaw 與 Nanobot 上測試。論文報告風險鏈形成率在白箱最高達 83.3%,黑箱最高達 80.6%;既有逐技能掃描器只能攔截其中有限部分。作者亦觀察到「橋接增益、跳數衰減」:加入橋接技能可提高成功機會,但鏈長超過三個技能後,攻擊成功率反而下降。

對平台工程而言,防線因此需要移到組合與執行階段,包括建立能力及資料流圖、限制跨技能傳值、對敏感來源加入 taint tracking,並在實際工具呼叫時重新檢查目的地與使用者授權。數字仍須謹慎解讀:Chain Formation Rate 衡量形成危險組合,不代表已成功竊取資料;研究亦只涵蓋兩套代理及人工建構情境。下一步應是公開 benchmark 與攻擊生成器,並測試簽章、靜態分析、沙箱和最小權限政策組合後的實際阻擋率。

來源

  1. CompoSkill: Compositional Skill Chain Attacks from Individually Scanner-Passing LLM Agent Skills
  2. OpenClaw skill loading, installation and security-scan documentation
  3. ClawHub skill registry and trust signals