返回首頁

AI 安全

MaliciousSkillBench 彙整 9,740 個代理技能,跨來源偵測 Macro-F1 跌至 0.665

新基準將 13 個公開來源的代理技能去重並按結構家族切分,避免近似樣本同時落入訓練與測試集。最佳文字分類器在隨機切分表現亮眼,面對未見來源卻把 62.4% 良性技能誤判為惡意。

Jason Zhang · CC0 · Image source
zh-Hant

代理 Skill 不只是提示文字,也可能攜帶腳本、資源與服務設定;一旦透過市集、儲存庫或團隊範本散布,就成為可影響工具權限與執行流程的供應鏈介面。8 月 20 日發布的 MaliciousSkillBench,試圖把這類風險從零散案例整理成可比較的偵測問題。

研究團隊收集 13 個公開來源,將 8,414 筆原始惡意紀錄正規化為 7,539 個唯一身分,再依結構相似性整理成 4,588 個家族。排除保守判定為標籤衝突的資料後,主要基準共有 9,740 個 Skill,包括 7,505 個惡意與 2,235 個良性樣本。資料集提供隨機、結構不重疊及來源不重疊等固定切分;後兩者尤其重要,因為只用隨機切分時,分類器可能只是記住同一惡意模板的改寫版本。

結果揭示明顯的泛化落差。最佳 word-level TF-IDF SVM 在隨機切分取得 0.932 Macro-F1,在結構不重疊切分仍有 0.916,但換成完全未見過的來源後只剩 0.665。它仍找出 95.6% 惡意樣本,代價卻是把 62.4% 良性 Skill 判成惡意。三款現成掃描器位於另一端:部分工具可把誤報降至約 1%,但惡意召回率只剩 2.5% 甚至為零,無法單獨充當安裝閘門。

公開資料以 CC BY 4.0 提供 9,735 筆完整靜態文字;五筆含敏感憑證材料的樣本只釋出淨化版本,且不包含可執行伴隨套件。這使基準較適合測試靜態預篩,而不能代表 Skill 在沙盒內的動態行為。攻擊分類也只覆蓋 4,983 個惡意身分,資料比例與來源標籤品質可能影響整體指標。工程團隊應關注來源不重疊測試,並把靜態掃描、最小權限、簽章來源與執行期監控組成多層防線。

來源

  1. MaliciousSkillBench: A Comprehensive Benchmark for Malicious Agent Skill Detection
  2. MaliciousSkillBench project page
  3. MaliciousSkillBench public dataset
  4. MaliciousSkillBench reproducibility repository