AI 安全
JailbreakSkill 將越獄策略封裝成可進化技能,HarmBench ASR 再增 13.4 個百分點
JailbreakSkill 以統一介面封裝提示改寫、失敗分析及技能演化,讓紅隊代理從未成功的攻擊軌跡產生新程序。第二階段令 AdvBench 與 HarmBench 的跨模型平均攻擊成功率分別再升 17.5 及 13.4 個百分點,但評分依賴 GPT-4o 裁判。

自動紅隊工具通常把越獄方法埋在提示、記憶格式或特定工作流中,新的攻擊技術很難獨立替換或重用。[JailbreakSkill 論文](https://arxiv.org/abs/2608.16465)改以技能作為執行與演化單位:每個技能由 `SKILL.md` 描述適用條件及程序,並可附帶透過 JSON-over-stdio 呼叫的程式。
框架分成兩階段。第一階段提供 16 種初始改寫技能,涵蓋 Base64、字元擾動、跨語言遮罩、程式補全、角色扮演及敘事重構。規劃器按風險類別維護各技能的連續裁判分數,使用 upper confidence bound 在探索未知技能與優先選用既有強項之間取捨;每個原始提示最多查詢目標模型十次,首次成功即停止。
仍未攻破的案例會連同改寫內容、模型回覆及評分存入失敗記憶。第二階段先按風險類別歸組,分析共同失敗模式,再選擇精煉既有技能、合併多種機制或發現新程序。候選技能必須至少解決一個先前失敗案例才會進入技能庫,之後亦可跨類別重用。這使系統累積的是可執行程序,而非只保存一次性的成功 prompt。
作者以 AdvBench 520 題及 HarmBench 400 題測試八款開放與閉源模型。第一階段的宏平均 ASR@10 分別為 72.0%及 68.1%;最強整體基線 TAP 為 70.9%及 54.6%。加入技能演化後,平均 ASR 進一步增加 17.5 與 13.4 個百分點;GPT-5.4 在 AdvBench 的增幅達 48.6 點。UCB 排序亦把每題平均目標查詢壓至 4.14 與 4.63 次,低於隨機排序的 5.98 與 6.24 次。
[開源實作](https://github.com/BattleWen/JailbreakSkill)包含三項資料集、技能註冊表及查詢預算限制,但也直接提供具攻擊性的轉換,部署必須限制於獲授權環境。更重要的是,成功與危害程度主要由 GPT-4o 裁判判定,演化又使用 Claude Sonnet 4.5;結果可能受裁判偏誤、供應商模型更新及高額輔助推論成本影響。防守方應關注可持久化技能是否令一次越獄經驗轉化成跨模型、跨工作階段的攻擊能力。