返回首頁

代理評測與開發工具

SkillShapley 逐步估算代理技能價值,99 種配置取得 206 組可重用邊際證據

SkillShapley 把 `skill.md` 的語義步驟視為合作賽局參與者,以 Shapley value 衡量每一步對任務成功率的貢獻。其 BAES 近似器優先測試能形成多組單步差異的技能配置,降低逐一執行代理的成本。

U.S. Army RHCE by Kirk Frady · Public domain · Image source
zh-Hant

代理技能通常是一份包含操作程序、驗證規則、API 範例及常見陷阱的長指令,但整體跑分無法回答哪一步真正有用。SkillShapley 將技能拆成保持原始次序的語義區塊,把保留的步驟集合視為 coalition,並以固定測試集上的成功率作為效用;某一步的 Shapley value,則是它在所有可能上下文中帶來的平均邊際增益。

直接列舉需要執行 $2^n$ 種技能版本,因此團隊提出 Boundary-Adaptive Edge Shapley(BAES)。系統先測試空集合、完整技能、所有單一步驟及缺少單一步驟的配置,再依各「步驟—集合大小」分層的變異與樣本量挑選下一個 coalition。若新配置與多個已快取配置只差一步,一次代理執行便可產生多組可重用的邊際比較;獎勵較低、結果較不穩定的區域會獲得更多預算。

研究使用 SkillsBench、OpenHands harness 及溫度零設定。三項可完整列舉的技能實驗顯示,依完整 Shapley 排名移除高價值步驟,成功率下降速度快於單獨測試、leave-one-out、LeastCore 及隨機移除。在一項十步驟試驗中,同為 99 個唯一配置,BAES 第一階段形成 206 條單步邊際邊;Monte Carlo permutation 只有 130 次觀察,其中 115 次為唯一觀察。作者亦報告 BAES 在相同配置預算下較快逼近完整 Shapley 排名。

這讓技能維護從整份提示的反覆試錯,轉成可定位冗餘、脆弱或負貢獻步驟的診斷流程。不過 BAES 在有限預算下是為排名恢復而設計的有偏估計,並非無偏 Shapley 計算;完整驗證只有三個低步數技能,十步驟結果也只是 pilot。語義分段本身仍由研究者決定,而刪除低價值區塊不保證 token 成本按比例下降。下一步應觀察程式、配置快取與完整評測紀錄會否公開,以及結果能否跨模型、隨機解碼和較長技能重現。

來源

  1. SkillShapley: Boundary-Adaptive Shapley Valuation for Skill Step Attribution in LLM Agents
  2. SkillsBench repository