返回首頁

AI 代理與開發工具

SKILLER 把 SKILL.md 當成可優化策略,Qwen3.5‑9B 在軟體工程測試達 82.8%

SKILLER 不更新小模型權重,而是讓強模型根據執行軌跡與驗證器回饋反覆修改文字技能。Qwen3.5‑9B 在 SWE‑Skills‑Bench 的三次執行平均分數由無技能時的 26.2% 升至 82.8%,但技能生成仍依賴 GPT‑5.4 與成功參考軌跡。

Mack_pesquisa · CC BY-SA 4.0 · Image source
zh-Hant

研究團隊公開 SKILLER,把代理技能視為可由強化學習搜尋的自然語言策略,而不是固定提示或模型參數。目標 Qwen3.5‑4B/9B 在工具環境執行目前的 `SKILL.md`;官方驗證器回傳成功率、測試結果及錯誤訊息,再由 GPT‑5.4 同時擔任 critic 與 actor。Critic 比較失敗軌跡、成功參考軌跡及歷史記憶,找出最早的因果偏離;actor 只使用 Insert、Replace、Create、Delete 四種操作局部修訂技能,必要時亦可建立確定性輔助程式。整個過程不反向傳播至執行模型。

在五步優化排程下,Qwen3.5‑9B 於 117 個 SWE‑Skills‑Bench 案例取得 82.8%,高於無技能的 26.2%、SkillX 的 58.8%及 Manus 技能的 62.4%;4B 版本則由 17.6%升至 66.7%。GAIA 的保留樣本測試也由 37.0%升至 49.59%,顯示方法不只記住單一訓練案例。技術上的重點是把昂貴算力移到離線技能建構階段,部署時仍可使用較小的本機模型與可審閱文字產物。

不過這不是免用前沿模型的方案:生成階段仍需 GPT‑5.4、驗證器及訓練專用參考軌跡,論文的成本分析亦排除小模型後續評測 token。各分數僅為三次執行平均,SkillsBench 還只選取 26 個單技能任務。公開儲存庫提供控制器、提示、benchmark adapter 與技能快照,但不含受上游條款限制的資料、完整軌跡或模型權重,且 SKILLER 程式採 PolyForm Noncommercial 授權。下一步應檢驗技能能否跨模型、runtime 版本及未見工具介面維持效果。

來源

  1. SKILLER: Language-Level Reinforcement Learning for Reusable Skill Extraction in Small Language Models
  2. DANG-ai/SKILLER:官方實作與重現說明