ホームへ戻る

AI 代理與開發工具

SKILLER、SKILL.mdを最適化可能な方策として扱い、Qwen3.5‑9Bがソフトウェアエンジニアリング評価で82.8%を達成

SKILLERは小規模モデルの重みを更新せず、強力なモデルが実行トレースと検証器のフィードバックに基づいてテキスト形式のスキルを反復的に修正する。Qwen3.5‑9BはSWE‑Skills‑Benchで、3回の実行における平均スコアをスキルなしの26.2%から82.8%へ向上させた。ただし、スキル生成は依然としてGPT‑5.4と成功例の参照トレースに依存する。

Mack_pesquisa · CC BY-SA 4.0 · Image source
zh-Hant

研究チームはSKILLERを公開し、エージェントスキルを固定プロンプトやモデルパラメータではなく、強化学習によって探索可能な自然言語方策として位置付けた。対象となるQwen3.5‑4B/9Bは、ツール環境で現在の`SKILL.md`を実行する。公式の検証器が成功率、テスト結果、エラーメッセージを返し、GPT‑5.4がcriticとactorの両方を担う。criticは失敗トレース、成功例の参照トレース、過去のメモリを比較し、因果関係が最初に逸脱した箇所を特定する。actorはInsert、Replace、Create、Deleteという4種類の操作だけを使ってスキルを局所的に修正し、必要に応じて決定論的な補助プログラムも作成できる。このプロセス全体を通じて、実行モデルへのバックプロパゲーションは行われない。

5ステップの最適化スケジュールにおいて、Qwen3.5‑9Bは117件のSWE‑Skills‑Benchケースで82.8%を記録し、スキルなしの26.2%、SkillXの58.8%、Manusスキルの62.4%を上回った。4B版も17.6%から66.7%へ向上した。GAIAのホールドアウトサンプル評価でも37.0%から49.59%へ伸びており、この手法が単一の訓練ケースを記憶しただけではないことを示している。技術的な要点は、高コストな計算処理をオフラインのスキル構築段階へ移し、デプロイ時には引き続き小規模なローカルモデルと、人間がレビュー可能なテキスト成果物を利用できる点にある。

ただし、これはフロンティアモデルを不要にする手法ではない。生成段階では依然としてGPT‑5.4、検証器、訓練専用の参照トレースが必要であり、論文のコスト分析には小規模モデルの後続評価で消費されるtokenも含まれていない。各スコアはわずか3回の実行平均で、SkillsBenchについても単一スキルのタスク26件のみが選定されている。公開リポジトリにはコントローラー、プロンプト、benchmark adapter、スキルのスナップショットが含まれる一方、上流の利用規約で制限されたデータ、完全なトレース、モデルの重みは含まれない。また、SKILLERのコードにはPolyForm Noncommercialライセンスが適用される。今後は、異なるモデル、runtimeバージョン、未見のツールインターフェースにまたがっても、スキルの効果が維持されるかを検証する必要がある。

出典

  1. SKILLER: Language-Level Reinforcement Learning for Reusable Skill Extraction in Small Language Models
  2. DANG-ai/SKILLER:官方實作與重現說明