代理評測與開發工具
SkillShapley、エージェントスキルの価値を段階的に推定――99種類の構成から再利用可能な限界貢献の証拠206組を取得
SkillShapleyは、`skill.md`の意味的な手順を協力ゲームのプレイヤーとみなし、Shapley valueによって各手順のタスク成功率への貢献を測定する。近似手法のBAESは、複数の「1手順のみ異なる」比較を生成できるスキル構成を優先的にテストし、エージェントを個別に実行するコストを削減する。

エージェントスキルは通常、操作手順、検証ルール、APIの例、よくある落とし穴などを含む長い指示文だ。しかし、全体のベンチマークスコアだけでは、どの手順が本当に有用なのかは分からない。SkillShapleyはスキルを元の順序を維持した意味的ブロックに分割し、残した手順の集合をcoalitionとみなし、固定テストセットでの成功率を効用とする。ある手順のShapley valueは、考えられるすべての文脈において、その手順がもたらす限界利得の平均である。
直接列挙するには$2^n$種類のスキル版を実行する必要があるため、チームはBoundary-Adaptive Edge Shapley(BAES)を提案した。システムはまず、空集合、完全なスキル、各手順のみを含む構成、各手順のみを除いた構成をテストする。続いて、「手順—集合サイズ」ごとに層別化した分散とサンプル数に基づき、次に評価するcoalitionを選択する。新しい構成が、キャッシュ済みの複数の構成と1手順だけ異なる場合、エージェントを1回実行するだけで、再利用可能な限界比較を複数生成できる。報酬が低く、結果が不安定な領域には、より多くの予算が割り当てられる。
研究ではSkillsBench、OpenHands harness、temperature 0の設定を使用した。完全列挙が可能な3つのスキル実験では、完全なShapley valueによるランキングに従って高価値の手順を削除すると、個別テスト、leave-one-out、LeastCore、ランダム削除よりも成功率が急速に低下した。10手順の実験では、いずれも99種類の一意な構成を用いた条件下で、BAESの第1段階は1手順差の限界貢献エッジを206本形成した。一方、Monte Carlo permutationによる観測は130回にとどまり、そのうち一意な観測は115回だった。著者らは、同じ構成数の予算では、BAESのほうが完全なShapleyランキングへより速く近づいたとも報告している。
これにより、スキルの保守は、プロンプト全体を対象とする反復的な試行錯誤から、冗長な手順、脆弱な手順、あるいは負の貢献をする手順を特定できる診断プロセスへと変わる。ただし、限られた予算下のBAESはランキングの復元を目的に設計されたバイアスのある推定手法であり、不偏なShapley計算ではない。完全な検証が行われたのは手順数の少ない3つのスキルのみで、10手順の結果もpilotにすぎない。意味的な分割自体も依然として研究者が決定しており、価値の低いブロックを削除しても、tokenコストが比例して減少するとは限らない。今後は、コード、構成キャッシュ、完全な評価ログが公開されるか、また異なるモデル、確率的デコーディング、より長いスキルでも結果を再現できるかを確認する必要がある。