代理開發工具
Agent Lightning 1.0.1、エージェント最適化プロセスをSkillとしてパッケージ化し、試行ごとのコスト、レイテンシー、正確率の測定を要求
Microsoftは、Claude Code、Codex、GitHub Copilotで利用できるAgent Lightning Skillを追加した。これにより、コーディングエージェントは固定benchmark上で、編集可能な別のエージェントを改良できる。これは予算制約下での実験ルール一式であり、対象エージェントに対して強化学習を自動実行するものではない。

Agent Lightning 1.0.1では、同名のSkillが初めて正式リリースされ、「別のAIエージェントを改善する」作業がコーディングエージェントによって実行可能な探索プロセスとして整理された。ユーザーが編集可能な対象エージェントとbenchmarkを提供すると、Skillはオプティマイザーに測定、変更、再評価を繰り返すよう求める。同時に、正確率、実行ごとのコスト、レイテンシー、完了率、ばらつきを追跡し、単発のスコア上昇だけを見て停止することを避ける。Claude Code、Codex、GitHub Copilotには、`gh skill install`を通じてインストールできる。
Skillが示す探索空間には、入力grounding、出力schema、prompt、tool、model、推論強度、障害分離、条件付きretry、routing、retrieval、複数候補からの選択が含まれる。開発中の実験予算とデプロイ後の1回あたりのコストは別々に扱われる。オプティマイザーは残りの予算を確認し、固定されたテストケース、validation split、または反復実行を利用してランダム性を抑えたうえで、完全に測定済みのcheckpointを1つ保持しなければならない。ルールでは、scorerの変更、held-out labelのデプロイ経路への漏洩、本番環境に存在しないmetadataへの依存も禁止されている。
今回のリリースはAgent Lightningの強化学習フレームワークと関連しているが、両者を混同してはならない。同フレームワークはAPI gatewayを使用して実際のharnessによるmodel callをインターセプトし、retokenization、動的なサンプル数、rollout-level advantageを処理する。論文では、約6,000件の学習データを用いることで、SWE-bench VerifiedにおけるQwen3.5-9Bのスコアを41.8%から56.4%へ向上させたと報告している。一方、新しいSkill自体は主に運用ルールと探索ガイダンスであり、このRLの成果を再現できるとは保証しておらず、汎用的な自動ハイパーパラメータチューニングアルゴリズムも内蔵していない。エンジニアリングチームは次に、未見のタスク、異なるmodel、異なるscorerでも安定した改善を見つけられるかを検証する必要がある。また、長時間の探索によってbenchmarkに過剰適合したり、API予算を使い果たしたりしないかも確認すべきだ。