ホームへ戻る

AI 程式代理

SkillForge、プロジェクトのテストから合成障害を事前生成し、2つのコーディングエージェントでSWE-bench Verifiedを5ポイント超改善

SkillForgeは実際の課題チケットが発生する前に、テストでカバーされた実行パスから検証可能な障害を生成し、その修復軌跡をプロジェクト固有のスキルへ蒸留する。Mini-SWE-Agentと組み合わせることで、DeepSeek-V3.2とGPT-5-miniのSWE-bench VerifiedにおけるPass@1は、それぞれ72.2%と60.6%に上昇した。

U.S. Air Force photo by Tech. Sgt. Kristen Pittman · Public domain · Image source
zh-Hant

コーディングエージェントが新しいコードベースに入る際、通常はファイルの検索とテストの実行を繰り返し、エラーを手がかりにプロジェクトの慣例をその場で学ぶしかない。SkillForgeは、このコールドスタートのコストを前倒しする。まず、合格済みで中核機能をカバーするテストを選び、実行トレースを使って、その機能を共同で実装している複数のコード断片を特定する。続いて元の実装をマスクし、LLMに周辺のコンテキストだけを基にコードを再実装させる。書き換えによってテストが失敗した場合、システムはバージョン、障害出力、参照パッチ、合成された問題記述を、実行可能な訓練課題としてパッケージ化する。

Mini-SWE-Agentは、これらの合成障害の修復を試みる。SkillForgeはさらに、成功と失敗の軌跡から2層の知識を抽出する。グローバルスキルにはモジュールの用途、デバッグ手順、関連APIを記録し、新しい課題チケットに着手する前にBM25で検索する。ローカルスキルはASTエンティティに紐付けられ、エージェントが該当ファイルを読み取ると、修正のヒントや一般的な落とし穴がリアルタイムで注入される。これはリポジトリ全体の要約をプロンプトに詰め込む方式とは異なり、過去の課題チケットが蓄積するのを待つ必要もない。

研究では、時間的に分離したSWE-bench Verified上で577件の障害を合成し、エージェントが利用できるスキルを、対象パッチのコミットより前に作成されたものだけに制限した。DeepSeek-V3.2のPass@1は66.4%から72.2%へ、GPT-5-miniは55.0%から60.6%へ上昇した。合成と蒸留のコストを償却すると、1問当たりのコストはそれぞれ0.049米ドルから0.074米ドル、0.031米ドルから0.066米ドルへ増加した。より難易度の高いSWE-bench Proでも、それぞれ5.8ポイントと4.1ポイント改善した。

エンジニアリング上の価値は、長期的に保守される単一の大規模コードベース向けに、エージェントの知識ベースを事前構築できる点にある。ただし、効果はテストカバレッジによって直接制限される。実行可能なテストがないレガシーモジュールからは十分なシグナルを得られず、LLMが生成する障害記述も、実際の開発者が作成する課題チケットに必ずしも似ているとは限らない。今後は、コードベースが急速に進化した後にスキルが陳腐化しないか、またオフラインでの知識ベース構築コストを実際の課題チケット量で効果的に償却できるかを検証する必要がある。

出典

  1. SkillForge: Self-Distilling Agents for Project-Specific Issue Resolution
  2. cslsolow/SkillForge