AI 程式工具/安全
GitHub Copilot Lite、多エージェントによるレビューに移行し、reviewerによるビルドとテストの実行も可能に
GitHubは、最も低コストなLite reviewをマルチエージェント・アンサンブル方式に変更した。公式実験では、高重大度の指摘の採用数が47%増加した。レビューエージェントはshellツールも実行できるようになったため、runnerの分離、プロンプトインジェクション、自動解決の監査記録が一段と重要になる。

GitHubはCopilot code reviewの実行アーキテクチャを更新した。Liteワークロードでは、単一のエージェントだけでpull requestを確認するのではなく、複数のエージェントが個別に分析し、その結果を1件のレビューに統合する。GitHubによると、社内実験では、最終的に開発者が対応した高・中・低重大度の指摘が平均でそれぞれ47%、31%、11%増加し、同時にレビュー1回当たりのコストは約8%低下したという。エージェント数、モデル構成、サンプルサイズ、統計区間は公開されていないため、これらの数値は再現可能なモデルベンチマークではなく、製品実験から得られたシグナルとして捉えるのが適切だ。
技術面でより大きな影響を持つのは、実行権限だ。レビューエージェントは従来、主にファイルを読み取っていたが、現在はCopilot agent firewallの背後でCopilot SDKの完全なshellツールセットを使用し、build、テスト、指定スクリプトを実行できるほか、許可されたツールやAPIからデータを取得できる。Copilotのエージェント型レビュー機能は、GitHub Actions runnerを通じてプロジェクト全体のコンテキストを収集する。Actions workflowが失敗した場合もレビューは生成されるが、機能が限定されたモードにフォールバックする。GitHub-hosted runnerを無効にしている組織も、これらの機能を維持するにはself-hosted runnerを構成する必要がある。
ユーザーインターフェースでも、より閉じた修正ループが形成された。開発者がCopilotの提案を適用すると、システムは変更内容に基づいてcommit messageを生成する。その後のcommitによって元の指摘に対応したと判定された場合、Copilotは再レビュー時に該当するdiscussion threadを自動的に解決し、未解決の指摘のみを開いたままにする。これにより手動での整理作業を減らせる一方、同じ製品が問題を指摘し、その問題が解決済みかどうかも判定することになる。規制対象のプロジェクトでは、クローズ状態をそのまま人による検証と見なさず、auto-resolveの監査記録を保持すべきだ。
エンジニアリングチームは、信頼できないPRの実行面も再評価する必要がある。テスト、ビルドスクリプト、ツール出力には、悪意ある動作やプロンプトインジェクションが仕込まれる可能性がある。Lite reviewでは通常、約0.05~1米ドル相当のAI creditsを消費し、Actionsの利用時間は別途計算される。今後は、GitHubがアンサンブル手法、誤検知率、分離の詳細を公開するか、また企業がfork PR、secrets、ネットワークアクセスについて、よりきめ細かなポリシーを設定できるようになるかを注視すべきだ。