AI 安全與代理框架
SHE、エージェントの実行軌跡から安全ハーネスを書き換え、攻撃成功率を17.1%から5.5%に低減
SHEはエージェントの安全ハーネスをシステムプロンプト、ルールベース、安全メモリ、ツールポリシーに分解し、失敗軌跡に基づいて局所的に改訂する。Agent-SafetyBenchでは攻撃成功率と誤拒否率を同時に低減したが、実環境への導入では評価器のバイアスやルールの自己肥大化を防ぐ必要がある。

上海人工知能研究所や復旦大学などの機関は、Safety Harness Evolution(SHE)を提案した。これは、エージェントの安全対策を固定されたシステムプロンプトから、過去の実行軌跡に基づいて継続的に改訂できるノンパラメトリック層へと変えるものだ。このフレームワークは基盤モデルとタスク環境を変更せず、ハーネスを責任範囲が明確な4つの成果物に分解する。システムプロンプトは全体的な信頼境界を担い、ルールベースはリスクを分類して許可、警告、ブロック、またはサニタイズを決定する。安全メモリは繰り返し修復できなかった事例を保存し、ツールポリシーは呼び出し権限と、ブロック後の復旧フローを制限する。
各進化ラウンドでは、まずクリーンタスクと敵対的タスクを再実行し、危害領域、攻撃対象領域、失敗モードに基づいて構造化診断を生成する。その後、問題を責任範囲が最も小さい成果物へルーティングする。修正案は形式と妥当性の検査を通過しなければならず、安全性スコアが向上し、通常タスクの有用性が低下しない場合に限って現行版を置き換える。却下された修正とその理由は、次のラウンドの参考情報として保持される。この設計は、エージェントが禁止ルールを増やすだけで安全性スコアを「水増し」することを防ごうとしている。
研究では、Agent-SafetyBenchの15タスクを使ってハーネスを進化させ、残る185件のタスクIDでクリーン入力、コンテキスト汚染、間接プロンプトインジェクション、ツール改ざん、メモリインジェクション、複合攻撃をテストした。進化後のSHEの平均攻撃成功率は5.5%で、静的なSafeHarnessの17.1%を下回った。ユーザビリティ精度は31.6%から47.6%へ向上した。SHEの進化前後だけを比較すると、攻撃成功率は8.6%から5.5%へ低下し、クリーンなリクエストの誤ブロック率も25.7%から19.8%へ低下した。進化に使用していないAgentHarmでは、Harm Scoreが19.8%から9.8%へ低下した。
コード、固定データ分割、ハーネスのシードはApache-2.0ライセンスで公開されているが、生成後のハーネス、完全なrollout、認証情報、外部ベンチマークスイートはリポジトリに含まれていない。そのため、エンジニアリングチームは進化プロセスを検証できるものの、主要な結果を再現するには、モデル利用と評価にかかる費用を自ら負担する必要がある。今後は、長期的な更新によってルールの競合や評価器への過適合が生じないか、また自動生成されたツールポリシーが実際の権限管理システムで人手による監査とロールバックに対応できるかを検証する必要がある。