AI 安全
DUMA-Bench、ユーザーとの対話をテストに導入 論文とリポジトリのスコアはなお不一致
新たなベンチマークは、変化する環境と複数ターンの対話を通じて、エージェントの操作や応答が安全規則に違反していないかを検証する。論文では対話モードで違反が増える傾向が観測されたが、公開結果には数値の食い違いがあり、再現時にはバージョンの照合が必要だ。

ITMO大学のAI Security Labなどの研究者は9月21日、DUMA-Benchを公開し、エージェントの安全性評価を、ユーザーとエージェントの双方が環境を変化させる状況へと拡張した。論文は8つの安全分野、35の実行可能なシナリオ、14モデルを対象とし、複数ターンのやり取りで安全規則への違反が生じるかを検証することに重点を置いている。[論文](https://arxiv.org/abs/2609.24662)
このプロジェクトはτ²-benchを拡張したもので、能動的に関与するユーザーがいない単独実行モードと、ユーザーシミュレーターを加えた双方制御モードを提供する。各分野にはポリシー、ツール、タスク、変更可能な状態が含まれ、攻撃内容は検索で取得する文書、共同作業者のメッセージ、ツールのインターフェースなどに埋め込める。これにより、ユーザーは冒頭でプロンプトを与えるだけでなく、処理の途中でも後続の行動に影響を及ぼせる。[公開リポジトリ](https://github.com/ai-security-lab-itmo/duma-benchmark)
スコアリングでは、環境と対話の両方を検証する。プログラムは、実行後に未承認の返金などの状態が残っていないかを確認する。テキスト応答については、評価用モデルに機密情報の漏えいを確認させることができる。これにより、「操作は拒否したが、説明の中で秘密を漏らした」ケースも失敗として計上できる。リポジトリには、同じタスクを複数回実行した際にすべて合格することを求める、反復試行の信頼性指標も用意されている。[スコアリング設計](https://github.com/ai-security-lab-itmo/duma-benchmark)
論文によると、対話の仕組みをすべて導入した後、集計された攻撃成功率は26.9%から41.1%へと、14.2パーセントポイント上昇した。一方、今回確認したREADMEの対応する表では、25.4%と40.3%になっている。両資料が示す傾向は同じだが、数値は一致していない。再現を試みる際は、タスクセット、評価器、結果のバージョンを照合する必要があり、整合性が確認された同一のデータとして扱うことはできない。[論文の結果](https://arxiv.org/html/2609.24662v1)、[リポジトリの結果](https://github.com/ai-security-lab-itmo/duma-benchmark)
研究では、モードの切り替えによって、複数ターンの対話、ユーザーの参加、ツールによる状態変化が同時に変わるため、各要因の因果的な寄与を切り分けられないことも認めている。ユーザーはモデルによってシミュレートされ、一部の判定は評価用モデルに依存する。さらにシナリオの規模も限られるため、これらの数値が示すのは当該テスト設定での結果に限られ、実際の製品が攻撃を受ける確率としてそのまま用いることはできない。[研究の限界](https://arxiv.org/html/2609.24662v1)
エージェント開発者が次に取れる行動は、同じポリシーを静的テストと対話型テストの両方に適用し、ツールの副作用と対話の全記録を保存したうえで、検証ステップの追加による違いを観察することだ。今回の確認に基づくと、引き続き優先すべき作業は、公開結果と実行可能な資料の整合性を確保することである。モデルのバージョン、タスク、評価用モデルの設定を固定できれば、このフレームワークは安全性のリグレッションを継続的に追跡する用途に、より適したものになる。