AI 安全
DUMA-Bench 納入使用者互動測試,論文與程式庫分數仍待對齊
新基準以可變動環境與多輪對話,檢查代理在操作及回覆中是否違反安全規則。論文觀察到互動模式下更多違規,但公開結果存在數值差異,重現時須核對版本。

ITMO 大學 AI Security Lab 等研究者於 9 月 21 日公開 DUMA-Bench,將代理安全評測擴展到使用者與代理共同改變環境的情境。論文涵蓋八類安全領域、35 個可執行情境與 14 款模型,重點是檢查多輪互動中是否違反安全規則。[論文](https://arxiv.org/abs/2609.24662)
專案延伸自 τ²-bench,提供沒有主動使用者的單獨執行模式,以及加入使用者模擬器的雙方控制模式。每個領域包含政策、工具、任務與可變動狀態,攻擊內容可藏在檢索文件、協作者訊息或工具介面。使用者因此不只是開場提供提示,也能在流程中影響後續行動。[公開儲存庫](https://github.com/ai-security-lab-itmo/duma-benchmark)
評分同時檢查環境與對話。程式會核對執行後是否留下未授權退款等狀態;文字回覆則可交由模型裁判檢查敏感資訊外洩。這讓「拒絕操作、卻在解釋中洩密」也能被計入失敗。儲存庫另提供重複試驗的可靠度指標,要求同一任務多次執行都通過。[評分設計](https://github.com/ai-security-lab-itmo/duma-benchmark)
論文報告,加入完整互動機制後,彙總攻擊成功率由 26.9% 升至 41.1%,增加 14.2 個百分點。不過,本次查核的 README 對應表列的是 25.4% 與 40.3%。兩份資料方向相同,數值卻不一致;重現者須核對任務集合、評分器與結果版本,不能把它們當成同一組已對齊的數據。[論文結果](https://arxiv.org/html/2609.24662v1)、[儲存庫結果](https://github.com/ai-security-lab-itmo/duma-benchmark)
研究也承認,模式切換同時改變多輪對話、使用者參與及工具造成的狀態變化,無法分離各因素的因果貢獻。使用者由模型模擬,部分判定依賴模型裁判,加上情境規模有限,這些數字只能描述該測試設定,不能直接當作真實產品的遭攻擊機率。[研究限制](https://arxiv.org/html/2609.24662v1)
對代理開發者而言,可採取的下一步是把相同政策放進靜態與互動兩套測試,保存工具副作用及完整對話,再觀察新增驗證關卡後的差異。依本次查核,優先工作仍是對齊公開結果與可執行材料;若能固定模型版本、任務及裁判設定,這套框架才更適合用於持續追蹤安全回歸。