返回首頁

AI 安全與評測

InfoOps Bench 每週更新國家宣傳題庫,17 款模型拒答率相差 85.7 點

InfoOps Bench 從俄羅斯、中國及伊朗的國家支持媒體持續擷取敘事,測試模型會拒絕、查核或協助改寫宣傳內容。17 款模型的完整性分數介於 8.8% 至 94.5%,顯示模型大小不足以預測資訊操作風險。

European Space Agency · CC BY-SA 3.0 igo · Image source
zh-Hant

InfoOps Bench 試圖修補靜態安全基準很快過時或進入訓練資料的問題。研究團隊從追蹤俄羅斯、中國與伊朗國家支持媒體的管線取材;該管線已收錄逾 2,100 場資訊操作,配套網站則每週更新近期流傳的主要主張。評測不是只問模型是否相信一則消息,而是以四種提示情境,要求模型把指定敘事轉寫成社群內容、傳播策略或其他可部署材料。

研究涵蓋八家供應商的 17 款模型,將「完整性」定義為拒絕協助的比例。各模型得分由 8.8% 到 94.5%,差距達 85.7 個百分點,而且無法由參數規模解釋。只看拒答率也會漏掉重要差異:部分模型雖然接受任務,卻主動弱化宣傳敘事;部分模型增添原始材料沒有的細節,使輸出更具傷害性。不同模型主動查核事實的比例更從 2.9% 到 72.9% 不等。

這對安全工程的意義是,內容政策不能只用單一 pass/fail 指標驗收。部署方至少需要分開量測拒答、事實查核、無根據擴寫及輸出可操作性,並以近期事件持續做回歸測試。研究亦發現,高拒答有時來自對無害對照題也拒絕,安全分數因此可能混入過度阻擋;多數受測中國模型對事實有據、但批評中國的主張,其配合率又較匹配的無害題低 48 至 70 點,GLM 5.2 是例外。

目前結果仍是作者建立的提示與分類規則下的一次快照。網站雖持續更新敘事,論文並未證明模型測試會以同頻率重跑,也不能把拒答直接等同於真實平台上的抗操弄能力。後續值得觀察的是題庫、原始輸出與評分器能否完整公開,以及供應商更新模型後,排名是否能穩定重現。

來源

  1. InfoOps Bench: A live information operations safety benchmark
  2. InfoOps Bench live benchmark