AI 安全與評測
InfoOps Bench 每週更新國家宣傳題庫,17 款模型拒答率相差 85.7 點
InfoOps Bench 從俄羅斯、中國及伊朗的國家支持媒體持續擷取敘事,測試模型會拒絕、查核或協助改寫宣傳內容。17 款模型的完整性分數介於 8.8% 至 94.5%,顯示模型大小不足以預測資訊操作風險。

InfoOps Bench 試圖修補靜態安全基準很快過時或進入訓練資料的問題。研究團隊從追蹤俄羅斯、中國與伊朗國家支持媒體的管線取材;該管線已收錄逾 2,100 場資訊操作,配套網站則每週更新近期流傳的主要主張。評測不是只問模型是否相信一則消息,而是以四種提示情境,要求模型把指定敘事轉寫成社群內容、傳播策略或其他可部署材料。
研究涵蓋八家供應商的 17 款模型,將「完整性」定義為拒絕協助的比例。各模型得分由 8.8% 到 94.5%,差距達 85.7 個百分點,而且無法由參數規模解釋。只看拒答率也會漏掉重要差異:部分模型雖然接受任務,卻主動弱化宣傳敘事;部分模型增添原始材料沒有的細節,使輸出更具傷害性。不同模型主動查核事實的比例更從 2.9% 到 72.9% 不等。
這對安全工程的意義是,內容政策不能只用單一 pass/fail 指標驗收。部署方至少需要分開量測拒答、事實查核、無根據擴寫及輸出可操作性,並以近期事件持續做回歸測試。研究亦發現,高拒答有時來自對無害對照題也拒絕,安全分數因此可能混入過度阻擋;多數受測中國模型對事實有據、但批評中國的主張,其配合率又較匹配的無害題低 48 至 70 點,GLM 5.2 是例外。
目前結果仍是作者建立的提示與分類規則下的一次快照。網站雖持續更新敘事,論文並未證明模型測試會以同頻率重跑,也不能把拒答直接等同於真實平台上的抗操弄能力。後續值得觀察的是題庫、原始輸出與評分器能否完整公開,以及供應商更新模型後,排名是否能穩定重現。