AI 安全與多代理系統
IO Factory 以十萬個模擬角色重播 AI 影響行動,但不能推算真實說服效果
IO Factory 將敘事規劃、代理發文、平台曝光、受眾狀態更新與基準比較串成可追溯的模擬生命週期。系統已在十萬名模擬平民及一萬名操作代理的設定下完成執行,但所有影響數值都來自人工配置規則與 LLM 評審。

偵測協同影響行動不能只分類單篇貼文,因為不同帳號可以使用不同語氣,在長時間內共同推動相同敘事。[IO Factory](https://arxiv.org/abs/2608.10920)因此把研究對象改成完整活動生命週期:管理代理先產生階段性指引,操作代理建立內容及互動,模擬平台依追蹤關係和推薦規則決定可見性,系統再為每次平民接觸內容建立曝光收據。這種設計與以階段、戰術和技術描述資訊行動的[DISARM框架](https://github.com/DISARMFoundation/DISARMframeworks/)相呼應,但增加了可執行環境與逐筆來源紀錄。
每次曝光會由LLM評審輸出相關性、立場、信心與說服力,再連同來源信任、重複曝光衰減、角色更新權重及議題方向,交給確定性公式更新模擬信念。主實驗使用Gemma 4 31B與H200節點,為每種條件建立13組配對執行:每組有一萬名平民,介入組另加入一千名操作代理;基準組保留相同人口、平台及更新規則,只移除影響行動。三個預設目標的方向性增量為0.130、0.132及0.336,經配對檢定後均達作者設定的顯著門檻。另一次壓力測試擴至十萬名平民和一萬名操作代理,證明架構能在該規模完成活動時間線。
技術價值不在這些數值本身,而在於每次狀態改變都能回溯至操作者、內容、曝光路徑、評審輸出及更新規則。安全團隊因而可替換推薦機制、模型或防禦措施,進行配對紅隊實驗,而不必在真實平台投放有害內容。然而論文未證明模擬角色等同真實使用者,也未以人類標註校準LLM評審;所謂「影響」只是模擬器尺度的狀態變化。下一步應要求跨模型敏感度分析、公開可重現實作,以及用倫理許可的真實觀察資料驗證曝光與更新假設。