AI 安全與多代理系統
IO Factory、10万体のシミュレーション人格でAI影響工作を再現──ただし現実の説得効果は推定できず
IO Factoryは、ナラティブ計画、エージェントによる投稿、プラットフォーム上の露出、オーディエンス状態の更新、ベースライン比較を、追跡可能なシミュレーションのライフサイクルとして統合した。10万体の模擬市民と1万体の工作エージェントという設定で実行を完了しているが、影響を示すすべての数値は、人為的に設定されたルールとLLMジャッジに基づく。

協調的影響工作を検知するには、個々の投稿を分類するだけでは不十分だ。複数のアカウントが異なる口調を使いながら、長期間にわたって同じナラティブを共同で推進できるためである。そこで[IO Factory](https://arxiv.org/abs/2608.10920)は、研究対象をキャンペーンのライフサイクル全体へと広げた。まず管理エージェントが段階別の指針を生成し、工作エージェントがコンテンツとインタラクションを作成する。次に、シミュレーションされたプラットフォームがフォロー関係とレコメンデーションルールに基づいて可視性を決定し、システムは模擬市民がコンテンツに接触するたびに露出レシートを作成する。この設計は、情報工作をフェーズ、戦術、技術で記述する[DISARMフレームワーク](https://github.com/DISARMFoundation/DISARMframeworks/)と呼応するものだが、実行可能な環境とイベント単位のプロベナンス記録が追加されている。
各露出について、LLMジャッジが関連性、スタンス、確信度、説得力を出力する。それらを情報源への信頼度、反復露出による効果の減衰、人格ごとの更新重み、トピックの方向性と組み合わせ、決定論的な数式によってシミュレーション上の信念を更新する。主要実験ではGemma 4 31BとH200ノードを使用し、各条件について13組のペア実行を構成した。各組には1万体の模擬市民が含まれ、介入群にはさらに1,000体の工作エージェントが追加された。ベースライン群では同じ人口、プラットフォーム、更新ルールを維持し、影響工作だけを除外した。事前設定された3つの目標に対する方向性増分は、それぞれ0.130、0.132、0.336であり、ペア検定後はいずれも著者が設定した有意性の閾値を満たした。別のストレステストでは10万体の模擬市民と1万体の工作エージェントまで拡張され、この規模でもキャンペーンのタイムラインを最後まで実行できることが示された。
技術的な価値は、これらの数値そのものではなく、状態変化の一つひとつを工作主体、コンテンツ、露出経路、ジャッジの出力、更新ルールまで遡って追跡できる点にある。これによりセキュリティチームは、現実のプラットフォームに有害なコンテンツを投入することなく、レコメンデーション機構、モデル、防御策を差し替えて、ペア構成のレッドチーム実験を実施できる。しかし、この論文はシミュレーション人格が現実のユーザーと同等であることを証明しておらず、LLMジャッジも人間によるアノテーションでキャリブレーションされていない。ここでいう「影響」とは、あくまでシミュレーター内の尺度における状態変化にすぎない。次の段階では、モデル横断の感度分析、再現可能な実装の公開、そして倫理審査を経た現実の観察データを用いた露出および更新仮定の検証が求められる。