返回首頁

AI 安全與代理系統

VLA 監測代理隱藏狀態通訊,同模型拍賣測試 AUROC 達 0.993

新研究把代理間未寫入對話紀錄的連續向量,與其後公開動作綁定至同一事件,再以異常、反事實影響及稀疏特徵三層檢查。平均 0.993 的結果混合了文字與潛在串通樣本,且攻擊由研究者預先設計,尚不能視為對自發密謀的通用偵測能力。

Fowler&fowler«Talk» · CC BY-SA 3.0 · Image source
zh-Hant

多代理系統不一定透過文字交換資訊。若一個代理把 residual stream 或最後一個 token 的隱藏狀態直接插入另一代理的輸入 embedding,公開 transcript 只會留下最後動作,傳遞策略意圖的連續向量則可能避開既有稽核。

研究團隊提出 Verifiable Latent Alignments(VLA),為每次隱藏狀態交接與後續公開動作加入共同 correlation ID。監測器首先以中性通訊建立逐維高斯分布,找出偏離正常流形的向量;第二層比較傳入可疑向量與阻擋、替換為中性向量時的動作機率分布,以有害方向的期望值位移及 KL divergence 衡量因果影響;第三層用 TopK 稀疏自編碼器標示重建誤差、未見特徵及罕見特徵。三層門檻均只以中性資料校準,攻擊標籤僅用於評分。

在 Nanda Town 拍賣沙盒中,同模型代理的序列監測平均 AUROC 為 0.993,跨 Qwen、Mistral、Vicuna 與 Phi 模型空間後降至 0.854。Qwen3-0.6B 的 25 至 100 名競標者測試仍維持至少 0.917;白箱介入以匹配的中性狀態重跑決策,令低價串通行為減少 47.3 個百分點。

數字有兩項重要限制:AUROC 的正類同時包含明文與隱藏狀態串通,而非純粹偵測潛在通道;接收代理也被明確告知要解讀私人狀態,攻擊碼更是離線最佳化所得。第二層還假設部署時能取得匹配的反事實控制,白箱修正則需存取模型 activation 並額外執行 forward pass。工程團隊接下來應觀察方法能否處理代理自行發展、刻意模仿正常分布的協定,以及研究程式與完整測試資料是否公開。

來源

  1. Beyond the Transcript: Detecting Covert Coordination in Latent Multi-Agent Communication
  2. Nanda Town:開源多代理協定測試沙盒