返回首頁

AI 評測與代理系統

KV cache 不等於「潛在思維」:錯配快取揭露多代理增益可能只是介面效應

新研究以錯配、歸零及隨機 KV cache 重新稽核多代理潛在通訊,發現移除快取造成的大幅退步,不一定證明接收者使用了發送者的特定資訊。部分自然評測中,歸零使準確率下降 14.7 點,換成其他題目的快取卻只差 0.4 點。

Marianoni · CC BY-SA 3.0 · Image source
zh-Hant

多代理系統開始直接傳遞 Transformer 的 KV cache,以減少文字中介的 token 與延遲;然而,[新研究](https://arxiv.org/abs/2608.04893)指出,「有快取比沒有快取好」不足以證明代理交換了可用的潛在思維。研究團隊將真實快取替換成其他題目的錯配快取、全零快取及統計量相符的隨機快取,藉此分開量測介面存在、一般計算狀態及題目專屬內容的作用。

當接收模型確實缺少發送者持有的答案相關資訊時,LatentMAS 原生通道在主要 Qwen3-8B 設定達到 100%,不含私人資訊的快取只有 23.4% 至 25.2%;類似差距亦出現在三個模型家族、五個檢查點及文字文件問答。但在接收者可自行解題的 GSM8K、ARC-Challenge 與 MedQA 設定,七個 Qwen3 實驗格中,正確配對與錯配快取的差異均落在預先設定的 ±2.8 點等效範圍。MedQA 更顯示,歸零快取損失 14.68 點,錯配快取僅損失 0.40 點,代表多數效果可能來自格式良好的計算狀態,而非該題內容。

相同稽核亦區分不同實作:[LatentMAS](https://github.com/Gen-Verse/LatentMAS) 的完整快取傳輸可呈現接近上限的題目專屬效果;KVComm 的部分層傳輸只取得約 7.2 至 10.8 點增益;C2C 公開投影器則未偵測到穩定的專屬內容轉移。工程上,潛在通訊評測應加入錯配樣本,而不能只做「有無快取」消融。限制是外部系統各只測一種公開設定,部分 Mistral ARC 結果亦受解析失敗影響;重新訓練投影器或改變快取層數後,結論可能不同。

來源

  1. When Does Latent Communication Pay? A Causal Audit of Relayed KV Caches in Multi-Agent LLMs
  2. LatentMAS: Latent Collaboration in Multi-Agent Systems
  3. Mistral NeMo