多代理系統
StateBridge 以閉式旋轉對齊代理隱藏狀態,無須訓練即可繞過文字通訊瓶頸
StateBridge 將發送代理的末層 hidden state 對齊接收端 embedding 空間,作為連續前綴直接注入。四款開放模型的26組測試中有22組並列或取得最佳結果,但方法仍限於可存取內部狀態的同模型代理。

多代理系統通常把規劃、批評與修正結果寫成文字,再交給下一個代理;取樣成 token 時,發送端隱藏狀態中的信心與替代路徑也隨之被壓掉。StateBridge 改為擷取訊息最後64個 token 的末層 hidden state,將其視作點雲,經中心化、白化與正交 Procrustes 對齊,求得保持角度及距離的閉式旋轉。它再校準向量範數,並把每個向量稍微拉向最近的詞彙 embedding,最後作為連續 prefix 加在接收代理輸入之前,全程不更新模型權重。[論文](https://arxiv.org/abs/2608.13317)已獲 [COLM 2026](https://colmweb.org/AcceptedPapers.html)接收,實作亦已在 [GitHub](https://github.com/YanwenPneg/StateBridge)公開。
作者以四代理的 Planner、Critic、Refiner、Judger 管線,測試 Qwen3 4B、8B、32B 與 OLMo3-7B-Think,涵蓋數學、問答及程式生成。StateBridge 在26個模型—任務組合中有22個最佳或並列最佳,各模型平均較最強基線提高2.4至2.9點。較明顯的例子包括 Qwen3-8B 的 GPQA 由最強基線45.5%升至52.5%,AIME24由56.7%升至63.3%;Qwen3-32B 的 GPQA則由58.3%升至64.1%。相較跨層搬移 KV cache,StateBridge 只操作輸入 embedding 介面,因此 OLMo 架構更換後沒有出現相同程度的崩落。
限制同樣具體:實驗中的代理共享同一模型權重,尚未證明不同模型家族能直接互傳 latent;方法需要 forward hook 取得 hidden state,封閉 API 基本上無法採用。對齊亦包含約為 O(d³) 的分解及 O(KVd) 的詞彙搜尋,未有生產吞吐或跨機傳輸測試;部分 GSM8K 組合還因格式等問題落後文字基線。工程上值得追蹤的是,連續訊息能否跨量化、張量並行與異構模型保持語意,以及不可讀的代理通訊會否令除錯、審計與安全監控更困難。