代理系統
StateBridge 以閉式對齊傳送代理隱藏狀態,26 組測試有 22 組最佳或並列最佳
StateBridge 用正交 Procrustes 轉換,把發送代理的末層隱藏狀態映射至接收代理的輸入嵌入空間,毋須訓練投影器。四款模型的平均成績比最強基線高 2.4 至 2.9 點,但目前只支援使用相同模型權重的代理。

多代理 LLM 通常把中間推理寫成文字,再交給下一個代理;這會把連續隱藏狀態壓成離散 token,接收端只能重新取得 token embedding。StateBridge 改為擷取發送端生成訊息時的末層 hidden states,並以對應 token 的 embedding 作參考,經過中心化、白化、正交 Procrustes 對齊、範數校準及 vocabulary anchoring,再透過 `inputs_embeds` 當作連續 prefix 注入下一個代理。正交映射保留狀態之間的距離與角度,也避免為每個模型或任務重新訓練 projector。
作者在 Planner、Critic、Refiner、Judger 四代理流水線測試 Qwen3-4B、Qwen3-8B、Qwen3-32B 與 OLMo3-7B-Think,涵蓋 GPQA、MedQA、AIME、GSM8K、HumanEval+ 等八項基準。StateBridge 在 26 個模型—任務組合中有 22 個取得最佳或並列最佳,四個模型設定的平均分數均較最強文字或 KV-cache 基線高 2.4 至 2.9 點;Qwen3-8B 的 GPQA 增幅達 7.0 點。OLMo3 上,逐層注入 KV cache 的 LatentMAS 平均只有 55.1%,StateBridge 則為 76.7%,顯示只使用共同的輸入嵌入介面較不依賴 Transformer 內部結構。
這不是通用的跨模型代理協議:實驗假設所有代理共享同一組權重,prefix 長度固定,且部分 GSM8K 組合反而退步。測試亦使用溫度 0.6 的隨機解碼,目前結果主要來自作者的單一實作,尚缺獨立重現。工程上接下來應觀察其對異質模型、批次服務、KV cache 管理及端到端延遲的影響,而不只看任務正確率。