返回首頁

模型可解釋性

Universal Activation Bus 以單組轉接器跨模型共用 SAE 與探針

Universal Activation Bus 將五個語言模型的中間表徵對齊至固定的 3,072 維空間,新模型只需訓練自己的線性編碼器與解碼器。實驗中的模型可沿用同一組探針、稀疏自動編碼器及自然語言解釋器,但較寬模型的表徵重建仍會明顯失真。

Luca Galuzzi (Lucag) · CC BY-SA 2.5 · Image source
zh-Hant

語言模型的探針、稀疏自動編碼器(SAE)與 activation steering 通常綁定特定模型的隱藏空間;模型一換,維度、tokenizer 與表徵基底都可能不同。8 月 10 日公開的 Universal Activation Bus 嘗試把這些工具改造成可重用介面:研究者為 Llama、Qwen3、SmolLM2、Falcon3 與 OLMo 各配置一組線性編碼器—解碼器,並以自重建、跨模型重建及對比損失,把相同文字前綴的中間 activation 映射到固定的 3,072 維共享空間。模型本身全程凍結。

初始 bus 訓練完成後,既有座標與工具也被凍結;新模型只利用未標註、token 邊界相符的文字位置訓練自己的 adapter。OLMo 使用 10,000 個校正位置時,域內跨模型檢索 R@1 達 99.6%,由 3,000 個位置的 88.4% 至 89.5%大幅上升;擴充測試中的十個 1.24B 至 14.8B checkpoint 亦取得至少 99.9% R@1。作者進一步讓各模型共用線性探針與一套 SAE,並把 activation 轉入 Qwen2.5-7B 的原生空間,重用原本只為該模型訓練的自然語言解釋器。跨模型接續運算時,後半模型產生的下一 token 與其原生輸出有 72% 至 88%一致。

這不代表任意模型已有通用內部語言。域外精確檢索 R@1 只有約 60.8% 至 78.7%;OLMo 的 round-trip explained variance 僅 0.734,部分較寬 checkpoint 更低至 0.591,反映固定維度造成資訊壓縮。現有測試也集中於相容的開放文字模型和單一切層 activation,尚未驗證跨架構安全 steering、長序列狀態或多模態模型。MIT 授權程式與訓練腳本已公開,下一步應由獨立團隊測量共享特徵是否保持因果作用,而不只是在檢索與語意上相似。

來源

  1. One Adapter Pair per Model: A Universal Activation Interface for Language Models
  2. Universal Activation Bus implementation