AI 可解釋性
SAEVerbalizer 直接把特徵方向說成文字,但最佳全域一致率仍只有 56.1%
SAEVerbalizer 將稀疏自編碼器的 decoder direction 注入 Gemma 3,訓練模型直接產生特徵解釋,省去逐特徵搜尋高啟用語料。27B 版本在較嚴格的全域測試達 56.1%參考一致率,但參考答案本身由模型生成,尚不能視為機制真相。

傳統 SAE 解釋流程要先讓模型掃描大型語料、找出每個 latent 的最高啟用片段,再請另一個 LLM 歸納共同概念。新提出的 SAEVerbalizer 改從內部表徵下手:在提示詞 prefill 階段,把某個 SAE decoder direction 注入指定 Transformer 層的 token 表徵,只微調後續層,讓模型直接輸出該方向的自然語言說明。跨模型時則加上一個輕量 adapter,把來源模型的方向映射到 verbalizer 的表徵空間。
研究使用 Gemma 3 1B、4B、27B,以及 Gemma Scope 2 的 262k-width SAE。最佳 27B、layer 16 設定以 48,000 組 Neuronpedia 特徵—解釋配對訓練,在三套未見特徵測試取得 52.3%、80.5%與56.1%的 Reference Agreement;未微調 backbone 在相同測試只有1.6%、2.5%與1.2%。同一層換成訓練時未見的 65k-width 字典,三項分數為64.4%、56.5%與65.9%,顯示學到的能力不完全綁定單一 SAE 字典。把1B方向經 adapter 送入27B verbalizer,也略勝1B原生版本;但4B轉接後反而全面退步。
這項工作值得關注,因為它把「為每個特徵重新蒐證」改成可重用的表徵解碼器,可能降低大字典分析成本,亦能測試方向合成與正負號變化。不過 RA 只量度輸出是否符合經篩選的 Neuronpedia 說明,而那些說明同樣從啟用樣本推斷,並非可驗證真值;每項設定也只跑一次,未估計隨機變異。作者主要測試 Gemma Scope 2,且未提供公開實作。下一步應看跨模型家族重現、因果介入驗證,以及相對完整 activation-based 流程的實際算力節省。