模型可解釋性
加入相容形容詞仍令 SAE 遺失 20% 至 60% 啟用特徵,挑戰「特徵袋」直覺
海德堡大學研究發現,稀疏自動編碼器的單一 latent 雖可解讀,整組啟用 latent 卻不穩定地對應人類概念。只在名詞前加入相容形容詞,原有啟用集合便可能消失兩成至六成,限制以集合重疊解讀模型狀態的可靠性。

稀疏自動編碼器(SAE)常被當成模型內部的「顯微鏡」:它把稠密 residual stream 分解成少量啟用 latent,研究者再依觸發文本替每個 latent 賦予概念解釋。新研究追問另一層問題:即使個別 latent 看似可理解,整組啟用 latent 是否真的像「特徵袋」般穩定組合?作者以啟用集合的 Jaccard 重疊取代稠密向量的 cosine similarity,並先證明此指標在合成 toy model 能恢復特徵聯集,在 The Pile 的三萬段文本中也能形成語意連貫鄰域。
到了自然語言,結果卻轉弱。以 Gemma 3 270M 與 16K big SAE 為主實驗時,SAE 集合對人類類別邊界的恢復不優於 residual stream;在「知更鳥比企鵝更典型地代表鳥」一類類內排序上,各類別 Spearman 相關多在零附近。研究者又建立 200 條名詞序列,逐步加入最多五個顏色、尺寸或狀態形容詞。若表示法具簡單組合性,「yellow shovel」理應保留 shovel 的 latent 再加入 yellow;實際上,原名詞 latent 的遺失率通常達 20%至60%,且會隨形容詞數量與部分模型層深增加。
這不代表 SAE 毫無價值。約六成的部分中層遺失 latent 曾在上游層出現,顯示問題可能包含探針截取位置與啟用門檻,而非模型完全忘記概念。研究也只測試短英文名詞片語、手工形容詞集合及有限的 Gemma/SAE 配置,尚未公開重現程式。工程上應避免把一次啟用、latent 集合差異或自動標籤直接當成因果證據;若 SAE 要支援監控、steering 或安全判定,下一步需加入跨提示穩定性、層間追蹤及實際介入實驗。