返回首頁

模型可解釋性與評估

SAE 因各自挑選最高啟用 token,跨字典因果變異可由 11.9%降至近零

一項新研究發現,稀疏自編碼器的消融評估通常讓每套字典自行選擇最高啟用 token,導致看似相同的 latent 實際在不同位置受測。固定共同位置後,受控實驗中原本歸因於字典差異的 7.6%與11.9%變異幾乎消失。

GemmaHist · CC BY-SA 4.0 · Image source
zh-Hant

稀疏自編碼器(SAE)常被用來把語言模型的 residual stream 分解成可命名 latent。驗證某個 latent 是否真正影響模型時,研究者通常在它啟用最強的 token 將其貢獻歸零,再量度下一 token 分布的 KL divergence;問題是「啟用最強的位置」由受測字典本身決定。換一套 SAE,即使 decoder direction 幾乎相同,最高啟用 token 也可能跟著改變,令跨字典比較同時混入位置差異。

[新研究](https://arxiv.org/abs/2608.13337)先配對 Google 為同一模型發布、decoder cosine 相近的 Gemma Scope latent,確認生產級字典也經常挑到不同 token。作者再從相同初始化訓練 6 套 SAE,只改變 fitting 設定,以固定 latent 身分。在 Gemma-2-2B、384 條序列的 15 組字典配對、3,600 次比較中,兩套字典選到同一 token 的比例只有 13.9%;雖高於隨機基準的 3.5%,不同位置的中位距離仍達 118 tokens。

這個選擇會直接改寫可靠度結論。讓各字典在自己的最高啟用位置量度時,latent×字典交互作用佔變異的 7.6%與11.9%;改在共同 token 量度後,兩者都降至接近零。把評估語料擴大 16 倍也沒有改善,因為更多文本反而提供更多可供字典分歧的極值位置。作者亦指出,是否排除特殊 token、是否按介入幅度正規化,均可能在相同資料上翻轉比較方向。

修正本身只需在評估程式中固定共同位置,但報告規格必須同步列出位置選擇、特殊 token 處理及正規化方式。[程式、預註冊文件與結果](https://github.com/vcnoel/sae-artifact)已公開。需要注意的是,主要受控實驗只涵蓋 Gemma-2-2B、Gemma-3-1B、相同初始化的 TopK SAE 與單一研究者實作;結論針對單 latent 零消融的幅度量測,不能直接外推至 interchange intervention、多 latent 概念測試或所有 SAE 評估。

來源

  1. Where You Measure Decides What You Measure: Position Selection in Ablation-Based SAE Evaluation
  2. Artifacts in ablation-based causal-effect measurement of SAE latents