AI 可解釋性
SAEVerbalizerは特徴方向を直接言語化するが、最良のグローバル一致率も56.1%にとどまる
SAEVerbalizerは、スパースオートエンコーダーのdecoder directionをGemma 3に注入し、モデルが特徴の説明を直接生成するよう訓練することで、特徴ごとに高活性化コーパスを検索する工程を省く。27B版は、より厳格なグローバルテストで56.1%のReference Agreementを達成したが、参照回答自体がモデルによって生成されているため、メカニズムの真実とはまだ見なせない。