模型可解釋性與評測
同一組模型的「測試感知」隨提示詞由正相關翻成負相關,模型本身只解釋 0.8%變異
一項重測發現,改寫探針的情境包裝,就能把模型規模相關係數由 +0.94 移至 −0.82。研究建議至少跨九至十組提示詞量度,否則單一 activation direction 不足以比較模型。

部分安全研究嘗試從模型中間啟用值判斷它是否知道自己正在接受評測:分別收集「這是測試」與「一般部署」提示的 activation,取兩組平均值之差作為方向,再檢查未見資料沿該方向能否分離。新研究指出,這個方法把提示詞包裝當成實作細節,但測量結果實際上主要屬於提示詞,而非模型。
作者把六種評測情境與六種部署情境交叉成 36 組 wrapper,保持任務文字逐 byte 相同,先測 Qwen2.5 四個尺寸,再以 Qwen3、OLMo-2、Gemma、Llama及 SmolLM 系列作敏感度檢查。在 Qwen2.5 階梯上,只替換部署情境,分數與參數量對數的相關係數便可由 +0.94、−0.02 移至 −0.82;36 組中有 21 組呈正相關、15 組呈負相關。相同 wrapper 用不同題目子集建立的方向 cosine similarity 達 0.9995,改用另一 wrapper 後卻只剩 0.3749,排除了單純抽樣噪音的解釋。
以 generalizability theory 分解後,模型只解釋報告數值的 0.8%變異,wrapper 與模型交互作用遠大於題目與模型交互作用。沿用單一 wrapper 的可靠度係數僅 0.018;增加題目幫助有限,跨 wrapper 平均才有明顯改善。作者估算,若假定既有研究聲稱的模型差距成立,至少需要約九組 wrapper;在 OLMo-2 的實測變異下則需要十組。
研究亦發現原評分集可用 725 個 bag-of-words 特徵達到 0.993 AUROC,意味表面格式本身已高度暴露標籤。這不是證明模型完全沒有「測試感知」,而是證明現行 difference-of-means 探針不能憑單一提示支撐跨模型結論。後續研究應公開所有 wrapper、加入無內容控制方向,並完整記錄 layer、token pooling、換行及截斷設定。