AI 評測與可靠性
ASR Benchmark Fitting 以三類探針量化背題,部分模型重現 18% 至 30% 錯誤參考稿
Hume AI 與 Hugging Face 發現,若音訊與公開測試集答案衝突,部分高分語音模型仍會輸出參考稿內容。Open ASR Leaderboard 已加入 Benchmark Fitting 分頁,但這些行為不等同證明模型直接看過測試資料。

一項涵蓋 11 款開源語音辨識模型的新研究,把模糊的「benchmark 污染」問題改寫成可執行的行為測試。研究者設計三類探針:先找出 VoxPopuli 音訊與參考稿互相矛盾的片段;再把 LibriSpeech 或 VoxPopuli 中的數字靜音,檢查模型是否仍補回原答案;最後利用「Mr./Mister」等同音異寫形式,觀察模型能否依資料集聲學線索切換成該測試集偏好的拼法。
結果顯示,部分公開榜單上 WER 較低的模型反而較常複製錯誤參考稿。研究團隊在抽查範圍內把約 40% VoxPopuli 測試片段標為可能含參考錯誤,涉及約 3% 的參考詞;出現 benchmark-conditioned 行為的模型,有 18% 至 30% 機率選擇錯誤參考稿。當目標數字被完全靜音時,若干模型在公開資料集仍有接近 40% 的精確補回率。11 款模型中另有六款在敬稱拼法測試顯著高於 0.5 的隨機切換基線。
機制實驗進一步指出,觸發訊號不只存在於文字解碼器。保留相同句子、改用新錄製的議會聲音或一般合成聲音後,複製答案的傾向通常下降;在原片段後附加八秒一般對話,也可讓多款模型恢復較忠於音訊的輸出。作者亦能以低秩線性 steering 改變此行為,顯示模型可能從狹窄的音色、錄音環境或資料來源特徵判斷「這是哪個 benchmark」。
Hugging Face 已把參考稿分歧與正字法切換指標加入 Open ASR Leaderboard,並公開評測程式及未正規化輸出。工程團隊選型時,應把新錄製、時間切分或說話者隔離的私有測試集與 WER 並列。重要限制是研究只覆蓋兩個主要英文資料集及 11 款模型;觀察到答案式行為可能源於訓練資料、微調、模型挑選或資料分布捷徑,不能單憑分數斷言開發者直接把測試集加入訓練。