AI 評測與可靠性
ASR Benchmark Fitting、3種類のプローブで「答えの暗記」を定量化。一部モデルは誤った参照トランスクリプトを18~30%の確率で再現
Hume AIとHugging Faceは、音声が公開テストセットの正解と矛盾する場合でも、一部の高スコア音声モデルが参照トランスクリプトの内容を出力することを発見した。Open ASR Leaderboardには「Benchmark Fitting」タブが追加されたが、こうした挙動は、モデルがテストデータを直接見たことの証明にはならない。