評測與資料集
Open ASR Leaderboard 加入印地語與印度英語,以表記格狀參考修正 WER 偏差
Hugging Face 與 Voice Arena 以 Monsoon 資料集擴充開放語音辨識排行榜,四個公開及私有分割涵蓋 4,888 名說話者。印地語改用可接受多種拼法的參考格狀結構,避免傳統單一轉錄把正確辨識誤算成錯字。

Open ASR Leaderboard 新增 Monsoon en-IN 與 hi-IN,首次把印地語及印度英語納入主要開放語音辨識評測。資料來自雙聲道、非腳本式對話,再切成單一說話者的短片段;四個公開與私有分割彼此不重疊,共涵蓋 4,888 名說話者、17 小時音訊,以及數百個地區與手機型號。[發布說明](https://huggingface.co/blog/open-asr-leaderboard-global-south)指出,每段資料附帶年齡、性別、教育、職業、原生地區及錄音裝置等 12 項屬性,讓研究者能把錯誤率拆到群體層級,而非只看一個平均值。
這次最具技術意義的改動是印地語評分。日常印地語包含大量英語借詞、語碼混用及複合詞分合差異,同一句話可能存在多個合理的天城文拼法。若只提供一條標準答案,傳統 WER 會獎勵模型模仿標註者的寫法。Monsoon hi-IN 因而為每個文字區段保存可接受變體的 lattice,並以 Orthographically-Informed WER 尋找有效對齊;團隊也公開 `voi-oiwer` 實作。扁平化為單一參考後,不只所有模型錯誤率上升,部分模型的排名還會互換。
分組結果亦顯示整體分數可能掩蓋部署風險:八個模型在印度英語公開集的總 WER 僅相差 0.18 點,但 Whisper Large V3 Turbo 的地區差距為 0.46 點,Voxtral Mini 3B 則達 1.68 點。印度英語結果已進入預設平均分;私有分割由維護者執行,以降低針對公開樣本調參的空間。排行榜程式採 [Apache 2.0 開放](https://github.com/huggingface/open_asr_leaderboard),公開資料則可供自行重跑。
限制在於資料刻意追求說話者廣度,單人通常只有數秒音訊,因此不適合推論長篇轉錄、串流延遲或說話者持續性。印地語樣本也集中於實際使用人口較高的印地語帶。下一步應觀察更多模型提交後,格狀評分是否穩定、私有集能否抵抗 benchmark fitting,以及同類設計能否擴展至更多多表記語言。