返回首頁

模型評測

HIVE 發現語音轉錄比鍵盤錯字更傷 LLM 推理,增加思考預算也未能補回

新研究以語音轉錄與 QWERTY 鍵盤擾動測試指令模型,發現語音造成的結構改寫會一致降低作答表現。提高推理預算幾乎可修復鍵盤通道,卻無法同樣挽救口語輸入。

Roger Gilbertson · CC BY-SA 2.0 · Image source
zh-Hant

語音代理通常把自動語音辨識輸出直接送入語言模型,但系統評測多以乾淨文字提示進行。8 月 4 日公開的研究提出 Human Input-Variation Engine(HIVE),分別模擬 QWERTY 鍵盤錯誤、一般語音轉錄中的不流暢,以及 AI 聽寫工具對句子的壓縮與重組,用來測量輸入通道如何改變指令模型表現。

作者報告,受測的所有指令微調模型都會因語音轉錄擾動而降低準確率;主要問題並非加入「嗯」等填充詞,而是轉錄過程改寫了原句結構。鍵盤錯字的影響較小,模型能容忍相當程度的表面噪音,直到關鍵 token 被破壞。研究將兩種通道的共同失敗因素指向「原問題有多少 token 在擾動後仍被保留」:額外插入 token 通常代價有限,刪除或改壞原有 token 才會顯著傷害結果。

通道差距主要出現在需要自行建構或推導答案的任務;若答案已列在多選選項中,差異不明顯。作者也測試較高的 thinking budget,結果幾乎補回鍵盤擾動造成的損失,卻未修復口語轉錄,壓縮式語音甚至可能在增加推理後更差。輕量適應訓練同樣未能消除問題,因此不能簡單假設加入少量帶噪資料即可解決。

對語音代理工程師而言,ASR 的字錯率不足以代表下游風險;同樣的錯字率若刪掉否定詞、條件或實體,影響會遠高於加入贅詞。較實際的防線是保留原始轉錄與正規化版本、標示低信心片段,並在執行工具前要求使用者確認關鍵參數。這仍是單篇預印本,摘要未提供跨語言結果;中文斷詞、同音字與省略主詞可能形成不同失敗模式,值得以公開程式及完整資料進一步驗證。

來源

  1. Should We Type or Talk to LLM Agents? A Comprehensive Study of Voice and Keyboard Input Perturbations
  2. Author research profile: Zizhao Hu