AI 研究
Agentic-GER 回查語音片段,中文術語錯誤率最高相對降低 36.8%
研究讓代理讀取整份逐字稿,再重轉錄可疑片段,修正跨段不一致的專有名詞。官方已公開實作,但最大增益限於特定模型組合,部署仍須衡量誤改率與推論成本。

上海交通大學與阿里巴巴等研究者於 9 月 24 日公開 Agentic-GER,將長篇語音校正拆成尋找疑點、回查音訊與最小修改。它沿用既有語音辨識結果,利用整份逐字稿協助判斷專有名詞;論文目前為預印本,標示已投稿 ICASSP 2027。[論文資料](https://arxiv.org/abs/2609.29428)
流程先摘要主題與術語,再依全文及工作記憶挑出可疑片段,交由 Qwen3-ASR-1.7B 重轉錄。語言模型綜合新辨識結果與前後文決定保留或修改,證據不足便保留原文;修改與保留決策都會寫入記憶,供下一輪參考。片段時間邊界維持不變,中文每輪最多檢查四個候選,每份錄音最多執行三十二輪、接受四十八次修改。[實作說明](https://github.com/QwenAudio/FunResearch/blob/main/Agentic-GER/README.md)
評測涵蓋 GigaSpeechBench 十二個領域的 524 份中文與 387 份英文錄音。作者報告,中文術語最大相對改善來自 Whisper-Large-v3 初稿搭配未啟用思考的 Qwen3.8-Max:B-CER 從 35.07% 降至 22.16%,相對下降 36.8%。此指標只計算標註術語,不能解讀為整份逐字稿錯誤減少相同比例;初稿改用 FunASR 時,同一校正器的相對降幅為 17.9%。[評測結果](https://arxiv.org/html/2609.29428v1)
收益也受錯誤類型影響:替換錯誤通常留下可疑文字,漏掉的術語則較難由全文掃描發現。思考模式也非越多越好,Max 在四組比較中有三組術語成績退步;部分配置的整體辨識錯誤率也可能略升。評估校正器時,須同時追蹤術語與全文品質。[限制分析](https://arxiv.org/html/2609.29428v1)
官方程式庫已提供提示、評測轉接器及中英文設定,但預設使用 Qwen3.8-27B,與最大增益配置不同;快速入門僅各處理一份錄音,也未附逐錄音原始實驗結果。重現時須另備模型服務,並核對執行完成狀態,避免把失敗後沿用的原稿誤認成校正成果。[重現說明](https://github.com/QwenAudio/FunResearch/blob/main/Agentic-GER/README.md)
從流程判斷,這項方法對中文技術內容的價值,在於利用跨段重複出現的名詞,補足短片段的語意不足;但它依賴完整逐字稿,串流服務的即時收益尚未由本研究證明。工程團隊可先將它接在既有轉錄流程之後,以自身領域錄音量測誤改率、延遲與呼叫成本,再評估是否適合會議、課程等長音訊。