語音 AI
AgenticASR 以滑動視窗反覆修訂轉錄,1B Refiner 將雙語評測推至 79.95 分
AgenticASR 把語音辨識與文字整理拆開,讓小型 Refiner 隨新語音重寫有限範圍的既有輸出,而不必反覆處理完整逐字稿。程式、檢查點與 917 題中英雙語基準已公開,但主要音訊由語音合成產生,評分也依賴 LLM 裁判。

傳統串流 ASR 追求逐字忠實,通常會保留贅詞、口吃、重複與說話者後來撤回的內容;若再逐段交給語言模型潤飾,模型又可能看不到後續修正線索。7 月 30 日公開的 AgenticASR 採用解耦式 ASR–Refiner 架構:前端辨識器持續產生文字,Refiner 則把最近數個來源區塊合併後重新生成乾淨文字,直接替換相對應的既有輸出區段。
預設系統只保留三個活動區塊,因此計算量取決於滑動視窗,而不是整段音訊長度。Refiner 由 MiniCPM-5-1B 初始化,以 10 萬組合成的口語/書面文字對進行全參數微調;研究也分別接上 Qwen3-ASR 與三種 Whisper 規模,顯示這一層不必綁定特定辨識器。公開串流實作整合 VAD、sherpa-onnx、穩定分塊與 MLX-LM,本機後端目前以 macOS 為主。
團隊同時發布 AASR-Bench,包含 917 個中英文樣本與 6,637 項原子規則,分別檢查內容保存、格式正規化、贅詞過濾及自我修正。Qwen3-ASR-1.7B 搭配 AgenticASR 得到 79.95 分,高於使用 Qwen3.5-Flash 後處理的 69.93 分與直接生成正式文字的 FormalASR 52.50 分;平均端到端延遲為 9.59 秒,API 後處理基線約 60.89 秒。作者另稱五種 ASR 前端均有改善,但弱 Whisper 前端的內容保存仍落後 API 基線。
限制在於多數測試音訊由 TTS 合成,只有 16.36% 人工錄製;規則由 Qwen3.7-Plus生成、Gemma-4-31B-IT 判分,仍可能帶入模型偏差。工程團隊下一步應驗證真實會議中的重疊語音、口音、噪音與超長串流,並量測修訂文字造成游標跳動或下游指令反覆觸發的產品風險。