最新模型
Grok Voice Transcribe 2.0 降低轉錄錯誤率,預設模型切換需留意
新版維持既有轉錄價格,官方多語短句測試與獨立批次評測均顯示詞錯誤率下降。批次速度、中文格式化支援及預設模型切換仍需分別驗證。

SpaceXAI 於 9 月 18 日推出 Grok Voice Transcribe 2.0,沿用每小時音訊 0.10 美元的批次價格與 0.20 美元的串流價格。官方表示模型以雜訊、多語音訊訓練並經後訓練調整,針對電話、口述帳號及短指令改善辨識;內部多語短句測試的詞錯誤率由 20.6% 降至 6.8%,這仍是供應商測量。[發布公告](https://x.ai/news/grok-voice-transcribe-2)
獨立證據來自 Artificial Analysis:9 月 19 日查核時,非串流榜上的 2.0 詞錯誤率為 2.3%,1.0 為 4.0%。同一表格的速度倍率卻由 242.1 降至 155.1,顯示準確度改善並不等於所有負載都更快。這是整段音訊的批次測量,不能直接換算成語音代理等候回覆的時間。[批次評測](https://artificialanalysis.ai/speech-to-text)
介面仍提供檔案轉錄與 WebSocket 串流,可選說話人標記及最多八聲道分別轉錄。Smart Turn 會預測說話者是否已完成表達;數字格式化則須同時指定語言與 `format=true`。對工程團隊而言,這些選項分別影響輪替時機、資料欄位及後續工具呼叫,更新模型後應以相同音訊重播,檢查實體值與回覆時點是否改變。[API 指南](https://docs.x.ai/developers/model-capabilities/audio/speech-to-text)
版本遷移也需留意:發布文說 2.0 即將成為預設,但目前模型文件已將其列為省略 `model` 時的預設值。需要可重現結果的服務應明確指定版本;官方預告未來數週棄用 1.0,尚未在公告給出確切日期。[模型文件](https://docs.x.ai/developers/models/speech-to-text)
中文部署仍有證據缺口。官方格式化語言表未列中文,不能由多語宣稱推定中文數字與地址的輸出契約;獨立榜單約八小時的資料組成,也不足以代替繁體中文或中英混語測試。該指標以代理對話資料占一半,議會發言與財報電話各占四分之一,且會正規化數字與標點。若產品要求逐字保留或精確重建帳號格式,排名分數與實際驗收標準仍可能不同。[評測方法](https://artificialanalysis.ai/methodology/speech-to-text)
串流評測另以語音活動偵測到的結束點起算延遲,與完整對話往返不同。工程師下一步應分別測量字錯誤率、專有名詞完整匹配及過早結束率,同時記錄端點設定與串流事件順序,再決定是否切換。