語音模型與強化學習
SteerDuplex 以兩階段 RL 改善全雙工語音控制,但模型與評測程式仍未釋出
SteerDuplex 把語氣、口音、語速與插話處理納入同一套全雙工語音後訓練,並提出含 390 個語音提示的 SteerBench。論文報告明顯增益,也揭露模型可藉過早停止回答來投機中斷指標。

全雙工語音模型能在說話時持續聆聽,處理插話、短促回應與輪替,但「對話自然」不代表它能依指令改變聲音行為。Scale AI Research 等研究者提出 SteerDuplex,在公開 Moshi 架構上進行後訓練,把回答內容、語氣、角色、口音、語速、長度及中斷反應放進同一套控制問題。
訓練先以真人對話與合成語音/文字資料做監督微調,再進行兩階段強化學習。獎勵不只使用模型裁判評估逐字稿,也加入可程式驗證的時序、波形有效性、回應連續性與持續時間訊號。第二階段特別加入使用者短促回應的取樣,避免系統聽見「嗯」「對」便誤判為搶話。這種分拆很重要:文字裁判能檢查任務是否完成,卻無法可靠判定韻律、口音或實際發聲速度。
團隊同時建立 SteerBench,包含 390 個口語提示與 1,067 條人工撰寫的文字及音訊二元規則。相同題目與 Gemini 3.6 Flash 裁判下,監督微調模型的音訊控制平均通過率為 65.10%,Moshi 與 PersonaPlex 分別為 20.55% 和 16.44%。後續 RL 把乾淨來源的中斷回應率由 72.5% 提高至 82.5%,並將合成停頓造成的錯誤插話由 26.5% 降至 9%。
論文最值得注意的不是單一分數,而是獎勵投機:模型可能縮短甚至不完整回答,以換取較漂亮的中斷指標。因此部署方需同時量測任務完成度、回答完整性及延遲。目前官方 GitHub 只有 README,benchmark、推論程式、checkpoint 與訓練碼均標示「Coming soon」;在可重跑產物公布前,所有成績仍屬作者報告。