語音模型與邊緣推論
Sopro V2 Turbo 開放 120M 語音模型,以兩步聲學求解在 CPU 串流合成
Sopro V2 Turbo 將 500M 教師蒸餾至 120M 參數,再以 reflow 把聲學求解從 32 步縮為兩步。模型可在 M3 CPU 約 300 毫秒輸出首段音訊並支援瀏覽器推論,但目前只有四種歐洲語言且未公開訓練程式。

Halo Research 公開 Sopro V2 Turbo 的 Apache 2.0 權重、PyTorch 推論程式與 ONNX 瀏覽器版本。模型支援英語、德語、法語及歐洲葡萄牙語,可從 5 至 20 秒參考音訊進行零樣本聲音複製;在 Apple M3 CPU 上,官方量得離線 real-time factor 為 0.24,串流為 0.21,首段音訊約 300 毫秒。這代表十秒語音理論上可在約兩秒內生成,但數字是單串流、預設設定,不能直接外推至高併發服務。
架構先由具 RoPE、RMSNorm 與 grouped-query attention 的自回歸 decoder 產生語意 token,再以 flow-matching 聲學頭生成 mel spectrogram,最後交給具三影格 lookahead 的因果 Vocos 變體輸出串流音訊。語音 tokenizer 從 Whisper large-v3 encoder 暖啟動,經 FSQ 瓶頸後再蒸餾成 20M 參數版本;它不要求參考語音的文字稿,因此邊緣部署毋須另跑 ASR。
訓練流程先建立 500M 教師,經三輪 DPO 後蒸餾至 120M 學生模型,再用 reflow 自我蒸餾把聲學求解器由 32 步降至兩步。官方在 Seed-TTS test-en 報告串流版本 WER 1.51、說話者相似度 0.644;LibriSpeech 測得 WER 1.88。這些結果使用 Whisper large-v3 與 WavLM 自動評分,基線部分直接取自其他論文,尚非統一硬體及程式下的獨立比較。
工程限制同樣明確:混合語言、數字與符號的讀法仍不穩,串流品質不完全等同離線版本;權重與推論碼雖已公開,訓練碼近期不會釋出,也沒有浮水印。中文團隊可借鑑其小詞表、ASR 對齊 tokenizer 與兩步聲學蒸餾設計,但不能直接用現有 checkpoint 合成中文;下一個關鍵是第三方重跑延遲、主觀音質及聲音複製安全評測。