語音模型與邊緣推論
Sopro V2 Turbo、120Mパラメータの音声モデルを公開——2ステップの音響ソルバーでCPUストリーミング合成
Sopro V2 Turboは、500Mパラメータの教師モデルを120Mパラメータへ蒸留し、さらにreflowによって音響ソルバーを32ステップから2ステップへ短縮した。M3 CPUでは約300ミリ秒で最初の音声チャンクを出力でき、ブラウザ推論にも対応するが、現時点で利用できるのは欧州の4言語のみで、訓練コードは公開されていない。

Halo Researchは、Sopro V2 TurboのApache 2.0ライセンスの重み、PyTorch推論コード、ONNXブラウザ版を公開した。モデルは英語、ドイツ語、フランス語、欧州ポルトガル語に対応し、5〜20秒の参照音声からゼロショット音声クローニングを行える。Apple M3 CPUでの公式測定では、オフラインのreal-time factorは0.24、ストリーミングでは0.21で、最初の音声チャンクは約300ミリ秒で出力される。これは理論上、10秒の音声を約2秒で生成できることを意味するが、この数値は単一ストリームかつデフォルト設定での結果であり、高並行サービスへそのまま外挿することはできない。
アーキテクチャでは、まずRoPE、RMSNorm、grouped-query attentionを備えた自己回帰decoderがセマンティックtokenを生成する。次にflow-matching音響ヘッドがmel spectrogramを生成し、最後に3フレームのlookaheadを備えた因果的Vocosバリアントがストリーミング音声を出力する。音声tokenizerはWhisper large-v3 encoderからウォームスタートされ、FSQボトルネックを経た後、20Mパラメータ版へ蒸留される。参照音声の文字起こしを必要としないため、エッジ展開時に別途ASRを実行する必要はない。
訓練プロセスでは、まず500Mパラメータの教師モデルを構築し、3ラウンドのDPOを経て120Mパラメータの生徒モデルへ蒸留する。さらにreflowによる自己蒸留を用いて、音響ソルバーを32ステップから2ステップへ削減した。公式報告によると、Seed-TTS test-enにおけるストリーミング版のWERは1.51、話者類似度は0.644で、LibriSpeechではWER 1.88を記録した。これらの結果はWhisper large-v3とWavLMによる自動評価に基づく。ベースラインの一部は他の論文から直接引用されており、同一のハードウェアおよびコード環境で実施された独立比較ではない。
エンジニアリング上の制約も明確だ。言語が混在する文章や、数字、記号の読み上げは依然として不安定で、ストリーミング版の品質はオフライン版と完全には同等でない。重みと推論コードは公開されているものの、訓練コードは当面リリースされず、watermarkも備えていない。中国語モデルを開発するチームは、小規模な語彙、ASRでアラインされたtokenizer、2ステップの音響蒸留という設計を参考にできるが、既存のcheckpointで中国語を直接合成することはできない。次の焦点は、第三者によるレイテンシーの再測定、主観的音質評価、音声クローニングの安全性評価となる。