語音模型與推論
Sonic-3.6 登上兩套人評語音榜首,官方延遲數字仍非端到端量測
Cartesia 推出支援逾40種語言的 Sonic-3.6,並在 Artificial Analysis 的供應商語音及受控語音榜取得首位。產品頁宣稱首段音訊延遲低於90毫秒,但公開資料尚不足以分離模型計算、網路及播放緩衝成本。
Cartesia 在8月18日開放 Sonic-3.6 測試,主打即時語音代理所需的自然節奏、情緒表達、跨語言切換及低延遲串流。官方產品頁列出逾40種語言、10秒語音複製、自訂發音字典,以及在文字中插入笑聲等非語言表達;系列採用狀態空間模型路線,以持續處理序列降低即時生成成本,而非為每個新音訊片段重新處理全部歷史內容。
較值得注意的是獨立人評結果。Artificial Analysis 同時維護兩種 Speech Arena:Provider Voices 使用各供應商自行挑選的原生聲線,容易同時反映聲優、錄音及模型品質;Controlled Voices 則把模型套用至相同參考聲線,較能隔離合成引擎本身。發布時的公開結果顯示,Sonic-3.6 在兩榜均列第一,報道記錄的 Elo 分別為1,283及1,123。後者尤其重要,因為它降低了供應商以優質預設聲線取得優勢的可能,但仍屬聽眾成對偏好,不等同字錯率、說話者相似度或特定中文腔調測試。
官方宣稱 time-to-first-audio 低於90毫秒,工程團隊不應直接把它當成使用者感受到的往返延遲:API區域、文字分段、網路、音訊緩衝及客戶端播放都會增加時間。Cartesia亦未公開Sonic-3.6的參數量、訓練資料、逐語言測試或完整模型卡。接下來應觀察固定中文語料的盲測、長句穩定度、並發下尾端延遲,以及正式API是否提供不可變版本識別碼,避免模型更新令生產聲音漂移。