語音生成/推論系統
Faster IndexTTS-2 將自回歸語音管線移植至 TensorRT,端到端最高加速 3.6 倍
新研究以 TensorRT 與 TensorRT-LLM 重構 IndexTTS-2 的 GPT、擴散 Transformer 和聲碼器,並加入串流及批次推論。中英文 Seed-TTS 實驗顯示 GPT 最高加速 5 倍,但目前公開材料仍不足以直接重現整套最佳化管線。

研究團隊在 7 月 23 日提交 Faster IndexTTS-2,針對自回歸零樣本文字轉語音在產品環境中的主要瓶頸動手。原版 IndexTTS-2 由自回歸 GPT、採 flow matching 的 Diffusion Transformer,以及最終聲碼器組成;雖能利用參考音訊複製聲線並控制情緒,但原始推論速度僅勉強達到即時,且缺乏完整的串流與批次處理路徑。
Faster IndexTTS-2 並非重新訓練一個聲學模型,而是把三段神經網路推論移到 NVIDIA TensorRT 與 TensorRT-LLM。GPT 端可利用為大型語言模型設計的執行與記憶體最佳化;後續擴散 Transformer 與聲碼器也改成 GPU 最佳化引擎。系統另外讓各元件支援批次推論,以提高同時處理多段語音時的 GPU 使用率,並提供串流輸出,讓語音代理不必等待整句波形完成後才開始播放。
作者在英文及中文 Seed-TTS 測試中,報告自回歸 GPT 最高加速 5 倍、端到端最高加速 3.6 倍,同時表示字錯率、說話者相似度與自然度只有輕微下降。這對即時客服、遊戲角色和語音代理很實際:首段音訊延遲、持續生成速度及併發吞吐,往往比離線生成一段音檔的總時間更能決定互動品質。
不過目前論文只有四頁,結果仍來自作者測試;原始 IndexTTS 儲存庫雖公開模型與推論程式,尚未提供與論文完全對應的 Faster IndexTTS-2 可重現套件。工程師接下來應關注實際 GPU 型號、批次大小、首音訊延遲、顯存占用,以及 TensorRT 引擎建置時間。若只比較最佳吞吐數字,可能掩蓋單請求或短句場景下的額外排程成本。