返回首頁

語音生成/推論系統

Faster IndexTTS-2 將自回歸語音管線移植至 TensorRT,端到端最高加速 3.6 倍

新研究以 TensorRT 與 TensorRT-LLM 重構 IndexTTS-2 的 GPT、擴散 Transformer 和聲碼器,並加入串流及批次推論。中英文 Seed-TTS 實驗顯示 GPT 最高加速 5 倍,但目前公開材料仍不足以直接重現整套最佳化管線。

This image photographed by Brian Burnell with permission was uploaded to Commons by George Hutchinson.To see his entire portfolio, click here. Permission to upload photographs by Brian Burnell is archived in the OTRS system as shown below … · CC BY-SA 3.0 · Image source
zh-Hant

研究團隊在 7 月 23 日提交 Faster IndexTTS-2,針對自回歸零樣本文字轉語音在產品環境中的主要瓶頸動手。原版 IndexTTS-2 由自回歸 GPT、採 flow matching 的 Diffusion Transformer,以及最終聲碼器組成;雖能利用參考音訊複製聲線並控制情緒,但原始推論速度僅勉強達到即時,且缺乏完整的串流與批次處理路徑。

Faster IndexTTS-2 並非重新訓練一個聲學模型,而是把三段神經網路推論移到 NVIDIA TensorRT 與 TensorRT-LLM。GPT 端可利用為大型語言模型設計的執行與記憶體最佳化;後續擴散 Transformer 與聲碼器也改成 GPU 最佳化引擎。系統另外讓各元件支援批次推論,以提高同時處理多段語音時的 GPU 使用率,並提供串流輸出,讓語音代理不必等待整句波形完成後才開始播放。

作者在英文及中文 Seed-TTS 測試中,報告自回歸 GPT 最高加速 5 倍、端到端最高加速 3.6 倍,同時表示字錯率、說話者相似度與自然度只有輕微下降。這對即時客服、遊戲角色和語音代理很實際:首段音訊延遲、持續生成速度及併發吞吐,往往比離線生成一段音檔的總時間更能決定互動品質。

不過目前論文只有四頁,結果仍來自作者測試;原始 IndexTTS 儲存庫雖公開模型與推論程式,尚未提供與論文完全對應的 Faster IndexTTS-2 可重現套件。工程師接下來應關注實際 GPU 型號、批次大小、首音訊延遲、顯存占用,以及 TensorRT 引擎建置時間。若只比較最佳吞吐數字,可能掩蓋單請求或短句場景下的額外排程成本。

來源

  1. Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs
  2. IndexTTS official repository