返回首頁

開放模型與邊緣 AI

Inflect v2 更新超小型本地 TTS 套件,4M 參數模型可自行調整聲音並匯出 ONNX

Inflect-Nano-v2 將完整文字轉波形模型控制在 3.97M 參數,近期更新加入可執行的單一說話者調整流程。它適合離線與邊緣語音介面,但訓練資料、跨語言效果及品質比較仍缺乏獨立驗證。

Ben Schumin · CC BY-SA 3.0 · Image source
zh-Hant

獨立開發者 Owen Song 更新 Inflect v2,將兩款固定聲音的英文 TTS 模型與調整工具整理成可直接執行的本地套件。Inflect-Nano-v2 共有 3,966,721 個可部署參數,FP32 權重為 15.97 MB;品質優先的 Micro-v2 則有 9,356,513 個參數、37.53 MB。兩者均包含 24 kHz 神經波形解碼器,而非只計算文字編碼器,並可透過相同 Python API 在 CPU 或 CUDA 執行。

架構屬於參數精簡的 VITS 系列,結合英文音素前端、單調對齊、隨機潛在變數合成、殘差耦合流與降低混疊的波形解碼器。Nano 使用 128 維潛在表示、三層雙頭文字編碼器和四個 flow coupling blocks。近期補上的 adaptation toolkit 可匯入單一說話者錄音與逐句文字,從 Nano 或 Micro checkpoint warm-start,支援中斷續訓、保留驗證音訊,最後輸出 PyTorch 或 ONNX 模型。這使它從只能播放固定聲音的權重,跨到可為嵌入式產品建立私有語音的基礎工具。

對手機、樹莓派、遊戲或不允許音訊上雲的介面而言,十多 MB 的完整模型可降低記憶體、下載量和冷啟動成本;固定 seed 亦有助於回歸測試。不過音素化仍依賴 eSpeak-ng,並未計入參數數量;公開模型只驗證英文固定聲音,改成中文等語言需要新的音素規則與大量配對資料,不能視為少量樣本聲音複製。訓練語料建置流程也未完整公開。團隊採用前應自行測試長文韻律、數字與專名、CPU 即時率,以及量化或 ONNX 匯出後的失真。

來源

  1. Inflect-Nano-v2 model card
  2. Inflect adaptation toolkit
  3. You can now fine-tune my 3.96M-parameter TTS on your own voice or language