開源語音模型
騰訊 AuK 以單一指令介面統合語音生成、內容改寫與聲學編輯
AuK 將零樣本 TTS、語句替換、音色與情緒調整、降噪及聲源分離納入同一個 1.5B 生成模型。蒸餾版 AuK-Flash 只需四個取樣步驟,但 4.5 倍加速與品質優勢目前仍主要來自團隊自己的實驗。

騰訊混元、上海交通大學等團隊於 9 月 8 日提交 [AuK 技術報告](https://arxiv.org/abs/2609.08936),翌日公開[程式與權重](https://github.com/Tencent-Hunyuan/AuK)。與分別串接 TTS、語音修補、降噪及聲源分離模型的常見流程不同,AuK 接收自然語言指令及可選的參考音訊,統一處理零樣本與描述式 TTS、字詞插入或刪除、歌詞改寫、音高與語速控制、情緒/音色/口音調整,以及人聲強化與分離等 16 類任務。
架構由三部分組成:多模態語言模型提供語意條件;共同以語音、一般音訊和音樂訓練的 VAE 表示聲學內容;生成器則先以雙串流 MMDiT 分別處理條件,再交給單串流 DiT,使用 rectified-flow 目標合成結果。團隊稱訓練資料換算為約 30.3 億組指令—音訊實例、195 萬小時有效監督,先做純生成預訓練,再聯合學習生成與編輯,最後分別加入人類偏好最佳化及獎勵式強化學習。
部署時不能只按「1.5B」估算資源:現有實作還要載入獨立 VAE 與 Qwen2.5-Omni-3B 編碼器,檢查點亦分開下載。基礎版可調整取樣步數及 classifier-free guidance;AuK-Flash 經一致性初始化與任務路由蒸餾後,固定四步、關閉 CFG,官方在相同條件下測得牆鐘時間快 4.5 倍。倉庫已提供命令列、Python、Gradio、ComfyUI 與微調入口,方便工程團隊測試,但論文中的領先結果尚待第三方以不同語言、口音及噪音環境重現;聲音仿製的授權、冒用與浮水印治理也未因模型開源而自動解決。