生成式音訊
YuE2-3B 以可編輯樂譜規劃完整歌曲,最佳八選一成績才超越 Suno v5
YuE2 把旋律與和弦的符號規劃、語意 token 和 flow-matching 音訊合成放進同一套生成流程。權重可在 24GB GPU 執行,但非商用授權及最佳八選一評測,使其與商用系統的比較仍須保守解讀。

M·A·P 團隊公開 [YuE2-3B 權重與推論套件](https://huggingface.co/m-a-p/YuE2-3B),把完整歌曲生成拆成可檢查、可編輯的中間表示。使用者輸入曲風與歌詞後,模型可先產生包含旋律及和弦的 ABC 樂譜,再生成 25 Hz 語意音樂 token、聲學 latent,最後由 VAE 解碼成 48 kHz 立體聲。這與只能反覆修改文字提示的黑箱音樂生成器不同:工程師或另一個代理可以直接調整音高、節奏、和聲和段落,再重新合成音訊。
[專案技術頁面](https://map-yue2.github.io/)列出的模型約有 35.9 億參數及 28 層,使用 AR–NAR Mixture-of-Transformers。自回歸與非自回歸專家共用注意力運算,但保留各自的 normalization、projection 與 MLP;後段則用 flow matching 生成聲學 latent。介面提供完整旋律與和弦規劃、僅旋律規劃及不使用符號計畫三種模式,也把 `plan`、語意生成、聲學合成與解碼分開暴露,方便建立編輯或批次工作流。官方表示 BF16 推論可在具 24GB 顯存的 NVIDIA GPU 上運行。
在含 192 個提示的 WildSongBench 上,標準 YuE2 的 SongBench 平均為 6.7316,低於 Suno v5 的 6.8721;從八個候選中依音樂性、提示控制與歌詞準確度挑選最佳結果後,才升至 6.9632。這個差異很重要:best-of-8 代表約八倍候選生成成本,也引入選擇器帶來的優勢,不能當成單次生成能力。評測主要是團隊發布的自動指標,尚缺獨立聽測與相同成本下的比較。
模型卡採 CC BY-NC 4.0,不能直接用於商業產品;推論還需安裝模型倉庫內提供的自訂 wheel。團隊稱訓練資料約 34.6 萬小時,主要來自 CC0 音樂與獲授權的合成資料,但目前公開資訊不足以逐項稽核資料組成。後續值得觀察的是單次生成品質、中文歌詞的音素錯誤率、實際生成速度,以及社群能否在不同 GPU 與解碼器上重現結果。