返回首頁

生成式音訊

YuE2 以可編輯樂譜銜接完整歌曲生成,更新評測揭露 best-of-8 成本差異

YuE2-3B 先生成 ABC 旋律與和弦,再以共享注意力的 AR/NAR 架構合成 48 kHz 歌曲,讓使用者可在音訊渲染前直接修改作曲。9 月 12 日更新的 WildSongBench 將它列於 17 組系統首位,但領先結果使用八選一,不能與多數系統的雙候選設定直接等價。

J. Nathan Matias · CC BY-SA 2.0 · Image source
zh-Hant

YuE2 把長篇歌曲生成拆成可觀察的中間表示:輸入歌詞與風格後,模型先輸出 ABC 格式的主旋律及和弦,再生成語意音樂 token、以 flow matching 產生聲學 latent,最後由 VAE 解碼為 48 kHz 立體聲。這使「改副歌和聲、保留人聲旋律、轉換編曲」不必只靠自然語言反覆抽樣,而能先編輯樂譜再重新渲染。[專案文件](https://github.com/multimodal-art-projection/YuE)也公開 `plan()`、`generate_semantic()`、`synthesize()` 與 `decode()` 等分階段介面。

核心生成器約 35.9 億參數、28 層,採 AR–NAR Mixture-of-Transformers。自回歸與非自回歸專家共用注意力計算,但保有各自的正規化、投影及 MLP:前者負責樂譜與語意序列,後者處理聲學生成。建立歌曲、零樣本翻唱及編輯使用同一 checkpoint,只是樂譜來源不同;翻唱流程可先用獨立的 SheetSage2 將原音訊轉成旋律,再讓 YuE2 依新歌詞與風格重新演奏。

9 月 12 日更新的 [WildSongBench 結果](https://huggingface.co/datasets/m-a-p/WildSongBench/blob/main/benchmark/results.md)涵蓋 192 個提示、17 組開放及封閉系統。YuE2 best-of-8 的 SongBench 平均為 6.9632,高於表中的 Mureka 9、Suno v5 與 Suno v6;標準雙候選 YuE2 則為 6.7316。這個差距同時揭露重要限制:最高成績先生成八首,再按自動音樂性、控制度與音素錯誤率挑選;其他系統的候選數和交付協定並不一致,而且小幅均值差異沒有統計顯著性證明,也不是人類偏好測試。

工程部署目前要求 Python 3.12、支援 BF16 的 NVIDIA GPU及約 24 GB VRAM;程式碼採 Apache 2.0,模型權重則是限制商用的 CC BY-NC 4.0。[模型卡](https://huggingface.co/m-a-p/YuE2-3B)已提供權重與重現資源,但技術報告仍未發布。接下來應觀察單候選品質、生成延遲與記憶體量測,以及可編輯符號計畫是否真的提升人類工作流效率,而不只是提高自動評分。

來源

  1. YuE2: Unifying Symbolic and Audio Music Generation at Frontier Quality
  2. YuE2 project and interactive results
  3. WildSongBench results and evaluation scope
  4. YuE2-3B model card