返回首頁

模型與邊緣推論

VibeVoice-ASR-BitNet 以異質量化把語音辨識壓至 1.58 GB,三顆 CPU 執行緒即可即時轉錄

Microsoft Research 公開 VibeVoice-ASR-BitNet,分別以 INT8 與三值權重量化語音編碼器和語言模型,讓多語 ASR 不需 GPU 即可運作。官方測試顯示模型較同容量 Whisper.cpp 快 1.6 至 2.3 倍,但目前只支援離線批次轉錄。

miss_rogue on flickr, https://www.flickr.com/photos/missrogue/132777293/ · CC BY-SA 2.0 · Image source
zh-Hant

Microsoft Research 發布 VibeVoice-ASR-BitNet 的技術報告、MIT 授權權重與 C++ 推論實作,目標是在一般 x86 或 ARM CPU 上執行以語言模型為核心的多語語音辨識。它沿用 VibeVoice-ASR 的「VAE tokenizer 加自回歸解碼器」結構,但把原本的 Qwen2.5-7B 解碼器換成 1.5B 版本,降低邊緣裝置的記憶體需求。

壓縮並非對全部元件套用同一格式。團隊觀察到 ConvNeXt VAE tokenizer 主要受啟用值與記憶體傳輸限制,因此使用全管線 I8_S,並融合正規化、卷積及啟用函式,減少中間張量的讀寫;權重頻寬主導的 Transformer 解碼器則採 I2_S 三值權重,嵌入與少數敏感部分保留 Q6_K。模型總容量由 FP16 的 4.62 GB 降至 1.58 GB,壓縮約 2.9 倍。

在 AMD EPYC 7V13、20 秒音訊的官方測試中,三條執行緒的 real-time factor 為 0.77,代表處理速度已快於音訊播放時間;相同約 1.6 GB 容量下,端到端速度較 INT8 Whisper.cpp large-v3-turbo 快 1.55 至 2.28 倍。團隊也公開 AVX2、NEON SIMD 核心及 GGUF 檔,可透過 llama.cpp、Ollama 或 Docker Model Runner載入。

代價是精度並非全面持平:相較 7B 基線,多個資料集的 WER 或 CER 上升,中文 AISHELL-4 的 CER 更由 19.83% 增至 27.45%。此外,所謂「即時」目前是整段音訊處理速度;實作尚不支援串流分塊與增量解碼。工程團隊下一步應檢查真實 CPU、口音、噪音及長錄音表現,而不能只依單一 EPYC 測試決定部署。

來源

  1. VibeVoice-ASR-BitNet Technical Report
  2. microsoft/VibeVoice-ASR-BitNet model card
  3. VibeASR.cpp