返回首頁

推論系統

Uno 以離散擴散輔助自回歸模型,無需獨立草稿模型即可並行解碼

Uno 將輕量擴散權重附加至自回歸 LLM,再以 Ψ-Spec 一次提出多個 token 並維持原模型的取樣分布。作者報告最高三倍加速,但目前數字仍來自研究團隊的特定模型、硬體與推論引擎。

Public domain · Image source
zh-Hant

自回歸語言模型必須逐一生成 token;推測解碼雖可減少大型模型的循序步驟,通常還要訓練或部署另一個草稿模型。IFM 等研究團隊提出的 Uno 改採「擴散輔助」架構:既有 AR 權重仍以 next-token prediction 定義機率分布,另一組較輕量的擴散權重則學習同時提出一段候選 token。

真正決定結果是否等價的是 Ψ-Spec 取樣器。它讓擴散路徑負責提出候選,再由 AR 路徑驗證或拒絕,因此論文所稱的 lossless 是最終樣本仍服從基礎 AR 模型的分布,而非保證每次執行都輸出相同文字,也不代表浮點運算完全一致。系統提供偏重整體吞吐量的 linear sampler,以及改善單一請求速度的 tree sampler。

作者在受測配置中報告,相較基礎 AR 解碼最高加速三倍,且各批次大小的吞吐量均高於其比較的推測解碼方法。8B 版本也在代理工具使用、程式設計與長上下文評測中勝過作者選定的 DiffusionGemma 26B 與 Mercury 2;這些準確率比較不等於在相同成本或通用服務條件下全面領先。

Apache-2.0 儲存庫已提供 Nano-vLLM 衍生推論引擎、訓練與評測流程,以及 K2 Horizon 0.9B、7B 和 Qwen3 8B 的配方與公開檢查點。Qwen3 路徑以 conditional LoRA 附加擴散能力,顯示既有開放權重模型不一定要從頭預訓練。

工程團隊接下來應觀察 Ψ-Spec 在不同 GPU、長輸出、高併發與量化模型上的接受率、KV cache 成本及尾端延遲。現有安裝流程鎖定特定 PyTorch、CUDA 與 FlashAttention 組合,亦尚未證明能直接整合主流 vLLM 或 SGLang 的生產部署。

來源

  1. Unlocking Lossless Speedups in LLMs via Discrete Diffusion
  2. ifm-ai/uno: Unlocking Lossless Speedups in LLMs via Discrete Diffusion