返回首頁

推論系統

NVIDIA Dynamo 拆分多模態推論三階段,混合流量首 token 延遲最多降低 42.2%

Dynamo 現可將視覺編碼、LLM 預填充與解碼分配給獨立工作程序及不同等級 GPU,避免影像請求阻塞純文字流量。官方測試雖顯示首 token 與端到端延遲最高改善 5 倍、7 倍,但長輸出或大型稠密模型可能抵銷拆分收益。

Farmer, Silas, 1839-1902. [from old catalog] · No restrictions · Image source
zh-Hant

NVIDIA 公布 Dynamo 的多模態 Encode–Prefill–Decode(EPD)拆分實作與部署判準。傳統聚合式服務由同一工作程序依序處理媒體解碼、視覺 Transformer、LLM prefill 與逐 token decode;影像或影片一多,視覺編碼不只延後自己的 TTFT,也會讓同批次的純文字請求遭遇隊首阻塞。Dynamo 改讓 encoder 產生視覺 embedding,再透過 NIXL 傳給 prefill/decode worker,使三階段能分別排程、批次化及擴縮。

部署可維持聚合式配置、在每張 GPU 上並置 encoder 與 PD worker,或把 encoder 移到較便宜的 GPU 層。後者的官方測試以兩張 RTX 6000D 處理視覺編碼、四張 GB200 執行 LLM;embedding 經峰值 20 Gbps 的 UCX RC/TCP 網路傳輸。主要基準採 Qwen3.5 122B-A10B NVFP4,每個請求十張影像、每張最多 256 個視覺 token、輸出 1,024 token。並置方案令 TTFT 降低 58%,異質方案降低 50%,後者在 inter-token latency 低於 100 毫秒的限制下可承載多 70% 流量。50:50 文字/影像流量測試中,文字 TTFT 從 92.3 降至 53.3 毫秒,影像則從 289.9 降至 200.6 毫秒。

這不是普遍適用的免費加速。輸出長度由 128 增至 2,048 token 時,異質 EPD 的端到端優勢由 20.3% 收窄至 5.2%,並置配置甚至倒退 2.5%;4B 模型的同 SLO goodput 可達聚合式的 2.62 倍,27B 稠密模型卻只剩 0.65 倍。工程團隊應先量測 ViT、prefill、decode 的時間占比以及 embedding 傳輸成本,再決定是否拆分;Dynamo 文件已提供 vLLM、SGLang 與 TensorRT-LLM 啟動路徑,但各後端的影像、影片及 KV 傳輸支援仍不一致。

來源

  1. When to Use Encode-Prefill-Decode Disaggregation to Accelerate Multimodal Model Serving
  2. Encoder Disaggregation
  3. Efficiently Serving Large Multimodal Models Using EPD Disaggregation
  4. ai-dynamo/dynamo