推論系統
NVIDIA 公開多 GPU 影片推論測試,八卡生成延遲降至約 34 秒
NVIDIA 以 Dynamo-Triton 與 TensorRT 執行 Cosmos 3 Nano,八卡生成延遲由單卡的 156.6 秒降至 34.2 秒。測試未涵蓋併發吞吐量與單片成本,品質驗證也僅採抽樣影格。

NVIDIA 於 9 月 21 日公布 Dynamo-Triton 搭配 TensorRT 多 GPU 執行的影片生成測試:Cosmos 3 Nano 在單卡平均需 156.6 秒,八卡降至 34.2 秒,整體加速約 4.58 倍。這次新資訊是服務整合與量測結果;多裝置後端支援已列於 26.07 版紀錄。[技術公告](https://developer.nvidia.com/blog/simplifying-model-serving-across-multiple-gpus-with-nvidia-tensorrt-multi-device-integration-in-nvidia-dynamo-triton/)、[版本紀錄](https://docs.nvidia.com/deeplearning/triton-inference-server/release-notes/rel-26-07.html)
架構將去噪 Transformer 包成單一 gRPC 模型端點,由後端管理各 GPU 的執行環境、CUDA 串流與 NCCL 通訊。應用端仍以 Diffusers 安排生成流程。Cosmos 3 Nano 模型卡說明,其架構同時包含文字自回歸與連續模態擴散兩類 Transformer,因此此測試不能當成整個多模態模型各項能力的通用加速比。模型卡目前只宣告驗證 BF16 精度,其他精度的品質與記憶體需求仍須分別核對。[模型卡](https://huggingface.co/nvidia/Cosmos3-Nano)
開發者必須先編譯分散式計算圖,再啟用 `KIND_MODEL` 與多裝置設定,不能只增加 GPU 清單便把單卡引擎自動切分。TensorRT 文件要求每個 rank 使用自己的執行環境與緩衝區,並同時提交工作;集體通訊需要所有參與者到齊,缺少任一 rank 可能造成等待。官方亦提供可逐項驗證通訊結果的程式範例,建立指定的集體運算後,核對每張卡的輸出是否符合預期。這能先排除通訊或執行環境問題,卻不能取代完整生成流程的驗證。[執行文件](https://docs.nvidia.com/deeplearning/tensorrt/latest/inference-library/multi-device-inference.html)、[通訊範例](https://github.com/NVIDIA/TensorRT/tree/main/samples/sampleDistCollective)
量測固定為 720p、189 幀、35 次去噪,每組預熱一次後測五次;包含生成流程,但排除模型載入及 MP4 編碼。Transformer RPC 的 6.09 倍加速高於整體增益,顯示其他階段仍限制總延遲。品質檢查只抽查五幀並套用誤差門檻,輸出並非逐像素一致。[測試條件](https://developer.nvidia.com/blog/simplifying-model-serving-across-multiple-gpus-with-nvidia-tensorrt-multi-device-integration-in-nvidia-dynamo-triton/)
部署判斷仍缺併發吞吐量與每支影片成本。工程團隊應先確認 GPU 型號、互連、精度與引擎版本,再比較同一批硬體跑單卡副本或跨卡請求的排程效果,並記錄排隊時間與高負載下的尾端延遲。上述數字支持縮短單次等待時間,尚不足以推論相同 GPU 預算能產生更多影片;繁體中文提示及不同場景的生成品質也需另測。相關重驗應保留提示、種子及所有部署設定供交叉比較。