推論基礎設施
Triton 2.72 修復動態批次飢餓與回應排序,升級至 CUDA 13.4 推論堆疊
NVIDIA Triton Inference Server 2.72.0 修正排程器可能在仍有請求時停止派工的問題,並恢復 `preserve_ordering` 的完成順序語義。新版同時更新 CUDA、TensorRT 與 gRPC 相依套件,但 TensorRT-LLM 映像缺席,vLLM/Ray 部署亦保留安全警告。

NVIDIA 於 8 月 31 日發布 Triton Inference Server 2.72.0,對應 NGC 26.08 容器。這次更新沒有主打新的生成模型,而是處理會直接影響線上服務可靠性的排程與狀態回報問題:動態批次器的 `waiting_consumer_count` 可能逐漸偏離實際狀態,導致佇列仍有請求、排程器卻不再派工。新版修正這項飢餓情況,使用動態批次與高併發流量的團隊應把長時間壓力測試納入升級驗證。
`preserve_ordering` 也改為在請求進入佇列時預留完成槽位,而非等運算完成才配置,以恢復客戶端預期的輸出順序。模型健康檢查方面,`TRITONSERVER_ServerModelIsReady` 現在會回傳非「模型不存在」類型的錯誤,未解析成功的模型亦會正確標示 `ready=false`。模型載入路徑則攔截例外並統一處理 `invalid_argument` 與 `out_of_range`,有助於避免壞模型設定向外破壞伺服器生命週期。
對嵌入式部署,新加入的 C/Python 日誌 callback 可把 Triton 訊息直接送入應用程式既有的觀測堆疊。後端修補包括非批次 TensorRT 模型的 CUDA Graph 執行、vLLM JSON 輸入解析,以及 ARM SBSA 上的 OpenVINO 模型生成。建置程序也能讀取實驗性 preset 檔,並依可用記憶體限制平行編譯數,降低自行建置 ONNX Runtime 或 OpenVINO 後端時的 OOM 風險。
26.08 容器採用 Triton 2.72、CUDA 13.4.1 與 TensorRT 11.2.1.2,最低支援 compute capability 7.5;升級前須核對主機驅動與自訂後端 ABI。值得注意的是,本版沒有提供 TensorRT-LLM backend 容器;官方也警告 vLLM v0 API 與 Ray 存在弱點,不應讓執行器或主機接受不受信任的網路連線。另有 CuPy 多執行緒 CUDA 13 Device API、顯式模型控制下 vLLM 張量平行等已知限制,因此這不是可直接替換映像、略過回歸測試的更新。