返回首頁

AI 基礎設施

SageMaker HyperPod Inference v3.1 開放自訂 Pod、憑證與逐 Pod 請求上限

AWS 更新 HyperPod Inference Operator,讓團隊能直接調整 Kubernetes Pod 規格、配置自訂 TLS 憑證,並限制單一 Pod 的並行請求。這些介面補上大型模型服務的隔離與背壓控制,但升級前仍須驗證自訂設定不會破壞 Operator 管理的資源。

Ajay Suresh from New York, NY, USA · CC BY 2.0 · Image source
zh-Hant

AWS 在 7 月 31 日登錄 SageMaker HyperPod Inference v3.1,核心變化集中於 Inference Operator:部署者可加入自訂 Kubernetes Pod 設定、掛接自有憑證,並設定每個 Pod 可接受的請求上限。相較只調整副本數與端點層流量,逐 Pod 限流能更直接地約束模型伺服器佇列,避免長提示、生成長度不一或 KV cache 壓力突然上升時,少數副本累積過多工作。

自訂 Pod 規格則讓平台工程師能補上 affinity、toleration、sidecar、volume 或安全性相關設定,將推論工作放到指定 GPU 節點並接入既有觀測及網路控制。自訂憑證對使用企業 PKI、私有模型閘道或服務網格的叢集尤其重要,可減少在 Operator 外另建 TLS 終止層的需要。不過,AWS 的簡短發布說明沒有列出所有可覆寫欄位、衝突合併規則及舊版資源的升級行為;任意修改 Pod template 也可能與 Operator 的調和迴圈互相覆蓋。

工程團隊應先在非生產叢集檢查產生後的 Deployment、Service 與憑證輪替流程,再用不同提示長度測試限流是否回傳、排隊或重新路由。下一步值得觀察的是 v3.1 是否提供明確的版本化 CRD、滾動升級保證,以及逐 Pod 上限能否與自動擴縮、連續批次和模型伺服器自身的 concurrency 設定協同運作。

來源

  1. Amazon SageMaker HyperPod Inference release notes
  2. Kubernetes:管理 TLS 憑證