AI 基礎設施
SageMaker HyperPod Inference v3.1 開放自訂 Pod、憑證與逐 Pod 請求上限
AWS 更新 HyperPod Inference Operator,讓團隊能直接調整 Kubernetes Pod 規格、配置自訂 TLS 憑證,並限制單一 Pod 的並行請求。這些介面補上大型模型服務的隔離與背壓控制,但升級前仍須驗證自訂設定不會破壞 Operator 管理的資源。

AWS 在 7 月 31 日登錄 SageMaker HyperPod Inference v3.1,核心變化集中於 Inference Operator:部署者可加入自訂 Kubernetes Pod 設定、掛接自有憑證,並設定每個 Pod 可接受的請求上限。相較只調整副本數與端點層流量,逐 Pod 限流能更直接地約束模型伺服器佇列,避免長提示、生成長度不一或 KV cache 壓力突然上升時,少數副本累積過多工作。
自訂 Pod 規格則讓平台工程師能補上 affinity、toleration、sidecar、volume 或安全性相關設定,將推論工作放到指定 GPU 節點並接入既有觀測及網路控制。自訂憑證對使用企業 PKI、私有模型閘道或服務網格的叢集尤其重要,可減少在 Operator 外另建 TLS 終止層的需要。不過,AWS 的簡短發布說明沒有列出所有可覆寫欄位、衝突合併規則及舊版資源的升級行為;任意修改 Pod template 也可能與 Operator 的調和迴圈互相覆蓋。
工程團隊應先在非生產叢集檢查產生後的 Deployment、Service 與憑證輪替流程,再用不同提示長度測試限流是否回傳、排隊或重新路由。下一步值得觀察的是 v3.1 是否提供明確的版本化 CRD、滾動升級保證,以及逐 Pod 上限能否與自動擴縮、連續批次和模型伺服器自身的 concurrency 設定協同運作。