AI 基礎設施
HUMAIN 啟用 MI355X 與 800G Ethernet AI 叢集,但未披露現有 GPU 與功率規模
HUMAIN 已在沙烏地阿拉伯提供以 AMD MI355X、EPYC 和 Cisco Silicon One 網路建置的生產級 GPU 服務。這使合作案跨過「規劃容量」門檻,但 250 MW 與 1 GW 仍分別是 2027 年起及 2030 年前的目標。

AMD、Cisco 與沙烏地阿拉伯 PIF 旗下 HUMAIN 宣布,首批 Instinct MI355X 基礎設施已投入生產並開始服務境內外客戶。公開架構由 MI355X GPU、EPYC CPU,以及採 Cisco Silicon One 的 Nexus 9000 系列網路組成;800G 光學連線負責跨節點互連,HUMAIN 則把整套資源包裝為可供訓練與推論使用的 GPU-as-a-service。相較只公布採購或電力目標,這次更新的實質差異是已有客戶工作負載運行。
這套設計也代表大型 AMD 叢集採用 Ethernet scale-out 的另一個生產案例。分散式訓練或大模型張量平行會頻繁執行 all-reduce、all-gather 等集合通訊;若交換器排隊、壅塞控制或光學鏈路配置失衡,即使 GPU 理論算力充足,利用率仍會快速下降。Cisco 的公開 AI POD 文件顯示,Nexus 9000 可組成 400G/800G、RoCEv2 的無損網路,但本次公告沒有揭露實際拓撲、每張 GPU 的外部頻寬、RCCL 效率、租戶隔離方式或端到端作業完成時間,因此不能據此判定它已達到特定訓練效率。
三家公司下一階段預計自 2027 年開始部署最高 250 MW、採 MI400 系列與 ROCm 的設施,合資公司的遠期目標則仍是 2030 年前最高 1 GW。這些數字不能與目前上線容量混用:公告未提供現有 GPU 數量、機房功率、地點數量或客戶利用率,也沒有說明 250 MW 計畫與先前提出的 100 MW MI450 第一階段如何銜接。換言之,已確認的是 MI355X 服務上線,而非數百 MW 已交付。
工程團隊接下來應關注三類資料:ROCm 與 RCCL 在這個 Ethernet fabric 上的可重現效能、GPU 服務的故障域與多租戶 QoS,以及 MI400 遷移是否需要改動映像、核心函式庫和網路配置。若 HUMAIN 公開模型吞吐、延遲分位數、集合通訊效率及可用性指標,才足以評估這套主權 AI 雲是否不只擴充容量,也能提供穩定的生產效能。