返回首頁

AI 基礎設施

HUMAIN 啟用 MI355X 與 800G Ethernet AI 叢集,但未披露現有 GPU 與功率規模

HUMAIN 已在沙烏地阿拉伯提供以 AMD MI355X、EPYC 和 Cisco Silicon One 網路建置的生產級 GPU 服務。這使合作案跨過「規劃容量」門檻,但 250 MW 與 1 GW 仍分別是 2027 年起及 2030 年前的目標。

Crazyblocks · CC0 · Image source
zh-Hant

AMD、Cisco 與沙烏地阿拉伯 PIF 旗下 HUMAIN 宣布,首批 Instinct MI355X 基礎設施已投入生產並開始服務境內外客戶。公開架構由 MI355X GPU、EPYC CPU,以及採 Cisco Silicon One 的 Nexus 9000 系列網路組成;800G 光學連線負責跨節點互連,HUMAIN 則把整套資源包裝為可供訓練與推論使用的 GPU-as-a-service。相較只公布採購或電力目標,這次更新的實質差異是已有客戶工作負載運行。

這套設計也代表大型 AMD 叢集採用 Ethernet scale-out 的另一個生產案例。分散式訓練或大模型張量平行會頻繁執行 all-reduce、all-gather 等集合通訊;若交換器排隊、壅塞控制或光學鏈路配置失衡,即使 GPU 理論算力充足,利用率仍會快速下降。Cisco 的公開 AI POD 文件顯示,Nexus 9000 可組成 400G/800G、RoCEv2 的無損網路,但本次公告沒有揭露實際拓撲、每張 GPU 的外部頻寬、RCCL 效率、租戶隔離方式或端到端作業完成時間,因此不能據此判定它已達到特定訓練效率。

三家公司下一階段預計自 2027 年開始部署最高 250 MW、採 MI400 系列與 ROCm 的設施,合資公司的遠期目標則仍是 2030 年前最高 1 GW。這些數字不能與目前上線容量混用:公告未提供現有 GPU 數量、機房功率、地點數量或客戶利用率,也沒有說明 250 MW 計畫與先前提出的 100 MW MI450 第一階段如何銜接。換言之,已確認的是 MI355X 服務上線,而非數百 MW 已交付。

工程團隊接下來應關注三類資料:ROCm 與 RCCL 在這個 Ethernet fabric 上的可重現效能、GPU 服務的故障域與多租戶 QoS,以及 MI400 遷移是否需要改動映像、核心函式庫和網路配置。若 HUMAIN 公開模型吞吐、延遲分位數、集合通訊效率及可用性指標,才足以評估這套主權 AI 雲是否不只擴充容量,也能提供穩定的生產效能。

來源

  1. AMD, Cisco and HUMAIN Expand Saudi Arabia’s AI Infrastructure as AMD Instinct Systems Go Live
  2. Largest AMD inference cluster outside the US goes live in KSA
  3. Cisco AI POD for Enterprise Training and Fine-Tuning Design Guide