返回首頁

AI 基礎設施

AWS ParallelCluster 3.16 加入節點診斷,但升級同時改動 IAM、NFS 與容器堆疊

新版 AMI 內建 `pcluster-diag`,可按節點角色檢查 Slurm、IMDS、目錄服務與 Lustre 狀態並輸出結構化報告。升級也終止 Amazon Linux 2 與 AWS Batch 支援,另有權限、網路出口和執行環境變更需要預先處理。

Delince · CC BY-SA 3.0 · Image source
zh-Hant

AWS 在 8 月 24 日宣布 ParallelCluster 3.16 正式可用,核心新增項目是隨官方 AMI 安裝的 `pcluster-diag`。工具會讀取節點角色與叢集設定,再選擇性執行九類檢查,包括 IMDS、保留帳號與檔案權限、ParallelCluster 管理程序、`clustermgtd` heartbeat、目錄服務、Slurm accounting,以及 FSx for Lustre。結果寫成 JSON;`FAILURE` 或 `CHECK_ERROR` 會令命令失敗,但 `WARNING` 仍回傳成功,因此把它接入維運自動化時不能只依賴 exit code。

一項[獨立實測](https://dev.classmethod.jp/articles/aws-parallelcluster-3-16-0-released-pcluster-diag/)在 Ubuntu 24.04 節點上約四秒完成九項檢查,並成功以錯誤的 `munge.key` 權限觸發失敗。不過工具必須以 root 執行,報告還會包含完整 `cluster_config` 與 `dna_json`;集中上傳前應先評估其中的拓撲、資源名稱與設定資訊是否屬敏感資料。

[3.16.0 發行說明](https://github.com/aws/aws-parallelcluster/releases/tag/v3.16.0)還包含多項可能影響 AI/HPC 叢集的變更。建立叢集時會重試受暫時性 IMDS 問題影響的 EBS 掛載,登入節點更新改由 head node 統一協調,bootstrap 暫存檔也移出 `/tmp`,改善自訂 AMI 使用 `noexec` 的情境。另一方面,CLI 新增 `tag:GetResources` 權限;受管 NFS server 強制使用 NFSv4;隔離子網建置映像時需允許 `amazon-efs-utils.aws.com`。Enroot 由 3.x 升至 4.2.1,Pyxis、CUDA、NVIDIA driver、EFA 與 Slurm亦同步更新,現有容器作業應先做相容性測試。Amazon Linux 2 與 AWS Batch scheduler 支援亦已結束,不能把這次更新當成無風險的診斷功能追加。

來源

  1. AWS ParallelCluster 3.16 adds an on-node diagnostics tool
  2. AWS ParallelCluster v3.16.0
  3. AWS ParallelCluster 3.16.0 pcluster-diag hands-on