View a markdown version of this page

在 AWS PCS 中建立登入節點的運算節點群組 - AWS PCS

本文為英文版的機器翻譯版本,如內容有任何歧義或不一致之處,概以英文版為準。

在 AWS PCS 中建立登入節點的運算節點群組

運算節點群組是 AWS PCS 啟動和管理的運算節點 (EC2 執行個體) 虛擬集合。當您定義運算節點群組時,您可以指定常見的特徵,例如 EC2 執行個體類型、執行個體數量下限和上限、目標 VPC 子網路、偏好的購買選項,以及自訂啟動組態。 AWS PCS 會根據這些設定,有效率地啟動、管理和終止運算節點群組中的運算節點。

在此步驟中,您將啟動靜態運算節點群組,以提供叢集的互動式存取權。您可以使用 SSH 或 Amazon EC2 Systems Manager (SSM) 登入,然後執行 shell 命令和管理 Slurm 任務。

建立運算節點群組
  • 開啟 AWS PCS 主控台並導覽至叢集

  • 選取名為 的叢集 get-started

  • 導覽至運算節點群組,然後選擇建立

  • 運算節點群組設定區段中,提供下列項目:

    • 運算節點群組名稱 – 輸入 login

  • 運算組態下,輸入或選取這些值:

    • EC2 啟動範本 – 選擇名稱為 的啟動範本 login-getstarted-lt

    • IAM 執行個體描述檔 – 選擇名為 的執行個體描述檔 AWSPCS-getstarted-role

    • 子網路 – 選取名稱開頭為 的子網路hpc-networking:PublicSubnetA。登入節點會在公有子網路中執行,因此您可以聯絡它們來登入並提交工作。

    • 執行個體 – 選取 c6i.xlarge

    • 擴展組態 – 針對最小執行個體計數,輸入 1。針對執行個體計數上限,輸入 1。修正 的兩個計數,1可讓單一登入節點隨時執行,做為叢集的穩定進入點。

  • 其他設定下,指定下列項目:

    • AMI ID – 選取您要使用的 AMI,其名稱格式如下:

      aws-pcs-sample_ami-al2023-platform-slurm-version
      注意

      Slurm 25.05 和舊版的範例 AMIs 使用 Amazon Linux 2 (amzn2) 而非 Amazon Linux 2023 (al2023)。

      如需範例 AMIs的詳細資訊,請參閱 搭配 AWS PCS 使用範例 Amazon Machine Image AMIs)

  • 節點生命週期動作區段中,新增掛載共用儲存和轉送節點日誌的指令碼。針對下列每個動作選擇新增指令碼。指令碼會在階段內從上到下執行,因此請依照顯示的順序新增它們。如需 AWS 維護之指令碼的詳細資訊,請參閱 AWS維護的指令碼

    1. configure-cloudwatch-logs – 將每個節點的生命週期動作日誌轉送至 Amazon CloudWatch Logs。首先進行設定,讓接下來的動作從節點的第一個開機擷取其輸出。

      • 生命週期階段 – 選取 nodeBootstrapped

      • 指令碼位置 – 輸入 s3://aws-pcs-repo-region/aws-pcs-node-lifecycle-scripts/configure-cloudwatch-logs-v1-latest.sh,將區域取代為叢集的區域 AWS 。

      • 名稱 – 輸入 configure-cloudwatch-logs

      • 引數 – 將此欄位保留空白。指令碼會自動將日誌傳送至/aws/pcs/cluster-id/lifecycle日誌群組。

      • 錯誤處理行為 – 選取 CONTINUE

      • 執行政策 – 選取 FIRST_BOOT_ONLY

    2. configure-efs-homes – 將 Amazon EFS 檔案系統掛載為 的主目錄基礎,/home並將節點設定為在第一次登入時建立每個使用者的主目錄。

      • 生命週期階段 – 選取 nodeBootstrapped

      • 指令碼位置 – 輸入 s3://aws-pcs-repo-region/aws-pcs-node-lifecycle-scripts/configure-efs-homes-v1-latest.sh,將區域取代為叢集 AWS 的區域。

      • 名稱 – 輸入 configure-efs-homes

      • 引數 – 輸入 --efs-id efs-file-system-id --home-base /home --options tls,將 efs-file-system-id 取代為您稍早在教學課程中建立的 EFS 檔案系統 ID。

      • 錯誤處理行為 – 選取 CONTINUE

      • 執行政策 – 選取 EVERY_BOOT

    3. mount-fsx-lustre – 將 FSx for Lustre 檔案系統掛載到 ,/shared以提供高效能的共用暫存。

      • 生命週期階段 – 選取 nodeBootstrapped

      • 指令碼位置 – 輸入 s3://aws-pcs-repo-region/aws-pcs-node-lifecycle-scripts/mount-fsx-lustre-v1-latest.sh,將區域取代為叢集 AWS 的區域 (例如 us-east-1)。

      • 名稱 – 輸入 mount-fsx-lustre

      • 引數 – 輸入 --fsx-dns-name fsx-dns-name --mount-name mount-name --mount-point /shared,將 fsx-dns-name 取代為 DNS 名稱,並將 mount-name 取代為您建立 FSx for Lustre 檔案系統時記下的掛載名稱

      • 錯誤處理行為 – 選取 CONTINUE

      • 執行政策 – 選取 EVERY_BOOT

    4. set-shared-dir-mode – 設定為可寫入/shared世界的黏性許可 (模式 1777),以便任何使用者可以在其中建立檔案。它會在 之後執行,mount-fsx-lustre以便套用至掛載的檔案系統。

      • 生命週期階段 – 選取 nodeBootstrapped

      • 指令碼位置 – 輸入 https://aws-hpc-recipes.s3.us-east-1.amazonaws.com/main/recipes/pcs-scripts/open_shared_dir/assets/set-shared-dir-mode-v1.0.0.sh。此社群指令碼由 HPC Recipes 發佈 AWS。

      • 名稱 – 輸入 set-shared-dir-mode

      • 引數 – 輸入 --path /shared --mode 1777

      • 錯誤處理行為 – 選取 CONTINUE

      • 執行政策 – 選取 EVERY_BOOT

  • 選擇建立運算節點群組

狀態欄位會顯示正在佈建運算節點群組時的建立。您可以在教學課程中繼續下一個步驟。