本文為英文版的機器翻譯版本,如內容有任何歧義或不一致之處,概以英文版為準。
在 AWS PCS 中建立登入節點的運算節點群組
運算節點群組是 AWS PCS 啟動和管理的運算節點 (EC2 執行個體) 虛擬集合。當您定義運算節點群組時,您可以指定常見的特徵,例如 EC2 執行個體類型、執行個體數量下限和上限、目標 VPC 子網路、偏好的購買選項,以及自訂啟動組態。 AWS PCS 會根據這些設定,有效率地啟動、管理和終止運算節點群組中的運算節點。
在此步驟中,您將啟動靜態運算節點群組,以提供叢集的互動式存取權。您可以使用 SSH 或 Amazon EC2 Systems Manager (SSM) 登入,然後執行 shell 命令和管理 Slurm 任務。
建立運算節點群組
-
開啟 AWS PCS 主控台
並導覽至叢集。 -
選取名為 的叢集
get-started -
導覽至運算節點群組,然後選擇建立。
-
在運算節點群組設定區段中,提供下列項目:
-
運算節點群組名稱 – 輸入
login。
-
-
在運算組態下,輸入或選取這些值:
-
EC2 啟動範本 – 選擇名稱為 的啟動範本
login-getstarted-lt -
IAM 執行個體描述檔 – 選擇名為 的執行個體描述檔
AWSPCS-getstarted-role -
子網路 – 選取名稱開頭為 的子網路
hpc-networking:PublicSubnetA。登入節點會在公有子網路中執行,因此您可以聯絡它們來登入並提交工作。 -
執行個體 – 選取
c6i.xlarge。 -
擴展組態 – 針對最小執行個體計數,輸入
1。針對執行個體計數上限,輸入1。修正 的兩個計數,1可讓單一登入節點隨時執行,做為叢集的穩定進入點。
-
-
在其他設定下,指定下列項目:
-
AMI ID – 選取您要使用的 AMI,其名稱格式如下:
aws-pcs-sample_ami-al2023-platform-slurm-version注意
Slurm 25.05 和舊版的範例 AMIs 使用 Amazon Linux 2 (
amzn2) 而非 Amazon Linux 2023 (al2023)。如需範例 AMIs的詳細資訊,請參閱 搭配 AWS PCS 使用範例 Amazon Machine Image AMIs)。
-
-
在節點生命週期動作區段中,新增掛載共用儲存和轉送節點日誌的指令碼。針對下列每個動作選擇新增指令碼。指令碼會在階段內從上到下執行,因此請依照顯示的順序新增它們。如需 AWS 維護之指令碼的詳細資訊,請參閱 AWS維護的指令碼。
-
configure-cloudwatch-logs – 將每個節點的生命週期動作日誌轉送至 Amazon CloudWatch Logs。首先進行設定,讓接下來的動作從節點的第一個開機擷取其輸出。
-
生命週期階段 – 選取
nodeBootstrapped。 -
指令碼位置 – 輸入
s3://aws-pcs-repo-,將region/aws-pcs-node-lifecycle-scripts/configure-cloudwatch-logs-v1-latest.sh區域取代為叢集的區域 AWS 。 -
名稱 – 輸入
configure-cloudwatch-logs。 -
引數 – 將此欄位保留空白。指令碼會自動將日誌傳送至
/aws/pcs/日誌群組。cluster-id/lifecycle -
錯誤處理行為 – 選取
CONTINUE。 -
執行政策 – 選取
FIRST_BOOT_ONLY。
-
-
configure-efs-homes – 將 Amazon EFS 檔案系統掛載為 的主目錄基礎,
/home並將節點設定為在第一次登入時建立每個使用者的主目錄。-
生命週期階段 – 選取
nodeBootstrapped。 -
指令碼位置 – 輸入
s3://aws-pcs-repo-,將region/aws-pcs-node-lifecycle-scripts/configure-efs-homes-v1-latest.sh區域取代為叢集 AWS 的區域。 -
名稱 – 輸入
configure-efs-homes。 -
引數 – 輸入
--efs-id,將efs-file-system-id--home-base /home --options tlsefs-file-system-id取代為您稍早在教學課程中建立的 EFS 檔案系統 ID。 -
錯誤處理行為 – 選取
CONTINUE。 -
執行政策 – 選取
EVERY_BOOT。
-
-
mount-fsx-lustre – 將 FSx for Lustre 檔案系統掛載到 ,
/shared以提供高效能的共用暫存。-
生命週期階段 – 選取
nodeBootstrapped。 -
指令碼位置 – 輸入
s3://aws-pcs-repo-,將region/aws-pcs-node-lifecycle-scripts/mount-fsx-lustre-v1-latest.sh區域取代為叢集 AWS 的區域 (例如us-east-1)。 -
名稱 – 輸入
mount-fsx-lustre。 -
引數 – 輸入
--fsx-dns-name,將fsx-dns-name--mount-namemount-name--mount-point /sharedfsx-dns-name取代為 DNS 名稱,並將mount-name取代為您建立 FSx for Lustre 檔案系統時記下的掛載名稱。 -
錯誤處理行為 – 選取
CONTINUE。 -
執行政策 – 選取
EVERY_BOOT。
-
-
set-shared-dir-mode – 設定為可寫入
/shared世界的黏性許可 (模式1777),以便任何使用者可以在其中建立檔案。它會在 之後執行,mount-fsx-lustre以便套用至掛載的檔案系統。-
生命週期階段 – 選取
nodeBootstrapped。 -
指令碼位置 – 輸入
https://aws-hpc-recipes.s3.us-east-1.amazonaws.com/main/recipes/pcs-scripts/open_shared_dir/assets/set-shared-dir-mode-v1.0.0.sh。此社群指令碼由 HPC Recipes 發佈 AWS。 -
名稱 – 輸入
set-shared-dir-mode。 -
引數 – 輸入
--path /shared --mode 1777。 -
錯誤處理行為 – 選取
CONTINUE。 -
執行政策 – 選取
EVERY_BOOT。
-
-
-
選擇建立運算節點群組。
狀態欄位會顯示正在佈建運算節點群組時的建立。您可以在教學課程中繼續下一個步驟。