View a markdown version of this page

AWS PCS에서 로그인 노드에 대한 컴퓨팅 노드 그룹 생성 - AWS PCS

기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.

AWS PCS에서 로그인 노드에 대한 컴퓨팅 노드 그룹 생성

컴퓨팅 노드 그룹은 AWS PCS가 시작하고 관리하는 컴퓨팅 노드(EC2 인스턴스)의 가상 컬렉션입니다. 컴퓨팅 노드 그룹을 정의할 때 EC2 인스턴스 유형, 최소 및 최대 인스턴스 수, 대상 VPC 서브넷, 기본 구매 옵션, 사용자 지정 시작 구성과 같은 일반적인 특성을 지정합니다. AWS PCS는 이러한 설정에 따라 컴퓨팅 노드 그룹에서 컴퓨팅 노드를 효율적으로 시작, 관리 및 종료합니다.

이 단계에서는 클러스터에 대한 대화형 액세스를 제공하는 정적 컴퓨팅 노드 그룹을 시작합니다. SSH 또는 Amazon EC2 Systems Manager(SSM)를 사용하여 로그인한 다음 셸 명령을 실행하고 Slurm 작업을 관리할 수 있습니다.

컴퓨팅 노드 그룹을 생성하려면
  • AWS PCS 콘솔을 열고 클러스터로 이동합니다.

  • 라는 클러스터를 선택합니다. get-started

  • 컴퓨팅 노드 그룹으로 이동하여 생성을 선택합니다.

  • 컴퓨팅 노드 그룹 설정 섹션에서 다음을 제공합니다.

    • 컴퓨팅 노드 그룹 이름 -를 입력합니다login.

  • 컴퓨팅 구성에서 다음 값을 입력하거나 선택합니다.

    • EC2 시작 템플릿 - 이름이 인 시작 템플릿을 선택합니다. login-getstarted-lt

    • IAM 인스턴스 프로파일 - 라는 인스턴스 프로파일을 선택합니다. AWSPCS-getstarted-role

    • 서브넷 - 이름이 로 시작하는 서브넷을 선택합니다hpc-networking:PublicSubnetA. 로그인 노드는 퍼블릭 서브넷에서 실행되므로 로그인하고 작업을 제출하기 위해 노드에 연결할 수 있습니다.

    • 인스턴스 - 선택합니다c6i.xlarge.

    • 조정 구성 - 최소 인스턴스 수에를 입력합니다1. 최대 인스턴스 수에 를 입력합니다. 1 에서 두 개수를 모두 수정하면 클러스터에 대한 안정적인 진입점으로 단일 로그인 노드가 항상 실행1됩니다.

  • 추가 설정에서 다음을 지정합니다.

    • AMI ID - 다음 형식의 이름을 가진 사용하려는 AMI를 선택합니다.

      aws-pcs-sample_ami-al2023-platform-slurm-version
      참고

      Slurm 25.05 및 이전 버전의 샘플 AMIs Amazon Linux 2023(amzn2) 대신 Amazon Linux 2()를 사용합니다al2023.

      샘플 AMIsAWS PCS에서 샘플 Amazon Machine Image(AMIs) 사용.

  • 노드 수명 주기 작업 섹션에서 공유 스토리지를 탑재하고 노드 로그를 전달하는 스크립트를 추가합니다. 다음 각 작업에 대해 스크립트 추가를 선택합니다. 스크립트는 단계 내에서 위에서 아래로 실행되므로 표시된 순서대로 추가합니다. AWS에서 유지 관리하는 스크립트에 대한 자세한 내용은 섹션을 참조하세요AWS유지 관리형 스크립트.

    1. configure-cloudwatch-logs - 각 노드의 수명 주기 작업 로그를 Amazon CloudWatch Logs에 전달합니다. 다음 작업이 노드의 첫 번째 부팅에서 출력을 캡처하도록 먼저 구성합니다.

      • 수명 주기 단계 -를 선택합니다nodeBootstrapped.

      • 스크립트 위치 - s3://aws-pcs-repo-region/aws-pcs-node-lifecycle-scripts/configure-cloudwatch-logs-v1-latest.sh를 입력하여 리전을 클러스터의 AWS 리전으로 바꿉니다.

      • 이름 -를 입력합니다configure-cloudwatch-logs.

      • 인수 -이 필드는 비워 둡니다. 스크립트는 로그 그룹에 /aws/pcs/cluster-id/lifecycle 로그를 자동으로 전송합니다.

      • 오류 처리 동작 -를 선택합니다CONTINUE.

      • 실행 정책 -를 선택합니다FIRST_BOOT_ONLY.

    2. configure-efs-homes - Amazon EFS 파일 시스템을의 홈 디렉터리 기본으로 탑재/home하고 첫 로그인 시 각 사용자의 홈 디렉터리를 생성하도록 노드를 구성합니다.

      • 수명 주기 단계 -를 선택합니다nodeBootstrapped.

      • 스크립트 위치 - s3://aws-pcs-repo-region/aws-pcs-node-lifecycle-scripts/configure-efs-homes-v1-latest.sh를 입력하여 리전을 클러스터의 AWS 리전으로 바꿉니다.

      • 이름 -를 입력합니다configure-efs-homes.

      • 인수 -를 입력하여 efs-file-system-id를 자습서의 앞부분에서 생성한 EFS 파일 시스템의 ID로 --efs-id efs-file-system-id --home-base /home --options tls바꿉니다.

      • 오류 처리 동작 -를 선택합니다CONTINUE.

      • 실행 정책 -를 선택합니다EVERY_BOOT.

    3. mount-fsx-lustre - 고성능 공유 스크래치 스토리지를 /shared 위해에 FSx for Lustre 파일 시스템을 탑재합니다.

      • 수명 주기 단계 -를 선택합니다nodeBootstrapped.

      • 스크립트 위치 - s3://aws-pcs-repo-region/aws-pcs-node-lifecycle-scripts/mount-fsx-lustre-v1-latest.sh를 입력하여 리전을 클러스터의 AWS 리전으로 바꿉니다(예: us-east-1).

      • 이름 -를 입력합니다mount-fsx-lustre.

      • 인수 -를 입력하여 fsx-dns-nameDNS 이름으로 --fsx-dns-name fsx-dns-name --mount-name mount-name --mount-point /shared바꾸고 mount-name을 FSx for Lustre 파일 시스템을 생성할 때 기록해 둔 탑재 이름으로 바꿉니다.

      • 오류 처리 동작 -를 선택합니다CONTINUE.

      • 실행 정책 -를 선택합니다EVERY_BOOT.

    4. set-shared-dir-mode - 모든 사용자가 파일을 생성할 수 있도록 /shared 월드 라이팅 가능한 고정 권한(모드 1777)으로 설정합니다. 탑재된 파일 시스템에 적용mount-fsx-lustre되도록 이후에 실행됩니다.

      • 수명 주기 단계 -를 선택합니다nodeBootstrapped.

      • 스크립트 위치 -를 입력합니다https://aws-hpc-recipes.s3.us-east-1.amazonaws.com/main/recipes/pcs-scripts/open_shared_dir/assets/set-shared-dir-mode-v1.0.0.sh. 이 커뮤니티 스크립트는 HPC 레시피에서 게시합니다 AWS.

      • 이름 -를 입력합니다set-shared-dir-mode.

      • 인수 -를 입력합니다--path /shared --mode 1777.

      • 오류 처리 동작 -를 선택합니다CONTINUE.

      • 실행 정책 -를 선택합니다EVERY_BOOT.

  • 컴퓨팅 노드 그룹 생성을 선택합니다.

상태 필드에는 컴퓨팅 노드 그룹이 프로비저닝되는 동안 생성이 표시됩니다. 진행 중인 동안 자습서의 다음 단계로 진행할 수 있습니다.