기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.
SageMaker 훈련 작업에 대한 컴퓨팅 용량 가져오기
컴퓨팅 용량을 요청하기 전에 AWS 계정이 다음 사전 조건을 충족하는지 확인합니다. 이러한 요구 사항을 순서대로 해결하면 일반적인 프로비저닝 실패를 방지하는 데 도움이 됩니다.
1단계: 리전에서 인스턴스 가용성 확인
모든 AWS 리전에서 모든 인스턴스 유형을 사용할 수 있는 것은 아닙니다. 훈련 워크로드의 인스턴스 유형을 선택하기 전에 대상 리전에서 인스턴스 유형을 사용할 수 있는지 확인합니다.
-
리전별 인스턴스 가용성 및 요금을 보려면 SageMaker AI 요금을
참조하세요. 훈련 탭을 선택하고 리전을 선택하여 사용 가능한 인스턴스 유형, 사양 및 시간당 요금을 확인합니다.
해당 리전에서 인스턴스 유형을 사용할 수 없는 경우:
-
해당 리전에서 사용할 수 있는 대체 인스턴스 유형을 선택합니다. GPU 가속 훈련의 경우 유사한 GPU 메모리 및 네트워킹 기능을 갖춘 인스턴스 패밀리를 식별합니다.
-
워크로드에 특정 인스턴스 유형이 필요하고 데이터 레지던시 및 규정 준수 요구 사항이 이를 허용하는 경우 해당 인스턴스 유형을 사용할 수 있는 다른 리전에서 훈련 작업을 실행하는 것이 좋습니다. 대상 리전에서 훈련 데이터에 액세스할 수 있는지 확인하거나 리전 간 데이터 전송을 계획합니다.
가용 영역당 인스턴스 가용성 확인
인스턴스 가용성은 리전 내 가용 영역에 따라 달라집니다. 리전에서 제공되는 인스턴스 유형이 해당 리전의 모든 가용 영역에서 반드시 제공되는 것은 아닙니다. 이는 프라이빗 VPC에서 훈련 작업을 실행할 때 중요합니다. 지정한 서브넷에 따라 SageMaker AI가 인스턴스를 프로비저닝하는 데 사용할 수 있는 가용 영역이 결정되기 때문입니다. 자세한 내용은 3단계: VPC 및 서브넷 구성(선택 사항) 단원을 참조하십시오.
리전에서 인스턴스 유형을 제공하는 가용 영역을 나열하려면 Amazon Elastic Compute Cloud DescribeInstanceTypeOfferings API를 사용합니다.
aws ec2 describe-instance-type-offerings \ --location-type availability-zone \ --filters Name=instance-type,Values=p5.48xlarge \ --region us-east-1 \ --query 'InstanceTypeOfferings[].Location' \ --output table
참고
SageMaker AI 인스턴스 유형(p5.48xlarge)이 아닌 Amazon Elastic Compute Cloud 인스턴스 유형()을 지정합니다ml.p5.48xlarge. SageMaker AI 훈련 인스턴스 유형은 ml. 접두사가 제거된 동일한 Amazon Elastic Compute Cloud 인스턴스 유형에 매핑됩니다.
2단계: 서비스 할당량 확인 및 요청
AWS 계정에는 SageMaker 훈련 작업에 동시에 사용할 수 있는 인스턴스 수를 제한하는 기본 할당량이 있습니다. 각 인스턴스 유형에는 자체 할당량이 있습니다.
-
현재 할당량을 보려면 Service Quotas 콘솔
을 열고 사용하려는 인스턴스 유형을 필터링합니다. -
훈련 작업에 필요한 인스턴스 수에 할당량이 충분하지 않은 경우 할당량 증가를 요청합니다. 할당량 증가는 즉각적이지 않습니다. 계획된 훈련 실행 전에 요청을 제출하세요.
작은 정보
유연한 훈련 계획의 경우 서비스 할당량은 계획의 인스턴스 수보다 크거나 같아야 합니다. 자세한 내용은 AWS 관리 콘솔을 사용하여 SageMaker 훈련 계획 할당량 보기 단원을 참조하십시오.
3단계: VPC 및 서브넷 구성(선택 사항)
이 단계는 프라이빗 VPC에서 훈련 작업을 실행하는 경우에만 적용됩니다. 기본적으로 SageMaker 훈련 작업은 SageMaker AI 관리형 네트워크 환경에서 실행되며 VPC 구성이 필요하지 않습니다. 조직에서 VPC 엔드포인트 또는 파일 시스템을 통해 Amazon S3에 저장된 데이터와 같은 프라이빗 VPC의 리소스에 액세스하기 위해 훈련 작업이 필요한 경우 CreateTrainingJob API의 VpcConfig 파라미터SecurityGroupIds에 Subnets 및를 지정해야 합니다.
VPC를 구성할 때 지정한 서브넷에 따라 SageMaker AI가 인스턴스를 프로비저닝하는 데 사용할 수 있는 가용 영역이 결정됩니다.
-
여러 가용 영역에 서브넷을 제공합니다. SageMaker AI는 per-Availability-Zone 용량 풀에서 훈련 인스턴스를 프로비저닝합니다. 더 많은 가용 영역에 서브넷을 포함하면 SageMaker AI가 사용할 수 있는 용량 풀이 증가하여 인스턴스 프로비저닝이 성공할 가능성이 향상되고 대기 시간이 단축됩니다. 가능한 경우 최소 3개의 가용 영역에서 서브넷을 지정합니다.
SageMaker AI는 여전히 단일 서브넷(단일 가용 영역) 내에서 지정된 작업에 대한 모든 인스턴스를 시작하여 물리적으로 가깝게 유지하고 노드 간 지연 시간을 최소화합니다. 추가 서브넷은 SageMaker AI가 선택할 수 있는 옵션만 확장합니다. 작업의 인스턴스는 가용 영역에 분산되지 않습니다.
-
유연한 훈련 계획의 경우 서브넷을 예약 용량에 맞춥니다. 각 예약 용량 블록은 특정 가용 영역에 프로비저닝됩니다.
Subnets의 에는 예약 용량 블록이 프로비저닝되는 가용 영역이 포함되어야VpcConfig합니다. 서로 다른 가용 영역에 걸쳐 있는 여러 블록이 있는 계획의 경우 모든 관련 영역에 서브넷을 포함합니다. -
데이터 소스를 훈련 인스턴스 가용 영역에 맞춥니다. 훈련 데이터가 또는 Amazon EFS와 같은 Availability-Zone-specific 스토리지 서비스에 있는 경우 훈련 인스턴스가 실행될 동일한 가용 영역에서 파일 시스템에 액세스할 수 있는지 확인합니다.
용량 옵션 선택
온디맨드 인스턴스
온디맨드는 SageMaker 훈련 작업의 기본 용량 옵션입니다. 인스턴스는 훈련 작업이 시작될 때 프로비저닝되고 완료되면 릴리스됩니다. 임시 작업을 실행하기 위한 선결제 약정 없이 초당 컴퓨팅 비용을 지불합니다. 작업에 필요한 용량은 작업 제출 중 리전의 가용성에 따라 최대한 할당됩니다.
요청된 인스턴스 유형에 온디맨드 용량을 사용할 수 없는 경우 훈련 작업은 대기 상태로 전환됩니다. 를 설정하여 대기 기간을 2시간에서 28일까지 구성할 수 있습니다MaxPendingTimeInSeconds. 해당 기간 내에 용량을 사용할 수 없게 되면에서 작업이 실패합니다InsufficientCapacityError.
작은 정보
연속 훈련 작업 간에 온디맨드 용량을 유지하려면 관리형 웜 풀을 활성화합니다. 웜 풀은 작업이 완료된 후 프로비저닝된 인스턴스를 유지하므로 후속 작업은 용량을 다시 획득하지 않고 동일한 인스턴스를 재사용합니다. 이는 하이퍼파라미터 튜닝 또는 분산 훈련 디버깅과 같은 반복 워크로드에 유용합니다.
관리형 스팟 훈련
관리형 스팟 훈련은 온디맨드 요금에 비해 최대 90%의 비용 절감으로 예비 Amazon EC2 스팟 용량을 사용합니다. SageMaker AI는 중단 및 자동 재시작을 포함한 스팟 수명 주기를 관리합니다. 스팟 훈련을 사용하면 워크로드가 중단될 수 있으며 마지막으로 저장된 상태에서 작업을 재개하려면 체크포인트 전략을 사용하는 것이 좋습니다.
스팟 용량 풀은 인스턴스 유형 및 가용 영역별로 정의됩니다. 스팟 가용성을 극대화하려면에서 여러 가용 영역에 걸쳐 서브넷을 지정합니다VpcConfig.Subnets. SageMaker AI가 작업을 중지하기 전에 스팟 용량을 기다리는 시간을 제어StoppingCondition.MaxWaitTimeInSeconds하도록 설정합니다.
자세한 내용은 Amazon SageMaker AI에서의 관리형 스팟 훈련 단원을 참조하십시오.
유연한 훈련 계획
유연한 훈련 계획을 사용하면 특정 날짜 및 기간 동안 GPU 용량을 미리 예약할 수 있습니다. 용량을 예약하면 수요가 많은 GPU 인스턴스 유형에 대한 예측 가능한 액세스 권한을 얻고, 훈련 비용을 미리 계획하고 예산을 책정하며, 자동화된 리소스 관리 및 내결함성의 이점을 누릴 수 있습니다. 요금은 인스턴스 유형, 인스턴스 수, 예약 기간 및 시작 날짜에 따라 달라집니다. 특정 구성에 대한 요금을 보려면 SearchTrainingPlanOfferings API 또는 SageMaker AI 콘솔을 사용합니다. 지원되는 인스턴스 유형은 섹션을 참조하세요ML 워크로드를 위한 유연한 훈련 계획 예약.
계획을 구매하기 전에 AWS 계정의 SageMaker AI 콘솔에서 또는 SearchTrainingPlanOfferings API를 사용하여 사용 가능한 훈련 계획 상품을 검색합니다. 사용 가능한 제품에는 인스턴스 유형, 기간, 요금 및 용량이 프로비저닝되는 가용 영역이 포함됩니다.
참고
유연한 훈련 계획을 검색하고 구매하려면 IAM 자격 증명에 sagemaker:SearchTrainingPlanOfferings 및를 포함한 적절한 권한이 있어야 합니다sagemaker:CreateTrainingPlan. 필요한 작업의 전체 목록은 Amazon SageMaker에서 정의한 작업을 참조하세요.
작은 정보
훈련 작업이 프라이빗 VPC에서 실행되는 경우 각 예약 용량 블록은 특정 가용 영역에 프로비저닝됩니다. Subnets의 에는 예약 용량 블록이 프로비저닝되는 가용 영역이 포함되어야 VpcConfig 합니다. 서로 다른 가용 영역에 걸쳐 있는 여러 블록이 있는 계획의 경우 모든 관련 영역에 서브넷을 포함합니다.
유연한 훈련 계획은 특정 인스턴스 유형 세트를 지원하며 일부 AWS 리전에서 사용할 수 있습니다. 지원되는 구성은 섹션을 참조하세요ML 워크로드를 위한 유연한 훈련 계획 예약. 요금은 SageMaker AI 요금을
작은 정보
SageMaker 훈련 작업을 사용한 분산 훈련 워크로드에 대한 모범 사례는 Amazon SageMaker에서 대규모 언어 모델 훈련: 모범 사례를