기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.
HyperPod
HyperPod는 여러 훈련 작업에서 사용할 수 있는 영구 컴퓨팅 클러스터에서 모델 사용자 지정을 실행합니다. HyperPod는 자동 장애 감지 및 복구를 제공하므로 대규모 및 장기 실행 훈련 워크로드에 적합합니다.
임시 훈련 작업은 단원을 참조하십시오SageMaker AI 학습 작업. 완전 관리형 서버리스 훈련은 섹션을 참조하세요서버리스 모델 사용자 지정.
지원되는 사용자 지정 기법 및 훈련 유형은 섹션을 참조하세요사용자 지정 기법.
개요
리전별 가용성
모든 HyperPod 지원 리전에서 사용할 수 있습니다.
오케스트레이션 옵션
Amazon EKS를 사용하는 HyperPod - 인터페이스: 레시피, HP-CLI. 동적 용량 관리 및 컨테이너화된 훈련 작업과 함께 Kubernetes기반 워크로드 오케스트레이션을 사용합니다.
HyperPod with Slurm - 인터페이스: 레시피. 헤드, 로그인 및 작업자 노드 구성과 함께 Slurm기반 작업 예약을 사용합니다.
지원되는 기술 및 훈련 유형
HyperPod는 모든 사용자 지정 기법과 훈련 유형을 지원합니다. 사용자 지정 기법 및 훈련 유형 섹션을 참조하세요.
시작하기
HyperPod를 처음 사용하는 경우 SageMaker AI HyperPod를 사용하여 클러스터를 설정하기 위한 사전 조건을 참조하세요.
기존 HyperPod 클러스터에서 모델 사용자 지정을 실행하려면:
레시피 리포지토리를 복제합니다.
git clone --recursive https://github.com/aws/sagemaker-hyperpod-recipes.git cd sagemaker-hyperpod-recipes pip3 install -r requirements.txt에서 레시피를 선택합니다
recipes_collection/recipes/fine-tuning/.클러스터별 설정을 구성합니다(클러스터별 구성 참조).
적절한 방법을 사용하여를 시작합니다.
EKS: 시작 관리자 스크립트 또는 HP-CLI 사용
Slurm: 시작 관리자 스크립트 사용
자세한 자습서와 전체 레시피 카탈로그는 SageMaker AI 레시피 설명서를 참조하세요.
HyperPod에 대한 자세한 내용은 Amazon SageMaker AI HyperPod를 참조하세요.