As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.
Obtenha capacidade computacional para trabalhos de SageMaker treinamento
Antes de solicitar capacidade computacional, confirme se sua AWS conta atende aos seguintes pré-requisitos. Atender a esses requisitos em ordem ajuda a evitar falhas comuns de provisionamento.
Etapa 1: verificar a disponibilidade da instância em sua região
Nem todos os tipos de instância estão disponíveis em todas as AWS regiões. Antes de selecionar um tipo de instância para sua carga de trabalho de treinamento, verifique se ela está disponível na sua região de destino.
-
Para ver a disponibilidade e os preços das instâncias por região, consulte Preços de SageMaker IA
. Selecione a guia Treinamento e escolha sua região para ver os tipos de instância, as especificações e os preços por hora disponíveis.
Se o tipo de instância não estiver disponível na sua região:
-
Escolha um tipo de instância alternativo que esteja disponível em sua região. Para GPU-accelerated treinamento, identifique famílias de instâncias com recursos de rede e memória de GPU comparáveis.
-
Se sua carga de trabalho exigir um tipo de instância específico e seus requisitos de residência e conformidade de dados permitirem, considere executar o trabalho de treinamento em uma região diferente onde esse tipo de instância esteja disponível. Certifique-se de que seus dados de treinamento estejam acessíveis na região de destino ou planeje a transferência de dados entre regiões.
Verificar a disponibilidade da instância por zona de disponibilidade
A disponibilidade da instância também varia de acordo com a zona de disponibilidade dentro de uma região. Um tipo de instância oferecido em sua região não é necessariamente oferecido em todas as zonas de disponibilidade dessa região. Isso é importante quando você executa trabalhos de treinamento em uma VPC privada, porque as sub-redes que você especifica determinam quais zonas de disponibilidade a SageMaker IA pode usar para provisionar instâncias. Para obter mais informações, consulte Etapa 3: configurar sua VPC e sub-redes (opcional).
Para listar as zonas de disponibilidade que oferecem um tipo de instância em uma região, use a DescribeInstanceTypeOfferings API Amazon Elastic Compute Cloud:
aws ec2 describe-instance-type-offerings \ --location-type availability-zone \ --filters Name=instance-type,Values=p5.48xlarge \ --region us-east-1 \ --query 'InstanceTypeOfferings[].Location' \ --output table
nota
Especifique o tipo de instância do Amazon Elastic Compute Cloud (p5.48xlarge), não o tipo de instância de SageMaker IA (ml.p5.48xlarge). SageMaker Os tipos de instância de treinamento de IA são mapeados para o tipo de instância equivalente do Amazon Elastic Compute Cloud com o ml. prefixo removido.
Etapa 2: verificar e solicitar cotas de serviço
Sua AWS conta tem cotas padrão que limitam o número de instâncias que você pode usar simultaneamente para trabalhos de SageMaker treinamento. Cada tipo de instância tem sua própria cota.
-
Para ver suas cotas atuais, abra o console de cotas de serviço
e filtre o tipo de instância que você planeja usar. -
Se sua cota for insuficiente para o número de instâncias que seu trabalho de treinamento exige, solicite um aumento de cota. Os aumentos de cota não são imediatos — envie sua solicitação antes do treinamento planejado.
dica
Para planos de treinamento flexíveis, sua cota de serviço deve ser igual ou maior que o número de instâncias em seu plano. Para obter mais informações, consulte Veja as cotas dos planos de SageMaker treinamento usando o AWS console de gerenciamento.
Etapa 3: configurar sua VPC e sub-redes (opcional)
Essa etapa se aplica somente se você executar trabalhos de treinamento em uma VPC privada. Por padrão, os trabalhos de SageMaker treinamento são executados em um ambiente de SageMaker AI-managed rede e não exigem configuração de VPC. Se sua organização precisar de trabalhos de treinamento para acessar recursos em uma VPC privada — por exemplo, dados armazenados no Amazon S3 por meio de um endpoint de VPC ou sistemas de arquivos — você deverá especificar Subnets e SecurityGroupIds no VpcConfig parâmetro da API. CreateTrainingJob
Quando você configura uma VPC, as sub-redes que você especifica determinam quais zonas de disponibilidade a SageMaker IA pode usar para provisionar instâncias.
-
Forneça sub-redes em várias zonas de disponibilidade. SageMaker A IA provisiona instâncias de treinamento Availability-Zone de grupos por capacidade. Incluir sub-redes em mais zonas de disponibilidade aumenta o pool de capacidade do qual a SageMaker IA pode extrair, o que aumenta a probabilidade de provisionamento bem-sucedido de instâncias e reduz os tempos de espera. Especifique sub-redes em pelo menos três zonas de disponibilidade, sempre que possível.
SageMaker A IA ainda inicia todas as instâncias de um determinado trabalho em uma única sub-rede (uma única zona de disponibilidade) para mantê-las fisicamente próximas e minimizar a latência entre nós. As sub-redes adicionais apenas ampliam as opções que a SageMaker IA pode escolher. Eles não distribuem as instâncias de um trabalho pelas zonas de disponibilidade.
-
Para planos de treinamento flexíveis, alinhe as sub-redes com sua capacidade reservada. Cada bloco de capacidade reservada é provisionado em uma zona de disponibilidade específica. Você
VpcConfigdeve incluir asSubnetszonas de disponibilidade nas quais seus blocos de capacidade reservada são provisionados. Para planos com vários blocos que abrangem diferentes zonas de disponibilidade, inclua sub-redes em todas as zonas relevantes. -
Alinhe as fontes de dados às zonas de disponibilidade da instância de treinamento. Se seus dados de treinamento residirem em um serviço Availability-Zone-specific de armazenamento como o Amazon EFS, verifique se o sistema de arquivos está acessível nas mesmas zonas de disponibilidade em que suas instâncias de treinamento serão executadas.
Escolha uma opção de capacidade
On-Demand Instâncias
On-Demand é a opção de capacidade padrão para trabalhos SageMaker de treinamento. As instâncias são provisionadas quando um trabalho de treinamento é iniciado e liberadas quando ele é concluído. Você paga por segundo de computação, sem nenhum compromisso inicial de executar trabalhos ad hoc. A capacidade necessária para os trabalhos é alocada com base no melhor esforço, com base na disponibilidade na Região durante a apresentação do trabalho.
Se a On-Demand capacidade não estiver disponível para o tipo de instância solicitado, o trabalho de treinamento entrará em um estado de espera. Você pode configurar o período de espera de 2 horas a 28 dias definindoMaxPendingTimeInSeconds. Se a capacidade não ficar disponível dentro desse período, o trabalho falhará com umInsufficientCapacityError.
dica
Para preservar a On-Demand capacidade entre trabalhos de treinamento consecutivos, ative o Managed Warm Pools. Os Warm Pools retêm instâncias provisionadas após a conclusão de um trabalho, de modo que os trabalhos subsequentes reutilizem as mesmas instâncias sem readquirir capacidade. Isso é útil para cargas de trabalho iterativas, como ajuste de hiperparâmetros ou depuração de treinamento distribuído.
Treinamento de spot gerenciado
O Managed Spot Training usa capacidade spot extra do Amazon EC2 com até 90% de economia de custos em comparação com os On-Demand preços. SageMaker A IA gerencia o ciclo de vida do Spot, incluindo interrupções e reinicializações automáticas. Com o Spot Training, as cargas de trabalho podem estar sujeitas a interrupções, e estratégias de checkpoint são recomendadas para retomar os trabalhos a partir do último estado salvo.
Os pools de capacidade spot são definidos por tipo de instância e zona de disponibilidade. Para maximizar a disponibilidade spot, especifique sub-redes em várias zonas de disponibilidade em. VpcConfig.Subnets StoppingCondition.MaxWaitTimeInSecondsDefinido para controlar por quanto tempo a SageMaker IA espera pela capacidade spot antes de interromper o trabalho.
Para obter mais informações, consulte Treinamento local gerenciado na Amazon SageMaker AI.
Planos de treinamento flexíveis
Planos de treinamento flexíveis permitem que você reserve a capacidade da GPU com antecedência para uma data e duração específicas. Ao reservar capacidade, você obtém acesso previsível a tipos de instâncias de GPU de alta demanda, planeja e orça seus custos de treinamento com antecedência e se beneficia do gerenciamento automatizado de recursos e da tolerância a falhas. O preço depende do tipo de instância, do número de instâncias, da duração da reserva e da data de início. Para ver os preços de sua configuração específica, use a SearchTrainingPlanOfferings API ou o console de SageMaker IA. Para ver os tipos de instância compatíveis, consulteReserve planos de treinamento flexíveis para cargas de trabalho de ML.
Antes de comprar um plano, pesquise as ofertas de planos de treinamento disponíveis no console de SageMaker IA da sua AWS conta ou usando a SearchTrainingPlanOfferings API. As ofertas disponíveis incluem tipos de instâncias, durações, preços e as zonas de disponibilidade em que a capacidade é provisionada.
nota
Para pesquisar e comprar planos de treinamento flexíveis, sua identidade IAM deve ter as permissões apropriadas, incluindo sagemaker:SearchTrainingPlanOfferings sagemaker:CreateTrainingPlan e. Para ver a lista completa das ações necessárias, consulte Ações definidas pela Amazon SageMaker.
dica
Se seus trabalhos de treinamento forem executados em uma VPC privada, cada bloco de capacidade reservada será provisionado em uma zona de disponibilidade específica. Você VpcConfig deve incluir as Subnets zonas de disponibilidade nas quais seus blocos de capacidade reservada são provisionados. Para planos com vários blocos que abrangem diferentes zonas de disponibilidade, inclua sub-redes em todas as zonas relevantes.
Planos de treinamento flexíveis oferecem suporte a um conjunto específico de tipos de instância e estão disponíveis em AWS regiões selecionadas. Para ver as configurações compatíveis, consulteReserve planos de treinamento flexíveis para cargas de trabalho de ML. Para saber os preços, consulte Preços de SageMaker IA
dica
Para obter as melhores práticas sobre cargas de trabalho de treinamento distribuídas com trabalhos de SageMaker treinamento, consulte Treinamento de grandes modelos linguísticos na Amazon SageMaker: melhores práticas