As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.
Lançamento de trabalhos de treinamento distribuídos com SMDDP usando o SDK do Python SageMaker
Para executar um trabalho de treinamento distribuído com seu script adaptadoAdaptação de seu script de treinamento para usar as operações coletivas do SMDDP, use a estrutura do SDK do SageMaker Python ou estimadores genéricos especificando o script de treinamento preparado como um script de ponto de entrada e a configuração de treinamento distribuído.
Esta página explica como usar o SDK do SageMaker AI Python de duas
-
Se você quiser obter uma adoção rápida de seu trabalho de treinamento distribuído em SageMaker IA, configure uma classe de estimador de SageMaker IA PyTorch
ou TensorFlow estrutura. O estimador de estrutura pega seu script de treinamento e combina automaticamente o URI de imagem correto dos contêineres pré-criados PyTorch ou de aprendizado TensorFlow profundo (DLC) , de acordo com o valor especificado no parâmetro. framework_version -
Se você quiser estender um dos contêineres pré-construídos ou criar um contêiner personalizado para criar seu próprio ambiente de ML com SageMaker IA, use a
Estimatorclasse genérica de IA e especifique o SageMaker URI da imagem do contêiner Docker personalizado hospedado em seu Amazon Elastic Container Registry (Amazon ECR).
Seus conjuntos de dados de treinamento devem ser armazenados no Amazon S3 ou no Amazon FSx for Lustre no local Região da AWS em que você está iniciando seu trabalho de treinamento. Se você usa notebooks Jupyter, você deve ter uma instância de SageMaker notebook ou um aplicativo SageMaker Studio Classic em execução no mesmo. Região da AWS Para obter mais informações sobre como armazenar seus dados de treinamento, consulte a documentação de entradas de dados do SDK do
dica
É recomendável que você use o Amazon FSx para Lustre em vez de Amazon S3 para aumentar o desempenho do treinamento. O Amazon FSx tem maior throughput e menor latência do que o Amazon S3.
dica
Para executar adequadamente o treinamento distribuído sobre os tipos de EFA-enabled instância, você deve habilitar o tráfego entre as instâncias configurando o grupo de segurança da sua VPC para permitir todo o tráfego de entrada e saída de e para o próprio grupo de segurança. Para saber como configurar as regras do grupo de segurança, consulte Etapa 1: Preparar um grupo de EFA-enabled segurança no Guia do usuário do Amazon EC2.
Escolha um dos tópicos a seguir para obter instruções sobre como executar um trabalho de treinamento distribuído do script de treinamento. Depois de iniciar um trabalho de treinamento, você pode monitorar a utilização do sistema e o desempenho do modelo usando SageMaker Depurador Amazon a Amazon CloudWatch.
Enquanto você segue as instruções nos tópicos a seguir para saber mais sobre detalhes técnicos, também recomendamos que você experimente o Exemplos da biblioteca de paralelismo de dados da Amazon SageMaker AI para começar.