

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

# Commencer à SageMaker HyperPod utiliser la console SageMaker AI
<a name="smcluster-getting-started-slurm-console"></a>

Le didacticiel suivant montre comment créer un nouveau SageMaker HyperPod cluster et le configurer avec Slurm via l'interface utilisateur de la console SageMaker AI. À la suite du didacticiel, vous allez créer un HyperPod cluster avec trois nœuds Slurm, `my-controller-group``my-login-group`, et. `worker-group-1`

**Note**  
HyperPod prend désormais en charge la création de clusters Slurm sans scripts de cycle de vie. Vous pouvez créer un cluster entièrement fonctionnel à l'aide de la AMI-based configuration, l'étendre à l'aide d'un script d'extension ou continuer à utiliser des scripts de cycle de vie personnalisés pour un contrôle total.

**Topics**
+ [Création d’un cluster](#smcluster-getting-started-slurm-console-create-cluster-page)
+ [déployer des ressources ;](#smcluster-getting-started-slurm-console-create-cluster-deploy)
+ [Suppression du cluster et nettoyage des ressources](#smcluster-getting-started-slurm-console-delete-cluster-and-clean)

## Création d’un cluster
<a name="smcluster-getting-started-slurm-console-create-cluster-page"></a>

Pour accéder à la ** page ** SageMaker HyperPod Clusters et choisir ** Slurm ** Orchestration, procédez comme suit.

1. Ouvrez la console Amazon SageMaker AI à l'adresse [ https://console.aws.amazon.com/sagemaker/](https://console.aws.amazon.com/sagemaker/).

1. Choisissez ** HyperPod Clusters ** dans le volet de navigation de gauche, puis ** Cluster Management**.

1. Sur la ** page ** SageMaker HyperPod Clusters, choisissez ** Créer un HyperPod cluster**. 

1. Dans la ** liste déroulante ** Créer un HyperPod cluster, choisissez ** Orchestrated by ** Slurm.

1. Sur la page de création du cluster Slurm, vous verrez deux options. Choisissez celle qui correspond le mieux à vos besoins.

   1. **Configuration rapide** : pour commencer immédiatement avec les paramètres par défaut, choisissez **Configuration rapide**. Avec cette option, SageMaker AI créera de nouvelles ressources telles que le VPC, les sous-réseaux, les groupes de sécurité, le compartiment Amazon S3, le rôle IAM et FSx for Lustre lors de la création de votre cluster.

   1. **Configuration personnalisée** : pour intégrer des ressources AWS existantes ou pour respecter des exigences spécifiques de mise en réseau, de sécurité ou de stockage, choisissez **Configuration personnalisée**. Avec cette option, vous pouvez choisir d’utiliser les ressources existantes ou d’en créer de nouvelles, et vous pouvez personnaliser la configuration qui répond le mieux à vos besoins.

## Configuration rapide
<a name="smcluster-getting-started-slurm-console-create-cluster-default"></a>

Dans la ** section Configuration ** rapide, suivez ces étapes pour créer votre HyperPod cluster avec Slurm Orchestration.

### Paramètres généraux
<a name="smcluster-getting-started-slurm-console-create-cluster-default-general"></a>

Attribuez un nom au nouveau cluster. Vous ne pourrez pas modifier le nom après la création du cluster.

### Groupes d’instances
<a name="smcluster-getting-started-slurm-console-create-cluster-default-instance-groups"></a>

Pour ajouter un groupe d’instances, choisissez **Ajouter un groupe**. Chaque groupe d’instances peut être configuré différemment et vous pouvez créer un cluster hétérogène composé de plusieurs groupes d’instances avec divers types d’instances. Pour déployer un cluster, vous devez ajouter au moins un groupe d’instances pour les types de groupe Contrôleur et Calcul.

**Important**  
Vous pouvez ajouter un seul groupe d’instances à la fois. Pour créer plusieurs groupes d’instances, répétez le processus pour chaque groupe d’instances.

Procédez comme suit pour ajouter un groupe d’instances.

1. Pour **Type de groupe d’instances**, choisissez un type pour votre groupe d’instances. Pour ce didacticiel, choisissez **Contrôleur (principal)** pour `my-controller-group`, **Connexion** pour `my-login-group` et **Calcul (travail)** pour `worker-group-1`.

1. Pour **Nom**, spécifiez le nom du groupe d’instances. Pour ce didacticiel, créez trois groupes d’instances nommés `my-controller-group`, `my-login-group` et `worker-group-1`.

1.  Pour **Capacité de l’instance**, choisissez une capacité à la demande ou un plan d’entraînement pour réserver vos ressources de calcul.

1. Pour **Type d’instance**, choisissez l’instance pour le groupe d’instances. Pour ce didacticiel, sélectionnez `ml.c5.xlarge` pour `my-controller-group`, `ml.m5.4xlarge` pour `my-login-group` et `ml.trn1.32xlarge` pour `worker-group-1`. 
**Important**  
Veillez à choisir un type d’instance doté de quotas suffisants et suffisamment d’adresses IP non attribuées pour votre compte. Pour consulter ou demander des quotas supplémentaires, consultez [SageMaker HyperPod quotas](sagemaker-hyperpod-prerequisites.md#sagemaker-hyperpod-prerequisites-quotas).

1. Pour **Quantité d’instances**, spécifiez un entier ne dépassant pas le quota d’instances pour l’utilisation du cluster. Pour ce didacticiel, entrez **1** pour les trois groupes.

1. Pour **Zone de disponibilité cible**, choisissez la zone de disponibilité dans laquelle vos instances seront provisionnées. La zone de disponibilité doit correspondre à l’emplacement de votre capacité de calcul accélérée.

1. Pour **Autre volume de stockage par instance (Go) – facultatif**, spécifiez un entier compris entre 1 et 16 384 pour définir la taille d’un volume Elastic Block Store (EBS) supplémentaire en gigaoctets (Go). Le volume EBS est attaché à chaque instance du groupe d’instances. Le chemin de montage par défaut pour le volume EBS supplémentaire est `/opt/sagemaker`. Une fois le cluster créé avec succès, vous pouvez accéder par SSH aux instances du cluster (nœuds) et vérifier si le volume EBS est correctement monté en exécutant la commande `df -h`. L’attachement d’un volume EBS supplémentaire fournit un stockage stable, hors instance et persistant de manière indépendante, comme décrit dans la section [Volumes Amazon EBS](https://docs.aws.amazon.com/ebs/latest/userguide/ebs-volumes.html) du *Guide de l’utilisateur Amazon Elastic Block Store*.

1. Choisissez **Ajouter un groupe d’instances**.

### Paramètres par défaut de configuration rapide
<a name="smcluster-getting-started-slurm-console-create-cluster-default-settings"></a>

Cette section répertorie tous les paramètres par défaut pour la création de votre cluster, y compris toutes les nouvelles AWS ressources qui seront créées au cours du processus de création du cluster. Passez en revue les paramètres par défaut.

**Note**  
La configuration rapide utilise automatiquement les scripts de cycle de vie par défaut. La nouvelle option AMI-based de configuration (aucun script de cycle de vie) n'est disponible que via la configuration personnalisée. Si vous souhaitez créer un cluster sans scripts de cycle de vie, choisissez Configuration personnalisée et choisissez ** Aucune ** sous Scripts de ** cycle de vie**.

## Configuration personnalisée
<a name="smcluster-getting-started-slurm-console-create-cluster-custom"></a>

Dans la ** section Configuration ** personnalisée, suivez ces étapes pour créer votre HyperPod cluster avec Slurm Orchestration.

### Paramètres généraux
<a name="smcluster-getting-started-slurm-console-create-cluster-custom-general"></a>

Attribuez un nom au nouveau cluster. Vous ne pourrez pas modifier le nom après la création du cluster.

Pour **Restauration d’instance**, choisissez **Automatique – *recommandé*** ou **Aucun**.

### Mise en réseau
<a name="smcluster-getting-started-slurm-console-create-cluster-custom-network"></a>

Configurez vos paramètres réseau pour la création du cluster. Ces paramètres ne pourront pas être modifiés après la création du cluster.

1. Pour le ** VPC**, choisissez votre propre VPC si vous en possédez déjà un qui donne accès à l' SageMaker IA à votre VPC. Pour créer un nouveau VPC, suivez les instructions de la section [Création d’un VPC](https://docs.aws.amazon.com/vpc/latest/userguide/create-vpc.html) dans le *Guide de l’utilisateur Amazon Virtual Private Cloud*. Vous pouvez le laisser sur ** Aucun ** pour utiliser le VPC SageMaker AI par défaut.

1. Pour **Bloc CIDR IPv4 du VPC**, entrez l’adresse IP de départ de votre VPC.

1. Pour les zones de ** disponibilité**, choisissez les zones de disponibilité (AZ) dans lesquelles HyperPod vous allez créer des sous-réseaux pour votre cluster. Choisissez des AZ correspondant à l’emplacement de votre capacité de calcul accéléré.

1. Pour **Groupes de sécurité**, créez un groupe de sécurité ou choisissez jusqu’à cinq groupes de sécurité configurés avec des règles permettant la communication entre les ressources au sein du VPC.

### Groupes d’instances
<a name="smcluster-getting-started-slurm-console-create-cluster-custom-instance-groups"></a>

Pour ajouter un groupe d’instances, choisissez **Ajouter un groupe**. Chaque groupe d’instances peut être configuré différemment et vous pouvez créer un cluster hétérogène composé de plusieurs groupes d’instances avec divers types d’instances. Pour déployer un cluster, vous devez ajouter au moins un groupe d’instances.

**Important**  
Vous pouvez ajouter un seul groupe d’instances à la fois. Pour créer plusieurs groupes d’instances, répétez le processus pour chaque groupe d’instances.

Procédez comme suit pour ajouter un groupe d’instances.

1. Pour **Type de groupe d’instances**, choisissez un type pour votre groupe d’instances. Pour ce didacticiel, choisissez **Contrôleur (principal)** pour `my-controller-group`, **Connexion** pour `my-login-group` et **Calcul (travail)** pour `worker-group-1`.

1. Pour **Nom**, spécifiez le nom du groupe d’instances. Pour ce didacticiel, créez trois groupes d’instances nommés `my-controller-group`, `my-login-group` et `worker-group-1`.

1.  Pour **Capacité de l’instance**, choisissez une capacité à la demande ou un plan d’entraînement pour réserver vos ressources de calcul.

1. Pour **Type d’instance**, choisissez l’instance pour le groupe d’instances. Pour ce didacticiel, sélectionnez `ml.c5.xlarge` pour `my-controller-group`, `ml.m5.4xlarge` pour `my-login-group` et `ml.trn1.32xlarge` pour `worker-group-1`. 
**Important**  
Veillez à choisir un type d’instance doté de quotas suffisants et suffisamment d’adresses IP non attribuées pour votre compte. Pour consulter ou demander des quotas supplémentaires, consultez [SageMaker HyperPod quotas](sagemaker-hyperpod-prerequisites.md#sagemaker-hyperpod-prerequisites-quotas).

1. Pour **Quantité d’instances**, spécifiez un entier ne dépassant pas le quota d’instances pour l’utilisation du cluster. Pour ce didacticiel, entrez **1** pour les trois groupes.

1. Pour **Zone de disponibilité cible**, choisissez la zone de disponibilité dans laquelle vos instances seront provisionnées. La zone de disponibilité doit correspondre à l’emplacement de votre capacité de calcul accélérée.

1. Pour **Autre volume de stockage par instance (Go) – facultatif**, spécifiez un entier compris entre 1 et 16 384 pour définir la taille d’un volume Elastic Block Store (EBS) supplémentaire en gigaoctets (Go). Le volume EBS est attaché à chaque instance du groupe d’instances. Le chemin de montage par défaut pour le volume EBS supplémentaire est `/opt/sagemaker`. Une fois le cluster créé avec succès, vous pouvez accéder par SSH aux instances du cluster (nœuds) et vérifier si le volume EBS est correctement monté en exécutant la commande `df -h`. L’attachement d’un volume EBS supplémentaire fournit un stockage stable, hors instance et persistant de manière indépendante, comme décrit dans la section [Volumes Amazon EBS](https://docs.aws.amazon.com/ebs/latest/userguide/ebs-volumes.html) du *Guide de l’utilisateur Amazon Elastic Block Store*.

1. Pour le nom de partition ** Slurm ** (groupes de calcul uniquement), entrez le nom de partition Slurm pour ce groupe d'instances de calcul. Les partitions agissent comme des files d'attente logiques qui organisent la façon dont les tâches sont planifiées sur différents ensembles de nœuds.

1. Choisissez **Ajouter un groupe d’instances**.

### Configuration du cycle de vie : en option
<a name="smcluster-getting-started-slurm-console-create-cluster-custom-lifecycle"></a>

Configurez la façon dont les nœuds de votre cluster sont provisionnés. Votre choix influe sur les exigences du compartiment Amazon S3, les besoins d'accès à Internet et la complexité du provisionnement. HyperPod prend en charge trois options de configuration du cycle de vie des nœuds, chacune offrant un niveau de contrôle différent sur le processus de provisionnement.

1. Pour les scripts de ** cycle de vie**, choisissez l'une des options suivantes pour contrôler la manière dont les nœuds sont provisionnés dans votre cluster :
   + **Aucun ** : HyperPod configure les nœuds automatiquement à l'aide de AMI-based la configuration. Les démons Slurm, Docker, Enroot, Pyxis, la comptabilité Slurm avec MariaDB, la génération et la propagation de clés SSH, la rotation des journaux et la configuration du répertoire personnel sont tous configurés sans aucun script ni compartiment Amazon S3. Tous les logiciels sont préemballés dans l'AMI, de sorte qu'aucun accès à Internet n'est requis lors du provisionnement. Il s'agit du chemin le plus simple pour les nouveaux clusters.
   + **Utiliser des scripts de cycle de vie par défaut ** — Les scripts de cycle de vie par défaut sont chargés dans le compartiment Amazon S3 choisi et utilisés pour provisionner les nœuds. Cette option utilise les scripts du référentiel [ Awsome Distributed Training ](https://github.com/awslabs/awsome-distributed-training/tree/main/1.architectures/5.sagemaker-hyperpod/LifecycleScripts/base-config) (ADTR).
   + **Utilisez des scripts de cycle de vie personnalisés ** : choisissez des scripts de cycle de vie dans un compartiment Amazon S3. Cela correspond au `OnCreate` chemin de l'API, où vos scripts possèdent l'intégralité de la séquence de provisionnement, y compris au démarrage de Slurm. HyperPod n'exécute pas AMI-based la configuration lorsque cette option est sélectionnée.

   Le tableau suivant récapitule les trois options :


<table>
<tbody>
</tbody>
</table>


1. Pour Fichier de script d'**extension dans S3 - * facultatif * ** (apparaît lorsque vous choisissez ** Aucun ** sous Scripts ** du cycle de vie**), entrez l'URI Amazon S3 de votre script d'extension. Le script d'extension vous permet de fournir des fonctionnalités facultatives supplémentaires, telles que l'observabilité, le système de sécurité du démon (SSSD) et le montage de compartiments Amazon S3, en plus des configurations par défaut sans gérer l'ensemble complet des scripts de cycle de vie.

   Entrez l'URI Amazon S3 complet dans le script du point d'entrée, par exemple :

   ```
   s3://DOC-EXAMPLE-BUCKET/extensions/run_extensions.sh
   ```

   HyperPod télécharge l'intégralité du dossier dans lequel se trouve le script du point d'entrée. Structurez votre dossier Amazon S3 de manière à ce que tous les fichiers de support se trouvent dans le même répertoire que le script du point d'entrée.
**Note**  
Dans l'API, cela correspond à spécifier `OnInitComplete` dans `LifeCycleConfig` with`SourceS3Uri`. La console les combine dans un seul champ URI Amazon S3 pointant directement vers le script du point d'entrée.
**Astuce**  
Pour les scripts d'extension prêts à l'emploi, consultez le dossier [ Extensions du ](https://github.com/awslabs/awsome-distributed-training/tree/main/1.architectures/5.sagemaker-hyperpod/Extensions) référentiel Awsome Distributed Training. Le `run_extensions.sh` script orchestre de multiples fonctionnalités à l'aide de simples bascules booléens pour activer ou désactiver chacune d'entre elles.

1. Pour le compartiment ** S3 pour les scripts de cycle de vie ** (apparaît lorsque vous choisissez ** Utiliser les scripts de cycle de vie par défaut ** ou ** Utiliser des scripts de cycle de vie personnalisés**), choisissez de créer un nouveau compartiment ou d'utiliser un compartiment existant pour stocker les scripts de cycle de vie.

**Note**  
La configuration optionnelle du cycle de vie des nœuds n'est prise en charge que pour les Slurm-orchestrated clusters. EKS-orchestrated Les clusters Amazon continuent de nécessiter des scripts de cycle de vie pour chaque groupe d'instances.

**Note**  
L'**option ** Aucun avec un script d'extension et l'**option ** Utiliser des scripts de cycle de vie personnalisés s'excluent mutuellement. Vous ne pouvez pas combiner AMI-based la configuration avec un script d'extension et des scripts de cycle de vie personnalisés sur le même groupe d'instances. Dans l'API, cela signifie `OnCreate` et `OnInitComplete` ne peut pas être spécifié ensemble.

### Permissions
<a name="smcluster-getting-started-slurm-console-create-cluster-custom-permissions"></a>

Choisissez ou créez un rôle IAM qui permet d' HyperPod exécuter et d'accéder aux AWS ressources nécessaires en votre nom.

### Stockage
<a name="smcluster-getting-started-slurm-console-create-cluster-custom-storage"></a>

Configurez le système de fichiers FSx for Lustre à provisionner sur le HyperPod cluster. La configuration FSx est facultative pour la création de clusters mais recommandée pour les charges de travail ML de production.

1. Pour **Système de fichiers**, choisissez un système de fichiers FSx pour Lustre existant, pour créer un nouveau système de fichiers FSx pour Lustre, ou ne provisionnez pas de système de fichiers FSx pour Lustre.

1. Pour **Débit par unité de stockage**, choisissez le débit qui sera disponible par Tio de stockage provisionné.

1. Pour **Capacité de stockage**, entrez une valeur de capacité en To.

1. Pour **Type de compression des données**, choisissez **LZ4** pour activer la compression des données.

1. Pour **Version Lustre**, consultez la valeur recommandée pour les nouveaux systèmes de fichiers.

**Note**  
Lorsque vous utilisez AMI-based la configuration (en choisissant ** Aucune ** dans les scripts ** du cycle de vie**) ou un script d'extension, HyperPod gère automatiquement FSx pour le montage de Lustre. Lorsque vous utilisez des scripts de cycle de vie personnalisés, vos scripts sont responsables du montage du système de fichiers.

### Balises - facultatif
<a name="smcluster-getting-started-slurm-console-create-cluster-tags"></a>

Pour les ** balises : * facultatif ***, ajoutez des paires clé/valeur au nouveau cluster et gérez le cluster en tant que AWS ressource. Pour en savoir plus, consultez [Balisage de vos ressources AWS](https://docs.aws.amazon.com/tag-editor/latest/userguide/tagging.html).

## déployer des ressources ;
<a name="smcluster-getting-started-slurm-console-create-cluster-deploy"></a>

Après avoir terminé la configuration du cluster à l’aide de la **configuration rapide** ou de la **configuration personnalisée**, choisissez l’option suivante pour démarrer le provisionnement des ressources et la création du cluster.
+  **Soumettre ** - SageMaker AI commencera à provisionner les ressources de configuration par défaut et à créer le cluster. 
+ **Télécharger les paramètres du CloudFormation modèle ** : vous allez télécharger le fichier JSON des paramètres de configuration et exécuter la AWS CLI commande pour déployer la CloudFormation pile afin de provisionner les ressources de configuration et de créer le cluster. Vous pouvez modifier le fichier JSON de paramètres téléchargés si nécessaire. Si vous choisissez cette option, consultez des instructions supplémentaires dans [Création de SageMaker HyperPod clusters à l'aide de CloudFormation modèles](smcluster-getting-started-slurm-console-create-cluster-cfn.md).

## Suppression du cluster et nettoyage des ressources
<a name="smcluster-getting-started-slurm-console-delete-cluster-and-clean"></a>

Une fois que vous avez testé avec succès la création d'un SageMaker HyperPod cluster, celui-ci continue de fonctionner dans `InService` cet état jusqu'à ce que vous supprimiez le cluster. Nous vous recommandons de supprimer tous les clusters créés à l'aide d'instances d' SageMaker IA à la demande lorsqu'elles ne sont pas utilisées afin d'éviter des frais de service continus basés sur la tarification à la demande. Dans ce didacticiel, vous avez créé un cluster composé de deux groupes d’instances. L’un d’eux utilise une instance C5. Veillez donc à supprimer le cluster en suivant les instructions dans [Supprimer un SageMaker HyperPod cluster](sagemaker-hyperpod-operate-slurm-console-ui.md#sagemaker-hyperpod-operate-slurm-console-ui-delete-cluster).

Toutefois, si vous avez créé un cluster avec une capacité de calcul réservée, le statut des clusters n’a aucune incidence sur la facturation des services.

Si vous avez utilisé ** Utiliser des scripts de cycle de vie par défaut ** ou ** Utiliser des scripts de cycle de vie personnalisés**, accédez au compartiment Amazon S3 que vous avez utilisé lors de la création du cluster et supprimez les fichiers de script de cycle de vie.

Si vous avez utilisé ** None ** (AMI-based configuration uniquement) sans script d'extension, aucun nettoyage Amazon S3 n'est nécessaire pour les scripts de cycle de vie.

Si vous avez utilisé ** None ** avec un script d'extension, nettoyez les fichiers de script d'extension du compartiment Amazon S3 que vous avez spécifié.

Si vous avez testé l’exécution de charges de travail sur le cluster, vérifiez si vous avez chargé des données ou si votre tâche a enregistré des artefacts dans différents compartiments S3 ou services de système de fichiers tels qu’Amazon FSx pour Lustre et Amazon Elastic File System. Pour éviter d’encourir des frais, supprimez tous les artefacts et toutes les données du stockage ou du système de fichiers.