Aidez à améliorer cette page
Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Pour contribuer à ce guide de l'utilisateur, cliquez sur le GitHub lien Modifier cette page qui se trouve dans le volet droit de chaque page.
Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Configuration du cluster Amazon EKS pour les charges AI/ML de travail
Astuce
Inscrivez-vous
Cette section vous explique comment créer un cluster Amazon EKS prêt à exécuter des charges de travail d'inférence, y compris le calcul avec des GPU, la pile de surveillance et le stockage Amazon S3 pour les pondérations des modèles, ainsi que les autorisations IAM nécessaires AWS .
Présentation de l’architecture
La configuration crée l'infrastructure suivante :
-
Cluster EKS avec GPU-enabled nœuds : un cluster Karpenter-managed NodePool qui provisionne dynamiquement les instances G-family GPU en utilisant la capacité Spot avec On-Demand solution de secours.
-
Pile de surveillance : Prometheus extrait les métriques des clusters, des nœuds et des GPU et les écrit à distance dans Amazon Managed Service for Prometheus (AMP). Grafana fournit des tableaux de bord à des fins de visualisation. L'exportateur NVIDIA DCGM ajoute GPU-specific des mesures telles que l'utilisation, la mémoire, la température, la consommation électrique, la bande passante NVLink et l'activité des tenseurs.
-
Compartiment S3 de pondérations des modèles — Un compartiment Amazon S3 pour stocker les poids des modèles, avec une association EKS Pod Identity qui autorise l' read/write accès aux modules de charge de travail.
Options de calcul en cluster
Le guide propose deux méthodes pour configurer votre cluster. Choisissez-en un et suivez-le régulièrement à toutes les étapes.
-
Mode automatique EKS : une seule commande permet de provisionner un cluster EKS avec le mode automatique EKS activé. Tous les composants requis sont fournis prêts à l'emploi, notamment la mise à Karpenter-based l'échelle automatique, l'agent de surveillance des nœuds EKS, l'extraction rapide des conteneurs avec SOCI et le plug-in de périphérique NVIDIA.
-
Self-managed Karpenter — Vous installez et configurez chaque composant de manière explicite : Karpenter via
eksctl, la réparation automatique des nœuds via son Feature Gate, l'agent de surveillance des nœuds EKS en tant que module complémentaire EKS et le plug-in de périphérique NVIDIA via Helm. Vous créez également une personnalisationEC2NodeClassqui utilise les AMI EKS-optimized NVIDIA AL2023 et configure SOCI.
Ce que vous allez configurer
| Step (Étape) | Description |
|---|---|
|
Créer un cluster |
Fournissez le plan de contrôle EKS et les composants au niveau du cluster nécessaires aux charges de travail du GPU. |
|
Créez des nœuds GPU provisionnés dynamiquement |
Définissez un GPU dynamique NodePool qui provisionne les instances G-family GPU au fur et à mesure que les charges de travail sont planifiées. |
|
Testez avec une capsule d'échantillon |
Validez la configuration de bout en bout en exécutant un |
|
Ajouter une capacité réservée (facultatif) |
Joignez une réservation On-Demand de capacité (ODCR) à votre formulaire NodeClass réservé en premier avec option de repli. Spot/On-Demand |
|
Installation de la surveillance |
Déployez kube-prometheus-stack (Prometheus + Grafana) avec écriture à distance sur AMP, ainsi que l'exportateur NVIDIA DCGM pour les métriques GPU. |
|
Création d'un panier de poids pour modèles |
Créez un compartiment S3 et configurez EKS Pod Identity afin que les modules de charge de travail puissent lire et écrire les pondérations des modèles. |
Prise en main
Pour obtenir des instructions détaillées à l'aide de l' AWS interface de ligne de commande, reportez-vous àConfigurer le cluster Amazon EKS pour les AI/ML charges de travail à l'aide des CLI. Pour obtenir des instructions étape par étape sur l'utilisation de Terraform, consultez. Configurer le cluster Amazon EKS pour les AI/ML charges de travail à l'aide de Terraform