View a markdown version of this page

Gérez le calcul accéléré pour les AI/ML charges de travail sur Amazon EKS - Amazon EKS

Aidez à améliorer cette page

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Pour contribuer à ce guide de l'utilisateur, cliquez sur le GitHub lien Modifier cette page qui se trouve dans le volet droit de chaque page.

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Gérez le calcul accéléré pour les AI/ML charges de travail sur Amazon EKS

Astuce

Inscrivez-vous aux prochains AI/ML ateliers Amazon EKS.

Cette section explique comment acheter et provisionner des instances de calcul accéléré EC2 pour les charges de travail de AI/ML formation et d'inférence avec Amazon EKS. Que vous entraîniez des modèles à grande échelle, que vous exécutiez des inférences en temps réel ou que vous déployiez des applications d'IA génératives, l'utilisation d'un GPU NVIDIA ou d'une capacité AWS Trainium adaptée est essentielle à la performance de vos charges de travail.

Choisissez parmi les types d'instances EC2

Consultez les spécifications des instances de calcul accéléré Amazon EC2 pour plus de détails sur les instances de calcul accéléré Amazon EC2 disponibles. Il s'agit notamment des instances GPU NVIDIA de la marque P-family et G-family, ainsi que des accélérateurs AWS conçus par Trainium et Inferentia.

Comprendre les options d'achat d'EC2

Une fois que vous connaissez les instances accélérées dont vous avez besoin pour vos charges de travail, l'étape suivante consiste à comprendre les options d'achat disponibles pour acquérir ces types d'instances accélérées. AWS propose quatre options d'achat de capacité de calcul : On-Demand instances, instances ponctuelles, blocs de capacité pour le machine learning et réservations de On-Demand capacité (ODCR). Chaque option répond à des modèles de charge de travail, à des profils de coûts et à des exigences de disponibilité différents. La documentation sur les options d'achat des instances Amazon EC2 explique le fonctionnement de chaque option, son modèle de tarification et les circonstances dans lesquelles l'utiliser.

  • On-Demand Instances  : Payez à la seconde sans engagement et disponibilité immédiate lorsque la capacité est disponible. Idéal pour le développement, le prototypage, la mise à l'échelle d'inférence imprévisible et toute charge de travail nécessitant un calcul immédiat sans risque d'interruption.

  • Instances ponctuelles  : jusqu'à 90 % d'économies On-Demand par rapport à l'utilisation de la capacité EC2 de réserve, avec un préavis d'interruption de 2 minutes. Idéal pour les charges de travail tolérantes aux pannes qui pointent vers un stockage durable : réglage des hyperparamètres, formation distribuée avec points de contrôle périodiques, inférence par lots et hors ligne, et pipelines de prétraitement des données.

  • Blocs de capacité pour ML  : instances Reserve P-family et Trainium pour une période fixe (24 heures, jusqu'à 6 mois), réservées jusqu'à 8 semaines à l'avance. Utilisez les blocs de capacité pour des sessions d'entraînement planifiées à grande échelle, des expériences de réglage limitées dans le temps et des projets de recherche dont les délais sont connus et qui nécessitent un accès prévisible à un cluster GPU.

  • On-Demand Réservations de capacité (ODCR)  : réservez une capacité accélérée dans une zone de disponibilité spécifique sans engagement à long terme, facturée aux On-Demand taux standard, que la capacité soit utilisée ou non. Idéal pour l'inférence de production, les SLA-bound services et les applications critiques pour lesquelles les retards de planification ou l'indisponibilité des capacités sont inacceptables. Contrairement aux blocs de capacité, les ODCR prennent en charge les deux instances P-family . G-family

Adaptez les options d'achat aux exigences de charge de travail

Maintenant que vous connaissez les types d'instances accélérées et les options d'achat, l'étape suivante consiste à choisir la bonne option d'achat en fonction des exigences spécifiques de votre charge de travail. Les charges de travail offrant une plus grande flexibilité en termes de types d'instances, de régions et de délais peuvent bénéficier d'un plus grand nombre d'options d'achat et d'une réduction des prix.

Fondez votre décision sur des facteurs tels que :

  • Importance stratégique et engagements en matière de SLA

  • Prévisibilité de la demande et flexibilité de planification

  • Volonté de s'engager à l'avance en faveur de la capacité réservée

  • Flexibilité entre les types d'instances, les régions et le calendrier

  • Tolérance aux interruptions par rapport aux économies de coûts

Dans la pratique, les équipes adoptent une approche hybride qui combine plusieurs options d'achat afin d'équilibrer les coûts, la disponibilité et la fiabilité de leur portefeuille de charges de travail. L'article How to Get GPU Capacity on AWS propose un arbre de décision, des comparaisons de prix et des exemples concrets permettant de sélectionner la bonne option d'achat pour différents types de charges de travail.

Vérifiez vos quotas de service EC2

Avant de mettre en œuvre une option d'achat de capacité sur votre cluster EKS, vérifiez que votre AWS compte dispose d'un quota de processeur virtuel suffisant pour les familles d'instances GPU que vous prévoyez d'utiliser. Sans quotas adéquats, Karpenter NodePools, EKS Auto Mode Provisioning et les groupes de nœuds EKS ne pourront pas lancer de nœuds de calcul accéléré, quelle que soit l'option d'achat sélectionnée.

AWS applique des quotas de processeurs virtuels distincts par famille d'instances et par modèle d'achat. Consultez les quotas de type d'instance Amazon EC2 pour comprendre les quotas par défaut pour les instances de calcul accéléré.

Ces quotas sont basés sur le nombre de processeurs virtuels, et non sur le nombre d'instances. Par exemple, le lancement de 10 instances p6-b300.48xlarge nécessite 1 920 vCPU (10 × 192). Les quotas de GPU par défaut sont souvent définis sur 0 pour les nouveaux comptes. Les demandes sont donc augmentées avant de tenter de déployer des instances.

Si vous rencontrez des limites de quota lors de la création de réservations par blocs de capacité, du lancement d' On-Demand instances ou de la soumission de demandes ponctuelles, contactez le AWS support ou l'équipe chargée de votre AWS compte pour discuter de vos besoins et explorer les options permettant de garantir la capacité de calcul accélérée qui répond le mieux à vos besoins.

Utiliser les options d'achat EC2 avec Amazon EKS

Après avoir sélectionné une option d'achat pour le calcul accéléré EC2, configurez votre cluster Amazon EKS pour utiliser cette capacité. Amazon EKS propose trois méthodes de provisionnement, chacune présentant un équilibre différent entre contrôle et automatisation :

  • Amazon EKS Auto Mode  : calcul AWS géré qui provisionne, dimensionne et corrige automatiquement les nœuds. Utilise Karpenter intégré pour le provisionnement et le système d'exploitation Bottlerocket avec pilotes NVIDIA et plug-ins de périphériques inclus. Idéal lorsque vous recherchez une infrastructure gérée avec un minimum de frais d'exploitation. Prend en charge le provisionnement de capacité statique et dynamique.

  • Karpenter (autogéré)  : projet open source en amont que vous installez et exploitez dans votre cluster Amazon EKS. Fournit le même modèle de provisionnement que le mode automatique EKS et vous avez un contrôle total sur le système d'exploitation, les AMI, le réglage du noyau et le cycle de vie des nœuds. Idéal pour les équipes de plateformes dont les exigences ne sont pas proposées par le mode automatique EKS dès le départ.

  • Groupes de nœuds (gérés et autogérés)  : soutenus par les groupes EC2 Auto Scaling (ASG), la capacité est définie à l'avance via un modèle de lancement EC2. Idéal pour les équipes de plateforme disposant de groupes de nœuds gérés ou autogérés par EKS existants et de charges de travail de formation avec un dimensionnement prévisible avec une empreinte de calcul accélérée statique connue.

Les pages ci-dessous décrivent en détail chaque option de provisionnement.

Stratégie mixte : combiner les options d'achat

Il est courant de combiner plusieurs options d'achat de capacité au sein d'un seul cluster Amazon EKS. Cette approche optimise simultanément les coûts, la disponibilité et la fiabilité en acheminant différentes charges de travail vers la source de capacité la plus appropriée. Les clients mettent en œuvre cette stratégie hybride en utilisant l'une des trois approches de gestion informatique d'EKS (EKS Auto Mode, Karpenter ou Node Groups) ou en les combinant au sein d'un même cluster.

EKS Auto Mode et Karpenter provisionnent toujours la capacité réservée (ODCR et blocs de capacité) en premier, puis Spot ou. On-Demand Vous pouvez associer cette priorité de provisionnement des instances en planifiant vos charges de travail critiques sur la capacité réservée et vos charges de travail flexibles sur Spot ou sur des instances. On-Demand Vous contrôlez le routage de la charge de travail grâce à des primitives de Kubernetes-native planification nodeSelector : vous ciblez un type de capacité spécifique, les teintes et les tolérances isolent les nœuds GPU NVIDIA ou AWS Trainium et topologySpreadConstraints répartissez les charges de travail entre les zones de disponibilité pour une haute disponibilité.

Un cluster Amazon EKS bien conçu organise le calcul accéléré NodePools ou les groupes de nœuds en deux catégories, Reserved et Burst, chacune correspondant aux modèles de charge de travail les mieux adaptés à la stratégie de capacité. Un exemple est décrit ci-dessous.

  • Capacité réservée  : un groupe de nœuds gpu-reserved NodePool ou effectue une inférence de production et planifie une formation à grande échelle sur la capacité réservée (ODCR et blocs de capacité) pour les SLA-bound services et les tâches planifiées à forte intensité de calcul. Ce NodePool groupe de nœuds sert aux charges de travail d'inférence et de production : points de terminaison d'inférence en temps réel, diffusion de modèles de production et applications critiques nécessitant une disponibilité permanente du GPU avec des performances prévisibles. Il prend également en charge les tâches planifiées à forte intensité de calcul : formation distribuée planifiée, expériences de réglage à grande échelle, projets de recherche limités dans le temps et toute charge de travail dont vous connaissez l'heure de début et la durée à l'avance.

  • Capacité de rafale  : un groupe de nœuds gpu-burst NodePool ou gère les expériences, les charges de travail ad hoc et le traitement par lots. Il utilise les instances Spot comme type de capacité principal avec option de On-Demand repli. Cette combinaison maximise les économies de coûts pour les charges de travail tolérantes aux pannes et garantit la capacité lorsque Spot n'est pas disponible. Ce NodePool groupe de nœuds sert à l'inférence hors ligne par lots, aux pipelines de prétraitement des données, aux tâches d'évaluation de modèles, au développement et au prototypage, à la mise à l'échelle d'inférence imprévisible, aux sessions de débogage de courte durée et à toute charge de travail qui implémente des points de contrôle et peut gérer des interruptions ponctuelles ou qui ne justifie pas une réservation mais ne peut pas attendre les fenêtres réservées. Les charges de travail sur ce groupe de nœuds NodePool ou sur ce groupe de nœuds mettent en œuvre des points de contrôle et un arrêt progressif pour gérer la perte de nœuds dans la fenêtre d'interruption ponctuelle de 2 minutes.

Spécifiez le type de capacité souhaité pour les charges de travail à l'aide de NodeSelector :. karpenter.sh/capacity-type: [spot, on-demand, reserved] Weight-based le provisioning permet de faire évoluer le cluster de manière efficace dans tous les pools de capacités. Grâce à cette architecture, vous pouvez exécuter diverses AI/ML charges de travail, des ordinateurs portables expérimentaux aux inférences de production, au sein d'un seul cluster Amazon EKS, tout en optimisant les coûts.