Contribuisci a migliorare questa pagina
Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Per contribuire a questa guida per l'utente, scegli il GitHub link Modifica questa pagina su che si trova nel riquadro destro di ogni pagina.
Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Configura il cluster Amazon EKS per i AI/ML carichi di lavoro
Suggerimento
Registrati
Questa sezione ti guida nella creazione di un cluster Amazon EKS pronto per eseguire carichi di lavoro di inferenza, tra cui l'elaborazione con GPU, lo stack di monitoraggio e lo storage Amazon S3 per i pesi dei modelli, insieme alle autorizzazioni IAM necessarie. AWS
Panoramica dell’architettura
La configurazione crea la seguente infrastruttura:
-
Cluster EKS con GPU-enabled nodi: un cluster Karpenter-managed NodePool che fornisce dinamicamente le istanze G-family GPU utilizzando la capacità Spot con fallback. On-Demand
-
Stack di monitoraggio: Prometheus analizza le metriche di cluster, nodi e GPU e le scrive in remoto su Amazon Managed Service for Prometheus (AMP). Grafana fornisce dashboard per la visualizzazione. NVIDIA DCGM Exporter aggiunge GPU-specific parametri tra cui utilizzo, memoria, temperatura, consumo energetico, larghezza di banda NVLink e attività tensoriale.
-
Model weights S3 bucket: un bucket Amazon S3 per l'archiviazione dei pesi dei modelli, con un'associazione EKS Pod Identity che consente l'accesso ai pod di carico di lavoro. read/write
Opzioni di elaborazione in cluster
La guida fornisce due percorsi per configurare il cluster. Scegline uno e seguilo costantemente in tutti i passaggi.
-
EKS Auto Mode: un singolo comando esegue il provisioning di un cluster EKS con EKS Auto Mode abilitata. Tutti i componenti necessari vengono forniti immediatamente, tra cui il Karpenter-based ridimensionamento automatico, l'agente di monitoraggio dei nodi EKS, i pull rapidi dei container con SOCI e il plug-in per i dispositivi NVIDIA.
-
Self-managed Karpenter — Ogni componente viene installato e configurato in modo esplicito: Karpenter tramite
eksctl, riparazione automatica del nodo tramite il relativo feature gate, l'agente di monitoraggio dei nodi EKS come componente aggiuntivo EKS e il plug-in del dispositivo NVIDIA tramite Helm. È inoltre possibile creare una configurazione personalizzataEC2NodeClassche utilizza le AMI NVIDIA AL2023 e configura SOCI. EKS-optimized
Cosa configurerai
| Fase | Description |
|---|---|
|
Crea un cluster |
Effettua il provisioning del piano di controllo EKS e dei componenti a livello di cluster necessari per i carichi di lavoro della GPU. |
|
Crea nodi GPU con provisioning dinamico |
Definisci una GPU dinamica che esegua il provisioning delle istanze G-family GPU NodePool man mano che i carichi di lavoro vengono pianificati. |
|
Esegui il test con un pod di esempio |
Convalida la configurazione end-to-end eseguendo un |
|
Aggiungi capacità riservata (opzionale) |
Allega una prenotazione On-Demand di capacità (ODCR) al modulo riservato NodeClass per primo con riserva. Spot/On-Demand |
|
Monitoraggio dell'installazione |
Implementa kube-prometheus-stack (Prometheus + Grafana) con scrittura remota su AMP, oltre alle metriche NVIDIA DCGM Exporter for GPU. |
|
Crea un bucket di pesi del modello |
Crea un bucket S3 e configura EKS Pod Identity in modo che i workload pod possano leggere e scrivere i pesi dei modelli. |
Nozioni di base
Per istruzioni dettagliate sull'uso della CLI, consulta. AWS Configura il cluster Amazon EKS per i AI/ML carichi di lavoro utilizzando le CLI Per istruzioni dettagliate sull'uso di Terraform, consulta. Configura il cluster Amazon EKS per i AI/ML carichi di lavoro utilizzando Terraform