View a markdown version of this page

Configura il cluster Amazon EKS per i AI/ML carichi di lavoro - Amazon EKS

Contribuisci a migliorare questa pagina

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

Per contribuire a questa guida per l'utente, scegli il GitHub link Modifica questa pagina su che si trova nel riquadro destro di ogni pagina.

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

Configura il cluster Amazon EKS per i AI/ML carichi di lavoro

Suggerimento

Registrati per i prossimi workshop Amazon EKS. AI/ML

Questa sezione ti guida nella creazione di un cluster Amazon EKS pronto per eseguire carichi di lavoro di inferenza, tra cui l'elaborazione con GPU, lo stack di monitoraggio e lo storage Amazon S3 per i pesi dei modelli, insieme alle autorizzazioni IAM necessarie. AWS

Panoramica dell’architettura

La configurazione crea la seguente infrastruttura:

  • Cluster EKS con GPU-enabled nodi: un cluster Karpenter-managed NodePool che fornisce dinamicamente le istanze G-family GPU utilizzando la capacità Spot con fallback. On-Demand

  • Stack di monitoraggio: Prometheus analizza le metriche di cluster, nodi e GPU e le scrive in remoto su Amazon Managed Service for Prometheus (AMP). Grafana fornisce dashboard per la visualizzazione. NVIDIA DCGM Exporter aggiunge GPU-specific parametri tra cui utilizzo, memoria, temperatura, consumo energetico, larghezza di banda NVLink e attività tensoriale.

  • Model weights S3 bucket: un bucket Amazon S3 per l'archiviazione dei pesi dei modelli, con un'associazione EKS Pod Identity che consente l'accesso ai pod di carico di lavoro. read/write

Opzioni di elaborazione in cluster

La guida fornisce due percorsi per configurare il cluster. Scegline uno e seguilo costantemente in tutti i passaggi.

  • EKS Auto Mode: un singolo comando esegue il provisioning di un cluster EKS con EKS Auto Mode abilitata. Tutti i componenti necessari vengono forniti immediatamente, tra cui il Karpenter-based ridimensionamento automatico, l'agente di monitoraggio dei nodi EKS, i pull rapidi dei container con SOCI e il plug-in per i dispositivi NVIDIA.

  • Self-managed Karpenter — Ogni componente viene installato e configurato in modo esplicito: Karpenter tramiteeksctl, riparazione automatica del nodo tramite il relativo feature gate, l'agente di monitoraggio dei nodi EKS come componente aggiuntivo EKS e il plug-in del dispositivo NVIDIA tramite Helm. È inoltre possibile creare una configurazione personalizzata EC2NodeClass che utilizza le AMI NVIDIA AL2023 e configura SOCI. EKS-optimized

Cosa configurerai

Fase Description

Crea un cluster

Effettua il provisioning del piano di controllo EKS e dei componenti a livello di cluster necessari per i carichi di lavoro della GPU.

Crea nodi GPU con provisioning dinamico

Definisci una GPU dinamica che esegua il provisioning delle istanze G-family GPU NodePool man mano che i carichi di lavoro vengono pianificati.

Esegui il test con un pod di esempio

Convalida la configurazione end-to-end eseguendo un nvidia-smi pod che attivi Karpenter per eseguire il provisioning di un nodo. GPU-enabled

Aggiungi capacità riservata (opzionale)

Allega una prenotazione On-Demand di capacità (ODCR) al modulo riservato NodeClass per primo con riserva. Spot/On-Demand

Monitoraggio dell'installazione

Implementa kube-prometheus-stack (Prometheus + Grafana) con scrittura remota su AMP, oltre alle metriche NVIDIA DCGM Exporter for GPU.

Crea un bucket di pesi del modello

Crea un bucket S3 e configura EKS Pod Identity in modo che i workload pod possano leggere e scrivere i pesi dei modelli.

Nozioni di base

Per istruzioni dettagliate sull'uso della CLI, consulta. AWS Configura il cluster Amazon EKS per i AI/ML carichi di lavoro utilizzando le CLI Per istruzioni dettagliate sull'uso di Terraform, consulta. Configura il cluster Amazon EKS per i AI/ML carichi di lavoro utilizzando Terraform