Contribuisci a migliorare questa pagina
Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Per contribuire a questa guida per l'utente, scegli il GitHub link Modifica questa pagina su che si trova nel riquadro destro di ogni pagina.
Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Gestisci le GPU NVIDIA su Amazon EKS
Le GPU NVIDIA sono ampiamente utilizzate per l'addestramento all'apprendimento automatico, l'inferenza e i carichi di lavoro di calcolo ad alte prestazioni. Amazon EKS supporta due meccanismi per la gestione dei dispositivi GPU NVIDIA nei cluster EKS: il driver NVIDIA DRA per GPU e il plug-in per dispositivi NVIDIA Kubernetes.
Consigliamo di utilizzare i driver DRA per le nuove implementazioni con Kubernetes versioni 1.34 e successive quando si utilizza il provisioning della capacità statica in Karpenter, gruppi di nodi gestiti da EKS o nodi autogestiti. https://karpenter.sh/docs/concepts/nodepools/#static-nodepool
Per la disponibilità delle funzionalità DRA in EKS, consulta le note di rilascio per le versioni di Kubernetes per EKS. Per ulteriori informazioni sull'utilizzo del driver e del plug-in del dispositivo NVIDIA DRA con EKS, vedere. Usa il driver o il plug-in del dispositivo NVIDIA DRA su Amazon EKS
Condivisione della GPU (MIG time-slicing) &
Multi-instance GPU (MIG)
Multi-Instance La GPU (MIG) è una funzionalità hardware delle GPU NVIDIA che partiziona una singola GPU fisica in più istanze isolate. Il numero massimo di istanze dipende dalla GPU. Le GPU per data center come A100, H100, H200 e B200 supportano fino a sette istanze, mentre le GPU e D ne supportano meno. Blackwell-based g7 g7e Ogni istanza dispone di memoria, unità di elaborazione e larghezza di banda di memoria dedicate, pertanto un carico di lavoro eseguito su un'istanza non può influire su un carico di lavoro su un'altra. A differenza del time-slicing, che condivide una GPU tramite il time-multiplexing del software senza isolamento, il MIG fornisce memoria a livello hardware e isolamento dei guasti tra i pod.
Il MIG è più adatto all'inferenza multi-tenant, ai carichi di lavoro che richiedono una qualità del servizio prevedibile e agli ambienti con requisiti di conformità per una tenancy isolata dall'hardware. È disponibile sulle GPU NVIDIA Ampere (A100), Hopper (H100 e H200) e Blackwell. Sì AWS, questi sono i tipi di istanza e i tipi di istanza e P-family . Blackwell-based g7 g7e
Per ulteriori informazioni e passaggi per l'utilizzo di MIG con GPU NVIDIA ed EKS, vedere. Usa GPU multiistanza (MIG) con GPU NVIDIA su Amazon EKS
Time-slicing
Time-slicing consente a più Pod di condividere una singola GPU fisica NVIDIA configurando il plug-in del dispositivo NVIDIA o il driver DRA in modo da pubblicizzare più di uno slot programmabile per GPU. Lo scheduler Kubernetes colloca più Pod sulla stessa GPU e lo scheduler CUDA della GPU multiplexa i carichi di lavoro nel tempo.
Time-slicing è la strategia più semplice. GPU-sharing Utilizza solo software, non richiede hardware speciale e funziona su tutti i tipi di istanze GPU NVIDIA. AWS Time-slicing non offre l'isolamento della memoria o del calcolo tra Pod che condividono una GPU. È ideale per carichi di lavoro con un basso utilizzo della GPU, come i servizi di inferenza che rimangono inattivi tra le richieste o gli ambienti di sviluppo in cui più utenti condividono una GPU. Per i carichi di lavoro che richiedono memoria a livello hardware e isolamento di elaborazione, utilizza invece MIG.
Per ulteriori informazioni e passaggi per l'utilizzo del time-slicing con GPU NVIDIA ed EKS, consulta. Usa il time-slicing con le GPU NVIDIA su Amazon EKS