Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Ciclo di vita ed etichette dei nodi
Amazon SageMaker HyperPod esegue controlli approfonditi sullo stato delle istanze del cluster durante la creazione e l'aggiornamento dei HyperPod cluster prima dell'inizio del partizionamento della GPU. HyperPod L'agente di monitoraggio dello stato di salute monitora continuamente lo stato di salute delle istanze partizionate tramite GPU.
Stati di configurazione MIG
I nodi con configurazione della partizione GPU attraversano diversi stati:
-
In sospeso: il nodo viene configurato con un profilo MIG
-
Configurazione: l'operatore GPU sta applicando il partizionamento MIG
-
Operazione riuscita: il partizionamento della GPU è stato completato con successo
-
Errore durante il partizionamento della GPU
Monitoraggio degli stati dei nodi
# Check node health status kubectl get nodes -l sagemaker.amazonaws.com/node-health-status=Schedulable # Monitor MIG configuration progress kubectl get nodeNODE_NAME-o jsonpath='{.metadata.labels.nvidia\.com/mig\.config\.state}' # Check for configuration errors kubectl describe nodeNODE_NAME| grep -A 5 "Conditions:"
Etichette e macchie personalizzate
Puoi gestire la configurazione MIG con etichette e tinte personalizzate per etichettare le partizioni GPU e applicarle a più istanze:
{ "KubernetesConfig": { "Labels": { "nvidia.com/mig.config": "all-2g.10gb", "task-type": "inference", "environment": "production" }, "Taints": [ { "Key": "gpu-task", "Value": "mig-enabled", "Effect": "NoSchedule" } ] } }