Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Erreur du plug-in GPU NVIDIA manquant
Le déploiement du modèle échoue en raison d'une erreur d'insuffisance graphique malgré la disponibilité de nœuds GPU. Cela se produit lorsque le plug-in de périphérique NVIDIA n'est pas installé dans le HyperPod cluster.
Message d’erreur:
0/15 nodes are available: 10 node(s) didn't match Pod's node affinity/selector, 5 Insufficient nvidia.com/gpu. preemption: 0/15 nodes are available: 10 Preemption is not helpful for scheduling, 5 No preemption victims found for incoming pod.
Cause fondamentale :
-
Kubernetes ne peut pas détecter les ressources GPU sans le plug-in de périphérique NVIDIA
-
Cela entraîne des échecs de planification pour les charges de travail du GPU
Résolution :
Installez le plug-in GPU NVIDIA en exécutant :
kubectl create -f https://raw.githubusercontent.com/NVIDIA/k8s-device-plugin/refs/tags/v0.17.1/deployments/static/nvidia-device-plugin.yml
Étapes de vérification :
-
Vérifiez l'état du déploiement du plugin :
kubectl get pods -n kube-system | grep nvidia-device-plugin -
Vérifiez que les ressources GPU sont désormais visibles :
kubectl get nodes -o=custom-columns=NAME:.metadata.name,GPU:.status.allocatable.nvidia\\.com/gpu -
Réessayez le déploiement du modèle
Note
Assurez-vous que les pilotes NVIDIA sont installés sur les nœuds GPU. L'installation du plug-in est une configuration unique par cluster. L'installation peut nécessiter des privilèges d'administrateur de cluster.