Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Résolution des problèmes de réseau
Cette section fournit des conseils de dépannage lorsque vous rencontrez des problèmes de réseau, en particulier lorsqu'il s'agit d'un problème de cluster dans un seul sous-réseau public.
Problèmes liés au regroupement dans un seul sous-réseau public
Dans la version AWS ParallelCluster 3.16.0 et les versions ultérieures, vérifiez si un /var/log/chef-client.log nœud de calcul a échoué. Si vous trouvez une erreur similaire à la suivante, cela signifie que le nœud n'a pas pu atteindre DynamoDB lors de l'initialisation :
INFO: Retrying execution of ruby_block[retrieve compute node info], 0 attempt left ================================================================================ Error executing action `run` on resource 'ruby_block[retrieve compute node info]' ================================================================================ RuntimeError ------------ Failed to query DynamoDB for compute node info: the aws cli call did not return in time and was terminated. This usually means the compute node cannot reach DynamoDB. If the compute subnet has no internet egress (NAT/IGW), ensure a DynamoDB VPC gateway endpoint is configured and attached to the subnet's route table.
Dans AWS ParallelCluster les versions antérieures à 3.16.0, les nœuds de calcul pouvaient se bloquer silencieusement pendant le démarrage au lieu de tomber en panne rapidement. Recherchez cloud-init-output.log sur un nœud de calcul une entrée de journal comme celle ci-dessous, qui indique que le nœud est bloqué en train de récupérer des informations depuis DynamoDB :
ruby_block[retrieve compute node info] action run[2022-03-11T17:47:11+00:00] INFO: Processing ruby_block[retrieve compute node info] action run (aws-parallelcluster-slurm::init line 31)
La cause la plus courante est l'absence d'un point de terminaison DynamoDB VPC, car il AWS ParallelCluster lit les informations du nœud de calcul depuis DynamoDB lors de l'initialisation. Pour la liste complète des points de terminaison requis, consultezAWS ParallelCluster dans un seul sous-réseau sans accès à Internet.
Pour résoudre ce problème, ajoutez le point de terminaison VPC manquant (généralement DynamoDB) à la table de routage du sous-réseau de calcul. Si le cluster est passé en mode protégé, consultez Slurm mode protégé par cluster la procédure de restauration.