Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Problembehandlung im Netzwerk
Dieser Abschnitt enthält einen Tipp zur Problembehandlung, wenn Sie auf Netzwerkprobleme stoßen, insbesondere wenn es sich um ein Problem mit einem Cluster in einem einzelnen öffentlichen Subnetz handelt.
Probleme mit Clustern in einem einzelnen öffentlichen Subnetz
Suchen Sie in AWS ParallelCluster 3.16.0 und höher nach einem /var/log/chef-client.log ausgefallenen Rechenknoten. Wenn Sie einen Fehler ähnlich dem folgenden finden, konnte der Knoten DynamoDB während des Bootstraps nicht erreichen:
INFO: Retrying execution of ruby_block[retrieve compute node info], 0 attempt left ================================================================================ Error executing action `run` on resource 'ruby_block[retrieve compute node info]' ================================================================================ RuntimeError ------------ Failed to query DynamoDB for compute node info: the aws cli call did not return in time and was terminated. This usually means the compute node cannot reach DynamoDB. If the compute subnet has no internet egress (NAT/IGW), ensure a DynamoDB VPC gateway endpoint is configured and attached to the subnet's route table.
In AWS ParallelCluster Versionen vor 3.16.0 konnten Rechenknoten während des Bootstraps stillschweigend hängen, anstatt schnell auszufallen. Suchen Sie cloud-init-output.log auf einem Rechenknoten nach einem Protokolleintrag wie dem folgenden, der darauf hinweist, dass der Knoten beim Abrufen von Informationen von DynamoDB nicht weiterkommt:
ruby_block[retrieve compute node info] action run[2022-03-11T17:47:11+00:00] INFO: Processing ruby_block[retrieve compute node info] action run (aws-parallelcluster-slurm::init line 31)
Die häufigste Ursache ist ein fehlender DynamoDB-VPC-Endpunkt, da während des Bootstraps Rechenknoteninformationen aus DynamoDB AWS ParallelCluster gelesen werden. Die vollständige Liste der erforderlichen Endpunkte finden Sie unter. AWS ParallelCluster in einem einzigen Subnetz ohne Internetzugang
Um das Problem zu lösen, fügen Sie den fehlenden VPC-Endpunkt (normalerweise DynamoDB) zur Routing-Tabelle des Compute-Subnetzes hinzu. Wenn der Cluster in den geschützten Modus übergegangen ist, finden Sie Informationen Slurm geschützter Cluster-Modus zur Wiederherstellung unter.