Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Behebung von Problemen in Clustern mit AWS Batch Integration
Dieser Abschnitt enthält mögliche Tipps zur Problembehandlung bei Clustern mit AWS Batch Scheduler-Integration, insbesondere bei Problemen mit Kopfknoten, Rechenproblemen, Jobausfällen und Timeout-Fehlern.
Themen
Probleme mit dem Head-Node
Sie können Probleme bei der Einrichtung von Kopfknoten auf die gleiche Weise wie bei einem Slurm Cluster beheben (mit Ausnahme Slurm bestimmter Protokolle). Weitere Informationen zu diesen Problemen finden Sie unter Hauptknoten.
Probleme bei der Datenverarbeitung
AWS Batch verwaltet die Skalierungs- und Rechenaspekte Ihrer Dienste. Wenn Sie auf Probleme im Zusammenhang mit der Datenverarbeitung stoßen, finden Sie in der Dokumentation AWS Batch zur Problembehandlung Hilfe.
Auftragsfehler
Wenn ein Job fehlschlägt, können Sie den awsbout Befehl ausführen, um die Jobausgabe abzurufen. Sie können den awsbstat Befehl auch ausführen, um einen Link zu den von Amazon gespeicherten Auftragsprotokollen abzurufen CloudWatch.
Verbindungs-Timeout bei Endpunkt-URL-Fehler
Wenn parallele Jobs mit mehreren Knoten mit einem Fehler fehlschlagen: Connect timeout on endpoint URL
-
Prüfen Sie im
awsboutAusgabeprotokoll, ob der Auftrag parallel zur Ausgabe über mehrere Knoten läuft:Detected 3/3 compute nodes. Waiting for all compute nodes to start. -
Überprüfen Sie, ob das Subnetz des Rechenknotens öffentlich ist.
Multi-node Parallele Jobs unterstützen die Verwendung öffentlicher Subnetze nicht, wenn sie in verwendet werden AWS Batch . AWS ParallelCluster Verwenden Sie ein privates Subnetz für Ihre Rechenknoten und Jobs. Weitere Informationen finden Sie im AWS Batch Benutzerhandbuch unter Überlegungen zur Rechenumgebung. Informationen zur Konfiguration eines privaten Subnetzes für Ihre Rechenknoten finden Sie unterAWS ParallelCluster mit AWS Batch Scheduler.