

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

# Orchestrierung von SageMaker HyperPod Clustern mit Slurm
<a name="sagemaker-hyperpod-slurm"></a>

Die Unterstützung von Slurm in SageMaker HyperPod hilft Ihnen dabei, belastbare Cluster für die Ausführung von Workloads für maschinelles Lernen (ML) und die Entwicklung hochmoderner Modelle wie Large Language Models (LLMs), Diffusionsmodelle und Foundation Models (FMs) bereitzustellen. Es beschleunigt die Entwicklung von FMs, indem undifferenzierte Schwerstarbeit beim Aufbau und der Wartung großer Rechencluster entfällt, die von Tausenden von Beschleunigern wie AWS Trainium und NVIDIA A100 und H100 Graphical Processing Units (GPUs) angetrieben werden. Wenn Beschleuniger ausfallen, erkennen die Cluster-Instances dank der Resilienzfunktionen der SageMaker HyperPod Monitore die fehlerhafte Hardware automatisch und ersetzen sie im Handumdrehen, sodass Sie sich auf die Ausführung von ML-Workloads konzentrieren können. Darüber hinaus können Sie mit der Unterstützung der Lifecycle-Konfiguration Ihre Computerumgebung an Ihre Bedürfnisse anpassen und sie mit den verteilten Amazon SageMaker AI-Trainingsbibliotheken konfigurieren, um eine optimale Leistung zu erzielen. SageMaker HyperPod AWS

**Betrieb von Clustern**

Sie können SageMaker HyperPod Cluster grafisch über die Konsolen-Benutzeroberfläche (UI) und programmgesteuert über die AWS Befehlszeilenschnittstelle (CLI) oder erstellen, konfigurieren und verwalten. AWS SDK for Python (Boto3) Mit Amazon VPC können Sie das Cluster-Netzwerk sichern und auch die Vorteile der Konfiguration Ihres Clusters mit Ressourcen in Ihrer VPC nutzen, z. B. Amazon FSx für Lustre, das den schnellsten Durchsatz bietet. Sie können Cluster-Instance-Gruppen auch unterschiedliche IAM-Rollen zuweisen und die Aktionen einschränken, die Ihre Cluster-Ressourcen und Benutzer ausführen können. Weitere Informationen hierzu finden Sie unter [SageMaker HyperPod Betrieb des Slurm-Clusters](sagemaker-hyperpod-operate-slurm.md).

**Konfigurieren der ML-Umgebung**

SageMaker HyperPod läuft[SageMaker HyperPod DLAMI](sagemaker-hyperpod-ref.md#sagemaker-hyperpod-ref-hyperpod-ami), wodurch eine ML-Umgebung auf den Clustern eingerichtet wird. HyperPod Sie können zusätzliche Anpassungen für das DLAMI konfigurieren, indem Sie Lebenszyklusskripte zur Unterstützung Ihres Anwendungsfalls bereitstellen. Weitere Informationen zum Einrichten von Lebenszyklusskripten finden Sie unter [Erste Schritte mit SageMaker HyperPod](smcluster-getting-started-slurm.md) und [Anpassen von SageMaker HyperPod Clustern mithilfe von Lebenszyklusskripten](sagemaker-hyperpod-lifecycle-best-practices-slurm.md).

**Planen von Aufträgen**

Nachdem Sie erfolgreich einen HyperPod Cluster erstellt haben, können sich Cluster-Benutzer bei den Cluster-Knoten (z. B. Head- oder Controller-Knoten, Login-Knoten und Worker-Knoten) anmelden und Jobs für die Ausführung von Machine-Learning-Workloads planen. Weitere Informationen hierzu finden Sie unter [Jobs auf SageMaker HyperPod Clustern](sagemaker-hyperpod-run-jobs-slurm.md).

**Widerstandskraft gegen Hardwareausfälle**

SageMaker HyperPod führt Integritätsprüfungen auf Clusterknoten durch und bietet eine Funktion zur automatischen Wiederaufnahme der Arbeitslast. Mit den Cluster-Resilienzfunktionen von können Sie Ihre Arbeitslast ab dem letzten Checkpoint HyperPod, den Sie gespeichert haben, fortsetzen, nachdem fehlerhafte Knoten in Clustern mit mehr als 16 Knoten durch fehlerfreie ersetzt wurden. Weitere Informationen hierzu finden Sie unter [SageMaker HyperPod Cluster-Resilienz](sagemaker-hyperpod-resiliency-slurm.md).

**Protokollieren und Verwalten von Clustern**

Sie können Kennzahlen zur SageMaker HyperPod Ressourcenauslastung und Lebenszyklusprotokolle in Amazon finden und SageMaker HyperPod Ressourcen verwalten CloudWatch, indem Sie sie taggen. Jede `CreateCluster` API-Ausführung erstellt einen eigenen Protokollstream, der im Format `<cluster-name>-<timestamp>` benannt ist. Im Protokollstream können Sie die Hostnamen, die Namen fehlgeschlagener Lebenszyklusskripte und die Ausgaben der fehlgeschlagenen Skripte wie `stdout` und `stderr` überprüfen. Weitere Informationen finden Sie unter [SageMaker HyperPod Clusterverwaltung](sagemaker-hyperpod-cluster-management-slurm.md).

**Kompatibel mit SageMaker KI-Tools **

Mithilfe von SageMaker HyperPod SageMaker KI können Sie Cluster mit AWS optimierten kollektiven Kommunikationsbibliotheken konfigurieren, wie z. B. der SMDDP-Bibliothek ([SageMaker AI Distributed Data Parallelism). ](data-parallel.md) Die SMDDP-Bibliothek implementiert den für die AWS Rechen- und Netzwerkinfrastruktur optimierten `AllGather` Betrieb für die leistungsstärksten SageMaker KI-Instanzen für maschinelles Lernen, die auf NVIDIA A100-GPUs basieren. Weitere Informationen hierzu finden Sie unter [Ausführung verteilter Trainingsworkloads mit eingeschaltetem Slurm HyperPod](sagemaker-hyperpod-run-jobs-slurm-distributed-training-workload.md).

**Platzierung der Instanz mit UltraServers **

SageMaker Die KI weist den Instanzen in Ihrem Unternehmen automatisch Jobs zu, UltraServer basierend auf einer Best-Effort-Strategie, bei der alle Instanzen in einer Instanz verwendet werden, UltraServer bevor eine andere verwendet wird. Wenn du beispielsweise 14 Instanzen anforderst und 2 UltraServers in deinem Trainingsplan hast, verwendet SageMaker KI alle Instanzen der ersten Instanz. UltraServer Wenn Sie 20 Instanzen angefordert haben und 2 UltraServers in Ihrem Trainingsplan haben, verwendet SageMaker KI in der ersten Instanz alle 17 Instanzen UltraServer und dann 3 in der zweiten UltraServer.

**Topics**
+ [Erste Schritte mit SageMaker HyperPod](smcluster-getting-started-slurm.md)
+ [SageMaker HyperPod Betrieb des Slurm-Clusters](sagemaker-hyperpod-operate-slurm.md)
+ [Anpassen von SageMaker HyperPod Clustern mithilfe von Lebenszyklusskripten](sagemaker-hyperpod-lifecycle-best-practices-slurm.md)
+ [Benutzerverwaltung auf einem SageMaker HyperPod Slurm-Cluster](sagemaker-hyperpod-slurm-user-management.md)
+ [SageMaker HyperPod Unterstützung für Knoten mit mehreren Anschlüssen](sagemaker-hyperpod-multihead-slurm.md)
+ [Jobs auf SageMaker HyperPod Clustern](sagemaker-hyperpod-run-jobs-slurm.md)
+ [SageMaker HyperPod Überwachung der Cluster-Ressourcen](sagemaker-hyperpod-cluster-observability-slurm.md)
+ [SageMaker HyperPod Slurm-Cluster-Ereignisse](sagemaker-hyperpod-cluster-events-slurm-page.md)
+ [SageMaker HyperPod Cluster-Resilienz](sagemaker-hyperpod-resiliency-slurm.md)
+ [Kontinuierliche Bereitstellung für einen verbesserten Cluster-Betrieb mit Slurm](sagemaker-hyperpod-scaling-slurm.md)
+ [SageMaker HyperPod Clusterverwaltung](sagemaker-hyperpod-cluster-management-slurm.md)
+ [SageMaker HyperPod Häufig gestellte Fragen](sagemaker-hyperpod-faq-slurm.md)