Unterstützung für die Verbesserung dieser Seite beitragen
Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Um zu diesem Benutzerhandbuch beizutragen, wählen Sie den GitHub Link Diese Seite bearbeiten unter, der sich im rechten Bereich jeder Seite befindet.
Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Amazon EKS-Cluster für AI/ML Workloads einrichten
Tipp
Registrieren Sie sich
In diesem Abschnitt erfahren Sie, wie Sie einen Amazon EKS-Cluster erstellen, der für die Ausführung von Inferenz-Workloads bereit ist, einschließlich der Datenverarbeitung mit GPUs, des Monitoring-Stacks und des Amazon S3-Speichers für Modellgewichte sowie der erforderlichen AWS IAM-Berechtigungen.
Übersicht über die Architektur
Das Setup erstellt die folgende Infrastruktur:
-
EKS-Cluster mit GPU-enabled Knoten — Ein Cluster Karpenter-managed NodePool , der G-family GPU-Instances mithilfe von Spot-Kapazität und On-Demand Fallback dynamisch bereitstellt.
-
Monitoring-Stack — Prometheus entfernt Cluster-, Knoten- und GPU-Metriken und schreibt sie per Fernzugriff in Amazon Managed Service for Prometheus (AMP). Grafana bietet Dashboards zur Visualisierung. Der NVIDIA DCGM Exporter fügt GPU-specific Metriken wie Auslastung, Speicher, Temperatur, Stromverbrauch, NVLink-Bandbreite und Tensoraktivität hinzu.
-
Modellgewichte S3-Bucket — Ein Amazon S3-Bucket zum Speichern von Modellgewichten mit einer EKS Pod Identity-Verknüpfung, die den Zugriff auf Workload-Pods gewährt. read/write
Optionen für die Cluster-Datenverarbeitung
Die Anleitung bietet zwei Möglichkeiten für die Einrichtung Ihres Clusters. Wählen Sie einen aus und folgen Sie ihm konsequent in allen Schritten.
-
EKS-Automatikmodus — Mit einem einzigen Befehl wird ein EKS-Cluster mit aktiviertem EKS-Automatikmodus bereitgestellt. Alle erforderlichen Komponenten sind sofort einsatzbereit, einschließlich der Karpenter-based automatischen Skalierung, des EKS-Node-Monitoring-Agenten, schneller Container-Pulls mit SOCI und des NVIDIA-Geräte-Plug-ins.
-
Self-managed Karpenter — Du installierst und konfigurierst jede Komponente explizit: Karpenter via
eksctl, automatische Node-Reparatur über sein Feature Gate, den EKS Node Monitoring Agent als EKS-Add-on und das NVIDIA-Geräte-Plugin über Helm. Sie erstellen auch eine benutzerdefinierte VersionEC2NodeClass, die die EKS-optimized NVIDIA AL2023 AMIs verwendet und SOCI konfiguriert.
Was wirst du einrichten
| Schritt | Description |
|---|---|
|
Cluster erstellen |
Stellen Sie die EKS-Steuerungsebene und die Komponenten auf Clusterebene bereit, die für GPU-Workloads benötigt werden. |
|
Erstellen Sie dynamisch bereitgestellte GPU-Knoten |
Definieren Sie eine dynamische GPU NodePool , die G-family GPU-Instanzen bereitstellt, wenn Workloads geplant werden. |
|
Testen Sie mit einem Beispiel-Pod |
Validieren Sie das Setup von Anfang bis Ende, indem Sie einen |
|
Reservierte Kapazität hinzufügen (optional) |
Fügen Sie Ihrem Formular „Reserved First“ mit Fallback eine On-Demand NodeClass Kapazitätsreservierung (ODCR) hinzu. Spot/On-Demand |
|
Installieren Sie die Überwachung |
Implementieren Sie Kube-Prometheus-Stack (Prometheus + Grafana) mit Remote-Write auf AMP sowie den NVIDIA DCGM Exporter für GPU-Metriken. |
|
Erstellen Sie einen Bucket mit Modellgewichten |
Erstellen Sie einen S3-Bucket und konfigurieren Sie EKS Pod Identity, damit Workload-Pods Modellgewichte lesen und schreiben können. |
Erste Schritte
Eine schrittweise Anleitung zur Verwendung der AWS CLI finden Sie unterAmazon EKS-Cluster für AI/ML Workloads mithilfe von CLIs einrichten. Eine schrittweise Anleitung zur Verwendung von Terraform finden Sie unter. Amazon EKS-Cluster für AI/ML Workloads mit Terraform einrichten