View a markdown version of this page

Amazon EKS-Cluster für AI/ML Workloads einrichten - Amazon EKS

Unterstützung für die Verbesserung dieser Seite beitragen

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Um zu diesem Benutzerhandbuch beizutragen, wählen Sie den GitHub Link Diese Seite bearbeiten unter, der sich im rechten Bereich jeder Seite befindet.

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Amazon EKS-Cluster für AI/ML Workloads einrichten

Tipp

Registrieren Sie sich für bevorstehende Amazon AI/ML EKS-Workshops.

In diesem Abschnitt erfahren Sie, wie Sie einen Amazon EKS-Cluster erstellen, der für die Ausführung von Inferenz-Workloads bereit ist, einschließlich der Datenverarbeitung mit GPUs, des Monitoring-Stacks und des Amazon S3-Speichers für Modellgewichte sowie der erforderlichen AWS IAM-Berechtigungen.

Übersicht über die Architektur

Das Setup erstellt die folgende Infrastruktur:

  • EKS-Cluster mit GPU-enabled Knoten — Ein Cluster Karpenter-managed NodePool , der G-family GPU-Instances mithilfe von Spot-Kapazität und On-Demand Fallback dynamisch bereitstellt.

  • Monitoring-Stack — Prometheus entfernt Cluster-, Knoten- und GPU-Metriken und schreibt sie per Fernzugriff in Amazon Managed Service for Prometheus (AMP). Grafana bietet Dashboards zur Visualisierung. Der NVIDIA DCGM Exporter fügt GPU-specific Metriken wie Auslastung, Speicher, Temperatur, Stromverbrauch, NVLink-Bandbreite und Tensoraktivität hinzu.

  • Modellgewichte S3-Bucket — Ein Amazon S3-Bucket zum Speichern von Modellgewichten mit einer EKS Pod Identity-Verknüpfung, die den Zugriff auf Workload-Pods gewährt. read/write

Optionen für die Cluster-Datenverarbeitung

Die Anleitung bietet zwei Möglichkeiten für die Einrichtung Ihres Clusters. Wählen Sie einen aus und folgen Sie ihm konsequent in allen Schritten.

  • EKS-Automatikmodus — Mit einem einzigen Befehl wird ein EKS-Cluster mit aktiviertem EKS-Automatikmodus bereitgestellt. Alle erforderlichen Komponenten sind sofort einsatzbereit, einschließlich der Karpenter-based automatischen Skalierung, des EKS-Node-Monitoring-Agenten, schneller Container-Pulls mit SOCI und des NVIDIA-Geräte-Plug-ins.

  • Self-managed Karpenter — Du installierst und konfigurierst jede Komponente explizit: Karpenter viaeksctl, automatische Node-Reparatur über sein Feature Gate, den EKS Node Monitoring Agent als EKS-Add-on und das NVIDIA-Geräte-Plugin über Helm. Sie erstellen auch eine benutzerdefinierte VersionEC2NodeClass, die die EKS-optimized NVIDIA AL2023 AMIs verwendet und SOCI konfiguriert.

Was wirst du einrichten

Schritt Description

Cluster erstellen

Stellen Sie die EKS-Steuerungsebene und die Komponenten auf Clusterebene bereit, die für GPU-Workloads benötigt werden.

Erstellen Sie dynamisch bereitgestellte GPU-Knoten

Definieren Sie eine dynamische GPU NodePool , die G-family GPU-Instanzen bereitstellt, wenn Workloads geplant werden.

Testen Sie mit einem Beispiel-Pod

Validieren Sie das Setup von Anfang bis Ende, indem Sie einen nvidia-smi Pod ausführen, der Karpenter veranlasst, einen GPU-enabled Knoten bereitzustellen.

Reservierte Kapazität hinzufügen (optional)

Fügen Sie Ihrem Formular „Reserved First“ mit Fallback eine On-Demand NodeClass Kapazitätsreservierung (ODCR) hinzu. Spot/On-Demand

Installieren Sie die Überwachung

Implementieren Sie Kube-Prometheus-Stack (Prometheus + Grafana) mit Remote-Write auf AMP sowie den NVIDIA DCGM Exporter für GPU-Metriken.

Erstellen Sie einen Bucket mit Modellgewichten

Erstellen Sie einen S3-Bucket und konfigurieren Sie EKS Pod Identity, damit Workload-Pods Modellgewichte lesen und schreiben können.

Erste Schritte

Eine schrittweise Anleitung zur Verwendung der AWS CLI finden Sie unterAmazon EKS-Cluster für AI/ML Workloads mithilfe von CLIs einrichten. Eine schrittweise Anleitung zur Verwendung von Terraform finden Sie unter. Amazon EKS-Cluster für AI/ML Workloads mit Terraform einrichten