View a markdown version of this page

NVIDIA-GPUs auf Amazon EKS verwalten - Amazon EKS

Unterstützung für die Verbesserung dieser Seite beitragen

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Um zu diesem Benutzerhandbuch beizutragen, wählen Sie den GitHub Link Diese Seite bearbeiten unter, der sich im rechten Bereich jeder Seite befindet.

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

NVIDIA-GPUs auf Amazon EKS verwalten

NVIDIA-GPUs werden häufig für maschinelles Lernen, Inferenz und Hochleistungsrechner-Workloads verwendet. Amazon EKS unterstützt zwei Mechanismen für die Verwaltung von NVIDIA-GPU-Geräten in Ihren EKS-Clustern: den NVIDIA DRA-Treiber für GPUs und das NVIDIA Kubernetes-Geräte-Plugin.

Wir empfehlen die Verwendung von DRA-Treibern für neue Bereitstellungen mit Kubernetes-Versionen 1.34 und höher, wenn Sie die statische Kapazitätsbereitstellung in Karpenter, von EKS verwalteten Knotengruppen oder selbstverwalteten Knoten verwenden. DRA wird derzeit im EKS-Automatikmodus nicht unterstützt. Der NVIDIA DRA-Treiber ermöglicht eine flexible GPU-Zuweisung und gemeinsame Nutzung von GPUs zwischen Containern.

Informationen zur Verfügbarkeit von DRA-Funktionen in EKS finden Sie in den Versionshinweisen für Kubernetes-Versionen für EKS. Weitere Informationen zur Verwendung des NVIDIA DRA-Treibers und des Geräte-Plug-ins mit EKS finden Sie unter. Verwenden Sie den NVIDIA DRA-Treiber oder das Geräte-Plugin auf Amazon EKS

Gemeinsame Nutzung der GPU (&MIG-Timeslicing)

Multi-instance GPU (MIG)

Multi-Instance GPU (MIG) ist eine Hardwarefunktion auf NVIDIA-GPUs, die eine einzelne physische GPU in mehrere isolierte Instanzen partitioniert. Die maximale Anzahl von Instanzen hängt von der GPU ab. Rechenzentrums-GPUs wie die A100, H100, H200 und B200 unterstützen bis zu sieben Instanzen, während die Blackwell-based g7 GPUs und weniger unterstützen. g7e Jede Instanz hat dedizierten Arbeitsspeicher, Recheneinheiten und Speicherbandbreite, sodass ein Workload, der auf einer Instance ausgeführt wird, keinen Workload auf einer anderen beeinflussen kann. Im Gegensatz zum Time-Slicing, bei dem eine GPU durch Software-Zeitmultiplexing ohne Isolierung gemeinsam genutzt wird, bietet MIG Speicher auf Hardwareebene und Fehlerisolierung zwischen Pods.

MIG eignet sich am besten für Inferenzen mit mehreren Mandanten, für Workloads, die eine vorhersehbare Servicequalität erfordern, und für Umgebungen, in denen Compliance-Anforderungen für hardwareseitige Tenancy gelten. Es ist auf NVIDIA Ampere (A100), Hopper (H100 und H200) und Blackwell GPUs verfügbar. On AWS, dies sind die Instance-Typen und die P-family Instance-Typen. Blackwell-based g7 g7e

Weitere Informationen und Schritte zur Verwendung von MIG mit NVIDIA-GPUs und EKS finden Sie unterVerwenden Sie Mehrinstanz-GPUs (MIG) mit NVIDIA-GPUs auf Amazon EKS.

Time-slicing

Time-slicing ermöglicht es mehreren Pods, sich eine einzige physische NVIDIA-GPU zu teilen, indem das NVIDIA-Geräte-Plugin oder der DRA-Treiber so konfiguriert werden, dass mehr als ein planbarer Steckplatz pro GPU angekündigt wird. Der Kubernetes-Scheduler platziert mehrere Pods auf derselben GPU, und der CUDA-Scheduler der GPU multiplext die Workloads im Zeitmultiplex.

Time-slicing GPU-sharing ist die einfachste Strategie. Es verwendet nur Software, erfordert keine spezielle Hardware und funktioniert auf jedem NVIDIA-GPU-Instance-Typ AWS. Time-slicing bietet keine Speicher- oder Rechenisolierung zwischen Pods, die sich eine GPU teilen. Es eignet sich am besten für Workloads mit niedriger GPU-Auslastung, z. B. Inferenzdienste, die zwischen Anfragen inaktiv sind, oder Entwicklungsumgebungen, in denen sich mehrere Benutzer eine GPU teilen. Verwenden Sie stattdessen MIG für Workloads, die Speicher auf Hardwareebene und Rechenisolierung erfordern.

Weitere Informationen und Schritte zur Verwendung von Time-Slicing mit NVIDIA-GPUs und EKS finden Sie unter. Verwenden Sie Timeslicing mit NVIDIA-GPUs auf Amazon EKS

Topics