Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
HyperPod verwaltetes mehrstufiges Checkpointing
In diesem Abschnitt wird erklärt, wie verwaltetes mehrstufiges Checkpointing funktioniert und welche Vorteile es für groß angelegtes Modelltraining bietet.
Das von Amazon SageMaker HyperPod verwaltete mehrstufige Checkpointing hilft Ihnen dabei, umfangreiche generative KI-Modelle effizienter zu trainieren. Es verwendet mehrere Speicherebenen, einschließlich des CPU-Speichers Ihres Clusters. Dieser Ansatz reduziert Ihre Erholungszeit und minimiert den Verlust an Trainingsfortschritten. Außerdem werden nicht ausgelastete Speicherressourcen in Ihrer Trainingsinfrastruktur genutzt.
Das verwaltete mehrstufige Checkpointing ermöglicht das Speichern von Checkpoints mit einer höheren Frequenz im Speicher. Sie werden in regelmäßigen Abständen dauerhaft gespeichert. Dadurch bleiben sowohl die Leistung als auch die Zuverlässigkeit während Ihres Trainingsprozesses erhalten.
In diesem Handbuch wird beschrieben, wie Managed Tiered Checkpointing mit PyTorch Frameworks auf Amazon EKS-Clustern eingerichtet, konfiguriert und verwendet wird. HyperPod
Wie funktioniert verwaltetes mehrstufiges Checkpointing
Managed Tiered Checkpointing verwendet einen mehrstufigen Speicheransatz. Der CPU-Speicher dient als primäre Ebene zum Speichern von Modell-Checkpoints. Sekundäre Stufen umfassen persistente Speicheroptionen wie Amazon S3.
Wenn Sie einen Checkpoint speichern, speichert das System ihn im zugewiesenen Speicherplatz auf Ihren Clusterknoten. Er repliziert automatisch Daten zwischen benachbarten Rechenknoten, um die Zuverlässigkeit zu erhöhen. Diese Replikationsstrategie schützt vor Ausfällen einzelner oder mehrerer Knoten und bietet gleichzeitig schnellen Zugriff für Wiederherstellungsvorgänge.
Das System speichert außerdem regelmäßig Checkpoints entsprechend Ihrer Konfiguration im persistenten Speicher. Dies gewährleistet eine langfristige Haltbarkeit Ihres Trainingsfortschritts.
Zu den wichtigsten Komponenten gehören:
-
Speicherverwaltungssystem: Ein Speicherverwaltungs-Daemon, der disaggregierten Speicher als Service für Checkpoint-Speicher bereitstellt
-
HyperPod Python-Bibliothek: Stellt eine Schnittstelle zu den disaggregierten Speicher-APIs bereit und bietet Hilfsprogramme zum Speichern, Laden und Verwalten von Checkpoints auf mehreren Ebenen
-
Checkpoint-Replikation: Aus Gründen der Fehlertoleranz werden Checkpoints automatisch über mehrere Knoten hinweg repliziert
Das System lässt sich durch einfache API-Aufrufe nahtlos in PyTorch Trainingsschleifen integrieren. Es erfordert nur minimale Änderungen an Ihrem vorhandenen Code.
Vorteile
Das verwaltete mehrstufige Checkpointing bietet mehrere Vorteile für das Training von Modellen in großem Maßstab:
-
Verbesserte Benutzerfreundlichkeit: Verwaltet die Speicherung, Replikation, Persistenz und Wiederherstellung von Checkpoints
-
Schnellere Checkpoint-Operationen: Der Memory-based Speicher bietet im Vergleich zu festplattenbasierten Checkpoints schnellere Speicher- und Ladezeiten, was zu einer schnelleren Wiederherstellung führt
-
Fehlertoleranz: Die automatische knotenübergreifende Checkpoint-Replikation schützt vor Ausfällen von Hardwareknoten
-
Minimale Codeänderungen: Die einfache API-Integration erfordert nur geringfügige Änderungen an vorhandenen Trainingsskripten
-
Verbesserter Trainingsdurchsatz: Der geringere Aufwand an Checkpoints bedeutet, dass mehr Zeit für das eigentliche Training aufgewendet wird