View a markdown version of this page

HyperPod funzionalità di allenamento senza checkpoint - Amazon SageMaker AI

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

HyperPod funzionalità di allenamento senza checkpoint

Consulta le pagine seguenti per conoscere le funzionalità di formazione di checkpointless training.

Repository di formazione Amazon SageMaker HyperPod checkpointless

HyperPod checkpointless training accelera il ripristino dai guasti dei cluster in ambienti di formazione distribuiti su larga scala attraverso ottimizzazioni a livello di framework. Queste ottimizzazioni vengono fornite tramite un'immagine di base del contenitore che include miglioramenti avanzati dell'inizializzazione NCCL, ottimizzazioni del caricamento dei dati e componenti di ripristino in corso e senza checkpoint. Il pacchetto di formazione HyperPod checkpointless si basa su queste fondamenta.

L'allenamento Checkpointless è abilitato tramite tre percorsi di ottimizzazione eseguiti in concerto:

  • Miglioramenti all'inizializzazione della comunicazione (NCCL e Gloo): elimina i colli di bottiglia nelle comunicazioni decentralizzando le informazioni relative a ranking, peer e ring (riquadro rosso in basso).

  • Ottimizzazioni del caricamento dei dati: riduci il tempo necessario per fornire il primo batch di dati durante le operazioni di riavvio (riquadri arancioni in basso).

  • Riduzione dei costi di riavvio del programma: riduci al minimo i costi di riavvio e consenti un rifornimento senza intoppi attraverso il ripristino del processo su nodi integri (riquadri blu e verdi in basso).

Due GPU eseguono le fasi di addestramento del modello in parallelo, alimentando i dati in ogni fase e salvando periodicamente i checkpoint.