Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Orchestrazione SageMaker HyperPod dei cluster con Slurm
Il supporto di Slurm in ti SageMaker HyperPod aiuta a fornire cluster resilienti per l'esecuzione di carichi di lavoro di machine learning (ML) e lo sviluppo di modelli all'avanguardia come i Large Language Models (LLM), i modelli di diffusione e i Foundation Models (FM). Accelera lo sviluppo di FM eliminando gli oneri indifferenziati legati alla creazione e alla manutenzione di cluster di elaborazione su larga scala alimentati da migliaia di acceleratori come AWS Trainium e le unità di elaborazione grafica (GPU) NVIDIA A100 e H100. Quando gli acceleratori si guastano, le funzionalità di resilienza dei SageMaker HyperPod monitor e delle istanze del cluster rilevano e sostituiscono automaticamente l'hardware difettoso in modo che tu possa concentrarti sull'esecuzione dei carichi di lavoro ML. Inoltre, con il supporto per la configurazione del ciclo di vita SageMaker HyperPod, puoi personalizzare il tuo ambiente di elaborazione per soddisfare al meglio le tue esigenze e configurarlo con le librerie di formazione distribuite di Amazon SageMaker AI per ottenere prestazioni ottimali su. AWS
Gestione dei cluster
Puoi creare, configurare e gestire SageMaker HyperPod i cluster graficamente tramite l'interfaccia utente (UI) della console e programmaticamente tramite l'interfaccia a riga di comando (CLI) o. AWS AWS SDK for Python (Boto3) Con Amazon VPC puoi proteggere la rete del cluster e sfruttare allo stesso tempo la configurazione del cluster con le risorse nel tuo VPC, ad esempio Amazon FSx per Lustre, che offre il throughput più veloce. Puoi anche assegnare diversi ruoli IAM ai gruppi di istanze del cluster e limitare le azioni che le risorse e gli utenti del cluster possono eseguire. Per ulteriori informazioni, consulta SageMaker HyperPod Operazioni del cluster Slurm.
Configurazione dell’ambiente di ML
SageMaker HyperPod runsSageMaker HyperPod DLAMI, che configura un ambiente ML sui cluster. HyperPod Puoi configurare personalizzazioni aggiuntive per DLAMI fornendo script del ciclo di vita per supportare il tuo caso d’uso. Per ulteriori informazioni su come configurare gli script del ciclo di vita, consulta Guida introduttiva con SageMaker HyperPod e Personalizzazione dei SageMaker HyperPod cluster utilizzando script del ciclo di vita.
Pianificazione dei processi
Dopo aver creato correttamente un HyperPod cluster, gli utenti del cluster possono accedere ai nodi del cluster (come il nodo principale o controller, il nodo di accesso e il nodo di lavoro) e pianificare i processi per l'esecuzione di carichi di lavoro di machine learning. Per ulteriori informazioni, consulta Lavori sui SageMaker HyperPod cluster.
Resilienza contro i guasti hardware
SageMaker HyperPod esegue controlli di integrità sui nodi del cluster e fornisce una funzionalità di ripristino automatico del carico di lavoro. Con le funzionalità di resilienza del cluster di HyperPod, puoi riprendere il carico di lavoro dall'ultimo checkpoint salvato, dopo che i nodi difettosi sono stati sostituiti con quelli integri nei cluster con più di 16 nodi. Per ulteriori informazioni, consulta SageMaker HyperPod resilienza del cluster.
Registrazione di log e gestione dei cluster
Puoi trovare le metriche sull'utilizzo SageMaker HyperPod delle risorse e i log del ciclo di vita in Amazon e gestire le risorse taggandole. CloudWatch SageMaker HyperPod Ogni esecuzione dell’API CreateCluster crea un flusso di log distinto, denominato in base al formato <cluster-name>-<timestamp>. Nel flusso di log, puoi controllare i nomi degli host, il nome degli script del ciclo di vita non riusciti e gli output degli script non riusciti, ad esempio stdout e stderr. Per ulteriori informazioni, consulta SageMaker HyperPod gestione dei cluster.
SageMaker Compatibile con gli strumenti di intelligenza artificiale
Utilizzando SageMaker HyperPod, è possibile configurare i cluster con le librerie di comunicazione collettiva AWS ottimizzate offerte dall' SageMaker IA, come la libreria SageMaker AI Distributed Data Parallelism (SMDDP). La libreria SMDDP implementa il AllGather funzionamento ottimizzato per l'infrastruttura di AWS calcolo e di rete per le istanze di machine learning AI più performanti basate sulle GPU NVIDIA A100. SageMaker Per ulteriori informazioni, consulta Esecuzione di carichi di lavoro di formazione distribuiti con Slurm attivo HyperPod.
Posizionamento delle istanze con UltraServers
SageMaker L'intelligenza artificiale assegna automaticamente i lavori alle istanze all'interno dell'utente in base a una strategia UltraServer basata sul massimo impegno che prevede l'utilizzo di tutte le istanze in una UltraServer prima di utilizzarne un'altra. Ad esempio, se richiedi 14 istanze e ne hai 2 UltraServers nel tuo piano di allenamento, l' SageMaker IA utilizza tutte le istanze della prima. UltraServer Se hai richiesto 20 istanze e ne hai 2 UltraServers nel tuo piano di allenamento, l' SageMaker IA utilizzerà tutte le 17 istanze della prima UltraServer e poi ne utilizzerà 3 della seconda. UltraServer