Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Osservabilità di cluster e attività
Esistono due opzioni per il monitoraggio dei cluster: SageMaker HyperPod
Il componente aggiuntivo per l' SageMaker HyperPod osservabilità: SageMaker HyperPod fornisce una dashboard completa e pronta all'uso che fornisce informazioni dettagliate sulle attività di sviluppo del modello di base (FM) e sulle risorse dei cluster. Questa soluzione unificata di osservabilità pubblica automaticamente le metriche chiave in Servizio gestito da Amazon per Prometheus e le visualizza nelle dashboard di Grafana gestito da Amazon. Le dashboard sono ottimizzate specificamente per lo sviluppo di FM con una copertura approfondita dello stato di integrità dell’hardware, dell’utilizzo delle risorse e delle prestazioni a livello di attività. Con questo componente aggiuntivo, puoi consolidare i dati sullo stato e sulle prestazioni di NVIDIA DCGM, esportatori di nodi Kubernetes a livello di istanza, Elastic Fabric Adapter, file system integrati, API Kubernetes, Kueue e task operator. SageMaker HyperPod
Amazon Insights: Amazon CloudWatch Insights raccoglie metriche per le risorse di calcolo, come CPU, CloudWatch memoria, disco e rete. Container Insights fornisce inoltre informazioni diagnostiche, ad esempio errori di riavvio del container, che consentono di isolare i problemi e risolverli in modo rapido. Puoi anche impostare CloudWatch allarmi sulle metriche raccolte da Container Insights.