Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Osservabilità per il SageMaker HyperPod cluster Amazon orchestrato da Amazon EKS
Per ottenere un'osservabilità completa nelle risorse e nei componenti software del tuo cluster Amazon SageMaker HyperPod (SageMaker HyperPod), integra il cluster con Amazon CloudWatch Container Insights, Amazon Managed Service for Prometheus e Amazon Managed Grafana. https://docs.aws.amazon.com/grafana/latest/userguide/what-is-Amazon-Managed-Service-Grafana.html Questi strumenti forniscono visibilità sull’integrità del cluster, sulle metriche delle prestazioni e sull’utilizzo delle risorse.
L'integrazione con Amazon Managed Service for Prometheus consente l'esportazione di metriche relative alle risorse del HyperPod cluster, fornendo informazioni dettagliate sulle loro prestazioni, utilizzo e integrità. L’integrazione con Grafana gestito da Amazon consente la visualizzazione di queste metriche attraverso varie dashboard Grafana che offrono un’interfaccia intuitiva per il monitoraggio e l’analisi del comportamento del cluster. Sfruttando questi servizi, ottieni una visione centralizzata e unificata del tuo HyperPod cluster, facilitando il monitoraggio proattivo, la risoluzione dei problemi e l'ottimizzazione dei carichi di lavoro di formazione distribuiti.
Nota
Mentre CloudWatch Amazon Managed Service for Prometheus e Amazon Managed Grafana si concentrano su metriche operative (ad esempio, integrità del sistema, prestazioni lavorative di formazione), i report sull' SageMaker HyperPod utilizzo integrano la governance delle attività per fornire informazioni finanziarie e sulla responsabilità delle risorse. SageMaker HyperPod governance delle attività Questi report monitorano:
-
Utilizzo del calcolo (ore principali) in tutto GPU/CPU/Neuron namespaces/teams
-
Attribuzione dei costi per le risorse allocate e quelle prese in prestito
-
Tendenze cronologiche (fino a 180 giorni) per audit e ottimizzazione
Per ulteriori informazioni sulla configurazione e la generazione di report sull'utilizzo, vedere Reporting Compute Usage in. HyperPod
Suggerimento
Per trovare esempi e soluzioni pratiche, consulta anche la sezione
Procedi con i seguenti argomenti per configurare l'osservabilità dei SageMaker HyperPod cluster.