Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
CloudWatch soluzione: carico di lavoro della GPU NVIDIA su Amazon EC2
Questa soluzione consente di configurare una raccolta di metriche pronta all'uso utilizzando CloudWatch agenti per i carichi di lavoro GPU NVIDIA in esecuzione su istanze EC2. Inoltre, consente di configurare una dashboard preconfigurata. CloudWatch Per informazioni generali su tutte le soluzioni CloudWatch di osservabilità, vedere. CloudWatch soluzioni di osservabilità
Argomenti
Requisiti
Questa soluzione è rilevante per le seguenti condizioni:
-
Calcolo: Amazon EC2
-
Supporta fino a 500 GPU su tutte le istanze EC2 in una determinata Regione AWS
-
Ultima versione dell'agente CloudWatch
-
Agente SSM installato sull'istanza EC2
-
Sull'istanza EC2 deve essere installato un driver NVIDIA. I driver NVIDIA sono preinstallati su alcune Amazon Machine Image (AMI). In caso contrario, il driver può essere installato manualmente. Per ulteriori informazioni, consulta Installazione dei driver NVIDIA sulle istanze Linux.
Nota
AWS Systems Manager (agente SSM) è preinstallato su alcune Amazon Machine Images (AMI) fornite da terze parti AWS affidabili. Se l'agente non è installato, puoi installarlo manualmente utilizzando la procedura per il tipo di sistema operativo.
Vantaggi
La soluzione offre il monitoraggio NVIDIA, fornendo approfondimenti preziosi per i seguenti casi d'uso:
-
Analisi dell'utilizzo di GPU e memoria per individuare eventuali problemi di prestazioni o la necessità di risorse aggiuntive.
-
Monitora la temperatura e il consumo energetico per assicurarti che le GPU funzionino entro limiti di sicurezza.
-
Valutazione delle prestazioni dell'encoder per i carichi di lavoro video basati su GPU.
-
Verifica che la connettività PCIe corrisponda alla generazione e alla larghezza previste.
-
Monitoraggio della velocità di clock della GPU per rilevare problemi di scalabilità e limitazione.
Di seguito sono riportati i principali vantaggi della soluzione:
-
Automatizza la raccolta delle metriche per NVIDIA utilizzando la configurazione degli CloudWatch agenti, eliminando la strumentazione manuale.
-
Fornisce una dashboard preconfigurata e consolidata per le metriche NVIDIA. CloudWatch Il pannello di controllo gestirà automaticamente le metriche delle nuove istanze NVIDIA EC2 configurate utilizzando la soluzione, anche se tali metriche non esistono quando si crea il pannello di controllo per la prima volta.
L'immagine seguente mostra un esempio di pannello di controllo per questa soluzione.
Costi
Questa soluzione crea e utilizza risorse nel tuo account. Ti verranno addebitati i costi standard di utilizzo, inclusi i seguenti:
-
Tutte le metriche raccolte dall' CloudWatch agente vengono addebitate come metriche personalizzate. Il numero di metriche utilizzate da questa soluzione dipende dal numero di host EC2.
-
Ogni host EC2 configurato per la soluzione pubblica un totale di 17 metriche per GPU.
-
-
Un pannello di controllo personalizzato.
-
Operazioni API richieste dall' CloudWatch agente per pubblicare le metriche. Con la configurazione predefinita per questa soluzione, l' CloudWatch agente chiama PutMetricData una volta al minuto per ogni host EC2. Ciò significa che l'PutMetricDataAPI verrà chiamata
30*24*60=43,200in un mese di 30 giorni per ogni host EC2.
Per ulteriori informazioni sui CloudWatch prezzi, consulta Amazon CloudWatch Pricing.
Il calcolatore dei prezzi può aiutarti a stimare i costi mensili approssimativi per l'utilizzo di questa soluzione.
Per utilizzare il calcolatore dei prezzi per stimare i costi mensili della soluzione
-
Apri il calcolatore CloudWatch dei prezzi di
Amazon. -
In Scegli una regione, seleziona la regione in cui vuoi implementare la soluzione.
-
Nella sezione Metriche, per Numero di metriche, inserisci
17 * average number of GPUs per EC2 host * number of EC2 instances configured for this solution. -
Nella sezione API, per Numero di richieste API, inserisci
43200 * number of EC2 instances configured for this solution. -
Per impostazione predefinita, l' CloudWatch agente esegue un'PutMetricDataoperazione al minuto per ogni host EC2.
-
Nella sezione Pannello di controllo e allarmi, per Numero di pannelli di controllo, inserisci
1. -
Puoi vedere i costi mensili stimati nella parte inferiore del calcolatore dei prezzi.
CloudWatch configurazione dell'agente per questa soluzione
L' CloudWatch agente è un software che viene eseguito in modo continuo e autonomo sui server e in ambienti containerizzati. Raccoglie metriche, registri e tracce dall'infrastruttura e dalle applicazioni e li invia a e. CloudWatch X-Ray
Per ulteriori informazioni sull' CloudWatch agente, vedere. Raccogli metriche, registri e tracce utilizzando l'agente CloudWatch
La configurazione degli agenti in questa soluzione raccoglie una serie di metriche per aiutarti a iniziare a monitorare e osservare la tua GPU NVIDIA. L' CloudWatch agente può essere configurato per raccogliere più metriche della GPU NVIDIA rispetto a quelle visualizzate nella dashboard per impostazione predefinita. Per un elenco di tutte le metriche GPU NVIDIA che puoi raccogliere, consulta Raccolta dei parametri della GPU NVIDIA.
Configurazione dell'agente per questa soluzione
Le metriche raccolte dall'agente sono definite nella configurazione dell'agente. La soluzione fornisce configurazioni degli agenti per raccogliere le metriche consigliate con dimensioni adeguate per il pannello di controllo della soluzione.
Usa la seguente configurazione CloudWatch dell'agente sulle istanze EC2 con GPU NVIDIA. La configurazione verrà memorizzata come metrica nel Parameter Store di SSM, come descritto più avanti nella sezione Passaggio 2: memorizza il file di configurazione CloudWatch dell'agente consigliato in Systems Manager Parameter Store.
{ "metrics": { "namespace": "CWAgent", "append_dimensions": { "InstanceId": "${aws:InstanceId}" }, "metrics_collected": { "nvidia_gpu": { "measurement": [ "utilization_gpu", "temperature_gpu", "power_draw", "utilization_memory", "fan_speed", "memory_total", "memory_used", "memory_free", "pcie_link_gen_current", "pcie_link_width_current", "encoder_stats_session_count", "encoder_stats_average_fps", "encoder_stats_average_latency", "clocks_current_graphics", "clocks_current_sm", "clocks_current_memory", "clocks_current_video" ], "metrics_collection_interval": 60 } } }, "force_flush_interval": 60 }
Implementazione dell'agente per la soluzione
Esistono diversi approcci per l'installazione CloudWatch dell'agente, a seconda del caso d'uso. Si consiglia di utilizzare Systems Manager per questa soluzione. Fornisce un'esperienza da console e semplifica la gestione di una flotta di server gestiti all'interno di un singolo AWS account. Le istruzioni in questa sezione utilizzano Systems Manager e sono destinate ai casi in cui l' CloudWatch agente non è in esecuzione con configurazioni esistenti. È possibile verificare se l' CloudWatch agente è in esecuzione seguendo i passaggi indicatiVerificare che l' CloudWatch agente sia in esecuzione.
Se stai già eseguendo l' CloudWatch agente sugli host EC2 in cui è distribuito il carico di lavoro e gestisci le configurazioni degli agenti, puoi saltare le istruzioni in questa sezione e seguire il meccanismo di distribuzione esistente per aggiornare la configurazione. Assicurati di unire la configurazione dell'agente della GPU NVIDIA con la configurazione dell'agente esistente, quindi implementa la configurazione unita. Se si utilizza Systems Manager per archiviare e gestire la configurazione dell' CloudWatch agente, è possibile unire la configurazione al valore del parametro esistente. Per ulteriori informazioni, vedere Gestione dei file di configurazione CloudWatch dell'agente.
Nota
L'utilizzo di Systems Manager per distribuire le seguenti configurazioni degli CloudWatch agenti sostituirà o sovrascriverà qualsiasi configurazione CloudWatch dell'agente esistente sulle istanze EC2. Puoi modificare questa configurazione per adattarla al tuo ambiente o caso d'uso specifico. Le metriche definite nella configurazione sono le minime richieste per il pannello di controllo fornito dalla soluzione.
Il processo di implementazione include i seguenti passaggi:
-
Passaggio 1: assicurati che le istanze EC2 di destinazione dispongano delle autorizzazioni IAM richieste.
-
Passaggio 2: archiviare il file di configurazione dell'agente consigliato nel Parameter Store di Systems Manager.
-
Passaggio 3: installa l' CloudWatch agente su una o più istanze EC2 utilizzando uno stack. CloudFormation
-
Passaggio 4: verificare che la configurazione dell'agente sia corretta.
Passaggio 1: assicurati che le istanze EC2 di destinazione dispongano delle autorizzazioni IAM richieste
È necessario concedere l'autorizzazione a Systems Manager per installare e configurare l'agente. CloudWatch È inoltre necessario concedere all' CloudWatch agente l'autorizzazione a pubblicare dati di telemetria dall'istanza EC2 in. CloudWatch Assicurati che al ruolo IAM associato all'istanza siano allegate le policy IAM CloudWatchAgentServerPolicy e AmazonSSMManagedInstanceCore IAM.
-
Dopo aver creato il ruolo, collegalo alle istanze EC2. Per collegare un ruolo a un'istanza EC2, segui i passaggi in Collegamento di un ruolo IAM a un'istanza.
Passaggio 2: memorizza il file di configurazione CloudWatch dell'agente consigliato in Systems Manager Parameter Store
Parameter Store semplifica l'installazione dell' CloudWatch agente su un'istanza EC2 archiviando e gestendo in modo sicuro i parametri di configurazione, eliminando la necessità di valori codificati. Ciò garantisce un processo di implementazione più sicuro e flessibile, che consente una gestione centralizzata e aggiornamenti più semplici delle configurazioni su più istanze.
Utilizzate i passaggi seguenti per memorizzare il file di configurazione dell' CloudWatch agente consigliato come parametro in Parameter Store.
Per creare il file di configurazione CloudWatch dell'agente come parametro
Aprire la AWS Systems Manager console all'indirizzo https://console.aws.amazon.com/systems-manager/
. -
Verifica che la Regione selezionata sulla console sia quella in cui è in esecuzione il carico di lavoro della GPU NVIDIA.
-
Dal pannello di navigazione, scegli Gestione applicazioni, Parameter Store.
-
Per creare un nuovo parametro per la configurazione, segui questi passaggi.
-
Scegli Create parameter (Crea parametro).
-
Nella casella Nome, inserisci un nome che utilizzerai per fare riferimento al file di configurazione dell' CloudWatch agente nei passaggi successivi. Ad esempio,
AmazonCloudWatch-NVIDIA-GPU-Configuration. -
(Facoltativo) Nella casella Descrizione, digita una descrizione per il parametro.
-
Per Livello parametri, scegli Standard.
-
Per Type (Tipo), scegliere String.
-
Per Tipo di dati, scegli testo.
-
Nella casella Valore, incolla il blocco JSON corrispondente elencato in Configurazione dell'agente per questa soluzione.
-
Scegli Create parameter (Crea parametro).
-
Fase 3: Installare l' CloudWatch agente e applicare la configurazione utilizzando un CloudFormation modello
È possibile utilizzare AWS CloudFormation per installare l'agente e configurarlo per utilizzare la configurazione CloudWatch dell'agente creata nei passaggi precedenti.
Per installare e configurare l' CloudWatch agente per questa soluzione
-
Apri la procedura guidata di creazione CloudFormation rapida dello stack utilizzando questo link: https://console.aws.amazon.com/cloudformation/home? #/stacks/quickcreate? URL del modello = https://aws-observability-solutions-prod-us-east-1.s3.us-east-1.amazonaws.com/CloudWatchAgent/CFN/v1.0.0/cw-agent-installation-template-1.0.0.json
. -
Verifica che la Regione selezionata sulla console sia quella in cui è in esecuzione il carico di lavoro della GPU NVIDIA.
-
Per Nome dello stack, inserisci un nome per identificare questo stack, ad esempio
CWAgentInstallationStack. -
Nella sezione Parametri, specifica quanto segue:
-
Per CloudWatchAgentConfigSSM, immettere il nome del parametro Systems Manager per la configurazione dell'agente creata in precedenza, ad esempio.
AmazonCloudWatch-NVIDIA-GPU-Configuration -
Per selezionare le istanze di destinazione, sono disponibili due opzioni.
-
Per InstanceIds, specifica un elenco delimitato da virgole di ID di istanza. Elenco di ID di istanza in cui desideri installare l' CloudWatch agente con questa configurazione. Puoi elencare una singola istanza o più istanze.
-
Se si esegue una distribuzione su larga scala, è possibile specificare tutte le istanze EC2 TagKey e le corrispondenti TagValue a cui destinare questo tag e valore. Se si specifica un TagKey, è necessario specificare un corrispondente. TagValue (Per un gruppo Auto Scaling, specificate
aws:autoscaling:groupNameTagKey e specificate il nome del gruppo Auto Scaling TagValue da distribuire a tutte le istanze all'interno del gruppo Auto Scaling.)
-
-
-
Esamina le impostazioni e quindi scegli Crea stack.
Se desideri prima modificare il file modello per personalizzarlo, scegli l'opzione Carica un file modello in Procedura guidata creazione stack per caricare il modello modificato. Per ulteriori informazioni, consulta Creazione di uno stack sulla console. CloudFormation
Nota
Una volta completato questo passaggio, questo parametro di Systems Manager verrà associato agli CloudWatch agenti in esecuzione nelle istanze mirate. Ciò significa che:
-
Se il parametro Systems Manager viene eliminato, l'agente si arresta.
-
Se il parametro Systems Manager viene modificato, le modifiche alla configurazione verranno applicate automaticamente all'agente alla frequenza pianificata, che per impostazione predefinita è di 30 giorni.
-
Se si desidera applicare immediatamente le modifiche a questo parametro Systems Manager, è necessario eseguire nuovamente questo passaggio. Per ulteriori informazioni sulle associazioni, consulta Utilizzo delle associazioni in Systems Manager.
Passaggio 4: verificare che la configurazione dell'agente sia corretta
È possibile verificare se l' CloudWatch agente è installato seguendo i passaggi indicatiVerificare che l' CloudWatch agente sia in esecuzione. Se l' CloudWatch agente non è installato e in esecuzione, assicurati di aver impostato tutto correttamente.
-
Assicurati di aver collegato un ruolo con le autorizzazioni corrette per l'istanza EC2, come descritto nella sezione Passaggio 1: assicurati che le istanze EC2 di destinazione dispongano delle autorizzazioni IAM richieste.
-
Assicurati di aver configurato correttamente il JSON per il parametro Systems Manager. Segui la procedura riportata in Risoluzione dei problemi di installazione dell' CloudWatch agente con CloudFormation.
Se tutto è impostato correttamente, dovresti vedere le metriche della GPU NVIDIA pubblicate su. CloudWatch Puoi controllare la CloudWatch console per verificare che siano pubblicate.
Per verificare che le metriche della GPU NVIDIA vengano pubblicate su CloudWatch
Apri la console all' CloudWatch indirizzo. https://console.aws.amazon.com/cloudwatch/
-
Scegli Metriche, Metriche classiche.
-
Assicurati di aver selezionato la Regione in cui hai implementato la soluzione e scegli Namespace personalizzati, CWAgent.
-
Cerca le metriche menzionate in Configurazione dell'agente per questa soluzione, ad esempio
nvidia_smi_utilization_gpu. Se vedi i risultati di queste metriche, significa che le metriche vengono pubblicate su. CloudWatch
Crea il pannello di controllo della soluzione GPU NVIDIA
Il pannello di controllo fornito da questa soluzione presenta le metriche delle GPU NVIDIA aggregando e presentando le metriche relative a tutte le istanze. Il pannello di controllo mostra una ripartizione dei collaboratori principali (widget dei principali 10 per metrica) per ogni metrica. Questo ti aiuta a identificare rapidamente i valori anomali o le istanze che contribuiscono in modo significativo alle metriche osservate.
Per creare il pannello di controllo, puoi utilizzare le seguenti opzioni:
Usa la CloudWatch console per creare la dashboard.
Usa AWS CloudFormation la console per distribuire il dashboard.
Scarica l' AWS CloudFormation infrastruttura come codice e integrala come parte della tua automazione di integrazione continua (CI).
Utilizzando la CloudWatch console per creare una dashboard, puoi visualizzarla in anteprima prima di crearla e ricevere l'addebito effettivo.
Nota
La dashboard creata con CloudFormation questa soluzione mostra le metriche della regione in cui viene implementata la soluzione. Assicurati di creare CloudFormation lo stack nella regione in cui sono pubblicate le metriche della tua GPU NVIDIA.
Se hai specificato uno spazio dei nomi personalizzato diverso da CWAgent nella configurazione dell'agente, dovrai cambiare il CloudFormation modello per la dashboard per sostituire CloudWatch CWAgent con lo spazio dei nomi personalizzato che stai utilizzando.
Per creare la dashboard tramite Console CloudWatch
-
Apri la CloudWatch console Create Dashboard utilizzando questo link: https://console.aws.amazon.com/cloudwatch/home? #dashboards? NvidiaGpuOnEc2DashboardTemplate= &referrer=os-catalog.
-
Verifica che la Regione selezionata sulla console sia quella in cui è in esecuzione il carico di lavoro della GPU NVIDIA.
-
Immetti il nome del pannello di controllo e scegli Crea pannello di controllo.
Per distinguere facilmente questo pannello di controllo da altri simili in Regioni diverse, consigliamo di includere il nome della Regione nel nome del pannello di controllo, ad esempio
NVIDIA-GPU-Dashboard-us-east-1. -
Visualizza l'anteprima del pannello di controllo e scegli Salva per creare il pannello di controllo.
Per creare la dashboard tramite CloudFormation
-
Apri la procedura guidata di creazione CloudFormation rapida dello stack utilizzando questo link: https://console.aws.amazon.com/cloudformation/home? #/stacks/quickcreate? URL del modello = https://aws-observability-solutions-prod-us-east-1.s3.us-east-1.amazonaws.com/NVIDIA_GPU_EC2/CloudWatch/CFN/v1.0.0/dashboard-template-1.0.0.json
. -
Verifica che la Regione selezionata sulla console sia quella in cui è in esecuzione il carico di lavoro della GPU NVIDIA.
-
Per Nome dello stack, inserisci un nome per identificare questo stack, ad esempio
NVIDIA-GPU-DashboardStack. -
Nella sezione Parametri, specifica il nome della dashboard sotto il parametro. DashboardName
-
Per distinguere facilmente questo pannello di controllo da altri simili in Regioni diverse, consigliamo di includere il nome della Regione nel nome del pannello di controllo, ad esempio
NVIDIA-GPU-Dashboard-us-east-1. -
Riconosci le capacità di accesso per le trasformazioni nella sezione Capacità e trasformazioni. Nota che CloudFormation non aggiunge alcuna risorsa IAM.
-
Esamina le impostazioni e quindi scegli Crea stack.
-
Una volta che lo stato dello stack è CREATE_COMPLETE, scegli la scheda Risorse sotto lo stack creato, quindi scegli il link in ID fisico per accedere al pannello di controllo. Puoi anche accedere alla dashboard nella CloudWatch console scegliendo Dashboard nel riquadro di navigazione a sinistra della console e trovando il nome della dashboard in Custom Dashboards.
Se desideri modificare il file modello per personalizzarlo per qualsiasi scopo, puoi utilizzare l'opzione Carica un file modello in Procedura guidata creazione stack per caricare il modello modificato. Per ulteriori informazioni, consulta Creazione di uno stack sulla console CloudFormation Puoi utilizzare questo link per scaricare il modello:. https://aws-observability-solutions-prod-us-east-1.s3.us-east-1.amazonaws.com/NVIDIA_GPU_EC2/CloudWatch/CFN/v1.0.0/dashboard-template-1.0.0.json
Nozioni di base sul pannello di controllo GPU NVIDIA
Ecco alcune attività che puoi provare con il nuovo pannello di controllo GPU NVIDIA. Queste attività permettono di accertarsi che il pannello di controllo funzioni correttamente e offrono un'esperienza pratica nel suo utilizzo per monitorare le GPU NVIDIA. Provandole, acquisirai familiarità con la navigazione nel pannello di controllo e l'interpretazione delle metriche visualizzate.
Verifica dell'utilizzo della GPU
Nella sezione Utilizzo, trova i widget Utilizzo della GPU e Utilizzo della memoria. Questi mostrano rispettivamente la percentuale di tempo in cui la GPU viene utilizzata attivamente per i calcoli e la percentuale di memoria globale in lettura o scrittura. Un utilizzo elevato potrebbe indicare potenziali rallentamenti nelle prestazioni o la necessità di risorse GPU aggiuntive.
Analisi dell'utilizzo della memoria della GPU
Nella sezione Memoria, trova i widget Memoria totale, Memoria usata e Memoria libera. Questi forniscono informazioni sulla capacità di memoria complessiva delle GPU e sulla quantità di memoria attualmente consumata o disponibile. La pressione della memoria potrebbe causare problemi di prestazioni o errori di esaurimento della memoria, quindi è importante monitorare queste metriche e assicurarsi che sia disponibile memoria sufficiente per i carichi di lavoro.
Monitoraggio della temperatura e dell'assorbimento di energia
Nella sezione Temperatura/Energia, trova i widget Temperatura GPU e Assorbimento energia. Queste metriche sono essenziali per garantire che le GPU funzionino entro limiti termici ed energetici sicuri.
Identificazione delle prestazioni dell'encoder
Nella sezione Encoder, trova i widget Numero di sessioni dell'encoder, FPS medi e Latenza media. Queste metriche sono rilevanti se esegui carichi di lavoro di codifica video sulle tue GPU. Monitora queste metriche per assicurarti che i tuoi codificatori funzionino in modo ottimale e identificare eventuali colli di bottiglia o problemi di prestazioni.
Controllo dello stato del collegamento PCIe
Nella sezione PCIe, trova i widget Generazione link PCIe e Larghezza link PCIe. Queste metriche forniscono informazioni sul collegamento PCIe che collega la GPU al sistema host. Assicuratevi che il collegamento funzioni alla generazione e alla larghezza previste per evitare potenziali limitazioni delle prestazioni dovute ai colli di bottiglia PCIe.
Controllo dei clock della GPU
Nella sezione Clock, trova i widget Clock grafica, Clock SM, Clock memoria e Clock video. Queste metriche mostrano le frequenze operative correnti dei vari componenti della GPU. Il monitoraggio di questi clock può aiutare a identificare potenziali problemi relativi al ridimensionamento del clock della GPU o alla limitazione della frequenza, che potrebbero influire sulle prestazioni.