View a markdown version of this page

Risoluzione dei problemi con pcluster-diag - AWS ParallelCluster

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

Risoluzione dei problemi con pcluster-diag

pcluster-diagè uno strumento di diagnostica che verifica una serie di condizioni che un AWS ParallelCluster nodo sano dovrebbe soddisfare.

pcluster-diagDa utilizzare come primo passaggio quando un cluster non si comporta correttamente in fase di esecuzione. Lo strumento emette un rapporto di diagnostica JSON per aiutarti a comprendere i problemi che riguardano il tuo cluster. Se non riesci a risolvere un problema, allega il rapporto a un AWS caso di supporto.

Lo strumento è incluso in tutte le AWS ParallelCluster AMI a partire dalla versione 3.16.0, sia le AMI ufficiali che le AMI personalizzate con cui si crea. pcluster build-image Se utilizzi una AWS ParallelCluster versione precedente, puoi comunque installare lo strumento seguendo i passaggi indicati. Versioni precedenti alla 3.16.0

È possibile eseguire pcluster-diag su qualsiasi nodo del cluster. Se non sai dov'è il problema, eseguilo sul nodo principale.

Caratteristiche chiave
  • Riconosce il contesto: all'avvio legge il tipo di nodo e la configurazione del cluster distribuito, quindi esegue solo i controlli applicabili. I controlli relativi alle funzionalità che il cluster non utilizza vengono segnalati come ignorati.

  • Read-only per impostazione predefinita: non modifica mai la configurazione del cluster. Un controllo che non è di sola lettura richiede l'approvazione esplicita dell'utente prima di essere eseguito e lo registra come ignorato in caso di rifiuto.

  • Completato in una sola esecuzione: un controllo che fallisce non ferma mai gli altri. Ogni controllo applicabile viene eseguito su ogni chiamata, quindi una sola esecuzione fornisce il quadro completo del nodo, in base ai controlli disponibili.

Mostra i controlli disponibili

Per vedere quali controlli verranno eseguiti dallo strumento, usa il describe-checks sottocomando, che restituisce un array JSON di ogni controllo registrato, ciascuno con il suo ID e la sua descrizione.

$ pcluster-diag describe-checks [ { "check_id": "...", "check_description": "..." }, ... ]

Esegui i controlli

Connettiti al nodo che desideri diagnosticare, quindi esegui il run sottocomando come root.

$ sudo pcluster-diag run

pcluster-diagscrive due stream separati:

  • Un registro di avanzamento fino all'errore standard.

  • Il rapporto JSON sullo standard output. Lo stesso report viene inoltre salvato in un file con data e ora ./pcluster-diag-output/ nella directory corrente.

Sono disponibili le seguenti opzioni.

--output-file path

Il file in cui viene scritto il report JSON. L'impostazione predefinita è un file con data e ora in, ad esempio. ./pcluster-diag-output/ ./pcluster-diag-output/pcluster-diag-report-2026-08-04T10-12-00.json

-y, --yes

Approva ogni controllo che richiede una conferma, senza chiedere conferma. Usalo quando esegui pcluster-diag da uno script.

--version

Stampa la pcluster-diag versione.

--help

Stampa le informazioni sull'utilizzo. pcluster-diag run --helpstampa le opzioni del run sottocomando.

Interpreta il rapporto

pcluster-diagemette un report JSON che tiene conto di ogni controllo eseguito, indipendentemente dal fatto che il controllo sia stato superato, avvertito, fallito o saltato. contextdescrive il nodo che è stato diagnosticato. La struttura generale del rapporto è la seguente:

{ "context": { ... }, "results": [ { "check_id": "...", "check_description": "...", "status": "...", "errors": [ { "code": "...", "message": "..." } ], "warnings": [ { "code": "...", "message": "..." } ], "infos": [ { "code": "...", "message": "..." } ] } ] }

Stati del controllo

Il risultato status di ogni controllo indica cosa farne.

Stato Significato Cosa fare

PASSED

Questo controllo non ha rilevato alcun problema.

-

WARNING

Questo controllo ha rilevato qualcosa che potrebbe causare un problema nel nodo.

Controlla l'warningselenco e indica tutto ciò che potrebbe essere importante.

FAILURE

Questo controllo ha rilevato un problema nel nodo.

Rivedi l'errorselenco e risolvi tutti i problemi.

CHECK_ERROR

Il controllo non è stato completato, quindi lo stato non può essere confermato.

Consideralo inconcludente, non come un problema. Segnala l'errore all' AWS assistenza perché potrebbe essere il segnale di un errore non gestito.

SKIPPED_NOT_APPLICABLE

Il controllo non si applica a questo tipo di nodo o alla configurazione del cluster.

Niente. Questo è lo stato previsto per le funzionalità che il cluster non utilizza.

SKIPPED_BY_USER

La verifica richiedeva la tua conferma e tu l'hai rifiutata.

Rieseguipcluster-diag, approvando il controllo quando richiesto.

Se ogni controllo viene riportatoPASSED, pcluster-diag non sono stati riscontrati problemi. Tuttavia, la copertura di non pcluster-diag è completa e aumenterà con ogni versione. Una diagnosi corretta non garantisce che il cluster sia sano.

Controlla i risultati

Il risultato di un controllo può contenere tre tipi di risultati, ciascuno con a code e amessage.

  • errors, codificatiEn, sono i motivi per cui un controllo non è riuscito. Il codice riservato E0 viene utilizzato solo per errori interni che hanno impedito la corretta esecuzione del controllo.

  • warnings, codificateWn, sono osservazioni non fatali.

  • infos, codificate, sono note In contestuali.

Scarica l'ultima versione di pcluster-diag da GitHub

pcluster-diagè disponibile su tutte le AWS ParallelCluster versioni 3.16.0 e successive e può essere installato anche su versioni precedenti con alcuni passaggi aggiuntivi.

Nuovi controlli e messaggi diagnostici migliorati arrivano nel repository https://github.com/aws/aws-parallelcluster-cookbook aws-parallelcluster-cookbook sul sito web. GitHub Per utilizzare i controlli più recenti senza attendere la versione successiva, segui i passaggi relativi alla tua AWS ParallelCluster versione. AWS ParallelCluster

Versioni 3.16.0 e successive

Nelle AWS ParallelCluster versioni 3.16.0 e successive, il pcluster-diag comando è installato e disponibile su. PATH

Per aggiornare lo strumento dalla develop filiale, esegui quanto segue sul nodo in cui desideri eseguire lo strumento.

$ curl -fL https://github.com/aws/aws-parallelcluster-cookbook/archive/refs/heads/develop.tar.gz \ | sudo tar -xz --strip-components=5 -C /opt/parallelcluster/sources/pcluster-diag \ --wildcards '*/cookbooks/aws-parallelcluster-platform/files/pcluster-diag/*'

Verifica che lo strumento sia funzionante:

$ sudo pcluster-diag describe-checks

Per utilizzare una versione diversa da quella suggeritadevelop, sostituisci develop l'URL con il ramo o il tag che desideri, ad esempio un release-* ramo.

Ricorda quanto segue:

  • L'aggiornamento si applica solo al nodo su cui viene eseguito. Ripetilo su ogni nodo che desideri diagnosticare con i controlli più recenti.

  • Il codice sorgente dello strumento è integrato nell'AMI, quindi un nodo che viene sostituito restituisce la versione dell'AMI.

Versioni precedenti alla 3.16.0

Nelle AWS ParallelCluster versioni precedenti alla 3.16.0, il pcluster-diag comando non è installato nel nodo.

Per installare lo strumento dalla develop filiale, esegui quanto segue sul nodo in cui desideri eseguire lo strumento.

$ sudo mkdir -p /opt/parallelcluster/sources/pcluster-diag curl -fL https://github.com/aws/aws-parallelcluster-cookbook/archive/refs/heads/develop.tar.gz \ | sudo tar -xz --strip-components=5 -C /opt/parallelcluster/sources/pcluster-diag \ --wildcards '*/cookbooks/aws-parallelcluster-platform/files/pcluster-diag/*'

Verifica che lo strumento sia funzionante:

$ PYTHONPATH=/opt/parallelcluster/sources/pcluster-diag /opt/parallelcluster/pyenv/versions/3.12.8/envs/cookbook_virtualenv/bin/python3 -m pcluster_diag.cli describe-checks