Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Risoluzione delle modifiche alla configurazione del sistema operativo che causano errori o guasti
Quando si apportano modifiche alla configurazione del sistema operativo ai AWS ParallelCluster nodi, possono verificarsi vari problemi che possono causare errori nella creazione, nell'aggiornamento o nel funzionamento del cluster. Questa sezione fornisce indicazioni per identificare e risolvere i problemi più comuni relativi alla configurazione del sistema operativo.
Problemi comuni di configurazione del sistema operativo
Problemi di configurazione locale
Uno dei problemi di configurazione del sistema operativo più comuni è legato alle impostazioni locali. Se vedi errori come:
cannot change locale (en_US.utf-8) because it has an invalid name
Ciò si verifica in genere quando:
-
Un processo
yumdi installazione non è riuscito e ha lasciato le impostazioni locali in uno stato incoerente -
Un utente ha terminato un processo di installazione prematuramente
-
I pacchetti locali sono mancanti o danneggiati
Come effettuare la diagnosi
-
Controlla se puoi passare all'utente pcluster-admin:
$su - pcluster-adminSe vedi un errore del tipo
cannot change locale...no such file or directory, questo conferma il problema. -
Verifica le impostazioni locali disponibili:
$localedef --listSe restituisce un elenco vuoto o non contiene le impostazioni locali predefinite, la configurazione locale è interrotta.
-
Controlla l'ultimo
yumcomando:$yum history$yum history info #IDSe l'ultimo ID non è presente
Return-Code: Success, gli script di post-installazione potrebbero non essere stati eseguiti correttamente.
Come risolvere
Ricostruisci le impostazioni locali reinstallando i language pack:
$sudo yum reinstall glibc-all-langpacks
Dopo la ricostruzione, verifica che il problema sia stato risolto eseguendo:
$su - pcluster-admin
Se non viene visualizzato alcun errore o avviso, il problema è stato risolto.
Conflitti tra pacchetti OS
Quando si installano pacchetti personalizzati o si modificano i pacchetti di sistema, possono verificarsi conflitti che impediscono il corretto funzionamento del cluster.
Come effettuare la diagnosi
-
Controlla il log di chef-client per eventuali errori relativi ai pacchetti:
$less /var/log/chef-client.log -
Cerca i conflitti di dipendenza tra i pacchetti nel log cfn-init:
$less /var/log/cfn-init.log
Come risolvere
-
Se un pacchetto specifico causa problemi, prova a reinstallarlo:
$sudo yum reinstall package-name -
Per i conflitti di dipendenza, potrebbe essere necessario rimuovere i pacchetti in conflitto:
$sudo yum remove conflicting-package -
Se il problema persiste, valuta la possibilità di creare un'AMI personalizzata con i pacchetti richiesti preinstallati utilizzando il comando.
pcluster build-imagePer ulteriori informazioni, consulta AWS ParallelCluster Personalizzazione dell'AMI.
Modifiche al file di configurazione del sistema
La modifica dei file critici di configurazione del sistema può causare errori del cluster, soprattutto se questi file sono gestiti da. AWS ParallelCluster
Come effettuare la diagnosi
-
Verifica la presenza di errori nel registro di chef-client che menzionano file di configurazione specifici:
$grep -i "config" /var/log/chef-client.log -
Cerca errori di autorizzazione o sintassi nei file di configurazione:
$less /var/log/cfn-init.log
Come risolvere
-
Ripristina i file di configurazione modificati allo stato originale:
$sudo cp /etc/file.conf.bak /etc/file.conf -
Se devi apportare modifiche permanenti ai file di configurazione del sistema, utilizza azioni di bootstrap personalizzate invece di modificare direttamente i file:
HeadNode: CustomActions: OnNodeConfigured: Script: s3://bucket-name/config-script.shPer ulteriori informazioni, consulta Azioni bootstrap personalizzate.
-
Per le modifiche alla configurazione che devono essere apportate direttamente ai file di sistema, valuta la possibilità di creare un'AMI personalizzata. Per ulteriori informazioni, consulta AWS ParallelCluster Personalizzazione dell'AMI.
Aggiornamenti del kernel e problemi di compatibilità
Gli aggiornamenti del kernel possono causare problemi di compatibilità con determinati AWS servizi, in particolare con Amazon FSx for Lustre.
Come effettuare la diagnosi
-
Controlla se gli aggiornamenti del kernel sono stati applicati:
$uname -r -
Cerca gli errori di montaggio di Amazon FSx nei log:
$grep -i "fsx" /var/log/chef-client.log
Come risolvere
-
Per Ubuntu 22.04, evita l'aggiornamento al kernel più recente poiché non esiste un client Amazon FSx per quel kernel. Per ulteriori informazioni, consulta Considerazioni sul sistema operativo.
-
Se hai già aggiornato il kernel e riscontri problemi, valuta la possibilità di effettuare il downgrade a una versione del kernel compatibile:
$sudo apt install linux-image-previous-version -
Per personalizzazioni persistenti del kernel, crea un'AMI personalizzata con la versione specifica del kernel di cui hai bisogno. Per ulteriori informazioni, consulta AWS ParallelCluster Personalizzazione dell'AMI.
Le migliori pratiche per le modifiche alla configurazione del sistema operativo
Per ridurre al minimo i problemi quando si apportano modifiche alla configurazione del sistema operativo:
-
Usa azioni Bootstrap personalizzate: invece di modificare direttamente i file di sistema, usa i
OnNodeStartnostriOnNodeConfiguredscript per apportare modifiche in modo controllato. Per ulteriori informazioni, consulta Azioni bootstrap personalizzate. -
Crea AMI personalizzate: per modifiche significative al sistema operativo, crea un'AMI personalizzata utilizzando
pcluster build-imageinvece di apportare modifiche alle istanze in esecuzione. Per ulteriori informazioni, consulta AWS ParallelCluster Personalizzazione dell'AMI. -
Verifica prima le modifiche: prima di applicare le modifiche a un cluster di produzione, testale su un piccolo cluster di test per assicurarne la compatibilità.
-
Modifiche ai documenti: tieni traccia di tutte le modifiche alla configurazione del sistema operativo apportate per facilitare la risoluzione dei problemi.
-
File di configurazione di backup: prima di modificare qualsiasi file di configurazione del sistema, crea un backup:
$sudo cp /etc/file.conf /etc/file.conf.bak -
Controlla i registri dopo le modifiche: dopo aver apportato le modifiche alla configurazione del sistema operativo, controlla i registri per eventuali errori:
$less /var/log/cfn-init.log$less /var/log/chef-client.log
Seguendo queste linee guida, è possibile ridurre al minimo il rischio che le modifiche alla configurazione del sistema operativo causino errori del cluster e risolvere in modo più efficace eventuali problemi.