View a markdown version of this page

Aggiornamento della versione dello scheduler di un cluster in AWS 2 PEZZI - AWS PEZZI

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

Aggiornamento della versione dello scheduler di un cluster in AWS 2 PEZZI

AWS PCS consente di aggiornare la versione dello scheduler su un cluster esistente senza ricostruire l'infrastruttura. Gli aggiornamenti di versione spostano il controller del cluster a una versione principale di Slurm più recente, che consente di accedere a nuove funzionalità, miglioramenti delle prestazioni e patch di sicurezza. Le versioni più recenti hanno anche una durata di supporto più lunga prima di raggiungere la fine del ciclo di vita.

Panoramica di

Un aggiornamento della versione di Scheduler prevede tre operazioni:

  1. Preparazione delle AMI di destinazione: crea o identifica le AMI che includono la versione di Slurm di destinazione e l'agente PCS più recente. AWS

  2. Aggiorna il cluster (UpdateCluster): sposta il controller sulla versione principale di Slurm di destinazione.

  3. Aggiorna i gruppi di nodi di calcolo (UpdateComputeNodeGroup): indirizza ciascun gruppo di nodi di calcolo a una nuova AMI in modo che i nuovi nodi utilizzino la versione di destinazione. Per ulteriori informazioni, consulta Aggiornamento di un AWS Gruppo di nodi di calcolo PCS.

Ci sono due percorsi che puoi seguire. Scegli un'opzione in base alla tua capacità di tollerare l'interruzione del lavoro.

Indipendentemente dall'opzione scelta, prima dell'inizio del processo, tutti i nodi del cluster devono eseguire la stessa versione «A» e alla fine del processo tutti i nodi devono eseguire la stessa versione «B». L'opzione 2 funziona indipendentemente dalla configurazione del cluster.

Opzione 1: aggiornamento continuo Opzione 2: interruzione Full-fleet della manutenzione
Esecuzione di processi Non richiede la cessazione del lavoro Tutti i processi in esecuzione sono terminati
Versione minima del controller del cluster 24.05 Nessuna restrizione
Flotta di elaborazione dopo l'aggiornamento del controller Versioni miste temporaneamente; sono necessarie fasi di drenaggio. Si consiglia di ridurre al minimo il tempo durante il quale le versioni miste vengono utilizzate in un cluster. Tutti i nodi partono da zero nella versione di destinazione
Nota

Prima di iniziare, assicurati che tutti i nodi di calcolo siano dotati dell'ultima patch di Slurm versione A e dell'agente PCS più recente AWS .

Limitazioni

Se il tuo cluster utilizza i plugin Spank (configurazione plugstack), AWS PCS non supporta l'opzione 1. Un aggiornamento continuo potrebbe causare una mancata corrispondenza della versione di configurazione del plugstack e errori del plug-in.

Compatibilità delle versioni

La tabella seguente mostra le versioni di destinazione supportate a cui eseguire l'aggiornamento, a seconda della versione corrente del cluster. È sempre consigliabile eseguire l'aggiornamento all'ultima versione consentita (mostrata in grassetto).

Il cluster e tutti i nodi di calcolo devono sempre eseguire la stessa versione di Slurm prima di avviare un aggiornamento.

Versione attuale del cluster Versioni di destinazione compatibili
25.11 N/A
25,05 25,11
24.11 (EOL) 25.11, 25.05
24.05 (EOL) 25.11, 25.05, 24.11
23.11 (EOL) (solo tramite l'opzione 2) 25.05, 24.11, 24.05

Per ulteriori informazioni sulle versioni supportate e sulle date di fine vita, vedere. Versioni di Slurm in AWS 2 PEZZI

Non puoi saltare più di tre versioni principali in un singolo aggiornamento. Se la versione di destinazione è superiore a quella attuale con più di tre versioni principali, esegui l'aggiornamento in più passaggi consecutivi. Per un esempio in più passaggi, consultaEsempio: aggiornamento tra più versioni.

Impatto sull'esecuzione dei lavori

Durante l'aggiornamento, il controller Slurm non è disponibile per un breve periodo. Ne consegue che:

  • Lavori in esecuzione: per l'opzione 1 (aggiornamento progressivo), i lavori già in esecuzione sui nodi di calcolo continuano a essere eseguiti. I nodi di calcolo non richiedono che il controller sia disponibile per l'esecuzione attiva dei job. Per l'opzione 2 (interruzione completa della manutenzione della flotta), tutti i lavori in corso vengono interrotti quando il parco macchine viene ridimensionato.

  • Invio di nuovi lavori: non è possibile inviare nuovi lavori o eseguire comandi di pianificazione mentre il controller non è disponibile.

  • Ridimensionamento: il ridimensionamento automatico viene sospeso durante l'aggiornamento. Nessuna nuova istanza viene avviata e nessuna istanza viene interrotta per essere ridimensionata fino al completamento dell'aggiornamento.

  • Dati contabili: se la contabilità è abilitata, i dati contabili vengono conservati durante l'aggiornamento. I record dei lavori memorizzati nel database di contabilità persistono dopo la modifica della versione.

  • API REST Slurm: se l'API REST Slurm è abilitata nel cluster, viene automaticamente aggiornata alla nuova versione dello scheduler come parte dell'operazione. UpdateCluster L'endpoint dell'API REST non è disponibile durante l'aggiornamento e riprende quando il cluster torna allo stato. ACTIVE Per ulteriori informazioni, consulta API REST Slurm in AWS 2 PEZZI.

Combinazione degli aggiornamenti di versione con le modifiche alla configurazione

È possibile combinare un aggiornamento di versione con altre modifiche alla configurazione in un'unica UpdateCluster richiesta. Ad esempio, è possibile aggiornare la versione dello scheduler e abilitare la contabilità nella stessa operazione.

Nota

Non aggiungere impostazioni Slurm specifiche per la versione di destinazione mentre la flotta contiene ancora nodi sulla versione precedente. La configurazione è distribuita a tutti i nodi; la vecchia slurmd potrebbe non riconoscere nuovi parametri.