

As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.

# Atualizando a versão do agendador de um cluster no AWS PCS
<a name="working-with_clusters_version_update"></a>

AWS O PCS permite que você atualize a versão do agendador em um cluster existente sem reconstruir sua infraestrutura. As atualizações de versão movem o controlador de cluster para uma versão principal mais recente do Slurm, oferecendo acesso a novos recursos, melhorias de desempenho e patches de segurança. As versões mais recentes também têm uma vida útil de suporte mais longa antes de chegarem ao fim da vida útil.

## Visão geral do
<a name="version_update-cluster-overview"></a>

A atualização da versão do agendador envolve três operações:

1. **Prepare AMIs de destino** — Crie ou identifique AMIs que incluam a versão de destino do Slurm e o agente PCS mais recente. AWS 

1. **Atualizar o cluster** (`UpdateCluster`) — move o controlador para a versão principal do Slurm de destino.

1. **Atualizar grupos de nós de computação** (`UpdateComputeNodeGroup`) — direcione cada grupo de nós de computação para uma nova AMI para que os novos nós usem a versão de destino. Para obter mais informações, consulte [Atualizando um AWS Grupo de nós de computação PCS](working-with_cng_update.md).

Há dois caminhos que você pode seguir. Escolha com base na possibilidade de tolerar a interrupção do trabalho e se deseja usar uma AMI de versão dupla (contendo as versões atual e de destino do Slurm).

Independentemente da opção escolhida, antes do início do processo, todos os nós no cluster devem executar a mesma versão “A” e, no final do processo, todos os nós devem executar a mesma versão “B”. A opção 2 funciona independentemente da configuração do cluster.


|  | Opção 1: atualização contínua | Opção 2: Full-fleet reciclar | 
| --- | --- | --- | 
| Execução de trabalhos | Não exige rescisão do trabalho | Todos os trabalhos em execução foram encerrados | 
| Requisito de AMI | Deve incluir as versões atual e de destino do Slurm | Precisa apenas da versão de destino do Slurm | 
| Versão mínima do controlador de cluster | 24.05 | Sem restrição | 
| Frota de computação após a atualização do controlador | Versões mistas temporariamente; etapas de drenagem necessárias. Recomendamos minimizar o tempo durante o qual as versões mistas são usadas em um cluster. | Todos os nós começam do zero na versão de destino | 

**nota**  
Antes de começar, certifique-se de que todos os nós de computação estejam no patch mais recente do Slurm versão A e no agente PCS mais recente AWS .

## Limitações
<a name="version_update-cluster-limitations"></a>

As configurações a seguir exigem etapas adicionais ou são incompatíveis com a Opção 1 (atualização contínua). Sem as soluções alternativas mencionadas, você deve usar a Opção 2 (reciclagem completa da frota) em vez disso:
+ **Plug-ins Spank** — Se seu cluster usa plug-ins Spank (configuração de plugstack), a Opção 1 não é suportada. Uma atualização contínua pode causar uma incompatibilidade de versão da configuração do plugstack e falhas no plug-in.
+ **Atualização de plug-ins de filtro de CLI para 25.11** — Se seu cluster usa plug-ins de filtro de CLI e está atualizando para a versão 25.11, a Opção 1 (atualização contínua) exige que você defina `CliFilterParameters` explicitamente as configurações do Slurm do cluster durante a atualização. Sem isso`CliFilterParameters`, os nós que executam a versão anterior não conseguem resolver o caminho do script do filtro CLI após a atualização do controlador, o que causa `sbatch` falhas. Para obter mais informações, consulte [Use os plug-ins de filtro CLI do Slurm para personalizar o envio de trabalhos no AWS PCS](slurm-cli-filter-plugins.md).

## Compatibilidade da versão
<a name="version_update-cluster-compatibility"></a>

A tabela a seguir mostra as versões de destino suportadas para as quais atualizar, dependendo da versão atual do cluster. É sempre recomendável atualizar para a versão mais recente permitida (mostrada em negrito).

O cluster e todos os nós de computação devem sempre executar a mesma versão do Slurm antes de iniciar uma atualização.


| Versão atual do cluster | Versões de destino compatíveis | 
| --- | --- | 
| 25.11 | N/A | 
| 25.05 | 25.11 | 
| 24.11 (SOL) | 25.11, 25.05 | 
| 24.05 (SOL) | 25.11, 25.05, 24.11 | 
| 23.11 (SOL) | (somente através da Opção 2) 25.05, 24.11, 24.05 | 

Para obter mais informações sobre versões compatíveis e datas de fim de vida útil, consulte. [Versões do Slurm em AWS PCS](slurm-versions.md)

Você não pode pular além das três versões principais em uma única atualização. Se sua versão de destino estiver mais de três versões principais à frente da versão atual, execute a atualização em várias etapas consecutivas. Para obter um exemplo de várias etapas, consulte[Exemplo: atualização em várias versões](working-with_clusters_version_update_procedure.md#version_update-procedure-multi-hop).

## Impacto na execução de trabalhos
<a name="version_update-cluster-job-impact"></a>

Durante a atualização, o controlador Slurm fica brevemente indisponível. Isso causa os seguintes efeitos:
+ **Trabalhos em execução** — Para a Opção 1 (atualização contínua), os trabalhos que já estão sendo executados nos nós de computação continuam sendo executados. Os nós de computação não exigem que o controlador esteja disponível para a execução ativa do trabalho. Para a Opção 2 (reciclagem total da frota), todos os trabalhos em execução são encerrados quando a frota é reduzida.
+ **Envios de novos trabalhos** — Você não pode enviar novos trabalhos ou executar comandos do agendador enquanto o controlador estiver indisponível.
+ **Dimensionamento** — O escalonamento automático é pausado durante a atualização. Nenhuma nova instância é iniciada e nenhuma instância é encerrada para redução até que a atualização seja concluída.
+ **Dados contábeis** — Se a contabilidade estiver ativada, os dados contábeis serão preservados durante a atualização. Os registros de trabalhos armazenados no banco de dados contábil persistem após a alteração da versão.
+ API **REST do Slurm — Se a API** REST do Slurm estiver ativada no cluster, ela será atualizada automaticamente para a nova versão do agendador como parte da operação. `UpdateCluster` O endpoint da API REST não está disponível durante a atualização e é retomado quando o cluster retorna ao estado. `ACTIVE` Para obter mais informações, consulte [API REST do Slurm em AWS PCS](slurm-rest-api.md).

## Combinando atualizações de versão com alterações de configuração
<a name="version_update-cluster-combined-changes"></a>

Você pode combinar uma atualização de versão com outras alterações de configuração em uma única `UpdateCluster` solicitação. Por exemplo, você pode atualizar a versão do agendador e ativar a contabilização na mesma operação.

**nota**  
Não adicione configurações de Slurm específicas à versão de destino enquanto a frota ainda contiver nós na versão anterior. A configuração é distribuída para todos os nós; o antigo `slurmd` pode não reconhecer novos parâmetros.

**Topics**
+ [Visão geral do](#version_update-cluster-overview)
+ [Limitações](#version_update-cluster-limitations)
+ [Compatibilidade da versão](#version_update-cluster-compatibility)
+ [Impacto na execução de trabalhos](#version_update-cluster-job-impact)
+ [Combinando atualizações de versão com alterações de configuração](#version_update-cluster-combined-changes)
+ [Atualize a versão do agendador de um AWS Cluster PCS](working-with_clusters_version_update_procedure.md)
+ [Solução de problemas AWS Atualizações da versão do cluster PCS](working-with_clusters_version_update_troubleshooting.md)