View a markdown version of this page

Memperbarui versi penjadwal cluster di AWS PCS - AWS PCS

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Memperbarui versi penjadwal cluster di AWS PCS

AWS PCS memungkinkan Anda memperbarui versi penjadwal pada cluster yang ada tanpa membangun kembali infrastruktur Anda. Pembaruan versi memindahkan pengontrol cluster ke versi utama Slurm yang lebih baru, memberi Anda akses ke fitur baru, peningkatan kinerja, dan tambalan keamanan. Versi yang lebih baru juga memiliki masa dukungan yang lebih lama sebelum mencapai akhir hayat.

Gambaran umum

Pembaruan versi penjadwal melibatkan tiga operasi:

  1. Siapkan AMI target - Bangun atau identifikasi AMI yang menyertakan versi Slurm target dan agen AWS PCS terbaru.

  2. Perbarui cluster (UpdateCluster) - Memindahkan pengontrol ke versi utama Slurm target.

  3. Perbarui grup node komputasi (UpdateComputeNodeGroup) — Arahkan setiap grup node komputasi ke AMI baru sehingga node baru menggunakan versi target. Untuk informasi selengkapnya, lihat Memperbarui sebuah AWS Grup node komputasi PCS.

Ada dua jalan yang bisa Anda ikuti. Pilih berdasarkan apakah Anda dapat mentolerir gangguan pekerjaan dan apakah Anda ingin menggunakan AMI versi ganda (berisi versi Slurm saat ini dan target).

Terlepas dari opsi mana yang Anda pilih, sebelum proses dimulai, semua node di cluster harus menjalankan versi yang sama “A” dan pada akhir proses semua node harus menjalankan versi yang sama “B”. Opsi 2 berfungsi terlepas dari konfigurasi cluster Anda.

Opsi 1: Pembaruan bergulir Opsi 2: daur Full-fleet ulang
Menjalankan pekerjaan Tidak memerlukan pemutusan hubungan kerja Semua pekerjaan yang berjalan dihentikan
Persyaratan AMI Harus menyertakan versi Slurm saat ini dan target Hanya membutuhkan versi Slurm target
Versi pengontrol cluster minimum 24.05 Tidak ada batasan
Hitung armada setelah pembaruan pengontrol Versi campuran sementara; langkah-langkah tiriskan diperlukan. Kami merekomendasikan meminimalkan jumlah waktu selama versi campuran digunakan dalam sebuah cluster. Semua node mulai segar pada versi target
catatan

Sebelum memulai, pastikan semua node komputasi berada di patch terbaru Slurm versi A dan pada agen PCS terbaru AWS .

Batasan

Konfigurasi berikut memerlukan langkah-langkah tambahan atau tidak kompatibel dengan Opsi 1 (pembaruan bergulir). Tanpa solusi yang disebutkan, Anda harus menggunakan Opsi 2 (daur ulang armada penuh) sebagai gantinya:

  • Plugin spank - Jika cluster Anda menggunakan plugin Spank (konfigurasi plugstack), Opsi 1 tidak didukung. Pembaruan bergulir dapat menyebabkan ketidakcocokan versi konfigurasi plugstack dan kegagalan plugin.

  • Plugin filter CLI diperbarui ke 25.11 - Jika cluster Anda menggunakan plugin filter CLI dan memperbarui ke versi 25.11, Opsi 1 (pembaruan bergulir) mengharuskan Anda mengatur secara CliFilterParameters eksplisit dalam pengaturan Slurm cluster selama pembaruan. TanpaCliFilterParameters, node yang menjalankan versi sebelumnya tidak dapat menyelesaikan jalur skrip filter CLI setelah pembaruan pengontrol, yang menyebabkan sbatch kegagalan. Untuk informasi selengkapnya, lihat Gunakan Plugin Filter CLI Slurm untuk menyesuaikan pengiriman pekerjaan di AWS PCS.

Kompatibilitas versi

Tabel berikut menunjukkan versi target yang didukung untuk diperbarui, tergantung pada versi cluster saat ini. Selalu disarankan untuk meningkatkan ke versi terbaru yang diizinkan (ditampilkan dalam huruf tebal).

Cluster dan semua node komputasi harus selalu menjalankan versi Slurm yang sama sebelum memulai pembaruan.

Versi cluster saat ini Versi target yang kompatibel
25.11 N/A
25.05 25.11
24.11 (EOL) 25.11, 25.05
24.05 (EOL) 25.11, 25.05, 24.11
23.11 (EOL) (hanya melalui Opsi 2) 25.05, 24.11, 24.05

Untuk informasi selengkapnya tentang versi yang didukung dan tanggal akhir masa pakai, lihat. Versi slurm di AWS PCS

Anda tidak dapat melewati lebih dari tiga versi utama dalam satu pembaruan. Jika versi target Anda lebih dari tiga versi utama di depan versi Anda saat ini, lakukan pembaruan dalam beberapa langkah berturut-turut. Untuk contoh multi-langkah, lihatContoh: Memperbarui di beberapa versi.

Dampak pada menjalankan pekerjaan

Selama pembaruan, pengontrol Slurm sebentar tidak tersedia. Ini memiliki efek sebagai berikut:

  • Menjalankan pekerjaan — Untuk Opsi 1 (pembaruan bergulir), pekerjaan yang sudah berjalan pada node komputasi terus dijalankan. Node komputasi tidak memerlukan pengontrol untuk tersedia untuk eksekusi pekerjaan aktif. Untuk Opsi 2 (daur ulang armada penuh), semua pekerjaan yang berjalan dihentikan saat armada diperkecil.

  • Pengajuan pekerjaan baru - Anda tidak dapat mengirimkan pekerjaan baru atau menjalankan perintah penjadwal saat pengontrol tidak tersedia.

  • Penskalaan - Penskalaan otomatis dijeda selama pembaruan. Tidak ada instance baru yang diluncurkan dan tidak ada instance yang dihentikan untuk penskalaan hingga pembaruan selesai.

  • Data akuntansi — Jika akuntansi diaktifkan, data akuntansi disimpan di seluruh pembaruan. Catatan pekerjaan yang disimpan dalam database akuntansi tetap ada setelah perubahan versi.

  • Slurm REST API - Jika Slurm REST API diaktifkan pada cluster, maka secara otomatis diperbarui ke versi scheduler baru sebagai bagian dari operasi. UpdateCluster Titik akhir REST API tidak tersedia selama pembaruan dan dilanjutkan saat cluster kembali ke status. ACTIVE Untuk informasi selengkapnya, lihat Slurm REST API di AWS PCS.

Menggabungkan pembaruan versi dengan perubahan konfigurasi

Anda dapat menggabungkan pembaruan versi dengan perubahan konfigurasi lainnya dalam satu UpdateCluster permintaan. Misalnya, Anda dapat memperbarui versi penjadwal dan mengaktifkan akuntansi dalam operasi yang sama.

catatan

Jangan menambahkan pengaturan Slurm khusus untuk versi target sementara armada masih berisi node pada versi sebelumnya. Konfigurasi didistribusikan ke semua node; yang lama slurmd mungkin tidak mengenali parameter baru.