Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Menyelesaikan perubahan konfigurasi OS yang menyebabkan kesalahan atau kegagalan
Saat membuat perubahan konfigurasi OS ke AWS ParallelCluster node, berbagai masalah dapat muncul yang dapat menyebabkan pembuatan cluster, pembaruan, atau kegagalan operasi. Bagian ini memberikan panduan untuk mengidentifikasi dan menyelesaikan masalah umum terkait konfigurasi OS.
Masalah konfigurasi OS yang umum
Masalah konfigurasi lokal
Salah satu masalah konfigurasi OS yang paling umum terkait dengan pengaturan lokal. Jika Anda melihat kesalahan seperti:
cannot change locale (en_US.utf-8) because it has an invalid name
Hal ini biasanya terjadi ketika:
-
Proses
yuminstalasi tidak berhasil dan meninggalkan pengaturan lokal dalam keadaan tidak konsisten -
Seorang pengguna menghentikan proses instalasi sebelum waktunya
-
Paket lokal hilang atau rusak
Cara mendiagnosis
-
Periksa apakah Anda dapat beralih ke pengguna pcluster-admin:
$su - pcluster-adminJika Anda melihat kesalahan seperti
cannot change locale...no such file or directory, ini mengonfirmasi masalah. -
Periksa lokal yang tersedia:
$localedef --listJika ini mengembalikan daftar kosong atau tidak berisi lokal default, konfigurasi lokal Anda rusak.
-
Periksa
yumperintah terakhir:$yum history$yum history info #IDJika ID terakhir tidak ada
Return-Code: Success, skrip pasca-instalasi mungkin tidak berhasil berjalan.
Bagaimana cara menyelesaikannya
Bangun kembali lokal dengan menginstal ulang paket bahasa:
$sudo yum reinstall glibc-all-langpacks
Setelah membangun kembali, verifikasi masalah diperbaiki dengan menjalankan:
$su - pcluster-admin
Jika tidak ada kesalahan atau peringatan yang muncul, masalah telah diselesaikan.
Konflik paket OS
Saat menginstal paket khusus atau memodifikasi paket sistem, konflik dapat muncul yang mencegah operasi cluster yang tepat.
Cara mendiagnosis
-
Periksa log chef-client untuk kesalahan terkait paket:
$less /var/log/chef-client.log -
Cari konflik ketergantungan paket di log cfn-init:
$less /var/log/cfn-init.log
Bagaimana cara menyelesaikannya
-
Jika paket tertentu menyebabkan masalah, coba instal ulang:
$sudo yum reinstall package-name -
Untuk konflik ketergantungan, Anda mungkin perlu menghapus paket yang saling bertentangan:
$sudo yum remove conflicting-package -
Jika masalah berlanjut, pertimbangkan untuk membuat AMI khusus dengan paket yang Anda butuhkan sudah diinstal sebelumnya menggunakan
pcluster build-imageperintah. Untuk informasi selengkapnya, lihat AWS ParallelCluster Kustomisasi AMI.
Modifikasi file konfigurasi sistem
Memodifikasi file konfigurasi sistem penting dapat menyebabkan kegagalan cluster, terutama jika file ini dikelola oleh AWS ParallelCluster.
Cara mendiagnosis
-
Periksa kesalahan dalam log chef-client yang menyebutkan file konfigurasi tertentu:
$grep -i "config" /var/log/chef-client.log -
Cari izin atau kesalahan sintaks dalam file konfigurasi:
$less /var/log/cfn-init.log
Bagaimana cara menyelesaikannya
-
Kembalikan file konfigurasi yang dimodifikasi ke keadaan semula:
$sudo cp /etc/file.conf.bak /etc/file.conf -
Jika Anda perlu membuat perubahan terus-menerus pada file konfigurasi sistem, gunakan tindakan bootstrap khusus alih-alih memodifikasi file secara langsung:
HeadNode: CustomActions: OnNodeConfigured: Script: s3://bucket-name/config-script.shUntuk informasi selengkapnya, lihat Tindakan bootstrap khusus.
-
Untuk perubahan konfigurasi yang harus dilakukan langsung ke file sistem, pertimbangkan untuk membuat AMI khusus. Untuk informasi selengkapnya, lihat AWS ParallelCluster Kustomisasi AMI.
Pembaruan kernel dan masalah kompatibilitas
Pembaruan kernel dapat menyebabkan masalah kompatibilitas dengan AWS layanan tertentu, terutama dengan Amazon FSx for Lustre.
Cara mendiagnosis
-
Periksa apakah pembaruan kernel telah diterapkan:
$uname -r -
Cari kegagalan pemasangan Amazon FSx di log:
$grep -i "fsx" /var/log/chef-client.log
Bagaimana cara menyelesaikannya
-
Untuk Ubuntu 22.04, hindari memperbarui ke kernel terbaru karena tidak ada klien Amazon FSx untuk kernel itu. Untuk informasi selengkapnya, lihat Pertimbangan sistem operasi.
-
Jika Anda telah memperbarui kernel dan mengalami masalah, pertimbangkan untuk menurunkan versi ke versi kernel yang kompatibel:
$sudo apt install linux-image-previous-version -
Untuk penyesuaian kernel persisten, buat AMI khusus dengan versi kernel spesifik yang Anda butuhkan. Untuk informasi selengkapnya, lihat AWS ParallelCluster Kustomisasi AMI.
Praktik terbaik untuk perubahan konfigurasi OS
Untuk meminimalkan masalah saat membuat perubahan konfigurasi OS:
-
Gunakan Tindakan Bootstrap Kustom: Alih-alih memodifikasi file sistem secara langsung, gunakan
OnNodeStartatauOnNodeConfiguredskrip untuk membuat perubahan dengan cara yang terkontrol. Untuk informasi selengkapnya, lihat Tindakan bootstrap khusus. -
Buat AMI Kustom: Untuk modifikasi OS yang signifikan, buat AMI kustom menggunakan alih-
pcluster build-imagealih membuat perubahan pada instans yang sedang berjalan. Untuk informasi selengkapnya, lihat AWS ParallelCluster Kustomisasi AMI. -
Uji Perubahan Pertama: Sebelum menerapkan perubahan ke cluster produksi, ujilah pada cluster pengujian kecil untuk memastikan kompatibilitas.
-
Perubahan Dokumen: Melacak semua perubahan konfigurasi OS yang dibuat untuk memfasilitasi pemecahan masalah.
-
File Konfigurasi Cad angan: Sebelum memodifikasi file konfigurasi sistem apa pun, buat cadangan:
$sudo cp /etc/file.conf /etc/file.conf.bak -
Periksa Log Setelah Perubahan: Setelah membuat perubahan konfigurasi OS, periksa log untuk kesalahan:
$less /var/log/cfn-init.log$less /var/log/chef-client.log
Dengan mengikuti panduan ini, Anda dapat meminimalkan risiko perubahan konfigurasi OS yang menyebabkan kegagalan cluster dan lebih efektif memecahkan masalah apa pun yang muncul.