View a markdown version of this page

Bagian penjadwalan - AWS ParallelCluster

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Bagian penjadwalan

(Diperlukan) Mendefinisikan penjadwal pekerjaan yang digunakan dalam cluster dan instance komputasi yang dikelola oleh penjadwal pekerjaan. Anda dapat menggunakan pen AWS Batch jadwal Slurm atau. Masing-masing mendukung serangkaian pengaturan dan properti yang berbeda.

Scheduling: Scheduler: slurm ScalingStrategy: string SlurmSettings: MungeKeySecretArn: string ScaledownIdletime: integer QueueUpdateStrategy: string EnableMemoryBasedScheduling: boolean CustomSlurmSettings: [dict] CustomSlurmSettingsIncludeFile: string Database: Uri: string UserName: string PasswordSecretArn: string DatabaseName: string ExternalSlurmdbd: boolean Host: string Port: integer Dns: DisableManagedDns: boolean HostedZoneId: string UseEc2Hostnames: boolean SlurmQueues: - Name: string ComputeSettings: LocalStorage: RootVolume: Size: integer Encrypted: boolean VolumeType: string Iops: integer Throughput: integer EphemeralVolume: MountDir: string CapacityReservationTarget: CapacityReservationId: string CapacityReservationResourceGroupArn: string CapacityType: string AllocationStrategy: string JobExclusiveAllocation: boolean CustomSlurmSettings: dict Tags: - Key: string Value: string HealthChecks: Gpu: Enabled: boolean Networking: SubnetIds: - string AssignPublicIp: boolean SecurityGroups: - string AdditionalSecurityGroups: - string PlacementGroup: Enabled: boolean Id: string Name: string Proxy: HttpProxyAddress: string ComputeResources: - Name: string InstanceType: string Instances: - InstanceType: string MinCount: integer MaxCount: integer DynamicNodePriority: integer StaticNodePriority: integer SpotPrice: float DisableSimultaneousMultithreading: boolean SchedulableMemory: integer HealthChecks: Gpu: Enabled: boolean Efa: Enabled: boolean GdrSupport: boolean CapacityReservationTarget: CapacityReservationId: string CapacityReservationResourceGroupArn: string Networking: PlacementGroup: Enabled: boolean Name: string CustomSlurmSettings: dict Tags: - Key: string Value: string LaunchTemplateOverrides: LaunchTemplateId: string Version: string CustomActions: OnNodeStart: Sequence: - Script: string Args: - string Script: string Args: - string OnNodeConfigured: Sequence: - Script: string Args: - string Script: string Args: - string Iam: InstanceProfile: string InstanceRole: string S3Access: - BucketName: string EnableWriteAccess: boolean KeyName: string AdditionalIamPolicies: - Policy: string Image: CustomAmi: string
Scheduling: Scheduler: awsbatch AwsBatchQueues: - Name: string CapacityType: string Networking: SubnetIds: - string AssignPublicIp: boolean SecurityGroups: - string AdditionalSecurityGroups: - string ComputeResources: # this maps to a Batch compute environment (initially we support only 1) - Name: string InstanceTypes: - string MinvCpus: integer DesiredvCpus: integer MaxvCpus: integer SpotBidPercentage: float

Pro perti penjadwalan

Scheduler(Diperlukan,String)

Menentukan jenis penjadwal yang digunakan. Nilai yang didukung adalah slurm dan awsbatch.

Kebijakan pembaruan: Jika pengaturan ini diubah, pembaruan tidak diizinkan.

catatan

awsbatchhanya mendukung sistem alinux2 operasi dan x86_64 platform.

ScalingStrategy(Opsional,String)

Memungkinkan Anda memilih bagaimana Slurm node dinamis ditingkatkan. Nilai yang didukung adalahall-or-nothing, greedy-all-or-nothing dan best-effort Nilai defaultnya adalahall-or-nothing.

Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.

catatan

Strategi penskalaan hanya berlaku untuk node yang akan dilanjutkan oleh Slurm, bukan untuk node yang akhirnya sudah berjalan.

  • all-or-nothingStrategi ini secara ketat mengikuti pendekatan semua atau tidak sama sekali, yang bertujuan untuk menghindari instance idle di akhir proses penskalaan. Ini beroperasi atas dasar semua atau tidak sama sekali, artinya dapat ditingkatkan sepenuhnya atau tidak sama sekali. Ketahuilah bahwa mungkin ada biaya tambahan karena instans yang diluncurkan sementara, ketika pekerjaan memerlukan lebih dari 500 node atau menjangkau beberapa sumber daya komputasi. Strategi ini memiliki throughput terendah di antara tiga Strategi Penskalaan yang mungkin. Waktu penskalaan tergantung pada jumlah pekerjaan yang dikirimkan per eksekusi program Slurm resume. Selain itu, Anda tidak dapat menskalakan jauh melampaui batas akun RunInstances sumber daya default per eksekusi, yaitu 1000 instans secara default. Rincian lebih lanjut dapat ditemukan di dokumentasi pel ambatan API Amazon EC2

  • greedy-all-or-nothing Mirip dengan strategi semua atau tidak sama sekali, ini bertujuan untuk menghindari instans idle pasca-penskalaan. Strategi ini memungkinkan peningkatan skala sementara selama proses penskalaan untuk mencapai throughput yang lebih tinggi daripada pendekatan all-or-nothing tetapi juga dilengkapi dengan batas penskalaan yang sama yaitu 1000 instance sesuai batas akun RunInstances sumber daya.

  • best-effort Strategi ini memprioritaskan throughput tinggi, meskipun itu berarti bahwa beberapa instance mungkin tidak aktif di akhir proses penskalaan. Ini mencoba mengalokasikan node sebanyak yang diminta oleh pekerjaan, tetapi ada kemungkinan tidak memenuhi seluruh permintaan. Tidak seperti strategi lain, pendekatan upaya terbaik dapat mengakumulasi lebih banyak instance daripada RunInstances batas standar, dengan biaya memiliki sumber daya idle di sepanjang beberapa eksekusi proses penskalaan.

Setiap strategi dirancang untuk memenuhi kebutuhan penskalaan yang berbeda, memungkinkan Anda memilih salah satu yang memenuhi persyaratan dan batasan spesifik Anda.

AwsBatchQueues

(Opsional) Pengaturan AWS Batch antrian. Hanya satu antrian yang didukung. Jika Scheduler disetel keawsbatch, bagian ini diperlukan. Untuk informasi selengkapnya tentang pen awsbatch jadwal, lihat pengaturan jaringan danMenggunakan AWS Batch (awsbatch) scheduler dengan AWS ParallelCluster.

AwsBatchQueues: - Name: string CapacityType: string Networking: SubnetIds: - string AssignPublicIp: boolean SecurityGroups: - string AdditionalSecurityGroups: - string ComputeResources: # this maps to a Batch compute environment (initially we support only 1) - Name: string InstanceTypes: - string MinvCpus: integer DesiredvCpus: integer MaxvCpus: integer SpotBidPercentage: float

Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.

AwsBatchQueuesproperti

Name(Diperlukan,String)

Nama an AWS Batch trian.

Kebijakan pembaruan: Jika pengaturan ini diubah, pembaruan tidak diizinkan.

CapacityType(Opsional,String)

Jenis sumber daya komputasi yang digunakan AWS Batch antrian. Nilai yang didukung adalahONDEMAND, SPOT atauCAPACITY_BLOCK. Nilai default-nya adalah ONDEMAND.

catatan

Jika Anda menyet CapacityType el keSPOT, akun Anda harus berisi peran AWSServiceRoleForEC2Spot terkait layanan. Anda dapat membuat peran ini menggunakan AWS CLI perintah berikut.

$ aws iam create-service-linked-role --aws-service-name spot.amazonaws.com

Untuk informasi selengkapnya, lihat Service-linked peran untuk permintaan Instans Spot di Panduan Pengguna Amazon Amazon EC2 untuk Inst ans Linux.

Kebijakan pembaruan: Armada komputasi harus dihentikan agar pengaturan ini diubah untuk pembaruan.

Jaringan

(Diperlukan) Mendefinisikan konfigurasi jaringan untuk an AWS Batch trian.

Networking: SubnetIds: - string AssignPublicIp: boolean SecurityGroups: - string AdditionalSecurityGroups: - string
Pro perti jaringan
SubnetIds(Diperlukan,[String])

Menentukan ID subnet yang ada untuk menyediakan an AWS Batch trian. Saat ini hanya satu subnet yang didukung.

Kebijakan pembaruan: Armada komputasi harus dihentikan agar pengaturan ini diubah untuk pembaruan.

AssignPublicIp(Opsional,String)

Membuat atau menetapkan alamat IP publik ke node dalam AWS Batch antrian. Nilai yang didukung adalah true dan false. Defaultnya tergantung pada subnet yang Anda tentukan.

Kebijakan pembaruan: Jika pengaturan ini diubah, pembaruan tidak diizinkan.

SecurityGroups(Opsional,[String])

Daftar grup keamanan yang digunakan an AWS Batch trian. Jika Anda tidak menentukan grup keamanan, AWS ParallelCluster buat grup keamanan baru.

Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.

AdditionalSecurityGroups(Opsional,[String])

Daftar grup keamanan yang digunakan an AWS Batch trian.

Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.

ComputeResources

(Diperlukan) Mendefinisikan ComputeResources konfigurasi untuk an AWS Batch trian.

ComputeResources: # this maps to a Batch compute environment (initially we support only 1) - Name: string InstanceTypes: - string MinvCpus: integer DesiredvCpus: integer MaxvCpus: integer SpotBidPercentage: float
ComputeResourcesproperti
Name(Diperlukan,String)

Nama lingkungan komputasi AWS Batch antrian.

Kebijakan pembaruan: Armada komputasi harus dihentikan agar pengaturan ini diubah untuk pembaruan.

InstanceTypes(Diperlukan,[String])

Array lingkungan AWS Batch komputasi dari tipe instance. Semua jenis instance harus menggunakan x86_64 arsitektur.

Kebijakan pembaruan: Armada komputasi harus dihentikan agar pengaturan ini diubah untuk pembaruan.

MinvCpus(Opsional,Integer)

Jumlah minimum vCPU yang dapat digunakan oleh lingkungan AWS Batch komputasi.

Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.

DesiredVcpus(Opsional,Integer)

Jumlah vCPU yang diinginkan di lingkungan AWS Batch komputasi. AWS Batch menyesuaikan nilai ini antara MinvCpus dan MaxvCpus berdasarkan permintaan dalam antrian pekerjaan.

Kebijakan pembaruan: Pengaturan ini tidak dianalisis selama pembaruan.

MaxvCpus(Opsional,Integer)

Jumlah maksimum vCPU untuk lingkungan AWS Batch komputasi. Anda tidak dapat mengatur ini ke nilai yang lebih rendah dariDesiredVcpus.

Kebijakan pembaruan: Pengaturan ini tidak dapat dikurangi selama pembaruan.

SpotBidPercentage(Opsional,Float)

Persentase maksimum On-Demand harga untuk jenis instans yang dapat dicapai oleh harga Instans Spot Amazon EC2 sebelum instance diluncurkan. Nilai defaultnya adalah 100 (100%). Rentang yang didukung adalah 1 -100.

Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.

SlurmQueues

(Opsional) Pengaturan untuk an Slurm trian. Jika Scheduler disetel keslurm, bagian ini diperlukan.

SlurmQueues: - Name: string ComputeSettings: LocalStorage: RootVolume: Size: integer Encrypted: boolean VolumeType: string Iops: integer Throughput: integer EphemeralVolume: MountDir: string CapacityReservationTarget: CapacityReservationId: string CapacityReservationResourceGroupArn: string CapacityType: string AllocationStrategy: string JobExclusiveAllocation: boolean CustomSlurmSettings: dict Tags: - Key: string Value: string HealthChecks: Gpu: Enabled: boolean Networking: SubnetIds: - string AssignPublicIp: boolean SecurityGroups: - string AdditionalSecurityGroups: - string PlacementGroup: Enabled: boolean Id: string Name: string Proxy: HttpProxyAddress: string ComputeResources: - Name: string InstanceType: string Instances: - InstanceType: string MinCount: integer MaxCount: integer DynamicNodePriority: integer StaticNodePriority: integer SpotPrice: float DisableSimultaneousMultithreading: boolean SchedulableMemory: integer HealthChecks: Gpu: Enabled: boolean Efa: Enabled: boolean GdrSupport: boolean CapacityReservationTarget: CapacityReservationId: string CapacityReservationResourceGroupArn: string Networking: PlacementGroup: Enabled: boolean Name: string CustomSlurmSettings: dict Tags: - Key: string Value: string LaunchTemplateOverrides: LaunchTemplateId: string Version: string CustomActions: OnNodeStart: Sequence: - Script: string Args: - string Script: string Args: - string OnNodeConfigured: Sequence: - Script: string Args: - string Script: string Args: - string Iam: InstanceProfile: string InstanceRole: string S3Access: - BucketName: string EnableWriteAccess: boolean KeyName: string AdditionalIamPolicies: - Policy: string Image: CustomAmi: string

Kebijakan pembaruan: Untuk pengaturan nilai daftar ini, nilai baru dapat ditambahkan selama pembaruan atau armada komputasi harus dihentikan saat menghapus nilai yang ada.

SlurmQueuesproperti

Name(Diperlukan,String)

Nama an Slurm trian.

catatan

Ukuran cluster dapat berubah selama pembaruan. Untuk informasi selengkapnya, lihat Ukuran kapasitas cluster dan pembaruan

Kebijakan pembaruan: Jika pengaturan ini diubah, pembaruan tidak diizinkan.

CapacityReservationTarget
catatan

CapacityReservationTargetditambahkan dengan AWS ParallelCluster versi 3.3.0.

CapacityReservationTarget: CapacityReservationId: string CapacityReservationResourceGroupArn: string

Menentukan reservasi On-Demand kapasitas untuk sumber daya komputasi antrian.

CapacityReservationId(Opsional,String)

ID reservasi kapasitas yang ada untuk ditargetkan untuk sumber daya komputasi antrian. ID dapat merujuk ke ODCR atau Blok Kapasitas untuk ML.

Reservasi harus menggunakan platform yang sama dengan yang digunakan instance. Misalnya, jika instans Anda berjalanrhel8, reservasi kapasitas Anda harus berjalan di platform Red Hat Enterprise Linux. Untuk informasi selengkapnya, lihat Platform yang didukung di Panduan Pengguna Amazon EC2 untuk Inst ans Linux.

catatan

Jika Anda menyertakan Instances dalam konfigurasi cluster, Anda harus mengecualikan CapacityReservationId pengaturan tingkat antrian ini dari konfigurasi.

Kebijakan pembaruan: Armada komputasi harus dihentikan atau QueueUpdateStrategyharus disetel agar pengaturan ini diubah untuk pembaruan.

CapacityReservationResourceGroupArn(Opsional,String)

Nama Sumber Daya Amazon (ARN) dari grup sumber daya yang berfungsi sebagai grup reservasi kapasitas terkait layanan untuk sumber daya komputasi antrian. AWS ParallelCluster mengidentifikasi dan menggunakan reservasi kapasitas yang paling tepat dari grup sumber daya berdasarkan kondisi berikut:

Grup sumber daya harus memiliki setidaknya satu ODCR untuk setiap jenis instans yang dicadangkan di Zona Ketersediaan di semua sumber daya komputasi antrian dan Zona Ketersediaan. Untuk informasi selengkapnya, lihat Luncurkan instans dengan Pemesanan Kapasitas Sesuai Permintaan (ODCR).

Untuk informasi selengkapnya tentang beberapa persyaratan konfigurasi subnet, lihat Networking/SubnetIds.

catatan

Beberapa Zona Ketersediaan ditambahkan dalam AWS ParallelCluster versi 3.4.0.

Kebijakan pembaruan: Armada komputasi harus dihentikan atau QueueUpdateStrategyharus disetel agar pengaturan ini diubah untuk pembaruan.

CapacityType(Opsional,String)

Jenis sumber daya komputasi yang digunakan Slurm antrian. Nilai yang didukung adalahONDEMAND, SPOT atauCAPACITY_BLOCK. Nilai default-nya adalah ONDEMAND.

catatan

Jika Anda menyet CapacityType el keSPOT, akun Anda harus memiliki peran AWSServiceRoleForEC2Spot terkait layanan. Anda dapat menggunakan AWS CLI perintah berikut untuk membuat peran ini.

$ aws iam create-service-linked-role --aws-service-name spot.amazonaws.com

Untuk informasi selengkapnya, lihat Service-linked peran untuk permintaan Instans Spot di Panduan Pengguna Amazon Amazon EC2 untuk Inst ans Linux.

Kebijakan pembaruan: Armada komputasi harus dihentikan atau QueueUpdateStrategyharus disetel agar pengaturan ini diubah untuk pembaruan.

AllocationStrategy(Opsional,String)

Tentukan strategi alokasi untuk semua sumber daya komputasi yang ditentukan dalam Instances.

Nilai yang valid: lowest-price capacity-optimized | price-capacity-optimized | prioritized | capacity-optimized-prioritized

CapacityType Strategi yang diizinkan
SESUAI PERMINTAAN harga terendah, diprioritaskan
TEMPAT harga terendah, dioptimalkan kapasitas, dioptimalkan kapasitas harga, dioptimalkan kapasitas diprioritaskan
KAPASITAS_BLOK Tidak didukung - AllocationStrategy tidak dapat dikonfigurasi

Default: lowest-price

lowest-price
  • Jika Anda menggunakanCapacityType = ONDEMAND, Amazon EC2 Fleet menggunakan harga untuk menentukan pesanan dan meluncurkan instans harga terendah terlebih dahulu.

  • Jika Anda menggunakanCapacityType = SPOT, Amazon EC2 Fleet meluncurkan instans dari kumpulan Instans Spot harga terendah yang memiliki kapasitas tersedia. Jika kumpulan kehabisan kapasitas sebelum memenuhi kapasitas yang Anda butuhkan, Amazon EC2 Fleet memenuhi permintaan Anda dengan meluncurkan instans untuk Anda. Secara khusus, Amazon EC2 Fleet meluncurkan instans dari kumpulan Instans Spot harga terendah yang memiliki kapasitas yang tersedia. Amazon EC2 Fleet mungkin meluncurkan Instans Spot dari beberapa kumpulan yang berbeda.

  • Jika Anda mengaturCapacityType = CAPACITY_BLOCK, tidak ada strategi alokasi, sehingga AllocationStrategy parameter tidak dapat dikonfigurasi.

capacity-optimized
  • Jika Anda mengatur CapacityType = ONDEMANDcapacity-optimized, tidak tersedia.

  • Jika Anda menyet CapacityType = SPOT el, Amazon EC2 Fleet meluncurkan instans dari kumpulan Instans Spot dengan kapasitas optimal untuk jumlah instans yang akan diluncurkan.

price-capacity-optimized
  • Jika Anda mengatur CapacityType = ONDEMANDcapacity-optimized, tidak tersedia.

  • Jika Anda meny CapacityType = SPOT etel, Amazon EC2 Fleet mengidentifikasi kumpulan dengan ketersediaan kapasitas tertinggi untuk jumlah instans yang diluncurkan. Hal ini berarti bahwa kami akan meminta Instans Spot dari kolam yang kami yakini memiliki peluang interupsi terendah dalam waktu dekat. Amazon EC2 Fleet kemudian meminta Instans Spot dari kumpulan ini dengan harga terendah.

prioritized
  • Jika Anda meny CapacityType = ONDEMAND etel, Amazon EC2 Fleet menghormati urutan prioritas yang AWS ParallelCluster berlaku untuk peng LaunchTemplate gantian saat beberapa subnet ditentukan. AWS ParallelCluster memperoleh penggantian priority dari posisi subnet target SlurmQueues/Networking/SubnetIds dengan Subnet pertama mendapatkan prioritas tertinggi. Prioritas didorong AWS ParallelCluster dalam urutan menurun dariSlurmQueues/Networking/SubnetIds, dengan yang pertama SubnetId memiliki prioritas tertinggi dan subnetID terakhir memiliki prioritas terendah.

  • Jika Anda mengatur CapacityType = SPOTprioritized, tidak tersedia.

capacity-optimized-prioritized
  • Jika Anda mengatur CapacityType = ONDEMANDcapacity-optimized-prioritized, tidak tersedia.

  • Jika Anda menyet CapacityType = SPOT el, Amazon EC2 Fleet mengoptimalkan kapasitas terlebih dahulu dan kemudian menerapkan, berdasarkan upaya terbaik, urutan prioritas yang ditetapkan untuk penggantian AWS ParallelCluster . LaunchTemplate Prioritas didorong AWS ParallelCluster dalam urutan menurun dariSlurmQueues/Networking/SubnetIds, dengan yang pertama SubnetId memiliki prioritas tertinggi dan subnetID terakhir memiliki prioritas terendah. Semua penggantian yang menargetkan subnet yang sama menerima nilai prioritas yang sama.

Kebijakan pembaruan: Armada komputasi harus dihentikan atau QueueUpdateStrategyharus disetel agar pengaturan ini diubah untuk pembaruan.

catatan

AllocationStrategydidukung mulai AWS ParallelCluster versi 3.3.0.

Baru di 3.14.0: prioritized (untuk On-Demand) dan capacity-optimized-prioritized (untuk Spot).

JobExclusiveAllocation(Opsional,String)

Jika disetel ketrue, ben OverSubscribe dera Slurm partisi disetel keEXCLUSIVE. Ketika OverSubscribe =EXCLUSIVE, pekerjaan di partisi memiliki akses eksklusif ke semua node yang dialokasikan. Untuk informasi lebih lanjut, lihat EKSKLU SIF dalam Slurm dokumentasi.

Nilai yang valid: true | false

Default: false

Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.

catatan

JobExclusiveAllocationdidukung mulai AWS ParallelCluster versi 3.7.0.

CustomSlurmSettings(Opsional,Dict)

Mendefinisikan pengaturan konfigurasi Slurm partisi kustom (antrian).

Menentukan kamus pasangan kunci-nilai parameter Slurm konfigurasi kustom yang berlaku untuk antrian (partisi).

Setiap pasangan kunci-nilai yang terpisahParam1: Value1, seperti, ditambahkan secara terpisah ke akhir baris konfigurasi Slurm partisi dalam format. Param1=Value1

Anda hanya dapat menentukan parameter Slurm konfigurasi yang tidak dicantumkan di. CustomSlurmSettings Untuk informasi tentang parameter Slurm konfigurasi yang dicantumkan, lihat. Terdaftar penolakan Slurm parameter konfigurasi untuk CustomSlurmSettings

AWS ParallelCluster hanya memeriksa apakah parameter ada dalam daftar tolak. AWS ParallelCluster tidak memvalidasi sintaks atau semantik parameter Slurm konfigurasi kustom Anda. Adalah tanggung jawab Anda untuk memvalidasi parameter Slurm konfigurasi kustom Anda. Parameter Slurm konfigurasi kustom yang tidak valid dapat menyebabkan kegagalan Slurm daemon yang dapat menyebabkan kegagalan pembuatan dan pembaruan cluster.

Untuk informasi selengkapnya tentang cara menentukan parameter Slurm konfigurasi khusus dengan AWS ParallelCluster, lihatSlurm kustomisasi konfigurasi.

Untuk informasi selengkapnya tentang parameter Slurm konfigurasi, lihat slurm.conf dalam dokumentasi. Slurm

Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.

catatan

CustomSlurmSettingsdidukung mulai dengan AWS ParallelCluster versi 3.6.0.

Tags(Opsional, [String])

Daftar pasangan nilai kunci tag. ComputeResourcetag menggantikan tag duplikat yang ditentukan dalam Bagian tag atau diSlurmQueues/Tags.

Key(Opsional,String)

Kunci tanda.

Value(Opsional,String)

Nilai tanda.

Kebijakan pembaruan: Armada komputasi harus dihentikan atau QueueUpdateStrategyharus disetel agar pengaturan ini diubah untuk pembaruan.

HealthChecks(Opsional)

Tentukan pemeriksaan kesehatan simpul komputasi pada semua sumber daya komputasi dalam antrian.

Gpu(Opsional)

Tentukan pemeriksaan kesehatan GPU pada semua sumber daya komputasi dalam antrian.

catatan

AWS ParallelCluster tidak mendukungHealthChecks/Gpudi node yang menggunakan sistem operasi alinux2 ARM. Platform ini tidak mendukung NVIDIA Data Center GPU Manager (DCGM).

penting

Pemeriksaan kesehatan GPU bawaan menjalankan diagnostik NVIDIA DCGM level-2 di prolog. Slurm Aktifkan hanya dengan alokasi eksklusif pekerjaan (satu pekerjaan per node; setJobExclusiveAllocation: true). Jangan mengaktifkannya pada instans GPU P6, P6e, atau yang lebih baru. P-family Lihat perinciannya di Praktik terbaik: Pemeriksaan kesehatan GPU.

Enabled(Opsional,Boolean)

Apakah AWS ParallelCluster melakukan pemeriksaan kesehatan GPU pada node komputasi. Nilai default-nya false.

Peril aku pemeriksaan kesehatan GPU
  • JikaGpu/Enableddisetel ketrue, AWS ParallelCluster melakukan pemeriksaan kesehatan GPU pada sumber daya komputasi dalam antrian.

  • Pemer Gpu iksaan kesehatan melakukan pemeriksaan kesehatan GPU pada sumber daya komputasi untuk mencegah pengiriman pekerjaan pada node dengan GPU terdegradasi.

  • Jika node komputasi gagal dalam pemeriksaan Gpu kesehatan, status simpul komputasi berubah menjadi. DRAIN Pekerjaan baru tidak dimulai di node ini. Pekerjaan yang ada berjalan sampai selesai. Setelah semua pekerjaan berjalan selesai, node komputasi berakhir jika itu adalah node dinamis, dan diganti jika itu adalah node statis.

  • Durasi pemeriksaan Gpu kesehatan tergantung pada jenis instans yang dipilih, jumlah GPU dalam instans, total memori GPU, dan jumlah target pemeriksaan Gpu kesehatan (setara dengan jumlah target GPU pekerjaan). Misalnya, pada p4d.24xlarge, durasi tipikal adalah 3 menit.

  • Jika pemeriksaan Gpu kesehatan berjalan pada instance yang tidak didukung, instans akan keluar dan pekerjaan berjalan pada node komputasi. Misalnya, jika instance tidak memiliki GPU, atau, jika instance memiliki GPU, tetapi bukan GPU NVIDIA, pemeriksaan kesehatan akan keluar dan pekerjaan berjalan pada node komputasi. Hanya GPU NVIDIA yang didukung.

  • Pemer Gpu iksaan kesehatan menggunakan dcgmi alat untuk melakukan pemeriksaan kesehatan pada node dan mengambil langkah-langkah berikut:

    Ketika pemeriksaan Gpu kesehatan dimulai di simpul:

    1. Ini mendeteksi apakah nvidia-dcgm dan nvidia-fabricmanager layanan sedang berjalan.

    2. Jika layanan ini tidak berjalan, pemeriksaan Gpu kesehatan akan memulainya.

    3. Ini mendeteksi apakah mode persistensi diaktifkan.

    4. Jika mode persistensi tidak diaktifkan, pemeriksaan Gpu kesehatan mengaktifkannya.

    Pada akhir pemeriksaan kesehatan, pemeriksaan Gpu kesehatan mengembalikan layanan dan sumber daya ini ke keadaan awal.

  • Jika pekerjaan ditugaskan ke kumpulan GPU node tertentu, pemeriksaan Gpu kesehatan hanya berjalan pada set tertentu. Jika tidak, Gpu pemeriksaan kesehatan berjalan pada semua GPU di node.

  • Jika node komputasi menerima 2 atau lebih permintaan Gpu pemeriksaan kesehatan pada saat yang sama, hanya pemeriksaan kesehatan pertama yang dijalankan dan yang lainnya dilewati. Ini juga berlaku untuk pemeriksaan kesehatan yang menargetkan GPU node. Anda dapat memeriksa file log untuk informasi tambahan mengenai situasi ini.

  • Log pemeriksaan kesehatan untuk node komputasi tertentu tersedia dalam /var/log/parallelcluster/slurm_health_check.log file. File ini tersedia di Amazon CloudWatch, di grup CloudWatch log cluster, di mana Anda dapat menemukan:

    • Rincian tentang tindakan yang dijalankan oleh Gpu pemeriksaan kesehatan, termasuk mengaktifkan dan menonaktifkan layanan dan mode persistensi.

    • Pengidentifikasi GPU, ID serial, dan UUID.

    • Output pemeriksaan kesehatan.

Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.

catatan

HealthChecksdidukung mulai AWS ParallelCluster versi 3.6.0.

Jaringan

(Diperlukan) Mendefinisikan konfigurasi jaringan untuk an Slurm trian.

Networking: SubnetIds: - string AssignPublicIp: boolean SecurityGroups: - string AdditionalSecurityGroups: - string PlacementGroup: Enabled: boolean Id: string Name: string Proxy: HttpProxyAddress: string

Kebijakan pembaruan: Armada komputasi harus dihentikan atau QueueUpdateStrategyharus disetel agar pengaturan ini diubah untuk pembaruan.

Pro perti jaringan
SubnetIds(Diperlukan,[String])

ID subnet yang ada tempat Anda menyediakan an Slurm trian.

Jika Anda mengkonfigurasi jenis instance di SlurmQueues/ComputeResources/InstanceType, Anda hanya dapat menentukan satu subnet.

Jika Anda mengonfigurasi jenis instance di SlurmQueues ComputeResources//Instances, Anda dapat menentukan satu subnet atau beberapa subnet.

Jika Anda menggunakan beberapa subnet, semua subnet yang ditentukan untuk antrian harus berada di VPC yang sama, dengan setiap subnet di Availability Zone (AZ) yang terpisah.

Misalnya, Anda mendefinisikan subnet-1 dan subnet-2 untuk antrian Anda.

subnet-1Dan tidak subnet-2 bisa keduanya masuk AZ-1.

subnet-1bisa masuk AZ-1 dan subnet-2 bisa masuk AZ-2.

Jika Anda mengonfigurasi hanya satu jenis instans dan ingin menggunakan beberapa subnet, tentukan jenis instans Anda Instances bukanInstanceType.

Misalnya, tentukan/ComputeResourcesInstances/InstanceType= al instance.type ih-alihComputeResources/InstanceType=instance.type.

catatan

Adaptor Kain Elastis (EFA) tidak didukung di zona ketersediaan yang berbeda.

Penggunaan beberapa Zona Ketersediaan dapat menyebabkan peningkatan latensi jaringan penyimpanan dan menambah biaya transfer data antar AZ. Misalnya, ini dapat terjadi ketika instance mengakses penyimpanan file yang terletak di AZ yang berbeda. Untuk informasi selengkapnya, lihat Transfer Data dalam hal yang sama Wilayah AWS.

Pembaruan cluster untuk mengubah dari penggunaan subnet tunggal ke beberapa subnet:
  • Misalkan definisi subnet dari sebuah cluster didefinisikan dengan subnet tunggal dan FSx terkel AWS ParallelCluster ola untuk sistem file Lustre. Kemudian, Anda tidak dapat memperbarui cluster ini dengan definisi ID subnet yang diperbarui secara langsung. Untuk membuat pembaruan cluster, Anda harus terlebih dahulu mengubah sistem file terkelola ke sistem file eksternal. Untuk informasi selengkapnya, lihat Mengkonversi AWS ParallelCluster penyimpanan terkelola ke penyimpanan eksternal.

  • Misalkan definisi subnet cluster didefinisikan dengan satu subnet dan sistem file Amazon EFS eksternal jika target pemasangan EFS tidak ada untuk semua AZ untuk beberapa subnet yang ditentukan untuk ditambahkan. Kemudian, Anda tidak dapat memperbarui cluster ini dengan definisi ID subnet yang diperbarui secara langsung. Untuk membuat pembaruan cluster atau membuat cluster, Anda harus terlebih dahulu membuat semua target mount untuk semua AZ untuk beberapa subnet yang ditentukan.

Zona Ketersediaan dan reservasi kapasitas cluster yang ditentukan dalam CapacityReservationResourceGroupArn:
  • Anda tidak dapat membuat cluster jika tidak ada tumpang tindih antara kumpulan jenis instans dan zona ketersediaan yang dicakup oleh grup sumber daya reservasi kapasitas yang ditentukan dan kumpulan jenis instans dan zona ketersediaan yang ditentukan untuk antrian.

  • Anda dapat membuat cluster jika ada tumpang tindih sebagian antara kumpulan jenis instans dan zona ketersediaan yang dicakup oleh grup sumber daya reservasi kapasitas yang ditentukan dan kumpulan jenis instans dan zona ketersediaan yang ditentukan untuk antrian. AWS ParallelCluster mengirimkan pesan peringatan tentang tumpang tindih sebagian untuk kasus ini.

  • Untuk informasi selengkapnya, lihat Luncurkan instans dengan Pemesanan Kapasitas Sesuai Permintaan (ODCR).

catatan

Beberapa Zona Ketersediaan ditambahkan dalam AWS ParallelCluster versi 3.4.0.

Awas

Peringatan ini berlaku untuk semua versi 3.x.y sebelum AWS ParallelCluster versi 3.3.1. AWS ParallelCluster versi 3.3.1 tidak terpengaruh jika parameter ini diubah.

Untuk AWS ParallelCluster 3 versi sebelum versi 3.3.1:

Jika Anda mengubah parameter ini dan memperbarui cluster, ini akan membuat FSx terkelola baru untuk sistem file Lustre dan menghapus sistem file FSx terkelola untuk Lustre yang ada tanpa menyimpan data yang ada. Hal ini mengakibatkan hilangnya data. Sebelum Anda melanjutkan, pastikan Anda membuat cadangan data dari FSx untuk sistem file Lustre yang ada jika Anda ingin menyimpan data. Untuk informasi selengkapnya, lihat Bekerja dengan cadangan di Panduan Pengguna FSx for Lustre.

Jika nilai subnet baru ditambahkan, Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.

Jika nilai subnet dihapus, Kebijakan pembaruan: Armada komputasi harus dihentikan atau QueueUpdateStrategyharus disetel agar pengaturan ini diubah untuk pembaruan.

AssignPublicIp(Opsional,String)

Membuat atau menetapkan alamat IP publik ke node dalam Slurm antrian. Nilai yang didukung adalah true dan false. Subnet yang Anda tentukan menentukan nilai default. Subnet dengan IP publik default untuk menetapkan alamat IP publik.

Jika Anda menentukan jenis hpc6id instans p4d atau, atau jenis instans lain yang memiliki beberapa antarmuka jaringan atau kartu antarmuka jaringan, Anda harus menyet HeadNode el Networking//ElasticIptrueuntuk menyediakan akses publik. AWS IP publik hanya dapat ditetapkan ke instans yang diluncurkan dengan antarmuka jaringan tunggal. Untuk kasus ini, sebaiknya gunakan gateway NAT untuk menyediakan akses publik ke node komputasi cluster. Dalam hal ini, atur AssignPublicIp kefalse. Untuk informasi selengkapnya tentang alamat IP, lihat Menetapkan alamat IPv4 publik selama peluncuran instans di Panduan Pengguna Amazon EC2 untuk Instans Linux.

catatan

Dimulai dengan AWS ParallelCluster versi 3.15.0, persyaratan ini juga berlaku ketika Anda mengaktifkan Efa pada jenis instance kartu jaringan tunggal yang mendukung lebih dari satu antarmuka jaringan. AWS ParallelCluster meluncurkan node komputasi ini dengan dua antarmuka jaringan (antarmuka utama ditambah efa-only antarmuka khusus), sehingga Amazon EC2 tidak secara otomatis menetapkan IP publik untuk mereka. Untuk antrian ini, atur AssignPublicIp ke false dan gunakan gateway NAT (atau tempatkan node komputasi di subnet pribadi) untuk menyediakan akses publik. Untuk informasi selengkapnya, lihat Adaptor Elastic Fabric.

Kebijakan pembaruan: Jika pengaturan ini diubah, pembaruan tidak diizinkan.

SecurityGroups(Opsional,[String])

Daftar grup keamanan yang akan digunakan untuk Slurm antrian. Jika tidak ada grup keamanan yang ditentukan, AWS ParallelCluster buat grup keamanan untuk Anda.

Pastikan grup keamanan dikonfigurasi dengan benar untuk SharedStorage sistem Anda.

Awas

Peringatan ini berlaku untuk semua 3. x. y AWS ParallelCluster versi sebelum versi 3.3.0. AWS ParallelCluster versi 3.3.0 tidak terpengaruh jika parameter ini diubah.

Untuk versi AWS ParallelCluster 3 sebelum versi 3.3.0:

Jika Anda mengubah parameter ini dan memperbarui cluster, ini akan membuat FSx terkelola baru untuk sistem file Lustre dan menghapus sistem file FSx terkelola untuk Lustre yang ada tanpa menyimpan data yang ada. Hal ini mengakibatkan hilangnya data. Pastikan untuk mencadangkan data dari FSx untuk sistem file Lustre yang ada jika Anda ingin menyimpan data. Untuk informasi selengkapnya, lihat Bekerja dengan cadangan di Panduan Pengguna FSx for Lustre.

Awas

Jika Anda mengaktifkan Efa untuk instans komputasi, pastikan instans Anda EFA-enabled adalah anggota grup keamanan yang mengizinkan semua lalu lintas masuk dan keluar untuk dirinya sendiri.

Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.

AdditionalSecurityGroups(Opsional,[String])

Daftar grup keamanan tambahan yang akan digunakan untuk Slurm antrian.

Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.

PlacementGroup(Opsional)

Menentukan pengaturan grup penempatan untuk an Slurm trian.

PlacementGroup: Enabled: boolean Id: string Name: string

Kebijakan pembaruan: Semua node komputasi harus dihentikan untuk penghapusan grup penempatan terkelola. Armada komputasi harus dihentikan atau QueueUpdateStrategyharus disetel agar pengaturan ini diubah untuk pembaruan.

Enabled(Opsional,Boolean)

Menunjukkan apakah grup penempatan digunakan untuk an Slurm trian. Nilai default-nya false.

Kebijakan pembaruan: Armada komputasi harus dihentikan atau QueueUpdateStrategyharus disetel agar pengaturan ini diubah untuk pembaruan.

Id(Opsional,String)

ID grup penempatan untuk grup penempatan cluster yang ada yang digunakan an Slurm trian. Pastikan untuk memberikan ID grup penempatan dan bukan nama.

Kebijakan pembaruan: Armada komputasi harus dihentikan atau QueueUpdateStrategyharus disetel agar pengaturan ini diubah untuk pembaruan.

Name(Opsional,String)

Nama grup penempatan untuk grup penempatan cluster yang ada yang digunakan an Slurm trian. Pastikan untuk memberikan nama grup penempatan dan bukan ID.

Kebijakan pembaruan: Armada komputasi harus dihentikan atau QueueUpdateStrategyharus disetel agar pengaturan ini diubah untuk pembaruan.

catatan
Proxy(Opsional)

Menentukan pengaturan proxy untuk an Slurm trian.

Proxy: HttpProxyAddress: string

Kebijakan pembaruan: Armada komputasi harus dihentikan atau QueueUpdateStrategyharus disetel agar pengaturan ini diubah untuk pembaruan.

HttpProxyAddress(Opsional,String)

Mendefinisikan server proxy HTTP atau HTTPS untuk Slurm antrian. Biasanya, ituhttps://x.x.x.x:8080.

Tidak ada nilai default.

Kebijakan pembaruan: Armada komputasi harus dihentikan atau QueueUpdateStrategyharus disetel agar pengaturan ini diubah untuk pembaruan.

Citra

(Opsional) Menentukan gambar yang akan digunakan untuk an Slurm trian. Untuk menggunakan AMI yang sama untuk semua node, gunakan CustomAmi pengaturan di Image bagian.

Image: CustomAmi: string

Kebijakan pembaruan: Armada komputasi harus dihentikan atau QueueUpdateStrategyharus disetel agar pengaturan ini diubah untuk pembaruan.

Pro perti Gambar
CustomAmi(Opsional,String)

AMI yang akan digunakan untuk Slurm antrian alih-alih AMI default. Anda dapat menggunakan perintah pcluster CLI untuk melihat daftar AMI default.

catatan

AMI harus didasarkan pada sistem operasi yang sama yang digunakan oleh node kepala.

pcluster list-official-images

Jika AMI kustom memerlukan izin tambahan untuk peluncurannya, Anda harus menambahkan izin ini ke kebijakan node kepala.

Misalnya, jika AMI kustom memiliki snapshot terenkripsi yang terkait dengannya, kebijakan tambahan berikut diperlukan dalam kebijakan node kepala.

JSON
{ "Version":"2012-10-17", "Statement": [ { "Effect": "Allow", "Action": [ "kms:DescribeKey", "kms:ReEncrypt*", "kms:CreateGrant", "kms:Decrypt" ], "Resource": [ "arn:aws:kms:us-east-1:111122223333:key/<AWS_KMS_KEY_ID>" ] } ] }

Untuk memecahkan masalah peringatan validasi AMI kustom, lihatMemecahkan masalah AMI khusus.

Kebijakan pembaruan: Armada komputasi harus dihentikan atau QueueUpdateStrategyharus disetel agar pengaturan ini diubah untuk pembaruan.

ComputeResources

(Diperlukan) Mendefinisikan ComputeResources konfigurasi untuk an Slurm trian.

catatan
  • Ukuran cluster dapat berubah selama pembaruan. Untuk informasi selengkapnya, lihat Ukuran kapasitas cluster dan pembaruan.

  • Sumber daya komputasi baru dapat ditambahkan ke cluster hanya jika digunakan di subnet milik blok CIDR yang ada saat cluster dibuat.

ComputeResources: - Name: string InstanceType: string Instances: - InstanceType: string MinCount: integer MaxCount: integer DynamicNodePriority: integer StaticNodePriority: integer SpotPrice: float DisableSimultaneousMultithreading: boolean SchedulableMemory: integer HealthChecks: Gpu: Enabled: boolean Efa: Enabled: boolean GdrSupport: boolean CapacityReservationTarget: CapacityReservationId: string CapacityReservationResourceGroupArn: string Networking: PlacementGroup: Enabled: boolean Name: string CustomSlurmSettings: dict Tags: - Key: string Value: string LaunchTemplateOverrides: LaunchTemplateId: string Version: string

Kebijakan pembaruan: Untuk pengaturan nilai daftar ini, nilai baru dapat ditambahkan selama pembaruan atau armada komputasi harus dihentikan saat menghapus nilai yang ada.

ComputeResourcesproperti
Name(Diperlukan,String)

Nama lingkungan komputasi Slurm antrian. Nama dapat memiliki hingga 25 karakter.

Kebijakan pembaruan: Jika pengaturan ini diubah, pembaruan tidak diizinkan.

InstanceType(Diperlukan,String)

Jenis instance yang digunakan dalam sumber daya Slurm komputasi ini. Semua jenis instance dalam cluster harus menggunakan arsitektur prosesor yang sama. Instans dapat menggunakan arm64 arsitektur x86_64 atau.

Konfigurasi cluster harus menentukan salah satu InstanceType atau Instans. Jika keduanya didefinisikan, AWS ParallelCluster gagal.

Ketika Anda mendefinisikanInstanceType, Anda tidak dapat mendefinisikan beberapa subnet. Jika Anda mengonfigurasi hanya satu jenis instans dan ingin menggunakan beberapa subnet, tentukan jenis instans Anda di, Instances bukan diInstanceType. Untuk informasi lebih lanjut, lihat Networking/SubnetIds.

Jika Anda menentukan jenis hpc6id instans p4d atau, atau jenis instans lain yang memiliki beberapa antarmuka jaringan atau kartu antarmuka jaringan, Anda harus meluncurkan instans komputasi di subnet pribadi seperti yang dijelaskan dalam. AWS ParallelCluster menggunakan dua subnet AWS IP publik hanya dapat ditetapkan ke instans yang diluncurkan dengan antarmuka jaringan tunggal. Untuk informasi selengkapnya, lihat Menetapkan alamat IPv4 publik selama peluncuran instans di Panduan Pengguna Amazon EC2 untuk Instans Linux.

catatan

Dimulai dengan AWS ParallelCluster versi 3.15.0, persyaratan ini juga berlaku ketika Anda mengaktifkan Efa pada jenis instance kartu jaringan tunggal yang mendukung lebih dari satu antarmuka jaringan. Untuk informasi selengkapnya, lihat Adaptor Elastic Fabric.

Kebijakan pembaruan: Armada komputasi harus dihentikan agar pengaturan ini diubah untuk pembaruan.

Instances(Diperlukan)

Menentukan daftar jenis instance untuk sumber daya komputasi. Untuk menentukan strategi alokasi untuk daftar jenis instans, lihat AllocationStrategy.

Konfigurasi cluster harus menentukan salah satu InstanceType atau Instances. Jika keduanya didefinisikan, AWS ParallelCluster gagal.

Untuk informasi selengkapnya, lihat Beberapa alokasi tipe instans dengan Slurm.

Instances: - InstanceType: string
catatan

Dimulai dengan AWS ParallelCluster versi 3.7.0, EnableMemoryBasedScheduling dapat diaktifkan jika Anda mengonfigurasi beberapa jenis instans di Inst ans.

Untuk AWS ParallelCluster versi 3.2.0 hingga 3.6. x, tidak EnableMemoryBasedScheduling dapat diaktifkan jika Anda mengonfigurasi beberapa jenis instans di Instans.

Kebijakan pembaruan: Untuk pengaturan nilai daftar ini, nilai baru dapat ditambahkan selama pembaruan atau armada komputasi harus dihentikan saat menghapus nilai yang ada.

InstanceType(Diperlukan,String)

Jenis instance yang akan digunakan dalam sumber daya Slurm komputasi ini. Semua jenis instance dalam cluster harus menggunakan arsitektur prosesor yang sama, baik x86_64 atauarm64.

Jenis instance yang tercantum di Instances harus memiliki:

Jenis instance yang tercantum di Instances dapat memiliki:

  • Jumlah memori yang berbeda.

    Dalam hal ini, memori minimum harus ditetapkan sebagai Slurm sumber daya yang dapat dikonsumsi.

    catatan

    Dimulai dengan AWS ParallelCluster versi 3.7.0, EnableMemoryBasedScheduling dapat diaktifkan jika Anda mengonfigurasi beberapa jenis instans di Inst ans.

    Untuk AWS ParallelCluster versi 3.2.0 hingga 3.6. x, tidak EnableMemoryBasedScheduling dapat diaktifkan jika Anda mengonfigurasi beberapa jenis instans di Instans.

  • Kartu jaringan yang berbeda.

    Dalam hal ini, jumlah antarmuka jaringan yang dikonfigurasi untuk sumber daya komputasi ditentukan oleh jenis instance dengan jumlah kartu jaringan terkecil.

  • Bandwidth jaringan yang berbeda.

  • Ukuran toko instance yang berbeda.

Jika Anda menentukan jenis hpc6id instans p4d atau, atau jenis instans lain yang memiliki beberapa antarmuka jaringan atau kartu antarmuka jaringan, Anda harus meluncurkan instans komputasi di subnet pribadi seperti yang dijelaskan dalam. AWS ParallelCluster menggunakan dua subnet AWS IP publik hanya dapat ditetapkan ke instans yang diluncurkan dengan antarmuka jaringan tunggal. Untuk informasi selengkapnya, lihat Menetapkan alamat IPv4 publik selama peluncuran instans di Panduan Pengguna Amazon EC2 untuk Instans Linux.

catatan

Dimulai dengan AWS ParallelCluster versi 3.15.0, persyaratan ini juga berlaku ketika Anda mengaktifkan Efa pada jenis instance kartu jaringan tunggal yang mendukung lebih dari satu antarmuka jaringan. Untuk informasi selengkapnya, lihat Adaptor Elastic Fabric.

Kebijakan pembaruan: Armada komputasi harus dihentikan agar pengaturan ini diubah untuk pembaruan.

catatan

Instancesdidukung mulai dengan AWS ParallelCluster versi 3.3.0.

MinCount(Opsional,Integer)

Jumlah minimum instance yang digunakan sumber daya Slurm komputasi. Default-nya adalah 0.

catatan

Ukuran cluster dapat berubah selama pembaruan. Untuk informasi selengkapnya, lihat Ukuran kapasitas cluster dan pembaruan

Kebijakan pembaruan: Armada komputasi harus dihentikan agar pengaturan ini diubah untuk pembaruan.

MaxCount(Opsional,Integer)

Jumlah maksimum instance yang digunakan sumber daya Slurm komputasi. Default-nya adalah 10.

Saat Anda menggunakanCapacityType = CAPACITY_BLOCK, MaxCount harus sama dengan MinCount dan lebih besar dari 0, karena semua bagian instance dari reservasi Blok Kapasitas dikelola sebagai node statis.

Pada waktu pembuatan cluster, node kepala menunggu semua node statis siap sebelum menandakan keberhasilan pembuatan cluster. Namun, saat Anda menggunakanCapacityType = CAPACITY_BLOCK, bagian node dari sumber daya komputasi yang terkait dengan Blok Kapasitas tidak akan dipertimbangkan untuk pemeriksaan ini. Cluster akan dibuat meskipun tidak semua Blok Kapasitas yang dikonfigurasi aktif.

catatan

Ukuran cluster dapat berubah selama pembaruan. Untuk informasi selengkapnya, lihat Ukuran kapasitas cluster dan pembaruan

DynamicNodePriority(Opsional,Integer)

Prioritas node dinamis dalam sumber daya komputasi antrian. Prioritas memetakan ke parameter Weight konfigurasi Slurm node untuk node dinamis sumber daya komputasi. Nilai default-nya adalah 1000.

Slurmmemprioritaskan node dengan Weight nilai terendah terlebih dahulu.

Awas

Penggunaan banyak Weight nilai yang berbeda dalam Slurm partisi (antrian) mungkin memperlambat laju penjadwalan pekerjaan dalam antrian.

Dalam AWS ParallelCluster versi yang lebih awal dari versi 3.7.0, node statis dan dinamis diberi bobot default yang sama dari1. Dalam hal ini, Slurm mungkin memprioritaskan node dinamis idle daripada node statis idle karena skema penamaan untuk node statis dan dinamis. Ketika semua yang lain sama, jadwalkan Slurm node menurut abjad berdasarkan nama.

catatan

DynamicNodePriorityditambahkan dalam AWS ParallelCluster versi 3.7.0.

Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.

StaticNodePriority(Opsional,Integer)

Prioritas node statis dalam sumber daya komputasi antrian. Prioritas memetakan ke parameter Weight konfigurasi Slurm node untuk node statis sumber daya komputasi. Nilai default-nya adalah 1.

Slurmmemprioritaskan node dengan Weight nilai terendah terlebih dahulu.

Awas

Penggunaan banyak Weight nilai yang berbeda dalam Slurm partisi (antrian) mungkin memperlambat laju penjadwalan pekerjaan dalam antrian.

catatan

StaticNodePriorityditambahkan dalam AWS ParallelCluster versi 3.7.0.

Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.

SpotPrice(Opsional,Float)

Harga maksimum yang dibayarkan untuk Instans Spot Amazon EC2 sebelum instans apa pun diluncurkan. Nilai default adalah On-Demand harga.

Kebijakan pembaruan: Armada komputasi harus dihentikan atau QueueUpdateStrategyharus disetel agar pengaturan ini diubah untuk pembaruan.

DisableSimultaneousMultithreading(Opsional,Boolean)

Jikatrue, multithreading pada node dalam Slurm antrian dinonaktifkan. Nilai default-nya adalah false.

Tidak semua jenis instance dapat menonaktifkan multithreading. Untuk daftar jenis instans yang mendukung penonaktifan multithreading, lihat inti dan utas CPU untuk setiap inti CPU per jenis instans di Panduan Pengguna Amazon EC2.

Kebijakan pembaruan: Armada komputasi harus dihentikan agar pengaturan ini diubah untuk pembaruan.

SchedulableMemory(Opsional,Integer)

Jumlah memori di MiB yang dikonfigurasi dalam Slurm parameter RealMemory untuk node komputasi dari sumber daya komputasi. Nilai ini adalah batas atas untuk memori node yang tersedia untuk pekerjaan saat SlurmSettings/EnableMemoryBasedSchedulingdiaktifkan. Nilai default adalah 95 persen dari memori yang tercantum dalam Jenis Instans Amazon EC2 dan dikembalikan oleh Amazon EC2 API. DescribeInstanceTypes Pastikan untuk mengonversi nilai yang diberikan dalam GiB ke MiB.

Nilai yang didukung: 1-EC2Memory

EC2Memoryadalah memori (dalam MiB) yang terdaftar di Amazon EC2 Instance Types dan dikembalikan oleh Amazon EC2 API. DescribeInstanceTypes Pastikan untuk mengonversi nilai yang diberikan dalam GiB ke MiB.

Opsi ini paling relevan bila SlurmSettings/EnableMemoryBasedSchedulingdiaktifkan. Untuk informasi selengkapnya, lihat Slurm penjadwalan berbasis memori.

catatan

SchedulableMemorydidukung mulai dengan AWS ParallelCluster versi 3.2.0.

Dimulai dengan versi 3.2.0, secara default, AWS ParallelCluster mengonfigur RealMemory asi node Slurm komputasi ke 95 persen memori yang dikembalikan oleh Amazon EC2 API. DescribeInstanceTypes Konfigurasi ini tidak tergantung pada nilaiEnableMemoryBasedScheduling.

Kebijakan pembaruan: Armada komputasi harus dihentikan atau QueueUpdateStrategyharus disetel agar pengaturan ini diubah untuk pembaruan.

HealthChecks(Opsional)

Tentukan pemeriksaan kesehatan pada sumber daya komputasi.

Gpu(Opsional)

Tentukan pemeriksaan kesehatan GPU pada sumber daya komputasi.

Enabled(Opsional,Boolean)

Apakah AWS ParallelCluster melakukan pemeriksaan kesehatan GPU pada menghitung sumber daya dalam antrian. Nilai default-nya false.

catatan

AWS ParallelCluster tidak mendukungHealthChecks/Gpudi node yang menggunakan sistem operasi alinux2 ARM. Platform ini tidak mendukung NVIDIA Data Center GPU Manager (DCGM).

Peril aku pemeriksaan kesehatan GPU
  • JikaGpu/Enableddisetel ketrue, AWS ParallelCluster melakukan pemeriksaan kesehatan GPU pada sumber daya komputasi.

  • Pemer Gpu iksaan kesehatan melakukan pemeriksaan kesehatan pada sumber daya komputasi untuk mencegah pengiriman pekerjaan pada node dengan GPU terdegradasi.

  • Jika node komputasi gagal dalam pemeriksaan Gpu kesehatan, status simpul komputasi berubah menjadi. DRAIN Pekerjaan baru tidak dimulai di node ini. Pekerjaan yang ada berjalan sampai selesai. Setelah semua pekerjaan berjalan selesai, node komputasi berakhir jika itu adalah node dinamis, dan diganti jika itu adalah node statis.

  • Durasi pemeriksaan Gpu kesehatan tergantung pada jenis instans yang dipilih, jumlah GPU dalam instans, dan jumlah target pemeriksaan Gpu kesehatan (setara dengan jumlah target GPU pekerjaan). Untuk contoh dengan 8 GPU, durasi tipikal kurang dari 3 menit.

  • Jika pemeriksaan Gpu kesehatan berjalan pada instance yang tidak didukung, instans akan keluar dan pekerjaan berjalan pada node komputasi. Misalnya, jika instance tidak memiliki GPU, atau, jika instance memiliki GPU, tetapi bukan GPU NVIDIA, pemeriksaan kesehatan akan keluar dan pekerjaan berjalan pada node komputasi. Hanya GPU NVIDIA yang didukung.

  • Pemer Gpu iksaan kesehatan menggunakan dcgmi alat untuk melakukan pemeriksaan kesehatan pada node dan mengambil langkah-langkah berikut:

    Ketika pemeriksaan Gpu kesehatan dimulai di simpul:

    1. Ini mendeteksi apakah nvidia-dcgm dan nvidia-fabricmanager layanan sedang berjalan.

    2. Jika layanan ini tidak berjalan, pemeriksaan Gpu kesehatan akan memulainya.

    3. Ini mendeteksi apakah mode persistensi diaktifkan.

    4. Jika mode persistensi tidak diaktifkan, pemeriksaan Gpu kesehatan mengaktifkannya.

    Pada akhir pemeriksaan kesehatan, pemeriksaan Gpu kesehatan mengembalikan layanan dan sumber daya ini ke keadaan awal.

  • Jika pekerjaan ditugaskan ke kumpulan GPU node tertentu, pemeriksaan Gpu kesehatan hanya berjalan pada set tertentu. Jika tidak, Gpu pemeriksaan kesehatan berjalan pada semua GPU di node.

  • Jika node komputasi menerima 2 atau lebih permintaan Gpu pemeriksaan kesehatan pada saat yang sama, hanya pemeriksaan kesehatan pertama yang dijalankan dan yang lainnya dilewati. Ini juga berlaku untuk pemeriksaan kesehatan yang menargetkan GPU node. Anda dapat memeriksa file log untuk informasi tambahan mengenai situasi ini.

  • Log pemeriksaan kesehatan untuk node komputasi tertentu tersedia dalam /var/log/parallelcluster/slurm_health_check.log file. File ini tersedia di Amazon CloudWatch, di grup CloudWatch log cluster, di mana Anda dapat menemukan:

    • Rincian tentang tindakan yang dijalankan oleh Gpu pemeriksaan kesehatan, termasuk mengaktifkan dan menonaktifkan layanan dan mode persistensi.

    • Pengidentifikasi GPU, ID serial, dan UUID.

    • Output pemeriksaan kesehatan.

Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.

catatan

HealthChecksdidukung mulai AWS ParallelCluster versi 3.6.0.

Efa(Opsional)

Menentukan pengaturan Elastic Fabric Adapter (EFA) untuk node dalam Slurm antrian.

Efa: Enabled: boolean GdrSupport: boolean

Kebijakan pembaruan: Armada komputasi harus dihentikan atau QueueUpdateStrategyharus disetel agar pengaturan ini diubah untuk pembaruan.

Enabled(Opsional,Boolean)

Menentukan bahwa Elastic Fabric Adapter (EFA) diaktifkan. Untuk melihat daftar instans Amazon EC2 yang mendukung EFA, lihat Jenis instans yang didukung di Panduan Pengguna Amazon EC2 untuk Instans Linux. Untuk informasi selengkapnya, lihat Elastic Fabric Adapter. Kami menyarankan Anda menggunakan cluster SlurmQueues/Networking/PlacementGroupuntuk meminimalkan latensi antar instance.

Nilai default-nya adalah false.

catatan

Adaptor Kain Elastis (EFA) tidak didukung di zona ketersediaan yang berbeda. Untuk informasi selengkapnya, lihat SubnetIds.

Awas

Jika Anda menentukan grup keamanan khusus di SecurityGroups, pastikan EFA-enabled instans Anda adalah anggota grup keamanan yang mengizinkan semua lalu lintas masuk dan keluar untuk dirinya sendiri.

Kebijakan pembaruan: Armada komputasi harus dihentikan atau QueueUpdateStrategyharus disetel agar pengaturan ini diubah untuk pembaruan.

GdrSupport(Opsional,Boolean)

(Opsional) Dimulai dengan AWS ParallelCluster versi 3.0.2, pengaturan ini tidak berpengaruh. Dukungan Elastic Fabric Adapter (EFA) untuk GPUDirect RDMA (akses memori langsung jarak jauh) selalu diaktifkan jika didukung oleh jenis instance untuk sumber daya Slurm komputasi dan sistem operasi.

Kebijakan pembaruan: Armada komputasi harus dihentikan atau QueueUpdateStrategyharus disetel agar pengaturan ini diubah untuk pembaruan.

CapacityReservationTarget
CapacityReservationTarget: CapacityReservationId: string CapacityReservationResourceGroupArn: string

Menentukan reservasi kapasitas sesuai permintaan yang akan digunakan untuk sumber daya komputasi.

CapacityReservationId(Opsional,String)

ID reservasi kapasitas yang ada untuk ditargetkan untuk sumber daya komputasi antrian. Id dapat merujuk ke ODCR atau Blok Kapasitas untuk ML.

Ketika parameter ini ditentukan pada tingkat sumber daya komputasi, InstanceType adalah opsional, itu akan diambil secara otomatis dari reservasi.

CapacityReservationResourceGroupArn(Opsional,String)

Menunjukkan Nama Sumber Daya Amazon (ARN) dari grup sumber daya yang berfungsi sebagai grup reservasi kapasitas tertaut layanan untuk sumber daya komputasi. AWS ParallelCluster mengidentifikasi dan menggunakan reservasi kapasitas yang paling tepat dari grup. Grup sumber daya harus memiliki setidaknya satu ODCR untuk setiap jenis instans yang terdaftar untuk sumber daya komputasi. Untuk informasi selengkapnya, lihat Luncurkan instans dengan Pemesanan Kapasitas Sesuai Permintaan (ODCR).

Kebijakan pembaruan: Armada komputasi harus dihentikan atau QueueUpdateStrategyharus disetel agar pengaturan ini diubah untuk pembaruan.

catatan

CapacityReservationTargetditambahkan dengan AWS ParallelCluster versi 3.3.0.

Networking
Networking: PlacementGroup: Enabled: boolean Name: string

Kebijakan pembaruan: Semua node komputasi harus dihentikan untuk penghapusan grup penempatan terkelola. Armada komputasi harus dihentikan atau QueueUpdateStrategyharus disetel agar pengaturan ini diubah untuk pembaruan.

PlacementGroup(Opsional)

Menentukan pengaturan grup penempatan untuk sumber daya komputasi.

Enabled(Opsional,Boolean)

Menunjukkan apakah grup penempatan digunakan untuk sumber daya komputasi.

  • Jika disetel ketrue, tanpa Name ditentukan, sumber daya komputasi tersebut diberi grup penempatan terkelola sendiri, terlepas dari PlacementGroup pengaturan SlurmQueues/Networking/.

  • Jika disetel ketrue, dengan yang Name ditentukan, sumber daya komputasi itu ditetapkan grup penempatan bernama, terlepas dari PlacementGroup pengaturanSlurmQueues/Networking/.

Kebijakan pembaruan: Armada komputasi harus dihentikan atau QueueUpdateStrategyharus disetel agar pengaturan ini diubah untuk pembaruan.

Name(Opsional,String)

Nama grup penempatan untuk grup penempatan cluster yang ada yang digunakan untuk sumber daya komputasi.

Kebijakan pembaruan: Armada komputasi harus dihentikan atau QueueUpdateStrategyharus disetel agar pengaturan ini diubah untuk pembaruan.

catatan
  • Jika keduanyaPlacementGroup/Enableddan Name tidak disetel, nilainya masing-masing default ke PlacementGroup pengaturan SlurmQueues Networking//.

  • Saat menggunakan reservasi blok kapasitas, batasan grup penempatan tidak boleh ditetapkan karena kesalahan kapasitas yang tidak mencukupi dapat terjadi karena kendala penempatan di luar reservasi meskipun reservasi kapasitas memiliki kapasitas yang tersisa.

  • ComputeResources/Networking/PlacementGroupditambahkan dengan AWS ParallelCluster versi 3.3.0.

CustomSlurmSettings(Opsional,Dict)

(Opsional) Mendefinisikan pengaturan konfigurasi Slurm node kustom (sumber daya komputasi).

Menentukan kamus pasangan kunci-nilai parameter Slurm konfigurasi kustom yang berlaku untuk Slurm node (sumber daya komputasi).

Setiap pasangan kunci-nilai yang terpisahParam1: Value1, seperti, ditambahkan secara terpisah ke akhir baris konfigurasi Slurm node dalam format. Param1=Value1

Anda hanya dapat menentukan parameter Slurm konfigurasi yang tidak dicantumkan di. CustomSlurmSettings Untuk informasi tentang parameter Slurm konfigurasi yang dicantumkan, lihat. Terdaftar penolakan Slurm parameter konfigurasi untuk CustomSlurmSettings

AWS ParallelCluster hanya memeriksa apakah parameter ada dalam daftar tolak. AWS ParallelCluster tidak memvalidasi sintaks atau semantik parameter Slurm konfigurasi kustom Anda. Adalah tanggung jawab Anda untuk memvalidasi parameter Slurm konfigurasi kustom Anda. Parameter Slurm konfigurasi kustom yang tidak valid dapat menyebabkan kegagalan Slurm daemon yang dapat menyebabkan kegagalan pembuatan dan pembaruan cluster.

Untuk informasi selengkapnya tentang cara menentukan parameter Slurm konfigurasi khusus dengan AWS ParallelCluster, lihatSlurm kustomisasi konfigurasi.

Untuk informasi selengkapnya tentang parameter Slurm konfigurasi, lihat slurm.conf dalam dokumentasi. Slurm

Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.

catatan

CustomSlurmSettingsdidukung mulai dengan AWS ParallelCluster versi 3.6.0.

Tags(Opsional, [String])

Daftar pasangan nilai kunci tag. ComputeResourcetag menggantikan tag duplikat yang ditentukan di Bagian tag atau SlurmQueues/Tags.

Key(Opsional,String)

Kunci tanda.

Value(Opsional,String)

Nilai tanda.

Kebijakan pembaruan: Armada komputasi harus dihentikan atau QueueUpdateStrategyharus disetel agar pengaturan ini diubah untuk pembaruan.

LaunchTemplateOverrides(Opsional)
catatan

LaunchTemplateOverridesditambahkan dengan AWS ParallelCluster versi 3.15.0.

Menentukan template peluncuran untuk mengganti template peluncuran default yang dibuat untuk AWS ParallelCluster sumber daya komputasi. Template peluncuran seharusnya hanya berisi penggantian antarmuka jaringan. AWS ParallelCluster memvalidasi template peluncuran dan mencegah penggantian parameter lain. Untuk informasi selengkapnya tentang cara menggunakan penggantian ini, lihatSesuaikan antarmuka jaringan node komputasi dengan penggantian template peluncuran.

LaunchTemplateOverrides: LaunchTemplateId: string Version: string

ComputeSettings

(Diperlukan) Mendefinisikan ComputeSettings konfigurasi untuk an Slurm trian.

ComputeSettingsproperti

Menentukan properti ComputeSettings dari node dalam Slurm antrian.

ComputeSettings: LocalStorage: RootVolume: Size: integer Encrypted: boolean VolumeType: string Iops: integer Throughput: integer EphemeralVolume: MountDir: string

Kebijakan pembaruan: Armada komputasi harus dihentikan atau QueueUpdateStrategyharus disetel agar pengaturan ini diubah untuk pembaruan.

LocalStorage(Opsional)

Menentukan properti LocalStorage dari node dalam Slurm antrian.

LocalStorage: RootVolume: Size: integer Encrypted: boolean VolumeType: string Iops: integer Throughput: integer EphemeralVolume: MountDir: string

Kebijakan pembaruan: Armada komputasi harus dihentikan atau QueueUpdateStrategyharus disetel agar pengaturan ini diubah untuk pembaruan.

RootVolume(Opsional)

Menentukan rincian volume root dari node dalam Slurm antrian.

RootVolume: Size: integer Encrypted: boolean VolumeType: string Iops: integer Throughput: integer

Kebijakan pembaruan: Armada komputasi harus dihentikan atau QueueUpdateStrategyharus disetel agar pengaturan ini diubah untuk pembaruan.

Size(Opsional,Integer)

Menentukan ukuran volume root dalam gibibytes (GiB) untuk node dalam antrian. Slurm Ukuran default berasal dari AMI. Menggunakan ukuran yang berbeda mengharuskan AMI mendukunggrowroot.

Kebijakan pembaruan: Armada komputasi harus dihentikan atau QueueUpdateStrategyharus disetel agar pengaturan ini diubah untuk pembaruan.

Encrypted(Opsional,Boolean)

Jikatrue, volume root dari node dalam Slurm antrian dienkripsi. Nilai default-nya adalah true.

Kebijakan pembaruan: Armada komputasi harus dihentikan atau QueueUpdateStrategyharus disetel agar pengaturan ini diubah untuk pembaruan.

VolumeType(Opsional,String)

Menentukan jenis volume Amazon EBS dari node dalam Slurm antrian. Nilai yang didukung adalah gp2gp3,io1,,io2,sc1,st1, danstandard. Nilai default-nya adalah gp3.

Untuk informasi lebih lanjut, lihat Jenis volume Amazon EBS di Panduan Pengguna Amazon EC2.

Kebijakan pembaruan: Armada komputasi harus dihentikan atau QueueUpdateStrategyharus disetel agar pengaturan ini diubah untuk pembaruan.

Iops(Opsional,Boolean)

Mendefinisikan jumlah IOPS untukio1,io2, dan volume gp3 tipe.

Nilai default, nilai yang didukung, dan volume_iops volume_size rasio bervariasi menurut VolumeType danSize.

VolumeType = io1

Default Iops = 100

Nilai yang didukung Iops = 100—64000 †

Maksimum volume_iops ke volume_size rasio = 50 IOPS per GiB. 5000 IOPS membutuhkan volume_size setidaknya 100 GiB.

VolumeType = io2

Default Iops = 100

Nilai yang didukung Iops = 100-64000 (256000 untuk volume io2 Block Express) †

Maksimum Iops ke Size rasio = 500 IOPS per GiB. 5000 IOPS membutuhkan Size setidaknya 10 GiB.

VolumeType = gp3

Standar Iops = 3000

Nilai yang didukung Iops = 3000—16000 †

Maksimum Iops ke Size rasio = 500 IOPS per GiB untuk volume dengan IOPS lebih besar dari 3000.

† IOPS maksimum dijamin hanya pada Instans yang dibangun di Sistem Nitro yang juga disediakan dengan lebih dari 32.000 IOPS. Instans lain dapat memiliki hingga 32.000 IOPS. io1Volume sebelumnya mungkin tidak mencapai kinerja penuh kecuali Anda memodifikasi volume. io2 Volume Block Express mendukung volume_iops nilai hingga 256000 pada jenis R5b instans. Untuk informasi selengkapnya, lihat io2 Blok volume Express di Panduan Pengguna Amazon EC2.

Kebijakan pembaruan: Armada komputasi harus dihentikan atau QueueUpdateStrategyharus disetel agar pengaturan ini diubah untuk pembaruan.

Throughput(Opsional,Integer)

Mendefinisikan throughput untuk jenis gp3 volume, di MiB/s. Pengaturan ini hanya berlaku bila VolumeType adagp3. Nilai default-nya adalah 125. Nilai yang didukung: 125—1000 MiB/s

Rasio Throughput to Iops bisa tidak lebih dari 0,25. Throughput maksimum 1000 MiB/s menghar Iops uskan pengaturan setidaknya 4000.

Kebijakan pembaruan: Armada komputasi harus dihentikan atau QueueUpdateStrategyharus disetel agar pengaturan ini diubah untuk pembaruan.

EphemeralVolume(Opsional,Boolean)

Menentukan pengaturan untuk volume sementara. Volume sementara dibuat dengan menggabungkan semua volume penyimpanan instance ke dalam satu volume logis yang diformat dengan sistem ext4 file. Nilai default-nya /scratch. Jika jenis instans tidak memiliki volume penyimpanan instans, tidak ada volume sementara yang dibuat. Untuk informasi selengkapnya, lihat Volume penyimpanan instans di Panduan Pengguna Amazon EC2.

EphemeralVolume: MountDir: string

Kebijakan pembaruan: Armada komputasi harus dihentikan atau QueueUpdateStrategyharus disetel agar pengaturan ini diubah untuk pembaruan.

MountDir(Opsional,String)

Direktori mount untuk volume sementara untuk setiap node dalam antrianSlurm.

Kebijakan pembaruan: Armada komputasi harus dihentikan atau QueueUpdateStrategyharus disetel agar pengaturan ini diubah untuk pembaruan.

CustomActions

(Opsional) Menentukan skrip kustom untuk dijalankan pada node dalam an Slurm trian.

CustomActions: OnNodeStart: Sequence: - Script: string Args: - string Script: string Args: - string OnNodeConfigured: Sequence: - Script: string Args: - string Script: string Args: - string

Kebijakan pembaruan: Armada komputasi harus dihentikan atau QueueUpdateStrategyharus disetel agar pengaturan ini diubah untuk pembaruan.

CustomActionsProperti
OnNodeStart(Opsional,String)

Menentukan urutan skrip atau skrip tunggal untuk dijalankan pada node dalam an Slurm trian sebelum tindakan bootstrap penerapan node dimulai. AWS ParallelCluster tidak mendukung menyertakan satu skrip dan Sequence untuk tindakan kustom yang sama. Untuk informasi selengkapnya, lihat Tindakan bootstrap kustom.

Kebijakan pembaruan: Armada komputasi harus dihentikan atau QueueUpdateStrategyharus disetel agar pengaturan ini diubah untuk pembaruan.

OnNodeConfigured(Opsional,String)

Menentukan urutan skrip atau skrip tunggal untuk dijalankan pada node dalam Slurm antrian setelah semua tindakan bootstrap node selesai. AWS ParallelCluster tidak mendukung menyertakan satu skrip dan Sequence untuk tindakan kustom yang sama. Untuk informasi selengkapnya, lihat Tindakan bootstrap kustom.

Kebijakan pembaruan: Armada komputasi harus dihentikan atau QueueUpdateStrategyharus disetel agar pengaturan ini diubah untuk pembaruan.

catatan

Sequenceditambahkan mulai dengan AWS ParallelCluster versi 3.6.0. Saat Anda menentukanSequence, Anda dapat mencantumkan beberapa skrip untuk tindakan kustom. AWS ParallelCluster terus mendukung konfigurasi tindakan kustom dengan satu skrip, tanpa termasukSequence.

AWS ParallelCluster tidak mendukung menyertakan satu skrip dan Sequence untuk tindakan kustom yang sama.

Iam

(Opsional) Men definisikan pengaturan IAM opsional untuk Slurm antrian.

Iam: S3Access: - BucketName: string EnableWriteAccess: boolean KeyName: string AdditionalIamPolicies: - Policy: string InstanceProfile: string InstanceRole: string

Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.

Properti Iam
InstanceProfile(Opsional,String)

Menentukan profil instance untuk mengganti peran instans default atau profil instance untuk Slurm antrian. Anda tidak dapat menentukan keduanya InstanceProfile danInstanceRole. Formatnya adalah arn:${Partition}:iam::${Account}:instance-profile/${InstanceProfileName}.

Jika ini ditentukan, AdditionalIamPolicies pengaturan S3Access dan tidak dapat ditentukan.

Sebaiknya tentukan satu atau kedua AdditionalIamPolicies pengaturan S3Access dan karena fitur yang ditambahkan AWS ParallelCluster sering memerlukan izin baru.

Kebijakan pembaruan: Armada komputasi harus dihentikan agar pengaturan ini diubah untuk pembaruan.

InstanceRole(Opsional,String)

Menentukan peran instance untuk mengganti peran instans default atau profil instance untuk Slurm antrian. Anda tidak dapat menentukan keduanya InstanceProfile danInstanceRole. Formatnya adalah arn:${Partition}:iam::${Account}:role/${RoleName}.

Jika ini ditentukan, AdditionalIamPolicies pengaturan S3Access dan tidak dapat ditentukan.

Sebaiknya tentukan satu atau kedua AdditionalIamPolicies pengaturan S3Access dan karena fitur yang ditambahkan AWS ParallelCluster sering memerlukan izin baru.

Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.

S3Access(Opsional)

Menentukan bucket untuk an Slurm trian. Ini digunakan untuk menghasilkan kebijakan untuk memberikan akses yang ditentukan ke bucket dalam Slurm antrian.

Jika ini ditentukan, InstanceRole pengaturan InstanceProfile dan tidak dapat ditentukan.

Sebaiknya tentukan satu atau kedua AdditionalIamPolicies pengaturan S3Access dan karena fitur yang ditambahkan AWS ParallelCluster sering memerlukan izin baru.

S3Access: - BucketName: string EnableWriteAccess: boolean KeyName: string

Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.

BucketName(Diperlukan,String)

Nama ember.

Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.

KeyName(Opsional,String)

Kunci untuk ember. Nilai default-nya adalah *.

Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.

EnableWriteAccess(Opsional,Boolean)

Menunjukkan apakah akses tulis diaktifkan untuk bucket.

Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.

AdditionalIamPolicies(Opsional)

Menentukan daftar Nama Sumber Daya Amazon (ARN) kebijakan IAM untuk Amazon EC2. Daftar ini dilampirkan ke peran root yang digunakan untuk Slurm antrian selain izin yang diperlukan oleh AWS ParallelCluster.

Nama kebijakan IAM dan ARN-nya berbeda. Nama tidak bisa digunakan.

Jika ini ditentukan, InstanceRole pengaturan InstanceProfile dan tidak dapat ditentukan.

Sebaiknya gunakan AdditionalIamPolicies karena AdditionalIamPolicies ditambahkan ke izin yang diperlukan, AWS ParallelCluster dan InstanceRole harus menyertakan semua izin yang diperlukan. Izin yang diperlukan sering berubah dari rilis ke rilis saat fitur ditambahkan.

Tidak ada nilai default.

AdditionalIamPolicies: - Policy: string

Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.

Policy(Diperlukan,[String])

Daftar kebijakan IAM.

Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.

SlurmSettings

(Opsional) Men definisikan pengaturan Slurm yang berlaku untuk seluruh cluster.

SlurmSettings: ScaledownIdletime: integer QueueUpdateStrategy: string EnableMemoryBasedScheduling: boolean CustomSlurmSettings: [dict] CustomSlurmSettingsIncludeFile: string Database: Uri: string UserName: string PasswordSecretArn: string ExternalSlurmdbd: Host: string Port: integer Dns: DisableManagedDns: boolean HostedZoneId: string UseEc2Hostnames: boolean

SlurmSettingsProperti

ScaledownIdletime(Opsional,Integer)

Mendefinisikan jumlah waktu (dalam menit) yang tidak ada pekerjaan dan Slurm node dihentikan.

Nilai default-nya adalah 10.

Kebijakan pembaruan: Armada komputasi harus dihentikan agar pengaturan ini diubah untuk pembaruan.

MungeKeySecretArn(Opsional,String)

Nama Sumber Daya Amazon (ARN) dari AWS rahasia Manajer Rahasia teks biasa yang berisi kunci munge yang dikodekan base64 untuk digunakan dalam cluster. Slurm Kunci munge ini akan digunakan untuk mengotentikasi panggilan RPC antara perintah Slurm klien dan Slurm daemon yang bertindak sebagai server jarak jauh. Jika tidak MungeKeySecretArn disediakan, AWS ParallelCluster akan menghasilkan kunci munge acak untuk cluster.

catatan

MungeKeySecretArndidukung mulai dengan AWS ParallelCluster versi 3.8.0.

Awas

Jika baru MungeKeySecretArn ditambahkan ke cluster yang ada, tidak ParallelCluster akan mengembalikan Kunci munge sebelumnya jika terjadi Rollback atau saat nanti menghapus. MungeKeySecretArn Sebagai gantinya, kunci munge acak baru akan dihasilkan.

Jika AWS ParallelCluster pengguna memiliki izin untuk DescribeSecret pada sumber daya rahasia tertentu, MungeKeySecretArn divalidasi. MungeKeySecretArn valid jika:

  • Rahasia yang ditentukan ada, dan

  • Rahasianya adalah plaintext dan berisi string yang dikodekan base64 yang valid, dan

  • Kunci munge biner yang didekodekan memiliki ukuran antara 256 dan 8192 bit.

Jika kebijakan IAM pengguna pcluster tidak disertakan DescribeSecret, tidak MungeKeySecretArn divalidasi dan pesan peringatan ditampilkan. Untuk informasi selengkapnya, lihat Basis AWS ParallelCluster kebijakan pengguna pcluster.

Saat Anda memperbarui MungeKeySecretArn, armada komputasi dan semua node login harus dihentikan.

Jika nilai rahasia dalam ARN rahasia dimodifikasi sementara ARN tetap sama, cluster tidak akan secara otomatis diperbarui dengan kunci munge baru. Untuk menggunakan kunci munge baru rahasia ARN, Anda harus menghentikan armada komputasi dan node login kemudian menjalankan perintah berikut dari node kepala.

sudo /opt/parallelcluster/scripts/slurm/update_munge_key.sh

Setelah menjalankan perintah, Anda dapat melanjutkan armada komputasi dan node login: node komputasi dan login yang baru disediakan akan secara otomatis mulai menggunakan kunci munge baru.

Untuk menghasilkan kunci munge kustom yang dikodekan base64, Anda dapat menggunakan utilitas mungekey yang didistribusikan dengan perangkat lunak munge dan kemudian mengkodekannya menggunakan utilitas base64 yang umumnya tersedia di OS Anda. Atau, Anda menggunakan bash (harap atur parameter bs antara 32 dan 1024)

dd if=/dev/random bs=128 count=1 2>/dev/null | base64 -w 0

atau Python sebagai berikut:

import random import os import base64 # key length in bytes key_length=128 base64.b64encode(os.urandom(key_length)).decode("utf-8")

Kebijakan Pembaruan: Armada komputasi dan node login harus dihentikan agar pengaturan ini dapat diubah untuk pembaruan.

QueueUpdateStrategy(Opsional,String)

Menentukan strategi penggantian untuk parameter SlurmQueues bagian yang memiliki kebijakan pembaruan berikut:

Kebijakan pembaruan: Armada komputasi harus dihentikan atau QueueUpdateStrategy harus disetel agar pengaturan ini diubah untuk pembaruan.

QueueUpdateStrategyNilai hanya digunakan ketika proses pembaruan cluster dimulai.

Nilai yang valid: COMPUTE_FLEET_STOP | DRAIN | TERMINATE

Nilai default: COMPUTE_FLEET_STOP

DRAIN

Node dalam antrian dengan nilai parameter yang diubah diatur keDRAINING. Node dalam status ini tidak menerima pekerjaan baru dan pekerjaan yang sedang berjalan terus selesai.

Setelah node menjadi idle (DRAINED), node diganti jika node statis, dan node dihentikan jika node dinamis. Node lain di antrian lain tanpa perubahan nilai parameter tidak terpengaruh.

Waktu yang dibutuhkan strategi ini untuk mengganti semua node antrian dengan nilai parameter yang diubah tergantung pada beban kerja yang sedang berjalan.

COMPUTE_FLEET_STOP

Nilai default QueueUpdateStrategy parameter. Dengan pengaturan ini, memperbarui parameter di bawah SlurmQueues bagian mengharuskan Anda menghentikan armada komputasi sebelum Anda melakukan pembaruan cluster:

$ pcluster update-compute-fleet --status STOP_REQUESTED
TERMINATE

Dalam antrian dengan nilai parameter yang diubah, pekerjaan yang sedang berjalan dihentikan dan node segera dimatikan.

Node statis diganti dan node dinamis dihentikan.

Node lain di antrian lain tanpa perubahan nilai parameter tidak terpengaruh.

Kebijakan pembaruan: Pengaturan ini tidak dianalisis selama pembaruan.

catatan

QueueUpdateStrategydidukung mulai dengan AWS ParallelCluster versi 3.2.0.

EnableMemoryBasedScheduling(Opsional,Boolean)

Jikatrue, penjadwalan berbasis memori diaktifkan di. Slurm Untuk informasi lebih lanjut, lihat SlurmQueues/ComputeResources/SchedulableMemory.

Nilai default-nya adalah false.

Awas

Mengaktifkan penjadwalan berbasis memori memengaruhi cara pen Slurm jadwal menangani pekerjaan dan alokasi node.

Untuk informasi selengkapnya, lihat Slurm penjadwalan berbasis memori.

catatan

EnableMemoryBasedSchedulingdidukung mulai dengan AWS ParallelCluster versi 3.2.0.

catatan

Dimulai dengan AWS ParallelCluster versi 3.7.0, EnableMemoryBasedScheduling dapat diaktifkan jika Anda mengonfigurasi beberapa jenis instans di Inst ans.

Untuk AWS ParallelCluster versi 3.2.0 hingga 3.6. x, tidak EnableMemoryBasedScheduling dapat diaktifkan jika Anda mengonfigurasi beberapa jenis instans di Instans.

Kebijakan pembaruan: Armada komputasi harus dihentikan agar pengaturan ini diubah untuk pembaruan.

CustomSlurmSettings(Opsional,[Dict])

Mendefinisikan Slurm pengaturan kustom yang berlaku untuk seluruh cluster.

Menentukan daftar kamus Slurm konfigurasi pasangan kunci-nilai yang akan ditambahkan ke akhir slurm.conf file yang dihasilkan. AWS ParallelCluster

Setiap kamus dalam daftar muncul sebagai baris terpisah ditambahkan ke file Slurm konfigurasi. Anda dapat menentukan parameter sederhana atau kompleks.

Parameter sederhana terdiri dari pasangan kunci tunggal, seperti yang ditunjukkan dalam contoh berikut:

- Param1: 100 - Param2: "SubParam1,SubParam2=SubValue2"

Contoh yang dirender dalam Slurm konfigurasi:

Param1=100 Param2=SubParam1,SubParam2=SubValue2

Parameter Slurm konfigurasi kompleks terdiri dari beberapa nilai kunci yang dipisahkan spasi, pasangan seperti yang ditunjukkan pada contoh berikut:

- NodeName: test-nodes[1-10] CPUs: 4 RealMemory: 4196 ... # other node settings - NodeSet: test-nodeset Nodes: test-nodes[1-10] ... # other nodeset settings - PartitionName: test-partition Nodes: test-nodeset ... # other partition settings

Contoh, dirender dalam Slurm konfigurasi:

NodeName=test-nodes[1-10] CPUs=4 RealMemory=4196 ... # other node settings NodeSet=test-nodeset Nodes=test-nodes[1-10] ... # other nodeset settings PartitionName=test-partition Nodes=test-nodeset ... # other partition settings
catatan

SlurmNode kustom tidak boleh berisi -dy- pola -st- atau dalam namanya. Pola-pola ini dicadangkan untuk node yang dikelola oleh AWS ParallelCluster.

Jika Anda menentukan parameter Slurm konfigurasi kustom diCustomSlurmSettings, Anda tidak boleh menentukan parameter Slurm konfigurasi khusus untukCustomSlurmSettingsIncludeFile.

Anda hanya dapat menentukan parameter Slurm konfigurasi yang tidak dicantumkan di. CustomSlurmSettings Untuk informasi tentang parameter Slurm konfigurasi yang dicantumkan, lihat. Terdaftar penolakan Slurm parameter konfigurasi untuk CustomSlurmSettings

AWS ParallelCluster hanya memeriksa apakah parameter ada dalam daftar tolak. AWS ParallelCluster tidak memvalidasi sintaks atau semantik parameter Slurm konfigurasi kustom Anda. Adalah tanggung jawab Anda untuk memvalidasi parameter Slurm konfigurasi kustom Anda. Parameter Slurm konfigurasi kustom yang tidak valid dapat menyebabkan kegagalan Slurm daemon yang dapat menyebabkan kegagalan pembuatan dan pembaruan cluster.

Untuk informasi selengkapnya tentang cara menentukan parameter Slurm konfigurasi khusus dengan AWS ParallelCluster, lihatSlurm kustomisasi konfigurasi.

Untuk informasi selengkapnya tentang parameter Slurm konfigurasi, lihat slurm.conf dalam dokumentasi. Slurm

Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.

catatan

CustomSlurmSettingsdidukung mulai dengan AWS ParallelCluster versi 3.6.0.

CustomSlurmSettingsIncludeFile(Opsional,String)

Mendefinisikan Slurm pengaturan kustom yang berlaku untuk seluruh cluster.

Menentukan Slurm file kustom yang terdiri dari parameter Slurm konfigurasi kustom untuk ditambahkan di akhir slurm.conf file yang dihasilkan AWS ParallelCluster .

Anda harus menyertakan jalur ke file. Jalur dapat dimulai dengan https:// ataus3://.

Jika Anda menentukan parameter Slurm konfigurasi khusus untukCustomSlurmSettingsIncludeFile, Anda tidak boleh menentukan parameter Slurm konfigurasi khusus untukCustomSlurmSettings.

catatan

SlurmNode kustom tidak boleh berisi -dy- pola -st- atau dalam namanya. Pola-pola ini dicadangkan untuk node yang dikelola oleh AWS ParallelCluster.

Anda hanya dapat menentukan parameter Slurm konfigurasi yang tidak dicantumkan di. CustomSlurmSettingsIncludeFile Untuk informasi tentang parameter Slurm konfigurasi yang dicantumkan, lihat. Terdaftar penolakan Slurm parameter konfigurasi untuk CustomSlurmSettings

AWS ParallelCluster hanya memeriksa apakah parameter ada dalam daftar tolak. AWS ParallelCluster tidak memvalidasi sintaks atau semantik parameter Slurm konfigurasi kustom Anda. Adalah tanggung jawab Anda untuk memvalidasi parameter Slurm konfigurasi kustom Anda. Parameter Slurm konfigurasi kustom yang tidak valid dapat menyebabkan kegagalan Slurm daemon yang dapat menyebabkan kegagalan pembuatan dan pembaruan cluster.

Untuk informasi selengkapnya tentang cara menentukan parameter Slurm konfigurasi khusus dengan AWS ParallelCluster, lihatSlurm kustomisasi konfigurasi.

Untuk informasi selengkapnya tentang parameter Slurm konfigurasi, lihat slurm.conf dalam dokumentasi. Slurm

Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.

catatan

CustomSlurmSettingsdidukung mulai dengan AWS ParallelCluster versi 3.6.0.

Basis Data

(Opsional) Mendefinisikan pengaturan untuk mengaktifkan Slurm Akuntansi pada cluster. Untuk informasi selengkapnya, lihat Slurmakuntansi dengan AWS ParallelCluster.

Database: Uri: string UserName: string PasswordSecretArn: string

Kebijakan pembaruan: Armada komputasi harus dihentikan agar pengaturan ini diubah untuk pembaruan.

Pro perti database

Uri(Diperlukan,String)

Alamat ke server database yang digunakan sebagai backend untuk Slurm akuntansi. URI ini harus diformat sebagai host:port dan tidak boleh berisi skema, sepertimysql://. Host dapat berupa alamat IP atau nama DNS yang dapat diselesaikan oleh node kepala. Jika port tidak disediakan, gunakan AWS ParallelCluster port MySQL default 3306.

AWS ParallelCluster melakukan bootstrap database Slurm akuntansi ke cluster dan harus mengakses database.

Basis data harus dapat dijangkau sebelum hal berikut terjadi:

  • Sebuah cluster dibuat.

  • Slurmakuntansi diaktifkan dengan pembaruan cluster.

Kebijakan pembaruan: Armada komputasi harus dihentikan agar pengaturan ini diubah untuk pembaruan.

UserName(Diperlukan,String)

Identitas yang Slurm digunakan untuk terhubung ke database, menulis log akuntansi, dan melakukan query. Pengguna harus memiliki izin baca dan tulis pada database.

Kebijakan pembaruan: Armada komputasi harus dihentikan agar pengaturan ini diubah untuk pembaruan.

PasswordSecretArn(Diperlukan,String)

Nama Sumber Daya Amazon (ARN) dari AWS Secrets Manager rahasia yang berisi kata sandi UserName plaintext. Kata sandi ini digunakan bersama dengan UserName Slurm akuntansi untuk mengautentikasi pada server database.

catatan
  • Saat Anda membuat rahasia menggunakan AWS Secrets Manager konsol pastikan untuk memilih “Jenis rahasia lainnya”, pilih plaintext, dan hanya sertakan teks kata sandi di rahasia.

  • Anda tidak dapat menggunakan karakter '#' dalam kata sandi Database karena Slurm tidak mendukungnya di slurmdbd.conf.

  • Untuk informasi lebih lanjut tentang cara menggunakan AWS Secrets Manager untuk membuat rahasia, lihat Buat AWS Secrets Manager Rahasia.

Jika pengguna memiliki izin untuk DescribeSecret, PasswordSecretArn divalidasi. PasswordSecretArnvalid jika rahasia yang ditentukan ada. Jika kebijakan IAM pengguna tidak disertakanDescribeSecret, PasswordSecretArn tidak divalidasi dan pesan peringatan ditampilkan. Untuk informasi selengkapnya, lihat Basis AWS ParallelCluster kebijakan pengguna pcluster.

Saat Anda memperbaruiPasswordSecretArn, armada komputasi harus dihentikan. Jika nilai rahasia berubah, dan ARN rahasia tidak berubah, cluster tidak secara otomatis diperbarui dengan kata sandi database baru. Untuk memperbarui cluster untuk nilai rahasia baru, Anda harus menjalankan perintah berikut dari dalam node kepala setelah armada komputasi dihentikan.

$ sudo /opt/parallelcluster/scripts/slurm/update_slurm_database_password.sh
Awas

Kami menyarankan Anda hanya mengubah kata sandi database saat armada komputasi dihentikan untuk menghindari hilangnya data akuntansi.

Kebijakan pembaruan: Armada komputasi harus dihentikan agar pengaturan ini diubah untuk pembaruan.

DatabaseName(Opsional,String)

Nama database pada server database (ditentukan oleh parameter Uri) yang akan digunakan untuk Akun Slurm tansi.

Nama database mungkin berisi huruf kecil, angka dan garis bawah. Nama tidak boleh lebih dari 64 karakter.

Parameter ini memetakan ke StorageLoc parameter slurmdbd.conf.

Jika tidak DatabaseName disediakan, ParallelCluster akan menggunakan nama cluster untuk menentukan nilai untukStorageLoc.

Memperbarui DatabaseName diperbolehkan, dengan pertimbangan berikut:

  • Jika database dengan nama belum DatabaseName ada di server database, slurmdbd akan membuatnya. Ini akan menjadi tanggung jawab Anda untuk mengkonfigurasi ulang database baru sesuai kebutuhan (misalnya menambahkan entitas akuntansi - cluster, akun, pengguna, asosiasi, QoS, dll.).

  • Jika database dengan nama DatabaseName sudah ada di server database, slurmdbd akan menggunakannya untuk fungsionalitas Akuntansi. Slurm

Kebijakan pembaruan: Armada komputasi harus dihentikan agar pengaturan ini diubah untuk pembaruan.

catatan

Databaseditambahkan mulai dengan rilis 3.3.0.

ExternalSlurmdbd

(Opsional) Mendefinisikan pengaturan untuk mengaktifkan Akun Slurm tansi dengan server slurmdbd eksternal. Untuk informasi lebih lanjut, lihat Slurm akuntansi dengan AWS ParallelCluster.

ExternalSlurmdbd: Host: string Port: integer

ExternalSlurmdbdproperti

Host(Diperlukan,String)

Alamat ke server slurmdbd eksternal untuk akuntansi. Slurm Host dapat berupa alamat IP atau nama DNS yang dapat diselesaikan oleh node kepala.

Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.

Port(Opsional,Integer)

Port yang didengarkan layanan slurmdbd. Nilai default-nya adalah 6819.

Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.

Dns

(Opsional) Men definisikan pengaturan Slurm yang berlaku untuk seluruh cluster.

Dns: DisableManagedDns: boolean HostedZoneId: string UseEc2Hostnames: boolean

Pro perti dns

DisableManagedDns(Opsional,Boolean)

Jikatrue, entri DNS untuk cluster tidak dibuat dan nama Slurm node tidak dapat diselesaikan.

Secara default, AWS ParallelCluster membuat zona yang dihosting Route 53 di mana node terdaftar saat diluncurkan. Nilai default-nya adalah false. Jika DisableManagedDns disetel ketrue, zona yang dihosting tidak dibuat oleh AWS ParallelCluster.

Untuk mempelajari cara menggunakan setelan ini untuk menyebarkan cluster di subnet tanpa akses internet, lihatAWS ParallelCluster dalam satu subnet tanpa akses internet.

Awas

Sistem resolusi nama diperlukan agar cluster dapat beroperasi dengan baik. Jika DisableManagedDns disetel ketrue, Anda harus menyediakan sistem resolusi nama. Untuk menggunakan DNS default Amazon EC2, setel UseEc2Hostnames ketrue. Atau, konfigurasikan resolver DNS Anda sendiri dan pastikan bahwa nama node terdaftar saat instance diluncurkan. Misalnya, Anda dapat melakukan ini dengan mengkonfigurasi CustomActions/OnNodeStart.

Kebijakan pembaruan: Jika pengaturan ini diubah, pembaruan tidak diizinkan.

HostedZoneId(Opsional,String)

Mendefinisikan ID zona host Route 53 kustom untuk digunakan untuk resolusi nama DNS untuk cluster. Jika disediakan, men AWS ParallelCluster daftarkan node cluster di zona yang dihosting yang ditentukan dan tidak membuat zona yang dikelola yang dihosting.

Kebijakan pembaruan: Jika pengaturan ini diubah, pembaruan tidak diizinkan.

UseEc2Hostnames(Opsional,Boolean)

Jikatrue, node komputasi cluster dikonfigurasi dengan nama host EC2 default. SlurmNodeHostNameIni juga diperbarui dengan informasi ini. Nilai default-nya false.

Untuk mempelajari cara menggunakan setelan ini untuk menyebarkan cluster di subnet tanpa akses internet, lihatAWS ParallelCluster dalam satu subnet tanpa akses internet.

catatan

Catatan ini tidak relevan dimulai dengan AWS ParallelCluster versi 3.3.0.

Untuk versi yang AWS ParallelCluster didukung sebelum 3.3.0:

Ketika UseEc2Hostnames disetel ketrue, file konfigurasi Slurm diatur dengan skrip AWS ParallelCluster prolog dan: epilog

  • prologberjalan untuk menambahkan info node ke /etc/hosts node komputasi saat setiap pekerjaan dialokasikan.

  • epilogberjalan untuk membersihkan konten yang ditulis olehprolog.

Untuk menambahkan kustom prolog atau epilog skrip, tambahkan masing-masing ke /opt/slurm/etc/pcluster/epilog.d/ folder /opt/slurm/etc/pcluster/prolog.d/ atau.

Kebijakan pembaruan: Jika pengaturan ini diubah, pembaruan tidak diizinkan.