Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Bagian penjadwalan
(Diperlukan) Mendefinisikan penjadwal pekerjaan yang digunakan dalam cluster dan instance komputasi yang dikelola oleh penjadwal pekerjaan. Anda dapat menggunakan pen AWS Batch jadwal Slurm atau. Masing-masing mendukung serangkaian pengaturan dan properti yang berbeda.
Scheduling: Scheduler: slurm ScalingStrategy:stringSlurmSettings: MungeKeySecretArn:stringScaledownIdletime:integerQueueUpdateStrategy:stringEnableMemoryBasedScheduling:booleanCustomSlurmSettings:[dict]CustomSlurmSettingsIncludeFile:stringDatabase: Uri:stringUserName:stringPasswordSecretArn:stringDatabaseName:stringExternalSlurmdbd:booleanHost:stringPort:integerDns: DisableManagedDns:booleanHostedZoneId:stringUseEc2Hostnames:booleanSlurmQueues: - Name:stringComputeSettings: LocalStorage: RootVolume: Size:integerEncrypted:booleanVolumeType:stringIops:integerThroughput:integerEphemeralVolume: MountDir:stringCapacityReservationTarget: CapacityReservationId:stringCapacityReservationResourceGroupArn:stringCapacityType:stringAllocationStrategy:stringJobExclusiveAllocation:booleanCustomSlurmSettings:dictTags: - Key:stringValue:stringHealthChecks: Gpu: Enabled:booleanNetworking: SubnetIds: -stringAssignPublicIp:booleanSecurityGroups: -stringAdditionalSecurityGroups: -stringPlacementGroup: Enabled:booleanId:stringName:stringProxy: HttpProxyAddress:stringComputeResources: - Name:stringInstanceType:stringInstances: - InstanceType:stringMinCount:integerMaxCount:integerDynamicNodePriority:integerStaticNodePriority:integerSpotPrice:floatDisableSimultaneousMultithreading:booleanSchedulableMemory:integerHealthChecks: Gpu: Enabled:booleanEfa: Enabled:booleanGdrSupport:booleanCapacityReservationTarget: CapacityReservationId:stringCapacityReservationResourceGroupArn:stringNetworking: PlacementGroup: Enabled:booleanName:stringCustomSlurmSettings:dictTags: - Key:stringValue:stringLaunchTemplateOverrides: LaunchTemplateId:stringVersion:stringCustomActions: OnNodeStart: Sequence: - Script:stringArgs: -stringScript:stringArgs: -stringOnNodeConfigured: Sequence: - Script:stringArgs: -stringScript:stringArgs: -stringIam: InstanceProfile:stringInstanceRole:stringS3Access: - BucketName:stringEnableWriteAccess:booleanKeyName:stringAdditionalIamPolicies: - Policy:stringImage: CustomAmi:string
Scheduling: Scheduler: awsbatch AwsBatchQueues: - Name:stringCapacityType:stringNetworking: SubnetIds: -stringAssignPublicIp:booleanSecurityGroups: -stringAdditionalSecurityGroups: -stringComputeResources: # this maps to a Batch compute environment (initially we support only 1) - Name:stringInstanceTypes: -stringMinvCpus:integerDesiredvCpus:integerMaxvCpus:integerSpotBidPercentage:float
Pro perti penjadwalan
Scheduler(Diperlukan,String)-
Menentukan jenis penjadwal yang digunakan. Nilai yang didukung adalah
slurmdanawsbatch.Kebijakan pembaruan: Jika pengaturan ini diubah, pembaruan tidak diizinkan.
catatan
awsbatchhanya mendukung sistemalinux2operasi danx86_64platform. ScalingStrategy(Opsional,String)-
Memungkinkan Anda memilih bagaimana Slurm node dinamis ditingkatkan. Nilai yang didukung adalah
all-or-nothing,greedy-all-or-nothingdanbest-effortNilai defaultnya adalahall-or-nothing.Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.
catatan
Strategi penskalaan hanya berlaku untuk node yang akan dilanjutkan oleh Slurm, bukan untuk node yang akhirnya sudah berjalan.
-
all-or-nothingStrategi ini secara ketat mengikuti pendekatan semua atau tidak sama sekali, yang bertujuan untuk menghindari instance idle di akhir proses penskalaan. Ini beroperasi atas dasar semua atau tidak sama sekali, artinya dapat ditingkatkan sepenuhnya atau tidak sama sekali. Ketahuilah bahwa mungkin ada biaya tambahan karena instans yang diluncurkan sementara, ketika pekerjaan memerlukan lebih dari 500 node atau menjangkau beberapa sumber daya komputasi. Strategi ini memiliki throughput terendah di antara tiga Strategi Penskalaan yang mungkin. Waktu penskalaan tergantung pada jumlah pekerjaan yang dikirimkan per eksekusi program Slurm resume. Selain itu, Anda tidak dapat menskalakan jauh melampaui batas akun RunInstances sumber daya default per eksekusi, yaitu 1000 instans secara default. Rincian lebih lanjut dapat ditemukan di dokumentasi pel ambatan API Amazon EC2 -
greedy-all-or-nothingMirip dengan strategi semua atau tidak sama sekali, ini bertujuan untuk menghindari instans idle pasca-penskalaan. Strategi ini memungkinkan peningkatan skala sementara selama proses penskalaan untuk mencapai throughput yang lebih tinggi daripada pendekatan all-or-nothing tetapi juga dilengkapi dengan batas penskalaan yang sama yaitu 1000 instance sesuai batas akun RunInstances sumber daya. -
best-effortStrategi ini memprioritaskan throughput tinggi, meskipun itu berarti bahwa beberapa instance mungkin tidak aktif di akhir proses penskalaan. Ini mencoba mengalokasikan node sebanyak yang diminta oleh pekerjaan, tetapi ada kemungkinan tidak memenuhi seluruh permintaan. Tidak seperti strategi lain, pendekatan upaya terbaik dapat mengakumulasi lebih banyak instance daripada RunInstances batas standar, dengan biaya memiliki sumber daya idle di sepanjang beberapa eksekusi proses penskalaan.
-
Setiap strategi dirancang untuk memenuhi kebutuhan penskalaan yang berbeda, memungkinkan Anda memilih salah satu yang memenuhi persyaratan dan batasan spesifik Anda.
AwsBatchQueues
(Opsional) Pengaturan AWS Batch antrian. Hanya satu antrian yang didukung. Jika Scheduler disetel keawsbatch, bagian ini diperlukan. Untuk informasi selengkapnya tentang pen awsbatch jadwal, lihat pengaturan jaringan danMenggunakan AWS Batch (awsbatch) scheduler dengan AWS ParallelCluster.
AwsBatchQueues: - Name:stringCapacityType:stringNetworking: SubnetIds: -stringAssignPublicIp:booleanSecurityGroups: -stringAdditionalSecurityGroups: -stringComputeResources: # this maps to a Batch compute environment (initially we support only 1) - Name:stringInstanceTypes: -stringMinvCpus:integerDesiredvCpus:integerMaxvCpus:integerSpotBidPercentage:float
Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.
AwsBatchQueuesproperti
Name(Diperlukan,String)-
Nama an AWS Batch trian.
Kebijakan pembaruan: Jika pengaturan ini diubah, pembaruan tidak diizinkan.
CapacityType(Opsional,String)-
Jenis sumber daya komputasi yang digunakan AWS Batch antrian. Nilai yang didukung adalah
ONDEMAND,SPOTatauCAPACITY_BLOCK. Nilai default-nya adalahONDEMAND.catatan
Jika Anda menyet
CapacityTypeel keSPOT, akun Anda harus berisi peranAWSServiceRoleForEC2Spotterkait layanan. Anda dapat membuat peran ini menggunakan AWS CLI perintah berikut.$aws iam create-service-linked-role --aws-service-name spot.amazonaws.com.rproxy.goskope.comUntuk informasi selengkapnya, lihat Service-linked peran untuk permintaan Instans Spot di Panduan Pengguna Amazon Amazon EC2 untuk Inst ans Linux.
Kebijakan pembaruan: Armada komputasi harus dihentikan agar pengaturan ini diubah untuk pembaruan.
Jaringan
(Diperlukan) Mendefinisikan konfigurasi jaringan untuk an AWS Batch trian.
Networking: SubnetIds: -stringAssignPublicIp:booleanSecurityGroups: -stringAdditionalSecurityGroups: -string
Pro perti jaringan
SubnetIds(Diperlukan,[String])-
Menentukan ID subnet yang ada untuk menyediakan an AWS Batch trian. Saat ini hanya satu subnet yang didukung.
Kebijakan pembaruan: Armada komputasi harus dihentikan agar pengaturan ini diubah untuk pembaruan.
AssignPublicIp(Opsional,String)-
Membuat atau menetapkan alamat IP publik ke node dalam AWS Batch antrian. Nilai yang didukung adalah
truedanfalse. Defaultnya tergantung pada subnet yang Anda tentukan.Kebijakan pembaruan: Jika pengaturan ini diubah, pembaruan tidak diizinkan.
SecurityGroups(Opsional,[String])-
Daftar grup keamanan yang digunakan an AWS Batch trian. Jika Anda tidak menentukan grup keamanan, AWS ParallelCluster buat grup keamanan baru.
Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.
AdditionalSecurityGroups(Opsional,[String])-
Daftar grup keamanan yang digunakan an AWS Batch trian.
Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.
ComputeResources
(Diperlukan) Mendefinisikan ComputeResources konfigurasi untuk an AWS Batch trian.
ComputeResources: # this maps to a Batch compute environment (initially we support only 1) - Name:stringInstanceTypes: -stringMinvCpus:integerDesiredvCpus:integerMaxvCpus:integerSpotBidPercentage:float
ComputeResourcesproperti
Name(Diperlukan,String)-
Nama lingkungan komputasi AWS Batch antrian.
Kebijakan pembaruan: Armada komputasi harus dihentikan agar pengaturan ini diubah untuk pembaruan.
InstanceTypes(Diperlukan,[String])-
Array lingkungan AWS Batch komputasi dari tipe instance. Semua jenis instance harus menggunakan
x86_64arsitektur.Kebijakan pembaruan: Armada komputasi harus dihentikan agar pengaturan ini diubah untuk pembaruan.
MinvCpus(Opsional,Integer)-
Jumlah minimum vCPU yang dapat digunakan oleh lingkungan AWS Batch komputasi.
Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.
DesiredVcpus(Opsional,Integer)-
Jumlah vCPU yang diinginkan di lingkungan AWS Batch komputasi. AWS Batch menyesuaikan nilai ini antara
MinvCpusdanMaxvCpusberdasarkan permintaan dalam antrian pekerjaan.Kebijakan pembaruan: Pengaturan ini tidak dianalisis selama pembaruan.
MaxvCpus(Opsional,Integer)-
Jumlah maksimum vCPU untuk lingkungan AWS Batch komputasi. Anda tidak dapat mengatur ini ke nilai yang lebih rendah dari
DesiredVcpus.Kebijakan pembaruan: Pengaturan ini tidak dapat dikurangi selama pembaruan.
SpotBidPercentage(Opsional,Float)-
Persentase maksimum On-Demand harga untuk jenis instans yang dapat dicapai oleh harga Instans Spot Amazon EC2 sebelum instance diluncurkan. Nilai defaultnya adalah
100(100%). Rentang yang didukung adalah1-100.Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.
SlurmQueues
(Opsional) Pengaturan untuk an Slurm trian. Jika Scheduler disetel keslurm, bagian ini diperlukan.
SlurmQueues: - Name:stringComputeSettings: LocalStorage: RootVolume: Size:integerEncrypted:booleanVolumeType:stringIops:integerThroughput:integerEphemeralVolume: MountDir:stringCapacityReservationTarget: CapacityReservationId:stringCapacityReservationResourceGroupArn:stringCapacityType:stringAllocationStrategy:stringJobExclusiveAllocation:booleanCustomSlurmSettings:dictTags: - Key:stringValue:stringHealthChecks: Gpu: Enabled:booleanNetworking: SubnetIds: -stringAssignPublicIp:booleanSecurityGroups: -stringAdditionalSecurityGroups: -stringPlacementGroup: Enabled:booleanId:stringName:stringProxy: HttpProxyAddress:stringComputeResources: - Name:stringInstanceType:stringInstances: - InstanceType:stringMinCount:integerMaxCount:integerDynamicNodePriority:integerStaticNodePriority:integerSpotPrice:floatDisableSimultaneousMultithreading:booleanSchedulableMemory:integerHealthChecks: Gpu: Enabled:booleanEfa: Enabled:booleanGdrSupport:booleanCapacityReservationTarget: CapacityReservationId:stringCapacityReservationResourceGroupArn:stringNetworking: PlacementGroup: Enabled:booleanName:stringCustomSlurmSettings:dictTags: - Key:stringValue:stringLaunchTemplateOverrides: LaunchTemplateId:stringVersion:stringCustomActions: OnNodeStart: Sequence: - Script:stringArgs: -stringScript:stringArgs: -stringOnNodeConfigured: Sequence: - Script:stringArgs: -stringScript:stringArgs: -stringIam: InstanceProfile:stringInstanceRole:stringS3Access: - BucketName:stringEnableWriteAccess:booleanKeyName:stringAdditionalIamPolicies: - Policy:stringImage: CustomAmi:string
SlurmQueuesproperti
Name(Diperlukan,String)-
Nama an Slurm trian.
catatan
Ukuran cluster dapat berubah selama pembaruan. Untuk informasi selengkapnya, lihat Ukuran kapasitas cluster dan pembaruan
Kebijakan pembaruan: Jika pengaturan ini diubah, pembaruan tidak diizinkan.
CapacityReservationTarget-
catatan
CapacityReservationTargetditambahkan dengan AWS ParallelCluster versi 3.3.0.CapacityReservationTarget: CapacityReservationId:stringCapacityReservationResourceGroupArn:stringMenentukan reservasi On-Demand kapasitas untuk sumber daya komputasi antrian.
CapacityReservationId(Opsional,String)-
ID reservasi kapasitas yang ada untuk ditargetkan untuk sumber daya komputasi antrian. ID dapat merujuk ke ODCR atau Blok Kapasitas untuk ML.
Reservasi harus menggunakan platform yang sama dengan yang digunakan instance. Misalnya, jika instans Anda berjalan
rhel8, reservasi kapasitas Anda harus berjalan di platform Red Hat Enterprise Linux. Untuk informasi selengkapnya, lihat Platform yang didukung di Panduan Pengguna Amazon EC2 untuk Inst ans Linux.catatan
Jika Anda menyertakan Instances dalam konfigurasi cluster, Anda harus mengecualikan
CapacityReservationIdpengaturan tingkat antrian ini dari konfigurasi. CapacityReservationResourceGroupArn(Opsional,String)-
Nama Sumber Daya Amazon (ARN) dari grup sumber daya yang berfungsi sebagai grup reservasi kapasitas terkait layanan untuk sumber daya komputasi antrian. AWS ParallelCluster mengidentifikasi dan menggunakan reservasi kapasitas yang paling tepat dari grup sumber daya berdasarkan kondisi berikut:
-
Jika
PlacementGroupdiaktifkan di SlurmQueues/Networkingatau SlurmQueues ComputeResources/Networking, AWS ParallelCluster pilih grup sumber daya yang menargetkan jenis instance danPlacementGroupuntuk sumber daya komputasi, jika sumber daya komputasi ada.Harus
PlacementGroupmenargetkan salah satu jenis instance yang didefinisikan di ComputeResources. -
Jika
PlacementGrouptidak diaktifkan di SlurmQueues/Networkingatau SlurmQueues ComputeResources/Networking, AWS ParallelCluster pilih grup sumber daya yang menargetkan hanya jenis instance sumber daya komputasi, jika sumber daya komputasi ada.
Grup sumber daya harus memiliki setidaknya satu ODCR untuk setiap jenis instans yang dicadangkan di Zona Ketersediaan di semua sumber daya komputasi antrian dan Zona Ketersediaan. Untuk informasi selengkapnya, lihat Luncurkan instans dengan Pemesanan Kapasitas Sesuai Permintaan (ODCR).
Untuk informasi selengkapnya tentang beberapa persyaratan konfigurasi subnet, lihat Networking/SubnetIds.
catatan
Beberapa Zona Ketersediaan ditambahkan dalam AWS ParallelCluster versi 3.4.0.
-
CapacityType(Opsional,String)-
Jenis sumber daya komputasi yang digunakan Slurm antrian. Nilai yang didukung adalah
ONDEMAND,SPOTatauCAPACITY_BLOCK. Nilai default-nya adalahONDEMAND.catatan
Jika Anda menyet
CapacityTypeel keSPOT, akun Anda harus memiliki peranAWSServiceRoleForEC2Spotterkait layanan. Anda dapat menggunakan AWS CLI perintah berikut untuk membuat peran ini.$aws iam create-service-linked-role --aws-service-name spot.amazonaws.com.rproxy.goskope.comUntuk informasi selengkapnya, lihat Service-linked peran untuk permintaan Instans Spot di Panduan Pengguna Amazon Amazon EC2 untuk Inst ans Linux.
AllocationStrategy(Opsional,String)-
Tentukan strategi alokasi untuk semua sumber daya komputasi yang ditentukan dalam Instances.
Nilai yang valid:
lowest-pricecapacity-optimized|price-capacity-optimized|prioritized|capacity-optimized-prioritizedCapacityType Strategi yang diizinkan SESUAI PERMINTAAN harga terendah, diprioritaskan TEMPAT harga terendah, dioptimalkan kapasitas, dioptimalkan kapasitas harga, dioptimalkan kapasitas diprioritaskan KAPASITAS_BLOK Tidak didukung - AllocationStrategy tidak dapat dikonfigurasi Default:
lowest-pricelowest-price-
-
Jika Anda menggunakan
CapacityType = ONDEMAND, Amazon EC2 Fleet menggunakan harga untuk menentukan pesanan dan meluncurkan instans harga terendah terlebih dahulu. -
Jika Anda menggunakan
CapacityType = SPOT, Amazon EC2 Fleet meluncurkan instans dari kumpulan Instans Spot harga terendah yang memiliki kapasitas tersedia. Jika kumpulan kehabisan kapasitas sebelum memenuhi kapasitas yang Anda butuhkan, Amazon EC2 Fleet memenuhi permintaan Anda dengan meluncurkan instans untuk Anda. Secara khusus, Amazon EC2 Fleet meluncurkan instans dari kumpulan Instans Spot harga terendah yang memiliki kapasitas yang tersedia. Amazon EC2 Fleet mungkin meluncurkan Instans Spot dari beberapa kumpulan yang berbeda. -
Jika Anda mengatur
CapacityType = CAPACITY_BLOCK, tidak ada strategi alokasi, sehinggaAllocationStrategyparameter tidak dapat dikonfigurasi.
-
capacity-optimized-
-
Jika Anda mengatur
CapacityType = ONDEMANDcapacity-optimized, tidak tersedia. -
Jika Anda menyet
CapacityType = SPOTel, Amazon EC2 Fleet meluncurkan instans dari kumpulan Instans Spot dengan kapasitas optimal untuk jumlah instans yang akan diluncurkan.
-
price-capacity-optimized-
-
Jika Anda mengatur
CapacityType = ONDEMANDcapacity-optimized, tidak tersedia. -
Jika Anda meny
CapacityType = SPOTetel, Amazon EC2 Fleet mengidentifikasi kumpulan dengan ketersediaan kapasitas tertinggi untuk jumlah instans yang diluncurkan. Hal ini berarti bahwa kami akan meminta Instans Spot dari kolam yang kami yakini memiliki peluang interupsi terendah dalam waktu dekat. Amazon EC2 Fleet kemudian meminta Instans Spot dari kumpulan ini dengan harga terendah.
-
prioritized-
-
Jika Anda meny
CapacityType = ONDEMANDetel, Amazon EC2 Fleet menghormati urutan prioritas yang AWS ParallelCluster berlaku untuk peng LaunchTemplate gantian saat beberapa subnet ditentukan. AWS ParallelCluster memperoleh penggantianprioritydari posisi subnet targetSlurmQueues/Networking/SubnetIdsdengan Subnet pertama mendapatkan prioritas tertinggi. Prioritas didorong AWS ParallelCluster dalam urutan menurun dariSlurmQueues/Networking/SubnetIds, dengan yang pertama SubnetId memiliki prioritas tertinggi dan subnetID terakhir memiliki prioritas terendah. -
Jika Anda mengatur
CapacityType = SPOTprioritized, tidak tersedia.
-
capacity-optimized-prioritized-
-
Jika Anda mengatur
CapacityType = ONDEMANDcapacity-optimized-prioritized, tidak tersedia. -
Jika Anda menyet
CapacityType = SPOTel, Amazon EC2 Fleet mengoptimalkan kapasitas terlebih dahulu dan kemudian menerapkan, berdasarkan upaya terbaik, urutan prioritas yang ditetapkan untuk penggantian AWS ParallelCluster . LaunchTemplate Prioritas didorong AWS ParallelCluster dalam urutan menurun dariSlurmQueues/Networking/SubnetIds, dengan yang pertama SubnetId memiliki prioritas tertinggi dan subnetID terakhir memiliki prioritas terendah. Semua penggantian yang menargetkan subnet yang sama menerima nilai prioritas yang sama.
-
catatan
AllocationStrategydidukung mulai AWS ParallelCluster versi 3.3.0.Baru di 3.14.0:
prioritized(untuk On-Demand) dancapacity-optimized-prioritized(untuk Spot). JobExclusiveAllocation(Opsional,String)-
Jika disetel ke
true, benOverSubscribedera Slurm partisi disetel keEXCLUSIVE. KetikaOverSubscribe=EXCLUSIVE, pekerjaan di partisi memiliki akses eksklusif ke semua node yang dialokasikan. Untuk informasi lebih lanjut, lihat EKSKLUSIF dalam Slurm dokumentasi. Nilai yang valid:
true|falseDefault:
falseKebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.
catatan
JobExclusiveAllocationdidukung mulai AWS ParallelCluster versi 3.7.0. CustomSlurmSettings(Opsional,Dict)-
Mendefinisikan pengaturan konfigurasi Slurm partisi kustom (antrian).
Menentukan kamus pasangan kunci-nilai parameter Slurm konfigurasi kustom yang berlaku untuk antrian (partisi).
Setiap pasangan kunci-nilai yang terpisah
Param1: Value1, seperti, ditambahkan secara terpisah ke akhir baris konfigurasi Slurm partisi dalam format.Param1=Value1Anda hanya dapat menentukan parameter Slurm konfigurasi yang tidak dicantumkan di.
CustomSlurmSettingsUntuk informasi tentang parameter Slurm konfigurasi yang dicantumkan, lihat. Terdaftar penolakan Slurm parameter konfigurasi untuk CustomSlurmSettingsAWS ParallelCluster hanya memeriksa apakah parameter ada dalam daftar tolak. AWS ParallelCluster tidak memvalidasi sintaks atau semantik parameter Slurm konfigurasi kustom Anda. Adalah tanggung jawab Anda untuk memvalidasi parameter Slurm konfigurasi kustom Anda. Parameter Slurm konfigurasi kustom yang tidak valid dapat menyebabkan kegagalan Slurm daemon yang dapat menyebabkan kegagalan pembuatan dan pembaruan cluster.
Untuk informasi selengkapnya tentang cara menentukan parameter Slurm konfigurasi khusus dengan AWS ParallelCluster, lihatSlurm kustomisasi konfigurasi.
Untuk informasi selengkapnya tentang parameter Slurm konfigurasi, lihat slurm.conf
dalam dokumentasi. Slurm Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.
catatan
CustomSlurmSettingsdidukung mulai dengan AWS ParallelCluster versi 3.6.0. Tags(Opsional, [String])-
Daftar pasangan nilai kunci tag. ComputeResourcetag menggantikan tag duplikat yang ditentukan dalam Bagian tag atau di
SlurmQueues/Tags.Key(Opsional,String)-
Kunci tanda.
Value(Opsional,String)-
Nilai tanda.
HealthChecks(Opsional)-
Tentukan pemeriksaan kesehatan simpul komputasi pada semua sumber daya komputasi dalam antrian.
Gpu(Opsional)-
Tentukan pemeriksaan kesehatan GPU pada semua sumber daya komputasi dalam antrian.
catatan
AWS ParallelCluster tidak mendukung
HealthChecks/Gpudi node yang menggunakan sistem operasialinux2ARM. Platform ini tidak mendukung NVIDIA Data Center GPU Manager (DCGM). penting
Pemeriksaan kesehatan GPU bawaan menjalankan diagnostik NVIDIA DCGM level-2 di prolog. Slurm Aktifkan hanya dengan alokasi eksklusif pekerjaan (satu pekerjaan per node; set
JobExclusiveAllocation: true). Jangan mengaktifkannya pada instans GPU P6, P6e, atau yang lebih baru. P-family Lihat perinciannya di Praktik terbaik: Pemeriksaan kesehatan GPU.Enabled(Opsional,Boolean)-
Apakah AWS ParallelCluster melakukan pemeriksaan kesehatan GPU pada node komputasi. Nilai default-nya
false.
Perilaku pemeriksaan kesehatan GPU-
Jika
Gpu/Enableddisetel ketrue, AWS ParallelCluster melakukan pemeriksaan kesehatan GPU pada sumber daya komputasi dalam antrian. -
Pemer
Gpuiksaan kesehatan melakukan pemeriksaan kesehatan GPU pada sumber daya komputasi untuk mencegah pengiriman pekerjaan pada node dengan GPU terdegradasi. -
Jika node komputasi gagal dalam pemeriksaan
Gpukesehatan, status simpul komputasi berubah menjadi.DRAINPekerjaan baru tidak dimulai di node ini. Pekerjaan yang ada berjalan sampai selesai. Setelah semua pekerjaan berjalan selesai, node komputasi berakhir jika itu adalah node dinamis, dan diganti jika itu adalah node statis. -
Durasi pemeriksaan
Gpukesehatan tergantung pada jenis instans yang dipilih, jumlah GPU dalam instans, total memori GPU, dan jumlah target pemeriksaanGpukesehatan (setara dengan jumlah target GPU pekerjaan). Misalnya, pada p4d.24xlarge, durasi tipikal adalah 3 menit. -
Jika pemeriksaan
Gpukesehatan berjalan pada instance yang tidak didukung, instans akan keluar dan pekerjaan berjalan pada node komputasi. Misalnya, jika instance tidak memiliki GPU, atau, jika instance memiliki GPU, tetapi bukan GPU NVIDIA, pemeriksaan kesehatan akan keluar dan pekerjaan berjalan pada node komputasi. Hanya GPU NVIDIA yang didukung. -
Pemer
Gpuiksaan kesehatan menggunakandcgmialat untuk melakukan pemeriksaan kesehatan pada node dan mengambil langkah-langkah berikut:Ketika pemeriksaan
Gpukesehatan dimulai di simpul:-
Ini mendeteksi apakah
nvidia-dcgmdannvidia-fabricmanagerlayanan sedang berjalan. -
Jika layanan ini tidak berjalan, pemeriksaan
Gpukesehatan akan memulainya. -
Ini mendeteksi apakah mode persistensi diaktifkan.
-
Jika mode persistensi tidak diaktifkan, pemeriksaan
Gpukesehatan mengaktifkannya.
Pada akhir pemeriksaan kesehatan, pemeriksaan
Gpukesehatan mengembalikan layanan dan sumber daya ini ke keadaan awal. -
-
Jika pekerjaan ditugaskan ke kumpulan GPU node tertentu, pemeriksaan
Gpukesehatan hanya berjalan pada set tertentu. Jika tidak,Gpupemeriksaan kesehatan berjalan pada semua GPU di node. -
Jika node komputasi menerima 2 atau lebih permintaan
Gpupemeriksaan kesehatan pada saat yang sama, hanya pemeriksaan kesehatan pertama yang dijalankan dan yang lainnya dilewati. Ini juga berlaku untuk pemeriksaan kesehatan yang menargetkan GPU node. Anda dapat memeriksa file log untuk informasi tambahan mengenai situasi ini. -
Log pemeriksaan kesehatan untuk node komputasi tertentu tersedia dalam
/var/log/parallelcluster/slurm_health_check.logfile. File ini tersedia di Amazon CloudWatch, di grup CloudWatch log cluster, di mana Anda dapat menemukan:-
Rincian tentang tindakan yang dijalankan oleh
Gpupemeriksaan kesehatan, termasuk mengaktifkan dan menonaktifkan layanan dan mode persistensi. -
Pengidentifikasi GPU, ID serial, dan UUID.
-
Output pemeriksaan kesehatan.
-
Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.
catatan
HealthChecksdidukung mulai AWS ParallelCluster versi 3.6.0.
Jaringan
(Diperlukan) Mendefinisikan konfigurasi jaringan untuk an Slurm trian.
Networking: SubnetIds: -stringAssignPublicIp:booleanSecurityGroups: -stringAdditionalSecurityGroups: -stringPlacementGroup: Enabled:booleanId:stringName:stringProxy: HttpProxyAddress:string
Pro perti jaringan
SubnetIds(Diperlukan,[String])-
ID subnet yang ada tempat Anda menyediakan an Slurm trian.
Jika Anda mengkonfigurasi jenis instance di SlurmQueues/ComputeResources/InstanceType, Anda hanya dapat menentukan satu subnet.
Jika Anda mengonfigurasi jenis instance di SlurmQueues ComputeResources//Instances, Anda dapat menentukan satu subnet atau beberapa subnet.
Jika Anda menggunakan beberapa subnet, semua subnet yang ditentukan untuk antrian harus berada di VPC yang sama, dengan setiap subnet di Availability Zone (AZ) yang terpisah.
Misalnya, Anda mendefinisikan subnet-1 dan subnet-2 untuk antrian Anda.
subnet-1Dan tidaksubnet-2bisa keduanya masuk AZ-1.subnet-1bisa masuk AZ-1 dansubnet-2bisa masuk AZ-2.Jika Anda mengonfigurasi hanya satu jenis instans dan ingin menggunakan beberapa subnet, tentukan jenis instans Anda
InstancesbukanInstanceType.Misalnya, tentukan/
ComputeResourcesInstances/InstanceType= alinstance.typeih-alihComputeResources/InstanceType=instance.type.catatan
Adaptor Kain Elastis (EFA) tidak didukung di zona ketersediaan yang berbeda.
Penggunaan beberapa Zona Ketersediaan dapat menyebabkan peningkatan latensi jaringan penyimpanan dan menambah biaya transfer data antar AZ. Misalnya, ini dapat terjadi ketika instance mengakses penyimpanan file yang terletak di AZ yang berbeda. Untuk informasi selengkapnya, lihat Transfer Data dalam hal yang sama Wilayah AWS
. Pembaruan cluster untuk mengubah dari penggunaan subnet tunggal ke beberapa subnet:
-
Misalkan definisi subnet dari sebuah cluster didefinisikan dengan subnet tunggal dan FSx terkel AWS ParallelCluster ola untuk sistem file Lustre. Kemudian, Anda tidak dapat memperbarui cluster ini dengan definisi ID subnet yang diperbarui secara langsung. Untuk membuat pembaruan cluster, Anda harus terlebih dahulu mengubah sistem file terkelola ke sistem file eksternal. Untuk informasi selengkapnya, lihat Mengkonversi AWS ParallelCluster penyimpanan terkelola ke penyimpanan eksternal.
-
Misalkan definisi subnet cluster didefinisikan dengan satu subnet dan sistem file Amazon EFS eksternal jika target pemasangan EFS tidak ada untuk semua AZ untuk beberapa subnet yang ditentukan untuk ditambahkan. Kemudian, Anda tidak dapat memperbarui cluster ini dengan definisi ID subnet yang diperbarui secara langsung. Untuk membuat pembaruan cluster atau membuat cluster, Anda harus terlebih dahulu membuat semua target mount untuk semua AZ untuk beberapa subnet yang ditentukan.
Zona Ketersediaan dan reservasi kapasitas cluster yang ditentukan dalam CapacityReservationResourceGroupArn:
-
Anda tidak dapat membuat cluster jika tidak ada tumpang tindih antara kumpulan jenis instans dan zona ketersediaan yang dicakup oleh grup sumber daya reservasi kapasitas yang ditentukan dan kumpulan jenis instans dan zona ketersediaan yang ditentukan untuk antrian.
-
Anda dapat membuat cluster jika ada tumpang tindih sebagian antara kumpulan jenis instans dan zona ketersediaan yang dicakup oleh grup sumber daya reservasi kapasitas yang ditentukan dan kumpulan jenis instans dan zona ketersediaan yang ditentukan untuk antrian. AWS ParallelCluster mengirimkan pesan peringatan tentang tumpang tindih sebagian untuk kasus ini.
-
Untuk informasi selengkapnya, lihat Luncurkan instans dengan Pemesanan Kapasitas Sesuai Permintaan (ODCR).
catatan
Beberapa Zona Ketersediaan ditambahkan dalam AWS ParallelCluster versi 3.4.0.
Awas
Peringatan ini berlaku untuk semua versi 3.x.y sebelum AWS ParallelCluster versi 3.3.1. AWS ParallelCluster versi 3.3.1 tidak terpengaruh jika parameter ini diubah.
Untuk AWS ParallelCluster 3 versi sebelum versi 3.3.1:
Jika Anda mengubah parameter ini dan memperbarui cluster, ini akan membuat FSx terkelola baru untuk sistem file Lustre dan menghapus sistem file FSx terkelola untuk Lustre yang ada tanpa menyimpan data yang ada. Hal ini mengakibatkan hilangnya data. Sebelum Anda melanjutkan, pastikan Anda membuat cadangan data dari FSx untuk sistem file Lustre yang ada jika Anda ingin menyimpan data. Untuk informasi selengkapnya, lihat Bekerja dengan cadangan di Panduan Pengguna FSx for Lustre.
Jika nilai subnet baru ditambahkan, Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.
Jika nilai subnet dihapus, Kebijakan pembaruan: Armada komputasi harus dihentikan atau QueueUpdateStrategyharus disetel agar pengaturan ini diubah untuk pembaruan.
-
AssignPublicIp(Opsional,String)-
Membuat atau menetapkan alamat IP publik ke node dalam Slurm antrian. Nilai yang didukung adalah
truedanfalse. Subnet yang Anda tentukan menentukan nilai default. Subnet dengan IP publik default untuk menetapkan alamat IP publik.Jika Anda menentukan jenis hpc6id instans p4d atau, atau jenis instans lain yang memiliki beberapa antarmuka jaringan atau kartu antarmuka jaringan, Anda harus menyet HeadNode el Networking//ElasticIp
trueuntuk menyediakan akses publik. AWS IP publik hanya dapat ditetapkan ke instans yang diluncurkan dengan antarmuka jaringan tunggal. Untuk kasus ini, sebaiknya gunakan gateway NAT untuk menyediakan akses publik ke node komputasi cluster. Dalam hal ini, aturAssignPublicIpkefalse. Untuk informasi selengkapnya tentang alamat IP, lihat Menetapkan alamat IPv4 publik selama peluncuran instans di Panduan Pengguna Amazon EC2 untuk Instans Linux.catatan
Dimulai dengan AWS ParallelCluster versi 3.15.0, persyaratan ini juga berlaku ketika Anda mengaktifkan Efa pada jenis instance kartu jaringan tunggal yang mendukung lebih dari satu antarmuka jaringan. AWS ParallelCluster meluncurkan node komputasi ini dengan dua antarmuka jaringan (antarmuka utama ditambah
efa-onlyantarmuka khusus), sehingga Amazon EC2 tidak secara otomatis menetapkan IP publik untuk mereka. Untuk antrian ini, aturAssignPublicIpkefalsedan gunakan gateway NAT (atau tempatkan node komputasi di subnet pribadi) untuk menyediakan akses publik. Untuk informasi selengkapnya, lihat Adaptor Elastic Fabric.Kebijakan pembaruan: Jika pengaturan ini diubah, pembaruan tidak diizinkan.
SecurityGroups(Opsional,[String])-
Daftar grup keamanan yang akan digunakan untuk Slurm antrian. Jika tidak ada grup keamanan yang ditentukan, AWS ParallelCluster buat grup keamanan untuk Anda.
Pastikan grup keamanan dikonfigurasi dengan benar untuk SharedStorage sistem Anda.
Awas
Peringatan ini berlaku untuk semua 3.
x.yAWS ParallelCluster versi sebelum versi 3.3.0. AWS ParallelCluster versi 3.3.0 tidak terpengaruh jika parameter ini diubah.Untuk versi AWS ParallelCluster 3 sebelum versi 3.3.0:
Jika Anda mengubah parameter ini dan memperbarui cluster, ini akan membuat FSx terkelola baru untuk sistem file Lustre dan menghapus sistem file FSx terkelola untuk Lustre yang ada tanpa menyimpan data yang ada. Hal ini mengakibatkan hilangnya data. Pastikan untuk mencadangkan data dari FSx untuk sistem file Lustre yang ada jika Anda ingin menyimpan data. Untuk informasi selengkapnya, lihat Bekerja dengan cadangan di Panduan Pengguna FSx for Lustre.
Awas
Jika Anda mengaktifkan Efa untuk instans komputasi, pastikan instans Anda EFA-enabled adalah anggota grup keamanan yang mengizinkan semua lalu lintas masuk dan keluar untuk dirinya sendiri.
Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.
AdditionalSecurityGroups(Opsional,[String])-
Daftar grup keamanan tambahan yang akan digunakan untuk Slurm antrian.
Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.
PlacementGroup(Opsional)-
Menentukan pengaturan grup penempatan untuk an Slurm trian.
PlacementGroup: Enabled:booleanId:stringName:stringEnabled(Opsional,Boolean)-
Menunjukkan apakah grup penempatan digunakan untuk an Slurm trian. Nilai default-nya
false. Id(Opsional,String)-
ID grup penempatan untuk grup penempatan cluster yang ada yang digunakan an Slurm trian. Pastikan untuk memberikan ID grup penempatan dan bukan nama.
Name(Opsional,String)-
Nama grup penempatan untuk grup penempatan cluster yang ada yang digunakan an Slurm trian. Pastikan untuk memberikan nama grup penempatan dan bukan ID.
catatan
-
Jika
PlacementGroup/Enableddisetel ketrue, tanpaNameatauIdditentukan, setiap sumber daya komputasi diberi grup penempatan terkelola sendiri, kecuali ComputeResources/Networking/PlacementGroupdidefinisikan untuk mengganti setelan ini. -
Dimulai dengan AWS ParallelCluster versi 3.3.0, SlurmQueues Networking PlacementGroup///Nameditambahkan sebagai alternatif pilihan untuk SlurmQueues//NetworkingPlacementGroup/Id.
PlacementGroup/Iddan PlacementGroup/Namesetara. Anda dapat menggunakan salah satunya.
Jika Anda menyertakan keduanya PlacementGroup/Iddan PlacementGroup/Name, AWS ParallelCluster gagal. Anda hanya dapat memilih satu atau yang lain.
Anda tidak perlu memperbarui cluster Anda untuk menggunakan PlacementGroup/Name.
-
Saat menggunakan reservasi blok kapasitas, batasan grup penempatan tidak boleh ditetapkan karena kesalahan kapasitas yang tidak mencukupi dapat terjadi karena kendala penempatan di luar reservasi meskipun reservasi kapasitas memiliki kapasitas yang tersisa.
Proxy(Opsional)-
Menentukan pengaturan proxy untuk an Slurm trian.
Proxy: HttpProxyAddress:stringHttpProxyAddress(Opsional,String)-
Mendefinisikan server proxy HTTP atau HTTPS untuk Slurm antrian. Biasanya, itu
https://.x.x.x.x:8080Tidak ada nilai default.
Citra
(Opsional) Menentukan gambar yang akan digunakan untuk an Slurm trian. Untuk menggunakan AMI yang sama untuk semua node, gunakan CustomAmi pengaturan di Image bagian.
Image: CustomAmi:string
Pro perti Gambar
CustomAmi(Opsional,String)-
AMI yang akan digunakan untuk Slurm antrian alih-alih AMI default. Anda dapat menggunakan perintah pcluster CLI untuk melihat daftar AMI default.
catatan
AMI harus didasarkan pada sistem operasi yang sama yang digunakan oleh node kepala.
pcluster list-official-imagesJika AMI kustom memerlukan izin tambahan untuk peluncurannya, Anda harus menambahkan izin ini ke kebijakan node kepala.
Misalnya, jika AMI kustom memiliki snapshot terenkripsi yang terkait dengannya, kebijakan tambahan berikut diperlukan dalam kebijakan node kepala.
Untuk memecahkan masalah peringatan validasi AMI kustom, lihatMemecahkan masalah AMI khusus.
ComputeResources
(Diperlukan) Mendefinisikan ComputeResources konfigurasi untuk an Slurm trian.
catatan
-
Ukuran cluster dapat berubah selama pembaruan. Untuk informasi selengkapnya, lihat Ukuran kapasitas cluster dan pembaruan.
-
Sumber daya komputasi baru dapat ditambahkan ke cluster hanya jika digunakan di subnet milik blok CIDR yang ada saat cluster dibuat.
ComputeResources: - Name:stringInstanceType:stringInstances: - InstanceType:stringMinCount:integerMaxCount:integerDynamicNodePriority:integerStaticNodePriority:integerSpotPrice:floatDisableSimultaneousMultithreading:booleanSchedulableMemory:integerHealthChecks: Gpu: Enabled:booleanEfa: Enabled:booleanGdrSupport:booleanCapacityReservationTarget: CapacityReservationId:stringCapacityReservationResourceGroupArn:stringNetworking: PlacementGroup: Enabled:booleanName:stringCustomSlurmSettings:dictTags: - Key:stringValue:stringLaunchTemplateOverrides: LaunchTemplateId:stringVersion:string
ComputeResourcesproperti
Name(Diperlukan,String)-
Nama lingkungan komputasi Slurm antrian. Nama dapat memiliki hingga 25 karakter.
Kebijakan pembaruan: Jika pengaturan ini diubah, pembaruan tidak diizinkan.
InstanceType(Diperlukan,String)-
Jenis instance yang digunakan dalam sumber daya Slurm komputasi ini. Semua jenis instance dalam cluster harus menggunakan arsitektur prosesor yang sama. Instans dapat menggunakan
arm64arsitekturx86_64atau.Konfigurasi cluster harus menentukan salah satu InstanceType atau Instans. Jika keduanya didefinisikan, AWS ParallelCluster gagal.
Ketika Anda mendefinisikan
InstanceType, Anda tidak dapat mendefinisikan beberapa subnet. Jika Anda mengonfigurasi hanya satu jenis instans dan ingin menggunakan beberapa subnet, tentukan jenis instans Anda di,Instancesbukan diInstanceType. Untuk informasi lebih lanjut, lihat Networking/SubnetIds.Jika Anda menentukan jenis hpc6id instans p4d atau, atau jenis instans lain yang memiliki beberapa antarmuka jaringan atau kartu antarmuka jaringan, Anda harus meluncurkan instans komputasi di subnet pribadi seperti yang dijelaskan dalam. AWS ParallelCluster menggunakan dua subnet AWS IP publik hanya dapat ditetapkan ke instans yang diluncurkan dengan antarmuka jaringan tunggal. Untuk informasi selengkapnya, lihat Menetapkan alamat IPv4 publik selama peluncuran instans di Panduan Pengguna Amazon EC2 untuk Instans Linux.
catatan
Dimulai dengan AWS ParallelCluster versi 3.15.0, persyaratan ini juga berlaku ketika Anda mengaktifkan Efa pada jenis instance kartu jaringan tunggal yang mendukung lebih dari satu antarmuka jaringan. Untuk informasi selengkapnya, lihat Adaptor Elastic Fabric.
Kebijakan pembaruan: Armada komputasi harus dihentikan agar pengaturan ini diubah untuk pembaruan.
Instances(Diperlukan)-
Menentukan daftar jenis instance untuk sumber daya komputasi. Untuk menentukan strategi alokasi untuk daftar jenis instans, lihat AllocationStrategy.
Konfigurasi cluster harus menentukan salah satu InstanceType atau Instances. Jika keduanya didefinisikan, AWS ParallelCluster gagal.
Untuk informasi selengkapnya, lihat Beberapa alokasi tipe instans dengan Slurm.
Instances: - InstanceType:stringcatatan
Dimulai dengan AWS ParallelCluster versi 3.7.0,
EnableMemoryBasedSchedulingdapat diaktifkan jika Anda mengonfigurasi beberapa jenis instans di Inst ans.Untuk AWS ParallelCluster versi 3.2.0 hingga 3.6.
x, tidakEnableMemoryBasedSchedulingdapat diaktifkan jika Anda mengonfigurasi beberapa jenis instans di Instans.InstanceType(Diperlukan,String)-
Jenis instance yang akan digunakan dalam sumber daya Slurm komputasi ini. Semua jenis instance dalam cluster harus menggunakan arsitektur prosesor yang sama, baik
x86_64atauarm64.Jenis instance yang tercantum di Instances harus memiliki:
-
Jumlah vCPU yang sama, atau, jika DisableSimultaneousMultithreading disetel ke
true, jumlah core yang sama. -
Jumlah akselerator yang sama dari produsen yang sama.
Jenis instance yang tercantum di Instances dapat memiliki:
-
Jumlah memori yang berbeda.
Dalam hal ini, memori minimum harus ditetapkan sebagai Slurm sumber daya yang dapat dikonsumsi.
catatan
Dimulai dengan AWS ParallelCluster versi 3.7.0,
EnableMemoryBasedSchedulingdapat diaktifkan jika Anda mengonfigurasi beberapa jenis instans di Inst ans.Untuk AWS ParallelCluster versi 3.2.0 hingga 3.6.
x, tidakEnableMemoryBasedSchedulingdapat diaktifkan jika Anda mengonfigurasi beberapa jenis instans di Instans. -
Kartu jaringan yang berbeda.
Dalam hal ini, jumlah antarmuka jaringan yang dikonfigurasi untuk sumber daya komputasi ditentukan oleh jenis instance dengan jumlah kartu jaringan terkecil.
-
Bandwidth jaringan yang berbeda.
-
Ukuran toko instance yang berbeda.
Jika Anda menentukan jenis hpc6id instans p4d atau, atau jenis instans lain yang memiliki beberapa antarmuka jaringan atau kartu antarmuka jaringan, Anda harus meluncurkan instans komputasi di subnet pribadi seperti yang dijelaskan dalam. AWS ParallelCluster menggunakan dua subnet AWS IP publik hanya dapat ditetapkan ke instans yang diluncurkan dengan antarmuka jaringan tunggal. Untuk informasi selengkapnya, lihat Menetapkan alamat IPv4 publik selama peluncuran instans di Panduan Pengguna Amazon EC2 untuk Instans Linux.
catatan
Dimulai dengan AWS ParallelCluster versi 3.15.0, persyaratan ini juga berlaku ketika Anda mengaktifkan Efa pada jenis instance kartu jaringan tunggal yang mendukung lebih dari satu antarmuka jaringan. Untuk informasi selengkapnya, lihat Adaptor Elastic Fabric.
Kebijakan pembaruan: Armada komputasi harus dihentikan agar pengaturan ini diubah untuk pembaruan.
-
catatan
Instancesdidukung mulai dengan AWS ParallelCluster versi 3.3.0. MinCount(Opsional,Integer)-
Jumlah minimum instance yang digunakan sumber daya Slurm komputasi. Default-nya adalah 0.
catatan
Ukuran cluster dapat berubah selama pembaruan. Untuk informasi selengkapnya, lihat Ukuran kapasitas cluster dan pembaruan
Kebijakan pembaruan: Armada komputasi harus dihentikan agar pengaturan ini diubah untuk pembaruan.
MaxCount(Opsional,Integer)-
Jumlah maksimum instance yang digunakan sumber daya Slurm komputasi. Default-nya adalah 10.
Saat Anda menggunakan
CapacityType = CAPACITY_BLOCK,MaxCountharus sama denganMinCountdan lebih besar dari 0, karena semua bagian instance dari reservasi Blok Kapasitas dikelola sebagai node statis.Pada waktu pembuatan cluster, node kepala menunggu semua node statis siap sebelum menandakan keberhasilan pembuatan cluster. Namun, saat Anda menggunakan
CapacityType = CAPACITY_BLOCK, bagian node dari sumber daya komputasi yang terkait dengan Blok Kapasitas tidak akan dipertimbangkan untuk pemeriksaan ini. Cluster akan dibuat meskipun tidak semua Blok Kapasitas yang dikonfigurasi aktif.catatan
Ukuran cluster dapat berubah selama pembaruan. Untuk informasi selengkapnya, lihat Ukuran kapasitas cluster dan pembaruan
DynamicNodePriority(Opsional,Integer)-
Prioritas node dinamis dalam sumber daya komputasi antrian. Prioritas memetakan ke parameter
Weightkonfigurasi Slurm node untuk node dinamis sumber daya komputasi. Nilai default-nya adalah 1000.Slurmmemprioritaskan node dengan
Weightnilai terendah terlebih dahulu.Awas
Penggunaan banyak
Weightnilai yang berbeda dalam Slurm partisi (antrian) mungkin memperlambat laju penjadwalan pekerjaan dalam antrian.Dalam AWS ParallelCluster versi yang lebih awal dari versi 3.7.0, node statis dan dinamis diberi bobot default yang sama dari
1. Dalam hal ini, Slurm mungkin memprioritaskan node dinamis idle daripada node statis idle karena skema penamaan untuk node statis dan dinamis. Ketika semua yang lain sama, jadwalkan Slurm node menurut abjad berdasarkan nama.catatan
DynamicNodePriorityditambahkan dalam AWS ParallelCluster versi 3.7.0.Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.
StaticNodePriority(Opsional,Integer)-
Prioritas node statis dalam sumber daya komputasi antrian. Prioritas memetakan ke parameter
Weightkonfigurasi Slurm node untuk node statis sumber daya komputasi. Nilai default-nya adalah 1.Slurmmemprioritaskan node dengan
Weightnilai terendah terlebih dahulu.Awas
Penggunaan banyak
Weightnilai yang berbeda dalam Slurm partisi (antrian) mungkin memperlambat laju penjadwalan pekerjaan dalam antrian.catatan
StaticNodePriorityditambahkan dalam AWS ParallelCluster versi 3.7.0.Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.
SpotPrice(Opsional,Float)-
Harga maksimum yang dibayarkan untuk Instans Spot Amazon EC2 sebelum instans apa pun diluncurkan. Nilai default adalah On-Demand harga.
DisableSimultaneousMultithreading(Opsional,Boolean)-
Jika
true, multithreading pada node dalam Slurm antrian dinonaktifkan. Nilai default-nya adalahfalse.Tidak semua jenis instance dapat menonaktifkan multithreading. Untuk daftar jenis instans yang mendukung penonaktifan multithreading, lihat inti dan utas CPU untuk setiap inti CPU per jenis instans di Panduan Pengguna Amazon EC2.
Kebijakan pembaruan: Armada komputasi harus dihentikan agar pengaturan ini diubah untuk pembaruan.
SchedulableMemory(Opsional,Integer)-
Jumlah memori di MiB yang dikonfigurasi dalam Slurm parameter
RealMemoryuntuk node komputasi dari sumber daya komputasi. Nilai ini adalah batas atas untuk memori node yang tersedia untuk pekerjaan saat SlurmSettings/EnableMemoryBasedSchedulingdiaktifkan. Nilai default adalah 95 persen dari memori yang tercantum dalam Jenis Instans Amazon EC2dan dikembalikan oleh Amazon EC2 API. DescribeInstanceTypes Pastikan untuk mengonversi nilai yang diberikan dalam GiB ke MiB. Nilai yang didukung:
1-EC2MemoryEC2Memoryadalah memori (dalam MiB) yang terdaftar di Amazon EC2 Instance Typesdan dikembalikan oleh Amazon EC2 API. DescribeInstanceTypes Pastikan untuk mengonversi nilai yang diberikan dalam GiB ke MiB. Opsi ini paling relevan bila SlurmSettings/EnableMemoryBasedSchedulingdiaktifkan. Untuk informasi selengkapnya, lihat Slurm penjadwalan berbasis memori.
catatan
SchedulableMemorydidukung mulai dengan AWS ParallelCluster versi 3.2.0.Dimulai dengan versi 3.2.0, secara default, AWS ParallelCluster mengonfigur
RealMemoryasi node Slurm komputasi ke 95 persen memori yang dikembalikan oleh Amazon EC2 API.DescribeInstanceTypesKonfigurasi ini tidak tergantung pada nilaiEnableMemoryBasedScheduling. HealthChecks(Opsional)-
Tentukan pemeriksaan kesehatan pada sumber daya komputasi.
Gpu(Opsional)-
Tentukan pemeriksaan kesehatan GPU pada sumber daya komputasi.
Enabled(Opsional,Boolean)-
Apakah AWS ParallelCluster melakukan pemeriksaan kesehatan GPU pada menghitung sumber daya dalam antrian. Nilai default-nya
false.catatan
AWS ParallelCluster tidak mendukung
HealthChecks/Gpudi node yang menggunakan sistem operasialinux2ARM. Platform ini tidak mendukung NVIDIA Data Center GPU Manager (DCGM).
Perilaku pemeriksaan kesehatan GPU-
Jika
Gpu/Enableddisetel ketrue, AWS ParallelCluster melakukan pemeriksaan kesehatan GPU pada sumber daya komputasi. -
Pemer
Gpuiksaan kesehatan melakukan pemeriksaan kesehatan pada sumber daya komputasi untuk mencegah pengiriman pekerjaan pada node dengan GPU terdegradasi. -
Jika node komputasi gagal dalam pemeriksaan
Gpukesehatan, status simpul komputasi berubah menjadi.DRAINPekerjaan baru tidak dimulai di node ini. Pekerjaan yang ada berjalan sampai selesai. Setelah semua pekerjaan berjalan selesai, node komputasi berakhir jika itu adalah node dinamis, dan diganti jika itu adalah node statis. -
Durasi pemeriksaan
Gpukesehatan tergantung pada jenis instans yang dipilih, jumlah GPU dalam instans, dan jumlah target pemeriksaanGpukesehatan (setara dengan jumlah target GPU pekerjaan). Untuk contoh dengan 8 GPU, durasi tipikal kurang dari 3 menit. -
Jika pemeriksaan
Gpukesehatan berjalan pada instance yang tidak didukung, instans akan keluar dan pekerjaan berjalan pada node komputasi. Misalnya, jika instance tidak memiliki GPU, atau, jika instance memiliki GPU, tetapi bukan GPU NVIDIA, pemeriksaan kesehatan akan keluar dan pekerjaan berjalan pada node komputasi. Hanya GPU NVIDIA yang didukung. -
Pemer
Gpuiksaan kesehatan menggunakandcgmialat untuk melakukan pemeriksaan kesehatan pada node dan mengambil langkah-langkah berikut:Ketika pemeriksaan
Gpukesehatan dimulai di simpul:-
Ini mendeteksi apakah
nvidia-dcgmdannvidia-fabricmanagerlayanan sedang berjalan. -
Jika layanan ini tidak berjalan, pemeriksaan
Gpukesehatan akan memulainya. -
Ini mendeteksi apakah mode persistensi diaktifkan.
-
Jika mode persistensi tidak diaktifkan, pemeriksaan
Gpukesehatan mengaktifkannya.
Pada akhir pemeriksaan kesehatan, pemeriksaan
Gpukesehatan mengembalikan layanan dan sumber daya ini ke keadaan awal. -
-
Jika pekerjaan ditugaskan ke kumpulan GPU node tertentu, pemeriksaan
Gpukesehatan hanya berjalan pada set tertentu. Jika tidak,Gpupemeriksaan kesehatan berjalan pada semua GPU di node. -
Jika node komputasi menerima 2 atau lebih permintaan
Gpupemeriksaan kesehatan pada saat yang sama, hanya pemeriksaan kesehatan pertama yang dijalankan dan yang lainnya dilewati. Ini juga berlaku untuk pemeriksaan kesehatan yang menargetkan GPU node. Anda dapat memeriksa file log untuk informasi tambahan mengenai situasi ini. -
Log pemeriksaan kesehatan untuk node komputasi tertentu tersedia dalam
/var/log/parallelcluster/slurm_health_check.logfile. File ini tersedia di Amazon CloudWatch, di grup CloudWatch log cluster, di mana Anda dapat menemukan:-
Rincian tentang tindakan yang dijalankan oleh
Gpupemeriksaan kesehatan, termasuk mengaktifkan dan menonaktifkan layanan dan mode persistensi. -
Pengidentifikasi GPU, ID serial, dan UUID.
-
Output pemeriksaan kesehatan.
-
Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.
catatan
HealthChecksdidukung mulai AWS ParallelCluster versi 3.6.0. Efa(Opsional)-
Menentukan pengaturan Elastic Fabric Adapter (EFA) untuk node dalam Slurm antrian.
Efa: Enabled:booleanGdrSupport:booleanEnabled(Opsional,Boolean)-
Menentukan bahwa Elastic Fabric Adapter (EFA) diaktifkan. Untuk melihat daftar instans Amazon EC2 yang mendukung EFA, lihat Jenis instans yang didukung di Panduan Pengguna Amazon EC2 untuk Instans Linux. Untuk informasi selengkapnya, lihat Elastic Fabric Adapter. Kami menyarankan Anda menggunakan cluster SlurmQueues/Networking/PlacementGroupuntuk meminimalkan latensi antar instance.
Nilai default-nya adalah
false.catatan
Adaptor Kain Elastis (EFA) tidak didukung di zona ketersediaan yang berbeda. Untuk informasi selengkapnya, lihat SubnetIds.
Awas
Jika Anda menentukan grup keamanan khusus di SecurityGroups, pastikan EFA-enabled instans Anda adalah anggota grup keamanan yang mengizinkan semua lalu lintas masuk dan keluar untuk dirinya sendiri.
GdrSupport(Opsional,Boolean)-
(Opsional) Dimulai dengan AWS ParallelCluster versi 3.0.2, pengaturan ini tidak berpengaruh. Dukungan Elastic Fabric Adapter (EFA) untuk GPUDirect RDMA (akses memori langsung jarak jauh) selalu diaktifkan jika didukung oleh jenis instance untuk sumber daya Slurm komputasi dan sistem operasi.
CapacityReservationTarget-
CapacityReservationTarget: CapacityReservationId:stringCapacityReservationResourceGroupArn:stringMenentukan reservasi kapasitas sesuai permintaan yang akan digunakan untuk sumber daya komputasi.
CapacityReservationId(Opsional,String)-
ID reservasi kapasitas yang ada untuk ditargetkan untuk sumber daya komputasi antrian. Id dapat merujuk ke ODCR atau Blok Kapasitas untuk ML.
Ketika parameter ini ditentukan pada tingkat sumber daya komputasi, InstanceType adalah opsional, itu akan diambil secara otomatis dari reservasi.
CapacityReservationResourceGroupArn(Opsional,String)-
Menunjukkan Nama Sumber Daya Amazon (ARN) dari grup sumber daya yang berfungsi sebagai grup reservasi kapasitas tertaut layanan untuk sumber daya komputasi. AWS ParallelCluster mengidentifikasi dan menggunakan reservasi kapasitas yang paling tepat dari grup. Grup sumber daya harus memiliki setidaknya satu ODCR untuk setiap jenis instans yang terdaftar untuk sumber daya komputasi. Untuk informasi selengkapnya, lihat Luncurkan instans dengan Pemesanan Kapasitas Sesuai Permintaan (ODCR).
-
Jika
PlacementGroupdiaktifkan di SlurmQueues/Networkingatau SlurmQueues ComputeResources/Networking, pilih AWS ParallelCluster grup sumber daya yang menargetkan jenis instance danPlacementGroupuntuk sumber daya komputasi jika ada.Harus
PlacementGroupmenargetkan salah satu jenis instance yang didefinisikan di ComputeResources. -
Jika
PlacementGrouptidak diaktifkan di SlurmQueues/Networkingatau SlurmQueues ComputeResources/Networking, pilih AWS ParallelCluster grup sumber daya yang menargetkan hanya jenis instance sumber daya komputasi, jika ada.
-
catatan
CapacityReservationTargetditambahkan dengan AWS ParallelCluster versi 3.3.0. Networking-
Networking: PlacementGroup: Enabled:booleanName:stringPlacementGroup(Opsional)-
Menentukan pengaturan grup penempatan untuk sumber daya komputasi.
Enabled(Opsional,Boolean)-
Menunjukkan apakah grup penempatan digunakan untuk sumber daya komputasi.
-
Jika disetel ke
true, tanpaNameditentukan, sumber daya komputasi tersebut diberi grup penempatan terkelola sendiri, terlepas dari PlacementGroup pengaturan SlurmQueues/Networking/. -
Jika disetel ke
true, dengan yangNameditentukan, sumber daya komputasi itu ditetapkan grup penempatan bernama, terlepas dariPlacementGrouppengaturanSlurmQueues/Networking/.
-
Name(Opsional,String)-
Nama grup penempatan untuk grup penempatan cluster yang ada yang digunakan untuk sumber daya komputasi.
catatan
-
Jika keduanya
PlacementGroup/EnableddanNametidak disetel, nilainya masing-masing default ke PlacementGroup pengaturan SlurmQueues Networking//. -
Saat menggunakan reservasi blok kapasitas, batasan grup penempatan tidak boleh ditetapkan karena kesalahan kapasitas yang tidak mencukupi dapat terjadi karena kendala penempatan di luar reservasi meskipun reservasi kapasitas memiliki kapasitas yang tersisa.
-
ComputeResources/Networking/PlacementGroupditambahkan dengan AWS ParallelCluster versi 3.3.0.
CustomSlurmSettings(Opsional,Dict)-
(Opsional) Mendefinisikan pengaturan konfigurasi Slurm node kustom (sumber daya komputasi).
Menentukan kamus pasangan kunci-nilai parameter Slurm konfigurasi kustom yang berlaku untuk Slurm node (sumber daya komputasi).
Setiap pasangan kunci-nilai yang terpisah
Param1: Value1, seperti, ditambahkan secara terpisah ke akhir baris konfigurasi Slurm node dalam format.Param1=Value1Anda hanya dapat menentukan parameter Slurm konfigurasi yang tidak dicantumkan di.
CustomSlurmSettingsUntuk informasi tentang parameter Slurm konfigurasi yang dicantumkan, lihat. Terdaftar penolakan Slurm parameter konfigurasi untuk CustomSlurmSettingsAWS ParallelCluster hanya memeriksa apakah parameter ada dalam daftar tolak. AWS ParallelCluster tidak memvalidasi sintaks atau semantik parameter Slurm konfigurasi kustom Anda. Adalah tanggung jawab Anda untuk memvalidasi parameter Slurm konfigurasi kustom Anda. Parameter Slurm konfigurasi kustom yang tidak valid dapat menyebabkan kegagalan Slurm daemon yang dapat menyebabkan kegagalan pembuatan dan pembaruan cluster.
Untuk informasi selengkapnya tentang cara menentukan parameter Slurm konfigurasi khusus dengan AWS ParallelCluster, lihatSlurm kustomisasi konfigurasi.
Untuk informasi selengkapnya tentang parameter Slurm konfigurasi, lihat slurm.conf
dalam dokumentasi. Slurm Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.
catatan
CustomSlurmSettingsdidukung mulai dengan AWS ParallelCluster versi 3.6.0. Tags(Opsional, [String])-
Daftar pasangan nilai kunci tag.
ComputeResourcetag menggantikan tag duplikat yang ditentukan di Bagian tag atau SlurmQueues/Tags.Key(Opsional,String)-
Kunci tanda.
Value(Opsional,String)-
Nilai tanda.
LaunchTemplateOverrides(Opsional)-
catatan
LaunchTemplateOverridesditambahkan dengan AWS ParallelCluster versi 3.15.0.Menentukan template peluncuran untuk mengganti template peluncuran default yang dibuat untuk AWS ParallelCluster sumber daya komputasi. Template peluncuran seharusnya hanya berisi penggantian antarmuka jaringan. AWS ParallelCluster memvalidasi template peluncuran dan mencegah penggantian parameter lain. Untuk informasi selengkapnya tentang cara menggunakan penggantian ini, lihatSesuaikan antarmuka jaringan node komputasi dengan penggantian template peluncuran.
LaunchTemplateOverrides: LaunchTemplateId:stringVersion:stringLaunchTemplateId(Diperlukan,String)-
ID templat peluncuran.
Version(Diperlukan,String)-
Nomor versi templat peluncuran.
ComputeSettings
(Diperlukan) Mendefinisikan ComputeSettings konfigurasi untuk an Slurm trian.
ComputeSettingsproperti
Menentukan properti ComputeSettings dari node dalam Slurm antrian.
ComputeSettings: LocalStorage: RootVolume: Size:integerEncrypted:booleanVolumeType:stringIops:integerThroughput:integerEphemeralVolume: MountDir:string
LocalStorage(Opsional)-
Menentukan properti
LocalStoragedari node dalam Slurm antrian.LocalStorage: RootVolume: Size:integerEncrypted:booleanVolumeType:stringIops:integerThroughput:integerEphemeralVolume: MountDir:stringRootVolume(Opsional)-
Menentukan rincian volume root dari node dalam Slurm antrian.
RootVolume: Size:integerEncrypted:booleanVolumeType:stringIops:integerThroughput:integerSize(Opsional,Integer)-
Menentukan ukuran volume root dalam gibibytes (GiB) untuk node dalam antrian. Slurm Ukuran default berasal dari AMI. Menggunakan ukuran yang berbeda mengharuskan AMI mendukung
growroot. Encrypted(Opsional,Boolean)-
Jika
true, volume root dari node dalam Slurm antrian dienkripsi. Nilai default-nya adalahtrue. VolumeType(Opsional,String)-
Menentukan jenis volume Amazon EBS dari node dalam Slurm antrian. Nilai yang didukung adalah
gp2gp3,io1,,io2,sc1,st1, danstandard. Nilai default-nya adalahgp3.Untuk informasi lebih lanjut, lihat Jenis volume Amazon EBS di Panduan Pengguna Amazon EC2.
Iops(Opsional,Boolean)-
Mendefinisikan jumlah IOPS untuk
io1,io2, dan volumegp3tipe.Nilai default, nilai yang didukung, dan
volume_iopsvolume_sizerasio bervariasi menurutVolumeTypedanSize.VolumeType=io1-
Default
Iops= 100Nilai yang didukung
Iops= 100—64000 †Maksimum
volume_iopskevolume_sizerasio = 50 IOPS per GiB. 5000 IOPS membutuhkanvolume_sizesetidaknya 100 GiB. VolumeType=io2-
Default
Iops= 100Nilai yang didukung
Iops= 100-64000 (256000 untuk volumeio2Block Express) †Maksimum
IopskeSizerasio = 500 IOPS per GiB. 5000 IOPS membutuhkanSizesetidaknya 10 GiB. VolumeType=gp3-
Standar
Iops= 3000Nilai yang didukung
Iops= 3000—16000 †Maksimum
IopskeSizerasio = 500 IOPS per GiB untuk volume dengan IOPS lebih besar dari 3000.
† IOPS maksimum dijamin hanya pada Instans yang dibangun di Sistem Nitro yang juga disediakan dengan lebih dari 32.000 IOPS. Instans lain dapat memiliki hingga 32.000 IOPS.
io1Volume sebelumnya mungkin tidak mencapai kinerja penuh kecuali Anda memodifikasi volume.io2Volume Block Express mendukungvolume_iopsnilai hingga 256000 pada jenisR5binstans. Untuk informasi selengkapnya, lihatio2Blok volume Express di Panduan Pengguna Amazon EC2. Throughput(Opsional,Integer)-
Mendefinisikan throughput untuk jenis
gp3volume, di MiB/s. Pengaturan ini hanya berlaku bilaVolumeTypeadagp3. Nilai default-nya adalah125. Nilai yang didukung: 125—1000 MiB/sRasio
ThroughputtoIopsbisa tidak lebih dari 0,25. Throughput maksimum 1000 MiB/s mengharIopsuskan pengaturan setidaknya 4000.
EphemeralVolume(Opsional,Boolean)-
Menentukan pengaturan untuk volume sementara. Volume sementara dibuat dengan menggabungkan semua volume penyimpanan instance ke dalam satu volume logis yang diformat dengan sistem
ext4file. Nilai default-nya/scratch. Jika jenis instans tidak memiliki volume penyimpanan instans, tidak ada volume sementara yang dibuat. Untuk informasi selengkapnya, lihat Volume penyimpanan instans di Panduan Pengguna Amazon EC2.EphemeralVolume: MountDir:stringMountDir(Opsional,String)-
Direktori mount untuk volume sementara untuk setiap node dalam antrianSlurm.
CustomActions
(Opsional) Menentukan skrip kustom untuk dijalankan pada node dalam an Slurm trian.
CustomActions: OnNodeStart: Sequence: - Script:stringArgs: -stringScript:stringArgs: -stringOnNodeConfigured: Sequence: - Script:stringArgs: -stringScript:stringArgs: -string
CustomActionsProperti
OnNodeStart(Opsional,String)-
Menentukan urutan skrip atau skrip tunggal untuk dijalankan pada node dalam an Slurm trian sebelum tindakan bootstrap penerapan node dimulai. AWS ParallelCluster tidak mendukung menyertakan satu skrip dan
Sequenceuntuk tindakan kustom yang sama. Untuk informasi selengkapnya, lihat Tindakan bootstrap kustom.Sequence(Opsional)-
Daftar skrip yang akan dijalankan.
Script(Diperlukan,String)-
File yang akan digunakan. Jalur file dapat dimulai dengan
https://ataus3://. Args(Opsional,[String])-
Daftar argumen untuk diteruskan ke skrip.
Script(Diperlukan,String)-
File yang akan digunakan untuk satu skrip. Jalur file dapat dimulai dengan
https://ataus3://. Args(Opsional,[String])-
Daftar argumen untuk diteruskan ke skrip tunggal.
OnNodeConfigured(Opsional,String)-
Menentukan urutan skrip atau skrip tunggal untuk dijalankan pada node dalam Slurm antrian setelah semua tindakan bootstrap node selesai. AWS ParallelCluster tidak mendukung menyertakan satu skrip dan
Sequenceuntuk tindakan kustom yang sama. Untuk informasi selengkapnya, lihat Tindakan bootstrap kustom.Sequence(Opsional)-
Daftar skrip yang akan dijalankan.
Script(Diperlukan,String)-
File yang akan digunakan. Jalur file dapat dimulai dengan
https://ataus3://. Args(Opsional,[String])-
Daftar argumen untuk diteruskan ke skrip.
Script(Diperlukan,String)-
File yang akan digunakan untuk satu skrip. Jalur file dapat dimulai dengan
https://ataus3://. Args(Opsional,[String])-
Daftar argumen untuk diteruskan ke skrip tunggal.
catatan
Sequenceditambahkan mulai dengan AWS ParallelCluster versi 3.6.0. Saat Anda menentukanSequence, Anda dapat mencantumkan beberapa skrip untuk tindakan kustom. AWS ParallelCluster terus mendukung konfigurasi tindakan kustom dengan satu skrip, tanpa termasukSequence.AWS ParallelCluster tidak mendukung menyertakan satu skrip dan
Sequenceuntuk tindakan kustom yang sama.
Iam
(Opsional) Men definisikan pengaturan IAM opsional untuk Slurm antrian.
Iam: S3Access: - BucketName:stringEnableWriteAccess:booleanKeyName:stringAdditionalIamPolicies: - Policy:stringInstanceProfile:stringInstanceRole:string
Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.
Properti Iam
InstanceProfile(Opsional,String)-
Menentukan profil instance untuk mengganti peran instans default atau profil instance untuk Slurm antrian. Anda tidak dapat menentukan keduanya
InstanceProfiledanInstanceRole. Formatnya adalaharn:${Partition}:iam::${Account}:instance-profile/${InstanceProfileName}.Jika ini ditentukan,
AdditionalIamPoliciespengaturanS3Accessdan tidak dapat ditentukan.Sebaiknya tentukan satu atau kedua
AdditionalIamPoliciespengaturanS3Accessdan karena fitur yang ditambahkan AWS ParallelCluster sering memerlukan izin baru.Kebijakan pembaruan: Armada komputasi harus dihentikan agar pengaturan ini diubah untuk pembaruan.
InstanceRole(Opsional,String)-
Menentukan peran instance untuk mengganti peran instans default atau profil instance untuk Slurm antrian. Anda tidak dapat menentukan keduanya
InstanceProfiledanInstanceRole. Formatnya adalaharn:${Partition}:iam::${Account}:role/${RoleName}.Jika ini ditentukan,
AdditionalIamPoliciespengaturanS3Accessdan tidak dapat ditentukan.Sebaiknya tentukan satu atau kedua
AdditionalIamPoliciespengaturanS3Accessdan karena fitur yang ditambahkan AWS ParallelCluster sering memerlukan izin baru.Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.
S3Access(Opsional)-
Menentukan bucket untuk an Slurm trian. Ini digunakan untuk menghasilkan kebijakan untuk memberikan akses yang ditentukan ke bucket dalam Slurm antrian.
Jika ini ditentukan,
InstanceRolepengaturanInstanceProfiledan tidak dapat ditentukan.Sebaiknya tentukan satu atau kedua
AdditionalIamPoliciespengaturanS3Accessdan karena fitur yang ditambahkan AWS ParallelCluster sering memerlukan izin baru.S3Access: - BucketName:stringEnableWriteAccess:booleanKeyName:stringKebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.
BucketName(Diperlukan,String)-
Nama ember.
Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.
KeyName(Opsional,String)-
Kunci untuk ember. Nilai default-nya adalah
*.Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.
EnableWriteAccess(Opsional,Boolean)-
Menunjukkan apakah akses tulis diaktifkan untuk bucket.
Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.
AdditionalIamPolicies(Opsional)-
Menentukan daftar Nama Sumber Daya Amazon (ARN) kebijakan IAM untuk Amazon EC2. Daftar ini dilampirkan ke peran root yang digunakan untuk Slurm antrian selain izin yang diperlukan oleh AWS ParallelCluster.
Nama kebijakan IAM dan ARN-nya berbeda. Nama tidak bisa digunakan.
Jika ini ditentukan,
InstanceRolepengaturanInstanceProfiledan tidak dapat ditentukan.Sebaiknya gunakan
AdditionalIamPolicieskarenaAdditionalIamPoliciesditambahkan ke izin yang diperlukan, AWS ParallelCluster danInstanceRoleharus menyertakan semua izin yang diperlukan. Izin yang diperlukan sering berubah dari rilis ke rilis saat fitur ditambahkan.Tidak ada nilai default.
AdditionalIamPolicies: - Policy:stringKebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.
Policy(Diperlukan,[String])-
Daftar kebijakan IAM.
Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.
SlurmSettings
(Opsional) Men definisikan pengaturan Slurm yang berlaku untuk seluruh cluster.
SlurmSettings: ScaledownIdletime:integerQueueUpdateStrategy:stringEnableMemoryBasedScheduling:booleanCustomSlurmSettings:[dict]CustomSlurmSettingsIncludeFile:stringDatabase: Uri:stringUserName:stringPasswordSecretArn:stringExternalSlurmdbd: Host:stringPort:integerDns: DisableManagedDns:booleanHostedZoneId:stringUseEc2Hostnames:boolean
SlurmSettingsProperti
ScaledownIdletime(Opsional,Integer)-
Mendefinisikan jumlah waktu (dalam menit) yang tidak ada pekerjaan dan Slurm node dihentikan.
Nilai default-nya adalah
10.Kebijakan pembaruan: Armada komputasi harus dihentikan agar pengaturan ini diubah untuk pembaruan.
MungeKeySecretArn(Opsional,String)-
Nama Sumber Daya Amazon (ARN) dari AWS rahasia Manajer Rahasia teks biasa yang berisi kunci munge yang dikodekan base64 untuk digunakan dalam cluster. Slurm Kunci munge ini akan digunakan untuk mengotentikasi panggilan RPC antara perintah Slurm klien dan Slurm daemon yang bertindak sebagai server jarak jauh. Jika tidak MungeKeySecretArn disediakan, AWS ParallelCluster akan menghasilkan kunci munge acak untuk cluster.
catatan
MungeKeySecretArndidukung mulai dengan AWS ParallelCluster versi 3.8.0.Awas
Jika baru MungeKeySecretArn ditambahkan ke cluster yang ada, tidak ParallelCluster akan mengembalikan Kunci munge sebelumnya jika terjadi Rollback atau saat nanti menghapus. MungeKeySecretArn Sebagai gantinya, kunci munge acak baru akan dihasilkan.
Jika AWS ParallelCluster pengguna memiliki izin untuk DescribeSecret pada sumber daya rahasia tertentu, MungeKeySecretArn divalidasi. MungeKeySecretArn valid jika:
-
Rahasia yang ditentukan ada, dan
-
Rahasianya adalah plaintext dan berisi string yang dikodekan base64 yang valid, dan
-
Kunci munge biner yang didekodekan memiliki ukuran antara 256 dan 8192 bit.
Jika kebijakan IAM pengguna pcluster tidak disertakan DescribeSecret, tidak MungeKeySecretArn divalidasi dan pesan peringatan ditampilkan. Untuk informasi selengkapnya, lihat Basis AWS ParallelCluster kebijakan pengguna pcluster.
Saat Anda memperbarui MungeKeySecretArn, armada komputasi dan semua node login harus dihentikan.
Jika nilai rahasia dalam ARN rahasia dimodifikasi sementara ARN tetap sama, cluster tidak akan secara otomatis diperbarui dengan kunci munge baru. Untuk menggunakan kunci munge baru rahasia ARN, Anda harus menghentikan armada komputasi dan node login kemudian menjalankan perintah berikut dari node kepala.
sudo /opt/parallelcluster/scripts/slurm/update_munge_key.shSetelah menjalankan perintah, Anda dapat melanjutkan armada komputasi dan node login: node komputasi dan login yang baru disediakan akan secara otomatis mulai menggunakan kunci munge baru.
Untuk menghasilkan kunci munge kustom yang dikodekan base64, Anda dapat menggunakan utilitas mungekey yang
didistribusikan dengan perangkat lunak munge dan kemudian mengkodekannya menggunakan utilitas base64 yang umumnya tersedia di OS Anda. Atau, Anda menggunakan bash (harap atur parameter bs antara 32 dan 1024) dd if=/dev/random bs=128 count=1 2>/dev/null | base64 -w 0atau Python sebagai berikut:
import random import os import base64 # key length in bytes key_length=128 base64.b64encode(os.urandom(key_length)).decode("utf-8") -
QueueUpdateStrategy(Opsional,String)-
Menentukan strategi penggantian untuk parameter SlurmQueues bagian yang memiliki kebijakan pembaruan berikut:
QueueUpdateStrategyNilai hanya digunakan ketika proses pembaruan cluster dimulai.Nilai yang valid:
COMPUTE_FLEET_STOP|DRAIN|TERMINATENilai default:
COMPUTE_FLEET_STOPDRAIN-
Node dalam antrian dengan nilai parameter yang diubah diatur ke
DRAINING. Node dalam status ini tidak menerima pekerjaan baru dan pekerjaan yang sedang berjalan terus selesai.Setelah node menjadi
idle(DRAINED), node diganti jika node statis, dan node dihentikan jika node dinamis. Node lain di antrian lain tanpa perubahan nilai parameter tidak terpengaruh.Waktu yang dibutuhkan strategi ini untuk mengganti semua node antrian dengan nilai parameter yang diubah tergantung pada beban kerja yang sedang berjalan.
COMPUTE_FLEET_STOP-
Nilai default
QueueUpdateStrategyparameter. Dengan pengaturan ini, memperbarui parameter di bawah SlurmQueues bagian mengharuskan Anda menghentikan armada komputasi sebelum Anda melakukan pembaruan cluster:$pcluster update-compute-fleet --status STOP_REQUESTED TERMINATE-
Dalam antrian dengan nilai parameter yang diubah, pekerjaan yang sedang berjalan dihentikan dan node segera dimatikan.
Node statis diganti dan node dinamis dihentikan.
Node lain di antrian lain tanpa perubahan nilai parameter tidak terpengaruh.
Kebijakan pembaruan: Pengaturan ini tidak dianalisis selama pembaruan.
catatan
QueueUpdateStrategydidukung mulai dengan AWS ParallelCluster versi 3.2.0. EnableMemoryBasedScheduling(Opsional,Boolean)-
Jika
true, penjadwalan berbasis memori diaktifkan di. Slurm Untuk informasi lebih lanjut, lihat SlurmQueues/ComputeResources/SchedulableMemory.Nilai default-nya adalah
false.Awas
Mengaktifkan penjadwalan berbasis memori memengaruhi cara pen Slurm jadwal menangani pekerjaan dan alokasi node.
Untuk informasi selengkapnya, lihat Slurm penjadwalan berbasis memori.
catatan
EnableMemoryBasedSchedulingdidukung mulai dengan AWS ParallelCluster versi 3.2.0.catatan
Dimulai dengan AWS ParallelCluster versi 3.7.0,
EnableMemoryBasedSchedulingdapat diaktifkan jika Anda mengonfigurasi beberapa jenis instans di Inst ans.Untuk AWS ParallelCluster versi 3.2.0 hingga 3.6.
x, tidakEnableMemoryBasedSchedulingdapat diaktifkan jika Anda mengonfigurasi beberapa jenis instans di Instans.Kebijakan pembaruan: Armada komputasi harus dihentikan agar pengaturan ini diubah untuk pembaruan.
CustomSlurmSettings(Opsional,[Dict])-
Mendefinisikan Slurm pengaturan kustom yang berlaku untuk seluruh cluster.
Menentukan daftar kamus Slurm konfigurasi pasangan kunci-nilai yang akan ditambahkan ke akhir
slurm.conffile yang dihasilkan. AWS ParallelClusterSetiap kamus dalam daftar muncul sebagai baris terpisah ditambahkan ke file Slurm konfigurasi. Anda dapat menentukan parameter sederhana atau kompleks.
Parameter sederhana terdiri dari pasangan kunci tunggal, seperti yang ditunjukkan dalam contoh berikut:
- Param1: 100 - Param2: "SubParam1,SubParam2=SubValue2"Contoh yang dirender dalam Slurm konfigurasi:
Param1=100 Param2=SubParam1,SubParam2=SubValue2Parameter Slurm konfigurasi kompleks terdiri dari beberapa nilai kunci yang dipisahkan spasi, pasangan seperti yang ditunjukkan pada contoh berikut:
- NodeName: test-nodes[1-10] CPUs: 4 RealMemory: 4196 ... # other node settings - NodeSet: test-nodeset Nodes: test-nodes[1-10] ... # other nodeset settings - PartitionName: test-partition Nodes: test-nodeset ... # other partition settingsContoh, dirender dalam Slurm konfigurasi:
NodeName=test-nodes[1-10] CPUs=4 RealMemory=4196 ... # other node settings NodeSet=test-nodeset Nodes=test-nodes[1-10] ... # other nodeset settings PartitionName=test-partition Nodes=test-nodeset ... # other partition settingscatatan
SlurmNode kustom tidak boleh berisi
-dy-pola-st-atau dalam namanya. Pola-pola ini dicadangkan untuk node yang dikelola oleh AWS ParallelCluster.Jika Anda menentukan parameter Slurm konfigurasi kustom di
CustomSlurmSettings, Anda tidak boleh menentukan parameter Slurm konfigurasi khusus untukCustomSlurmSettingsIncludeFile.Anda hanya dapat menentukan parameter Slurm konfigurasi yang tidak dicantumkan di.
CustomSlurmSettingsUntuk informasi tentang parameter Slurm konfigurasi yang dicantumkan, lihat. Terdaftar penolakan Slurm parameter konfigurasi untuk CustomSlurmSettingsAWS ParallelCluster hanya memeriksa apakah parameter ada dalam daftar tolak. AWS ParallelCluster tidak memvalidasi sintaks atau semantik parameter Slurm konfigurasi kustom Anda. Adalah tanggung jawab Anda untuk memvalidasi parameter Slurm konfigurasi kustom Anda. Parameter Slurm konfigurasi kustom yang tidak valid dapat menyebabkan kegagalan Slurm daemon yang dapat menyebabkan kegagalan pembuatan dan pembaruan cluster.
Untuk informasi selengkapnya tentang cara menentukan parameter Slurm konfigurasi khusus dengan AWS ParallelCluster, lihatSlurm kustomisasi konfigurasi.
Untuk informasi selengkapnya tentang parameter Slurm konfigurasi, lihat slurm.conf
dalam dokumentasi. Slurm Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.
catatan
CustomSlurmSettingsdidukung mulai dengan AWS ParallelCluster versi 3.6.0. CustomSlurmSettingsIncludeFile(Opsional,String)-
Mendefinisikan Slurm pengaturan kustom yang berlaku untuk seluruh cluster.
Menentukan Slurm file kustom yang terdiri dari parameter Slurm konfigurasi kustom untuk ditambahkan di akhir
slurm.conffile yang dihasilkan AWS ParallelCluster .Anda harus menyertakan jalur ke file. Jalur dapat dimulai dengan
https://ataus3://.Jika Anda menentukan parameter Slurm konfigurasi khusus untuk
CustomSlurmSettingsIncludeFile, Anda tidak boleh menentukan parameter Slurm konfigurasi khusus untukCustomSlurmSettings.catatan
SlurmNode kustom tidak boleh berisi
-dy-pola-st-atau dalam namanya. Pola-pola ini dicadangkan untuk node yang dikelola oleh AWS ParallelCluster.Anda hanya dapat menentukan parameter Slurm konfigurasi yang tidak dicantumkan di.
CustomSlurmSettingsIncludeFileUntuk informasi tentang parameter Slurm konfigurasi yang dicantumkan, lihat. Terdaftar penolakan Slurm parameter konfigurasi untuk CustomSlurmSettingsAWS ParallelCluster hanya memeriksa apakah parameter ada dalam daftar tolak. AWS ParallelCluster tidak memvalidasi sintaks atau semantik parameter Slurm konfigurasi kustom Anda. Adalah tanggung jawab Anda untuk memvalidasi parameter Slurm konfigurasi kustom Anda. Parameter Slurm konfigurasi kustom yang tidak valid dapat menyebabkan kegagalan Slurm daemon yang dapat menyebabkan kegagalan pembuatan dan pembaruan cluster.
Untuk informasi selengkapnya tentang cara menentukan parameter Slurm konfigurasi khusus dengan AWS ParallelCluster, lihatSlurm kustomisasi konfigurasi.
Untuk informasi selengkapnya tentang parameter Slurm konfigurasi, lihat slurm.conf
dalam dokumentasi. Slurm Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.
catatan
CustomSlurmSettingsdidukung mulai dengan AWS ParallelCluster versi 3.6.0.
Basis Data
(Opsional) Mendefinisikan pengaturan untuk mengaktifkan Slurm Akuntansi pada cluster. Untuk informasi selengkapnya, lihat Slurmakuntansi dengan AWS ParallelCluster.
Database: Uri:stringUserName:stringPasswordSecretArn:string
Kebijakan pembaruan: Armada komputasi harus dihentikan agar pengaturan ini diubah untuk pembaruan.
Pro perti database
Uri(Diperlukan,String)-
Alamat ke server database yang digunakan sebagai backend untuk Slurm akuntansi. URI ini harus diformat sebagai
host:portdan tidak boleh berisi skema, sepertimysql://. Host dapat berupa alamat IP atau nama DNS yang dapat diselesaikan oleh node kepala. Jika port tidak disediakan, gunakan AWS ParallelCluster port MySQL default 3306.AWS ParallelCluster melakukan bootstrap database Slurm akuntansi ke cluster dan harus mengakses database.
Basis data harus dapat dijangkau sebelum hal berikut terjadi:
-
Sebuah cluster dibuat.
-
Slurmakuntansi diaktifkan dengan pembaruan cluster.
Kebijakan pembaruan: Armada komputasi harus dihentikan agar pengaturan ini diubah untuk pembaruan.
-
UserName(Diperlukan,String)-
Identitas yang Slurm digunakan untuk terhubung ke database, menulis log akuntansi, dan melakukan query. Pengguna harus memiliki izin baca dan tulis pada database.
Kebijakan pembaruan: Armada komputasi harus dihentikan agar pengaturan ini diubah untuk pembaruan.
PasswordSecretArn(Diperlukan,String)-
Nama Sumber Daya Amazon (ARN) dari AWS Secrets Manager rahasia yang berisi kata sandi
UserNameplaintext. Kata sandi ini digunakan bersama denganUserNameSlurm akuntansi untuk mengautentikasi pada server database.catatan
-
Saat Anda membuat rahasia menggunakan AWS Secrets Manager konsol pastikan untuk memilih “Jenis rahasia lainnya”, pilih plaintext, dan hanya sertakan teks kata sandi di rahasia.
-
Anda tidak dapat menggunakan karakter '#' dalam kata sandi Database karena Slurm tidak mendukungnya di slurmdbd.conf.
-
Untuk informasi lebih lanjut tentang cara menggunakan AWS Secrets Manager untuk membuat rahasia, lihat Buat AWS Secrets Manager Rahasia.
Jika pengguna memiliki izin untuk DescribeSecret,
PasswordSecretArndivalidasi.PasswordSecretArnvalid jika rahasia yang ditentukan ada. Jika kebijakan IAM pengguna tidak disertakanDescribeSecret,PasswordSecretArntidak divalidasi dan pesan peringatan ditampilkan. Untuk informasi selengkapnya, lihat Basis AWS ParallelCluster kebijakan pengguna pcluster.Saat Anda memperbarui
PasswordSecretArn, armada komputasi harus dihentikan. Jika nilai rahasia berubah, dan ARN rahasia tidak berubah, cluster tidak secara otomatis diperbarui dengan kata sandi database baru. Untuk memperbarui cluster untuk nilai rahasia baru, Anda harus menjalankan perintah berikut dari dalam node kepala setelah armada komputasi dihentikan.$sudo /opt/parallelcluster/scripts/slurm/update_slurm_database_password.shAwas
Kami menyarankan Anda hanya mengubah kata sandi database saat armada komputasi dihentikan untuk menghindari hilangnya data akuntansi.
Kebijakan pembaruan: Armada komputasi harus dihentikan agar pengaturan ini diubah untuk pembaruan.
-
DatabaseName(Opsional,String)-
Nama database pada server database (ditentukan oleh parameter Uri) yang akan digunakan untuk Akun Slurm tansi.
Nama database mungkin berisi huruf kecil, angka dan garis bawah. Nama tidak boleh lebih dari 64 karakter.
Parameter ini memetakan ke
StorageLocparameter slurmdbd.conf. Jika tidak
DatabaseNamedisediakan, ParallelCluster akan menggunakan nama cluster untuk menentukan nilai untukStorageLoc.Memperbarui
DatabaseNamediperbolehkan, dengan pertimbangan berikut:-
Jika database dengan nama belum DatabaseName ada di server database, slurmdbd akan membuatnya. Ini akan menjadi tanggung jawab Anda untuk mengkonfigurasi ulang database baru sesuai kebutuhan (misalnya menambahkan entitas akuntansi - cluster, akun, pengguna, asosiasi, QoS, dll.).
-
Jika database dengan nama DatabaseName sudah ada di server database, slurmdbd akan menggunakannya untuk fungsionalitas Akuntansi. Slurm
Kebijakan pembaruan: Armada komputasi harus dihentikan agar pengaturan ini diubah untuk pembaruan.
-
catatan
Databaseditambahkan mulai dengan rilis 3.3.0.
ExternalSlurmdbd
(Opsional) Mendefinisikan pengaturan untuk mengaktifkan Akun Slurm tansi dengan server slurmdbd eksternal. Untuk informasi lebih lanjut, lihat Slurm akuntansi dengan AWS ParallelCluster.
ExternalSlurmdbd: Host:stringPort:integer
ExternalSlurmdbdproperti
Host(Diperlukan,String)-
Alamat ke server slurmdbd eksternal untuk akuntansi. Slurm Host dapat berupa alamat IP atau nama DNS yang dapat diselesaikan oleh node kepala.
Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.
Port(Opsional,Integer)-
Port yang didengarkan layanan slurmdbd. Nilai default-nya adalah
6819.Kebijakan pembaruan: Pengaturan ini dapat diubah selama pembaruan.
Dns
(Opsional) Men definisikan pengaturan Slurm yang berlaku untuk seluruh cluster.
Dns: DisableManagedDns:booleanHostedZoneId:stringUseEc2Hostnames:boolean
Pro perti dns
DisableManagedDns(Opsional,Boolean)-
Jika
true, entri DNS untuk cluster tidak dibuat dan nama Slurm node tidak dapat diselesaikan.Secara default, AWS ParallelCluster membuat zona yang dihosting Route 53 di mana node terdaftar saat diluncurkan. Nilai default-nya adalah
false. JikaDisableManagedDnsdisetel ketrue, zona yang dihosting tidak dibuat oleh AWS ParallelCluster.Untuk mempelajari cara menggunakan setelan ini untuk menyebarkan cluster di subnet tanpa akses internet, lihatAWS ParallelCluster dalam satu subnet tanpa akses internet.
Awas
Sistem resolusi nama diperlukan agar cluster dapat beroperasi dengan baik. Jika
DisableManagedDnsdisetel ketrue, Anda harus menyediakan sistem resolusi nama. Untuk menggunakan DNS default Amazon EC2, setelUseEc2Hostnamesketrue. Atau, konfigurasikan resolver DNS Anda sendiri dan pastikan bahwa nama node terdaftar saat instance diluncurkan. Misalnya, Anda dapat melakukan ini dengan mengkonfigurasi CustomActions/OnNodeStart.Kebijakan pembaruan: Jika pengaturan ini diubah, pembaruan tidak diizinkan.
HostedZoneId(Opsional,String)-
Mendefinisikan ID zona host Route 53 kustom untuk digunakan untuk resolusi nama DNS untuk cluster. Jika disediakan, men AWS ParallelCluster daftarkan node cluster di zona yang dihosting yang ditentukan dan tidak membuat zona yang dikelola yang dihosting.
Kebijakan pembaruan: Jika pengaturan ini diubah, pembaruan tidak diizinkan.
UseEc2Hostnames(Opsional,Boolean)-
Jika
true, node komputasi cluster dikonfigurasi dengan nama host EC2 default. SlurmNodeHostNameIni juga diperbarui dengan informasi ini. Nilai default-nyafalse.Untuk mempelajari cara menggunakan setelan ini untuk menyebarkan cluster di subnet tanpa akses internet, lihatAWS ParallelCluster dalam satu subnet tanpa akses internet.
catatan
Catatan ini tidak relevan dimulai dengan AWS ParallelCluster versi 3.3.0.
Untuk versi yang AWS ParallelCluster didukung sebelum 3.3.0:
Ketika
UseEc2Hostnamesdisetel ketrue, file konfigurasi Slurm diatur dengan skrip AWS ParallelClusterprologdan:epilog-
prologberjalan untuk menambahkan info node ke/etc/hostsnode komputasi saat setiap pekerjaan dialokasikan. -
epilogberjalan untuk membersihkan konten yang ditulis olehprolog.
Untuk menambahkan kustom
prologatauepilogskrip, tambahkan masing-masing ke/opt/slurm/etc/pcluster/epilog.d/folder/opt/slurm/etc/pcluster/prolog.d/atau.Kebijakan pembaruan: Jika pengaturan ini diubah, pembaruan tidak diizinkan.
-