View a markdown version of this page

Membuat grup simpul komputasi di AWS PCS - AWS PCS

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Membuat grup simpul komputasi di AWS PCS

Topik ini memberikan ikhtisar opsi yang tersedia dan menjelaskan apa yang harus dipertimbangkan saat Anda membuat grup simpul komputasi di AWS Parallel Computing Service (AWS PCS). Jika ini adalah pertama kalinya Anda membuat grup simpul komputasi di AWS PCS, kami sarankan Anda mengikuti tutorial diMemulai dengan AWS Layanan Komputasi Paralel. Tutorial ini dapat membantu Anda membuat sistem HPC yang berfungsi tanpa memperluas ke semua opsi yang tersedia dan arsitektur sistem yang mungkin.

catatan

Anda dapat mengonfigurasi pengaturan Slurm kustom pada grup simpul komputasi untuk mengontrol pemanfaatan sumber daya dan perilaku tingkat simpul. Untuk informasi selengkapnya, lihat Mengkonfigurasi pengaturan Slurm khusus di AWS PCS.

catatan

Untuk menjalankan skrip kustom pada titik-titik yang ditentukan dalam siklus hidup node komputasi — seperti memasang sistem file, menginstal perangkat lunak, atau bergabung dengan layanan direktori — tanpa menyematkan logika dalam data pengguna template peluncuran, gunakan tindakan siklus hidup simpul. Untuk informasi selengkapnya, lihat Tindakan siklus hidup simpul.

penting

AWS PCS saat ini membutuhkan kernel dengan dukungan IPv4 untuk komunikasi node lokal, bahkan ketika Anda menggunakan AWS PCS dalam IPv6-only jaringan. Untuk informasi selengkapnya, lihat Gambar Mesin Amazon Kustom (AMIs) untuk AWS PCS.

Prasyarat

  • Kuota layanan yang cukup untuk meluncurkan jumlah instans EC2 yang diinginkan di Anda Wilayah AWS. Anda dapat menggunakan Konsol Manajemen AWS untuk memeriksa dan meminta kenaikan kuota layanan Anda.

  • VPC dan subnet yang sudah ada yang memenuhi persyaratan jaringan AWS PCS. Sebaiknya Anda memahami persyaratan ini secara menyeluruh sebelum menerapkan cluster untuk penggunaan produksi. Untuk informasi selengkapnya, lihat AWS PCS VPC dan persyaratan subnet dan pertimbangan. Anda juga dapat menggunakan CloudFormation template untuk membuat VPC dan subnet. AWS menyediakan resep HPC untuk CloudFormation template. Untuk informasi lebih lanjut, lihat aws-h pc-resep di. GitHub

  • Profil instance IAM dengan izin untuk memanggil tindakan RegisterComputeNodeGroupInstance API AWS PCS dan akses ke AWS sumber daya lain yang diperlukan untuk instans grup node Anda. Untuk informasi selengkapnya, lihat Profil instans IAM untuk AWS Layanan Komputasi Paralel.

  • Template peluncuran untuk instance grup node Anda. Untuk informasi selengkapnya, lihat Menggunakan template peluncuran Amazon EC2 dengan PCS AWS.

  • Untuk membuat grup simpul komputasi yang menggunakan instans Amazon EC2 Spot, Anda harus memiliki peran AWSServiceRoleForEC2Spot terkait layanan di. Akun AWS Untuk informasi selengkapnya, lihat Peran Amazon EC2 Spot untuk AWS PCS.

Buat grup simpul komputasi di AWS PCS

Anda dapat membuat grup simpul komputasi menggunakan Konsol Manajemen AWS atau. AWS CLI

Konsol Manajemen AWS
Untuk membuat grup simpul komputasi menggunakan konsol
  1. Buka konsol AWS PCS.

  2. Pilih cluster tempat Anda ingin membuat grup simpul komputasi. Arahkan ke Compute node groups dan pilih Cre ate.

  3. Di bagian pengaturan grup simpul komputasi, berikan nama untuk grup node Anda. Nama hanya dapat berisi karakter alfanumerik dan tanda hubung yang peka huruf besar-kecil. Itu harus dimulai dengan karakter alfabet dan tidak boleh lebih dari 25 karakter. Nama harus unik di dalam cluster.

  4. Di bawah konfigurasi komputasi, masukkan atau pilih nilai-nilai ini:

    1. Template peluncuran EC2 - Pilih template peluncuran khusus untuk digunakan untuk grup simpul ini. Template peluncuran dapat digunakan untuk menyesuaikan pengaturan jaringan seperti subnet, dan grup keamanan, konfigurasi pemantauan, dan penyimpanan tingkat instance. Jika Anda belum menyiapkan template peluncuran, lihat Menggunakan template peluncuran Amazon EC2 dengan PCS AWS untuk mempelajari cara membuatnya.

      penting

      AWS PCS membuat template peluncuran terkelola untuk setiap grup simpul komputasi. Ini diberi namapcs-identifier-do-not-delete. Jangan pilih ini saat Anda membuat atau memperbarui grup simpul komputasi, atau grup node tidak akan berfungsi dengan benar.

    2. Versi template peluncuran EC2 - Anda harus memilih versi template peluncuran kustom Anda. Jika Anda mengubah versi nanti, Anda harus memperbarui grup simpul komputasi untuk mendeteksi perubahan pada template peluncuran. Untuk informasi selengkapnya, lihat Memperbarui sebuah AWS Grup node komputasi PCS.

    3. ID AMI - jika template peluncuran Anda tidak menyertakan ID AMI, atau jika Anda ingin mengganti nilai dalam template peluncuran, berikan ID AMI di sini. Perhatikan bahwa AMI yang digunakan untuk grup node harus kompatibel dengan AWS PCS. Anda juga dapat memilih sampel AMI yang disediakan oleh AWS. Untuk informasi lebih lanjut tentang topik ini, lihatGambar Mesin Amazon (AMI) untuk AWS PCS.

    4. Profil instance IAM — Pilih profil instance untuk grup node. Profil instance memberikan izin instans untuk mengakses AWS sumber daya dan layanan dengan aman. Jika Anda belum menyiapkannya, Anda dapat memilih Buat profil dasar agar AWS PCS membuat profil untuk Anda dengan kebijakan minimum, atau lihatProfil instans IAM untuk AWS Layanan Komputasi Paralel.

    5. Subnets — Pilih satu atau lebih subnet di VPC tempat cluster AWS PCS Anda digunakan. Jika Anda memilih beberapa subnet, komunikasi EFA tidak akan tersedia antar node, dan komunikasi antar node di subnet yang berbeda mungkin meningkatkan latensi. Pastikan subnet yang Anda tentukan di sini cocok dengan yang Anda tentukan dalam template peluncuran EC2.

    6. Instans — Pilih satu atau beberapa jenis instans untuk memenuhi permintaan penskalaan dalam grup node. Semua jenis instance harus memiliki arsitektur prosesor yang sama (x86_64 atau arm64) dan jumlah vCPU. Jika instance memiliki GPU, semua jenis instance harus memiliki jumlah GPU yang sama.

    7. Konfigurasi penskalaan — Tentukan jumlah minimum dan maksimum instance untuk grup node. Atur minimum (min) sama dengan maksimum (maks) untuk kapasitas statis (misalnya, 5 menit, 5 maks). Atur minimum ke 0 untuk penskalaan sepenuhnya dinamis (misalnya, 0 menit, 10 maks). Dengan Slurm 24.05 atau yang lebih baru, Anda dapat mengatur minimum lebih besar dari 0 dan kurang dari maksimum untuk kapasitas campuran. Ini mempertahankan jumlah instance dasar dan ditingkatkan sesuai kebutuhan (misalnya, 2 menit, 10 maks).

  5. (Opsional) Di bawah Pengaturan tambahan, tentukan hal berikut:

    1. Opsi pembelian — pilih On-Demand Instans, Instans Spot, Reservasi Kapasitas yang Dapat Diinterupsi, atau Blok Kapasitas yang ada. Pilih On-Demand apakah Anda berencana menggunakan Reservasi On-Demand Kapasitas (ODCR). Untuk informasi selengkapnya, lihat Menggunakan ODCRs dengan AWS PCS. Pilih Reservasi Kapasitas Terputus untuk menggunakan ODCR terputus bersama (). I-ODCR Untuk informasi selengkapnya, lihat Menggunakan I-ODCRs dengan AWS PCS. Pilih Blok Kapasitas untuk menggunakan Blok Kapasitas Amazon EC2 yang ada untuk reservasi ML. Untuk informasi selengkapnya, lihat Menggunakan Blok Kapasitas Amazon EC2 untuk ML dengan AWS PCS.

    2. Strategi alokasi — jika Anda telah memilih opsi pembelian Spot, Anda dapat menentukan bagaimana kumpulan kapasitas Spot dipilih saat meluncurkan instance di grup node. Untuk informasi selengkapnya, lihat Strateg i alokasi untuk Instans Spot di Panduan Pengguna Amazon Elastic Compute Cloud. Opsi ini tidak berpengaruh jika Anda telah memilih opsi On-demand pembelian.

  6. (Opsional) Di bagian konfigurasi Penjadwal, Anda dapat menentukan yang berikut:

    1. Scale-down waktu idle — (Opsional) Waktu dalam detik sebelum node idle dalam grup node ini diperkecil. Jika tidak disetel, nilai tingkat cluster digunakan. Pengaturan ini memerlukan Slurm versi 25.11 atau yang lebih baru.

  7. (Opsional) Di bagian pengaturan Slurm khusus, Anda dapat menambahkan nama parameter dan pasangan nilai untuk mengonfigurasi pengaturan Slurm tambahan. Untuk daftar lengkap parameter yang didukung, lihatPengaturan Slurm khusus untuk AWS Grup simpul komputasi PCS.

  8. (Opsional) Di bagian Tindakan siklus hidup Node, Anda dapat menambahkan skrip yang berjalan pada titik tertentu dalam siklus hidup node komputasi. Pilih Tam bah skrip. Pilih tahap siklus hidup, dan tentukan lokasi skrip, nama, argumen opsional, perilaku penanganan kesalahan, dan kebijakan eksekusi. Untuk menambahkan lebih banyak skrip, ulangi langkah-langkah ini. Skrip berjalan dari atas ke bawah dalam tahap. Untuk mengubah urutan eksekusi, pilih Tind akan untuk skrip, lalu pilih Pindah ke atas atau P indahkan ke bawah. Untuk informasi selengkapnya, lihat Tindakan siklus hidup simpul.

  9. (Opsional) Di bawah Tag, tambahkan tag apa pun ke grup simpul komputasi Anda.

  10. Pilih Buat grup simpul komputasi. Bid ang Status menunjukkan Creating sementara AWS PCS menyediakan grup node. Ini dapat memakan waktu beberapa menit.

Langkah selanjutnya yang disarankan
  • Tambahkan grup node Anda ke antrian di AWS PCS untuk mengaktifkannya memproses pekerjaan.

AWS CLI
Untuk membuat grup simpul komputasi menggunakan AWS CLI

Buat antrian Anda dengan perintah berikut. Sebelum menjalankan perintah, buat penggantian berikut:

  1. Ganti region dengan ID Wilayah AWS untuk membuat cluster Anda, sepertius-east-1.

  2. Ganti my-cluster dengan nama atau clusterId cluster Anda.

  3. Ganti my-node-group dengan nama untuk grup simpul komputasi Anda. Nama hanya dapat berisi karakter alfanumerik (peka huruf besar/kecil) dan tanda hubung. Itu harus dimulai dengan karakter alfabet dan tidak boleh lebih dari 25 karakter. Nama harus unik di dalam cluster.

  4. Ganti subnet-ExampleID1 dengan satu atau beberapa ID subnet dari VPC cluster Anda.

  5. Ganti lt-ExampleID1 dengan ID untuk template peluncuran kustom Anda. Jika Anda belum menyiapkannya, lihat Menggunakan template peluncuran Amazon EC2 dengan PCS AWS untuk mempelajari cara membuatnya.

    penting

    AWS PCS membuat template peluncuran terkelola untuk setiap grup simpul komputasi. Ini diberi namapcs-identifier-do-not-delete. Jangan pilih ini saat Anda membuat atau memperbarui grup simpul komputasi, atau grup node tidak akan berfungsi dengan benar.

  6. Ganti launch-template-version dengan versi template peluncuran tertentu. AWS PCS mengaitkan grup node Anda dengan versi spesifik dari template peluncuran.

  7. Ganti arn:InstanceProfile dengan ARN profil instance IAM Anda. Jika Anda tidak memiliki satu yang disiapkan, lihat Menggunakan template peluncuran Amazon EC2 dengan PCS AWS panduan.

  8. Ganti min-instances dan max-instances dengan nilai integer. Atur minimum (min) sama dengan maksimum (maks) untuk kapasitas statis (misalnya, 5 menit, 5 maks). Atur minimum ke 0 untuk penskalaan sepenuhnya dinamis (misalnya, 0 menit, 10 maks). Dengan Slurm 24.05 atau yang lebih baru, Anda dapat mengatur minimum lebih besar dari 0 dan kurang dari maksimum untuk kapasitas campuran. Ini mempertahankan jumlah instance dasar dan ditingkatkan sesuai kebutuhan (misalnya, 2 menit, 10 maks).

  9. Ganti t3.large dengan jenis instance lain. Anda dapat menambahkan lebih banyak jenis instance dengan menentukan daftar instanceType pengaturan. Misalnya, --instance-configs instanceType=c6i.16xlarge instanceType=c6a.16xlarge. Semua jenis instance harus memiliki arsitektur prosesor yang sama (x86_64 atau arm64) dan jumlah vCPU. Jika instance memiliki GPU, semua jenis instance harus memiliki jumlah GPU yang sama.

aws pcs create-compute-node-group --region region \ --cluster-identifier my-cluster \ --compute-node-group-name my-node-group \ --subnet-ids subnet-ExampleID1 \ --custom-launch-template id=lt-ExampleID1,version='launch-template-version' \ --iam-instance-profile-arn=arn:InstanceProfile \ --scaling-config minInstanceCount=min-instances,maxInstanceCount=max-instance \ --instance-configs instanceType=t3.large
contoh- Membuat grup simpul komputasi dengan pengaturan Slurm khusus
aws pcs create-compute-node-group --region region \ --cluster-identifier my-cluster \ --compute-node-group-name my-node-group \ --subnet-ids subnet-ExampleID1 \ --custom-launch-template id=lt-ExampleID1,version='launch-template-version' \ --iam-instance-profile-arn=arn:InstanceProfile \ --scaling-config minInstanceCount=min-instances,maxInstanceCount=max-instance \ --instance-configs instanceType=t3.large \ --slurm-configuration \ 'slurmCustomSettings=[{parameterName=Features,parameterValue="gpu,nvme"}]'

Untuk informasi selengkapnya, lihat Pengaturan Slurm khusus untuk AWS Grup simpul komputasi PCS.

contoh- Membuat grup simpul komputasi dengan waktu idle yang diperkecil
aws pcs create-compute-node-group --region region \ --cluster-identifier my-cluster \ --compute-node-group-name my-gpu-nodes \ --subnet-ids subnet-ExampleID1 \ --custom-launch-template id=lt-ExampleID1,version='1' \ --iam-instance-profile-arn=arn:InstanceProfile \ --scaling-config minInstanceCount=0,maxInstanceCount=10 \ --instance-configs instanceType=p4d.24xlarge \ --slurm-configuration scaleDownIdleTimeInSeconds=300

Peng scaleDownIdleTimeInSeconds aturan pada tingkat grup node komputasi mengesampingkan nilai tingkat cluster untuk node dalam grup ini. Pengaturan ini memerlukan Slurm versi 25.11 atau yang lebih baru.

Ada beberapa pengaturan konfigurasi opsional yang dapat Anda tambahkan ke create-compute-node-group perintah.

  • Anda dapat menentukan --amiId apakah template peluncuran kustom Anda tidak menyertakan referensi ke AMI, atau jika Anda ingin mengganti nilai itu. Perhatikan bahwa AMI yang digunakan untuk grup node harus kompatibel dengan AWS PCS. Anda juga dapat memilih sampel AMI yang disediakan oleh AWS. Untuk informasi lebih lanjut tentang topik ini, lihatGambar Mesin Amazon (AMI) untuk AWS PCS.

  • Gunakan --purchase-option untuk memilih cara AWS PCS membeli instans EC2 untuk grup simpul komputasi Anda. On-Demand adalah default.

    • ONDEMAND— Gunakan On-Demand Instans. Pilih juga opsi ini jika Anda berencana menggunakan Reservasi On-Demand Kapasitas (ODCR). Untuk informasi selengkapnya, lihat Menggunakan ODCRs dengan AWS PCS.

    • SPOT— Gunakan Instans Spot. Jika Anda memilih instans Spot, Anda juga dapat menggunakan --allocation-strategy untuk menentukan bagaimana AWS PCS memilih kumpulan kapasitas Spot saat meluncurkan instans dalam grup node. Untuk informasi selengkapnya, lihat Strateg i alokasi untuk Instans Spot di Panduan Pengguna Amazon Elastic Compute Cloud.

    • CAPACITY_BLOCK— Gunakan Blok Kapasitas EC2 Amazon yang ada untuk reservasi ML. Untuk informasi selengkapnya, lihat Menggunakan Blok Kapasitas Amazon EC2 untuk ML dengan AWS PCS.

    • INTERRUPTIBLE_CAPACITY_RESERVATION— Gunakan ODCR yang dapat diinterupsi bersama ()I-ODCR. Untuk informasi selengkapnya, lihat Menggunakan I-ODCRs dengan AWS PCS.

  • Dimungkinkan untuk menyediakan opsi Slurm konfigurasi untuk node dalam grup node menggunakan--slurm-configuration. Anda dapat mengatur bobot (prioritas penjadwalan) dan memori nyata. Node dengan bobot yang lebih rendah memiliki prioritas yang lebih tinggi, dan unitnya sewenang-wenang. Untuk informasi selengkapnya, lihat Berat dalam Slurm dokumentasi. Memori nyata mengatur ukuran (dalam GB) memori nyata pada node dalam grup node. Ini dimaksudkan untuk digunakan bersama dengan CR_CPU_Memory opsi untuk cluster di AWS PCS dalam Slurm konfigurasi Anda. Untuk informasi lebih lanjut, lihat RealMemory dalam Slurm dokumentasi.

  • Gunakan --node-lifecycle-actions untuk menjalankan skrip kustom pada titik tertentu dalam siklus hidup node komputasi, seperti memasang sistem file, menginstal perangkat lunak, atau bergabung dengan layanan direktori. Untuk informasi selengkapnya, lihat Konfigurasikan tindakan siklus hidup simpul di AWS PCS. Misalnya perintah, lihatContoh tindakan siklus hidup simpul untuk AWS PCS.

penting

Diperlukan beberapa menit untuk membuat grup simpul komputasi.

Anda dapat menanyakan status grup node Anda dengan perintah berikut. Anda tidak akan dapat mengaitkan grup node dengan antrian sampai statusnya mencapaiACTIVE.

aws pcs get-compute-node-group --region region \ --cluster-identifier my-cluster \ --compute-node-group-identifier my-node-group