Bantu meningkatkan halaman ini
Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Untuk berkontribusi pada panduan pengguna ini, pilih GitHub tautan Edit halaman ini di yang terletak di panel kanan setiap halaman.
Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Mengelola komputasi yang dipercepat untuk AI/ML beban kerja di Amazon EKS
Tip
Daftar
Bagian ini mencakup cara membeli dan menyediakan instans komputasi yang dipercepat EC2 untuk beban kerja AI/ML pelatihan dan inferensi dengan Amazon EKS. Baik Anda melatih model skala besar, menjalankan inferensi real-time, atau menerapkan aplikasi AI generatif, menggunakan GPU NVIDIA atau kapasitas AWS Trainium yang tepat adalah dasar untuk kinerja beban kerja Anda.
Pilih dari jenis instans EC2
Lihat Spesifikasi untuk instans komputasi akselerasi Amazon EC2 untuk detail tentang instans komputasi akselerasi Amazon EC2 yang tersedia. Ini termasuk instance GPU NVIDIA dari P-family dan G-family, serta akselerator yang AWS dirancang Trainium dan Inferentia.
Memahami opsi pembelian EC2
Setelah mengetahui instans akselerasi yang Anda butuhkan untuk beban kerja Anda, langkah selanjutnya adalah memahami opsi pembelian yang tersedia untuk memperoleh jenis instans yang dipercepat ini. AWS menawarkan empat opsi pembelian kapasitas komputasi: On-Demand Instans, Instans Spot, Blok Kapasitas untuk ML, dan Reservasi On-Demand Kapasitas (ODCR). Setiap opsi melayani pola beban kerja, profil biaya, dan persyaratan ketersediaan yang berbeda. Dokumentasi Opsi Pembelian Instans Amazon EC2 menjelaskan cara kerja setiap opsi, model penetapan harganya, dan kapan menggunakannya.
-
On-Demand Contoh: Bayar per detik tanpa komitmen dan ketersediaan segera ketika kapasitas ada. Terbaik untuk pengembangan, pembuatan prototipe, penskalaan inferensi yang tidak dapat diprediksi, dan beban kerja apa pun yang membutuhkan komputasi segera tanpa risiko gangguan.
-
Instans Spot: Penghematan hingga 90% dibandingkan On-Demand dengan menggunakan kapasitas EC2 cadangan, dengan pemberitahuan gangguan selama 2 menit. Terbaik untuk beban kerja toleran kesalahan yang memeriksa ke penyimpanan tahan lama: penyetelan hyperparameter, pelatihan terdistribusi dengan pos pemeriksaan berkala, inferensi batch dan offline, dan pipeline prapemrosesan data.
-
Blok Kapasitas untuk ML: Instans Cadangan P-family dan Trainium untuk jendela tetap (24 jam, hingga 6 bulan), dipesan hingga 8 minggu sebelumnya. Gunakan Blok Kapasitas untuk menjalankan pelatihan skala besar yang direncanakan, eksperimen penyempurnaan terikat waktu, dan proyek penelitian dengan garis waktu yang diketahui yang memerlukan akses yang dapat diprediksi ke cluster GPU.
-
On-Demand Reservasi Kapasitas (ODCR): Cadangkan kapasitas yang dipercepat di Zona Ketersediaan tertentu tanpa komitmen jangka panjang, ditagih dengan On-Demand tarif standar apakah kapasitas digunakan atau tidak. Terbaik untuk inferensi produksi, SLA-bound layanan, dan aplikasi penting bisnis di mana penundaan penjadwalan atau ketidaktersediaan kapasitas tidak dapat diterima. Tidak seperti Blok Kapasitas, ODCR mendukung keduanya P-family dan G-family instance.
Cocokkan opsi pembelian dengan persyaratan beban kerja
Sekarang setelah Anda memahami jenis instans yang dipercepat dan opsi pembelian, langkah selanjutnya adalah mencocokkan opsi pembelian yang tepat dengan persyaratan khusus beban kerja Anda. Beban kerja dengan fleksibilitas yang lebih besar di seluruh jenis instans, wilayah, dan waktu memenuhi syarat untuk lebih banyak opsi pembelian dan harga yang lebih rendah.
Dasarkan keputusan Anda pada faktor-faktor seperti:
-
Kepentingan strategis dan komitmen SLA
-
Prediktabilitas permintaan dan fleksibilitas penjadwalan
-
Kesediaan untuk berkomitmen pada kapasitas yang dipesan terlebih dahulu
-
Fleksibilitas di seluruh jenis instans, wilayah, dan waktu
-
Toleransi untuk interupsi versus penghematan biaya
Dalam praktiknya, tim mengadopsi pendekatan hibrida yang menggabungkan beberapa opsi pembelian untuk menyeimbangkan biaya, ketersediaan, dan keandalan di seluruh portofolio beban kerja mereka. Artikel Cara Mendapatkan Kapasitas GPU AWS
Verifikasi kuota layanan EC2 Anda
Sebelum menerapkan opsi pembelian kapasitas apa pun pada cluster EKS Anda, verifikasi bahwa AWS akun Anda memiliki kuota vCPU yang cukup untuk keluarga instans GPU yang akan Anda gunakan. Tanpa kuota yang memadai, Karpenter NodePools, penyediaan Mode Otomatis EKS, dan grup simpul EKS akan gagal meluncurkan node komputasi yang dipercepat terlepas dari opsi pembelian mana yang Anda pilih.
AWS memberlakukan kuota vCPU terpisah per keluarga instance dan model pembelian. Tinjau kuota jenis instans Amazon EC2 untuk memahami kuota default untuk instans komputasi yang dipercepat.
Kuota ini didasarkan pada jumlah vCPU, bukan jumlah instance. Misalnya, meluncurkan 10 instans p6-b300.48xlarge membutuhkan 1.920 vCPU (10 × 192). Kuota GPU default sering disetel ke 0 untuk akun baru, jadi permintaan meningkat sebelum mencoba menerapkan instance.
Jika Anda mengalami batasan kuota saat membuat reservasi Blok Kapasitas, meluncurkan On-Demand instans, atau mengirimkan permintaan Spot, hubungi AWS Dukungan atau tim AWS akun Anda untuk mendiskusikan persyaratan Anda dan jelajahi opsi untuk mengamankan kapasitas komputasi yang dipercepat yang paling sesuai dengan kebutuhan Anda.
Gunakan opsi pembelian EC2 dengan Amazon EKS
Setelah memilih opsi pembelian komputasi dipercepat EC2, konfigurasikan cluster Amazon EKS Anda untuk menggunakan kapasitas tersebut. Amazon EKS menyediakan tiga metode penyediaan, masing-masing dengan keseimbangan kontrol dan otomatisasi yang berbeda:
-
Mode Otomatis Amazon EKS: komput AWS asi terkelola yang secara otomatis menyediakan, menskalakan, dan menambal node. Menggunakan Karpenter bawaan untuk penyediaan dan sistem operasi Bottlerocket dengan driver NVIDIA dan plugin perangkat disertakan. Terbaik saat Anda menginginkan infrastruktur terkelola dengan biaya operasional minimal. Mendukung penyediaan kapasitas statis dan dinamis.
-
Karpenter (dikelola sendiri): Proyek hulu sumber terbuka yang Anda instal dan operasikan di cluster Amazon EKS Anda. Menyediakan model penyediaan yang sama dengan Mode Otomatis EKS dan Anda memiliki kontrol penuh atas sistem operasi, AMI, penyetelan kernel, dan siklus hidup node. Terbaik untuk tim platform dengan persyaratan yang tidak disediakan oleh Mode Otomatis EKS secara langsung.
-
Grup node (dikelola dan dikelola sendiri): Didukung oleh Grup Penskalaan Otomatis EC2 (ASG), kapasitas ditentukan di muka melalui template peluncuran EC2. Terbaik untuk tim platform dengan grup node yang dikelola atau dikelola sendiri EKS yang ada, dan beban kerja pelatihan dengan ukuran yang dapat diprediksi dengan jejak komputasi dipercepat statis yang diketahui.
Halaman-halaman di bawah ini mencakup setiap opsi penyediaan secara rinci.
Strategi campuran: gabungkan opsi pembelian
Adalah umum untuk menggabungkan beberapa opsi pembelian kapasitas dalam satu cluster Amazon EKS. Pendekatan ini mengoptimalkan biaya, ketersediaan, dan keandalan secara bersamaan dengan merutekan beban kerja yang berbeda ke sumber kapasitas yang paling tepat. Pelanggan menerapkan strategi hibrida ini menggunakan salah satu dari tiga pendekatan manajemen komputasi EKS (EKS Auto Mode, Karpenter, atau Grup Node) atau menggabungkannya dalam cluster yang sama.
EKS Auto Mode dan Karpenter selalu menyediakan kapasitas cadangan (ODCR dan Blok Kapasitas) terlebih dahulu, diikuti oleh Spot atau. On-Demand Anda dapat menggabungkan prioritas penyediaan instans ini dengan menjadwalkan beban kerja penting pada kapasitas yang dicadangkan dan beban kerja fleksibel Anda di Spot atau instans. On-Demand Anda mengontrol perutean beban kerja melalui Kubernetes-native penjadwalan primitif: nodeSelector menargetkan jenis kapasitas tertentu, noda dan toleransi mengisolasi GPU NVIDIA atau node AWS Trainium, dan topologySpreadConstraints mendistribusikan beban kerja di seluruh Zona Ketersediaan untuk ketersediaan tinggi.
Cluster Amazon EKS yang dirancang dengan baik mengatur komputasi NodePools atau grup node yang dipercepat menjadi dua kategori, Reserved dan Burst, masing-masing selaras dengan pola beban kerja yang paling sesuai untuk strategi kapasitas. Contohnya dijelaskan di bawah ini.
-
Kapasitas Cad angan: Grup
gpu-reservedNodePool atau node menjalankan inferensi produksi dan pelatihan skala besar terjadwal tentang kapasitas cadangan (ODCR dan Blok Kapasitas) untuk SLA-bound layanan dan pekerjaan intensif komputasi yang direncanakan. Grup node NodePool ini melayani beban kerja inferensi dan produksi: titik akhir inferensi real-time, penyajian model produksi, dan aplikasi penting bisnis yang memerlukan ketersediaan GPU yang selalu aktif dengan kinerja yang dapat diprediksi. Ini juga mendukung pekerjaan intensif komputasi terjadwal: pelatihan terdistribusi yang direncanakan, eksperimen penyempurnaan skala besar, proyek penelitian terikat waktu, dan beban kerja apa pun di mana Anda mengetahui waktu dan durasi mulai sebelumnya. -
Kapasitas Burst: Grup A
gpu-burstNodePool atau node menangani eksperimen, beban kerja ad hoc, dan pemrosesan batch. Ini menggunakan instance Spot sebagai tipe kapasitas utama dengan On-Demand fallback. Kombinasi ini memaksimalkan penghematan biaya untuk beban kerja toleran kesalahan dan memastikan kapasitas saat Spot tidak tersedia. Grup node ini NodePool melayani inferensi offline batch, pipeline prapemrosesan data, pekerjaan evaluasi model, pengembangan dan pembuatan prototipe, penskalaan inferensi yang tidak dapat diprediksi, sesi debugging berumur pendek, dan beban kerja apa pun yang mengimplementasikan checkpointing dan dapat menangani interupsi Spot atau yang tidak membenarkan reservasi tetapi tidak bisa menunggu jendela yang dicadangkan. Beban kerja pada grup ini NodePool atau node menerapkan checkpointing dan shutdown yang anggun untuk menangani kehilangan node dalam jendela interupsi Spot 2 menit.
Tentukan jenis kapasitas yang diinginkan untuk beban kerja menggunakan NodeSelector:. karpenter.sh/capacity-type: [spot, on-demand, reserved] Weight-based penyediaan menskalakan cluster secara efisien di semua kumpulan kapasitas. Dengan arsitektur ini, Anda dapat menjalankan beragam beban kerja AI/ML —mulai dari notebook eksperimental hingga kesimpulan produksi—dalam satu cluster Amazon EKS sambil mengoptimalkan biaya.