Bantu meningkatkan halaman ini
Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Untuk berkontribusi pada panduan pengguna ini, pilih GitHub tautan Edit halaman ini di yang terletak di panel kanan setiap halaman.
Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Kelola GPU NVIDIA di Amazon EKS
GPU NVIDIA banyak digunakan untuk pelatihan pembelajaran mesin, inferensi, dan beban kerja komputasi berkinerja tinggi. Amazon EKS mendukung dua mekanisme untuk mengelola perangkat GPU NVIDIA di cluster EKS Anda: driver NVIDIA DRA untuk GPU dan plugin perangkat NVIDIA Kubernetes.
Sebaiknya gunakan driver DRA untuk penerapan baru dengan Kubernetes versi 1.34 dan yang lebih baru saat menggunakan penyediaan kapasitas statis
Untuk ketersediaan fitur DRA di EKS, lihat Catatan rilis untuk versi Kubernetes untuk EKS. Untuk informasi lebih lanjut tentang menggunakan driver NVIDIA DRA dan plugin perangkat dengan EKS, lihatGunakan driver NVIDIA DRA atau plugin perangkat di Amazon EKS.
Berbagi GPU (pemotongan & waktu MIG)
Multi-instance GPU (MIG)
Multi-Instance GPU (MIG) adalah fitur perangkat keras pada GPU NVIDIA yang mempartisi satu GPU fisik menjadi beberapa instance terisolasi. Jumlah maksimum instance tergantung pada GPU. GPU pusat data seperti A100, H100, H200, dan B200 mendukung hingga tujuh instans, sedangkan GPU dan mendukung lebih sedikit. Blackwell-based g7 g7e Setiap instance memiliki memori khusus, unit komputasi, dan bandwidth memori, sehingga beban kerja yang berjalan pada satu instans tidak dapat memengaruhi beban kerja pada instans lain. Tidak seperti time-slicing, yang berbagi GPU melalui multiplexing waktu perangkat lunak tanpa isolasi, MIG menyediakan memori tingkat perangkat keras dan isolasi kesalahan antara Pod.
MIG paling cocok untuk inferensi multi-tenant, beban kerja yang memerlukan kualitas layanan yang dapat diprediksi, dan lingkungan dengan persyaratan kepatuhan untuk sewa yang terisolasi perangkat keras. Ini tersedia pada GPU NVIDIA Ampere (A100), Hopper (H100 dan H200), dan Blackwell. Pada AWS, ini adalah P-family tipe instance Blackwell-based g7 dan tipe g7e instance and.
Untuk informasi selengkapnya dan langkah-langkah untuk menggunakan MIG dengan GPU NVIDIA dan EKS, lihatGunakan GPU multi-instance (MIG) dengan GPU NVIDIA di Amazon EKS.
Time-slicing
Time-slicing memungkinkan beberapa Pod berbagi GPU NVIDIA fisik tunggal dengan mengonfigurasi plugin perangkat NVIDIA atau driver DRA untuk mengiklankan lebih dari satu slot yang dapat dijadwalkan per GPU. Penjadwal Kubernetes menempatkan beberapa Pod pada GPU yang sama, dan penjadwal CUDA GPU mengalikan waktu beban kerja.
Time-slicing adalah GPU-sharing strategi yang paling sederhana. Ini hanya menggunakan perangkat lunak, tidak memerlukan perangkat keras khusus, dan berfungsi pada setiap jenis instans GPU NVIDIA AWS. Time-slicing tidak menawarkan memori atau isolasi komputasi antara Pod yang berbagi GPU. Cara terbaik untuk beban kerja dengan pemanfaatan GPU rendah, seperti layanan inferensi yang menganggur antara permintaan atau lingkungan pengembangan di mana beberapa pengguna berbagi GPU. Untuk beban kerja yang memerlukan memori tingkat perangkat keras dan isolasi komputasi, gunakan MIG sebagai gantinya.
Untuk informasi selengkapnya dan langkah-langkah untuk menggunakan pemotongan waktu dengan GPU NVIDIA dan EKS, lihat. Gunakan pemotongan waktu dengan GPU NVIDIA di Amazon EKS