Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
CloudWatch solusi: beban kerja GPU NVIDIA di Amazon EC2
Solusi ini membantu Anda mengonfigurasi pengumpulan metrik out-of-the-box menggunakan CloudWatch agen untuk beban kerja GPU NVIDIA yang berjalan pada instans EC2. Selain itu, ini membantu Anda mengatur CloudWatch dasbor yang telah dikonfigurasi sebelumnya. Untuk informasi umum tentang semua solusi CloudWatch pengamatan, lihatCloudWatch solusi pengamatan.
Topik
Persyaratan
Solusi ini relevan untuk kondisi berikut:
-
Komputasi: Amazon EC2
-
Mendukung hingga 500 GPU di semua instans EC2 dalam satu Wilayah AWS
-
Versi terbaru dari CloudWatch agent
-
Agen SSM diinstal pada instans EC2
-
Instans EC2 harus memiliki driver NVIDIA yang diinstal. Driver NVIDIA sudah diinstal sebelumnya pada beberapa Amazon Machine Images (AMI). Jika tidak, Anda dapat melakukan instalasi driver secara manual. Untuk informasi selengkapnya, silakan lihat Install NVIDIA drivers pada instans Linux.
catatan
AWS Systems Manager (Agen SSM) sudah diinstal sebelumnya pada beberapa Amazon Machine Images (AMI) yang disediakan oleh AWS dan pihak ketiga tepercaya. Jika agen tidak diinstal, Anda dapat menginstalnya secara manual menggunakan prosedur untuk jenis sistem operasi Anda.
Manfaat
Solusi ini memberikan pemantauan NVIDIA, memberikan wawasan berharga untuk kasus penggunaan berikut:
-
Analisis penggunaan GPU dan memori untuk hambatan kinerja atau kebutuhan akan sumber daya tambahan.
-
Pantau suhu dan daya tarik untuk memastikan GPU beroperasi dalam batas aman.
-
Mengevaluasi kinerja encoder untuk beban kerja video GPU.
-
Verifikasi konektivitas PCIe untuk generasi dan lebar yang diharapkan.
-
Pantau kecepatan clock GPU untuk mendeteksi masalah penskalaan dan pelambatan.
Di bawah ini adalah keuntungan utama dari solusi ini:
-
Mengotomatiskan pengumpulan metrik untuk NVIDIA menggunakan konfigurasi CloudWatch agen, menghilangkan instrumentasi manual.
-
Menyediakan CloudWatch dasbor konsolidasi yang telah dikonfigurasi sebelumnya untuk metrik NVIDIA. Dasbor akan secara otomatis menangani metrik dari instans NVIDIA EC2 baru yang dikonfigurasi menggunakan solusi, bahkan jika metrik tersebut tidak ada saat Anda pertama kali membuat dasbor.
Gambar berikut adalah contoh dasbor untuk solusi ini.
Biaya
Solusi ini membuat dan menggunakan sumber daya di akun Anda. Anda dikenai biaya untuk penggunaan standar, termasuk yang berikut:
-
Semua metrik yang dikumpulkan oleh CloudWatch agen ditagih sebagai metrik khusus. Jumlah metrik yang digunakan oleh solusi ini tergantung pada jumlah host EC2.
-
Setiap host EC2 yang dikonfigurasi untuk solusi menerbitkan total 17 metrik per GPU.
-
-
Satu dasbor khusus.
-
Operasi API diminta oleh CloudWatch agen untuk mempublikasikan metrik. Dengan konfigurasi default untuk solusi ini, CloudWatch agen memanggil PutMetricData sekali setiap menit untuk setiap host EC2. Ini berarti PutMetricData API akan dipanggil
30*24*60=43,200dalam 30 hari bulan untuk setiap host EC2.
Untuk informasi selengkapnya tentang CloudWatch harga, lihat CloudWatch Harga Amazon
Kalkulator harga dapat membantu Anda memperkirakan perkiraan biaya bulanan untuk menggunakan solusi ini.
Untuk menggunakan kalkulator harga untuk memperkirakan biaya solusi bulanan Anda
-
Buka kalkulator CloudWatch harga Amazon
. -
Untuk Pilih Wilayah, pilih Wilayah tempat Anda ingin menerapkan solusi.
-
Di bagian Metrik, untuk Jumlah metrik, masukkan
17 * average number of GPUs per EC2 host * number of EC2 instances configured for this solution. -
Di bagian API, untuk Jumlah permintaan API, masukkan
43200 * number of EC2 instances configured for this solution. -
Secara default, CloudWatch agen melakukan satu PutMetricData operasi setiap menit untuk setiap host EC2.
-
Di bagian Dasbor dan Alarm, untuk Jumlah Dasbor, masukkan.
1 -
Anda dapat melihat perkiraan biaya bulanan Anda di bagian bawah kalkulator harga.
CloudWatch konfigurasi agen untuk solusi ini
CloudWatch Agen adalah perangkat lunak yang berjalan terus menerus dan mandiri di server Anda dan di lingkungan kontainer. Ini mengumpulkan metrik, log, dan jejak dari infrastruktur dan aplikasi Anda dan mengirimkannya ke CloudWatch dan X-Ray.
Untuk informasi lebih lanjut tentang CloudWatch agen, lihatKumpulkan metrik, log, dan jejak menggunakan CloudWatch agen.
Konfigurasi agen dalam solusi ini mengumpulkan serangkaian metrik untuk membantu Anda mulai memantau dan mengamati GPU NVIDIA Anda. CloudWatch Agen dapat dikonfigurasi untuk mengumpulkan lebih banyak metrik GPU NVIDIA daripada tampilan dasbor secara default. Untuk daftar semua metrik GPU NVIDIA yang dapat Anda kumpulkan, lihatKumpulkan metrik GPU NVIDIA.
Konfigurasi agen untuk solusi ini
Metrik yang dikumpulkan oleh agen ditentukan dalam konfigurasi agen. Solusi ini menyediakan konfigurasi agen untuk mengumpulkan metrik yang direkomendasikan dengan dimensi yang sesuai untuk dasbor solusi.
Gunakan konfigurasi CloudWatch agen berikut pada instans EC2 dengan GPU NVIDIA. Konfigurasi akan disimpan sebagai parameter di Penyimpanan Parameter SSM, seperti yang dijelaskan nanti. Langkah 2: Simpan file konfigurasi CloudWatch agen yang direkomendasikan di Penyimpanan Parameter Manajer Sistem
{ "metrics": { "namespace": "CWAgent", "append_dimensions": { "InstanceId": "${aws:InstanceId}" }, "metrics_collected": { "nvidia_gpu": { "measurement": [ "utilization_gpu", "temperature_gpu", "power_draw", "utilization_memory", "fan_speed", "memory_total", "memory_used", "memory_free", "pcie_link_gen_current", "pcie_link_width_current", "encoder_stats_session_count", "encoder_stats_average_fps", "encoder_stats_average_latency", "clocks_current_graphics", "clocks_current_sm", "clocks_current_memory", "clocks_current_video" ], "metrics_collection_interval": 60 } } }, "force_flush_interval": 60 }
Menyebarkan agen untuk solusi Anda
Ada beberapa pendekatan untuk menginstal CloudWatch agen, tergantung pada kasus penggunaan. Kami merekomendasikan menggunakan Manajer Sistem untuk solusi ini. Ini memberikan pengalaman konsol dan membuatnya lebih mudah untuk mengelola armada server terkelola dalam satu AWS akun. Petunjuk di bagian ini menggunakan Manajer Sistem dan ditujukan untuk saat Anda tidak menjalankan CloudWatch agen dengan konfigurasi yang ada. Anda dapat memeriksa apakah CloudWatch agen sedang berjalan dengan mengikuti langkah-langkah diVerifikasi bahwa CloudWatch agen sedang berjalan.
Jika Anda sudah menjalankan CloudWatch agen di host EC2 tempat beban kerja digunakan dan mengelola konfigurasi agen, Anda dapat melewati petunjuk di bagian ini dan mengikuti mekanisme penerapan yang ada untuk memperbarui konfigurasi. Pastikan untuk menggabungkan konfigurasi agen GPU NVIDIA dengan konfigurasi agen yang ada, lalu terapkan konfigurasi gabungan. Jika Anda menggunakan Manajer Sistem untuk menyimpan dan mengelola konfigurasi untuk CloudWatch agen, Anda dapat menggabungkan konfigurasi ke nilai parameter yang ada. Untuk informasi selengkapnya, lihat Mengel CloudWatch ola file konfigurasi agen.
catatan
Menggunakan System Manager untuk menerapkan konfigurasi CloudWatch agen berikut akan menggantikan atau mengganti konfigurasi CloudWatch agen yang ada pada instans EC2 Anda. Anda dapat memodifikasi konfigurasi ini agar sesuai dengan lingkungan unik atau kasus penggunaan Anda. Metrik yang ditentukan dalam konfigurasi adalah minimum yang diperlukan untuk dasbor yang disediakan solusi.
Proses penerapan meliputi langkah-langkah berikut:
-
Langkah 1: Pastikan instans EC2 target memiliki izin IAM yang diperlukan.
-
Langkah 2: Simpan file konfigurasi agen yang direkomendasikan di Penyimpanan Parameter Manajer Sistem.
-
Langkah 3: Instal CloudWatch agen pada satu atau beberapa instans EC2 menggunakan CloudFormation tumpukan.
-
Langkah 4: Verifikasi pengaturan agen dikonfigurasi dengan benar.
Langkah 1: Pastikan instans EC2 target memiliki izin IAM yang diperlukan
Anda harus memberikan izin bagi Manajer Sistem untuk menginstal dan mengkonfigurasi CloudWatch agen. Anda juga harus memberikan izin kepada CloudWatch agen untuk menerbitkan telemetri dari instans EC2 Anda ke. CloudWatch Pastikan peran IAM yang dilampirkan ke instans memiliki kebijakan CloudWatchAgentServerPolicy dan AmazonSSMManagedInstanceCore IAM yang terlampir.
-
Setelah peran dibuat, lampirkan peran ke instans EC2 Anda. Untuk melampirkan peran ke instans EC2, ikuti langkah-langkah di Lamp irkan peran IAM ke instance.
Langkah 2: Simpan file konfigurasi CloudWatch agen yang direkomendasikan di Penyimpanan Parameter Manajer Sistem
Parameter Store menyederhanakan penginst CloudWatch alan agen pada instans EC2 dengan menyimpan dan mengelola parameter konfigurasi dengan aman, menghilangkan kebutuhan akan nilai hardcode. Ini memastikan proses penerapan yang lebih aman dan fleksibel, memungkinkan manajemen terpusat dan pembaruan konfigurasi yang lebih mudah di beberapa instans.
Gunakan langkah-langkah berikut untuk menyimpan file konfigurasi CloudWatch agen yang direkomendasikan sebagai parameter di Penyimpanan Parameter.
Untuk membuat file konfigurasi CloudWatch agen sebagai parameter
Buka AWS Systems Manager konsol di https://console.aws.amazon.com/systems-manager/
. -
Verifikasi bahwa Wilayah yang dipilih pada konsol adalah Wilayah tempat beban kerja GPU NVIDIA berjalan.
-
Dari panel navigasi, pilih Manajemen Aplikasi, Penyimpanan Parameter.
-
Ikuti langkah-langkah ini untuk membuat parameter baru untuk konfigurasi.
-
Pilih Buat parameter.
-
Di kotak Nama, masukkan nama yang akan Anda gunakan untuk mereferensikan file konfigurasi CloudWatch agen di langkah selanjutnya. Misalnya,
AmazonCloudWatch-NVIDIA-GPU-Configuration. -
(Opsional) Di kotak Deskripsi, ketik deskripsi untuk parameter.
-
Untuk tingkat Parameter, pilih Standar.
-
Untuk Jenis, pilih String.
-
Untuk Jenis data, pilih teks.
-
Di kotak Nilai, tempel blok JSON yang sesuai yang terdaftar diKonfigurasi agen untuk solusi ini.
-
Pilih Buat parameter.
-
Langkah 3: Instal CloudWatch agen dan terapkan konfigurasi menggunakan CloudFormation templat
Anda dapat menggunakan AWS CloudFormation untuk menginstal agen dan mengonfigurasinya untuk menggunakan konfigurasi CloudWatch agen yang Anda buat pada langkah sebelumnya.
Untuk menginstal dan mengkonfigurasi CloudWatch agen untuk solusi ini
-
Buka panduan CloudFormation buat tumpukan cepat menggunakan tautan ini: https://console.aws.amazon.com/cloudformation/home? #/? stacks/quickcreate TemplateURL =. https://aws-observability-solutions-prod-us-east-1.s3.us-east-1.amazonaws.com/CloudWatchAgent/CFN/v1.0.0/cw-agent-installation-template-1.0.0.json
-
Verifikasi bahwa Wilayah yang dipilih pada konsol adalah Wilayah tempat beban kerja GPU NVIDIA berjalan.
-
Untuk nama Stack, masukkan nama untuk mengidentifikasi tumpukan ini, seperti
CWAgentInstallationStack. -
Di bagian Parameter, tentukan yang berikut ini:
-
Untuk CloudWatchAgentConfigSSM, masukkan nama parameter Manajer Sistem untuk konfigurasi agen yang Anda buat sebelumnya, seperti
AmazonCloudWatch-NVIDIA-GPU-Configuration. -
Untuk memilih instance target, Anda memiliki dua opsi.
-
Untuk InstanceIds, tentukan daftar ID instance yang dipisahkan koma dari daftar ID instans tempat Anda ingin menginstal CloudWatch agen dengan konfigurasi ini. Anda dapat mencantumkan satu contoh atau beberapa contoh.
-
Jika Anda menerapkan dalam skala besar, Anda dapat menentukan TagKey dan yang sesuai TagValue untuk menargetkan semua instans EC2 dengan tag dan nilai ini. Jika Anda menentukan a TagKey, Anda harus menentukan yang sesuai TagValue. (Untuk grup Penskalaan Otomatis, tent
aws:autoscaling:groupNameukan untuk TagKey dan tentukan nama grup Penskalaan Otomatis untuk diterapkan TagValue ke semua instance dalam grup Penskalaan Otomatis.)
-
-
-
Tinjau pengaturan, lalu pilih Buat tumpukan.
Jika Anda ingin mengedit file template terlebih dahulu untuk menyesuaikannya, pilih opsi Ungg ah file template di bawah Create Stack Wizard untuk mengunggah template yang diedit. Untuk informasi selengkapnya, lihat Membuat tumpukan di CloudFormation konsol.
catatan
Setelah langkah ini selesai, parameter Manajer Sistem ini akan dikaitkan dengan CloudWatch agen yang berjalan di instance yang ditargetkan. Ini artinya bahwa:
-
Jika parameter Manajer Sistem dihapus, agen akan berhenti.
-
Jika parameter Manajer Sistem diedit, perubahan konfigurasi akan secara otomatis berlaku untuk agen pada frekuensi terjadwal yaitu 30 hari secara default.
-
Jika Anda ingin segera menerapkan perubahan pada parameter Manajer Sistem ini, Anda harus menjalankan langkah ini lagi. Untuk informasi selengkapnya tentang asosiasi, lihat Bekerja dengan asosiasi di Manajer Sistem.
Langkah 4: Verifikasi pengaturan agen dikonfigurasi dengan benar
Anda dapat memverifikasi apakah CloudWatch agen diinstal dengan mengikuti langkah-langkah diVerifikasi bahwa CloudWatch agen sedang berjalan. Jika CloudWatch agen tidak diinstal dan berjalan, pastikan Anda telah mengatur semuanya dengan benar.
-
Pastikan Anda telah melampirkan peran dengan izin yang benar untuk instans EC2 seperti yang dijelaskan dalamLangkah 1: Pastikan instans EC2 target memiliki izin IAM yang diperlukan.
-
Pastikan Anda telah mengkonfigurasi JSON dengan benar untuk parameter Manajer Sistem. Ikuti langkah-langkah di Memecahkan masalah instalasi CloudWatch agen dengan CloudFormation.
Jika semuanya diatur dengan benar, maka Anda akan melihat metrik GPU NVIDIA sedang dipublikasikan CloudWatch. Anda dapat memeriksa CloudWatch konsol untuk memverifikasi bahwa mereka sedang dipublikasikan.
Untuk memverifikasi bahwa metrik GPU NVIDIA sedang dipublikasikan ke CloudWatch
Buka CloudWatch konsol di https://console.aws.amazon.com/cloudwatch/
. -
Pilih Metrik, Metrik Klasik.
-
Pastikan Anda telah memilih Wilayah tempat Anda menerapkan solusi, dan pilih ruang nama khusus, CWAgent.
-
Cari metrik yang disebutkan diKonfigurasi agen untuk solusi ini, seperti
nvidia_smi_utilization_gpu. Jika Anda melihat hasil untuk metrik ini, maka metrik akan dipublikasikan ke CloudWatch.
Buat dasbor solusi NVIDIA GPU
Dasbor yang disediakan oleh solusi ini menyajikan metrik GPU NVIDIA dengan menggabungkan dan menyajikan metrik di semua instance. Dasbor menunjukkan rincian kontributor teratas (10 teratas per widget metrik) untuk setiap metrik. Ini membantu Anda mengidentifikasi outlier atau instance dengan cepat yang secara signifikan berkontribusi pada metrik yang diamati.
Untuk membuat dasbor, Anda dapat menggunakan opsi berikut:
Gunakan CloudWatch konsol untuk membuat dasbor.
Gunakan AWS CloudFormation konsol untuk menyebarkan dasbor.
Unduh AWS CloudFormation infrastruktur sebagai kode dan integrasikan sebagai bagian dari otomatisasi integrasi berkelanjutan (CI) Anda.
Dengan menggunakan CloudWatch konsol untuk membuat dasbor, Anda dapat melihat pratinjau dasbor sebelum benar-benar membuat dan dikenakan biaya.
catatan
Dasbor yang dibuat dengan CloudFormation solusi ini menampilkan metrik dari Wilayah tempat solusi diterapkan. Pastikan untuk membuat CloudFormation tumpukan di Wilayah tempat metrik GPU NVIDIA Anda diterbitkan.
Jika Anda telah menentukan namespace khusus selain CWAgent dalam konfigurasi CloudWatch agen, Anda harus mengubah CloudFormation template untuk dasbor untuk mengganti CWAgent dengan namespace khusus yang Anda gunakan.
Untuk membuat dasbor melalui CloudWatch Konsol
-
Buka CloudWatch Console Create Dashboard menggunakan tautan ini: https://console.aws.amazon.com/cloudwatch/home? #dashboards? DasborTemplate= &referrer=os-katalogNvidiaGpuOnEc2.
-
Verifikasi bahwa Wilayah yang dipilih pada konsol adalah Wilayah tempat beban kerja GPU NVIDIA berjalan.
-
Masukkan nama dasbor, lalu pilih Buat Dasbor.
Untuk membedakan dasbor ini dengan mudah dari dasbor serupa di Wilayah lain, sebaiknya sertakan nama Wilayah dalam nama dasbor, seperti
NVIDIA-GPU-Dashboard-us-east-1. -
Pratinjau dasbor dan pilih Simpan untuk membuat dasbor.
Untuk membuat dasbor melalui CloudFormation
-
Buka panduan CloudFormation buat tumpukan cepat menggunakan tautan ini: https://console.aws.amazon.com/cloudformation/home? #/? stacks/quickcreate TemplateURL =. https://aws-observability-solutions-prod-us-east-1.s3.us-east-1.amazonaws.com/NVIDIA_GPU_EC2/CloudWatch/CFN/v1.0.0/dashboard-template-1.0.0.json
-
Verifikasi bahwa Wilayah yang dipilih pada konsol adalah Wilayah tempat beban kerja GPU NVIDIA berjalan.
-
Untuk nama Stack, masukkan nama untuk mengidentifikasi tumpukan ini, seperti
NVIDIA-GPU-DashboardStack. -
Di bagian Parameter, tentukan nama dasbor di bawah DashboardName parameter.
-
Untuk membedakan dasbor ini dengan mudah dari dasbor serupa di Wilayah lain, sebaiknya sertakan nama Wilayah dalam nama dasbor, seperti
NVIDIA-GPU-Dashboard-us-east-1. -
Mengakui kemampuan akses untuk transformasi di bawah Kemampuan dan transformasi. Perhatikan bahwa CloudFormation tidak menambahkan sumber daya IAM apa pun.
-
Tinjau pengaturan, lalu pilih Buat tumpukan.
-
Setelah status tumpukan adalah CREATE_COMPLETE, pilih tab Resources di bawah tumpukan yang dibuat dan kemudian pilih tautan di bawah ID Fisik untuk pergi ke dasbor. Anda juga dapat mengakses dasbor di CloudWatch konsol dengan memilih Dasbor di panel navigasi kiri konsol, dan menemukan nama dasbor di bawah Dasbor K ustom.
Jika Anda ingin mengedit file template untuk menyesuaikannya untuk tujuan apa pun, Anda dapat menggunakan opsi Ungg ah file template di bawah Create Stack Wizard untuk mengunggah template yang diedit. Untuk informasi selengkapnya, lihat Membuat tumpukan di CloudFormation konsol. Anda dapat menggunakan tautan ini untuk mengunduh template: https://aws-observability-solutions-prod-us-east-1.s3.us-east-1.amazonaws.com/NVIDIA_GPU_EC2/CloudWatch/CFN/v1.0.0/dashboard-template-1.0.0.json
Memulai dengan dasbor GPU NVIDIA
Berikut adalah beberapa tugas yang dapat Anda coba dengan dasbor GPU NVIDIA baru. Tugas-tugas ini memungkinkan Anda untuk memvalidasi bahwa dasbor berfungsi dengan benar dan memberi Anda beberapa pengalaman langsung menggunakannya untuk memantau GPU NVIDIA Anda. Saat Anda mencobanya, Anda akan terbiasa menavigasi dasbor dan menafsirkan metrik yang divisualisasikan.
Tinjau pemanfaatan GPU
Dari bagian Pem anfaatan, temukan widget Pemanfaatan GPU dan Pem anfaatan Memori. Ini menunjukkan persentase waktu GPU secara aktif digunakan untuk perhitungan dan persentase memori global yang dibaca atau ditulis, masing-masing. Pemanfaatan yang tinggi dapat menunjukkan potensi hambatan kinerja atau kebutuhan akan sumber daya GPU tambahan.
Analisis penggunaan memori GPU
Di bagian Memori, temukan widget Total Memory, Used Memory, dan Free Memory. Ini memberikan wawasan tentang kapasitas memori keseluruhan GPU dan berapa banyak memori yang saat ini dikonsumsi atau tersedia. Tekanan memori dapat menyebabkan masalah kinerja atau kesalahan kehabisan memori, jadi penting untuk memantau metrik ini dan memastikan memori yang cukup tersedia untuk beban kerja Anda.
Pantau suhu dan daya tarik
Di bagian Temperature/ Power, temukan widget Suhu GPU dan Power Draw. Metrik ini penting untuk memastikan bahwa GPU Anda beroperasi dalam batas termal dan daya yang aman.
Identifikasi kinerja encoder
Di bagian Encoder, temukan widget Encoder Session Count, Average FPS, dan Rata-rata Latensi. Metrik ini relevan jika Anda menjalankan beban kerja pengkodean video pada GPU Anda. Pantau metrik ini untuk memastikan bahwa encoder Anda berkinerja optimal dan mengidentifikasi potensi hambatan atau masalah kinerja.
Periksa status tautan PCIe
Di bagian PCIe, temukan widget PCIe Link Generation dan PCIe Link Width. Metrik ini memberikan informasi tentang tautan PCIe yang menghubungkan GPU ke sistem host. Pastikan tautan beroperasi pada generasi dan lebar yang diharapkan untuk menghindari potensi keterbatasan kinerja karena kemacetan PCIe.
Tinjau jam GPU
Di bagian Jam, temukan widget Jam Grafis, Jam SM, Jam Mem ori, dan Jam Video. Metrik ini menunjukkan frekuensi operasi saat ini dari berbagai komponen GPU. Memantau jam ini dapat membantu mengidentifikasi masalah potensial dengan penskalaan jam GPU atau pelambatan frekuensi, yang dapat memengaruhi kinerja.