View a markdown version of this page

Perubahan ketersediaan profiler - Amazon SageMaker AI

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Perubahan ketersediaan profiler

catatan

Pemberitahuan akhir dukungan: Pada 30 Juni 2027, dukungan untuk Amazon SageMaker Profiler AWS akan berakhir. Setelah 30 Juni 2027, Anda tidak akan lagi dapat mengakses konsol Profiler atau sumber daya Profiler.

Mengganti Amazon SageMaker Profiler

Jika saat ini Anda menggunakan SageMaker Profiler, ikuti panduan ini untuk beralih ke layanan alternatif.

Gambaran umum

Amazon SageMaker Profiler memberikan visibilitas mendalam ke aktivitas GPU dan CPU selama pelatihan, termasuk menjalankan kernel, peluncuran kernel, operasi sinkronisasi, operasi memori, dan latensi antara pel CPU-initiated uncuran dan eksekusi kernel GPU. Panduan ini memandu Anda menghapus konfigurasi Profiler yang ada dan mengadopsi profiler asli kerangka kerja TensorBoard, dan Amazon CloudWatch untuk diagnostik kinerja pelatihan.

Untuk PyTorch dan TensorFlow beban kerja, kombinasi profiler asli kerangka kerja dan TensorBoard memberikan visibilitas tingkat kernel yang setara dengan integrasi langsung ke dalam ekosistem sumber terbuka. Amazon CloudWatch menyediakan pemantauan sumber daya tingkat sistem dengan alarm yang dapat dikonfigurasi. Bersama-sama, alat-alat ini menawarkan SageMaker alternatif untuk diagnostik kinerja pelatihan Profiler.

Pemetaan kemampuan

Kemampuan Profiler Diganti oleh
Pelacakan kernel GPU, CPU/GPU pemanfaatan, analisis sinkronisasi, latensi peluncuran-ke-eksekusi kernel PyTorch Profiler/ TensorFlow Profiler + TensorBoard
Pemuat data dan profil pipa input Profil Kerangka + TensorBoard
Pemantauan sumber daya sistem (CPU, GPU, memori, disk) Amazon CloudWatch
Anotasi operasi khusus Anotasi Framework Profiler
Visualisasi garis waktu UI Profiler TensorBoard Plugin Profiler

Langkah 1: Hapus konfigurasi Profiler

Hapus anotasi smprof dari skrip pelatihan Anda

Jika skrip pelatihan Anda menggunakan modul SageMaker Profiler Python (smprofatau yang lebih lamasmppy), hapus:

  • import smprof (atau import smppy as smprof)

  • SMProfiler.instance(), SMProf.configure(), SMProf.start_profiling(), SMProf.stop_profiling()

  • Semua smprof.annotate() pengelola konteks dansmprof.annotation_begin()/smprof.annotation_end()panggilan

Hapus ProfilerConfig dari konfigurasi pelatihan Anda

Hapus profiler_config parameter dari konfigurasi SageMaker pelatihan Anda:

# Remove this configuration # V2 from sagemaker import ProfilerConfig, Profiler profiler_config = ProfilerConfig( profile_params = Profiler(cpu_profiling_duration=3600) ) # V3 from sagemaker.core.debugger.profiler_config import ProfilerConfig from sagemaker.core.debugger.profiler import Profiler

Hapus keluaran Profiler di Amazon S3

SageMaker Profiler menyimpan data profil di bawah rule-output jalur pekerjaan pelatihan Anda:

s3://<output-path>/<training-job-name>/rule-output/

Hapus awalan ini jika Anda tidak lagi memerlukan data profil historis. Log pekerjaan pelatihan dan artefak model Anda tetap tidak terpengaruh.

Hapus SageMaker paket Profiler Python (jika diinstal secara manual)

Jika Anda menambahkan smprof paket ke wadah Docker khusus requirements.txt atau kustom, hapus setiap baris yang merujuk. smppy.s3.amazonaws.com

Hapus CloudWatch Grup Log (opsional)

Periksa grup CloudWatch log yang dibuat oleh pemrosesan aturan Profiler di bawah/aws/sagemaker/ProcessingJobs. Hapus ini jika tidak lagi diperlukan untuk mengurangi biaya penyimpanan.

Tinjau kebijakan IAM

Hapus kebijakan IAM yang memberikan izin khusus untuk penggunaan Profiler:

  • s3:GetObject/dic s3:PutObject akup ke jalur keluaran aturan Profiler

  • Peran yang melekat pada pekerjaan pelatihan semata-mata untuk dukungan Profiler

Pertahankan kebijakan apa pun yang masih diperlukan untuk pekerjaan pelatihan atau CloudWatch pemantauan Anda.

Nonaktifkan otomatisasi dependen

Memperbarui atau menghapus otomatisasi apa pun yang menggunakan output Profiler:

  • Langkah Fungsi alur kerja yang memproses data Profiler

  • A EventBridge turan Amazon dipicu oleh keluaran Profiler

  • Post-training prosesor yang membaca dari jalur Profiler S3

Langkah 2: Konfigurasikan penggantian

Aktifkan profil tingkat kerangka kerja

Perbarui skrip pelatihan Anda untuk menggunakan profiler bawaan kerangka kerja Anda. Kedu PyTorch anya dan TensorFlow profiler terintegrasi langsung dengan TensorBoard visualisasi, termasuk tampilan timeline, statistik kernel, dan rekomendasi kinerja.

PyTorch:

import torch from torch.profiler import profile, schedule, tensorboard_trace_handler with profile( activities=[torch.profiler.ProfilerActivity.CPU, torch.profiler.ProfilerActivity.CUDA], schedule=schedule(wait=1, warmup=1, active=3, repeat=1), on_trace_ready=tensorboard_trace_handler("./tensorboard/logs"), record_shapes=True, profile_memory=True, with_stack=True ) as prof: for step, batch in enumerate(train_loader): inputs, labels = batch outputs = model(inputs) loss = criterion(outputs, labels) loss.backward() optimizer.step() prof.step()

Untuk membuat anotasi operasi tertentu (menggantismprof.annotate()):

with torch.profiler.record_function("forward_pass"): outputs = model(inputs) with torch.profiler.record_function("backward_pass"): loss.backward()

TensorFlow:

import tensorflow as tf tf.profiler.experimental.start("./tensorboard/logs") model.fit(train_dataset, epochs=5) tf.profiler.experimental.stop()
catatan

Seperti halnya SageMaker Profiler, membuat profil seluruh pekerjaan pelatihan tidak disarankan. Buat profil subset langkah yang representatif (hingga beberapa ratus) untuk meminimalkan overhead.

Visualisasikan dengan TensorBoard

Lun TensorBoard curkan untuk melihat hasil pembuatan profil, jadwal eksekusi, dan rekomendasi kinerja:

tensorboard --logdir=./tensorboard/logs

Plu TensorBoard gin Profiler menyediakan garis waktu kernel GPU yang setara dengan UI SageMaker Profiler, bersama dengan statistik kernel, ringkasan eksekusi, analisis pipeline input, dan rekomendasi kinerja. Untuk dikelola TensorBoard di SageMaker AI, lihat TensorBoard di Amazon SageMaker AI. Ter TensorBoard kelola memerlukan SageMaker Domain dan tersedia di wilayah tertentu.

Gunakan Amazon CloudWatch untuk pemantauan dan peringatan sistem

Amazon CloudWatch menangkap metrik pemanfaatan sumber daya untuk pekerjaan pelatihan Anda, termasuk CPU, GPU, memori, dan disk, secara real time, dengan dukungan alarm yang dapat dikonfigurasi untuk mendeteksi kemacetan sumber daya, kurangnya pemanfaatan, atau lonjakan tak terduga, dan dasbor yang menggabungkan metrik sistem di seluruh proses pelatihan. Untuk langkah-langkah terperinci, lihat CloudWatch Metrik Amazon untuk Memantau dan Menganalisis Pekerjaan Pelatihan. Atau, Anda dapat mencatat metrik kinerja sistem dari skrip pelatihan Anda langsung ke MLFlow untuk pelacakan terpadu bersama metrik eksperimen Anda.

Apa yang terjadi pada data Anda yang ada

  • Log pelatihan dan artefak di S3 — Output pekerjaan pelatihan dan artefak model Anda tetap dapat diakses. Ini independen dari Profiler.

  • Data pelacakan profiler — Data profil historis tetap berada di S3 di bawah rule-output/ sampai Anda menghapusnya.

  • CloudWatch metrik — Metrik sistem historis yang sudah CloudWatch ada dipertahankan sesuai pengaturan retensi akun Anda.