View a markdown version of this page

Mempercepat pengembangan AI generatif menggunakan MLFlow terkelola di Amazon AI SageMaker - Amazon SageMaker AI

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Mempercepat pengembangan AI generatif menggunakan MLFlow terkelola di Amazon AI SageMaker

MLFlow yang dikelola sepenuhnya di Amazon SageMaker AI memungkinkan Anda mempercepat AI generatif dengan mempermudah melacak eksperimen dan memantau kinerja model dan aplikasi AI menggunakan satu alat.

Pengembangan AI generatif dengan MLFlow

Ketika pelanggan di seluruh industri mempercepat pengembangan AI generatif mereka, mereka memerlukan kemampuan untuk melacak eksperimen, mengamati perilaku, dan mengevaluasi kinerja model dan aplikasi AI. Ilmuwan dan pengembang data tidak memiliki alat untuk menganalisis kinerja model dan aplikasi AI dari eksperimen hingga produksi, sehingga sulit untuk mengakar penyebab dan menyelesaikan masalah. Tim menghabiskan lebih banyak waktu untuk mengintegrasikan alat daripada meningkatkan model atau aplikasi AI generatif mereka.

Pelatihan atau penyempurnaan AI generatif dan pembelajaran mesin adalah proses berulang yang membutuhkan eksperimen dengan berbagai kombinasi data, algoritma, dan parameter, sambil mengamati dampaknya pada akurasi model. Sifat eksperimen berulang menghasilkan banyak proses dan versi pelatihan model, membuatnya sulit untuk melacak model berkinerja terbaik dan konfigurasinya. Kompleksitas mengelola dan membandingkan pelatihan berulang meningkat dengan GenAI, di mana eksperimen tidak hanya melibatkan model penyempurnaan tetapi juga mengeksplorasi output yang kreatif dan beragam. Peneliti harus menyesuaikan hyperparameter, memilih arsitektur model yang sesuai, dan menyusun beragam kumpulan data untuk mengoptimalkan kualitas dan kreativitas konten yang dihasilkan. Mengevaluasi model AI generatif membutuhkan metrik kuantitatif dan kualitatif, menambahkan lapisan kompleksitas lain ke proses eksperimen. Kemampuan pelacakan eksperimen di MLFlow di Amazon SageMaker AI memungkinkan Anda melacak, mengatur, melihat, menganalisis, dan membandingkan eksperimen ML berulang untuk mendapatkan wawasan komparatif serta mendaftarkan serta menerapkan model berkinerja terbaik Anda.

Kemampuan pelacakan dalam MLFlow yang dikelola sepenuhnya memungkinkan Anda merekam input, output, dan metadata di setiap langkah aplikasi AI generatif, membantu Anda mengidentifikasi sumber bug atau perilaku tak terduga dengan cepat. Dengan menyimpan catatan setiap model dan versi aplikasi, MLFlow yang dikelola sepenuhnya menawarkan keterlacakan untuk menghubungkan respons AI ke komponen sumbernya, memungkinkan Anda melacak masalah dengan cepat langsung ke kode, data, atau parameter tertentu yang menghasilkannya. Ini secara dramatis mengurangi waktu pemecahan masalah dan memungkinkan tim untuk lebih fokus pada inovasi.

Integrasi MLFlow

Gunakan MLFlow saat melatih dan mengevaluasi model untuk menemukan kandidat terbaik untuk kasus penggunaan Anda. Anda dapat membandingkan kinerja model, parameter, dan metrik di seluruh eksperimen di UI MLFlow, melacak model terbaik Anda di MLFlow Model Registry, mendaftarkannya secara otomatis sebagai model SageMaker AI, dan menerapkan model terdaftar ke titik akhir SageMaker AI.

Amazon SageMaker AI dengan MLFlow

Gunakan MLFlow untuk melacak dan mengelola fase eksperimen siklus pembelajaran mesin (ML) dengan AWS integrasi untuk pengembangan model, manajemen, penerapan, dan pelacakan.

SageMaker Studio Amazon

Buat dan kelola server pelacakan, jalankan buku catatan untuk membuat eksperimen, dan akses UI MLFlow untuk melihat dan membandingkan eksperimen yang dijalankan di seluruh Studio.

SageMaker Pendaftaran Model

Kelola versi model dan model katalog untuk produksi dengan mendaftarkan model secara otomatis dari MLFlow Model Registry ke SageMaker Model Registry. Untuk informasi selengkapnya, lihat Secara otomatis mendaftar SageMaker kan model AI dengan SageMaker Model Registry.

SageMaker Inferensi AI

Siapkan model terbaik Anda untuk penerapan pada titik akhir SageMaker AI menggunakanModelBuilder. Untuk informasi selengkapnya, lihat Terapkan model MLFlow dengan ModelBuilder.

AWS Identity and Access Management

Konfigurasikan akses ke MLFlow menggunakan kontrol akses berbasis peran (RBAC) dengan IAM. Tulis kebijakan identitas IAM untuk mengotorisasi API MLFlow yang dapat dipanggil oleh klien server pelacakan MLFlow. Semua MLFlow REST API direpresentasikan sebagai tindakan IAM di bawah awalan sagemaker-mlflow layanan. Untuk informasi selengkapnya, lihat Menyiapkan izin IAM untuk MLFlow.

AWS CloudTrail

Lihat log in AWS CloudTrail untuk membantu Anda mengaktifkan audit operasional dan risiko, tata kelola, dan kepatuhan AWS akun Anda. Untuk informasi selengkapnya, lihat AWS CloudTrail log.

Amazon EventBridge

Otomatiskan peninjauan model dan siklus hidup penerapan menggunakan peristiwa MLFlow yang ditangkap oleh Amazon EventBridge. Untuk informasi selengkapnya, lihat Acara EventBridge Amazon.

Didukung Wilayah AWS

Server Pelacakan MLFlow

Server Pelacakan MLFlow umumnya tersedia di semua AWS Wil ayah komersial tempat Amazon SageMaker Studio tersedia, kecuali Wilayah China. Server Pelacakan MLFlow hanya tersedia AWS CLI di Wilayah Eropa (Zurich), Wilayah Asia Pasifik (Hyderabad), Wilayah Asia Pasifik (Melbourne), dan Wilayah Kanada Barat (Calgary).

Server pelacakan diluncurkan dalam zona ketersediaan tunggal dalam Wilayah yang ditentukan.

Aplikasi MLFlow

Aplikasi MLFlow tersedia sebagai berikut: Wilayah AWS

  • Wilayah AS Timur (N. Virginia)

  • Wilayah US East (Ohio)

  • Wilayah US West (N California)

  • Wilayah US West (Oregon)

  • Wilayah Asia Pacific (Mumbai)

  • Wilayah Asia Pasifik (Seoul)

  • Wilayah Asia Pasifik (Singapura)

  • Wilayah Asia Pasifik (Sydney)

  • Wilayah Asia Pasifik (Tokyo)

  • Wilayah Kanada (Pusat)

  • Wilayah Eropa (Frankfurt)

  • Wilayah Eropa (Irlandia)

  • Wilayah Eropa (London)

  • Wilayah Eropa (Paris)

  • Wilayah Eropa (Stockholm)

  • Wilayah Amerika Selatan (Sao Paulo)

Cara kerjanya

Server Pelacakan MLFlow memiliki tiga komponen utama: komputasi, penyimpanan metadata backend, dan penyimpanan artefak. Komputasi yang meng-host server pelacakan dan penyimpanan metadata backend dihosting dengan aman di akun layanan SageMaker AI. Penyimpanan artefak berada di bucket Amazon S3 di AWS akun Anda sendiri.

Diagram yang menunjukkan penyimpanan komputasi dan metadata untuk Server Pelacakan MLFlow.

Server pelacakan memiliki ARN. Anda dapat menggunakan ARN ini untuk menghubungkan MLFlow SDK ke Server Pelacakan Anda dan mulai mencatat proses pelatihan Anda ke MLFlow.

Baca terus untuk informasi lebih lanjut tentang konsep-konsep kunci berikut:

Penyimpanan metadata backend

Saat Anda membuat Server Pelacakan MLFlow, penyimpanan backend, yang menyimpan berbagai metadata untuk setiap Run, seperti ID run, waktu mulai dan akhir, parameter, dan metrik, secara otomatis dikonfigurasi dalam akun layanan SageMaker AI dan dikelola sepenuhnya untuk Anda.

Penyimpanan artefak

Untuk menyediakan MLFlow dengan penyimpanan persisten untuk metadata untuk setiap proses, seperti bobot model, gambar, file model, dan file data untuk proses percobaan Anda, Anda harus membuat penyimpanan artefak menggunakan Amazon S3. Toko artefak harus diatur dalam AWS akun Anda dan Anda harus secara eksplisit memberikan akses MLFlow ke Amazon S3 untuk mengakses toko artefak Anda. Untuk informasi selengkapnya, lihat Toko Artefak di dokumentasi MLFlow.

catatan

SageMaker AI MLFlow memiliki batas ukuran unduhan 200 MB.

Versi aplikasi MLFlow

Versi MLFlow berikut tersedia untuk digunakan dengan Aplikasi SageMaker AI MLFlow:

Versi MLFlow Versi Python
MLFlow 3.10 (versi terbaru) Python 3.10 atau yang lebih baru

Versi terbaru Aplikasi MLFlow memiliki fitur terbaru, patch keamanan, dan perbaikan bug. Saat Anda membuat Aplikasi MLFlow baru, aplikasi itu akan secara otomatis diperbarui ke versi terbaru yang didukung. Untuk informasi selengkapnya tentang membuat Aplikasi MLFlow, lihatPengaturan Aplikasi MLFlow.

Aplikasi MLFlow menggunakan versi semantik. Versi dalam format berikut:major-version.minor-version.patch-version.

Ukuran Server Pelacakan MLFlow

Anda dapat secara opsional menentukan ukuran server pelacakan Anda di UI Studio atau dengan AWS CLI parameter--tracking-server-size. Anda dapat memilih antara"Small","Medium", dan"Large". Ukuran konfigurasi server pelacakan MLFlow default adalah"Small". Anda dapat memilih ukuran tergantung pada proyeksi penggunaan server pelacakan seperti volume data yang dicatat, jumlah pengguna, dan frekuensi penggunaan.

Sebaiknya gunakan server pelacakan kecil untuk tim hingga 25 pengguna, server pelacakan menengah untuk tim hingga 50 pengguna, dan server pelacakan besar untuk tim hingga 100 pengguna. Kami berasumsi bahwa semua pengguna akan membuat permintaan bersamaan ke Server Pelacakan MLFlow Anda untuk membuat rekomendasi ini. Anda harus memilih ukuran server pelacakan berdasarkan pola penggunaan yang diharapkan dan TPS (Transactions Per Second) yang didukung oleh masing-masing server pelacakan.

catatan

Sifat beban kerja Anda dan jenis permintaan yang Anda buat ke server pelacakan menentukan TPS yang Anda lihat.

Pelacakan ukuran server TPS berkelanjutan Meledakkan TPS
Kecil Hingga 25 Hingga 50
Sedang Hingga 50 Hingga 100
Besar Hingga 100 Hingga 200

Pelacakan versi server

Versi MLFlow berikut tersedia untuk digunakan dengan SageMaker AI:

Versi MLFlow Versi Python
MLFlow 3.0 (versi terbaru) Python 3.9 atau yang lebih baru
MLaliran 2,16 Python 3.8 atau yang lebih baru
MLaliran 2,13 Python 3.8 atau yang lebih baru

Versi terbaru dari server pelacakan memiliki fitur terbaru, patch keamanan, dan perbaikan bug. Saat Anda membuat server pelacakan baru, sebaiknya gunakan versi terbaru. Untuk informasi selengkapnya tentang membuat server pelacakan, lihatServer Pelacakan MLFlow.

Server pelacakan MLFlow menggunakan versi semantik. Versi dalam format berikut:major-version.minor-version.patch-version.

Fitur terbaru, seperti elemen UI baru dan fungsionalitas API, ada dalam versi kecil.

AWS CloudTrail log

AWS CloudTrail secara otomatis mencatat aktivitas yang terkait dengan Server Pelacakan MLFlow Anda. Panggilan API bidang kontrol berikut dicatat CloudTrail:

  • CreateMlflowTrackingServer

  • DescribeMlflowTrackingServer

  • UpdateMlflowTrackingServer

  • DeleteMlflowTrackingServer

  • ListMlflowTrackingServers

  • CreatePresignedMlflowTrackingServer

  • StartMlflowTrackingServer

  • StopMlflowTrackingServer

AWS CloudTrail juga secara otomatis mencatat aktivitas yang terkait dengan bidang data MLFlow Anda. Panggilan API bidang data berikut masuk CloudTrail. Untuk nama acara, tambahkan awalan Mlflow (misalnya,MlflowCreateExperiment).

  • CreateExperiment

  • CreateModelVersion

  • CreateRegisteredModel

  • CreateRun

  • DeleteExperiment

  • DeleteModelVersion

  • DeleteModelVersionTag

  • DeleteRegisteredModel

  • DeleteRegisteredModelAlias

  • DeleteRegisteredModelTag

  • DeleteRun

  • DeleteTag

  • GetDownloadURIForModelVersionArtifacts

  • GetExperiment

  • GetExperimentByName

  • GetLatestModelVersions

  • GetMetricHistory

  • GetModelVersion

  • GetModelVersionByAlias

  • GetRegisteredModel

  • GetRun

  • ListArtifacts

  • LogBatch

  • LogInputs

  • LogMetric

  • LogModel

  • LogParam

  • RenameRegisteredModel

  • RestoreExperiment

  • RestoreRun

  • SearchExperiments

  • SearchModelVersions

  • SearchRegisteredModels

  • SearchRuns

  • SetExperimentTag

  • SetModelVersionTag

  • SetRegisteredModelAlias

  • SetRegisteredModelTag

  • SetTag

  • TransitionModelVersionStage

  • UpdateExperiment

  • UpdateModelVersion

  • UpdateRegisteredModel

  • UpdateRun

  • FinalizeLoggedModel

  • GetLoggedModel

  • DeleteLoggedModel

  • SearchLoggedModels

  • SetLoggedModelTags

  • DeleteLoggedModelTag

  • ListLoggedModelArtifacts

  • LogLoggedModelParams

  • LogOutputs

Untuk informasi selengkap CloudTrail nya, lihat Panduan AWS CloudTrail Pengguna .

Acara EventBridge Amazon

Gunakan EventBridge untuk merutekan peristiwa dari penggunaan MLFlow dengan SageMaker AI ke aplikasi konsumen di seluruh organisasi Anda. Peristiwa berikut dipancarkan ke EventBridge:

  • “Pem SageMaker buatan Server Pelacakan”

  • “Pel SageMaker acakan Server Dibuat”

  • “Pem SageMaker buatan Server Pelacakan Gagal”

  • “Pem SageMaker baruan Server Pelacakan”

  • “Pel SageMaker acakan Server Diperbarui”

  • “Pel SageMaker acakan Pembaruan Server Gagal”

  • “Mengh SageMaker apus Pelacakan Server”

  • “Pel SageMaker acakan Server Dihapus”

  • “Pengh SageMaker apusan Pelacakan Server Gagal”

  • “Pel SageMaker acakan Server Mulai”

  • “Pel SageMaker acakan Server Dimulai”

  • “Pel SageMaker acakan Server Mulai Gagal”

  • “Pel SageMaker acakan Server Menghentikan”

  • “Pel SageMaker acakan Server Hentikan”

  • “Pel SageMaker acakan Server Berhenti Gagal”

  • “Pel SageMaker acakan Pemeliharaan Server Sedang Berlangsung”

  • “Pel SageMaker acakan Pemeliharaan Server Selesai”

  • “Pel SageMaker acakan Pemeliharaan Server Gagal”

  • “J SageMaker alankan Pembuatan Server Pelacakan MLFlow”

  • “Pem SageMaker buatan Server Pelacakan MLFlow” RegisteredModel

  • “Pem SageMaker buatan Server Pelacakan MLFlow” ModelVersion

  • “T SageMaker ahap Transisi Server Pelacakan MLFlow” ModelVersion

  • “Peng SageMaker aturan Server Pelacakan MLFlow Alias Model Terdaftar”

Untuk informasi selengkap EventBridge nya, lihat Panduan EventBridge Pengguna Amazon .