View a markdown version of this page

Membuat eksperimen Regresi atau Klasifikasi Autopilot untuk data tabular menggunakan UI Studio Classic - Amazon SageMaker AI

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Membuat eksperimen Regresi atau Klasifikasi Autopilot untuk data tabular menggunakan UI Studio Classic

penting

Pada 30 November 2023, UI Autopilot bermigrasi ke Amazon SageMaker Canvas sebagai bagian dari pengalaman Amazon SageMaker Studio yang diperbarui. SageMaker Canvas menyediakan kemampuan tanpa kode bagi analis dan ilmuwan data warga untuk tugas-tugas seperti persiapan data, rekayasa fitur, pemilihan algoritma, pelatihan dan penyetelan, inferensi, dan banyak lagi. Pengguna dapat memanfaatkan visualisasi bawaan dan analisis bagaimana jika untuk mengeksplorasi data mereka dan skenario yang berbeda, dengan prediksi otomatis yang memungkinkan mereka untuk memproduksikan model mereka dengan mudah. Canvas mendukung berbagai kasus penggunaan, termasuk visi komputer, perkiraan permintaan, pencarian cerdas, dan AI generatif.

Pengguna Amazon SageMaker Studio Classic, pengalaman Studio sebelumnya, dapat terus menggunakan UI Autopilot di Studio Classic. Pengguna dengan pengalaman pengkodean dapat terus menggunakan semua referensi API di SDK yang didukung untuk implementasi teknis.

Jika Anda telah menggunakan Autopilot di Studio Classic sampai sekarang dan ingin bermigrasi ke SageMaker Canvas, Anda mungkin harus memberikan izin tambahan ke profil pengguna atau peran IAM Anda sehingga Anda dapat membuat dan menggunakan aplikasi Canvas. SageMaker Untuk informasi selengkapnya, lihat (Opsional) Migrasi dari Autopilot di Studio Classic ke Canvas SageMaker.

Semua UI-related instruksi dalam panduan ini berkaitan dengan fitur mandiri Autopilot sebelum bermigrasi ke Amazon Canvas. SageMaker Pengguna yang mengikuti petunjuk ini harus menggunakan Studio Classic.

Anda dapat menggunakan UI Amazon SageMaker Studio Classic untuk membuat eksperimen Autopilot untuk masalah klasifikasi atau regresi pada data tabular. UI membantu Anda menentukan nama eksperimen, menyediakan lokasi untuk data input dan output, dan menentukan data target mana yang akan diprediksi. Secara opsional, Anda juga dapat menentukan jenis masalah yang ingin Anda pecahkan (regresi, klasifikasi, klasifikasi multiclass), pilih strategi pemodelan Anda (ansambel bertum puk atau optimasi hyperparameter), pilih daftar algoritma yang digunakan oleh pekerjaan Autopilot untuk melatih data, dan banyak lagi.

UI memiliki deskripsi, sakelar sakelar, menu dropdown, tombol radio, dan banyak lagi untuk membantu Anda menavigasi membuat kandidat model Anda. Setelah percobaan berjalan, Anda dapat membandingkan uji coba dan mempelajari detail langkah-langkah pra-pemrosesan, algoritma, dan rentang hyperparameter dari setiap model. Secara opsional, Anda dapat mengunduh laporan penjelasan dan kinerja mereka. Gunakan buku catatan yang disediakan untuk melihat hasil eksplorasi data otomatis atau definisi model kandidat.

Atau, Anda dapat menggunakan Autopilot AutoML API di. Buat Pekerjaan Regresi atau Klasifikasi untuk Data Tabular Menggunakan API AutoML

Untuk membuat eksperimen Autopilot menggunakan UI Studio Classic
  1. Masuk di https://console.aws.amazon.com/sagemaker/, pilih Studio dari panel navigasi kiri, pilih Domain dan profil pengguna Anda, lalu Buka Studio.

  2. Di Studio, pilih ikon Studio Classic di panel navigasi kiri atas. Ini membuka aplikasi Studio Classic.

  3. Jalankan atau buka aplikasi Studio Classic dari ruang pilihan Anda, atau Buat ruang Studio Classic. . Pada tab Beranda, pilih kartu AutoML. Ini membuka tab AutoML baru.

  4. Pilih Buat eksperimen AutoML. Ini membuka tab Buat eksperimen baru.

  5. Di bagian Percobaan dan detail data, masukkan informasi berikut:

    1. Nama percobaan — Harus unik untuk akun Anda saat ini Wilayah AWS dan berisi maksimal 63 karakter alfanumerik. Dapat menyertakan tanda hubung (-) tetapi tidak spasi.

    2. Input data — Menyediakan lokasi bucket Amazon Simple Storage Service (Amazon S3) dari data input Anda. Bucket S3 ini harus ada di Anda saat ini Wilayah AWS. URL harus dalam s3:// format di mana Amazon SageMaker AI memiliki izin menulis. File harus dalam format CSV atau Parquet dan berisi setidaknya 500 baris. Pilih Browse untuk menelusuri jalur yang tersedia dan Prat injau untuk melihat contoh data input Anda.

    3. Apakah input S3 Anda adalah file manifes? — File manifes menyertakan metadata dengan data input Anda. Metadata menentukan lokasi data Anda di Amazon S3. Ini juga menentukan bagaimana data diformat dan atribut mana dari dataset yang akan digunakan saat melatih model Anda. Anda dapat menggunakan file manifes sebagai alternatif untuk pra-pemrosesan saat data berlabel sedang dialirkan dalam Pipe mode.

    4. Membagi data secara otomatis? — Autopilot dapat membagi data Anda menjadi pemisahan 80-20% untuk data pelatihan dan validasi. Jika Anda lebih suka pemisahan khusus, Anda dapat memilih T entukan rasio pemisahan. Untuk menggunakan kumpulan data khusus untuk validasi, pilih Men yediakan kumpulan validasi.

    5. Lokasi data keluaran (bucket S3) — Nama lokasi bucket S3 tempat Anda ingin menyimpan data keluaran. URL untuk bucket ini harus dalam format Amazon S3 di mana Amazon SageMaker AI memiliki izin menulis. Bucket S3 harus dalam arus Wilayah AWS. Autopilot juga dapat membuat ini untuk Anda di lokasi yang sama dengan data input Anda.

  6. Pilih Berikutnya: Target dan fitur. Tab Target dan fitur terbuka.

  7. Di bagian Target dan fitur:

    • Pilih kolom yang akan ditetapkan sebagai target prediksi model.

    • Secara opsional, Anda dapat meneruskan nama kolom bobot sampel di bagian Berat sampel untuk meminta baris dataset Anda ditimbang selama pelatihan dan evaluasi. Untuk informasi selengkapnya tentang metrik tujuan yang tersedia, lihatMetrik tertimbang autopilot.

      catatan

      Dukungan untuk bobot sampel hanya tersedia dalam mode ansambel.

    • Anda juga dapat memilih fitur untuk pelatihan dan mengubah tipe datanya. Jenis data berikut tersedia:Text,,Numerical, CategoricalDatetime,Sequence, danAuto. Semua fitur dipilih secara default.

  8. Pilih Berikutnya: Metode pelatihan. Tab Metode Pel atihan terbuka.

  9. Di bagian Metode pelatihan, pilih opsi pelatihan Anda: Ensembling, Optimasi Hyperparameter (HPO), atau Otomatis untuk membiarkan Autopilot memilih metode pelatihan secara otomatis berdasarkan ukuran dataset. Setiap mode pelatihan menjalankan serangkaian algoritma yang telah ditentukan sebelumnya pada dataset Anda untuk melatih kandidat model. Secara default, Autopilot memilih semua algoritma yang tersedia untuk mode pelatihan yang diberikan. Anda dapat menjalankan eksperimen pelatihan Autopilot dengan semua algoritma atau memilih subset Anda sendiri.

    Untuk informasi selengkapnya tentang mode pelatihan dan algoritma yang tersedia, lihat bagian mode pelatihan Autopilot di halaman Mode dan algoritma https://docs.aws.amazon.com/sagemaker/latest/dg/autopilot-model-support-validation.html pelatihan.

  10. Pilih Berikutnya: Pengaturan penerapan dan lanj utan untuk membuka tab Deployment and advanced settings. Pengaturan mencakup nama titik akhir tampilan otomatis, jenis masalah pembelajaran mesin, dan pilihan tambahan untuk menjalankan eksperimen Anda.

    1. Pengaturan pener apan — Autopilot dapat secara otomatis membuat titik akhir dan menerapkan model Anda untuk Anda.

      Untuk menerapkan secara otomatis ke titik akhir yang dibuat secara otomatis, atau untuk memberikan nama titik akhir untuk penerapan khusus, setel sakelar ke Ya di bawah Penerapan otomatis? Jika Anda mengimpor data dari Amazon SageMaker Data Wrangler, Anda memiliki opsi tambahan untuk menerapkan model terbaik secara otomatis dengan atau tanpa transformasi dari Data Wrangler.

      catatan

      Jika alur Data Wrangler Anda berisi operasi multi-baris sepertigroupby,, atau joinconcatenate, Anda tidak dapat menerapkan secara otomatis dengan transformasi ini. Untuk informasi selengkapnya, lihat Mel atih Model Secara Otomatis pada Alur Data Anda.

    2. Pengaturan lanjutan (opsional) — Autopilot menyediakan kontrol tambahan untuk mengatur parameter eksperimental secara manual seperti menentukan jenis masalah Anda, batasan waktu pada pekerjaan dan uji coba Autopilot Anda, keamanan, dan pengaturan enkripsi.

      catatan

      Autopilot mendukung pengaturan nilai default untuk menyederhanakan konfigurasi eksperimen Autopilot menggunakan Studio Classic UI. Administrator dapat menggunakan konfigurasi siklus hidup Studio Classic (LCC) untuk mengatur nilai infrastruktur, jaringan, dan keamanan dalam file konfigurasi dan melakukan pra-pengisian setelan lanjutan pekerjaan. AutoML

      Untuk mempelajari cara administrator dapat mengotomatiskan penyesuaian eksperimen Autopilot, lihat. Konfigurasikan parameter default percobaan Autopilot (untuk administrator)

      1. Jenis masalah pembelajaran mesin — Autopilot dapat secara otomatis menyimpulkan jenis masalah pembelajaran yang diawasi dari dataset Anda. Jika Anda lebih suka memilihnya secara manual, Anda dapat menggunakan menu tarik-turun Pilih jenis masalah pembelajaran mesin. Perhatikan bahwa defaultnya adalah Auto. Dalam beberapa kasus, SageMaker AI tidak dapat menyimpulkan secara akurat. Ketika itu terjadi, Anda harus memberikan nilai agar pekerjaan berhasil. Secara khusus, Anda dapat memilih dari jenis berikut:

        • Klasi fikasi biner menetapkan data input ke salah satu dari dua kelas yang telah ditentukan dan saling eksklusif, berdasarkan atributnya, seperti diagnosis medis berdasarkan hasil tes diagnostik yang menentukan apakah seseorang memiliki penyakit.

        • Regresi — Regresi menetapkan hubungan antara variabel input (juga dikenal sebagai variabel atau fitur independen) dan variabel target (juga dikenal sebagai variabel dependen). Hubungan ini ditangkap melalui fungsi atau model matematika yang memetakan variabel input ke output kontinu. Ini biasanya digunakan untuk tugas-tugas seperti memprediksi harga rumah berdasarkan fitur seperti luas persegi dan jumlah kamar mandi, tren pasar saham, atau memperkirakan angka penjualan.

        • Klasifikasi Multiclass — Klasifikasi Multiclass menetapkan data input ke salah satu dari beberapa kelas berdasarkan atributnya, seperti prediksi topik yang paling relevan dengan dokumen teks, seperti politik, keuangan, atau filsafat.

      2. Runtime — Anda dapat menentukan batas waktu maksimum. Setelah mencapai batas waktu, uji coba dan pekerjaan yang melebihi batasan waktu secara otomatis berhenti.

      3. Ak ses — Anda dapat memilih peran yang diasumsikan Amazon SageMaker Studio Classic untuk mendapatkan akses sementara Layanan AWS (khususnya, SageMaker AI dan Amazon S3) atas nama Anda. Jika tidak ada peran yang ditentukan secara eksplisit, Studio Classic secara otomatis menggunakan peran eksekusi SageMaker AI default yang dilampirkan ke profil pengguna Anda.

      4. Enkripsi — Untuk meningkatkan keamanan data Anda saat diam dan melindunginya dari akses yang tidak sah, Anda dapat menentukan kunci enkripsi untuk mengenkripsi data di bucket Amazon S3 Anda dan di volume Amazon Elastic Block Store (Amazon EBS) yang terpasang ke domain Studio Classic Anda.

      5. Keamanan — Anda dapat memilih cloud pribadi virtual (Amazon VPC) tempat pekerjaan SageMaker AI Anda berjalan. Pastikan Amazon VPC memiliki akses ke bucket Amazon S3 input dan output Anda.

      6. Proyek — Tentukan nama proyek SageMaker AI untuk dikaitkan dengan eksperimen Autopilot ini dan keluaran model. Saat Anda menentukan proyek, Autopilot menandai proyek ke eksperimen. Ini memungkinkan Anda mengetahui output model mana yang terkait dengan proyek ini.

      7. Tag — Tag adalah array pasangan kunci-nilai. Gunakan tag untuk mengkategorikan sumber daya Anda Layanan AWS, seperti tujuan, pemilik, atau lingkungannya.

    3. Pilih Berikutnya: Tinjau dan buat untuk mendapatkan ringkasan eksperimen Autopilot Anda sebelum Anda membuatnya.

  11. Pilih Buat eksperimen. Pembuatan eksperimen memulai pekerjaan Autopilot di SageMaker AI. Autopilot memberikan status percobaan, informasi tentang proses eksplorasi data dan kandidat model dalam buku catatan, daftar model yang dihasilkan dan laporannya, dan profil pekerjaan yang digunakan untuk membuatnya.

    Untuk informasi tentang buku catatan yang dihasilkan oleh pekerjaan Autopilot, lihat. Notebook autopilot dihasilkan untuk mengelola tugas AutoML Untuk informasi tentang detail setiap kandidat model dan laporannya, lihat Lihat detail model danLihat laporan kinerja model Autopilot.

catatan

Untuk menghindari biaya yang tidak perlu: Jika Anda menerapkan model yang tidak lagi diperlukan, hapus titik akhir dan sumber daya yang dibuat selama penerapan tersebut. Informasi tentang harga instans berdasarkan Wilayah tersedia di Amazon Pr SageMaker icing.