View a markdown version of this page

Ikhtisar pembelajaran mesin - Amazon Redshift

Amazon Redshift tidak akan lagi mendukung penggunaan Python UDF setelah 30 Juni 2026. Kami akan mulai menegakkannya secara bertahap. Untuk informasi lebih lanjut tentang detail opsi akhir masa pakai dan migrasi Python, lihat posting blog yang diterbitkan pada 30 Juni 2025.

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Ikhtisar pembelajaran mesin

Dengan Amazon Redshift, Anda dapat memanfaatkan kemampuan pembelajaran mesin untuk mendapatkan wawasan berharga dari data Anda. Ikhtisar Machine Learning (ML) ini menunjukkan cara menjelajahi, memvisualisasikan, dan mempersiapkan data Anda untuk pelatihan dan penerapan model ML. Bagian berikut akan memandu Anda melalui proses memanfaatkan Amazon Redshift ML untuk membuka potensi data Anda melalui pembelajaran mesin.

Dengan menggunakan Amazon Redshift ML, Anda dapat melatih model pembelajaran mesin menggunakan pernyataan SQL dan memanggilnya dalam kueri SQL untuk prediksi.

Untuk membantu Anda mempelajari cara menggunakan Amazon Redshift ML, Anda dapat menonton video berikut.

Untuk informasi tentang prasyarat untuk menyiapkan cluster Redshift atau kelompok kerja Tanpa Server, izin, dan kepemilikan untuk menggunakan Amazon Redshift ML, baca bagian berikut. Bagian ini juga menjelaskan cara kerja pelatihan dan prediksi sederhana di Amazon Redshift ML.

Bagaimana pembelajaran mesin dapat memecahkan masalah

Model pembelajaran mesin menghasilkan prediksi dengan menemukan pola dalam data pelatihan Anda dan kemudian menerapkan pola ini ke data baru. Dalam pembelajaran mesin, Anda melatih model-model ini dengan mempelajari pola-pola yang paling baik menjelaskan data Anda. Kemudian Anda menggunakan model untuk membuat prediksi (juga disebut kesimpulan) pada data baru. Pembelajaran mesin biasanya merupakan proses berulang di mana Anda dapat terus meningkatkan akurasi prediksi dengan mengubah parameter dan meningkatkan data pelatihan Anda. Jika data berubah, pelatihan ulang model baru dengan dataset baru terjadi.

Untuk mengatasi berbagai tujuan bisnis, ada pendekatan pembelajaran mesin fundamental yang berbeda.

Pembelajaran yang diawasi di Amazon Redshift ML

Amazon Redshift mendukung pembelajaran terawasi, yang merupakan pendekatan paling umum untuk analitik perusahaan tingkat lanjut. Pembelajaran yang diawasi adalah pendekatan pembelajaran mesin yang disukai ketika Anda memiliki kumpulan data yang mapan dan pemahaman tentang bagaimana data input spesifik memprediksi berbagai hasil bisnis. Hasil ini kadang-kadang disebut label. Secara khusus, dataset Anda adalah tabel dengan atribut yang terdiri dari fitur (input) dan target (output). Misalnya, Anda memiliki tabel yang menyediakan usia dan kode pos untuk pelanggan masa lalu dan sekarang. Misalkan Anda juga memiliki bidang “aktif” yang benar untuk pelanggan saat ini dan salah untuk pelanggan yang telah menangguhkan keanggotaan mereka. Tujuan pembelajaran mesin yang diawasi adalah untuk menemukan pola usia dan kode pos yang mengarah ke churn pelanggan, seperti yang diwakili oleh pelanggan yang targetnya “Salah.” Anda dapat menggunakan model ini untuk memprediksi pelanggan yang cenderung mengalami churn, seperti menangguhkan keanggotaan mereka, dan berpotensi menawarkan insentif retensi.

Amazon Redshift mendukung pembelajaran terawasi yang mencakup regresi, klasifikasi biner, dan klasifikasi multiclass. Regresi mengacu pada masalah memprediksi nilai berkelanjutan, seperti total pengeluaran pelanggan. Klasifikasi biner mengacu pada masalah memprediksi salah satu dari dua hasil, seperti memprediksi apakah pelanggan berubah atau tidak. Klasifikasi multiclass mengacu pada masalah memprediksi salah satu dari banyak hasil, seperti memprediksi item yang mungkin diminati pelanggan. Analis data dan ilmuwan data dapat menggunakannya untuk melakukan pembelajaran yang diawasi untuk mengatasi masalah mulai dari peramalan, personalisasi, atau prediksi churn pelanggan. Anda juga dapat menggunakan pembelajaran terawasi dalam masalah seperti prediksi penjualan mana yang akan ditutup, prediksi pendapatan, deteksi penipuan, dan prediksi nilai seumur hidup pelanggan.

Pembelajaran tanpa pengawasan di Amazon Redshift ML

Pembelajaran tanpa pengawasan menggunakan algoritma pembelajaran mesin untuk menganalisis dan mengelompokkan data pelatihan tanpa label. Algoritma menemukan pola atau pengelompokan tersembunyi. Tujuannya adalah untuk memodelkan struktur atau distribusi yang mendasari dalam data untuk mempelajari lebih lanjut tentang data.

Amazon Redshift mendukung algoritma K-Means pengelompokan untuk memecahkan masalah pembelajaran tanpa pengawasan. Algoritma ini memecahkan masalah pengelompokan di mana Anda ingin menemukan pengelompokan dalam data. K-Means Algoritma mencoba untuk menemukan pengelompokan diskrit dalam data. Data yang tidak diklasifikasikan dikelompokkan dan dipartisi berdasarkan persamaan dan perbedaannya. Dengan mengelompokkan, K-Means algoritma secara iteratif menentukan sentroid terbaik dan menetapkan setiap anggota ke sentroid terdekat. Anggota terdekat dengan centroid yang sama termasuk dalam kelompok yang sama. Anggota kelompok semirip mungkin dengan anggota lain dalam kelompok yang sama, dan seberbeda mungkin dari anggota kelompok lain. Misalnya, algoritma K-Means pengelompokan dapat digunakan untuk mengklasifikasikan kota yang terkena dampak pandemi atau mengklasifikasikan kota berdasarkan popularitas produk konsumen.

Saat menggunakan K-Means algoritma, Anda menentukan input k yang menentukan jumlah cluster yang akan ditemukan dalam data. Output dari algoritma ini adalah satu set k centroid. Setiap titik data milik salah satu kluster k yang paling dekat dengannya. Setiap cluster dijelaskan oleh sentroidnya. Centroid dapat dianggap sebagai rata-rata multi-dimensi cluster. K-Means Algoritma membandingkan jarak untuk melihat seberapa berbeda cluster satu sama lain. Jarak yang lebih besar umumnya menunjukkan perbedaan yang lebih besar antara cluster.

Pra-pemrosesan data penting K-Means, karena memastikan bahwa fitur model tetap pada skala yang sama dan menghasilkan hasil yang dapat diandalkan. Amazon Redshift mendukung beberapa K-Means preprosesor untuk pernyataan CREATE MODEL, seperti, StandardScaler MinMax, dan. NumericPassthrough Jika Anda tidak ingin menerapkan prapemrosesan apa pun K-means, pilih NumericPassthrough secara eksplisit sebagai transformator. Untuk informasi selengkapnya tentang K-Means parameter, lihatBUAT MODEL dengan K-MEANS parameter.

Untuk membantu Anda mempelajari cara melakukan pelatihan tanpa pengawasan dengan K-Means pengelompokan, Anda dapat menonton video berikut.

Syarat dan konsep untuk Amazon Redshift ML

Istilah-istilah berikut digunakan untuk menggambarkan beberapa konsep Amazon Redshift ML:

  • Pembelajaran mesin di Amazon Redshift melatih model dengan satu perintah SQL. Amazon Redshift ML dan Amazon SageMaker AI mengelola semua konversi data, izin, penggunaan sumber daya, dan penemuan model yang tepat.

  • Pelatihan adalah fase ketika Amazon Redshift membuat model pembelajaran mesin dengan menjalankan subset data tertentu ke dalam model. Amazon Redshift secara otomatis meluncurkan pekerjaan pelatihan di Amazon SageMaker AI dan menghasilkan model.

  • Prediksi (juga disebut inferensi) adalah penggunaan model dalam kueri Amazon Redshift SQL untuk memprediksi hasil. Pada waktu inferensi, Amazon Redshift menggunakan fungsi prediksi berbasis model sebagai bagian dari kueri yang lebih besar untuk menghasilkan prediksi. Prediksi dihitung secara lokal, di cluster Redshift, sehingga memberikan throughput tinggi, latensi rendah, dan nol biaya tambahan.

  • Dengan membawa model Anda sendiri (BYOM), Anda dapat menggunakan model yang dilatih di luar Amazon Redshift dengan Amazon SageMaker AI untuk inferensi dalam database secara lokal di Amazon Redshift. Amazon Redshift ML mendukung penggunaan BYOM dalam inferensi lokal.

  • Inferensi lokal digunakan ketika model dilatih sebelumnya di Amazon SageMaker AI, dikompilasi oleh Amazon SageMaker AI Neo, dan dilokalkan di Amazon Redshift ML. Untuk mengimpor model yang didukung untuk inferensi lokal ke Amazon Redshift, gunakan perintah CREATE MODEL. Amazon Redshift mengimpor model SageMaker AI yang telah dilatih sebelumnya dengan memanggil Amazon SageMaker AI Neo. Anda mengkompilasi model di sana dan mengimpor model yang dikompilasi ke Amazon Redshift. Gunakan inferensi lokal untuk kecepatan yang lebih cepat dan biaya yang lebih rendah.

  • Inferensi jarak jauh digunakan saat Amazon Redshift memanggil titik akhir model yang digunakan di AI. SageMaker Inferensi jarak jauh memberikan fleksibilitas untuk memanggil semua jenis model khusus dan model pembelajaran mendalam, seperti TensorFlow model yang Anda buat dan gunakan di Amazon SageMaker AI.

Yang juga penting adalah sebagai berikut:

  • Amazon SageMaker AI adalah layanan pembelajaran mesin yang dikelola sepenuhnya. Dengan Amazon SageMaker AI, ilmuwan dan pengembang data dapat dengan mudah membangun, melatih, dan langsung menerapkan model ke lingkungan yang siap produksi yang dihosting. Untuk informasi tentang Amazon SageMaker AI, lihat Apa itu Amazon SageMaker AI di Panduan Pengembang SageMaker AI Amazon.

  • Amazon SageMaker AI Autopilot adalah kumpulan fitur yang secara otomatis melatih dan menyetel model pembelajaran mesin terbaik untuk klasifikasi atau regresi, berdasarkan data Anda. Anda mempertahankan kontrol penuh dan visibilitas. Amazon SageMaker AI Autopilot mendukung data input dalam format tabular. Amazon SageMaker AI Autopilot menyediakan pembersihan dan prapemrosesan data otomatis, pemilihan algoritma otomatis untuk regresi linier, klasifikasi biner, dan klasifikasi multiclass. Ini juga mendukung optimasi hyperparameter otomatis (HPO), pelatihan terdistribusi, instance otomatis, dan pemilihan ukuran cluster. Untuk informasi tentang Amazon SageMaker AI Autopilot, lihat Men gotomatiskan pengembangan model dengan Amazon SageMaker AI Autopilot di Panduan Pengembang AI Amazon SageMaker .

  • Amazon Bedrock adalah layanan yang dikelola sepenuhnya yang menawarkan pilihan model dasar (FM) berkinerja tinggi dari perusahaan AI terkemuka seperti AI21 Labs, Anthropic, Cohere, Meta, Mistral AI, Stability AI, dan Amazon melalui satu API, bersama dengan serangkaian kemampuan yang diperlukan untuk membangun aplikasi AI generatif.