View a markdown version of this page

Pemrosesan Fitur dengan Spark ML dan Scikit-learn - Amazon SageMaker AI

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Pemrosesan Fitur dengan Spark ML dan Scikit-learn

Sebelum melatih model dengan algoritma bawaan Amazon SageMaker AI atau algoritma khusus, Anda dapat menggunakan Spark dan preprocessor scikit-learn untuk mengubah data dan fitur insinyur Anda.

Pemrosesan Fitur dengan Spark ML

Anda dapat menjalankan tugas Spark ML dengan AWS Glu e, layanan ETL (ekstrak, ubah, muat) tanpa server, dari notebook SageMaker AI Anda. Anda juga dapat terhubung ke cluster EMR yang ada untuk menjalankan tugas Spark ML dengan Amazon EM R. Untuk melakukan ini, Anda memerlukan peran AWS Identity and Access Management (IAM) yang memberikan izin untuk melakukan panggilan dari buku catatan SageMaker AI Anda ke AWS Glue.

catatan

Untuk melihat versi Python dan Spark mana yang AWS Glue didukung, lihat Catatan AWS Rilis Glue.

Setelah fitur rekayasa, Anda mengemas dan membuat serial pekerjaan Spark ML dengan MLeap ke dalam wadah MLap yang dapat Anda tambahkan ke pipeline inferensi. Anda tidak perlu menggunakan cluster Spark yang dikelola secara eksternal. Dengan pendekatan ini, Anda dapat dengan mulus menskalakan dari sampel baris ke terabyte data. Transformator yang sama berfungsi untuk pelatihan dan inferensi, jadi Anda tidak perlu menduplikasi logika prapemrosesan dan rekayasa fitur atau mengembangkan solusi satu kali untuk membuat model bertahan. Dengan pipeline inferensi, Anda tidak perlu memelihara infrastruktur luar, dan Anda dapat membuat prediksi langsung dari input data.

Saat Anda menjalankan tugas Spark ML AWS Glue, pipeline Spark ML diserialkan ke dalam format mLeap. Kemudian, Anda dapat menggunakan pekerjaan dengan SparkML Model Serving Container di Pipeline Inferensi SageMaker AI. MLeap adalah format serialisasi dan mesin eksekusi untuk pipeline pembelajaran mesin. Ini mendukung Spark, Scikit-learn, dan TensorFlow untuk melatih pipeline dan mengekspornya ke pipeline serial yang disebut MLap Bundle. Anda dapat mendeserialisasi Bundel kembali ke Spark untuk penilaian mode batch atau ke runtime mLeap untuk mendukung layanan API real-time.

Untuk contoh yang menunjukkan cara menampilkan proses dengan Spark ML, lihat Mel atih Model ML menggunakan Apache Spark di Amazon EMR dan menerapkan di notebook sampel SageMaker AI.

Pemrosesan Fitur dengan Scikit-Learn

Anda dapat menjalankan dan mengemas tugas scikit-learn ke dalam wadah langsung di Amazon AI. SageMaker Untuk contoh kode Python untuk membangun model fiturizer scikit-learn yang melatih kumpulan data bunga Iris Fisher dan memprediksi spesies Iris berdasarkan pengukuran morfologi, lihat Pelatihan dan Prediksi IRIS dengan Sagemaker. Scikit-learn