View a markdown version of this page

Jalankan Pekerjaan Pemrosesan dengan Apache Spark - Amazon SageMaker AI

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Jalankan Pekerjaan Pemrosesan dengan Apache Spark

Apache Spark adalah mesin analitik terpadu untuk pemrosesan data skala besar. Amazon SageMaker AI menyediakan gambar Docker bawaan yang menyertakan Apache Spark dan dependensi lain yang diperlukan untuk menjalankan pekerjaan pemrosesan data terdistribusi. Berikut ini memberikan contoh tentang cara menjalankan pekerjaan Pemro SageMaker sesan Amazon menggunakan Apache Spark.

Dengan Amazon SageMaker Python SDK, Anda dapat dengan mudah menerapkan transformasi data dan mengekstrak fitur (rekayasa fitur) menggunakan kerangka kerja Spark. Untuk informasi tentang menggunakan SageMaker Python SDK untuk menjalankan tugas pemrosesan Spark, lihat Pem rosesan Data dengan Spark di Amazon SageMaker Python SDK.

Repositori kode yang berisi kode sumber dan Dockerfiles untuk gambar Spark tersedia di. GitHub

Anda dapat menggunakan sagemaker.spark.SparkJarProcessor kelas sagemaker.spark.PySparkProcessor or untuk menjalankan aplikasi Spark Anda di dalam pekerjaan pemrosesan. Catatan Anda dapat MaxRuntimeInSeconds mengatur batas waktu proses maksimum 5 hari. Sehubungan dengan waktu eksekusi, dan jumlah instance yang digunakan, beban kerja spark sederhana melihat hubungan yang hampir linier antara jumlah instance vs. waktu penyelesaian.

Contoh kode berikut menunjukkan cara menjalankan pekerjaan pemrosesan yang memanggil skrip Anda PySpark . preprocess.py

from sagemaker.core.spark.processing import PySparkProcessor spark_processor = PySparkProcessor( base_job_name="spark-preprocessor", framework_version="2.4", role=role, instance_count=2, instance_type="ml.m5.xlarge", max_runtime_in_seconds=1200, ) spark_processor.run( submit_app="preprocess.py", arguments=['s3_input_bucket', bucket, 's3_input_key_prefix', input_prefix, 's3_output_bucket', bucket, 's3_output_key_prefix', output_prefix], )

Untuk tampilan mendalam, lihat buku catatan contoh Pemrosesan Data Terdistribusi dengan Apache Spark dan Pemro SageMaker sesan.

Jika Anda tidak menggunakan Amazon SageMaker AI Python SDK dan salah satu kelas Prosesornya untuk mengambil gambar yang sudah dibuat sebelumnya, Anda dapat mengambil gambar-gambar ini sendiri. Gambar Doc SageMaker ker bawaan disimpan di Amazon Elastic Container Registry (Amazon ECR). Untuk daftar lengkap gambar Docker pra-build yang tersedia, lihat dokumen gambar yang tersedia.

Untuk mempelajari lebih lanjut tentang menggunakan SageMaker Python SDK dengan wadah Pemrosesan, lihat Amazon SageMaker AI Python SDK.