Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Jalankan Pekerjaan Pemrosesan dengan Apache Spark
Apache Spark adalah mesin analitik terpadu untuk pemrosesan data skala besar. Amazon SageMaker AI menyediakan gambar Docker bawaan yang menyertakan Apache Spark dan dependensi lain yang diperlukan untuk menjalankan pekerjaan pemrosesan data terdistribusi. Berikut ini memberikan contoh tentang cara menjalankan pekerjaan Pemro SageMaker sesan Amazon menggunakan Apache Spark.
Dengan Amazon SageMaker Python SDK
Repositori kode yang berisi kode sumber dan Dockerfiles untuk gambar Spark tersedia di. GitHub
Anda dapat menggunakan sagemaker.spark.SparkJarProcessorsagemaker.spark.PySparkProcessor
Contoh kode berikut menunjukkan cara menjalankan pekerjaan pemrosesan yang memanggil skrip Anda PySpark . preprocess.py
from sagemaker.core.spark.processing import PySparkProcessor spark_processor = PySparkProcessor( base_job_name="spark-preprocessor", framework_version="2.4", role=role, instance_count=2, instance_type="ml.m5.xlarge", max_runtime_in_seconds=1200, ) spark_processor.run( submit_app="preprocess.py", arguments=['s3_input_bucket', bucket, 's3_input_key_prefix', input_prefix, 's3_output_bucket', bucket, 's3_output_key_prefix', output_prefix], )
Untuk tampilan mendalam, lihat buku catatan contoh Pemrosesan Data Terdistribusi dengan Apache Spark dan Pemro SageMaker sesan
Jika Anda tidak menggunakan Amazon SageMaker AI Python SDK
Untuk mempelajari lebih lanjut tentang menggunakan SageMaker Python SDK dengan wadah Pemrosesan, lihat Amazon SageMaker AI Python SDK