View a markdown version of this page

Apache Spark - Amazon EMR

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Apache Spark

Apache Spark adalah kerangka kerja pemrosesan terdistribusi dan model pemrograman yang membantu Anda melakukan pembelajaran mesin, pemrosesan aliran, atau analisis grafik dengan cluster Amazon EMR. Mirip dengan Apache Hadoop, Spark merupakan sistem pemrosesan terdistribusi sumber terbuka, yang biasa digunakan untuk beban kerja big data. Namun, Spark memiliki beberapa perbedaan penting dari Hadoop MapReduce. Spark memiliki dioptimalkan diarahkan asiklik mesin eksekusi graf (DAG) dan aktif cache data dalam memori, yang dapat meningkatkan kinerja, terutama untuk algoritma tertentu dan query interaktif.

Spark native mendukung aplikasi yang ditulis dalam Scala, Python, dan Java. Ini juga mencakup beberapa pustaka yang terintegrasi erat untuk SQL (Spark), pembelajaran mesin (MLLib), pemrosesan aliran (Spark streaming), dan pemrosesan grafik (GraphX). Alat-alat ini membuatnya lebih mudah untuk memanfaatkan kerangka Spark untuk berbagai kasus penggunaan.

Anda dapat menginstal Spark pada cluster Amazon EMR bersama dengan aplikasi Hadoop lainnya, dan juga dapat memanfaatkan sistem file Amazon EMR (EMRFS) untuk mengakses data secara langsung di Amazon S3. Hive juga terintegrasi dengan Spark sehingga Anda dapat menggunakan HiveContext objek untuk menjalankan skrip Hive menggunakan Spark. Sebuah konteks Hive termasuk dalam percikan-shell sebagai sqlContext.

Untuk contoh tutorial tentang menyiapkan cluster EMR dengan Spark dan menganalisis kumpulan data sampel, lihat Tutorial: Memulai dengan Amazon EMR di blog AWS Berita.

Anda dapat menggunakan Agen Pemecahan Masalah Apache Spark untuk memecahkan masalah aplikasi Apache Spark pada EMR di EC2, Amazon EMR Serverless, dan EMR di EKS. Untuk mempelajari selengkapnya, lihat Apa itu Agen Pemecahan Masalah Apache Spark untuk Amazon EMR dan AWS Lem.

penting

Apache Spark versi 2.3.1, tersedia mulai dengan rilis Amazon EMR 5.16.0, alamat dan. CVE-2018-8024 CVE-2018-1334 Kami merekomendasikan Anda memigrasi versi Spark sebelumnya ke Spark versi 2.3.1 atau versi yang lebih baru.

Tabel berikut mencantumkan versi Spark yang termasuk dalam rilis terbaru seri Amazon EMR 7.x, bersama dengan komponen yang diinstal Amazon EMR dengan Spark.

Untuk versi komponen yang diinstal dengan Spark dalam rilis ini, lihat Versi Komponen Rilis 7.13.0.

Informasi versi Spark untuk emr-7.13.0
Label Rilis Amazon EMR Versi Spark Komponen Dipasang Dengan Spark

emr-7.13.0

Spark 3.5.6-amzn-2

delta, emrfs, emr-goodies, emr-ddb, emr-s3-select, hadoop-client, hadoop-hdfs-datanode, hadoop-hdfs-library, hadoop-hdfs-namenode, hadoop-hdfs-zkfc, hadoop-httpfs-server, hadoop-kms-server, hadoop-yarn-nodemanager, hadoop-yarn-resourcemanager, hadoop-yarn-timeline-server, hudi, hudi-spark, iceberg, livy-server, nginx, r, spark-client, spark-history-server, spark-on-yarn, spark-yarn-slave

Tabel berikut mencantumkan versi Spark yang termasuk dalam rilis terbaru seri Amazon EMR 6.x, bersama dengan komponen yang diinstal Amazon EMR dengan Spark.

Untuk versi komponen yang diinstal dengan Spark dalam rilis ini, lihat Versi Komponen Rilis 6.15.0.

Informasi versi Spark untuk emr-6.15.0
Label Rilis Amazon EMR Versi Spark Komponen Dipasang Dengan Spark

emr-6.15.0

Spark 3.4.1-amzn-2

aws-sagemaker-spark-sdk, delta, emrfs, emr-goodies, emr-ddb, emr-s3-select, hadoop-client, hadoop-hdfs-datanode, hadoop-hdfs-library, hadoop-hdfs-namenode, hadoop-httpfs-server, hadoop-kms-server, hadoop-yarn-nodemanager, hadoop-yarn-resourcemanager, hadoop-yarn-timeline-server, hudi, hudi-spark, iceberg, livy-server, nginx, r, spark-client, spark-history-server, spark-on-yarn, spark-yarn-slave

catatan

Amazon EMR rilis 6.8.0 hadir dengan Apache Spark 3.3.0. Rilis Spark ini menggunakan Apache Log4j 2 dan log4j2.properties file untuk mengkonfigurasi Log4j dalam proses Spark. Jika Anda menggunakan Spark di cluster atau membuat cluster EMR dengan parameter konfigurasi khusus, dan Anda ingin memutakhirkan ke Amazon EMR rilis 6.8.0, Anda harus bermigrasi ke klasifikasi spark-log4j2 konfigurasi baru dan format kunci untuk Apache Log4j 2. Untuk informasi selengkapnya, lihat Migrasi dari Apache Log4j 1.x ke Log4j 2.x.

Tabel berikut mencantumkan versi Spark yang termasuk dalam rilis terbaru seri Amazon EMR 5.x, bersama dengan komponen yang diinstal Amazon EMR dengan Spark.

Untuk versi komponen yang diinstal dengan Spark dalam rilis ini, lihat Versi Komponen Rilis 5.36.2.

Informasi versi Spark untuk emr-5.36.2
Label Rilis Amazon EMR Versi Spark Komponen Dipasang Dengan Spark

emr-5.36.2

Spark 2.4.8-amzn-2

aws-sagemaker-spark-sdk, emrfs, emr-goodies, emr-ddb, emr-s3-select, hadoop-client, hadoop-hdfs-datanode, hadoop-hdfs-library, hadoop-hdfs-namenode, hadoop-httpfs-server, hadoop-kms-server, hadoop-yarn-nodemanager, hadoop-yarn-resourcemanager, hadoop-yarn-timeline-server, hudi, hudi-spark, livy-server, nginx, r, spark-client, spark-history-server, spark-on-yarn, spark-yarn-slave