Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Apache Spark
Apache Spark
Spark supporta applicazioni scritte in Scala, Python e Java a livello nativo. Include anche diverse librerie strettamente integrate per SQL (Spark
Puoi installare Spark su un cluster Amazon EMR insieme ad altre applicazioni Hadoop. Questa soluzione consente inoltre l'utilizzo del file system Amazon EMR (EMRFS) per accedere direttamente ai dati in Amazon S3. Hive è inoltre integrato con Spark in modo da poter utilizzare un HiveContext oggetto per eseguire script Hive utilizzando Spark. Un contesto Hive è incluso nella shell di Spark come sqlContext.
Per un esempio di tutorial sulla configurazione di un cluster EMR con Spark e sull'analisi di un set di dati di esempio, consulta Tutorial: Getting started with Amazon EMR nel blog News. AWS
Puoi utilizzare Apache Spark Troubleshooting Agent per risolvere i problemi delle tue applicazioni Apache Spark su EMR su EC2, Amazon EMR Serverless ed EMR su EKS. Per ulteriori informazioni, consulta Cos'è Apache Spark Troubleshooting Agent per Amazon EMR e AWS Aderenza.
Importante
Apache Spark versione 2.3.1, disponibile a partire dalla versione 5.16.0 di Amazon EMR, indirizzi e. CVE-2018-8024
La seguente tabella indica la versione di Spark inclusa nell'ultimo rilascio della serie Amazon EMR 7.x insieme ai componenti che Amazon EMR installa con Spark.
Per la versione dei componenti installati con Spark in questa versione, consulta Versioni dei componenti della Release 7.13.0. Amazon EMR versione 7.13.0
| Etichetta di rilascio di Amazon EMR | Versione di Spark | Componenti installati con Spark |
|---|---|---|
emr-7.13.0 |
Spark 3.5.6-amzn-2 |
delta, emrfs, emr-goodies, emr-ddb, emr-s3-select, hadoop-client, hadoop-hdfs-datanode, hadoop-hdfs-library, hadoop-hdfs-namenode, hadoop-hdfs-zkfc, hadoop-httpfs-server, hadoop-kms-server, hadoop-yarn-nodemanager, hadoop-yarn-resourcemanager, hadoop-yarn-timeline-server, hudi, hudi-spark, iceberg, livy-server, nginx, r, spark-client, spark-history-server, spark-on-yarn, spark-yarn-slave |
La seguente tabella indica la versione di Spark inclusa nell'ultimo rilascio della serie Amazon EMR 6.x insieme ai componenti che Amazon EMR installa con Spark.
Per la versione dei componenti installati con Spark in questo rilascio, consulta la sezione Versioni dei componenti del rilascio 6.15.0.
| Etichetta di rilascio di Amazon EMR | Versione di Spark | Componenti installati con Spark |
|---|---|---|
emr-6.15.0 |
Spark 3.4.1-amzn-2 |
aws-sagemaker-spark-sdk, delta, emrfs, emr-goodies, emr-ddb, emr-s3-select, hadoop-client, hadoop-hdfs-datanode, hadoop-hdfs-library, hadoop-hdfs-namenode, hadoop-httpfs-server, hadoop-kms-server, hadoop-yarn-nodemanager, hadoop-yarn-resourcemanager, hadoop-yarn-timeline-server, hudi, hudi-spark, iceberg, livy-server, nginx, r, spark-client, spark-history-server, spark-on-yarn, spark-yarn-slave |
Nota
Rilascio 6.8.0 di Amazon EMR con Spark per Apache 3.3.0. Questa versione di Spark utilizza Apache Log4j 2 e il file log4j2.properties per configurare Log4j nei processi Spark. Se utilizzi Spark nel cluster o crei cluster EMR con parametri di configurazione personalizzati e desideri eseguire l'aggiornamento alla versione 6.8.0 di Amazon EMR, devi migrare alla nuova classificazione della configurazione e formato chiave spark-log4j2 per Apache Log4j 2. Per ulteriori informazioni, consulta Migrazione da Apache Log4j 1.x a Log4j 2.x.
La seguente tabella indica la versione di Spark inclusa nell'ultimo rilascio della serie Amazon EMR 5.x insieme ai componenti che Amazon EMR installa con Spark.
Per la versione dei componenti installati con Spark in questa versione, vedi Versioni dei componenti della Release 5.36.2.
| Etichetta di rilascio di Amazon EMR | Versione di Spark | Componenti installati con Spark |
|---|---|---|
emr-5.36.2 |
Spark 2.4.8-amzn-2 |
aws-sagemaker-spark-sdk, emrfs, emr-goodies, emr-ddb, emr-s3-select, hadoop-client, hadoop-hdfs-datanode, hadoop-hdfs-library, hadoop-hdfs-namenode, hadoop-httpfs-server, hadoop-kms-server, hadoop-yarn-nodemanager, hadoop-yarn-resourcemanager, hadoop-yarn-timeline-server, hudi, hudi-spark, livy-server, nginx, r, spark-client, spark-history-server, spark-on-yarn, spark-yarn-slave |
Argomenti
Esecuzione di applicazioni Spark con Docker utilizzando Amazon EMR 6.x
Lavorare con una gerarchia multi-catalogo in AWS Incolla Data Catalog con Spark su Amazon EMR
Cos'è Apache Spark Troubleshooting Agent per Amazon EMR e AWS Aderenza
Utilizzo del connettore Amazon Kinesis Data Streams per lo streaming strutturato di Spark
Utilizzo dell'integrazione di Amazon Redshift per Apache Spark su Amazon EMR