View a markdown version of this page

AWS runtime per Apache Spark (emr-spark-8.1.0) - Amazon EMR

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

AWS runtime per Apache Spark (emr-spark-8.1.0)

Ciclo di vita supportato da emr-spark-8.1.0

Questa versione è designata come versione LTS (Long Term Support). La tabella seguente descrive le date del ciclo di vita supportate per Amazon EMR Spark 8.1.0.

Fase di supporto Data
Data di rilascio iniziale 8 settembre 2026
Supporto standard fino al 7 settembre 2029
Fine del ciclo di vita 8 settembre 2029

Versioni dell'applicazione emr-spark-8.1.0

Questa versione include le seguenti applicazioni: AmazonCloudWatchAgent,,,, Delta Hudi, Iceberg e. JupyterEnterpriseGateway Livy Spark

La seguente tabella elenca le versioni dell'applicazione disponibili in questo rilascio di Amazon EMR e quelle nei precedenti tre rilasci di Amazon EMR (quando applicabile).

Per la cronologia completa delle versioni dell'applicazione di ogni rilascio di Amazon EMR, fai riferimento ai seguenti argomenti:

Informazioni sulla versione dell'applicazione
emr-spark-8.1.0 emr-spark-8.0.0
AWS SDK per Java 2.44.52,41,32
Python 3.11, 3.133.11, 3.13
Scala 2.13.172,13,16
AmazonCloudWatchAgent1,300034.0-amzn-01,300032,2-amzn-0
Delta4.2.0-amzn-04.0.0-amzn-1-spark
Hudi1.1.1-amzn-01.1.0-amzn-0
Iceberg1.11.0-amzn-01.10.1-amzn-0
JupyterEnterpriseGateway2.6.02.6.0
Livy0.9.0-incubazione0.8.0-incubazione
Spark4.1.1-amzn-04.0.2-amzn-0

note di rilascio di emr-spark-8.1.0

Le seguenti note di rilascio includono informazioni per Amazon EMR release 8.1.0 (emr-spark-8.1.0), con Apache Spark 4.1.1.

Cosa c'è di nuovo

  • Apache Spark 4.1.1 — Amazon EMR Spark 8.1.0 include Apache Spark 4.1.1. Le dipendenze aggiornate includono Scala 2.13.17, Jackson 2.20.0 e Parquet-MR 1.16.0, insieme a nuove funzionalità di Spark, miglioramenti delle prestazioni e correzioni di bug.

  • Supporto delle specifiche Iceberg v3 per i carichi di lavoro Spark: Amazon EMR Spark 8.1.0 estende il supporto delle specifiche Iceberg v3 per i carichi di lavoro Spark. Questa versione aggiunge le seguenti funzionalità v3:

    • Tipi di dati geospaziali: le tabelle Iceberg v3 supportano i tipi di dati e. GEOMETRY GEOGRAPHY

    • Funzioni SQL geospaziali: Amazon EMR Spark 8.1.0 supporta nativamente le funzioni geospaziali per i carichi di lavoro Iceberg. Imposta spark.sql.geospatial.enabled su true nella configurazione di Spark per abilitare le funzioni geospaziali. Apache Spark 4.1 supporta solo SRID 0, 3857 e 4326. Sono supportate le seguenti funzioni:

      • st_area(geom)

      • st_asbinary(geo[, endianness])

      • st_collect(geoArray)

      • st_convexhull(geom)

      • st_distance(geom1, geom2)

      • st_dwithin(geom1, geom2, distance)

      • st_geogfromwkb(wkb)

      • st_geomfromwkb(wkb[, srid])

      • st_geomfromwkt(wkt[, srid])

      • st_intersection(geom1, geom2)

      • st_intersects(geom1, geom2)

      • st_length(geom)

      • st_makeline(geomArray)

      • st_setsrid(geo, srid)

      • st_srid(geo)

      • st_within(geom1, geom2)

      • st_x(point)

      • st_y(point)

    • Nanosecond-precision timestamp: le tabelle Iceberg v3 supportano colonne di timestamp con precisione nanosecondi (e). TIMESTAMP(9) TIMESTAMP_NTZ(9)

    • Distruzione delle varianti: le tabelle Iceberg v3 supportano la distruzione delle varianti.

    • UNKNOWNtipo di dati: le tabelle Iceberg v3 supportano il tipo di UNKNOWN dati per le colonne il cui tipo non è ancora definito. Le colonne di questo tipo sono opzionali, il valore predefinito è nullo e non vengono archiviate nei file di dati.

    • Valori predefiniti: le colonne Iceberg v3 supportano i valori predefiniti dichiarati, che si applicano quando un autore omette la colonna.

  • Supporto granulare esteso per il controllo degli accessi per i formati open table: Amazon EMR Spark 8.1.0 estende il supporto granulare di controllo degli accessi (FGAC) per i formati open table (OTF). Iceberg ora supporta FGAC per operazioni aggiuntive:,,, e. DESCRIBE TABLE SHOW TBLPROPERTIES SHOW CREATE TABLE ALTER TABLE table_name WRITE ORDERED BY ALTER TABLE table_name WRITE DISTRIBUTED BY Delta Lake ora supporta FGAC per l'operazione. VACUUM

  • Miglioramenti dell'aggiornamento incrementale per le viste materializzate di Iceberg: l'aggiornamento incrementale ora supporta le tabelle tramite l'acquisizione dei dati di modifica. Merge-on-Read Ciò consente aggiornamenti rapidi per i carichi di lavoro che utilizzano aggiornamenti ed eliminazioni. L'aggiornamento legge solo i file di dati interessati da una modifica, utilizzando le statistiche per file e per colonna a livello di manifesto.

  • Multi-format supporto multi-catalogo con individuazione automatica: le query SQL di Spark possono ora fare riferimento ai cataloghi per nome senza preregistrarli nella configurazione di Spark. I tipi di catalogo supportati includono cataloghi su più account e cataloghi federati S3 Tables, con rilevamento automatico dei formati di tabella Iceberg, Delta e Hudi. Per abilitare questa funzionalità, aggiungi la seguente configurazione Spark: "spark.sql.catalog.spark_catalog": "org.apache.spark.sql.connector.catalog.redirecting.RedirectingSessionCatalog", "spark.sql.catalogResolver": "com.amazonaws.glue.catalog.redirecting.GlueCatalogResolver"

Modifiche, miglioramenti e problemi risolti

  • Questa versione include correzioni di bug e miglioramenti delle funzionalità per Iceberg, Hudi e Delta. Per ulteriori informazioni, consulta la sezione Novità.

  • Migliore tolleranza alla verifica della crittografia del disco durante l'avvio del cluster: i cluster con crittografia del disco locale abilitata nella loro configurazione di sicurezza sono ora più tolleranti nei confronti dei ritardi transitori della connettività di rete durante l'avvio dell'istanza. Questa modifica riduce gli errori intermittenti di avvio del cluster.

  • Risolto il problema della gestione dei caratteri UTF-8 multibyte nelle configurazioni Amazon EMR: le configurazioni Amazon EMR ora supportano correttamente i caratteri multibyte. UTF-8 Ciò include valori con lettere accentate o caratteri non latini. Per ulteriori informazioni, consulta la sezione Configurazione delle applicazioni.

  • Maggiore affidabilità di avvio di Secret Agent: risolve due problemi che potevano causare errori di provisioning del cluster Amazon EMR relativi al servizio di sicurezza Secret Agent. La creazione del certificato ora attende che HDFS sia pronto per procedere e lo script di avvio ritenta il rilevamento del processo Java di Secret Agent. Insieme, queste modifiche riducono gli errori di avvio nei cluster con inizializzazione dello storage più lenta o istanze molto caricate.

Problemi noti e limitazioni

  • La crittografia nativa delle tabelle Apache Iceberg viene applicata solo quando si utilizza Hive Metastore o un catalogo REST Iceberg. Con il AWS Glue Data Catalog (incluso l'endpoint REST Iceberg) e il catalogo Hadoop, queste proprietà sono accettate ma non applicate. Di conseguenza, i dati vengono scritti in testo normale. Per crittografare i dati delle tabelle Iceberg a riposo con questi cataloghi, abilita la crittografia lato server di Amazon S3 con AWS KMS le chiavi (SSE-KMS) nella posizione Amazon S3 della tabella.

  • Le trasformazioni che richiedono più di un argomento non sono supportate per le tabelle Iceberg v3.

Versioni Java predefinite di emr-spark-8.1.0

ApplicazioneVersione Java/Amazon Corretto (l'impostazione predefinita è in grassetto)
Spark17, 21
Livy17, 11, 8
Hadoop17, 11, 8

Versioni dei componenti emr-spark-8.1.0

I componenti che Amazon EMR installa con questo rilascio sono elencati di seguito. Alcuni sono installati come parte di pacchetti di applicazione dei big data. Altri sono specifici per Amazon EMR e installati per processi e caratteristiche del sistema. In genere iniziano con o. emr aws Big-data i pacchetti applicativi nella versione più recente di Amazon EMR sono in genere l'ultima versione disponibile nella community. Mettiamo a disposizione i rilasci della community in Amazon EMR il più rapidamente possibile.

Alcuni componenti in Amazon EMR differiscono dalle versioni della community. Tali componenti hanno un'etichetta che indica la versione nel modulo CommunityVersion-amzn-EmrVersion. EmrVersion inizia da 0. Ad esempio, se un componente della community open source denominato myapp-component con versione 2.2 è stato modificato tre volte per essere incluso in rilasci diversi di Amazon EMR, tale versione di rilascio si presenta come 2.2-amzn-2.

Componente Versione Description
adot-java-agent1.31.0Un agente Java che raccoglie i parametri dai daemon delle applicazioni.
delta4.2.0-amzn-0Delta Lake è un formato a tabella aperta per set di dati analitici di grandissime dimensioni
emr-amazon-cloudwatch-agent1,300034.0-amzn-0Un'applicazione che raccoglie parametri interni a livello di sistema e parametri delle applicazioni personalizzati dalle istanze Amazon EC2.
emr-ddb6.1.0Connettore di Amazon DynamoDB per le applicazioni dell'ecosistema Hadoop.
emr-goodies3.23.0 - scintillaLibrerie utili per l'ecosistema Hadoop.
emr-notebook-env1.18.0Ambiente Conda per EMR Notebooks che include il gateway aziendale Jupyter
emr-s3-dist-cp2.46.0Applicazione di copia distribuita ottimizzata per Amazon S3.
hadoop-client3.4.2-amzn-3Client di riga di comando Hadoop, ad esempio "hdfs", "hadoop" o "yarn".
hadoop-hdfs-datanode3.4.2-amzn-3Servizio a livello di nodo HDFS per lo storage di blocchi.
hadoop-hdfs-library3.4.2-amzn-3Libreria e client di riga di comando HDFS
hadoop-hdfs-namenode3.4.2-amzn-3Servizio HDFS per tenere traccia dei nomi di file e delle posizioni dei blocchi.
hadoop-hdfs-zkfc3.4.2-amzn-3Servizio ZKFC per il tracciamento dei namenodes per la modalità HA.
hadoop-hdfs-journalnode3.4.2-amzn-3Servizio HDFS per gestire il giornale di registrazione del file system Hadoop su cluster HA.
hadoop-httpfs-server3.4.2-amzn-3Endpoint HTTP per le operazioni HDFS.
hadoop-kms-server3.4.2-amzn-3Server di gestione delle chiavi crittografiche basato sull'API di Hadoop. KeyProvider
hadoop-mapred3.4.2-amzn-3MapReduce librerie di motori di esecuzione per l'esecuzione di un'applicazione. MapReduce
hadoop-yarn-nodemanager3.4.2-amzn-3Servizio YARN per la gestione di container su un singolo nodo.
hadoop-yarn-resourcemanager3.4.2-amzn-3Servizio YARN per l'allocazione e la gestione delle risorse di cluster e delle applicazioni distribuite.
hadoop-yarn-timeline-server3.4.2-amzn-3Servizio per il recupero di informazioni correnti e della cronologia per applicazioni YARN.
hudi1.1.1-amzn-0Framework di elaborazione incrementale per alimentare la Data Pipeline a bassa latenza e alta efficienza.
hudi-spark1.1.1-amzn-0Libreria bundle per eseguire Spark con Hudi.
iceberg1.11.0-amzn-0Apache Iceberg è un formato a tabella aperta per enormi set di dati analitici
livy-server0.9.0-incubazioneInterfaccia REST per l'interazione con Apache Spark
nginx1.12.1nginx [motore x] è un server proxy inverso e HTTP
mariadb-server5.5.68+Server di database MariaDB.
nvidia-cuda12,5,0Driver Nvidia e kit di strumenti Cuda
r4.3.2The R Project for Statistical Computing
spark-client4.1.1-amzn-0Client a riga di comando Spark.
spark-history-server4.1.1-amzn-0Interfaccia utente Web per la visualizzazione di eventi registrati per la durata di un'applicazione Spark completata.
spark-on-yarn4.1.1-amzn-0In-memory motore di esecuzione per YARN.
spark-yarn-slave4.1.1-amzn-0Librerie Apache Spark necessarie per gli slave YARN.
spark-rapids26.04.2-amzn-0Plugin Nvidia Spark RAPIDS che accelera Apache Spark con GPU.
zookeeper-server3.9.3-amzn-8Servizio centralizzato per la manutenzione delle informazioni di configurazione, i servizi di denominazione, la sincronizzazione distribuita e l'erogazione di servizi di gruppo.
zookeeper-client3.9.3-amzn-8ZooKeeper client a riga di comando.

classificazioni di configurazione emr-spark-8.1.0

Le classificazioni di configurazione consentono di personalizzare le applicazioni. Esse corrispondono spesso a un file XML di configurazione per l'applicazione, ad esempio hive-site.xml. Per ulteriori informazioni, consulta Configurazione delle applicazioni.

Le azioni di riconfigurazione vengono eseguite quando si specifica una configurazione per gruppi di istanze in un cluster in esecuzione. Amazon EMR avvia solo le azioni di riconfigurazione per le classificazioni modificate. Per ulteriori informazioni, consulta Riconfigurazione di un gruppo di istanze in un cluster in esecuzione.

classificazioni emr-spark-8.1.0
Classificazioni Description Operazioni di riconfigurazione

capacity-scheduler

Modifica i valori nel file capacity-scheduler.xml di Hadoop.

Restarts the ResourceManager service.

container-executor

Modificare i valori nel file container-executor.cfg di Hadoop YARN.

Not available.

container-log4j

Modifica i valori nel file container-log4j.properties di Hadoop YARN.

Not available.

core-site

Modifica i valori nel file core-site.xml di Hadoop.

Restarts the Hadoop HDFS services Namenode, SecondaryNamenode, Datanode, ZKFC, and Journalnode. Restarts the Hadoop YARN services ResourceManager, NodeManager, ProxyServer, and TimelineServer. Additionally restarts Hadoop KMS, Hadoop Httpfs, and MapReduce-HistoryServer.

docker-conf

Modifica le impostazioni relative a docker.

Not available.

hadoop-env

Modifica i valori nell'ambiente Hadoop per tutti i componenti Hadoop.

Restarts the Hadoop HDFS services Namenode, SecondaryNamenode, Datanode, ZKFC, and Journalnode. Restarts the Hadoop YARN services ResourceManager, NodeManager, ProxyServer, and TimelineServer. Additionally restarts MapReduce-HistoryServer.

hadoop-log4j

Modifica i valori nel file log4j.properties di Hadoop.

Restarts the Hadoop HDFS services SecondaryNamenode, Datanode, and Journalnode. Restarts the Hadoop YARN services ResourceManager, NodeManager, ProxyServer, and TimelineServer. Additionally restarts Hadoop KMS, Hadoop Httpfs, and MapReduce-HistoryServer.

hadoop-ssl-server

Modifica la configurazione server ssl hadoop

Not available.

hadoop-ssl-client

Modifica la configurazione client ssl hadoop

Not available.

hdfs-encryption-zones

Configura le zone di crittografia HDFS.

This classification should not be reconfigured.

hdfs-env

Modifica i valori nell'ambiente HDFS.

Restarts Hadoop HDFS services Namenode, Datanode, and ZKFC.

hdfs-site

Modifica i valori nel file hdfs-site.xml di HDFS.

Restarts the Hadoop HDFS services Namenode, SecondaryNamenode, Datanode, ZKFC, and Journalnode. Additionally restarts Hadoop Httpfs.

httpfs-env

Modifica i valori nell'ambiente HTTPFS.

Restarts Hadoop Httpfs service.

httpfs-site

Modifica i valori nel file httpfs-site.xml di Hadoop.

Restarts Hadoop Httpfs service.

hadoop-kms-acls

Modifica i valori nel file kms-acls.xml di Hadoop.

Not available.

hadoop-kms-env

Modifica i valori nell'ambiente Hadoop KMS.

Restarts Hadoop-KMS service.

hadoop-kms-java-home

Modifica la home Java KMS di Hadoop

Not available.

hadoop-kms-log4j

Modifica i valori nel file kms-log4j.properties di Hadoop.

Not available.

hadoop-kms-site

Modifica i valori nel file kms-site.xml di Hadoop.

Restarts Hadoop-KMS.

hudi-env

Modifica i valori nell'ambiente Hudi.

Not available.

hudi-defaults

Modifica i valori nel file hudi-defaults.conf di Hudi.

Not available.

iceberg-defaults

Modifica i valori nel file iceberg-defaults.conf di Iceberg.

Not available.

delta-defaults

Modifica i valori nel file delta-defaults.conf di Delta.

Not available.

jupyter-notebook-conf

Modifica i valori nel file jupyter_notebook_config.py di Jupyter Notebook.

Not available.

jupyter-s3-conf

Configura la persistenza di S3 del notebook Jupyter.

Not available.

jupyter-sparkmagic-conf

Modifica i valori nel file config.json di Sparkmagic.

Not available.

livy-conf

Modifica i valori nel file livy.conf di Livy.

Restarts Livy Server.

livy-env

Modifica i valori nell'ambiente Livy.

Restarts Livy Server.

livy-log4j2

Modifica le impostazioni di log4j2.properties di Livy.

Restarts Livy Server.

mapred-env

Modificare i valori nell'ambiente dell'applicazione. MapReduce

Restarts Hadoop MapReduce-HistoryServer.

mapred-site

Modificare i valori nel file mapred-site.xml dell' MapReduce applicazione.

Restarts Hadoop MapReduce-HistoryServer.

spark

EMR-curated Impostazioni Amazon per Apache Spark.

This property modifies spark-defaults. See actions there.

spark-defaults

Modifica i valori nel file spark-defaults.conf di Spark.

Restarts Spark history server and Spark thrift server.

spark-env

Modifica i valori nell'ambiente Spark.

Restarts Spark history server and Spark thrift server.

spark-hive-site

Modifica i valori nel file hive-site.xml di Spark

Not available.

spark-log4j2

Modifica i valori nel file log4j2.properties di Spark.

Restarts Spark history server and Spark thrift server.

spark-metrics

Modifica i valori nel file metrics.properties di Spark.

Restarts Spark history server and Spark thrift server.

yarn-env

Modifica i valori nell'ambiente YARN.

Restarts the Hadoop YARN services ResourceManager, NodeManager, ProxyServer, and TimelineServer. Additionally restarts MapReduce-HistoryServer.

yarn-site

Modifica i valori nel file yarn-site.xml di YARN.

Restarts the Hadoop YARN services ResourceManager, NodeManager, ProxyServer, and TimelineServer. Additionally restarts Livy Server and MapReduce-HistoryServer.

zookeeper-config

Modifica i valori nel ZooKeeper file zoo.cfg.

Restarts Zookeeper server.

zookeeper-logback

Cambia i valori nel ZooKeeper file logback.xml.

Restarts Zookeeper server.

cloudwatch-logs

Configura l'integrazione dei CloudWatch log per i nodi del cluster EMR.

Not available.

emr-metrics

Modifica le impostazioni delle metriche emr per questo nodo.

Restarts the CloudWatchAgent service.

Registro delle modifiche di Amazon EMR Spark 8.1.0

Registro delle modifiche per Amazon EMR Spark 8.1.0
DataEventDescription
08 settembre 2026Pubblicazione dei documentiNote di rilascio di Amazon EMR Spark 8.1.0 (emr-spark-8.1.0) pubblicate per la prima volta