Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
AWS runtime per Apache Spark (emr-spark-8.1.0)
Ciclo di vita supportato da emr-spark-8.1.0
Questa versione è designata come versione LTS (Long Term Support). La tabella seguente descrive le date del ciclo di vita supportate per Amazon EMR Spark 8.1.0.
| Fase di supporto | Data |
|---|---|
| Data di rilascio iniziale | 8 settembre 2026 |
| Supporto standard fino al | 7 settembre 2029 |
| Fine del ciclo di vita | 8 settembre 2029 |
Versioni dell'applicazione emr-spark-8.1.0
Questa versione include le seguenti applicazioni: AmazonCloudWatchAgent,,,, Delta
La seguente tabella elenca le versioni dell'applicazione disponibili in questo rilascio di Amazon EMR e quelle nei precedenti tre rilasci di Amazon EMR (quando applicabile).
Per la cronologia completa delle versioni dell'applicazione di ogni rilascio di Amazon EMR, fai riferimento ai seguenti argomenti:
| emr-spark-8.1.0 | emr-spark-8.0.0 | |
|---|---|---|
| AWS SDK per Java | 2.44.5 | 2,41,32 |
| Python | 3.11, 3.13 | 3.11, 3.13 |
| Scala | 2.13.17 | 2,13,16 |
| AmazonCloudWatchAgent | 1,300034.0-amzn-0 | 1,300032,2-amzn-0 |
| Delta | 4.2.0-amzn-0 | 4.0.0-amzn-1-spark |
| Hudi | 1.1.1-amzn-0 | 1.1.0-amzn-0 |
| Iceberg | 1.11.0-amzn-0 | 1.10.1-amzn-0 |
| JupyterEnterpriseGateway | 2.6.0 | 2.6.0 |
| Livy | 0.9.0-incubazione | 0.8.0-incubazione |
| Spark | 4.1.1-amzn-0 | 4.0.2-amzn-0 |
note di rilascio di emr-spark-8.1.0
Le seguenti note di rilascio includono informazioni per Amazon EMR release 8.1.0 (emr-spark-8.1.0), con Apache Spark 4.1.1.
Cosa c'è di nuovo
Apache Spark 4.1.1 — Amazon EMR Spark 8.1.0 include Apache Spark 4.1.1. Le dipendenze aggiornate includono Scala 2.13.17, Jackson 2.20.0 e Parquet-MR 1.16.0, insieme a nuove funzionalità di Spark, miglioramenti delle prestazioni e correzioni di bug.
Supporto delle specifiche Iceberg v3 per i carichi di lavoro Spark: Amazon EMR Spark 8.1.0 estende il supporto delle specifiche Iceberg v3 per i carichi di lavoro Spark. Questa versione aggiunge le seguenti funzionalità v3:
Tipi di dati geospaziali: le tabelle Iceberg v3 supportano i tipi di dati e.
GEOMETRYGEOGRAPHYFunzioni SQL geospaziali: Amazon EMR Spark 8.1.0 supporta nativamente le funzioni geospaziali per i carichi di lavoro Iceberg. Imposta
spark.sql.geospatial.enabledsutruenella configurazione di Spark per abilitare le funzioni geospaziali. Apache Spark 4.1 supporta solo SRID 0, 3857 e 4326. Sono supportate le seguenti funzioni:st_area(geom)st_asbinary(geo[, endianness])st_collect(geoArray)st_convexhull(geom)st_distance(geom1, geom2)st_dwithin(geom1, geom2, distance)st_geogfromwkb(wkb)st_geomfromwkb(wkb[, srid])st_geomfromwkt(wkt[, srid])st_intersection(geom1, geom2)st_intersects(geom1, geom2)st_length(geom)st_makeline(geomArray)st_setsrid(geo, srid)st_srid(geo)st_within(geom1, geom2)st_x(point)st_y(point)
Nanosecond-precision timestamp: le tabelle Iceberg v3 supportano colonne di timestamp con precisione nanosecondi (e).
TIMESTAMP(9)TIMESTAMP_NTZ(9)Distruzione delle varianti: le tabelle Iceberg v3 supportano la distruzione delle varianti.
UNKNOWNtipo di dati: le tabelle Iceberg v3 supportano il tipo diUNKNOWNdati per le colonne il cui tipo non è ancora definito. Le colonne di questo tipo sono opzionali, il valore predefinito è nullo e non vengono archiviate nei file di dati.Valori predefiniti: le colonne Iceberg v3 supportano i valori predefiniti dichiarati, che si applicano quando un autore omette la colonna.
Supporto granulare esteso per il controllo degli accessi per i formati open table: Amazon EMR Spark 8.1.0 estende il supporto granulare di controllo degli accessi (FGAC) per i formati open table (OTF). Iceberg ora supporta FGAC per operazioni aggiuntive:,,, e.
DESCRIBE TABLESHOW TBLPROPERTIESSHOW CREATE TABLEALTER TABLE table_name WRITE ORDERED BYALTER TABLE table_name WRITE DISTRIBUTED BYDelta Lake ora supporta FGAC per l'operazione.VACUUMMiglioramenti dell'aggiornamento incrementale per le viste materializzate di Iceberg: l'aggiornamento incrementale ora supporta le tabelle tramite l'acquisizione dei dati di modifica. Merge-on-Read Ciò consente aggiornamenti rapidi per i carichi di lavoro che utilizzano aggiornamenti ed eliminazioni. L'aggiornamento legge solo i file di dati interessati da una modifica, utilizzando le statistiche per file e per colonna a livello di manifesto.
Multi-format supporto multi-catalogo con individuazione automatica: le query SQL di Spark possono ora fare riferimento ai cataloghi per nome senza preregistrarli nella configurazione di Spark. I tipi di catalogo supportati includono cataloghi su più account e cataloghi federati S3 Tables, con rilevamento automatico dei formati di tabella Iceberg, Delta e Hudi. Per abilitare questa funzionalità, aggiungi la seguente configurazione Spark:
"spark.sql.catalog.spark_catalog": "org.apache.spark.sql.connector.catalog.redirecting.RedirectingSessionCatalog", "spark.sql.catalogResolver": "com.amazonaws.glue.catalog.redirecting.GlueCatalogResolver"
Modifiche, miglioramenti e problemi risolti
Questa versione include correzioni di bug e miglioramenti delle funzionalità per Iceberg, Hudi e Delta. Per ulteriori informazioni, consulta la sezione Novità.
Migliore tolleranza alla verifica della crittografia del disco durante l'avvio del cluster: i cluster con crittografia del disco locale abilitata nella loro configurazione di sicurezza sono ora più tolleranti nei confronti dei ritardi transitori della connettività di rete durante l'avvio dell'istanza. Questa modifica riduce gli errori intermittenti di avvio del cluster.
Risolto il problema della gestione dei caratteri UTF-8 multibyte nelle configurazioni Amazon EMR: le configurazioni Amazon EMR ora supportano correttamente i caratteri multibyte. UTF-8 Ciò include valori con lettere accentate o caratteri non latini. Per ulteriori informazioni, consulta la sezione Configurazione delle applicazioni.
Maggiore affidabilità di avvio di Secret Agent: risolve due problemi che potevano causare errori di provisioning del cluster Amazon EMR relativi al servizio di sicurezza Secret Agent. La creazione del certificato ora attende che HDFS sia pronto per procedere e lo script di avvio ritenta il rilevamento del processo Java di Secret Agent. Insieme, queste modifiche riducono gli errori di avvio nei cluster con inizializzazione dello storage più lenta o istanze molto caricate.
Problemi noti e limitazioni
La crittografia nativa delle tabelle Apache Iceberg viene applicata solo quando si utilizza Hive Metastore o un catalogo REST Iceberg. Con il AWS Glue Data Catalog (incluso l'endpoint REST Iceberg) e il catalogo Hadoop, queste proprietà sono accettate ma non applicate. Di conseguenza, i dati vengono scritti in testo normale. Per crittografare i dati delle tabelle Iceberg a riposo con questi cataloghi, abilita la crittografia lato server di Amazon S3 con AWS KMS le chiavi (SSE-KMS) nella posizione Amazon S3 della tabella.
Le trasformazioni che richiedono più di un argomento non sono supportate per le tabelle Iceberg v3.
Versioni Java predefinite di emr-spark-8.1.0
| Applicazione | Versione Java/Amazon Corretto (l'impostazione predefinita è in grassetto) |
|---|---|
| Spark | 17, 21 |
| Livy | 17, 11, 8 |
| Hadoop | 17, 11, 8 |
Versioni dei componenti emr-spark-8.1.0
I componenti che Amazon EMR installa con questo rilascio sono elencati di seguito. Alcuni sono installati come parte di pacchetti di applicazione dei big data. Altri sono specifici per Amazon EMR e installati per processi e caratteristiche del sistema. In genere iniziano con o. emr aws Big-data i pacchetti applicativi nella versione più recente di Amazon EMR sono in genere l'ultima versione disponibile nella community. Mettiamo a disposizione i rilasci della community in Amazon EMR il più rapidamente possibile.
Alcuni componenti in Amazon EMR differiscono dalle versioni della community. Tali componenti hanno un'etichetta che indica la versione nel modulo . CommunityVersion-amzn-EmrVersion inizia da 0. Ad esempio, se un componente della community open source denominato EmrVersionmyapp-component con versione 2.2 è stato modificato tre volte per essere incluso in rilasci diversi di Amazon EMR, tale versione di rilascio si presenta come 2.2-amzn-2.
| Componente | Versione | Description |
|---|---|---|
| adot-java-agent | 1.31.0 | Un agente Java che raccoglie i parametri dai daemon delle applicazioni. |
| delta | 4.2.0-amzn-0 | Delta Lake è un formato a tabella aperta per set di dati analitici di grandissime dimensioni |
| emr-amazon-cloudwatch-agent | 1,300034.0-amzn-0 | Un'applicazione che raccoglie parametri interni a livello di sistema e parametri delle applicazioni personalizzati dalle istanze Amazon EC2. |
| emr-ddb | 6.1.0 | Connettore di Amazon DynamoDB per le applicazioni dell'ecosistema Hadoop. |
| emr-goodies | 3.23.0 - scintilla | Librerie utili per l'ecosistema Hadoop. |
| emr-notebook-env | 1.18.0 | Ambiente Conda per EMR Notebooks che include il gateway aziendale Jupyter |
| emr-s3-dist-cp | 2.46.0 | Applicazione di copia distribuita ottimizzata per Amazon S3. |
| hadoop-client | 3.4.2-amzn-3 | Client di riga di comando Hadoop, ad esempio "hdfs", "hadoop" o "yarn". |
| hadoop-hdfs-datanode | 3.4.2-amzn-3 | Servizio a livello di nodo HDFS per lo storage di blocchi. |
| hadoop-hdfs-library | 3.4.2-amzn-3 | Libreria e client di riga di comando HDFS |
| hadoop-hdfs-namenode | 3.4.2-amzn-3 | Servizio HDFS per tenere traccia dei nomi di file e delle posizioni dei blocchi. |
| hadoop-hdfs-zkfc | 3.4.2-amzn-3 | Servizio ZKFC per il tracciamento dei namenodes per la modalità HA. |
| hadoop-hdfs-journalnode | 3.4.2-amzn-3 | Servizio HDFS per gestire il giornale di registrazione del file system Hadoop su cluster HA. |
| hadoop-httpfs-server | 3.4.2-amzn-3 | Endpoint HTTP per le operazioni HDFS. |
| hadoop-kms-server | 3.4.2-amzn-3 | Server di gestione delle chiavi crittografiche basato sull'API di Hadoop. KeyProvider |
| hadoop-mapred | 3.4.2-amzn-3 | MapReduce librerie di motori di esecuzione per l'esecuzione di un'applicazione. MapReduce |
| hadoop-yarn-nodemanager | 3.4.2-amzn-3 | Servizio YARN per la gestione di container su un singolo nodo. |
| hadoop-yarn-resourcemanager | 3.4.2-amzn-3 | Servizio YARN per l'allocazione e la gestione delle risorse di cluster e delle applicazioni distribuite. |
| hadoop-yarn-timeline-server | 3.4.2-amzn-3 | Servizio per il recupero di informazioni correnti e della cronologia per applicazioni YARN. |
| hudi | 1.1.1-amzn-0 | Framework di elaborazione incrementale per alimentare la Data Pipeline a bassa latenza e alta efficienza. |
| hudi-spark | 1.1.1-amzn-0 | Libreria bundle per eseguire Spark con Hudi. |
| iceberg | 1.11.0-amzn-0 | Apache Iceberg è un formato a tabella aperta per enormi set di dati analitici |
| livy-server | 0.9.0-incubazione | Interfaccia REST per l'interazione con Apache Spark |
| nginx | 1.12.1 | nginx [motore x] è un server proxy inverso e HTTP |
| mariadb-server | 5.5.68+ | Server di database MariaDB. |
| nvidia-cuda | 12,5,0 | Driver Nvidia e kit di strumenti Cuda |
| r | 4.3.2 | The R Project for Statistical Computing |
| spark-client | 4.1.1-amzn-0 | Client a riga di comando Spark. |
| spark-history-server | 4.1.1-amzn-0 | Interfaccia utente Web per la visualizzazione di eventi registrati per la durata di un'applicazione Spark completata. |
| spark-on-yarn | 4.1.1-amzn-0 | In-memory motore di esecuzione per YARN. |
| spark-yarn-slave | 4.1.1-amzn-0 | Librerie Apache Spark necessarie per gli slave YARN. |
| spark-rapids | 26.04.2-amzn-0 | Plugin Nvidia Spark RAPIDS che accelera Apache Spark con GPU. |
| zookeeper-server | 3.9.3-amzn-8 | Servizio centralizzato per la manutenzione delle informazioni di configurazione, i servizi di denominazione, la sincronizzazione distribuita e l'erogazione di servizi di gruppo. |
| zookeeper-client | 3.9.3-amzn-8 | ZooKeeper client a riga di comando. |
classificazioni di configurazione emr-spark-8.1.0
Le classificazioni di configurazione consentono di personalizzare le applicazioni. Esse corrispondono spesso a un file XML di configurazione per l'applicazione, ad esempio hive-site.xml. Per ulteriori informazioni, consulta Configurazione delle applicazioni.
Le azioni di riconfigurazione vengono eseguite quando si specifica una configurazione per gruppi di istanze in un cluster in esecuzione. Amazon EMR avvia solo le azioni di riconfigurazione per le classificazioni modificate. Per ulteriori informazioni, consulta Riconfigurazione di un gruppo di istanze in un cluster in esecuzione.
| Classificazioni | Description | Operazioni di riconfigurazione |
|---|---|---|
capacity-scheduler | Modifica i valori nel file capacity-scheduler.xml di Hadoop. | Restarts the ResourceManager service. |
container-executor | Modificare i valori nel file container-executor.cfg di Hadoop YARN. | Not available. |
container-log4j | Modifica i valori nel file container-log4j.properties di Hadoop YARN. | Not available. |
core-site | Modifica i valori nel file core-site.xml di Hadoop. | Restarts the Hadoop HDFS services Namenode, SecondaryNamenode, Datanode, ZKFC, and Journalnode. Restarts the Hadoop YARN services ResourceManager, NodeManager, ProxyServer, and TimelineServer. Additionally restarts Hadoop KMS, Hadoop Httpfs, and MapReduce-HistoryServer. |
docker-conf | Modifica le impostazioni relative a docker. | Not available. |
hadoop-env | Modifica i valori nell'ambiente Hadoop per tutti i componenti Hadoop. | Restarts the Hadoop HDFS services Namenode, SecondaryNamenode, Datanode, ZKFC, and Journalnode. Restarts the Hadoop YARN services ResourceManager, NodeManager, ProxyServer, and TimelineServer. Additionally restarts MapReduce-HistoryServer. |
hadoop-log4j | Modifica i valori nel file log4j.properties di Hadoop. | Restarts the Hadoop HDFS services SecondaryNamenode, Datanode, and Journalnode. Restarts the Hadoop YARN services ResourceManager, NodeManager, ProxyServer, and TimelineServer. Additionally restarts Hadoop KMS, Hadoop Httpfs, and MapReduce-HistoryServer. |
hadoop-ssl-server | Modifica la configurazione server ssl hadoop | Not available. |
hadoop-ssl-client | Modifica la configurazione client ssl hadoop | Not available. |
hdfs-encryption-zones | Configura le zone di crittografia HDFS. | This classification should not be reconfigured. |
hdfs-env | Modifica i valori nell'ambiente HDFS. | Restarts Hadoop HDFS services Namenode, Datanode, and ZKFC. |
hdfs-site | Modifica i valori nel file hdfs-site.xml di HDFS. | Restarts the Hadoop HDFS services Namenode, SecondaryNamenode, Datanode, ZKFC, and Journalnode. Additionally restarts Hadoop Httpfs. |
httpfs-env | Modifica i valori nell'ambiente HTTPFS. | Restarts Hadoop Httpfs service. |
httpfs-site | Modifica i valori nel file httpfs-site.xml di Hadoop. | Restarts Hadoop Httpfs service. |
hadoop-kms-acls | Modifica i valori nel file kms-acls.xml di Hadoop. | Not available. |
hadoop-kms-env | Modifica i valori nell'ambiente Hadoop KMS. | Restarts Hadoop-KMS service. |
hadoop-kms-java-home | Modifica la home Java KMS di Hadoop | Not available. |
hadoop-kms-log4j | Modifica i valori nel file kms-log4j.properties di Hadoop. | Not available. |
hadoop-kms-site | Modifica i valori nel file kms-site.xml di Hadoop. | Restarts Hadoop-KMS. |
hudi-env | Modifica i valori nell'ambiente Hudi. | Not available. |
hudi-defaults | Modifica i valori nel file hudi-defaults.conf di Hudi. | Not available. |
iceberg-defaults | Modifica i valori nel file iceberg-defaults.conf di Iceberg. | Not available. |
delta-defaults | Modifica i valori nel file delta-defaults.conf di Delta. | Not available. |
jupyter-notebook-conf | Modifica i valori nel file jupyter_notebook_config.py di Jupyter Notebook. | Not available. |
jupyter-s3-conf | Configura la persistenza di S3 del notebook Jupyter. | Not available. |
jupyter-sparkmagic-conf | Modifica i valori nel file config.json di Sparkmagic. | Not available. |
livy-conf | Modifica i valori nel file livy.conf di Livy. | Restarts Livy Server. |
livy-env | Modifica i valori nell'ambiente Livy. | Restarts Livy Server. |
livy-log4j2 | Modifica le impostazioni di log4j2.properties di Livy. | Restarts Livy Server. |
mapred-env | Modificare i valori nell'ambiente dell'applicazione. MapReduce | Restarts Hadoop MapReduce-HistoryServer. |
mapred-site | Modificare i valori nel file mapred-site.xml dell' MapReduce applicazione. | Restarts Hadoop MapReduce-HistoryServer. |
spark | EMR-curated Impostazioni Amazon per Apache Spark. | This property modifies spark-defaults. See actions there. |
spark-defaults | Modifica i valori nel file spark-defaults.conf di Spark. | Restarts Spark history server and Spark thrift server. |
spark-env | Modifica i valori nell'ambiente Spark. | Restarts Spark history server and Spark thrift server. |
spark-hive-site | Modifica i valori nel file hive-site.xml di Spark | Not available. |
spark-log4j2 | Modifica i valori nel file log4j2.properties di Spark. | Restarts Spark history server and Spark thrift server. |
spark-metrics | Modifica i valori nel file metrics.properties di Spark. | Restarts Spark history server and Spark thrift server. |
yarn-env | Modifica i valori nell'ambiente YARN. | Restarts the Hadoop YARN services ResourceManager, NodeManager, ProxyServer, and TimelineServer. Additionally restarts MapReduce-HistoryServer. |
yarn-site | Modifica i valori nel file yarn-site.xml di YARN. | Restarts the Hadoop YARN services ResourceManager, NodeManager, ProxyServer, and TimelineServer. Additionally restarts Livy Server and MapReduce-HistoryServer. |
zookeeper-config | Modifica i valori nel ZooKeeper file zoo.cfg. | Restarts Zookeeper server. |
zookeeper-logback | Cambia i valori nel ZooKeeper file logback.xml. | Restarts Zookeeper server. |
cloudwatch-logs | Configura l'integrazione dei CloudWatch log per i nodi del cluster EMR. | Not available. |
emr-metrics | Modifica le impostazioni delle metriche emr per questo nodo. | Restarts the CloudWatchAgent service. |
Registro delle modifiche di Amazon EMR Spark 8.1.0
| Data | Event | Description |
|---|---|---|
| 08 settembre 2026 | Pubblicazione dei documenti | Note di rilascio di Amazon EMR Spark 8.1.0 (emr-spark-8.1.0) pubblicate per la prima volta |