View a markdown version of this page

AWS runtime pour Apache Spark (emr-spark-8.1.0) - Amazon EMR

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

AWS runtime pour Apache Spark (emr-spark-8.1.0)

Cycle de vie pris en charge par emr-spark-8.1.0

Cette version est désignée comme une version avec support à long terme (LTS). Le tableau suivant décrit les dates de cycle de vie prises en charge pour Amazon EMR Spark 8.1.0.

Phase d'assistance Date
Date de sortie initiale 8 septembre 2026
Support standard jusqu'à 7 septembre 2029
Fin de vie 8 septembre 2029

Versions de l'application emr-spark-8.1.0

Cette version inclut les applications suivantes : AmazonCloudWatchAgent Delta, Hudi, Iceberg JupyterEnterpriseGateway, Livy, et Spark.

Le tableau ci-dessous répertorie les versions d'application disponibles dans cette version d'Amazon EMR et les versions d'application des trois versions précédentes d'Amazon EMR (le cas échéant).

Pour obtenir un historique complet des versions des applications de chaque version d'Amazon EMR, consultez les rubriques suivantes :

Informations sur la version de l'application
emr-spark-8.1.0 emr-spark-8.0.0
AWS SDK pour Java 2,44,52,41,32
Python 3,11 et 3,133,11 et 3,13
Scala 2,13,172,13,16
AmazonCloudWatchAgent1,300034,0-amzn-01,300032,2-amzn-0
Delta4.2.0-amzn-04.0.0-amzn-1-spark
Hudi1.1.1-amzn-01.1.0-amzn-0
Iceberg1.11.0-amzn-01.10.1-amzn-0
JupyterEnterpriseGateway2.6.02.6.0
Livy0.9.0 - incubation0.8.0 - incubation
Spark4.1.1-amzn-04.0.2-amzn-0

Notes de mise à jour d'emr-spark-8.1.0

Les notes de publication suivantes contiennent des informations sur la version 8.1.0 d'Amazon EMR (emr-spark-8.1.0), avec Apache Spark 4.1.1.

Nouveautés

  • Apache Spark 4.1.1 — Amazon EMR Spark 8.1.0 inclut Apache Spark 4.1.1. Les dépendances mises à jour incluent Scala 2.13.17, Jackson 2.20.0 et Parquet-MR 1.16.0, ainsi que de nouvelles fonctionnalités de Spark, des améliorations de performances et des corrections de bugs.

  • Prise en charge des spécifications Iceberg v3 pour les charges de travail Spark — Amazon EMR Spark 8.1.0 étend la prise en charge des spécifications Iceberg v3 pour les charges de travail Spark. Cette version ajoute les fonctionnalités v3 suivantes :

    • Types de données géospatiales — Les tables Iceberg v3 prennent en charge les types de GEOGRAPHY données GEOMETRY et.

    • Fonctions SQL géospatiales  : Amazon EMR Spark 8.1.0 prend en charge de manière native les fonctions géospatiales pour les charges de travail Iceberg. Définissez spark.sql.geospatial.enabled ce paramètre sur true dans votre configuration Spark pour activer les fonctions géospatiales. Apache Spark 4.1 prend uniquement en charge les SRID 0, 3857 et 4326. Les fonctions suivantes sont prises en charge :

      • st_area(geom)

      • st_asbinary(geo[, endianness])

      • st_collect(geoArray)

      • st_convexhull(geom)

      • st_distance(geom1, geom2)

      • st_dwithin(geom1, geom2, distance)

      • st_geogfromwkb(wkb)

      • st_geomfromwkb(wkb[, srid])

      • st_geomfromwkt(wkt[, srid])

      • st_intersection(geom1, geom2)

      • st_intersects(geom1, geom2)

      • st_length(geom)

      • st_makeline(geomArray)

      • st_setsrid(geo, srid)

      • st_srid(geo)

      • st_within(geom1, geom2)

      • st_x(point)

      • st_y(point)

    • Nanosecond-precision horodatages — Les tables Iceberg v3 prennent en charge les colonnes d'horodatage d'une précision de la nanoseconde (et). TIMESTAMP(9) TIMESTAMP_NTZ(9)

    • Déchiquetage des variantes — Les tables Iceberg v3 prennent en charge le déchiquetage des variantes.

    • UNKNOWNtype de données — Les tables Iceberg v3 prennent en charge le type de UNKNOWN données pour les colonnes dont le type n'est pas encore défini. Les colonnes de ce type sont facultatives, sont nulles par défaut et ne sont pas stockées dans des fichiers de données.

    • Valeurs par défaut — Les colonnes Iceberg v3 prennent en charge les valeurs par défaut déclarées, qui s'appliquent lorsqu'un rédacteur omet la colonne.

  • Prise en charge étendue du contrôle d'accès affiné pour les formats de table ouverte — Amazon EMR Spark 8.1.0 étend la prise en charge du contrôle d'accès affiné (FGAC) pour les formats de table ouverte (OTF). Iceberg prend désormais en charge le FGAC pour des opérations supplémentaires : DESCRIBE TABLESHOW TBLPROPERTIES, SHOW CREATE TABLEALTER TABLE table_name WRITE ORDERED BY, et. ALTER TABLE table_name WRITE DISTRIBUTED BY Delta Lake soutient désormais la FGAC pour cette VACUUM opération.

  • Améliorations apportées à l'actualisation incrémentielle des vues matérialisées d'Iceberg — L'actualisation incrémentielle prend désormais en charge les Merge-on-Read tableaux grâce à la capture des données de modification. Cela permet d'actualiser rapidement les charges de travail qui utilisent des mises à jour et des suppressions. Refresh lit uniquement les fichiers de données concernés par une modification, en utilisant des statistiques de colonne par fichier et au niveau du manifeste.

  • Multi-format prise en charge de plusieurs catalogues avec découverte automatique  : les requêtes Spark SQL peuvent désormais référencer les catalogues par leur nom sans les pré-enregistrer dans la configuration de Spark. Les types de catalogues pris en charge incluent les catalogues multicomptes et les catalogues fédérés S3 Tables, avec détection automatique des formats de tableau Iceberg, Delta et Hudi. Pour activer cette fonctionnalité, ajoutez la configuration Spark suivante : "spark.sql.catalog.spark_catalog": "org.apache.spark.sql.connector.catalog.redirecting.RedirectingSessionCatalog", "spark.sql.catalogResolver": "com.amazonaws.glue.catalog.redirecting.GlueCatalogResolver"

Modifications, améliorations et problèmes résolus

  • Cette version inclut des corrections de bogues et des améliorations de fonctionnalités pour Iceberg, Hudi et Delta. Pour plus d'informations, consultez la section Nouveautés.

  • Tolérance de vérification du chiffrement de disque améliorée lors du démarrage du cluster — Les clusters dont le chiffrement de disque local est activé dans leur configuration de sécurité sont désormais plus tolérants aux retards transitoires de connectivité réseau lors du démarrage de l'instance. Cette modification permet de réduire les échecs de démarrage intermittents du cluster.

  • Correction de la gestion des caractères UTF-8 multioctets dans les configurations Amazon EMR — Les configurations Amazon EMR prennent désormais correctement en charge les caractères multioctets. UTF-8 Cela inclut les valeurs comportant des lettres accentuées ou des caractères non latins. Pour plus d'informations, consultez Configuration des applications.

  • Amélioration de la fiabilité de démarrage des agents secrets — Corrige deux problèmes susceptibles d'entraîner des échecs de provisionnement du cluster Amazon EMR liés au service de sécurité Secret Agent. La création du certificat attend désormais que le HDFS soit prêt pour continuer, et le script de démarrage tente à nouveau de détecter le processus Java de l'agent secret. Ensemble, ces modifications permettent de réduire les échecs de lancement sur les clusters dont l'initialisation du stockage est plus lente ou dont les instances sont fortement chargées.

Limites et problèmes connus

  • Le chiffrement natif des tables Apache Iceberg est appliqué uniquement lorsque vous utilisez le Hive Metastore ou un catalogue Iceberg REST. Avec le catalogue de données AWS Glue (y compris son point de terminaison Iceberg REST) et le catalogue Hadoop, ces propriétés sont acceptées mais pas appliquées. Par conséquent, les données sont écrites en texte brut. Pour chiffrer les données des tables Iceberg au repos avec ces catalogues, activez le chiffrement côté serveur Amazon S3 à l'aide de AWS KMS clés (SSE-KMS) sur l'emplacement Amazon S3 de la table.

  • Les transformations qui prennent plus d'un argument ne sont pas prises en charge pour les tables Iceberg v3.

Versions Java par défaut d'emr-spark-8.1.0

ApplicationVersion Java/Amazon Corretto (la valeur par défaut est en gras)
Spark17 ET 21
Livy17, 11 et 8
Hadoop17, 11 et 8

Versions des composants emr-spark-8.1.0

Les composants installés par Amazon EMR avec cette version sont répertoriés ci-dessous. Certains sont installés dans le cadre de packages d'application de Big Data. Les autres sont propres à Amazon EMR et installés pour les fonctions et processus système. Celles-ci commencent généralement par emr ouaws. Big-data les packages d'application de la version la plus récente d'Amazon EMR sont généralement la dernière version disponible dans la communauté. Nous nous efforçons de mettre à disposition les versions de la communauté dans Amazon EMR le plus rapidement possible.

Certains composants dans Amazon EMR diffèrent des versions de la communauté. Ces composants ont une étiquette de version sous la forme CommunityVersion-amzn-EmrVersion. EmrVersion commence à 0. Par exemple, si un composant de la communauté open source nommé myapp-component avec la version 2.2 a été modifié trois fois en vue de son inclusion dans différentes versions d'Amazon EMR, sa version apparaît sous le nom 2.2-amzn-2.

Composant Version Description
adot-java-agent1,31,0Agent Java qui collecte des métriques à partir des démons d’application.
delta4.2.0-amzn-0Delta Lake est un format de table ouvert pour les jeux de données analytiques de grande taille.
emr-amazon-cloudwatch-agent1,300034,0-amzn-0Application qui collecte des métriques au niveau interne du système ainsi que des métriques d’application personnalisées à partir d’instances Amazon EC2.
emr-ddb6.1.0Connecteur Amazon DynamoDB pour les applications de l'écosystème Hadoop.
emr-goodies3.23.0-étincelleBibliothèques proposant plus de commodités pour l'écosystème Hadoop.
emr-notebook-env1.18.0Environnement Conda pour le bloc-notes EMR qui inclut la passerelle Jupyter Entreprise
emr-s3-dist-cp2,46,0Application de copie distribuée optimisée pour Amazon S3.
hadoop-client3.4.2-amzn-3Clients de ligne de commande Hadoop tels que « hdfs », « hadoop » ou « yarn ».
hadoop-hdfs-datanode3.4.2-amzn-3HDFS node-level service for storing blocks.
hadoop-hdfs-library3.4.2-amzn-3Bibliothèque et client de ligne de commande HDFS
hadoop-hdfs-namenode3.4.2-amzn-3Service HDFS pour le suivi des noms de fichier et des emplacements de bloc.
hadoop-hdfs-zkfc3.4.2-amzn-3Service ZKFC pour le suivi des namenodes pour le mode HA.
hadoop-hdfs-journalnode3.4.2-amzn-3Service HDFS pour la gestion du journal du système de fichiers Hadoop sur les clusters HA.
hadoop-httpfs-server3.4.2-amzn-3Point de terminaison HTTP pour les opérations HDFS.
hadoop-kms-server3.4.2-amzn-3Serveur de gestion de clés cryptographiques basé sur l'API Hadoop. KeyProvider
hadoop-mapred3.4.2-amzn-3MapReduce bibliothèques de moteurs d'exécution pour exécuter une MapReduce application.
hadoop-yarn-nodemanager3.4.2-amzn-3Service YARN pour la gestion de conteneurs sur un nœud individuel.
hadoop-yarn-resourcemanager3.4.2-amzn-3Service YARN pour l'allocation et la gestion des ressources de cluster et des applications distribuées.
hadoop-yarn-timeline-server3.4.2-amzn-3Service de récupération d'informations actuelles et historiques pour les applications YARN.
hudi1.1.1-amzn-0Infrastructure de traitement incrémentiel pour implémenter un pipeline à faible latence et à efficacité élevée.
hudi-spark1.1.1-amzn-0Bibliothèque de solution groupée pour exécuter Spark avec Hudi.
iceberg1.11.0-amzn-0Apache Iceberg est un format de table ouvert pour les jeux de données analytiques de grande taille.
livy-server0.9.0 - incubationInterface REST pour interagir avec Apache Spark
nginx1.12.1nginx [engine x] est un serveur HTTP et à proxy inverse
mariadb-server5,5,68 et versions supérieuresServeur de base de données MariaDB.
nvidia-cuda12,5,0Pilotes Nvidia et boîte à outils Cuda
r4.3.2Projet R pour les calculs statistiques
spark-client4.1.1-amzn-0Clients de ligne de commande Spark.
spark-history-server4.1.1-amzn-0Interface web pour afficher des événements enregistrés pour la durée de vie d'une application Spark terminée.
spark-on-yarn4.1.1-amzn-0In-memory moteur d'exécution pour YARN.
spark-yarn-slave4.1.1-amzn-0Bibliothèques Apache Spark requises par les esclaves YARN.
spark-rapids26.04.2-amzn-0Plug-in Nvidia Spark RAPIDS qui accélère Apache Spark avec les GPU.
zookeeper-server3.9.3-amzn-8Service centralisé conçu pour la conservation des informations de configuration, l'affectation de noms, la synchronisation distribuée et la fourniture de services de groupe.
zookeeper-client3.9.3-amzn-8ZooKeeper client en ligne de commande.

classifications de configuration d'emr-spark-8.1.0

Les classifications de configuration vous permettent de personnaliser les applications. Elles correspondent souvent à un fichier XML de configuration de l'application, tel que hive-site.xml. Pour plus d’informations, consultez Configuration des applications.

Les actions de reconfiguration se produisent lorsque vous spécifiez une configuration pour les groupes d'instances d'un cluster en cours d'exécution. Amazon EMR lance uniquement des actions de reconfiguration pour les classifications que vous modifiez. Pour plus d’informations, consultez Reconfigurer un groupe d'instances dans un cluster en cours d'exécution.

classifications emr-spark-8.1.0
Classifications Description Actions de reconfiguration

capacity-scheduler

Modifiez les valeurs dans le fichier capacity-scheduler.xml de Hadoop.

Restarts the ResourceManager service.

container-executor

Modifiez les valeurs dans le fichier container-executor.cfg de Hadoop YARN.

Not available.

container-log4j

Modifiez les valeurs dans le fichier container-log4j.properties de Hadoop YARN.

Not available.

core-site

Modifiez les valeurs dans le fichier core-site.xml de Hadoop.

Restarts the Hadoop HDFS services Namenode, SecondaryNamenode, Datanode, ZKFC, and Journalnode. Restarts the Hadoop YARN services ResourceManager, NodeManager, ProxyServer, and TimelineServer. Additionally restarts Hadoop KMS, Hadoop Httpfs, and MapReduce-HistoryServer.

docker-conf

Modifiez les paramètres liés au docker.

Not available.

hadoop-env

Modifiez les valeurs dans l'environnement Hadoop pour tous les composants Hadoop.

Restarts the Hadoop HDFS services Namenode, SecondaryNamenode, Datanode, ZKFC, and Journalnode. Restarts the Hadoop YARN services ResourceManager, NodeManager, ProxyServer, and TimelineServer. Additionally restarts MapReduce-HistoryServer.

hadoop-log4j

Modifiez les valeurs dans le fichier log4j.properties de Hadoop.

Restarts the Hadoop HDFS services SecondaryNamenode, Datanode, and Journalnode. Restarts the Hadoop YARN services ResourceManager, NodeManager, ProxyServer, and TimelineServer. Additionally restarts Hadoop KMS, Hadoop Httpfs, and MapReduce-HistoryServer.

hadoop-ssl-server

Modifier la configuration du serveur ssl hadoop

Not available.

hadoop-ssl-client

Modifier la configuration du client ssl hadoop

Not available.

hdfs-encryption-zones

Configurez les zones de chiffrement HDFS.

This classification should not be reconfigured.

hdfs-env

Modifiez les valeurs dans l'environnement HDFS.

Restarts Hadoop HDFS services Namenode, Datanode, and ZKFC.

hdfs-site

Modifiez les valeurs dans le fichier hdfs-site.xml de HDFS.

Restarts the Hadoop HDFS services Namenode, SecondaryNamenode, Datanode, ZKFC, and Journalnode. Additionally restarts Hadoop Httpfs.

httpfs-env

Modifiez les valeurs dans l'environnement HTTPFS.

Restarts Hadoop Httpfs service.

httpfs-site

Modifiez les valeurs dans le fichier httpfs-site.xml de Hadoop.

Restarts Hadoop Httpfs service.

hadoop-kms-acls

Modifiez les valeurs dans le fichier kms-acls.xml de Hadoop.

Not available.

hadoop-kms-env

Modifiez les valeurs dans l'environnement KMS de Hadoop.

Restarts Hadoop-KMS service.

hadoop-kms-java-home

Modification de la page d'accueil Java KMS d'Hadoop

Not available.

hadoop-kms-log4j

Modifiez les valeurs dans le fichier kms-log4j.properties de Hadoop.

Not available.

hadoop-kms-site

Modifiez les valeurs dans le fichier kms-site.xml de Hadoop.

Restarts Hadoop-KMS.

hudi-env

Modifiez les valeurs dans l'environnement Hudi.

Not available.

hudi-defaults

Modifiez les valeurs dans le fichier hudi-defaults.conf de Hudi.

Not available.

iceberg-defaults

Modification des valeurs du fichier iceberg-defaults.conf d'Iceberg.

Not available.

delta-defaults

Modification des valeurs dans le fichier delta-defaults.conf de Delta.

Not available.

jupyter-notebook-conf

Modifiez les valeurs dans le fichier jupyter_notebook_config.py de Jupyter Notebook.

Not available.

jupyter-s3-conf

Configuration de la persistance S3 de bloc-notes Jupyter.

Not available.

jupyter-sparkmagic-conf

Modifiez les valeurs dans le fichier config.json de Sparkmagic.

Not available.

livy-conf

Modifiez les valeurs dans le fichier livy.conf de Livy.

Restarts Livy Server.

livy-env

Modifiez les valeurs dans l'environnement Livy.

Restarts Livy Server.

livy-log4j2

Modifiez les paramètres Livy log4j2.properties.

Restarts Livy Server.

mapred-env

Modifiez les valeurs dans l'environnement de l' MapReduce application.

Restarts Hadoop MapReduce-HistoryServer.

mapred-site

Modifiez les valeurs dans le fichier mapred-site.xml de l' MapReduce application.

Restarts Hadoop MapReduce-HistoryServer.

spark

EMR-curated Paramètres Amazon pour Apache Spark.

This property modifies spark-defaults. See actions there.

spark-defaults

Modifiez les valeurs dans le fichier spark-defaults.conf de Spark.

Restarts Spark history server and Spark thrift server.

spark-env

Modifiez les valeurs dans l'environnement Spark.

Restarts Spark history server and Spark thrift server.

spark-hive-site

Modifiez les valeurs dans le fichier hive-site.xml de Spark

Not available.

spark-log4j2

Modifiez les valeurs dans le fichier log4j2.properties de Spark.

Restarts Spark history server and Spark thrift server.

spark-metrics

Modifiez les valeurs dans le fichier metrics.properties de Spark.

Restarts Spark history server and Spark thrift server.

yarn-env

Modifiez les valeurs dans l'environnement YARN.

Restarts the Hadoop YARN services ResourceManager, NodeManager, ProxyServer, and TimelineServer. Additionally restarts MapReduce-HistoryServer.

yarn-site

Modifiez les valeurs dans le fichier yarn-site.xml de YARN.

Restarts the Hadoop YARN services ResourceManager, NodeManager, ProxyServer, and TimelineServer. Additionally restarts Livy Server and MapReduce-HistoryServer.

zookeeper-config

Modifiez les valeurs dans ZooKeeper le fichier zoo.cfg.

Restarts Zookeeper server.

zookeeper-logback

Modifiez les valeurs dans ZooKeeper le fichier logback.xml.

Restarts Zookeeper server.

cloudwatch-logs

Configurez l'intégration CloudWatch des journaux pour les nœuds de cluster EMR.

Not available.

emr-metrics

Modifiez les paramètres de métrique EMR pour ce nœud.

Restarts the CloudWatchAgent service.

Journal des modifications d'Amazon EMR Spark 8.1.0

Journal des modifications pour Amazon EMR Spark 8.1.0
DateÉvénementDescription
08/09/2026/09Publication de documentsLes notes de mise à jour d'Amazon EMR Spark 8.1.0 (emr-spark-8.1.0) ont été publiées pour la première fois