View a markdown version of this page

AWS tiempo de ejecución de Apache Spark (emr-spark-8.1.0) - Amazon EMR

Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.

AWS tiempo de ejecución de Apache Spark (emr-spark-8.1.0)

Ciclo de vida compatible con emr-spark-8.1.0

Esta versión se designa como versión de soporte a largo plazo (LTS). En la siguiente tabla se describen las fechas de ciclo de vida admitidas para Amazon EMR Spark 8.1.0.

Fase de soporte Date
Fecha de lanzamiento inicial 8 de septiembre de 2026
Soporte estándar hasta 7 de septiembre de 2029
Fin de vida útil 8 de septiembre de 2029

versiones de la aplicación emr-spark-8.1.0

Esta versión incluye las siguientes aplicaciones: AmazonCloudWatchAgent,,, Delta Hudi, Iceberg y. JupyterEnterpriseGateway Livy Spark

En la siguiente tabla se enumeran las versiones de la aplicación disponibles en esta versión de Amazon EMR y las versiones de la aplicación en las tres versiones anteriores de Amazon EMR (cuando corresponda).

Para ver un historial completo de las versiones de la aplicación disponibles para cada versión de Amazon EMR, consulte los temas siguientes:

Información sobre la versión de la aplicación
emr-spark-8.1.0 emr-spark-8.0.0
AWS SDK para Java 2.4.52,41,32
Python 3.11, 3.133.11, 3.13
Scala 2.13.172.13,16
AmazonCloudWatchAgent1.300034.0-amzn-01.300032.2-amzn-0
Delta4.2.0-amzn-04.0.0-amzn-1-spark
Hudi1.1.1-amzn-01.1.0-amzn-0
Iceberg1.11.0-amzn-01.10.1-amzn-0
JupyterEnterpriseGateway2.6.02.6.0
Livy0.9.0 incubando0.8.0-incubating
Spark4.1.1-amzn-04.0.2-amzn-0

notas de la versión de emr-spark-8.1.0

Las siguientes notas de la versión incluyen información sobre la versión 8.1.0 (emr-spark-8.1.0) de Amazon EMR, que incluye Apache Spark 4.1.1.

Novedades

  • Apache Spark 4.1.1: Amazon EMR Spark 8.1.0 incluye Apache Spark 4.1.1. Las dependencias actualizadas incluyen Scala 2.13.17, Jackson 2.20.0 y Parquet-MR 1.16.0, junto con nuevas funciones de Spark, mejoras de rendimiento y correcciones de errores.

  • Compatibilidad con las especificaciones de Iceberg v3 para las cargas de trabajo de Spark: Amazon EMR Spark 8.1.0 amplía la compatibilidad de las especificaciones de Iceberg v3 con las cargas de trabajo de Spark. Esta versión añade las siguientes funciones de la versión 3:

    • Tipos de datos geoespaciales: las tablas Iceberg v3 admiten los tipos de datos GEOMETRY yGEOGRAPHY.

    • Funciones SQL geoespaciales: Amazon EMR Spark 8.1.0 admite de forma nativa las funciones geoespaciales para las cargas de trabajo de Iceberg. Configúralo true en tu configuración de Spark spark.sql.geospatial.enabled para habilitar las funciones geoespaciales. Apache Spark 4.1 solo es compatible con los SRID 0, 3857 y 4326. Se admiten las siguientes funciones:

      • st_area(geom)

      • st_asbinary(geo[, endianness])

      • st_collect(geoArray)

      • st_convexhull(geom)

      • st_distance(geom1, geom2)

      • st_dwithin(geom1, geom2, distance)

      • st_geogfromwkb(wkb)

      • st_geomfromwkb(wkb[, srid])

      • st_geomfromwkt(wkt[, srid])

      • st_intersection(geom1, geom2)

      • st_intersects(geom1, geom2)

      • st_length(geom)

      • st_makeline(geomArray)

      • st_setsrid(geo, srid)

      • st_srid(geo)

      • st_within(geom1, geom2)

      • st_x(point)

      • st_y(point)

    • Nanosecond-precision marcas de tiempo: las tablas Iceberg v3 admiten columnas de marcas de tiempo de precisión de nanosegundos (y). TIMESTAMP(9) TIMESTAMP_NTZ(9)

    • Trituración de variantes: las tablas Iceberg v3 admiten la destrucción de variantes.

    • UNKNOWNtipo de datos: las tablas Iceberg v3 admiten el tipo de UNKNOWN datos para las columnas cuyo tipo aún no está definido. Las columnas de este tipo son opcionales, el valor predeterminado es nulo y no se almacenan en archivos de datos.

    • Valores predeterminados: las columnas de la versión 3 de Iceberg admiten los valores predeterminados declarados, que se aplican cuando un escritor omite la columna.

  • Compatibilidad ampliada con controles de acceso detallados para formatos de tablas abiertas: Amazon EMR Spark 8.1.0 amplía la compatibilidad con el control de acceso detallado (FGAC) para los formatos de tablas abiertas (OTF). Iceberg ahora es compatible con FGAC para operaciones adicionales:,,, y. DESCRIBE TABLE SHOW TBLPROPERTIES SHOW CREATE TABLE ALTER TABLE table_name WRITE ORDERED BY ALTER TABLE table_name WRITE DISTRIBUTED BY Delta Lake ahora apoya al FGAC en la operación. VACUUM

  • Mejoras en la actualización incremental de las vistas materializadas de Iceberg: la actualización incremental ahora admite Merge-on-Read tablas mediante la captura de datos modificados. Esto permite actualizar rápidamente las cargas de trabajo que utilizan actualizaciones y eliminaciones. La actualización solo lee los archivos de datos afectados por un cambio, utilizando estadísticas por archivo y por columna a nivel de manifiesto.

  • Multi-format compatibilidad con varios catálogos con detección automática: las consultas SQL de Spark ahora pueden hacer referencia a los catálogos por su nombre sin necesidad de registrarlos previamente en la configuración de Spark. Los tipos de catálogo compatibles incluyen los catálogos multicuenta y los catálogos federados de S3 Tables, con detección automática de los formatos de tablas Iceberg, Delta y Hudi. Para habilitar esta función, agrega la siguiente configuración de Spark: "spark.sql.catalog.spark_catalog": "org.apache.spark.sql.connector.catalog.redirecting.RedirectingSessionCatalog", "spark.sql.catalogResolver": "com.amazonaws.glue.catalog.redirecting.GlueCatalogResolver"

Cambios, mejoras y problemas resueltos

  • Esta versión incluye correcciones de errores y mejoras de funciones para Iceberg, Hudi y Delta. Para obtener más información, consulte la sección Novedades.

  • Mejora de la tolerancia a la verificación del cifrado de disco durante el inicio del clúster: los clústeres con el cifrado de disco local habilitado en su configuración de seguridad ahora son más tolerantes a los retrasos transitorios de conectividad de red durante el arranque de la instancia. Este cambio reduce los errores intermitentes al iniciar el clúster.

  • Se corrigió el manejo de caracteres UTF-8 multibyte en las configuraciones de Amazon EMR: las configuraciones de Amazon EMR ahora admiten correctamente los caracteres multibyte. UTF-8 Esto incluye valores con letras acentuadas o alfabetos no latinos. Para obtener más información, consulte Configuración de aplicaciones.

  • Mejora de la fiabilidad de inicio del agente secreto: se corrigen dos problemas que podían provocar errores de aprovisionamiento de clústeres de Amazon EMR relacionados con el servicio de seguridad del agente secreto. La creación del certificado ahora espera a que HDFS esté listo para continuar y el script de inicio vuelve a intentar detectar el proceso Java del agente secreto. En conjunto, estos cambios reducen los errores de lanzamiento en los clústeres con una inicialización del almacenamiento más lenta o instancias muy cargadas.

Problemas conocidos y limitaciones

  • El cifrado nativo de tablas de Apache Iceberg solo se aplica cuando se utiliza Hive Metastore o un catálogo REST de Iceberg. Con el catálogo de datos de AWS Glue (incluido su punto final REST Iceberg) y el catálogo de Hadoop, estas propiedades se aceptan pero no se aplican. Como resultado, los datos se escriben en texto plano. Para cifrar los datos de la tabla Iceberg en reposo con estos catálogos, habilite el cifrado del lado del servidor de Amazon S3 con AWS KMS claves (SSE-KMS) en la ubicación de Amazon S3 de la tabla.

  • Las transformaciones que requieren más de un argumento no son compatibles con las tablas de Iceberg v3.

Versiones Java predeterminadas de emr-spark-8.1.0

AplicaciónVersión de Java o Amazon Corretto (el valor predeterminado está en negrita)
Spark17, 21
Livy17, 11, 8
Hadoop17, 11, 8

versiones de componentes emr-spark-8.1.0

A continuación, se muestran los componentes que Amazon EMR instala con esta versión. Algunos se instalan como parte de paquetes de aplicación de macrodatos. Otros son exclusivos de Amazon EMR y se instalan para ciertos procesos y características del sistema. Por lo general, comienzan con o. emr aws Big-data Los paquetes de aplicaciones de la versión más reciente de Amazon EMR suelen ser la última versión que se encuentra en la comunidad. Intentamos que las versiones de la comunidad estén disponibles en Amazon EMR lo más rápido posible.

Algunos componentes de Amazon EMR son distintos de las versiones que se encuentran en la comunidad. Estos componentes tienen una etiqueta de versión con el formato CommunityVersion-amzn-EmrVersion. La EmrVersion empieza por 0. Por ejemplo, si un componente de la comunidad de código abierto llamado myapp-component con la versión 2.2 se ha modificado tres veces para incluirlo en diferentes versiones de lanzamiento de Amazon EMR, la versión que se mostrará será 2.2-amzn-2.

Componente Versión Description (Descripción)
adot-java-agent1.31.0Un agente Java que recopila métricas de los daemons de las aplicaciones.
delta4.2.0-amzn-0Delta Lake es un formato de tabla abierto para conjuntos de datos analíticos de gran tamaño
emr-amazon-cloudwatch-agent1.300034.0-amzn-0Se trata de una aplicación que recopila métricas internas de nivel de sistema y métricas de aplicación personalizadas de las instancias de Amazon EC2.
emr-ddb6.1.0Conector de Amazon DynamoDB para aplicaciones del ecosistema de Hadoop.
emr-goodies3.23.0-sparkBibliotecas especialmente prácticas para el ecosistema de Hadoop.
emr-notebook-env1.18.0Entorno de Conda para cuaderno de EMR que incluye una puerta de enlace empresarial de Jupyter
emr-s3-dist-cp2.46.0Aplicación de copia distribuida optimizada para Amazon S3.
hadoop-client3.4.2-amzn-3Los clientes de línea de comando de Hadoop como, por ejemplo "hdfs", "hadoop" o "yarn".
hadoop-hdfs-datanode3.4.2-amzn-3Servicio de nivel de nodos de HDFS para el almacenamiento de bloques.
hadoop-hdfs-library3.4.2-amzn-3Biblioteca y cliente de línea de comandos HDFS
hadoop-hdfs-namenode3.4.2-amzn-3Servicio de HDFS para realizar un seguimiento de nombres de archivo y bloquear ubicaciones.
hadoop-hdfs-zkfc3.4.2-amzn-3Servicio ZKFC para rastrear nodos de nombres para el modo HA.
hadoop-hdfs-journalnode3.4.2-amzn-3Servicio de HDFS para administrar los archivos de Hadoop periódico en clústeres de alta disponibilidad.
hadoop-httpfs-server3.4.2-amzn-3Punto de enlace HTTP para operaciones HDFS.
hadoop-kms-server3.4.2-amzn-3Servidor de administración de claves criptográficas basado en la API de Hadoop. KeyProvider
hadoop-mapred3.4.2-amzn-3MapReduce bibliotecas de motores de ejecución para ejecutar una aplicación. MapReduce
hadoop-yarn-nodemanager3.4.2-amzn-3Servicio de YARN para la administración de contenedores en un nodo individual.
hadoop-yarn-resourcemanager3.4.2-amzn-3Servicio de YARN para la asignación y administración de recursos de clúster y aplicaciones distribuidas.
hadoop-yarn-timeline-server3.4.2-amzn-3Servicio para recuperar información actual e histórica para aplicaciones de YARN.
hudi1.1.1-amzn-0Marco de procesamiento incremental para impulsar la canalización de datos a baja latencia y alta eficiencia.
hudi-spark1.1.1-amzn-0Biblioteca de paquetes para ejecutar Spark con Hudi.
iceberg1.11.0-amzn-0Apache Iceberg es un formato de tabla abierto para conjuntos de datos analíticos muy grandes
livy-server0.9.0 incubandoInterfaz de REST para interactuar con Apache Spark
nginx1.12.1nginx [engine x] es un servidor HTTP y proxy inverso
mariadb-server5.5.68+Servidor de base de datos de MariaDB.
nvidia-cuda12.5.0Controladores Nvidia y conjunto de herramientas Cuda
r4.3.2Proyecto R para análisis estadístico
spark-client4.1.1-amzn-0Clientes de línea de comando de Spark.
spark-history-server4.1.1-amzn-0IU web para la visualización de eventos registrados durante la vida útil de una aplicación Spark completada.
spark-on-yarn4.1.1-amzn-0In-memory motor de ejecución para YARN.
spark-yarn-slave4.1.1-amzn-0Bibliotecas de Apache Spark necesarias para esclavos de YARN.
spark-rapids26.04.2-amzn-0Complemento Nvidia Spark RAPIDS que acelera Apache Spark con GPU.
zookeeper-server3.9.3-amzn-8Servicio centralizado para mantener información de configuración, nomenclatura, proporcionar sincronización distribuida y proporcionar servicios de grupo.
zookeeper-client3.9.3-amzn-8ZooKeeper cliente de línea de comandos.

clasificaciones de configuración de emr-spark-8.1.0

Las clasificaciones de configuración le permiten personalizar las aplicaciones. Suelen corresponder a un archivo XML de configuración para la aplicación como, por ejemplo, hive-site.xml. Para obtener más información, consulte Configuración de aplicaciones.

Las acciones de reconfiguración se producen cuando se especifica una configuración para los grupos de instancias de un clúster en ejecución. Amazon EMR solo inicia acciones de reconfiguración para las clasificaciones que se modifican. Para obtener más información, consulte Reconfiguración de un grupo de instancias en un clúster en ejecución.

clasificaciones de emr-spark-8.1.0
Clasificaciones Description (Descripción) Acciones de reconfiguración

capacity-scheduler

Cambiar los valores en el archivo capacity-scheduler.xml de Hadoop.

Restarts the ResourceManager service.

container-executor

Cambie los valores en el archivo container-executor.cfg de Hadoop YARN.

Not available.

container-log4j

Cambiar los valores en el archivo container-log4j.properties de Hadoop YARN.

Not available.

core-site

Cambiar los valores en el archivo core-site.xml de Hadoop.

Restarts the Hadoop HDFS services Namenode, SecondaryNamenode, Datanode, ZKFC, and Journalnode. Restarts the Hadoop YARN services ResourceManager, NodeManager, ProxyServer, and TimelineServer. Additionally restarts Hadoop KMS, Hadoop Httpfs, and MapReduce-HistoryServer.

docker-conf

Cambie la configuración relacionada con el docker.

Not available.

hadoop-env

Cambiar los valores en el entorno de Hadoop para todos los componentes de Hadoop.

Restarts the Hadoop HDFS services Namenode, SecondaryNamenode, Datanode, ZKFC, and Journalnode. Restarts the Hadoop YARN services ResourceManager, NodeManager, ProxyServer, and TimelineServer. Additionally restarts MapReduce-HistoryServer.

hadoop-log4j

Cambiar los valores en el archivo log4j.properties de Hadoop.

Restarts the Hadoop HDFS services SecondaryNamenode, Datanode, and Journalnode. Restarts the Hadoop YARN services ResourceManager, NodeManager, ProxyServer, and TimelineServer. Additionally restarts Hadoop KMS, Hadoop Httpfs, and MapReduce-HistoryServer.

hadoop-ssl-server

Cambiar la configuración del servidor ssl de Hadoop

Not available.

hadoop-ssl-client

Cambiar la configuración del cliente ssl de Hadoop

Not available.

hdfs-encryption-zones

Configurar zonas de cifrado de HDFS.

This classification should not be reconfigured.

hdfs-env

Cambiar los valores en el entorno de HDFS.

Restarts Hadoop HDFS services Namenode, Datanode, and ZKFC.

hdfs-site

Cambiar los valores en hdfs-site.xml de HDFS.

Restarts the Hadoop HDFS services Namenode, SecondaryNamenode, Datanode, ZKFC, and Journalnode. Additionally restarts Hadoop Httpfs.

httpfs-env

Cambiar los valores en el entorno de HTTPFS.

Restarts Hadoop Httpfs service.

httpfs-site

Cambiar los valores en el archivo httpfs-site.xml de Hadoop.

Restarts Hadoop Httpfs service.

hadoop-kms-acls

Cambiar los valores en el archivo kms-acls.xml de Hadoop.

Not available.

hadoop-kms-env

Cambiar los valores en el entorno de Hadoop KMS.

Restarts Hadoop-KMS service.

hadoop-kms-java-home

Cambie la página de inicio de Java de KMS de Hadoop

Not available.

hadoop-kms-log4j

Cambiar los valores en el archivo kms-log4j.properties de Hadoop.

Not available.

hadoop-kms-site

Cambiar los valores en el archivo kms-site.xml de Hadoop.

Restarts Hadoop-KMS.

hudi-env

Cambiar los valores en el entorno de Hudi.

Not available.

hudi-defaults

Cambie los valores en el archivo hudi-defaults.conf de Hudi.

Not available.

iceberg-defaults

Cambie los valores del archivo iceberg-defaults.conf de Iceberg.

Not available.

delta-defaults

Cambie los valores del archivo delta-defaults.conf de Delta.

Not available.

jupyter-notebook-conf

Cambiar los valores en el archivo jupyter_notebook_config.py de Jupyter Notebook.

Not available.

jupyter-s3-conf

Configurar la persistencia en S3 del bloc de notas de Jupyter.

Not available.

jupyter-sparkmagic-conf

Cambiar los valores en el archivo config.json de Sparkmagic.

Not available.

livy-conf

Cambiar los valores en el archivo livy.conf de Livy.

Restarts Livy Server.

livy-env

Cambiar los valores en el entorno de Livy.

Restarts Livy Server.

livy-log4j2

Cambiar la configuración de log4j2.properties de Livy.

Restarts Livy Server.

mapred-env

Cambie los valores en el entorno de la aplicación. MapReduce

Restarts Hadoop MapReduce-HistoryServer.

mapred-site

Cambie los valores en el archivo mapred-site.xml de la MapReduce aplicación.

Restarts Hadoop MapReduce-HistoryServer.

spark

EMR-curated Configuración de Amazon para Apache Spark.

This property modifies spark-defaults. See actions there.

spark-defaults

Cambiar los valores en el archivo spark-defaults.conf de Spark.

Restarts Spark history server and Spark thrift server.

spark-env

Cambiar los valores en el entorno de Spark.

Restarts Spark history server and Spark thrift server.

spark-hive-site

Cambiar los valores en el archivo hive-site.xml de Spark.

Not available.

spark-log4j2

Cambiar los valores en el archivo log4j2.properties de Spark.

Restarts Spark history server and Spark thrift server.

spark-metrics

Cambiar los valores en el archivo metrics.properties de Spark.

Restarts Spark history server and Spark thrift server.

yarn-env

Cambiar los valores en el entorno de YARN.

Restarts the Hadoop YARN services ResourceManager, NodeManager, ProxyServer, and TimelineServer. Additionally restarts MapReduce-HistoryServer.

yarn-site

Cambiar los valores en el archivo yarn-site.xml de YARN.

Restarts the Hadoop YARN services ResourceManager, NodeManager, ProxyServer, and TimelineServer. Additionally restarts Livy Server and MapReduce-HistoryServer.

zookeeper-config

Cambie los valores en ZooKeeper el archivo zoo.cfg.

Restarts Zookeeper server.

zookeeper-logback

Cambia los valores ZooKeeper del archivo logback.xml.

Restarts Zookeeper server.

cloudwatch-logs

Configure la integración de CloudWatch los registros para los nodos del clúster de EMR.

Not available.

emr-metrics

Cambie la configuración de la métrica EMR para este nodo.

Restarts the CloudWatchAgent service.

Registro de cambios de Amazon EMR Spark 8.1.0

Registro de cambios para Amazon EMR Spark 8.1.0
DateEventDescription (Descripción)
2026-09-08Publicación de documentosLas notas de la versión 8.1.0 (emr-spark-8.1.0) de Amazon EMR Spark se publicaron por primera vez