Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.
AWS tiempo de ejecución de Apache Spark (emr-spark-8.1.0)
Ciclo de vida compatible con emr-spark-8.1.0
Esta versión se designa como versión de soporte a largo plazo (LTS). En la siguiente tabla se describen las fechas de ciclo de vida admitidas para Amazon EMR Spark 8.1.0.
| Fase de soporte | Date |
|---|---|
| Fecha de lanzamiento inicial | 8 de septiembre de 2026 |
| Soporte estándar hasta | 7 de septiembre de 2029 |
| Fin de vida útil | 8 de septiembre de 2029 |
versiones de la aplicación emr-spark-8.1.0
Esta versión incluye las siguientes aplicaciones: AmazonCloudWatchAgent,,, Delta
En la siguiente tabla se enumeran las versiones de la aplicación disponibles en esta versión de Amazon EMR y las versiones de la aplicación en las tres versiones anteriores de Amazon EMR (cuando corresponda).
Para ver un historial completo de las versiones de la aplicación disponibles para cada versión de Amazon EMR, consulte los temas siguientes:
| emr-spark-8.1.0 | emr-spark-8.0.0 | |
|---|---|---|
| AWS SDK para Java | 2.4.5 | 2,41,32 |
| Python | 3.11, 3.13 | 3.11, 3.13 |
| Scala | 2.13.17 | 2.13,16 |
| AmazonCloudWatchAgent | 1.300034.0-amzn-0 | 1.300032.2-amzn-0 |
| Delta | 4.2.0-amzn-0 | 4.0.0-amzn-1-spark |
| Hudi | 1.1.1-amzn-0 | 1.1.0-amzn-0 |
| Iceberg | 1.11.0-amzn-0 | 1.10.1-amzn-0 |
| JupyterEnterpriseGateway | 2.6.0 | 2.6.0 |
| Livy | 0.9.0 incubando | 0.8.0-incubating |
| Spark | 4.1.1-amzn-0 | 4.0.2-amzn-0 |
notas de la versión de emr-spark-8.1.0
Las siguientes notas de la versión incluyen información sobre la versión 8.1.0 (emr-spark-8.1.0) de Amazon EMR, que incluye Apache Spark 4.1.1.
Novedades
Apache Spark 4.1.1: Amazon EMR Spark 8.1.0 incluye Apache Spark 4.1.1. Las dependencias actualizadas incluyen Scala 2.13.17, Jackson 2.20.0 y Parquet-MR 1.16.0, junto con nuevas funciones de Spark, mejoras de rendimiento y correcciones de errores.
Compatibilidad con las especificaciones de Iceberg v3 para las cargas de trabajo de Spark: Amazon EMR Spark 8.1.0 amplía la compatibilidad de las especificaciones de Iceberg v3 con las cargas de trabajo de Spark. Esta versión añade las siguientes funciones de la versión 3:
Tipos de datos geoespaciales: las tablas Iceberg v3 admiten los tipos de datos
GEOMETRYyGEOGRAPHY.Funciones SQL geoespaciales: Amazon EMR Spark 8.1.0 admite de forma nativa las funciones geoespaciales para las cargas de trabajo de Iceberg. Configúralo
trueen tu configuración de Sparkspark.sql.geospatial.enabledpara habilitar las funciones geoespaciales. Apache Spark 4.1 solo es compatible con los SRID 0, 3857 y 4326. Se admiten las siguientes funciones:st_area(geom)st_asbinary(geo[, endianness])st_collect(geoArray)st_convexhull(geom)st_distance(geom1, geom2)st_dwithin(geom1, geom2, distance)st_geogfromwkb(wkb)st_geomfromwkb(wkb[, srid])st_geomfromwkt(wkt[, srid])st_intersection(geom1, geom2)st_intersects(geom1, geom2)st_length(geom)st_makeline(geomArray)st_setsrid(geo, srid)st_srid(geo)st_within(geom1, geom2)st_x(point)st_y(point)
Nanosecond-precision marcas de tiempo: las tablas Iceberg v3 admiten columnas de marcas de tiempo de precisión de nanosegundos (y).
TIMESTAMP(9)TIMESTAMP_NTZ(9)Trituración de variantes: las tablas Iceberg v3 admiten la destrucción de variantes.
UNKNOWNtipo de datos: las tablas Iceberg v3 admiten el tipo deUNKNOWNdatos para las columnas cuyo tipo aún no está definido. Las columnas de este tipo son opcionales, el valor predeterminado es nulo y no se almacenan en archivos de datos.Valores predeterminados: las columnas de la versión 3 de Iceberg admiten los valores predeterminados declarados, que se aplican cuando un escritor omite la columna.
Compatibilidad ampliada con controles de acceso detallados para formatos de tablas abiertas: Amazon EMR Spark 8.1.0 amplía la compatibilidad con el control de acceso detallado (FGAC) para los formatos de tablas abiertas (OTF). Iceberg ahora es compatible con FGAC para operaciones adicionales:,,, y.
DESCRIBE TABLESHOW TBLPROPERTIESSHOW CREATE TABLEALTER TABLE table_name WRITE ORDERED BYALTER TABLE table_name WRITE DISTRIBUTED BYDelta Lake ahora apoya al FGAC en la operación.VACUUMMejoras en la actualización incremental de las vistas materializadas de Iceberg: la actualización incremental ahora admite Merge-on-Read tablas mediante la captura de datos modificados. Esto permite actualizar rápidamente las cargas de trabajo que utilizan actualizaciones y eliminaciones. La actualización solo lee los archivos de datos afectados por un cambio, utilizando estadísticas por archivo y por columna a nivel de manifiesto.
Multi-format compatibilidad con varios catálogos con detección automática: las consultas SQL de Spark ahora pueden hacer referencia a los catálogos por su nombre sin necesidad de registrarlos previamente en la configuración de Spark. Los tipos de catálogo compatibles incluyen los catálogos multicuenta y los catálogos federados de S3 Tables, con detección automática de los formatos de tablas Iceberg, Delta y Hudi. Para habilitar esta función, agrega la siguiente configuración de Spark:
"spark.sql.catalog.spark_catalog": "org.apache.spark.sql.connector.catalog.redirecting.RedirectingSessionCatalog", "spark.sql.catalogResolver": "com.amazonaws.glue.catalog.redirecting.GlueCatalogResolver"
Cambios, mejoras y problemas resueltos
Esta versión incluye correcciones de errores y mejoras de funciones para Iceberg, Hudi y Delta. Para obtener más información, consulte la sección Novedades.
Mejora de la tolerancia a la verificación del cifrado de disco durante el inicio del clúster: los clústeres con el cifrado de disco local habilitado en su configuración de seguridad ahora son más tolerantes a los retrasos transitorios de conectividad de red durante el arranque de la instancia. Este cambio reduce los errores intermitentes al iniciar el clúster.
Se corrigió el manejo de caracteres UTF-8 multibyte en las configuraciones de Amazon EMR: las configuraciones de Amazon EMR ahora admiten correctamente los caracteres multibyte. UTF-8 Esto incluye valores con letras acentuadas o alfabetos no latinos. Para obtener más información, consulte Configuración de aplicaciones.
Mejora de la fiabilidad de inicio del agente secreto: se corrigen dos problemas que podían provocar errores de aprovisionamiento de clústeres de Amazon EMR relacionados con el servicio de seguridad del agente secreto. La creación del certificado ahora espera a que HDFS esté listo para continuar y el script de inicio vuelve a intentar detectar el proceso Java del agente secreto. En conjunto, estos cambios reducen los errores de lanzamiento en los clústeres con una inicialización del almacenamiento más lenta o instancias muy cargadas.
Problemas conocidos y limitaciones
El cifrado nativo de tablas de Apache Iceberg solo se aplica cuando se utiliza Hive Metastore o un catálogo REST de Iceberg. Con el catálogo de datos de AWS Glue (incluido su punto final REST Iceberg) y el catálogo de Hadoop, estas propiedades se aceptan pero no se aplican. Como resultado, los datos se escriben en texto plano. Para cifrar los datos de la tabla Iceberg en reposo con estos catálogos, habilite el cifrado del lado del servidor de Amazon S3 con AWS KMS claves (SSE-KMS) en la ubicación de Amazon S3 de la tabla.
Las transformaciones que requieren más de un argumento no son compatibles con las tablas de Iceberg v3.
Versiones Java predeterminadas de emr-spark-8.1.0
| Aplicación | Versión de Java o Amazon Corretto (el valor predeterminado está en negrita) |
|---|---|
| Spark | 17, 21 |
| Livy | 17, 11, 8 |
| Hadoop | 17, 11, 8 |
versiones de componentes emr-spark-8.1.0
A continuación, se muestran los componentes que Amazon EMR instala con esta versión. Algunos se instalan como parte de paquetes de aplicación de macrodatos. Otros son exclusivos de Amazon EMR y se instalan para ciertos procesos y características del sistema. Por lo general, comienzan con o. emr aws Big-data Los paquetes de aplicaciones de la versión más reciente de Amazon EMR suelen ser la última versión que se encuentra en la comunidad. Intentamos que las versiones de la comunidad estén disponibles en Amazon EMR lo más rápido posible.
Algunos componentes de Amazon EMR son distintos de las versiones que se encuentran en la comunidad. Estos componentes tienen una etiqueta de versión con el formato . La CommunityVersion-amzn-EmrVersion empieza por 0. Por ejemplo, si un componente de la comunidad de código abierto llamado EmrVersionmyapp-component con la versión 2.2 se ha modificado tres veces para incluirlo en diferentes versiones de lanzamiento de Amazon EMR, la versión que se mostrará será 2.2-amzn-2.
| Componente | Versión | Description (Descripción) |
|---|---|---|
| adot-java-agent | 1.31.0 | Un agente Java que recopila métricas de los daemons de las aplicaciones. |
| delta | 4.2.0-amzn-0 | Delta Lake es un formato de tabla abierto para conjuntos de datos analíticos de gran tamaño |
| emr-amazon-cloudwatch-agent | 1.300034.0-amzn-0 | Se trata de una aplicación que recopila métricas internas de nivel de sistema y métricas de aplicación personalizadas de las instancias de Amazon EC2. |
| emr-ddb | 6.1.0 | Conector de Amazon DynamoDB para aplicaciones del ecosistema de Hadoop. |
| emr-goodies | 3.23.0-spark | Bibliotecas especialmente prácticas para el ecosistema de Hadoop. |
| emr-notebook-env | 1.18.0 | Entorno de Conda para cuaderno de EMR que incluye una puerta de enlace empresarial de Jupyter |
| emr-s3-dist-cp | 2.46.0 | Aplicación de copia distribuida optimizada para Amazon S3. |
| hadoop-client | 3.4.2-amzn-3 | Los clientes de línea de comando de Hadoop como, por ejemplo "hdfs", "hadoop" o "yarn". |
| hadoop-hdfs-datanode | 3.4.2-amzn-3 | Servicio de nivel de nodos de HDFS para el almacenamiento de bloques. |
| hadoop-hdfs-library | 3.4.2-amzn-3 | Biblioteca y cliente de línea de comandos HDFS |
| hadoop-hdfs-namenode | 3.4.2-amzn-3 | Servicio de HDFS para realizar un seguimiento de nombres de archivo y bloquear ubicaciones. |
| hadoop-hdfs-zkfc | 3.4.2-amzn-3 | Servicio ZKFC para rastrear nodos de nombres para el modo HA. |
| hadoop-hdfs-journalnode | 3.4.2-amzn-3 | Servicio de HDFS para administrar los archivos de Hadoop periódico en clústeres de alta disponibilidad. |
| hadoop-httpfs-server | 3.4.2-amzn-3 | Punto de enlace HTTP para operaciones HDFS. |
| hadoop-kms-server | 3.4.2-amzn-3 | Servidor de administración de claves criptográficas basado en la API de Hadoop. KeyProvider |
| hadoop-mapred | 3.4.2-amzn-3 | MapReduce bibliotecas de motores de ejecución para ejecutar una aplicación. MapReduce |
| hadoop-yarn-nodemanager | 3.4.2-amzn-3 | Servicio de YARN para la administración de contenedores en un nodo individual. |
| hadoop-yarn-resourcemanager | 3.4.2-amzn-3 | Servicio de YARN para la asignación y administración de recursos de clúster y aplicaciones distribuidas. |
| hadoop-yarn-timeline-server | 3.4.2-amzn-3 | Servicio para recuperar información actual e histórica para aplicaciones de YARN. |
| hudi | 1.1.1-amzn-0 | Marco de procesamiento incremental para impulsar la canalización de datos a baja latencia y alta eficiencia. |
| hudi-spark | 1.1.1-amzn-0 | Biblioteca de paquetes para ejecutar Spark con Hudi. |
| iceberg | 1.11.0-amzn-0 | Apache Iceberg es un formato de tabla abierto para conjuntos de datos analíticos muy grandes |
| livy-server | 0.9.0 incubando | Interfaz de REST para interactuar con Apache Spark |
| nginx | 1.12.1 | nginx [engine x] es un servidor HTTP y proxy inverso |
| mariadb-server | 5.5.68+ | Servidor de base de datos de MariaDB. |
| nvidia-cuda | 12.5.0 | Controladores Nvidia y conjunto de herramientas Cuda |
| r | 4.3.2 | Proyecto R para análisis estadístico |
| spark-client | 4.1.1-amzn-0 | Clientes de línea de comando de Spark. |
| spark-history-server | 4.1.1-amzn-0 | IU web para la visualización de eventos registrados durante la vida útil de una aplicación Spark completada. |
| spark-on-yarn | 4.1.1-amzn-0 | In-memory motor de ejecución para YARN. |
| spark-yarn-slave | 4.1.1-amzn-0 | Bibliotecas de Apache Spark necesarias para esclavos de YARN. |
| spark-rapids | 26.04.2-amzn-0 | Complemento Nvidia Spark RAPIDS que acelera Apache Spark con GPU. |
| zookeeper-server | 3.9.3-amzn-8 | Servicio centralizado para mantener información de configuración, nomenclatura, proporcionar sincronización distribuida y proporcionar servicios de grupo. |
| zookeeper-client | 3.9.3-amzn-8 | ZooKeeper cliente de línea de comandos. |
clasificaciones de configuración de emr-spark-8.1.0
Las clasificaciones de configuración le permiten personalizar las aplicaciones. Suelen corresponder a un archivo XML de configuración para la aplicación como, por ejemplo, hive-site.xml. Para obtener más información, consulte Configuración de aplicaciones.
Las acciones de reconfiguración se producen cuando se especifica una configuración para los grupos de instancias de un clúster en ejecución. Amazon EMR solo inicia acciones de reconfiguración para las clasificaciones que se modifican. Para obtener más información, consulte Reconfiguración de un grupo de instancias en un clúster en ejecución.
| Clasificaciones | Description (Descripción) | Acciones de reconfiguración |
|---|---|---|
capacity-scheduler | Cambiar los valores en el archivo capacity-scheduler.xml de Hadoop. | Restarts the ResourceManager service. |
container-executor | Cambie los valores en el archivo container-executor.cfg de Hadoop YARN. | Not available. |
container-log4j | Cambiar los valores en el archivo container-log4j.properties de Hadoop YARN. | Not available. |
core-site | Cambiar los valores en el archivo core-site.xml de Hadoop. | Restarts the Hadoop HDFS services Namenode, SecondaryNamenode, Datanode, ZKFC, and Journalnode. Restarts the Hadoop YARN services ResourceManager, NodeManager, ProxyServer, and TimelineServer. Additionally restarts Hadoop KMS, Hadoop Httpfs, and MapReduce-HistoryServer. |
docker-conf | Cambie la configuración relacionada con el docker. | Not available. |
hadoop-env | Cambiar los valores en el entorno de Hadoop para todos los componentes de Hadoop. | Restarts the Hadoop HDFS services Namenode, SecondaryNamenode, Datanode, ZKFC, and Journalnode. Restarts the Hadoop YARN services ResourceManager, NodeManager, ProxyServer, and TimelineServer. Additionally restarts MapReduce-HistoryServer. |
hadoop-log4j | Cambiar los valores en el archivo log4j.properties de Hadoop. | Restarts the Hadoop HDFS services SecondaryNamenode, Datanode, and Journalnode. Restarts the Hadoop YARN services ResourceManager, NodeManager, ProxyServer, and TimelineServer. Additionally restarts Hadoop KMS, Hadoop Httpfs, and MapReduce-HistoryServer. |
hadoop-ssl-server | Cambiar la configuración del servidor ssl de Hadoop | Not available. |
hadoop-ssl-client | Cambiar la configuración del cliente ssl de Hadoop | Not available. |
hdfs-encryption-zones | Configurar zonas de cifrado de HDFS. | This classification should not be reconfigured. |
hdfs-env | Cambiar los valores en el entorno de HDFS. | Restarts Hadoop HDFS services Namenode, Datanode, and ZKFC. |
hdfs-site | Cambiar los valores en hdfs-site.xml de HDFS. | Restarts the Hadoop HDFS services Namenode, SecondaryNamenode, Datanode, ZKFC, and Journalnode. Additionally restarts Hadoop Httpfs. |
httpfs-env | Cambiar los valores en el entorno de HTTPFS. | Restarts Hadoop Httpfs service. |
httpfs-site | Cambiar los valores en el archivo httpfs-site.xml de Hadoop. | Restarts Hadoop Httpfs service. |
hadoop-kms-acls | Cambiar los valores en el archivo kms-acls.xml de Hadoop. | Not available. |
hadoop-kms-env | Cambiar los valores en el entorno de Hadoop KMS. | Restarts Hadoop-KMS service. |
hadoop-kms-java-home | Cambie la página de inicio de Java de KMS de Hadoop | Not available. |
hadoop-kms-log4j | Cambiar los valores en el archivo kms-log4j.properties de Hadoop. | Not available. |
hadoop-kms-site | Cambiar los valores en el archivo kms-site.xml de Hadoop. | Restarts Hadoop-KMS. |
hudi-env | Cambiar los valores en el entorno de Hudi. | Not available. |
hudi-defaults | Cambie los valores en el archivo hudi-defaults.conf de Hudi. | Not available. |
iceberg-defaults | Cambie los valores del archivo iceberg-defaults.conf de Iceberg. | Not available. |
delta-defaults | Cambie los valores del archivo delta-defaults.conf de Delta. | Not available. |
jupyter-notebook-conf | Cambiar los valores en el archivo jupyter_notebook_config.py de Jupyter Notebook. | Not available. |
jupyter-s3-conf | Configurar la persistencia en S3 del bloc de notas de Jupyter. | Not available. |
jupyter-sparkmagic-conf | Cambiar los valores en el archivo config.json de Sparkmagic. | Not available. |
livy-conf | Cambiar los valores en el archivo livy.conf de Livy. | Restarts Livy Server. |
livy-env | Cambiar los valores en el entorno de Livy. | Restarts Livy Server. |
livy-log4j2 | Cambiar la configuración de log4j2.properties de Livy. | Restarts Livy Server. |
mapred-env | Cambie los valores en el entorno de la aplicación. MapReduce | Restarts Hadoop MapReduce-HistoryServer. |
mapred-site | Cambie los valores en el archivo mapred-site.xml de la MapReduce aplicación. | Restarts Hadoop MapReduce-HistoryServer. |
spark | EMR-curated Configuración de Amazon para Apache Spark. | This property modifies spark-defaults. See actions there. |
spark-defaults | Cambiar los valores en el archivo spark-defaults.conf de Spark. | Restarts Spark history server and Spark thrift server. |
spark-env | Cambiar los valores en el entorno de Spark. | Restarts Spark history server and Spark thrift server. |
spark-hive-site | Cambiar los valores en el archivo hive-site.xml de Spark. | Not available. |
spark-log4j2 | Cambiar los valores en el archivo log4j2.properties de Spark. | Restarts Spark history server and Spark thrift server. |
spark-metrics | Cambiar los valores en el archivo metrics.properties de Spark. | Restarts Spark history server and Spark thrift server. |
yarn-env | Cambiar los valores en el entorno de YARN. | Restarts the Hadoop YARN services ResourceManager, NodeManager, ProxyServer, and TimelineServer. Additionally restarts MapReduce-HistoryServer. |
yarn-site | Cambiar los valores en el archivo yarn-site.xml de YARN. | Restarts the Hadoop YARN services ResourceManager, NodeManager, ProxyServer, and TimelineServer. Additionally restarts Livy Server and MapReduce-HistoryServer. |
zookeeper-config | Cambie los valores en ZooKeeper el archivo zoo.cfg. | Restarts Zookeeper server. |
zookeeper-logback | Cambia los valores ZooKeeper del archivo logback.xml. | Restarts Zookeeper server. |
cloudwatch-logs | Configure la integración de CloudWatch los registros para los nodos del clúster de EMR. | Not available. |
emr-metrics | Cambie la configuración de la métrica EMR para este nodo. | Restarts the CloudWatchAgent service. |
Registro de cambios de Amazon EMR Spark 8.1.0
| Date | Event | Description (Descripción) |
|---|---|---|
| 2026-09-08 | Publicación de documentos | Las notas de la versión 8.1.0 (emr-spark-8.1.0) de Amazon EMR Spark se publicaron por primera vez |