View a markdown version of this page

AWS tempo de execução para o Apache Spark (emr-spark-8.1.0) - Amazon EMR

As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.

AWS tempo de execução para o Apache Spark (emr-spark-8.1.0)

ciclo de vida suportado pelo emr-spark-8.1.0

Esta versão foi designada como uma versão de suporte de longo prazo (LTS). A tabela a seguir descreve as datas do ciclo de vida suportadas pelo Amazon EMR Spark 8.1.0.

Fase de suporte Data
Data da versão inicial 8 de setembro de 2026
Suporte padrão até 7 de setembro de 2029
Fim da vida útil 8 de setembro de 2029

versões do aplicativo emr-spark-8.1.0

Esta versão inclui os seguintes aplicativos: AmazonCloudWatchAgent Delta Hudi, Iceberg, JupyterEnterpriseGateway Livy,, Spark e.

A tabela abaixo lista as versões das aplicações disponíveis nesta versão do Amazon EMR e as versões de aplicações nas três versões anteriores do Amazon EMR (quando aplicável).

Para obter um histórico abrangente das versões das aplicações de cada versão do Amazon EMR, consulte os seguintes tópicos:

Informações da versão da aplicação
emr-spark-8.1.0 emr-spark-8.0.0
AWS SDK para Java 2,44,52,41,32
Python 3,11, 3,133,11, 3,13
Scala 2.13,172.13,16
AmazonCloudWatchAgent1,300034,0-amzn-01.300032.2-amzn-0
Delta4.2.0-amzn-04.0.0-amzn-1-spark
Hudi1,1-amzn-01.1.0-amzn-0
Iceberg1.11.0-amzn-01.10.1-amzn-0
JupyterEnterpriseGateway2.6.02.6.0
Livy0.9.0 - incubação0.8.0-incubating
Spark4.1.1-amzn-04,0,2-amzn-0

notas de lançamento do emr-spark-8.1.0

As notas de lançamento a seguir incluem informações sobre o Amazon EMR versão 8.1.0 (emr-spark-8.1.0), com o Apache Spark 4.1.1.

O que há de novo

  • Apache Spark 4.1.1 — O Amazon EMR Spark 8.1.0 inclui o Apache Spark 4.1.1. As dependências atualizadas incluem Scala 2.13.17, Jackson 2.20.0 e Parquet-MR 1.16.0, além de novos recursos do Spark, melhorias de desempenho e correções de erros.

  • Suporte às especificações do Iceberg v3 para cargas de trabalho do Spark — O Amazon EMR Spark 8.1.0 amplia o suporte às especificações do Iceberg v3 para cargas de trabalho do Spark. Esta versão adiciona os seguintes recursos v3:

    • Tipos de dados geoespaciais — As tabelas Iceberg v3 suportam os tipos de dados GEOMETRY e. GEOGRAPHY

    • Funções SQL geoespaciais — O Amazon EMR Spark 8.1.0 oferece suporte nativo a funções geoespaciais para cargas de trabalho do Iceberg. spark.sql.geospatial.enabledDefina como true em sua configuração do Spark para ativar funções geoespaciais. O Apache Spark 4.1 suporta somente SRID 0, 3857 e 4326. As seguintes funções são suportadas:

      • st_area(geom)

      • st_asbinary(geo[, endianness])

      • st_collect(geoArray)

      • st_convexhull(geom)

      • st_distance(geom1, geom2)

      • st_dwithin(geom1, geom2, distance)

      • st_geogfromwkb(wkb)

      • st_geomfromwkb(wkb[, srid])

      • st_geomfromwkt(wkt[, srid])

      • st_intersection(geom1, geom2)

      • st_intersects(geom1, geom2)

      • st_length(geom)

      • st_makeline(geomArray)

      • st_setsrid(geo, srid)

      • st_srid(geo)

      • st_within(geom1, geom2)

      • st_x(point)

      • st_y(point)

    • Nanosecond-precision timestamps — As tabelas Iceberg v3 suportam colunas de timestamp de precisão de nanossegundos (e). TIMESTAMP(9) TIMESTAMP_NTZ(9)

    • Destruição de variantes — As tabelas Iceberg v3 suportam a destruição de variantes.

    • UNKNOWNtipo de dados — As tabelas Iceberg v3 suportam o tipo de UNKNOWN dados para colunas cujo tipo ainda não está definido. As colunas desse tipo são opcionais, por padrão são nulas e não são armazenadas em arquivos de dados.

    • Valores padrão — As colunas Iceberg v3 suportam valores padrão declarados, que se aplicam quando um escritor omite a coluna.

  • Suporte estendido de controle de acesso refinado para formatos de tabela aberta — O Amazon EMR Spark 8.1.0 estende o suporte de controle de acesso refinado (FGAC) para formatos de tabela aberta (OTFs). O Iceberg agora oferece suporte ao FGAC para operações adicionais:DESCRIBE TABLE,SHOW TBLPROPERTIES,SHOW CREATE TABLE, e. ALTER TABLE table_name WRITE ORDERED BY ALTER TABLE table_name WRITE DISTRIBUTED BY A Delta Lake agora oferece suporte ao FGAC para a VACUUM operação.

  • Melhorias na atualização incremental para visualizações materializadas do Iceberg — A atualização incremental agora oferece suporte Merge-on-Read a tabelas por meio da captura de dados de alterações. Isso permite atualizações rápidas para cargas de trabalho que usam atualizações e exclusões. O Refresh lê somente os arquivos de dados afetados por uma alteração, usando estatísticas de coluna por arquivo e em nível de manifesto.

  • Multi-format suporte a vários catálogos com descoberta automática — as consultas SQL do Spark agora podem referenciar catálogos pelo nome sem pré-registrá-los na configuração do Spark. Os tipos de catálogo compatíveis incluem catálogos entre contas e catálogos federados do S3 Tables, com detecção automática dos formatos de tabela Iceberg, Delta e Hudi. Para ativar esse recurso, adicione a seguinte configuração do Spark: "spark.sql.catalog.spark_catalog": "org.apache.spark.sql.connector.catalog.redirecting.RedirectingSessionCatalog", "spark.sql.catalogResolver": "com.amazonaws.glue.catalog.redirecting.GlueCatalogResolver"

Alterações, melhorias e problemas resolvidos

  • Esta versão inclui correções de erros e melhorias de recursos para Iceberg, Hudi e Delta. Para obter mais informações, consulte a seção O que há de novo.

  • Tolerância aprimorada na verificação da criptografia de disco durante a inicialização do cluster — Clusters com criptografia de disco local ativada em sua configuração de segurança agora são mais tolerantes a atrasos transitórios de conectividade de rede durante a inicialização da instância. Essa alteração reduz as falhas intermitentes na inicialização do cluster.

  • UTF-8 Manipulação fixa de caracteres multibyte nas configurações do Amazon EMR — as configurações do Amazon EMR agora suportam corretamente caracteres multibyte. UTF-8 Isso inclui valores com letras acentuadas ou escritas não latinas. Para obter mais informações, consulte Configure applications.

  • Confiabilidade aprimorada na inicialização do Secret Agent — corrige dois problemas que poderiam causar falhas no provisionamento de clusters do Amazon EMR relacionadas ao serviço de segurança do Secret Agent. A criação do certificado agora aguarda a prontidão do HDFS antes de continuar, e o script de inicialização tenta detectar novamente o processo Java do Agente Secreto. Juntas, essas mudanças reduzem as falhas de inicialização em clusters com inicialização de armazenamento mais lenta ou instâncias muito carregadas.

Problemas conhecidos e limitações

  • A criptografia de tabela nativa do Apache Iceberg é aplicada somente quando você usa o Hive Metastore ou um catálogo REST do Iceberg. Com o AWS Glue Data Catalog (incluindo seu endpoint REST Iceberg) e o catálogo do Hadoop, essas propriedades são aceitas, mas não aplicadas. Como resultado, os dados são gravados em texto simples. Para criptografar os dados da tabela Iceberg em repouso com esses catálogos, habilite a criptografia do lado do servidor do Amazon S3 com AWS KMS chaves () SSE-KMS na localização do Amazon S3 da tabela.

  • As transformações que usam mais de um argumento não são suportadas pelas tabelas Iceberg v3.

versões Java padrão do emr-spark-8.1.0

AplicaçãoVersão Java/Amazon Corretto (o padrão é negrito)
Spark17, 21
Livy17, 11, 8
Hadoop17, 11, 8

versões do componente emr-spark-8.1.0

Os componentes que o Amazon EMR instala com esta versão estão listados abaixo. Alguns são instalados como parte de pacotes de aplicativos de big data. Outros são exclusivos do Amazon EMR e instalados para processos e atributos do sistema. Normalmente, eles começam com emr ouaws. Big-data os pacotes de aplicativos na versão mais recente do Amazon EMR geralmente são a versão mais recente encontrada na comunidade. Disponibilizamos as versões da comunidade no Amazon EMR o mais rapidamente possível.

Alguns componentes no Amazon EMR diferem das versões da comunidade. Esses componentes tem um rótulo de versão no formulário CommunityVersion-amzn-EmrVersion. O EmrVersion começa em 0. Por exemplo, se um componente da comunidade de código aberto denominado myapp-component com a versão 2.2 tiver sido alterado três vezes para inclusão em versões diferentes do Amazon EMR, sua versão será listada como 2.2-amzn-2.

Componente Versão Description
adot-java-agent1,31,0Um Java Agent que coleta métricas de daemons de aplicações.
delta4.2.0-amzn-0O Delta Lake é um formato de tabela aberto para grandes conjuntos de dados analíticos
emr-amazon-cloudwatch-agent1,300034,0-amzn-0Uma aplicação que coleta métricas internas no nível do sistema e métricas de aplicações personalizadas de instâncias do Amazon EC2.
emr-ddb6.1.0O conector do Amazon DynamoDB para aplicativos do ecossistema do Hadoop.
emr-goodies3.23.0-sparkBibliotecas convenientes para o ecossistema do Hadoop.
emr-notebook-env1.18.0Ambiente Conda para bloco de anotações do emr, que inclui o jupyter enterprise gateway
emr-s3-dist-cp2,46,0Cópia distribuída otimizada de aplicativos para o Amazon S3.
hadoop-client3.4.2-amzn-3Clientes da linha de comando do Hadoop, como 'hdfs', 'hadoop', ou 'yarn'.
hadoop-hdfs-datanode3.4.2-amzn-3O serviço de nível de nó do HDFS para armazenamento de blocos.
hadoop-hdfs-library3.4.2-amzn-3O cliente de linha de comando e biblioteca do HDFS
hadoop-hdfs-namenode3.4.2-amzn-3O serviço do HDFS para rastrear nomes de arquivos e locais de blocos.
hadoop-hdfs-zkfc3.4.2-amzn-3Serviço ZKFC para rastrear namenodes para o modo HA.
hadoop-hdfs-journalnode3.4.2-amzn-3O serviço do HDFS para gerenciar o lançamento de arquivos do Hadoop em clusters de HA.
hadoop-httpfs-server3.4.2-amzn-3O endpoint de HTTP para as operações do HDFS.
hadoop-kms-server3.4.2-amzn-3Servidor de gerenciamento de chaves criptográficas baseado na API do Hadoop. KeyProvider
hadoop-mapred3.4.2-amzn-3MapReduce bibliotecas de mecanismos de execução para executar um MapReduce aplicativo.
hadoop-yarn-nodemanager3.4.2-amzn-3O serviço do YARN para o gerenciamento de contêineres em um nó individual.
hadoop-yarn-resourcemanager3.4.2-amzn-3O serviço do YARN para alocar e gerenciar recursos de cluster e aplicativos distribuídos.
hadoop-yarn-timeline-server3.4.2-amzn-3O serviço para recuperar informações atuais e históricas dos aplicativos do YARN.
hudi1,1-amzn-0Estrutura de processamento incremental para alimentar o pipeline de dados com baixa latência e alta eficiência.
hudi-spark1,1-amzn-0Biblioteca de pacotes para executar o Spark com o Hudi.
iceberg1.11.0-amzn-0Apache Iceberg é um formato de tabela aberta para conjuntos de dados analíticos imensos
livy-server0.9.0 - incubaçãoInterface REST para interagir com o Apache Spark
nginx1.12.1nginx [mecanismo x] é um servidor de proxy reverso e HTTP
mariadb-server5.5.68+Servidor de banco de dados MariaDB.
nvidia-cuda12.5.0Drivers NVIDIA e toolkit CUDA
r4.3.2O projeto R para computação estatística
spark-client4.1.1-amzn-0Os clientes da linha de comando do Spark.
spark-history-server4.1.1-amzn-0A interface de usuário da web para visualizar os eventos registrados por toda a vida útil de um aplicativo Spark concluído.
spark-on-yarn4.1.1-amzn-0In-memory mecanismo de execução para YARN.
spark-yarn-slave4.1.1-amzn-0As bibliotecas do Apache Spark necessárias para subordinados do YARN.
spark-rapids26.04.2-amzn-0Plugin do Nvidia Spark RAPIDS que acelera o Apache Spark com GPUs.
zookeeper-server3,9.3-amzn-8O serviço centralizado de manutenção de informações de configuração, nomenclatura, fornecimento de sincronização distribuída, e fornecimento de serviços de grupo.
zookeeper-client3,9.3-amzn-8ZooKeeper cliente de linha de comando.

classificações de configuração do emr-spark-8.1.0

As classificações de configuração permitem que você personalize aplicações. Elas geralmente correspondem a um arquivo XML de configuração da aplicação, como hive-site.xml. Para obter mais informações, consulte Configurar aplicações.

Ocorrem ações de reconfiguração quando você especifica uma configuração para grupos de instâncias em um cluster em execução. O Amazon EMR só inicia ações de reconfiguração para as classificações que você modifica. Para obter mais informações, consulte Reconfigurar um grupo de instâncias de um cluster em execução.

classificações emr-spark-8.1.0
Classificações Description Ações de reconfiguração

capacity-scheduler

Alterar os valores no arquivo capacity-scheduler.xml do Hadoop.

Restarts the ResourceManager service.

container-executor

Alterar os valores no arquivo container-executor.cfg do YARN do Hadoop.

Not available.

container-log4j

Altere os valores no arquivo container-log4j.properties do YARN do Hadoop.

Not available.

core-site

Alterar os valores no arquivo core-site.xml do Hadoop.

Restarts the Hadoop HDFS services Namenode, SecondaryNamenode, Datanode, ZKFC, and Journalnode. Restarts the Hadoop YARN services ResourceManager, NodeManager, ProxyServer, and TimelineServer. Additionally restarts Hadoop KMS, Hadoop Httpfs, and MapReduce-HistoryServer.

docker-conf

Alterar as configurações relacionadas ao docker.

Not available.

hadoop-env

Alterar os valores no ambiente do Hadoop para todos os componentes do Hadoop.

Restarts the Hadoop HDFS services Namenode, SecondaryNamenode, Datanode, ZKFC, and Journalnode. Restarts the Hadoop YARN services ResourceManager, NodeManager, ProxyServer, and TimelineServer. Additionally restarts MapReduce-HistoryServer.

hadoop-log4j

Alterar os valores no arquivo log4j.properties do Hadoop.

Restarts the Hadoop HDFS services SecondaryNamenode, Datanode, and Journalnode. Restarts the Hadoop YARN services ResourceManager, NodeManager, ProxyServer, and TimelineServer. Additionally restarts Hadoop KMS, Hadoop Httpfs, and MapReduce-HistoryServer.

hadoop-ssl-server

Alterar a configuração do servidor SSL no Hadoop

Not available.

hadoop-ssl-client

Alterar a configuração do cliente SSL no Hadoop

Not available.

hdfs-encryption-zones

Configurar as zonas de criptografia do HDFS.

This classification should not be reconfigured.

hdfs-env

Alterar os valores no ambiente do HDFS.

Restarts Hadoop HDFS services Namenode, Datanode, and ZKFC.

hdfs-site

Alterar os valores no arquivo hdfs-site.xml do HDFS.

Restarts the Hadoop HDFS services Namenode, SecondaryNamenode, Datanode, ZKFC, and Journalnode. Additionally restarts Hadoop Httpfs.

httpfs-env

Alterar os valores no ambiente do HTTPFS.

Restarts Hadoop Httpfs service.

httpfs-site

Alterar os valores no arquivo httpfs-site.xml do Hadoop.

Restarts Hadoop Httpfs service.

hadoop-kms-acls

Alterar os valores no arquivo kms-acls.xml do Hadoop.

Not available.

hadoop-kms-env

Alterar os valores no ambiente do Hadoop KMS.

Restarts Hadoop-KMS service.

hadoop-kms-java-home

Alterar a página inicial do KMS do Hadoop

Not available.

hadoop-kms-log4j

Alterar os valores no arquivo kms-log4j.properties do Hadoop.

Not available.

hadoop-kms-site

Alterar os valores no arquivo kms-site.xml do Hadoop.

Restarts Hadoop-KMS.

hudi-env

Altere os valores no ambiente do Hudi.

Not available.

hudi-defaults

Alterar os valores no arquivo hudi-defaults.conf do Hudi.

Not available.

iceberg-defaults

Alterar os valores no arquivo iceberg-defaults.conf do Iceberg.

Not available.

delta-defaults

Alterar os valores no arquivo delta-defaults.conf do Delta.

Not available.

jupyter-notebook-conf

Alterar os valores no arquivo jupyter_notebook_config.py do Notebook Jupyter.

Not available.

jupyter-s3-conf

Configurar a persistência do notebook Jupyter S3.

Not available.

jupyter-sparkmagic-conf

Altere os valores no arquivo config.json do Sparkmagic.

Not available.

livy-conf

Alterar os valores no arquivo livy.conf do Livy.

Restarts Livy Server.

livy-env

Alterar os valores no ambiente do Livy.

Restarts Livy Server.

livy-log4j2

Alterar as configurações de log4j2.properties do Livy.

Restarts Livy Server.

mapred-env

Altere os valores no ambiente do MapReduce aplicativo.

Restarts Hadoop MapReduce-HistoryServer.

mapred-site

Altere os valores no arquivo mapred-site.xml do MapReduce aplicativo.

Restarts Hadoop MapReduce-HistoryServer.

spark

EMR-curated Configurações da Amazon para o Apache Spark.

This property modifies spark-defaults. See actions there.

spark-defaults

Alterar os valores no arquivo spark-defaults.conf do Spark.

Restarts Spark history server and Spark thrift server.

spark-env

Alterar os valores no ambiente do Spark.

Restarts Spark history server and Spark thrift server.

spark-hive-site

Alterar os valores no arquivo hive-site.xml do Spark.

Not available.

spark-log4j2

Alterar os valores no arquivo log4j2.properties do Spark.

Restarts Spark history server and Spark thrift server.

spark-metrics

Alterar os valores no arquivo metrics.properties do Spark.

Restarts Spark history server and Spark thrift server.

yarn-env

Alterar os valores no ambiente do YARN.

Restarts the Hadoop YARN services ResourceManager, NodeManager, ProxyServer, and TimelineServer. Additionally restarts MapReduce-HistoryServer.

yarn-site

Alterar os valores no arquivo yarn-site.xml do YARN.

Restarts the Hadoop YARN services ResourceManager, NodeManager, ProxyServer, and TimelineServer. Additionally restarts Livy Server and MapReduce-HistoryServer.

zookeeper-config

Altere os valores no ZooKeeper arquivo zoo.cfg.

Restarts Zookeeper server.

zookeeper-logback

Altere os valores no ZooKeeper arquivo logback.xml.

Restarts Zookeeper server.

cloudwatch-logs

Configure a integração de CloudWatch registros para nós de cluster do EMR.

Not available.

emr-metrics

Altere as configurações de métricas do EMR desse nó.

Restarts the CloudWatchAgent service.

Registro de alterações do Amazon EMR Spark 8.1.0

Registro de alterações do Amazon EMR Spark 8.1.0
DataEventDescription
2026-09-08Publicação de documentosNotas de lançamento do Amazon EMR Spark 8.1.0 (emr-spark-8.1.0) publicadas pela primeira vez