As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.
AWS tempo de execução para o Apache Spark (emr-spark-8.1.0)
ciclo de vida suportado pelo emr-spark-8.1.0
Esta versão foi designada como uma versão de suporte de longo prazo (LTS). A tabela a seguir descreve as datas do ciclo de vida suportadas pelo Amazon EMR Spark 8.1.0.
| Fase de suporte | Data |
|---|---|
| Data da versão inicial | 8 de setembro de 2026 |
| Suporte padrão até | 7 de setembro de 2029 |
| Fim da vida útil | 8 de setembro de 2029 |
versões do aplicativo emr-spark-8.1.0
Esta versão inclui os seguintes aplicativos: AmazonCloudWatchAgent Delta
A tabela abaixo lista as versões das aplicações disponíveis nesta versão do Amazon EMR e as versões de aplicações nas três versões anteriores do Amazon EMR (quando aplicável).
Para obter um histórico abrangente das versões das aplicações de cada versão do Amazon EMR, consulte os seguintes tópicos:
| emr-spark-8.1.0 | emr-spark-8.0.0 | |
|---|---|---|
| AWS SDK para Java | 2,44,5 | 2,41,32 |
| Python | 3,11, 3,13 | 3,11, 3,13 |
| Scala | 2.13,17 | 2.13,16 |
| AmazonCloudWatchAgent | 1,300034,0-amzn-0 | 1.300032.2-amzn-0 |
| Delta | 4.2.0-amzn-0 | 4.0.0-amzn-1-spark |
| Hudi | 1,1-amzn-0 | 1.1.0-amzn-0 |
| Iceberg | 1.11.0-amzn-0 | 1.10.1-amzn-0 |
| JupyterEnterpriseGateway | 2.6.0 | 2.6.0 |
| Livy | 0.9.0 - incubação | 0.8.0-incubating |
| Spark | 4.1.1-amzn-0 | 4,0,2-amzn-0 |
notas de lançamento do emr-spark-8.1.0
As notas de lançamento a seguir incluem informações sobre o Amazon EMR versão 8.1.0 (emr-spark-8.1.0), com o Apache Spark 4.1.1.
O que há de novo
Apache Spark 4.1.1 — O Amazon EMR Spark 8.1.0 inclui o Apache Spark 4.1.1. As dependências atualizadas incluem Scala 2.13.17, Jackson 2.20.0 e Parquet-MR 1.16.0, além de novos recursos do Spark, melhorias de desempenho e correções de erros.
Suporte às especificações do Iceberg v3 para cargas de trabalho do Spark — O Amazon EMR Spark 8.1.0 amplia o suporte às especificações do Iceberg v3 para cargas de trabalho do Spark. Esta versão adiciona os seguintes recursos v3:
Tipos de dados geoespaciais — As tabelas Iceberg v3 suportam os tipos de dados
GEOMETRYe.GEOGRAPHYFunções SQL geoespaciais — O Amazon EMR Spark 8.1.0 oferece suporte nativo a funções geoespaciais para cargas de trabalho do Iceberg.
spark.sql.geospatial.enabledDefina comotrueem sua configuração do Spark para ativar funções geoespaciais. O Apache Spark 4.1 suporta somente SRID 0, 3857 e 4326. As seguintes funções são suportadas:st_area(geom)st_asbinary(geo[, endianness])st_collect(geoArray)st_convexhull(geom)st_distance(geom1, geom2)st_dwithin(geom1, geom2, distance)st_geogfromwkb(wkb)st_geomfromwkb(wkb[, srid])st_geomfromwkt(wkt[, srid])st_intersection(geom1, geom2)st_intersects(geom1, geom2)st_length(geom)st_makeline(geomArray)st_setsrid(geo, srid)st_srid(geo)st_within(geom1, geom2)st_x(point)st_y(point)
Nanosecond-precision timestamps — As tabelas Iceberg v3 suportam colunas de timestamp de precisão de nanossegundos (e).
TIMESTAMP(9)TIMESTAMP_NTZ(9)Destruição de variantes — As tabelas Iceberg v3 suportam a destruição de variantes.
UNKNOWNtipo de dados — As tabelas Iceberg v3 suportam o tipo deUNKNOWNdados para colunas cujo tipo ainda não está definido. As colunas desse tipo são opcionais, por padrão são nulas e não são armazenadas em arquivos de dados.Valores padrão — As colunas Iceberg v3 suportam valores padrão declarados, que se aplicam quando um escritor omite a coluna.
Suporte estendido de controle de acesso refinado para formatos de tabela aberta — O Amazon EMR Spark 8.1.0 estende o suporte de controle de acesso refinado (FGAC) para formatos de tabela aberta (OTFs). O Iceberg agora oferece suporte ao FGAC para operações adicionais:
DESCRIBE TABLE,SHOW TBLPROPERTIES,SHOW CREATE TABLE, e.ALTER TABLE table_name WRITE ORDERED BYALTER TABLE table_name WRITE DISTRIBUTED BYA Delta Lake agora oferece suporte ao FGAC para aVACUUMoperação.Melhorias na atualização incremental para visualizações materializadas do Iceberg — A atualização incremental agora oferece suporte Merge-on-Read a tabelas por meio da captura de dados de alterações. Isso permite atualizações rápidas para cargas de trabalho que usam atualizações e exclusões. O Refresh lê somente os arquivos de dados afetados por uma alteração, usando estatísticas de coluna por arquivo e em nível de manifesto.
Multi-format suporte a vários catálogos com descoberta automática — as consultas SQL do Spark agora podem referenciar catálogos pelo nome sem pré-registrá-los na configuração do Spark. Os tipos de catálogo compatíveis incluem catálogos entre contas e catálogos federados do S3 Tables, com detecção automática dos formatos de tabela Iceberg, Delta e Hudi. Para ativar esse recurso, adicione a seguinte configuração do Spark:
"spark.sql.catalog.spark_catalog": "org.apache.spark.sql.connector.catalog.redirecting.RedirectingSessionCatalog", "spark.sql.catalogResolver": "com.amazonaws.glue.catalog.redirecting.GlueCatalogResolver"
Alterações, melhorias e problemas resolvidos
Esta versão inclui correções de erros e melhorias de recursos para Iceberg, Hudi e Delta. Para obter mais informações, consulte a seção O que há de novo.
Tolerância aprimorada na verificação da criptografia de disco durante a inicialização do cluster — Clusters com criptografia de disco local ativada em sua configuração de segurança agora são mais tolerantes a atrasos transitórios de conectividade de rede durante a inicialização da instância. Essa alteração reduz as falhas intermitentes na inicialização do cluster.
UTF-8 Manipulação fixa de caracteres multibyte nas configurações do Amazon EMR — as configurações do Amazon EMR agora suportam corretamente caracteres multibyte. UTF-8 Isso inclui valores com letras acentuadas ou escritas não latinas. Para obter mais informações, consulte Configure applications.
Confiabilidade aprimorada na inicialização do Secret Agent — corrige dois problemas que poderiam causar falhas no provisionamento de clusters do Amazon EMR relacionadas ao serviço de segurança do Secret Agent. A criação do certificado agora aguarda a prontidão do HDFS antes de continuar, e o script de inicialização tenta detectar novamente o processo Java do Agente Secreto. Juntas, essas mudanças reduzem as falhas de inicialização em clusters com inicialização de armazenamento mais lenta ou instâncias muito carregadas.
Problemas conhecidos e limitações
A criptografia de tabela nativa do Apache Iceberg é aplicada somente quando você usa o Hive Metastore ou um catálogo REST do Iceberg. Com o AWS Glue Data Catalog (incluindo seu endpoint REST Iceberg) e o catálogo do Hadoop, essas propriedades são aceitas, mas não aplicadas. Como resultado, os dados são gravados em texto simples. Para criptografar os dados da tabela Iceberg em repouso com esses catálogos, habilite a criptografia do lado do servidor do Amazon S3 com AWS KMS chaves () SSE-KMS na localização do Amazon S3 da tabela.
As transformações que usam mais de um argumento não são suportadas pelas tabelas Iceberg v3.
versões Java padrão do emr-spark-8.1.0
| Aplicação | Versão Java/Amazon Corretto (o padrão é negrito) |
|---|---|
| Spark | 17, 21 |
| Livy | 17, 11, 8 |
| Hadoop | 17, 11, 8 |
versões do componente emr-spark-8.1.0
Os componentes que o Amazon EMR instala com esta versão estão listados abaixo. Alguns são instalados como parte de pacotes de aplicativos de big data. Outros são exclusivos do Amazon EMR e instalados para processos e atributos do sistema. Normalmente, eles começam com emr ouaws. Big-data os pacotes de aplicativos na versão mais recente do Amazon EMR geralmente são a versão mais recente encontrada na comunidade. Disponibilizamos as versões da comunidade no Amazon EMR o mais rapidamente possível.
Alguns componentes no Amazon EMR diferem das versões da comunidade. Esses componentes tem um rótulo de versão no formulário . O CommunityVersion-amzn-EmrVersion começa em 0. Por exemplo, se um componente da comunidade de código aberto denominado EmrVersionmyapp-component com a versão 2.2 tiver sido alterado três vezes para inclusão em versões diferentes do Amazon EMR, sua versão será listada como 2.2-amzn-2.
| Componente | Versão | Description |
|---|---|---|
| adot-java-agent | 1,31,0 | Um Java Agent que coleta métricas de daemons de aplicações. |
| delta | 4.2.0-amzn-0 | O Delta Lake é um formato de tabela aberto para grandes conjuntos de dados analíticos |
| emr-amazon-cloudwatch-agent | 1,300034,0-amzn-0 | Uma aplicação que coleta métricas internas no nível do sistema e métricas de aplicações personalizadas de instâncias do Amazon EC2. |
| emr-ddb | 6.1.0 | O conector do Amazon DynamoDB para aplicativos do ecossistema do Hadoop. |
| emr-goodies | 3.23.0-spark | Bibliotecas convenientes para o ecossistema do Hadoop. |
| emr-notebook-env | 1.18.0 | Ambiente Conda para bloco de anotações do emr, que inclui o jupyter enterprise gateway |
| emr-s3-dist-cp | 2,46,0 | Cópia distribuída otimizada de aplicativos para o Amazon S3. |
| hadoop-client | 3.4.2-amzn-3 | Clientes da linha de comando do Hadoop, como 'hdfs', 'hadoop', ou 'yarn'. |
| hadoop-hdfs-datanode | 3.4.2-amzn-3 | O serviço de nível de nó do HDFS para armazenamento de blocos. |
| hadoop-hdfs-library | 3.4.2-amzn-3 | O cliente de linha de comando e biblioteca do HDFS |
| hadoop-hdfs-namenode | 3.4.2-amzn-3 | O serviço do HDFS para rastrear nomes de arquivos e locais de blocos. |
| hadoop-hdfs-zkfc | 3.4.2-amzn-3 | Serviço ZKFC para rastrear namenodes para o modo HA. |
| hadoop-hdfs-journalnode | 3.4.2-amzn-3 | O serviço do HDFS para gerenciar o lançamento de arquivos do Hadoop em clusters de HA. |
| hadoop-httpfs-server | 3.4.2-amzn-3 | O endpoint de HTTP para as operações do HDFS. |
| hadoop-kms-server | 3.4.2-amzn-3 | Servidor de gerenciamento de chaves criptográficas baseado na API do Hadoop. KeyProvider |
| hadoop-mapred | 3.4.2-amzn-3 | MapReduce bibliotecas de mecanismos de execução para executar um MapReduce aplicativo. |
| hadoop-yarn-nodemanager | 3.4.2-amzn-3 | O serviço do YARN para o gerenciamento de contêineres em um nó individual. |
| hadoop-yarn-resourcemanager | 3.4.2-amzn-3 | O serviço do YARN para alocar e gerenciar recursos de cluster e aplicativos distribuídos. |
| hadoop-yarn-timeline-server | 3.4.2-amzn-3 | O serviço para recuperar informações atuais e históricas dos aplicativos do YARN. |
| hudi | 1,1-amzn-0 | Estrutura de processamento incremental para alimentar o pipeline de dados com baixa latência e alta eficiência. |
| hudi-spark | 1,1-amzn-0 | Biblioteca de pacotes para executar o Spark com o Hudi. |
| iceberg | 1.11.0-amzn-0 | Apache Iceberg é um formato de tabela aberta para conjuntos de dados analíticos imensos |
| livy-server | 0.9.0 - incubação | Interface REST para interagir com o Apache Spark |
| nginx | 1.12.1 | nginx [mecanismo x] é um servidor de proxy reverso e HTTP |
| mariadb-server | 5.5.68+ | Servidor de banco de dados MariaDB. |
| nvidia-cuda | 12.5.0 | Drivers NVIDIA e toolkit CUDA |
| r | 4.3.2 | O projeto R para computação estatística |
| spark-client | 4.1.1-amzn-0 | Os clientes da linha de comando do Spark. |
| spark-history-server | 4.1.1-amzn-0 | A interface de usuário da web para visualizar os eventos registrados por toda a vida útil de um aplicativo Spark concluído. |
| spark-on-yarn | 4.1.1-amzn-0 | In-memory mecanismo de execução para YARN. |
| spark-yarn-slave | 4.1.1-amzn-0 | As bibliotecas do Apache Spark necessárias para subordinados do YARN. |
| spark-rapids | 26.04.2-amzn-0 | Plugin do Nvidia Spark RAPIDS que acelera o Apache Spark com GPUs. |
| zookeeper-server | 3,9.3-amzn-8 | O serviço centralizado de manutenção de informações de configuração, nomenclatura, fornecimento de sincronização distribuída, e fornecimento de serviços de grupo. |
| zookeeper-client | 3,9.3-amzn-8 | ZooKeeper cliente de linha de comando. |
classificações de configuração do emr-spark-8.1.0
As classificações de configuração permitem que você personalize aplicações. Elas geralmente correspondem a um arquivo XML de configuração da aplicação, como hive-site.xml. Para obter mais informações, consulte Configurar aplicações.
Ocorrem ações de reconfiguração quando você especifica uma configuração para grupos de instâncias em um cluster em execução. O Amazon EMR só inicia ações de reconfiguração para as classificações que você modifica. Para obter mais informações, consulte Reconfigurar um grupo de instâncias de um cluster em execução.
| Classificações | Description | Ações de reconfiguração |
|---|---|---|
capacity-scheduler | Alterar os valores no arquivo capacity-scheduler.xml do Hadoop. | Restarts the ResourceManager service. |
container-executor | Alterar os valores no arquivo container-executor.cfg do YARN do Hadoop. | Not available. |
container-log4j | Altere os valores no arquivo container-log4j.properties do YARN do Hadoop. | Not available. |
core-site | Alterar os valores no arquivo core-site.xml do Hadoop. | Restarts the Hadoop HDFS services Namenode, SecondaryNamenode, Datanode, ZKFC, and Journalnode. Restarts the Hadoop YARN services ResourceManager, NodeManager, ProxyServer, and TimelineServer. Additionally restarts Hadoop KMS, Hadoop Httpfs, and MapReduce-HistoryServer. |
docker-conf | Alterar as configurações relacionadas ao docker. | Not available. |
hadoop-env | Alterar os valores no ambiente do Hadoop para todos os componentes do Hadoop. | Restarts the Hadoop HDFS services Namenode, SecondaryNamenode, Datanode, ZKFC, and Journalnode. Restarts the Hadoop YARN services ResourceManager, NodeManager, ProxyServer, and TimelineServer. Additionally restarts MapReduce-HistoryServer. |
hadoop-log4j | Alterar os valores no arquivo log4j.properties do Hadoop. | Restarts the Hadoop HDFS services SecondaryNamenode, Datanode, and Journalnode. Restarts the Hadoop YARN services ResourceManager, NodeManager, ProxyServer, and TimelineServer. Additionally restarts Hadoop KMS, Hadoop Httpfs, and MapReduce-HistoryServer. |
hadoop-ssl-server | Alterar a configuração do servidor SSL no Hadoop | Not available. |
hadoop-ssl-client | Alterar a configuração do cliente SSL no Hadoop | Not available. |
hdfs-encryption-zones | Configurar as zonas de criptografia do HDFS. | This classification should not be reconfigured. |
hdfs-env | Alterar os valores no ambiente do HDFS. | Restarts Hadoop HDFS services Namenode, Datanode, and ZKFC. |
hdfs-site | Alterar os valores no arquivo hdfs-site.xml do HDFS. | Restarts the Hadoop HDFS services Namenode, SecondaryNamenode, Datanode, ZKFC, and Journalnode. Additionally restarts Hadoop Httpfs. |
httpfs-env | Alterar os valores no ambiente do HTTPFS. | Restarts Hadoop Httpfs service. |
httpfs-site | Alterar os valores no arquivo httpfs-site.xml do Hadoop. | Restarts Hadoop Httpfs service. |
hadoop-kms-acls | Alterar os valores no arquivo kms-acls.xml do Hadoop. | Not available. |
hadoop-kms-env | Alterar os valores no ambiente do Hadoop KMS. | Restarts Hadoop-KMS service. |
hadoop-kms-java-home | Alterar a página inicial do KMS do Hadoop | Not available. |
hadoop-kms-log4j | Alterar os valores no arquivo kms-log4j.properties do Hadoop. | Not available. |
hadoop-kms-site | Alterar os valores no arquivo kms-site.xml do Hadoop. | Restarts Hadoop-KMS. |
hudi-env | Altere os valores no ambiente do Hudi. | Not available. |
hudi-defaults | Alterar os valores no arquivo hudi-defaults.conf do Hudi. | Not available. |
iceberg-defaults | Alterar os valores no arquivo iceberg-defaults.conf do Iceberg. | Not available. |
delta-defaults | Alterar os valores no arquivo delta-defaults.conf do Delta. | Not available. |
jupyter-notebook-conf | Alterar os valores no arquivo jupyter_notebook_config.py do Notebook Jupyter. | Not available. |
jupyter-s3-conf | Configurar a persistência do notebook Jupyter S3. | Not available. |
jupyter-sparkmagic-conf | Altere os valores no arquivo config.json do Sparkmagic. | Not available. |
livy-conf | Alterar os valores no arquivo livy.conf do Livy. | Restarts Livy Server. |
livy-env | Alterar os valores no ambiente do Livy. | Restarts Livy Server. |
livy-log4j2 | Alterar as configurações de log4j2.properties do Livy. | Restarts Livy Server. |
mapred-env | Altere os valores no ambiente do MapReduce aplicativo. | Restarts Hadoop MapReduce-HistoryServer. |
mapred-site | Altere os valores no arquivo mapred-site.xml do MapReduce aplicativo. | Restarts Hadoop MapReduce-HistoryServer. |
spark | EMR-curated Configurações da Amazon para o Apache Spark. | This property modifies spark-defaults. See actions there. |
spark-defaults | Alterar os valores no arquivo spark-defaults.conf do Spark. | Restarts Spark history server and Spark thrift server. |
spark-env | Alterar os valores no ambiente do Spark. | Restarts Spark history server and Spark thrift server. |
spark-hive-site | Alterar os valores no arquivo hive-site.xml do Spark. | Not available. |
spark-log4j2 | Alterar os valores no arquivo log4j2.properties do Spark. | Restarts Spark history server and Spark thrift server. |
spark-metrics | Alterar os valores no arquivo metrics.properties do Spark. | Restarts Spark history server and Spark thrift server. |
yarn-env | Alterar os valores no ambiente do YARN. | Restarts the Hadoop YARN services ResourceManager, NodeManager, ProxyServer, and TimelineServer. Additionally restarts MapReduce-HistoryServer. |
yarn-site | Alterar os valores no arquivo yarn-site.xml do YARN. | Restarts the Hadoop YARN services ResourceManager, NodeManager, ProxyServer, and TimelineServer. Additionally restarts Livy Server and MapReduce-HistoryServer. |
zookeeper-config | Altere os valores no ZooKeeper arquivo zoo.cfg. | Restarts Zookeeper server. |
zookeeper-logback | Altere os valores no ZooKeeper arquivo logback.xml. | Restarts Zookeeper server. |
cloudwatch-logs | Configure a integração de CloudWatch registros para nós de cluster do EMR. | Not available. |
emr-metrics | Altere as configurações de métricas do EMR desse nó. | Restarts the CloudWatchAgent service. |
Registro de alterações do Amazon EMR Spark 8.1.0
| Data | Event | Description |
|---|---|---|
| 2026-09-08 | Publicação de documentos | Notas de lançamento do Amazon EMR Spark 8.1.0 (emr-spark-8.1.0) publicadas pela primeira vez |