Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
AWS Laufzeit für Apache Spark (emr-spark-8.1.0)
Von emr-spark-8.1.0 unterstützter Lebenszyklus
Diese Version wird als Long Term Support (LTS) -Version bezeichnet. In der folgenden Tabelle werden die unterstützten Lebenszyklusdaten für Amazon EMR Spark 8.1.0 beschrieben.
| Unterstützungsphase | Date |
|---|---|
| Erstes Veröffentlichungsdatum | 8. September 2026 |
| Standardsupport bis | 7. September 2029 |
| Ende der Lebensdauer | 8. September 2029 |
emr-spark-8.1.0-Anwendungsversionen
Diese Version umfasst die folgenden Anwendungen: AmazonCloudWatchAgent,,, Delta
In der folgenden Tabelle sind die in dieser Version von Amazon EMR verfügbaren Anwendungsversionen und die Anwendungsversionen der vorherigen drei Amazon-EMR-Versionen (sofern zutreffend) aufgeführt.
Einen umfassenden Verlauf der Anwendungsversionen für jede Version von Amazon EMR finden Sie in den folgenden Themen:
| emr-spark-8.1.0 | emr-spark-8.0.0 | |
|---|---|---|
| AWS SDK für Java | 2.44.5 | 2,41,32 |
| Python | 3,11, 3,13 | 3,11, 3,13 |
| Scala | 2,1,17 | 2,13,16 |
| AmazonCloudWatchAgent | 1,300034,0-amzn-0 | 1,300032,2-amzn-0 |
| Delta | 4.2.0-amzn-0 | 4.0.0-amzn-1-spark |
| Hudi | 1.1.1-amzn-0 | 1.1.0-amzn-0 |
| Iceberg | 1.11.0-amzn-0 | 1.10.1-amzn-0 |
| JupyterEnterpriseGateway | 2.6.0 | 2.6.0 |
| Livy | 0.9.0-inkubieren | 0,8,0-inkubieren |
| Spark | 4.1.1-amzn-0 | 4.0.2-amzn-0 |
Versionshinweise zu emr-spark-8.1.0
Die folgenden Versionshinweise enthalten Informationen zur Amazon EMR-Version 8.1.0 (emr-spark-8.1.0) mit Apache Spark 4.1.1.
Was ist neu
Apache Spark 4.1.1 — Amazon EMR Spark 8.1.0 beinhaltet Apache Spark 4.1.1. Zu den aktualisierten Abhängigkeiten gehören Scala 2.13.17, Jackson 2.20.0 und Parquet-MR 1.16.0 sowie neue Spark-Funktionen, Leistungsverbesserungen und Bugfixes.
Iceberg v3-Spezifikationsunterstützung für Spark-Workloads — Amazon EMR Spark 8.1.0 erweitert die Iceberg v3-Spezifikationsunterstützung für Spark-Workloads. Diese Version fügt die folgenden v3-Funktionen hinzu:
Geodatentypen — Iceberg v3-Tabellen unterstützen die
GEOGRAPHYDatentypenGEOMETRYund.Geodaten-SQL-Funktionen — Amazon EMR Spark 8.1.0 unterstützt von Haus aus Geodatenfunktionen für Iceberg-Workloads. Stellen Sie in Ihrer
spark.sql.geospatial.enabledSpark-Konfiguration auf auf ein, umtrueGeodatenfunktionen zu aktivieren. Apache Spark 4.1 unterstützt nur SRID 0, 3857 und 4326. Die folgenden Funktionen werden unterstützt:st_area(geom)st_asbinary(geo[, endianness])st_collect(geoArray)st_convexhull(geom)st_distance(geom1, geom2)st_dwithin(geom1, geom2, distance)st_geogfromwkb(wkb)st_geomfromwkb(wkb[, srid])st_geomfromwkt(wkt[, srid])st_intersection(geom1, geom2)st_intersects(geom1, geom2)st_length(geom)st_makeline(geomArray)st_setsrid(geo, srid)st_srid(geo)st_within(geom1, geom2)st_x(point)st_y(point)
Nanosecond-precision Zeitstempel — Iceberg v3-Tabellen unterstützen Zeitstempelspalten (und) mit einer Genauigkeit von Nanosekunden.
TIMESTAMP(9)TIMESTAMP_NTZ(9)Varianten-Shredding — Iceberg v3-Tabellen unterstützen Varianten-Shredding.
UNKNOWNDatentyp — Iceberg v3-Tabellen unterstützen denUNKNOWNDatentyp für Spalten, deren Typ noch nicht definiert ist. Spalten dieses Typs sind optional, haben standardmäßig den Wert Null und werden nicht in Datendateien gespeichert.Standardwerte — Iceberg v3-Spalten unterstützen deklarierte Standardwerte, die gelten, wenn ein Autor die Spalte weglässt.
Erweiterte Unterstützung für feinkörnige Zugriffskontrolle für offene Tabellenformate — Amazon EMR Spark 8.1.0 erweitert die FGAC-Unterstützung (Fine-Grained Access Control) für offene Tabellenformate (OTFs). Iceberg unterstützt jetzt FGAC für zusätzliche Operationen:,, und.
DESCRIBE TABLESHOW TBLPROPERTIESSHOW CREATE TABLEALTER TABLE table_name WRITE ORDERED BYALTER TABLE table_name WRITE DISTRIBUTED BYDelta Lake unterstützt jetzt FGAC für den Vorgang.VACUUMVerbesserungen bei der schrittweisen Aktualisierung für materialisierte Iceberg-Ansichten — Die inkrementelle Aktualisierung unterstützt Merge-on-Read jetzt Tabellen durch Erfassung von Änderungsdaten. Dies ermöglicht schnelle Aktualisierungen für Workloads, die Aktualisierungen und Löschungen verwenden. Refresh liest nur die Datendateien, die von einer Änderung betroffen sind. Dabei werden Spaltenstatistiken pro Datei und auf Manifestebene verwendet.
Multi-format Unterstützung mehrerer Kataloge mit automatischer Erkennung — Spark-SQL-Abfragen können Kataloge jetzt namentlich referenzieren, ohne sie in der Spark-Konfiguration vorab zu registrieren. Zu den unterstützten Katalogtypen gehören kontoübergreifende Kataloge und Verbundkataloge von S3 Tables mit automatischer Erkennung der Tabellenformate Iceberg, Delta und Hudi. Um diese Funktion zu aktivieren, fügen Sie die folgende Spark-Konfiguration hinzu:
"spark.sql.catalog.spark_catalog": "org.apache.spark.sql.connector.catalog.redirecting.RedirectingSessionCatalog", "spark.sql.catalogResolver": "com.amazonaws.glue.catalog.redirecting.GlueCatalogResolver"
Änderungen, Verbesserungen und behobene Probleme
Diese Version enthält Bugfixes und Funktionsverbesserungen für Iceberg, Hudi und Delta. Weitere Informationen finden Sie im Abschnitt Was ist neu.
Verbesserte Toleranz bei der Überprüfung der Festplattenverschlüsselung beim Cluster-Start — Cluster, bei denen die lokale Festplattenverschlüsselung in ihrer Sicherheitskonfiguration aktiviert ist, sind jetzt toleranter gegenüber vorübergehenden Verzögerungen bei der Netzwerkkonnektivität beim Starten der Instance. Diese Änderung reduziert zeitweilige Cluster-Startfehler.
Die Behandlung von UTF-8 Multibyte-Zeichen in Amazon EMR-Konfigurationen wurde behoben — Amazon EMR-Konfigurationen unterstützen jetzt korrekt Multibyte-Zeichen. UTF-8 Dies schließt Werte mit Akzentbuchstaben oder nicht-lateinischen Schriftzeichen ein. Weitere Informationen finden Sie unter Konfigurieren von Anwendungen.
Verbesserte Zuverlässigkeit beim Starten von Secret Agent — Behebt zwei Probleme, die zu Fehlern bei der Bereitstellung von Amazon EMR-Clustern im Zusammenhang mit dem Secret Agent-Sicherheitsdienst führen konnten. Die Zertifikatserstellung wartet nun darauf, dass HDFS bereit ist, bevor fortgefahren wird, und das Startskript versucht erneut, den Secret Agent Java-Prozess zu erkennen. Zusammen reduzieren diese Änderungen Startfehler auf Clustern mit langsamerer Speicherinitialisierung oder stark ausgelasteten Instances.
Bekannte Probleme und Einschränkungen
Die native Apache Iceberg-Tabellenverschlüsselung wird nur angewendet, wenn Sie den Hive Metastore oder einen Iceberg REST-Katalog verwenden. Mit dem AWS Glue Data Catalog (einschließlich seines Iceberg-REST-Endpunkts) und dem Hadoop-Katalog werden diese Eigenschaften akzeptiert, aber nicht durchgesetzt. Daher werden Daten im Klartext geschrieben. Um ruhende Iceberg-Tabellendaten mit diesen Katalogen zu verschlüsseln, aktivieren Sie die serverseitige Amazon S3-Verschlüsselung mit AWS KMS Schlüsseln (SSE-KMS) am Amazon S3-Speicherort der Tabelle.
Transformationen, die mehr als ein Argument benötigen, werden für Iceberg v3-Tabellen nicht unterstützt.
emr-spark-8.1.0 Standard-Java-Versionen
| Anwendung | Java-/Amazon-Corretto-Version (Standard ist fett gedruckt) |
|---|---|
| Spark | 17, 21 |
| Livy | 17, 11, 8 |
| Hadoop | 17, 11, 8 |
Versionen der Komponenten emr-spark-8.1.0
Die Komponenten, die Amazon EMR mit dieser Version installiert, sind nachstehend aufgeführt. Einige werden als Teil von Big-Data-Anwendungspaketen installiert. Andere sind nur für Amazon EMR verfügbar und werden für Systemprozesse und -Features installiert. Diese beginnen in der Regel mit oder. emr aws Big-data Bei den Anwendungspaketen in der neuesten Amazon EMR-Version handelt es sich in der Regel um die neueste Version, die in der Community zu finden ist. Wir stellen Community-Versionen in Amazon EMR so schnell wie möglich zur Verfügung.
Einige Komponenten in Amazon EMR unterscheiden sich von Community-Versionen. Diese Komponenten verfügen über eine Versionsbezeichnung in der Form . Der CommunityVersion-amzn-EmrVersion beginnt bei 0. Wenn zum Beispiel eine Open-Source-Community-Komponente mit dem Namen EmrVersionmyapp-component der Version 2.2 dreimal für die Aufnahme in verschiedene Amazon-EMR-Versionen geändert wurde, wird ihre Version als 2.2-amzn-2 aufgeführt.
| Komponente | Version | Description |
|---|---|---|
| adot-java-agent | 1.31.0 | Ein Java-Agent, der Metriken von Anwendungs-Daemons sammelt. |
| delta | 4.2.0-amzn-0 | Delta Lake ist ein offenes Tabellenformat für riesige analytische Datensätze |
| emr-amazon-cloudwatch-agent | 1,300034,0-amzn-0 | Eine Anwendung, die interne Metriken auf Systemebene und benutzerdefinierte Anwendungsmetriken von Amazon-EC2-Instances erfasst. |
| emr-ddb | 6.1,0 | Amazon DynamoDB-Connector für Anwendungen aus dem Hadoop-Ökosystem. |
| emr-goodies | 3.23.0-Spark | Praktische Bibliotheken für das Hadoop-Ökosystem. |
| emr-notebook-env | 1.18.0 | Conda Env für EMR-Notebooks, das Jupyter Enterprise Gateway enthält |
| emr-s3-dist-cp | 2,46,0 | Verteilte Kopieranwendung, die für Amazon S3 optimiert ist. |
| hadoop-client | 3.4.2-amzn-3 | Hadoop-Befehlszeilen-Clients wie z. B. "hdfs", "Hadoop" oder "Garn". |
| hadoop-hdfs-datanode | 3.4.2-amzn-3 | HDFS-Service auf Knotenebene zum Speichern von Blöcken. |
| hadoop-hdfs-library | 3.4.2-amzn-3 | HDFS-Client und -Bibliothek für die Befehlszeile |
| hadoop-hdfs-namenode | 3.4.2-amzn-3 | HDFS-Service für die Nachverfolgung von Dateinamen und Block-Speicherorten. |
| hadoop-hdfs-zkfc | 3.4.2-amzn-3 | ZKFC-Dienst zum Verfolgen von Namenodes für den HA-Modus. |
| hadoop-hdfs-journalnode | 3.4.2-amzn-3 | HDFS-Service zum Verwalten des Hadoop-Dateisystemjournals auf HA-Clustern. |
| hadoop-httpfs-server | 3.4.2-amzn-3 | HTTP-Endpunkt für HDFS-Operationen. |
| hadoop-kms-server | 3.4.2-amzn-3 | Server zur Verwaltung kryptografischer Schlüssel, der auf der Hadoop-API basiert. KeyProvider |
| hadoop-mapred | 3.4.2-amzn-3 | MapReduce Bibliotheken für die Ausführungsengine zum Ausführen einer Anwendung. MapReduce |
| hadoop-yarn-nodemanager | 3.4.2-amzn-3 | YARN-Service für die Verwaltung von Containern auf einem einzelnen Knoten. |
| hadoop-yarn-resourcemanager | 3.4.2-amzn-3 | YARN-Service für Zuweisung und Verwaltung von Cluster-Ressourcen und verteilten Anwendungen. |
| hadoop-yarn-timeline-server | 3.4.2-amzn-3 | Service für das Abrufen von aktuellen und historischen Informationen für YARN-Anwendungen. |
| hudi | 1.1.1-amzn-0 | Inkrementelles Verarbeitungs-Framework zur Versorgung der Datenpipline mit geringer Latenz und hoher Effizienz. |
| hudi-spark | 1.1.1-amzn-0 | Bündel-Bibliothek zum Ausführen von Spark mit Hudi. |
| iceberg | 1.11.0-amzn-0 | Apache Iceberg ist ein offenes Tabellenformat für sehr große analytische Datensätze |
| livy-server | 0.9.0-inkubieren | REST-Schnittstelle für die Interaktion mit Apache Spark |
| nginx | 1.12.1 | nginx [engine x] ist ein HTTP- und Reverse-Proxy-Server. |
| mariadb-server | 5,5,68+ | MariaDB-Datenbankserver. |
| nvidia-cuda | 12,5,0 | Nvidia-Treiber und Cuda-Toolkit |
| r | 4.3.2 | The R Project for Statistical Computing (Software zur statistischen Datenverarbeitung) |
| spark-client | 4.1.1-amzn-0 | Spark-Befehlszeilen-Clients. |
| spark-history-server | 4.1.1-amzn-0 | Web-Benutzeroberfläche zum Anzeigen von protokollierten Ereignissen für die gesamte Lebensdauer einer abgeschlossenen Spark-Anwendung. |
| spark-on-yarn | 4.1.1-amzn-0 | In-memory Ausführungs-Engine für YARN. |
| spark-yarn-slave | 4.1.1-amzn-0 | Apache Spark-Bibliotheken, die von YARN-Slaves benötigt werden. |
| spark-rapids | 26.04.2-amzn-0 | Nvidia-Spark-RAPIDS-Plugin, das Apache Spark mit GPUs beschleunigt. |
| zookeeper-server | 3,9,3-amzn-8 | Zentraler Service für die Verwaltung von Konfigurationsinformationen, die Benennung, die Bereitstellung verteilter Synchronisierung und die Bereitstellung von Gruppenservices. |
| zookeeper-client | 3,9,3-amzn-8 | ZooKeeper Befehlszeilen-Client. |
emr-spark-8.1.0-Konfigurationsklassifizierungen
Mithilfe von Konfigurationsklassifizierungen können Sie Anwendungen anpassen. Diese entsprechen häufig einer XML-Konfigurationsdatei für die Anwendung, z. B. hive-site.xml Weitere Informationen finden Sie unter Anwendungen konfigurieren.
Aktionen zur Neukonfiguration treten auf, wenn Sie eine Konfiguration für Instance-Gruppen in einem laufenden Cluster angeben. Amazon EMR initiiert nur Rekonfigurationsaktionen für die Klassifizierungen, die Sie ändern. Weitere Informationen finden Sie unter Eine Instance-Gruppe in einem laufenden Cluster neu konfigurieren.
| Klassifizierungen | Description | Aktionen zur Neukonfiguration |
|---|---|---|
capacity-scheduler | Ändert die Werte in der capacity-scheduler.xml-Datei in Hadoop. | Restarts the ResourceManager service. |
container-executor | Ändern Sie die Werte in der Datei „container-executor.cfg“ Datei von Hadoop YARN. | Not available. |
container-log4j | Ändert die Werte in der container-log4j.properties-Datei in Hadoop YARN. | Not available. |
core-site | Ändert die Werte in der core-site.xml-Datei in Hadoop. | Restarts the Hadoop HDFS services Namenode, SecondaryNamenode, Datanode, ZKFC, and Journalnode. Restarts the Hadoop YARN services ResourceManager, NodeManager, ProxyServer, and TimelineServer. Additionally restarts Hadoop KMS, Hadoop Httpfs, and MapReduce-HistoryServer. |
docker-conf | Ändern Sie die Docker-bezogenen Einstellungen. | Not available. |
hadoop-env | Ändert die Werte in der Hadoop-Umgebung für alle Hadoop-Komponenten. | Restarts the Hadoop HDFS services Namenode, SecondaryNamenode, Datanode, ZKFC, and Journalnode. Restarts the Hadoop YARN services ResourceManager, NodeManager, ProxyServer, and TimelineServer. Additionally restarts MapReduce-HistoryServer. |
hadoop-log4j | Ändert die Werte in der log4j.properties-Datei in Hadoop. | Restarts the Hadoop HDFS services SecondaryNamenode, Datanode, and Journalnode. Restarts the Hadoop YARN services ResourceManager, NodeManager, ProxyServer, and TimelineServer. Additionally restarts Hadoop KMS, Hadoop Httpfs, and MapReduce-HistoryServer. |
hadoop-ssl-server | Ändert die SSL-Server-Konfiguration in Hadoop. | Not available. |
hadoop-ssl-client | Ändert die SSL-Client-Konfiguration in Hadoop. | Not available. |
hdfs-encryption-zones | Konfiguriert die HDFS-Verschlüsselungszonen. | This classification should not be reconfigured. |
hdfs-env | Ändert die Werte in der HDFS-Umgebung. | Restarts Hadoop HDFS services Namenode, Datanode, and ZKFC. |
hdfs-site | Ändert die Werte in der hdfs-site.xml-Datei in HDFS. | Restarts the Hadoop HDFS services Namenode, SecondaryNamenode, Datanode, ZKFC, and Journalnode. Additionally restarts Hadoop Httpfs. |
httpfs-env | Ändert die Werte in der HTTPFS-Umgebung. | Restarts Hadoop Httpfs service. |
httpfs-site | Ändert die Werte in der httpfs-site.xml-Datei in Hadoop. | Restarts Hadoop Httpfs service. |
hadoop-kms-acls | Ändert die Werte in der kms-acls.xml-Datei in Hadoop. | Not available. |
hadoop-kms-env | Ändert die Werte in der KMS-Umgebung in Hadoop. | Restarts Hadoop-KMS service. |
hadoop-kms-java-home | Das KMS-Java-Home von Hadoop ändern | Not available. |
hadoop-kms-log4j | Ändert die Werte in der kms-log4j.properties-Datei in Hadoop. | Not available. |
hadoop-kms-site | Ändert die Werte in der kms-site.xml-Datei in Hadoop. | Restarts Hadoop-KMS. |
hudi-env | Ändern der Werte in der Hudi-Umgebung. | Not available. |
hudi-defaults | Ändern Sie die Werte in der hudi-defaults.conf-Datei in Hudi. | Not available. |
iceberg-defaults | Ändern Sie die Werte in der iceberg-defaults.conf-Datei von Iceberg. | Not available. |
delta-defaults | Ändern Sie die Werte in der delta-defaults.conf-Datei von Delta. | Not available. |
jupyter-notebook-conf | Ändert die Werte in der jupyter_notebook_config.py-Datei in Jupyter Notebook. | Not available. |
jupyter-s3-conf | Konfigurieren Sie die S3-Persistenz für Jupyter Notebooks. | Not available. |
jupyter-sparkmagic-conf | Ändert die Werte in der config.json-Datei in Sparkmagic. | Not available. |
livy-conf | Ändert die Werte in der livy.conf-Datei von Livy. | Restarts Livy Server. |
livy-env | Ändert die Werte in der Livy-Umgebung. | Restarts Livy Server. |
livy-log4j2 | Ändern Sie die log4j2.properties-Einstellungen für Livy. | Restarts Livy Server. |
mapred-env | Ändern Sie die Werte in der Anwendungsumgebung. MapReduce | Restarts Hadoop MapReduce-HistoryServer. |
mapred-site | Ändern Sie die Werte in der Datei mapred-site.xml der MapReduce Anwendung. | Restarts Hadoop MapReduce-HistoryServer. |
spark | EMR-curated Amazon-Einstellungen für Apache Spark. | This property modifies spark-defaults. See actions there. |
spark-defaults | Ändert die Werte in der spark-defaults.conf-Datei in Spark. | Restarts Spark history server and Spark thrift server. |
spark-env | Ändert die Werte in der Spark-Umgebung. | Restarts Spark history server and Spark thrift server. |
spark-hive-site | Ändert die Werte in der hive-site.xml-Datei in Spark. | Not available. |
spark-log4j2 | Ändern Sie die Werte in der log4j2.properties-Datei in Spark. | Restarts Spark history server and Spark thrift server. |
spark-metrics | Ändert die Werte in der metrics.properties-Datei in Spark. | Restarts Spark history server and Spark thrift server. |
yarn-env | Ändert die Werte in der YARN-Umgebung. | Restarts the Hadoop YARN services ResourceManager, NodeManager, ProxyServer, and TimelineServer. Additionally restarts MapReduce-HistoryServer. |
yarn-site | Ändert die Werte in der yarn-site.xml-Datei in YARN. | Restarts the Hadoop YARN services ResourceManager, NodeManager, ProxyServer, and TimelineServer. Additionally restarts Livy Server and MapReduce-HistoryServer. |
zookeeper-config | Ändern Sie die Werte in ZooKeeper der Datei zoo.cfg. | Restarts Zookeeper server. |
zookeeper-logback | Ändern Sie die Werte in ZooKeeper der Datei logback.xml. | Restarts Zookeeper server. |
cloudwatch-logs | Konfigurieren Sie die CloudWatch Logs-Integration für EMR-Clusterknoten. | Not available. |
emr-metrics | Ändern Sie die EMR-Metrikeinstellungen für diesen Knoten. | Restarts the CloudWatchAgent service. |
Amazon EMR Spark 8.1.0 Änderungsprotokoll
| Date | Veranstaltung | Description |
|---|---|---|
| 2026-09-08 | Veröffentlichung von Dokumenten | Die Versionshinweise zu Amazon EMR Spark 8.1.0 (emr-spark-8.1.0) wurden erstmals veröffentlicht |