View a markdown version of this page

AWS-Laufzeit für Apache Spark (emr-spark-8.0-preview) - Amazon EMR

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

AWS-Laufzeit für Apache Spark (emr-spark-8.0-preview)

In der folgenden Tabelle sind die mit (emr-spark-8.0-preview) verfügbaren Anwendungsversionen aufgeführt. AWS runtime for Apache Spark

Informationen zur Anwendungsversion
Anwendung Version
Spark 4.0.1-amzn-0
Versionshinweise zur AWS-Runtime für Apache Spark (emr-spark-8.0-preview)
  • Vorschauversion — Dies ist eine Vorabversion von Featuring Apache Spark 4.0.1. AWS runtime for Apache Spark Diese Vorschau ist nur auf EMR Serverless verfügbar.

  • Regionale Verfügbarkeit — Diese Vorschauversion ist in allen AWS Regionen verfügbar, in denen EMR Serverless verfügbar ist, mit Ausnahme der Regionen China und AWS GovCloud (USA).

  • Informationen zur Anwendungsversion — Diese Version wird mit den folgenden Anwendungsversionen ausgeliefert:

    • AWS SDK für Java 2.35.5, 1.12.792

    • Python 3.9, 3.11, 3.12

    • Skala 2.13.16

    • AmazonCloudWatchAgent 1.300034.0-amzn-0

    • Delta 4.0.0-amzn-0-spark

    • Eisberg 1.10.0-amzn-spark-0

    • Diese Version wird standardmäßig mit Amazon Corretto 17 (basierend auf OpenJDK) für Anwendungen ausgeliefert, die Corretto 17 (JDK 17) unterstützen.

  • Einschränkungen bei der Vorschau — Die folgenden Funktionen sind in dieser Vorschauversion nicht verfügbar:

    • Interaktive Funktionen und Integrationsfunktionen: SageMaker Unified Studio, EMR Studio-Integration, Spark Connect, Livy und JupyterEnterpriseGateway werden nicht unterstützt.

    • Tabellenformate und Zugriffskontrolle: Hudi, Delta Universal Format und Fine-Grained Access Control (FGAC) mit Filtern und Operatoren auf Zeilen- oder Spaltenebene werden nicht unterstützt. DDL/DML

    • Datenkonnektoren: Spark-SQL-Kinesis-, EMR-Dynamodb- und Spark-Redshift-Konnektoren sind nicht verfügbar.

    • History Server: Der Persistent Spark History Server ist in dieser Vorabversion nicht verfügbar. Benutzer können weiterhin auf die Live-Spark-Benutzeroberfläche zugreifen, um aktive serverlose Jobs in Echtzeit zu überwachen und zu debuggen.

    • Spezialfunktionen: Materialized Views sind nicht verfügbar.

  • Vorschaufunktionen — In dieser Vorschauversion können Sie die folgenden Funktionen testen. Diese Vorschauversion wird nicht für Produktions-Workloads empfohlen:

    • SQL-Funktionen: ANSI-SQL-Modus mit strengerer Typbehandlung, SQL PIPE-Syntax (|>) für Verkettungsvorgänge, VARIANT-Datentyp für halbstrukturierte JSON-Daten, SQL-Skripting mit Ablaufsteuerungsanweisungen und Sitzungsvariablen sowie benutzerdefinierte SQL-Funktionen.

    • Verbesserungen beim Streaming: Arbitrary Stateful Processing API v2 mit WithState Transformationsoperator, State Data Source Reader für abfragbaren Streaming-Status (experimentell) und erweitertem State Store mit verbessertem RocksDB-Changelog-Checkpointing.

    • Unterstützung für Tabellenformate: Apache Iceberg v3 mit VARIANT-Datentypunterstützung, AWS S3-Tabellen-Integration und Full Table Access (FTA) mit AWS Lake Formation Iceberg-, Delta Lake- und Hive-Tabellen.

  • Zusätzliche Dokumentation — Zusätzliche Apache Spark-Dokumentation finden Sie in der Apache Spark 4.0.1 Release-Dokumentation.

Erste Schritte

Um mit der Apache Spark 4.0.1 Preview zu beginnen, erstellen Sie mithilfe der CLI eine EMR-Serverless-Anwendung: AWS

aws emr-serverless create-application --type spark \ --release-label emr-spark-8.0-preview \ --region us-east-1 --name spark4-preview