View a markdown version of this page

Tiempo de ejecución de AWS para Apache Spark (emr-spark-8.0-preview) - Amazon EMR

Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.

Tiempo de ejecución de AWS para Apache Spark (emr-spark-8.0-preview)

En la siguiente tabla se enumeran las versiones de la aplicación disponibles con (emr-spark-8.0-preview). AWS runtime for Apache Spark

Información sobre la versión de la aplicación
Aplicación Versión
Spark 4.0.1-amzn-0
Notas de la versión de AWS Runtime para Apache Spark (emr-spark-8.0-preview)
  • Versión preliminar: se trata de una versión preliminar que incluye Apache Spark 4.0.1. AWS runtime for Apache Spark Esta versión preliminar solo está disponible en EMR Serverless.

  • Disponibilidad regional: esta versión preliminar está disponible en todas AWS las regiones en las que EMR Serverless está disponible, excepto en las regiones de China y AWS GovCloud (EE. UU.).

  • Información sobre la versión de la aplicación: esta versión incluye las siguientes versiones de la aplicación:

    • AWS SDK para Java 2.35.5, 1.12.792

    • Python 3.9, 3.11, 3.12

    • Scala 2.13.16

    • AmazonCloudWatchAgent 1.300034.0-amzn-0

    • Delta 4.0.0-amzn-0-spark

    • Iceberg 1.10.0-amzn-spark-0

    • Esta versión viene con Amazon Corretto 17 (basado en OpenJDK) de forma predeterminada para las aplicaciones que admiten Corretto 17 (JDK 17).

  • Limitaciones de la versión preliminar: las siguientes funciones no están disponibles en esta versión preliminar:

    • Funciones interactivas y de integración: SageMaker Unified Studio, la integración con EMR Studio, Spark Connect y Livy no JupyterEnterpriseGateway son compatibles.

    • Formatos de tablas y control de acceso: no se admiten Hudi, Delta Universal Format ni el control de acceso detallado (FGAC) con filtros y operadores a nivel de fila o columna. DDL/DML

    • Conectores de datos: los conectores spark-sql-kinesis, emr-dynamodb y spark-redshift no están disponibles.

    • Servidor de historial: el servidor de historial de Persistent Spark no está disponible en esta versión preliminar. Los usuarios aún pueden acceder a la interfaz de usuario de Spark en vivo para monitorear y depurar los trabajos activos sin servidor en tiempo real.

    • Funciones especializadas: las vistas materializadas no están disponibles.

  • Capacidades de vista previa: puede probar las siguientes capacidades en esta versión preliminar. Esta versión preliminar no se recomienda para cargas de trabajo de producción:

    • Características de SQL: modo ANSI SQL con un manejo de tipos más estricto, sintaxis SQL PIPE (|>) para encadenar operaciones, tipo de datos VARIANT para datos JSON semiestructurados, secuencias de comandos SQL con sentencias de flujo de control y variables de sesión, y funciones SQL definidas por el usuario.

    • Mejoras en la transmisión: la versión 2 de la API de procesamiento arbitrario de estados con WithState operador de transformación, un lector de fuentes de datos estatales para obtener estados consultables (experimental) y un almacén de estados mejorado con un punto de control del registro de cambios mejorado de RockSDB.

    • Compatibilidad con formatos de tabla: Apache Iceberg v3, compatible con los tipos de datos VARIANT, integración con AWS AWS Lake Formation S3 Tables y acceso completo a tablas (FTA) para tablas Iceberg, Delta Lake y Hive.

  • Documentación adicional: para obtener documentación adicional sobre Apache Spark, consulte la documentación de lanzamiento de Apache Spark 4.0.1.

Introducción

Para empezar a usar la versión preliminar de Apache Spark 4.0.1, cree una aplicación EMR sin servidor mediante la CLI: AWS

aws emr-serverless create-application --type spark \ --release-label emr-spark-8.0-preview \ --region us-east-1 --name spark4-preview