Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.
Tiempo de ejecución de AWS para Apache Spark (emr-spark-8.0-preview)
En la siguiente tabla se enumeran las versiones de la aplicación disponibles con (emr-spark-8.0-preview). AWS runtime for Apache Spark
| Aplicación | Versión |
|---|---|
| Spark | 4.0.1-amzn-0 |
Notas de la versión de AWS Runtime para Apache Spark (emr-spark-8.0-preview)
-
Versión preliminar: se trata de una versión preliminar que incluye Apache Spark 4.0.1.
AWS runtime for Apache SparkEsta versión preliminar solo está disponible en EMR Serverless. -
Disponibilidad regional: esta versión preliminar está disponible en todas AWS las regiones en las que EMR Serverless está disponible, excepto en las regiones de China y AWS GovCloud (EE. UU.).
-
Información sobre la versión de la aplicación: esta versión incluye las siguientes versiones de la aplicación:
-
AWS SDK para Java 2.35.5, 1.12.792
-
Python 3.9, 3.11, 3.12
-
Scala 2.13.16
-
AmazonCloudWatchAgent 1.300034.0-amzn-0
-
Delta 4.0.0-amzn-0-spark
-
Iceberg 1.10.0-amzn-spark-0
-
Esta versión viene con Amazon Corretto 17 (basado en OpenJDK) de forma predeterminada para las aplicaciones que admiten Corretto 17 (JDK 17).
-
-
Limitaciones de la versión preliminar: las siguientes funciones no están disponibles en esta versión preliminar:
-
Funciones interactivas y de integración: SageMaker Unified Studio, la integración con EMR Studio, Spark Connect y Livy no JupyterEnterpriseGateway son compatibles.
-
Formatos de tablas y control de acceso: no se admiten Hudi, Delta Universal Format ni el control de acceso detallado (FGAC) con filtros y operadores a nivel de fila o columna. DDL/DML
-
Conectores de datos: los conectores spark-sql-kinesis, emr-dynamodb y spark-redshift no están disponibles.
-
Servidor de historial: el servidor de historial de Persistent Spark no está disponible en esta versión preliminar. Los usuarios aún pueden acceder a la interfaz de usuario de Spark en vivo para monitorear y depurar los trabajos activos sin servidor en tiempo real.
-
Funciones especializadas: las vistas materializadas no están disponibles.
-
-
Capacidades de vista previa: puede probar las siguientes capacidades en esta versión preliminar. Esta versión preliminar no se recomienda para cargas de trabajo de producción:
-
Características de SQL: modo ANSI SQL con un manejo de tipos más estricto, sintaxis SQL PIPE (|>) para encadenar operaciones, tipo de datos VARIANT para datos JSON semiestructurados, secuencias de comandos SQL con sentencias de flujo de control y variables de sesión, y funciones SQL definidas por el usuario.
-
Mejoras en la transmisión: la versión 2 de la API de procesamiento arbitrario de estados con WithState operador de transformación, un lector de fuentes de datos estatales para obtener estados consultables (experimental) y un almacén de estados mejorado con un punto de control del registro de cambios mejorado de RockSDB.
-
Compatibilidad con formatos de tabla: Apache Iceberg v3, compatible con los tipos de datos VARIANT, integración con AWS AWS Lake Formation S3 Tables y acceso completo a tablas (FTA) para tablas Iceberg, Delta Lake y Hive.
-
-
Documentación adicional: para obtener documentación adicional sobre Apache Spark, consulte la documentación de lanzamiento de Apache Spark 4.0.1.
Introducción
Para empezar a usar la versión preliminar de Apache Spark 4.0.1, cree una aplicación EMR sin servidor mediante la CLI: AWS
aws emr-serverless create-application --type spark \ --release-label emr-spark-8.0-preview \ --region us-east-1 --name spark4-preview