Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Amazon EMR sur les versions 7.2.0 d'EKS
Cette page décrit les fonctionnalités nouvelles et mises à jour d'Amazon EMR spécifiques au déploiement d'Amazon EMR on EKS. Pour plus d'informations sur l'exécution d'Amazon EMR sur Amazon EC2 et sur la version Amazon EMR 7.2.0 en général, consultez Amazon EMR 7.2.0 dans le Amazon EMR Release Guide.
Amazon EMR sur les versions 7.2 d'EKS
Les versions 7.2.0 d'Amazon EMR suivantes sont disponibles pour Amazon EMR sur EKS. Sélectionnez une version spécifique d'EMR-7.2.0-xxxx pour afficher plus de détails, tels que la balise d'image du conteneur associée.
Notes de mise à jour
Notes de mise à jour pour Amazon EMR sur EKS 7.2.0
-
Applications prises en charge – AWS SDK pour Java 2.23.18 and 1.12.705, Apache Spark 3.5.1-amzn-1, Apache Hudi 0.14.1-amzn-0, Apache Iceberg 1.5.0-amzn-0, Delta 3.1.0, Apache Spark RAPIDS 24.02.0-amzn-1, Jupyter Enterprise Gateway 2.6.0, Apache Flink 1.18.1-amzn-0, Flink Operator 1.8.0-amzn-1
-
Composants pris en charge :
aws-sagemaker-spark-sdk,emr-ddb,emr-goodies,emr-s3-select,emrfs,hadoop-client,hudi,hudi-spark,iceberg,spark-kubernetes. -
Classifications de configuration prises en charge
À utiliser avec StartJobRun et les CreateManagedEndpoint API :
Classifications Descriptions core-siteModifiez les valeurs dans le fichier Hadoop
core-site.xml.emrfs-siteModifiez les paramètres EMRFS.
spark-metricsModifiez les valeurs dans le fichier Spark
metrics.properties.spark-defaultsModifiez les valeurs dans le fichier Spark
spark-defaults.conf.spark-envModifiez les valeurs dans l'environnement Spark.
spark-hive-siteModifiez les valeurs dans le fichier Spark
hive-site.xml.spark-log4j2Modifiez les valeurs dans le fichier Spark
log4j2.properties.emr-job-submitterConfiguration pour le pod soumissionnaire de tâches.
À utiliser spécifiquement avec CreateManagedEndpoint les API :
Classifications Descriptions jeg-configModifiez les valeurs dans le fichier
jupyter_enterprise_gateway_config.pyJupyter Enterprise Gateway.jupyter-kernel-overridesModifiez la valeur de l'image du noyau dans le fichier Jupyter Kernel Spec.
Les classifications de configuration vous permettent de personnaliser les applications. Elles correspondent souvent à un fichier XML de configuration de l'application, tel que
spark-hive-site.xml. Pour plus d'informations, consultez la rubrique Configuration des applications.
Fonctionnalités notables
Les fonctionnalités suivantes sont incluses dans la version 7.2.0 d'Amazon EMR sur EKS.
-
Mises à niveau des applications : les mises à niveau des applications Amazon EMR on EKS 7.2.0 incluent Spark 3.5.1, Flink 1.18.1 et Flink Operator 1.8.0. https://docs.aws.amazon.com/emr/latest/EMR-on-EKS-DevelopmentGuide/jobruns-flink-kubernetes-operator.html
-
Autoscaler pour les mises à jour de Flink — La version 7.2.0 utilise la configuration open source
job.autoscaler.restart.time-tracking.enabledpour permettre l'estimation du temps de redimensionnement. Vous n'avez donc plus à attribuer manuellement des valeurs empiriques au temps de redémarrage. Si vous utilisez la version 7.1.0 ou une version antérieure, vous pouvez toujours utiliser la mise à l'échelle automatique d'Amazon EMR. -
Intégration d'Apache Hudi Apache Flink sur Amazon EMR sur EKS — Cette version ajoute une intégration entre Apache Hudi et Apache Flink, afin que vous puissiez utiliser l'opérateur Flink Kubernetes pour exécuter des tâches Hudi. Hudi vous permet d'utiliser des opérations au niveau des enregistrements que vous pouvez utiliser pour simplifier la gestion des données et le développement de pipelines de données.
-
Intégration d'Amazon S3 Express One Zone à Amazon EMR sur EKS — Avec la version 7.2.0 et les versions ultérieures, vous pouvez télécharger des données dans la zone S3 Express One avec Amazon EMR sur EKS. S3 Express One Zone est une classe de stockage Amazon S3 mono-zone à hautes performances qui fournit un accès aux données cohérent en millisecondes à un chiffre pour la plupart des applications sensibles à la latence. À son lancement, S3 Express One Zone offre la latence la plus faible et les meilleures performances de stockage d’objets cloud dans Amazon S3.
-
Prise en charge des configurations par défaut dans l'opérateur Spark — L'opérateur Spark sur Amazon EKS prend désormais en charge les mêmes configurations par défaut que le modèle d'exécution de la tâche de démarrage sur Amazon EMR sur EKS pour la version 7.2.0 et supérieure. Cela signifie que des fonctionnalités telles qu'Amazon S3 et EMRFS ne nécessitent plus de configurations manuelles dans le fichier yaml.