

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

# Système de fichiers EMR (EMRFS)
<a name="emr-fs"></a>

**Note**  
À partir de la version EMR 7.10.0, le système de fichiers S3A a remplacé EMRFS en tant que connecteur EMR S3 par défaut.

Le système de fichiers EMR (EMRFS) est une mise en œuvre de HDFS que tous les clusters Amazon EMR utilisent pour la lecture et l'écriture des fichiers réguliers depuis Amazon EMR directement dans Amazon S3. EMRFS permet de stocker des données persistantes dans Amazon S3 en vue de les utiliser avec Hadoop, tout en fournissant des fonctionnalités telles que le chiffrement des données. 

Le chiffrement des données vous permet de chiffrer les objets qu'EMRFS écrit dans Amazon S3 et permet à EMRFS de travailler avec les données chiffrées dans Amazon S3. Si vous utilisez la version 4.8.0 ou ultérieure d'Amazon EMR, vous pouvez utiliser les configurations de sécurité pour configurer le chiffrement des objets EMRFS dans Amazon S3, ainsi que d'autres paramètres de chiffrement. Pour plus d'informations, consultez [Options de chiffrement](https://docs.aws.amazon.com/emr/latest/ManagementGuide/emr-data-encryption-options). Si vous utilisez une version précédente version de Amazon EMR, vous pouvez configurer manuellement les paramètres de chiffrement. Pour de plus amples informations, veuillez consulter [Spécification du chiffrement Amazon S3 en utilisant les propriétés EMRFS](emr-emrfs-encryption.md).

Amazon S3 offre une forte cohérence entre lecture et écriture pour toutes les opérations GET, PUT et LIST dans l'ensemble Régions AWS. Cela signifie que ce que vous écrivez à l'aide d'EMRFS correspond à ce que vous allez lire sur Amazon S3, sans aucun impact sur les performances. Pour plus d’informations, consultez [Modèle de cohérence de données Amazon S3](https://docs.aws.amazon.com/AmazonS3/latest/userguide/Welcome.html#ConsistencyModel).

Lorsque vous utilisez les versions 5.10.0 ou ultérieures d'Amazon EMR, vous pouvez utiliser différents rôles IAM pour les demandes EMRFS à Amazon S3 en fonction des utilisateurs du cluster, des groupes ou de l'emplacement des données EMRFS dans Amazon S3. Pour plus d'informations, consultez [Configuration de rôles IAM pour les demandes EMRFS à Amazon S3](https://docs.aws.amazon.com/emr/latest/ManagementGuide/emr-emrfs-iam-roles).

**Avertissement**  
Avant d'activer l'exécution spéculative pour les clusters Amazon EMR exécutant des tâches Apache Spark, veuillez consulter les informations suivantes.  
EMRFS inclut le S3-optimized committer EMRFS, une OutputCommitter implémentation optimisée pour l'écriture de fichiers sur Amazon S3 lors de l'utilisation d'EMRFS. Si vous activez la fonctionnalité d'exécution spéculative d'Apache Spark avec des applications qui écrivent des données dans Amazon S3 et n'utilisent pas le S3-optimized committer EMRFS, vous pouvez rencontrer des problèmes d'exactitude des données décrits dans. [ SPARK-10063 ](https://issues.apache.org/jira/browse/SPARK-10063) Cela peut se produire si vous utilisez des versions d'Amazon EMR antérieures à la version 5.19 d'Amazon EMR, ou si vous écrivez des fichiers dans Amazon S3 avec des formats tels que ORC et CSV. Ces formats ne sont pas pris en charge par le committer EMRFS. S3-optimized Pour une liste complète des exigences relatives à l'utilisation du committer EMRFS, voir [ Exigences relatives au S3-optimized committer EMRFS. S3-optimized ](https://docs.aws.amazon.com/emr/latest/ReleaseGuide/emr-spark-committer-reqs.html)  
L'écriture directe EMRFS est généralement utilisée lorsque le S3-optimized committer EMRFS n'est pas pris en charge, par exemple lors de l'écriture de ce qui suit :  
Un format de sortie autre que Parquet, tel que ORC ou texte.
Fichiers Hadoop à l'aide de l'API Spark RDD.
Parquet utilisant Hive SerDe. Consultez [Conversion de la table Hive Metastore Parquet](https://spark.apache.org/docs/latest/sql-data-sources-parquet.html#hive-metastore-parquet-table-conversion).
L'écriture directe EMRFS n'est pas utilisée dans les scénarios suivants :  
Lorsque le S3-optimized committer EMRFS est activé. Voir [ Exigences relatives au validateur EMRFS. S3-optimized ](https://docs.aws.amazon.com/emr/latest/ReleaseGuide/emr-spark-committer-reqs.html)
Lors de l'écriture de partitions dynamiques avec une partition OverwriteMode définie sur dynamique.
Lorsque vous écrivez sur des emplacements de partition personnalisés, tels que des emplacements non conformes à la convention d'emplacement de partition par défaut de Hive.
Lorsque vous utilisez des systèmes de fichiers autres qu'EMRFS, tels que l'écriture sur HDFS ou l'utilisation du système de fichiers S3A.
Pour déterminer si votre application utilise l'écriture directe dans Amazon EMR 5.14.0 ou version ultérieure, activez la journalisation Spark INFO. Si une ligne de journal contenant le texte « Direct Write : ENABLED » est présente dans les journaux du pilote Spark ou dans les journaux des conteneurs de l'exécuteur Spark, cela signifie que votre application Spark a écrit en écriture directe.  
Par défaut, l'exécution spéculative est `OFF` sur Amazon EMRClusters. Nous vous recommandons vivement de ne pas activer l'exécution spéculative si l'une ou l'autre de ces conditions est remplie :  
Vous écrivez des données sur Amazon S3.
Les données sont écrites dans un format autre qu'Apache Parquet ou dans le format Apache Parquet sans utiliser le committer EMRFS S3-optimized .
Si vous activez l'exécution spéculative de Spark et que vous écrivez des données sur Amazon S3 à l'aide de l'écriture directe EMRFS, vous risquez de subir des pertes de données intermittentes. Lorsque vous écrivez des données dans HDFS ou que vous écrivez des données dans Parquet à l'aide du S3-optimized committer EMRFS, Amazon EMR n'utilise pas l'écriture directe et ce problème ne se produit pas.  
Si vous devez écrire des données dans des formats utilisant l'écriture directe EMRFS depuis Spark vers Amazon S3 et utiliser l'exécution spéculative, nous vous recommandons d'écrire sur HDFS, puis de transférer les fichiers de sortie vers Amazon S3 à l'aide de S3DistCp.

**Topics**
+ [Vue cohérente](emr-plan-consistent-view.md)
+ [Autorisation d'accès aux données EMRFS dans Amazon S3](emr-plan-credentialsprovider.md)
+ [Gestion de la valeur par défaut AWS Security Token Service point de terminaison](emr-emrfs-sts-endpoint.md)
+ [Spécification du chiffrement Amazon S3 en utilisant les propriétés EMRFS](emr-emrfs-encryption.md)