Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Concepts et termes fondamentaux dans AWS Glue DataBrew
Vous trouverez ci-dessous un aperçu des concepts fondamentaux et de la terminologie dans AWS Glue DataBrew. Après avoir lu cette section, consultezDémarrage avec AWS Glue DataBrew, qui vous explique le processus de création de projets, de connexion d'ensembles de données et d'exécution de tâches.
Project
L'espace de travail interactif de préparation des données DataBrew s'appelle un projet. À l'aide d'un projet de données, vous gérez un ensemble d'éléments connexes : données, transformations et processus planifiés. Dans le cadre de la création d'un projet, vous choisissez ou créez un jeu de données sur lequel travailler. Ensuite, vous créez une recette, qui est un ensemble d'instructions ou d'étapes que vous DataBrew souhaitez suivre. Ces actions transforment vos données brutes en un formulaire prêt à être utilisé par votre pipeline de données.
Jeu de données
Un ensemble de données désigne simplement un ensemble de données, c'est-à-dire des lignes ou des enregistrements divisés en colonnes ou en champs. Lorsque vous créez un DataBrew projet, vous vous connectez aux données que vous souhaitez transformer ou préparer ou les télécharger. DataBrew peut fonctionner avec des données provenant de n'importe quelle source, importées à partir de fichiers formatés, et il se connecte directement à une liste croissante de magasins de données.
En effet DataBrew, un ensemble de données est une connexion en lecture seule à vos données. DataBrew collecte un ensemble de métadonnées descriptives pour faire référence aux données. Aucune donnée réelle ne peut être modifiée ou stockée par DataBrew. Pour des raisons de simplicité, nous utilisons un ensemble de données pour faire référence à la fois à l'ensemble de données réel et aux DataBrew utilisations des métadonnées.
Formule
Dans DataBrew, une recette est un ensemble d'instructions ou d'étapes relatives aux données sur lesquelles vous DataBrew souhaitez agir. Une recette peut contenir de nombreuses étapes, et chaque étape peut contenir de nombreuses actions. Vous utilisez les outils de transformation de la barre d'outils pour configurer toutes les modifications que vous souhaitez apporter à vos données. Plus tard, lorsque vous êtes prêt à voir le produit fini de votre recette, vous lui attribuez cette tâche DataBrew et vous la planifiez. DataBrew stocke les instructions relatives à la transformation des données, mais ne stocke aucune de vos données réelles. Vous pouvez télécharger et réutiliser des recettes dans d'autres projets. Vous pouvez également publier plusieurs versions d'une recette.
Tâche
DataBrew se charge de transformer vos données en exécutant les instructions que vous avez définies lorsque vous avez créé une recette. Le processus d'exécution de ces instructions s'appelle une tâche. Une tâche peut mettre en œuvre vos recettes de données selon un calendrier prédéfini. Mais vous n'êtes pas limité à un calendrier. Vous pouvez également exécuter des tâches à la demande. Si vous souhaitez profiler certaines données, vous n'avez pas besoin d'une recette. Dans ce cas, vous pouvez simplement configurer une tâche de profilage pour créer un profil de données.
Traçabilité des données
DataBrew suit vos données dans une interface visuelle afin de déterminer leur origine, appelée lignée de données. Cette vue vous montre comment les données circulent entre les différentes entités d'où elles proviennent à l'origine. Vous pouvez voir son origine, les autres entités qui l'ont influencée, ce qui lui est arrivé au fil du temps et où il a été stocké.
Profil de données
Lorsque vous profilez vos données, vous DataBrew créez un rapport appelé profil de données. Ce résumé vous renseigne sur la forme actuelle de vos données, notamment le contexte du contenu, la structure des données et leurs relations. Vous pouvez créer un profil de données pour n'importe quel ensemble de données en exécutant une tâche de profilage de données.