View a markdown version of this page

Traçage de l'ingestion et du traitement des lacs de données - Traçabilité avec Serverless Analytics

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Traçage de l'ingestion et du traitement des lacs de données

Date de publication : 15 juillet 2021 (Historique du diagramme)

Cette architecture montre comment suivre l'ingestion et le traitement de votre data lake à l'aide d'AWS X-Ray. Vous pouvez émettre des traces depuis les principaux points de contrôle du flux afin de diagnostiquer les problèmes liés au cycle de vie du traitement des lacs de données et d'identifier les goulots d'étranglement liés aux performances.

Suivi de l'ingestion et du traitement des lacs de données à l'aide d'AWS X-Ray

Schéma d'architecture illustrant l'ingestion des lacs de données et la traçabilité du traitement à l'aide d'AWS X-Ray AWS Step Functions AWS Lambda, et d'Amazon Simple Storage Service.

Les étapes suivantes décrivent l'architecture :

  1. Différents producteurs fournissent des données dans le lac de données basé sur Amazon Simple Storage Service.

  2. Les données arrivent d'abord dans un compartiment Amazon S3 pour les données brutes. Il s'agit de la première trace depuis qu'AWS X-Ray active les messages de suivi pour les notifications d'événements Amazon S3.

  3. Les blocs de curation des lacs de données préparent les données à des fins d'analyse. AWS Step Functionsdéclenche ces blocs de traitement. AWS X-Ray s'intègre à Step Functions pour vous aider à identifier les goulots d'étranglement en matière de performances et à résoudre les demandes qui ont entraîné une erreur.

  4. AWS X-Ray peut tracer AWS Lambda les fonctions. Lambda exécute le X-Ray démon et enregistre un segment contenant des détails sur l'appel de la fonction et les résultats. Pour plus d'instrumentation, associez au X-Ray SDK la fonction permettant d'enregistrer les appels sortants et d'ajouter des annotations et des métadonnées.

  5. La curation des données se poursuit avec la machine à états Step Functions qui déclenche le bloc de curation suivant. Comme le premier bloc, X-Ray peut capturer les fonctions Step et Lambda.

  6. Les données sont stockées dans un compartiment agrégé prêt à être analysées. Il s'agit de la dernière trace du flux d'ingestion du lac de données. Grâce aux traces émises depuis tous les points de contrôle clés, vous pouvez diagnostiquer les problèmes liés au cycle de vie du traitement des lacs de données.

  7. Divers outils d'analyse tels qu'Amazon Quick Sight, Amazon Redshift et Amazon Athena vous permettent de visualiser les données du lac de données construit sur Amazon S3.

Suggestions de lecture

Pour plus d'informations, consultez les ressources suivantes :

Historique du diagramme

Pour être informé des mises à jour de ce schéma d'architecture de référence, abonnez-vous au fil RSS.

ModificationDescriptionDate

Publication initiale

Schéma d'architecture de référence publié pour la première fois.

15 juillet 2021

Publication initiale

Le schéma d'architecture de référence a été publié pour la première fois

15 juillet 2021

Note

Pour vous abonner aux mises à jour RSS, un plug-in RSS doit être activé pour le navigateur que vous utilisez.