Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Verwaltung von Inserts und Upserts in einem serverlosen Data Lake
Veröffentlichungsdatum: 15. Juni 2021 () Geschichte des Diagramms
Diese Architektur zeigt, wie Sie Apache Hudi Running on Amazon EMR verwenden können, um Einfügungen und Aktualisierungen von Datensätzen in Amazon Simple Storage Service zu verarbeiten. Sie können einen kostengünstigen und skalierbaren Data Lake aufbauen, der On-Demand-Analysen bereitstellt und persistente Data Marts erstellt.
Verwaltung von Inserts und Upserts in einem serverlosen Data Lake
Die folgenden Schritte beschreiben die Architektur:
-
Erfassen Sie Daten aus Quellsystemen per Batch, Change Data Capture (CDC) oder per Streaming in die Rohschicht in Amazon S3.
-
Nachdem die Daten im Rohdatensee auf Amazon S3 gespeichert sind, crawlen Sie die Daten und füllen Sie sie mithilfe eines Crawlers in den AWS Glue-Datenkatalog ein.
-
Ziehen Sie Rohdaten in einen Amazon EMR-Cluster und lesen Sie sie mit Hive und Spark zur Bereinigung und Transformation ein.
-
Apache HudiDie Ausführung auf Amazon EMR liest die Daten mithilfe von Spark-APIs und führt Einfügungen und Upserts für die erforderlichen Datensätze durch.
-
Speichern Sie die bereinigten und transformierten Daten wieder in den von Amazon S3 verarbeiteten und berichtspflichtigen Buckets.
-
Verwenden Sie die meldepflichtigen Daten bei Bedarf mit Athena oder laden Sie sie in Amazon Redshift. https://docs.aws.amazon.com/redshift/latest/dg/welcome.html Verschiedene Benutzer, Tools und Ressourcen können diese Daten nutzen.
-
Übernehmen Sie die komplette Datenverlagerung, erstellen Sie Amazon EMR-Cluster auf Abruf für Batch-Daten und laden Sie die Daten mithilfe der Workflow-Orchestrierung mit Amazon Managed Workflows for Apache Airflow (MWAA).
Weitere Informationen
Weitere Informationen finden Sie in den folgenden Ressourcen:
Geschichte des Diagramms
Abonnieren Sie den RSS-Feed, um über Aktualisierungen dieses Referenzarchitekturdiagramms informiert zu werden.
| Änderung | Beschreibung | Datum |
|---|---|---|
Erste Veröffentlichung | Das Referenzarchitekturdiagramm wurde zuerst veröffentlicht. | 15. Juni 2021 |
Anmerkung
Um RSS-Updates zu abonnieren, muss ein RSS-Plugin für den von Ihnen verwendeten Browser aktiviert sein.