View a markdown version of this page

SQL-basierte Datenverarbeitung in Amazon ECS - SQL-basierte Datenverarbeitung in Amazon ECS

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

SQL-basierte Datenverarbeitung in Amazon ECS

Veröffentlichungsdatum: 8. März 2021 () Geschichte des Diagramms

Diese Architektur zeigt, wie eine konfigurationsgesteuerte ETL-Alternative (Extract-Transform-Load) ohne Code mithilfe eines containerisierten ETL-Frameworks (ARC) erstellt wird, das die Datenverarbeitung mit vereinfacht und beschleunigt. Apache Spark Sie führen das Framework auf Amazon Elastic Container Service mit AWS Fargate aus. https://docs.aws.amazon.com/AmazonECS/latest/developerguide/Welcome.html https://docs.aws.amazon.com/AmazonECS/latest/developerguide/AWS_Fargate.html

SQL-basierte Datenverarbeitung in Amazon ECS

Architekturdiagramm, das die SQL-based Datenverarbeitung mit Amazon Elastic Container Service, AWS Fargate AWS Lambda, Amazon Simple Storage Service und Amazon CloudWatch zeigt.

Die folgenden Schritte beschreiben die Architektur:

  1. Ein Benutzer erstellt eine ETL-Datenpipeline, die auf dem ARC-Framework und SQL-Skripten in einem interaktiven ARC Jupyter Notebook basiert. Das Notebook läuft auf Amazon ECS mit AWS Fargate.

  2. Das Notebook und die ETL-Jobs verarbeiten Batch- und Stream-Daten über AWS PrivateLink. Der Verkehr zwischen ETL-Prozessen und Datenspeichern verlässt das Amazon-Netzwerk nicht.

  3. Das ARC Jupyter-Notebook erstellt eine JSON-Datei zur Jobflow-Konfiguration. Der Benutzer lädt die Datei und die SQL-Skripts über einen CI/CD automatisierten Bereitstellungsprozess oder manuell auf Amazon Simple Storage Service hoch.

  4. Ein Ereignis beim Eintreffen einer Amazon S3-Datei löst eine AWS Lambda Funktion aus.

  5. Die Lambda-Funktion startet eine Amazon ECS-Aufgabe, um Batch-Daten vorübergehend zu verarbeiten oder um Stream-Daten kontinuierlich in einem Container mit langer Laufzeit zu verarbeiten. Jeder Job verwendet isolierte Rechenressourcen.

  6. Amazon CloudWatch Events plant und orchestriert reguläre ARC-ETL-Jobs und Amazon ECS-Aufgaben mit den Starttypen AWS Fargate oder Amazon EC2.

  7. ARC-ETL-Jobs generieren Anwendungsprotokolle für jede Datenverarbeitungsphase auf granularer Ebene. CloudWatch bietet Überwachungs- und Warnfunktionen.

Weitere Informationen

Weitere Informationen finden Sie in den folgenden Ressourcen:

Geschichte des Diagramms

Abonnieren Sie den RSS-Feed, um über Aktualisierungen dieses Referenzarchitekturdiagramms informiert zu werden.

ÄnderungBeschreibungDatum

Erste Veröffentlichung

Das Referenzarchitekturdiagramm wurde zuerst veröffentlicht.

8. März 2021

Anmerkung

Um RSS-Updates zu abonnieren, muss ein RSS-Plugin für den von Ihnen verwendeten Browser aktiviert sein.