Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
AWS Glue Qualität der Daten
AWS Glue Datenqualität ermöglicht es Ihnen, die Qualität Ihrer Daten zu messen und zu überwachen, sodass Sie gute Geschäftsentscheidungen treffen können. AWS Glue Data Quality basiert auf dem DeeQu Open-Source-Framework und bietet ein verwaltetes, serverloses Erlebnis. AWS Glue Data Quality arbeitet mit der Data Quality Definition Language (DQDL), einer domänenspezifischen Sprache, mit der Sie Datenqualitätsregeln definieren. Weitere Informationen über DQDL und die unterstützten Regeltypen finden Sie unter Referenz zu Data Quality Definition Language (DQDL).
Weitere Produktdetails und Preise finden Sie auf der Serviceseite für AWS Glue Data Quality
Vorteile und wichtige Features
Zu den Vorteilen und Hauptmerkmalen von AWS Glue Data Quality gehören:
-
Serverless – es gibt keine Installation, Patches oder Wartung.
-
Schneller Einstieg — AWS Glue Data Quality analysiert Ihre Daten schnell und erstellt Datenqualitätsregeln für Sie. Sie können mit zwei Klicks loslegen: „Datenqualitätsregeln erstellen → Regeln empfehlen“.
-
Erkennen von Datenqualitätsproblemen – Verwenden Sie Machine Learning (ML), um Anomalien und schwer zu erkennende Datenqualitätsprobleme zu erkennen.
-
Regeln improvisieren – mit mehr als 25 sofort einsatzbereiten DQ-Regeln können Sie Regeln erstellen, die Ihren spezifischen Anforderungen entsprechen.
-
Qualität bewerten und fundierte Geschäftsentscheidungen treffen – Sobald Sie die Regeln bewertet haben, erhalten Sie einen Datenqualitätswert, der einen Überblick über den Zustand Ihrer Daten bietet. Verwenden Sie den Wert von Data Quality, um sichere Geschäftsentscheidungen zu treffen.
-
Konzentrieren Sie sich auf schlechte Daten — AWS Glue Data Quality hilft Ihnen dabei, die genauen Datensätze zu identifizieren, die zu einem Rückgang Ihrer Qualitätswerte geführt haben. Identifizieren, isolieren und beheben Sie sie ganz einfach.
-
Nutzungsbasierte Bezahlung — Für die Nutzung von AWS Glue Data Quality sind keine Jahreslizenzen erforderlich.
-
Keine Fixierung — AWS Glue Data Quality basiert auf Open Source DeeQu, sodass Sie die Regeln, die Sie verfassen, in einer offenen Sprache speichern können.
-
Datenqualitätsprüfungen – Sie können Datenqualitätsprüfungen für Data Catalog- und AWS Glue-ETL-Pipelines erzwingen, sodass Sie die Datenqualität im Ruhezustand und während der Übertragung verwalten können.
-
ML-based Erkennung der Datenqualität — Verwenden Sie maschinelles Lernen (ML), um Anomalien und schwer zu erkennende Probleme mit der Datenqualität zu erkennen.
-
Offene Sprache zum Ausdruck von Regeln – stellt sicher, dass Datenqualitätsregeln einheitlich und einfach verfasst werden. Geschäftsanwender können Datenqualitätsregeln ganz einfach in einer für sie verständlichen Sprache ausdrücken. Für Ingenieure bietet diese Sprache die Flexibilität, Code zu generieren, eine konsistente Versionsverwaltung zu implementieren und Bereitstellungen zu automatisieren.
Funktionsweise
Es gibt zwei Einstiegspunkte für AWS Glue Data Quality: die AWS Glue Data Catalog Jobs und ETL. AWS Glue Dieser Abschnitt bietet einen Überblick über die Anwendungsfälle und AWS Glue Funktionen, die jeder Einstiegspunkt unterstützt.
Datenqualität für den AWS Glue Data Catalog
AWS Glue Data Quality bewertet Objekte, die in der AWS Glue Data Catalog gespeichert sind. Es bietet Nicht-Programmierern eine einfache Möglichkeit, Datenqualitätsregeln einzurichten. Zu diesen Persönlichkeiten gehören Datenverwalter und Geschäftsanalysten.
Sie können diese Option für die folgenden Anwendungsfälle wählen:
-
Sie möchten Datenqualitätsaufgaben für Datensätze durchführen, die Sie bereits im AWS Glue Data Catalog katalogisiert haben.
-
Sie arbeiten an der Datenverwaltung und müssen kontinuierlich Datenqualitätsprobleme in Ihrem Data Lake identifizieren oder bewerten.
Sie können die Datenqualität für den Datenkatalog über die folgenden Schnittstellen verwalten:
-
Die Verwaltungskonsole AWS Glue
-
AWS Glue APIs
Um mit AWS Glue Datenqualität zu beginnen, AWS Glue Data Catalog sehen Sie sich anErste Schritte mit AWS Glue Data Quality für den Data Catalog.
Datenqualität für AWS Glue ETL-Aufträge
AWS Glue Mit Data Quality for AWS Glue ETL-Jobs können Sie proaktive Datenqualitätsaufgaben ausführen. Proaktive Aufgaben helfen Ihnen, fehlerhafte Daten zu identifizieren und herauszufiltern, bevor Sie einen Datensatz in Ihren Data Lake laden.
Sie können die Datenqualität für ETL-Aufträge für die folgenden Anwendungsfälle auswählen:
-
Sie möchten Datenqualitätsaufgaben in Ihre ETL-Aufträge einbeziehen
-
Sie möchten Code schreiben, der Datenqualitätsaufgaben in ETL-Skripten definiert
-
Sie möchten die Qualität der Daten, die in Ihren visuellen Daten-Pipelines fließen, verwalten
Sie können die Datenqualität für ETL-Aufträge über die folgenden Schnittstellen verwalten:
-
AWS Glue Studio, AWS Glue Studio Notizbücher und interaktive Sitzungen AWS Glue
-
AWS Glue Bibliotheken für ETL-Skripting
-
AWS Glue APIs
Informationen zu den ersten Schritten mit der Datenqualität für ETL-Aufträge finden Sie unter Tutorial: Erste Schritte mit Data Quality im AWS Glue Studio -Benutzerhandbuch.
Vergleich der Datenqualität für den Datenkatalog mit der Datenqualität für ETL-Aufträge
Diese Tabelle bietet einen Überblick über die Funktionen, die jeder Einstiegspunkt für AWS Glue Data Quality unterstützt.
| Feature | Datenqualität für den Datenkatalog | Datenqualität für ETL-Aufträge |
|---|---|---|
| Datenquellen | Amazon S3 Amazon Redshift, mit dem Datenkatalog kompatible JDBC-Quellen und transaktionale Data Lake-Formate wie Apache Iceberg, Apache Hudi und Delta Lake. AWS Lake Formation verwaltete OTF-Formate werden ebenfalls mit einigen Einschränkungen unterstützt. Amazon Athena Ansichten, die im AWS Glue Datenkatalog katalogisiert sind, werden nicht unterstützt. Weitere Informationen finden Sie unter Unterstützte Ressourcentypen. | Alle Datenquellen, die von unterstützt werden AWS Glue, einschließlich benutzerdefinierter Konnektoren und Konnektoren von Drittanbietern. |
| Empfehlungen für Data-Quality-Regeln | Unterstützt | Nicht unterstützt |
| DQDL-Regeln erstellen und ausführen | Unterstützt | Unterstützt |
| Auto-Scaling | Nicht unterstützt | Unterstützt |
| AWS Glue Flex-Unterstützung | Nicht unterstützt | Unterstützt |
| Planung | Wird beim Auswerten von Data-Quality-Regeln und über Schrittfunktionen unterstützt. | Wird bei der Verwendung von Schrittfunktionen und Workflows unterstützt. |
| Identifizieren von Datensätzen, bei denen die Datenqualitätsprüfungen fehlgeschlagen sind | Nicht unterstützt | Unterstützt |
| Integration mit Amazon Eventbridge | Unterstützt | Unterstützt |
| Integration mit AWS Cloudwatch | Unterstützt | Unterstützt |
| Schreiben von Datenqualitätsergebnissen in Amazon S3 | Unterstützt | Unterstützt |
| Inkrementelle Datenqualität | Wird über Pushdown-Prädikate unterstützt | Wird über AWS Glue Lesezeichen unterstützt |
| AWS CloudFormation Unterstützung | Unterstützt | Unterstützt |
| ML-based Erkennung von Anomalien | Unterstützt | Unterstützt |
| Dynamische Regeln | Unterstützt | Unterstützt |
Überlegungen
Beachten Sie die folgenden Punkte, bevor Sie AWS Glue Data Quality verwenden:
-
Datenqualitätsregeln können keine verschachtelten oder Listentyp-Datenquellen auswerten. Siehe Verschachtelte Strukturen verflachen.
Terminologie
In der folgenden Liste werden Begriffe definiert, die sich auf AWS Glue Datenqualität beziehen.
- Definitionssprache für Datenqualität (DQDL)
-
Eine domänenspezifische Sprache, die Sie zum Schreiben von AWS Glue Datenqualitätsregeln verwenden können.
Weitere Informationen zu DQDL finden Sie im Referenz zu Data Quality Definition Language (DQDL)-Benutzerhandbuch.
- Datenqualität
-
Beschreibt, wie gut ein Datensatz seinen spezifischen Zweck erfüllt. AWS Glue Bei der Datenqualität werden Regeln anhand eines Datensatzes evaluiert, um die Datenqualität zu messen. Jede Regel prüft auf bestimmte Merkmale wie Datenaktualität oder -integrität. Zur Quantifizierung der Datenqualität können Sie einen Datenqualitätswert verwenden.
- Datenqualitätswert
-
Der Prozentsatz der Datenqualitätsregeln, die erfüllt werden (das Ergebnis ist wahr), wenn Sie einen Regelsatz mit AWS Glue Data Quality bewerten.
- Regel
-
Ein DQDL-Ausdruck, der Ihre Daten auf ein bestimmtes Merkmal überprüft und einen booleschen Wert zurückgibt. Weitere Informationen finden Sie unter Regelstruktur.
- Analyzer
-
Ein DQDL-Ausdruck, der Datenstatistiken sammelt. Ein Analysator sammelt Datenstatistiken, die von ML-Algorithmen verwendet werden können, um Anomalien und schwer zu erkennende Datenqualitätsprobleme im Laufe der Zeit zu erkennen.
- Regelsatz
-
Eine AWS Glue Ressource, die eine Reihe von Datenqualitätsregeln umfasst. Ein Regelsatz muss einer Tabelle im AWS Glue Data Catalog zugeordnet sein. Beim Speichern eines Regelsatzes weist AWS Glue dem Regelsatz einen Amazon-Ressourcennamen (ARN) zu.
- Datenqualitätswert
-
Der Prozentsatz der Datenqualitätsregeln, die bei der Auswertung eines Regelsatzes mit AWS Glue Data Quality erfolgreich sind (das Ergebnis ist wahr).
- Beobachtung
-
Eine von AWS Glue generierte unbestätigte Erkenntnis, die durch die Analyse von Datenstatistiken gewonnen wird, die im Laufe der Zeit anhand von Regeln und Analysatoren erfasst wurden.
Einschränkungen
AWS Glue Grenzen des Datenqualitätsdienstes:
-
Ein Regelsatz kann 2.000 Regeln enthalten. Wenn Ihre Regelsätze größer sind, empfehlen wir, sie in mehrere Regelsätze aufzuteilen.
-
Die Größe des Regelsatzes beträgt 65 KB. Wenn Ihre Regelsätze größer sind, empfehlen wir, sie in mehrere Regelsätze aufzuteilen.
-
AWS Glue Data Quality erfasst Statistiken, wenn Sie eine Regel oder einen Analyzer erstellen. Das Speichern dieser Statistiken ist mit keinen Kosten verbunden. Es besteht jedoch ein Limit von 100.000 Statistiken pro Konto und diese Statistiken werden maximal zwei Jahre lang aufbewahrt.
Versionshinweise für AWS Glue Datenqualität
In diesem Thema werden die Funktionen beschrieben, die in die AWS Glue Datenqualität eingeführt wurden.
Allgemeine Verfügbarkeit: neue Features
Die folgenden neuen Funktionen sind mit der allgemeinen Verfügbarkeit von AWS Glue Data Quality verfügbar:
Die Möglichkeit zu ermitteln, welche Datensätze die Datenqualitätsprüfung nicht bestanden haben, wird jetzt unterstützt in AWS Glue Studio
Neue Regeltypen für die Datenqualität, wie z. B. die Validierung der referenziellen Integrität von Daten zwischen zwei Datensätzen, der Vergleich von Daten zwischen zwei Datensätzen und Datentypprüfungen
Verbesserte Benutzererfahrung in der AWS Glue Data Catalog
Unterstützung für Apache Iceberg, Apache Hudi und Delta Lake
Unterstützung für Amazon Redshift
Vereinfachte Benachrichtigung bei Amazon EventBridge
AWS CloudFormation Unterstützung für die Erstellung von Regelsätzen
Leistungsverbesserungen: Caching-Option in ETL und AWS Glue Studio für eine schnellere Leistung bei der Bewertung der Datenqualität
27. November 2023 (Vorschau)
-
ML-powered Funktionen zur Erkennung von Anomalien sind jetzt in AWS Glue ETL und verfügbar. AWS Glue Studio Damit können Sie jetzt Anomalien und schwer zu erkennende Datenqualitätsprobleme erkennen.
-
Mit dynamischen Regeln können Sie dynamische Schwellenwerte angeben (z. B.:)
RowCount> avg(last(10))
12. März 2024
-
DQDL-Verbesserungen
26. Juni 2024
-
DQDL-Verbesserungen
-
DQDL unterstützt jetzt die WHERE-Klausel, sodass Sie Daten filtern können, bevor Sie DQ-Regeln anwenden.
-
7. August 2024
-
Anomalieerkennung und dynamische Regeln sind jetzt allgemein verfügbar.
22. November 2024
-
Neue Regeltypen für die Verwaltung der Datenqualität Ihrer Dateien
-
Standardmäßige Datenqualitätsprüfungen in Visual ETL-Aufträgen
6. Dezember 2024
-
AWS Glue Data Quality unterstützt jetzt Amazon SageMaker AI LakeHouse Tabellen und AWS Lake Formation verwaltete Iceberg-, Delta- und HUDI-Tabellen in AWS Glue ETL 5.0.
7. Juli 2025
-
AWS Glue Datenqualität; unterstützt jetzt Amazon S3-Tabellen, RMS, Lakehouse und AWS Lake Formation verwaltete Iceberg-Tabellen im AWS Glue Datenkatalog.
21. November 2025
-
AWS Glue Data Quality unterstützt jetzt die Kennzeichnung von Regeln für eine verbesserte Berichterstattung. Sie können Datenqualitätsergebnisse effektiver organisieren und analysieren, indem Sie Ergebnisse anhand bestimmter Bezeichnungen abfragen, um fehlerhafte Regeln innerhalb bestimmter Kategorien zu identifizieren, Regelergebnisse nach Team oder Bereich zu zählen und zielgerichtete Berichte für verschiedene Stakeholder zu erstellen. Weitere Informationen finden Sie unter Labels.
-
AWS Glue Data Quality unterstützt jetzt Konstanten in DQDL, sodass Sie konstante Werte definieren und im gesamten Skript auf sie verweisen können. Dies hilft, Probleme im Zusammenhang mit Größenbeschränkungen für Abfragen zu vermeiden, wenn Sie mit großen SQL-Anweisungen arbeiten. Weitere Informationen finden Sie unter Konstanten.
27. Juli 2026
-
Mit AWS Glue Data Quality können Sie den
DistributionAnalyzer jetzt verwenden, um Häufigkeitsverteilungen für Ihre Datenspalten zu berechnen. Für numerische Spalten generiert er Histogramme in Unterteilungen. Für kategoriale Spalten werden Wertverteilungen generiert, die nach Häufigkeit sortiert sind. Weitere Informationen finden Sie unter Verteilungsanalysator. -
Sie können jetzt Ergebnisse zur Datenqualität in Apache Iceberg Tabellen im AWS Glue Data Catalog für Abfragen mit schreiben. Dazu gehören Regelergebnisse, Ergebnisse der Profilerstellung, Verteilungsergebnisse, Ergebnisse auf Zeilenebene und Beobachtungsergebnisse. Weitere Informationen finden Sie unter Datenqualitätsergebnisse in Datenkatalogtabellen schreiben.
-
Sie können jetzt die Anomalieerkennung mit dem verwenden. AWS Glue Data Catalog Um die Anomalieerkennung für katalogisierte Tabellen zu aktivieren, führen Sie Evaluierungsläufe mit
ObservationScopeset auf aus.ALLWeitere Informationen finden Sie unter Erkennung von Anomalien in AWS Glue Datenqualität.