Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Konzepte zur Datenbereitstellung
Verwenden Sie dieses Thema, um die wichtigsten Konzepte für Streaming-Tabellen und die Amazon S3-Bereitstellung in Amazon Kinesis Data Streams zu überprüfen.
Datenaktualität
Die Aktualität der Daten definiert die maximale Zeit (in Sekunden), in der Kinesis Data Streams eingehende Datensätze zwischenspeichert, bevor sie an das Ziel übermittelt werden. Sie können die Aktualität der Daten zwischen 300 und 900 Sekunden (5 bis 15 Minuten) konfigurieren. Der Standardwert beträgt 300 Sekunden.
-
Niedrigere Werte — Schnellere Lieferung an Ihr Ziel mit kleineren Chargengrößen.
-
Höhere Werte — Effizienteres Batching, wodurch weniger, größere Dateien am Zielort produziert werden.
Eingabeformate für Streaming-Tabellen
Bei der Übertragung an Streaming-Tabellen auf Apache Iceberg unterstützt die Datenbereitstellung die folgenden Eingabedatensatzformate. Für beide Formate ist die AWS Glue Schemaregistrierung erforderlich.
-
JSON — einfache JSON-Datensätze. Sie müssen ein
GSRSchemaARN(das eines AWS Glue Schema Registry-Schemas) angeben, das auf ein in der Schema Registry registriertes AWS Glue Schema verweist. -
GSR_JSON (AWS Glue Schema Registry JSON) — JSON-Datensätze, bei denen die Schema-ID in jeden Datensatz eingebettet ist. Das Schema wird automatisch aus AWS Glue der Schemaregistrierung aufgelöst.
Eingabeformate für Amazon S3-Buckets für allgemeine Zwecke
Bei der Bereitstellung an Amazon S3-Buckets für allgemeine Zwecke unterstützt die Datenübermittlung die folgenden Eingabedatensatzformate. Es ist keine Schemaregistrierung erforderlich.
-
JSON — einfache JSON-Datensätze.
-
STRING — UTF-8 Zeichenkettendatensätze.
-
BYTE_ARRAY — rohe Binärdatensätze.
Anmerkung
Das GSR_JSON Format wird für Amazon S3-Buckets für allgemeine Zwecke nicht unterstützt. Es ist nur für die Lieferung an Streaming-Tabellen auf Apache Iceberg verfügbar.
Durchsetzung des Schemas
Bei Streaming-Tabellen auf Apache Iceberg wird jeder Datensatz anhand des in der Schemaregistrierung registrierten AWS Glue Schemas validiert. Datensätze, die nicht dem Schema entsprechen, werden nicht an Ihre Streaming-Tabelle übertragen. Fehlermetadaten werden zur Problembehandlung in die Warteschlange für unzustellbare Nachrichten geschrieben. Die Datenbereitstellung unterstützt die Schemaentwicklung nicht. Dazu gehören das Hinzufügen neuer Felder, das Entfernen vorhandener Felder, das Umbenennen von Feldern oder das Ändern von Felddatentypen.
Kein Auffüllen
Ihr Ziel empfängt nur Datensätze, die erstellt wurden, nachdem Sie die Streaming-Tabelle erstellt oder die S3-Bereitstellung konfiguriert haben. Bestehende Datensätze im Stream werden nicht aufgefüllt.
Neue Tabelle pro Lieferung
Bei jeder Streaming-Table-Lieferung wird am Zielort eine eigene Iceberg-Tabelle erstellt. Die Lieferung an bestehende Tabellen wird nicht unterstützt. Sie geben beim Aufrufen CreateChannel den ARN, den Namespace und den Tabellennamen des Tabellen-Buckets an.
Dead-letter Warteschlange
Eine Warteschlange mit unzustellbaren Briefen erfasst Informationen über Datensätze, die nicht erfolgreich zugestellt werden konnten.
-
Streaming-Tabellen auf Apache Iceberg — eine Warteschlange mit unlesbaren Buchstaben ist erforderlich. Sie müssen einen S3-Bucket und ein Präfix für fehlgeschlagene Datensätze angeben.
-
Amazon S3-Buckets für allgemeine Zwecke — eine Warteschlange mit unzustellbaren Briefen ist optional. Wenn nicht angegeben, wird standardmäßig derselbe Ziel-Bucket mit einem Fehlerpräfix verwendet.
Die Warteschlange mit toten Buchstaben enthält Datensatzkennungen und Fehlerkontext, keine Nutzlasten für vollständige Datensätze.
Inline-Komprimierung
Bei der Datenbereitstellung erfolgt die Inline-Komprimierung, indem Datensätze aus mehreren Shards in Dateien mit optimaler Größe zusammengefasst werden. Dadurch wird die Anzahl kleiner Dateien am Ziel reduziert und die Abfrageleistung verbessert.
Staaten der Lieferung
Eine Lieferung durchläuft während ihres Lebenszyklus die folgenden Zustände:
-
WIRD ERSTELLT — Die Lieferung wird bereitgestellt.
-
AKTIV — Die Lieferung liefert Datensätze.
-
AKTUALISIERUNG — Eine Konfigurationsänderung ist im Gange.
-
LÖSCHEN — Die Lieferung wird entfernt.
-
FEHLGESCHLAGEN — Bei der Lieferung ist ein nicht behebbarer Fehler aufgetreten.
Append-only Lieferung
Die Lieferung erfolgt nur als Anhang. Updates und Upserts werden nicht unterstützt. Jeder Datensatz aus dem Stream wird als neue Zeile am Ziel geschrieben.