View a markdown version of this page

AWS Entity Resolution Glossar - AWS Entity Resolution

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

AWS Entity Resolution Glossar

Amazon-Ressourcenname (ARN)

Ein eindeutiger Bezeichner für AWS Ressourcen. ARNs sind erforderlich, wenn Sie eine Ressource in allen Bereichen eindeutig angeben müssen AWS Entity Resolution, z. B. in AWS Entity Resolution Richtlinien, Amazon Relational Database Service (Amazon RDS) -Tags und API-Aufrufen.

Attribut Typ

Der Typ des Attributs für das Eingabefeld. Wenn Sie eine Schemazuordnung erstellen, wählen Sie den Attributtyp aus einer vorkonfigurierten Werteliste wie Name , Adresse, Telefonnummer oder E-Mail-Adresse aus. Der Attributtyp gibt an, AWS Entity Resolution welche Art von Daten Sie präsentieren, sodass sie ordnungsgemäß klassifiziert und normalisiert werden können.

Automatische Verarbeitung

Eine Option für den Verarbeitungsrhythmus für einen passenden Workflow-Job, die es ermöglicht, ihn automatisch auszuführen, wenn sich Ihre Dateneingabe ändert.

Diese Option ist nur für den regelbasierten Abgleich verfügbar.

Standardmäßig ist der Verarbeitungsrhythmus für einen passenden Workflow-Job auf Manuell festgelegt , sodass er bei Bedarf ausgeführt werden kann. Sie können die automatische Verarbeitung so einrichten, dass Ihr passender Workflow-Job automatisch ausgeführt wird, wenn sich Ihre Dateneingabe ändert. Dadurch bleibt Ihre passende Workflow-Ausgabe auf dem neuesten Stand.

AWS KMS key ARN

Dies ist Ihr AWS KMS Amazon-Ressourcenname (ARN) für die Verschlüsselung im Ruhezustand. Falls nicht angegeben, verwendet das System einen AWS Entity Resolution verwalteten KMS-Schlüssel.

Batch-Arbeitsablauf

Ein Prozess, der in geplanten Intervallen ausgeführt wird, um Daten aus einem gesamten Datensatz abzugleichen und zu lösen. Batch-Workflows in AWS Entity Resolution eignen sich am besten für die Ersteinrichtung, regelmäßige vollständige Aktualisierungen und Szenarien mit erheblichen Änderungen sowohl der Quell- als auch der Zieldatensätze.

Klartext

Daten, die nicht kryptografisch geschützt sind.

Konfidenzniveau () ConfidenceLevel

Für den ML-Abgleich ist dies das Konfidenzniveau, das angewendet wird AWS Entity Resolution , wenn ML einen übereinstimmenden Datensatz identifiziert. Dies ist Teil der passenden Workflow-Metadaten, die in die Ausgabe aufgenommen werden.

Konfidenzniveau aufzeichnen (RecordConfidenceLevel)

Für den inkrementellen ML-Abgleich ist dies das Konfidenzniveau pro Datensatz, das angewendet wird, AWS Entity Resolution wenn ML eine übereinstimmende Datensatzgruppe identifiziert. Dies ist Teil der passenden Workflow-Metadaten, die in die Ausgabe aufgenommen werden.

Entschlüsselung

Der Prozess der Rücktransformation verschlüsselter Daten in ihre ursprüngliche Form. Die Entschlüsselung kann nur durchgeführt werden, wenn Sie Zugriff auf den geheimen Schlüssel haben.

Verschlüsselung

Der Vorgang, bei dem Daten mithilfe eines geheimen Werts, der als Schlüssel bezeichnet wird, in eine zufällig erscheinende Form codiert werden. Ohne Zugriff auf den Schlüssel ist es unmöglich, den ursprünglichen Klartext zu ermitteln.

Gruppenname

Der Gruppenname verweist auf die gesamte Gruppe von Eingabefeldern und kann Ihnen helfen, analysierte Daten zu Vergleichszwecken zu gruppieren.

Wenn es beispielsweise drei Eingabefelder gibt:first_name, undmiddle_name, können Sie sie gruppierenlast_name, indem Sie den Gruppennamen wie full_name für den Abgleich und die Ausgabe eingeben.

Hash

Hashing bedeutet, dass ein kryptografischer Algorithmus angewendet wird, der eine irreversible und eindeutige Zeichenfolge mit einer festen Größe erzeugt — einen sogenannten Hash. AWS Entity Resolution verwendet das Secure Hash Algorithm 256-Bit-Hash-Protokoll (SHA256) und gibt eine 32-Byte-Zeichenfolge aus. In können Sie wählen AWS Entity Resolution, ob Datenwerte in Ihrer Ausgabe gehasht werden sollen.

Hash-Protokoll (HashingProtocol)

AWS Entity Resolution verwendet das Secure Hash Algorithm 256-Bit-Hash-Protokoll (SHA256) und gibt eine 32-Byte-Zeichenfolge aus. Dies ist Teil der passenden Workflow-Metadaten, die in die Ausgabe aufgenommen werden.

Methode der ID-Zuordnung

Wie die ID-Zuordnung durchgeführt werden soll.

Es gibt zwei Methoden zur ID-Zuordnung:

  • Rule-based — Die Methode, mit der Sie Vergleichsregeln verwenden, um Erstanbieterdaten in einem ID-Mapping-Workflow von einer Quelle in ein Ziel zu übersetzen.

  • Provider-Dienste — Die Methode, mit der Sie einen Provider-Service verwenden, um in einem ID-Mapping-Workflow von Drittanbietern kodierte Daten von einer Quelle in ein Ziel zu übersetzen.

    AWS Entity Resolution unterstützt derzeit LiveRamp als Provider-Dienste die ID-Zuordnungsmethode. Sie müssen über ein Abonnement für LiveRamp Through verfügen, um diese AWS Data Exchange Methode verwenden zu können. Weitere Informationen finden Sie unter Schritt 1: Abonnieren Sie einen Anbieterdienst unter AWS Data Exchange.

Arbeitsablauf für die ID-Zuordnung

Ein Datenverarbeitungsauftrag, der Daten aus einer Eingabedatenquelle einem Eingabedatenziel auf der Grundlage der angegebenen ID-Zuordnungsmethode zuordnet. Es erstellt eine ID-Zuordnungstabelle. Für diesen Workflow müssen Sie die ID-Zuordnungsmethode und die Eingabedaten angeben, die Sie von einer Quelle in ein Ziel übersetzen möchten.

Sie können einen ID-Zuordnungs-Workflow einrichten, der in Ihrem eigenen AWS-Konto oder in zwei Arbeitsabläufen ausgeführt wird AWS-Konten.

ID-Namespace

Eine Ressource AWS Entity Resolution , die Metadaten enthält, in denen Datensätze aus mehreren Quellen erklärt werden AWS-Konten und wie diese Datensätze in einem ID-Mapping-Workflow verwendet werden.

Es gibt zwei Arten von ID-Namespaces: und. SOURCE TARGET Der SOURCE enthält Konfigurationen für die Quelldaten, die in einem ID-Zuordnungs-Workflow verarbeitet werden. Das TARGET enthält eine Konfiguration der Zieldaten, in die alle Quellen aufgelöst werden. Um die Eingabedaten zu definieren, die Sie in zwei Gruppen auflösen möchten AWS-Konten, erstellen Sie eine ID-Namespace-Quelle und ein ID-Namespace-Ziel, um Ihre Daten von einem Set (SOURCE) in ein anderes () zu übersetzen. TARGET

Nachdem Sie und ein anderes Mitglied ID-Namespaces erstellt und einen ID-Zuordnungs-Workflow ausgeführt haben, können Sie einer Kollaboration beitreten, AWS Clean Rooms um eine Verknüpfung mehrerer Tabellen in der ID-Zuordnungstabelle auszuführen und die Daten zu analysieren.

Weitere Informationen finden Sie im AWS Clean Rooms -Benutzerhandbuch.

Inkrementeller Arbeitsablauf

Ein Prozess, der nur neue oder aktualisierte Datensätze seit dem letzten Lauf abgleicht und auflöst, anstatt den gesamten Datensatz zu verarbeiten. Inkrementelle Workflows in AWS Entity Resolution eignen sich am besten für häufige Aktualisierungen, um die Aktualität der Daten aufrechtzuerhalten, wenn sich nur ein kleiner Teil des Datensatzes geändert hat.

Eingabefeld

Ein Eingabefeld entspricht einem Spaltennamen aus Ihrer AWS Glue Eingabedatentabelle.

Eingabequelle ARN (InputSourceARN)

Der Amazon-Ressourcenname (ARN), der für eine AWS Glue Tabelleneingabe generiert wurde. Dies ist Teil der passenden Workflow-Metadaten, die in die Ausgabe aufgenommen werden.

Abgleich auf Grundlage von Machine Learning

Beim maschinellen Lernen (ML-Matching) werden Übereinstimmungen in Ihren Daten gefunden, die möglicherweise unvollständig sind oder nicht exakt gleich aussehen. Beim ML-Abgleich handelt es sich um einen voreingestellten Prozess, bei dem versucht wird, Datensätze aus allen von Ihnen eingegebenen Daten abzugleichen. Beim ML-Abgleich werden eine Übereinstimmungs-ID und ein Konfidenzniveau für jeden übereinstimmenden Datensatz zurückgegeben.

Manuelle Verarbeitung

Eine Option für den Verarbeitungsrhythmus für einen passenden Workflow-Job, mit der dieser bei Bedarf ausgeführt werden kann.

Diese Option ist standardmäßig festgelegt und sowohl für den regelbasierten Abgleich als auch für den auf maschinellem Lernen basierenden Abgleich verfügbar.

Many-to-Many übereinstimmend

Many-to-many Matching vergleicht mehrere Instanzen ähnlicher Daten. Werte in Eingabefeldern, denen derselbe Vergleichsschlüssel zugewiesen wurde, werden miteinander verglichen, unabhängig davon, ob sie sich im selben Eingabefeld oder in unterschiedlichen Eingabefeldern befinden.

Beispielsweise könnten Sie mehrere Eingabefelder für Telefonnummern wie mobile_phone und home_phone mit demselben Vergleichsschlüssel „Telefon“ haben. Verwenden Sie den Viele-zu-Viele-Abgleich, um Daten im mobile_phone Eingabefeld mit Daten im mobile_phone Eingabefeld und Daten im home_phone Eingabefeld zu vergleichen.

Vergleichsregeln werten Daten in mehreren Eingabefeldern mit demselben Vergleichsschlüssel mithilfe einer (ODER) -Operation aus, und beim Eins-zu-Viele-Vergleich werden Werte in mehreren Eingabefeldern verglichen. Das bedeutet, dass, wenn eine Kombination aus mobile_phone oder zwischen zwei Datensätzen home_phone übereinstimmt, der Vergleichsschlüssel „Telefon“ einen Treffer zurückgibt. Für die Vergleichstaste „Telefon“, um eine Übereinstimmung zu finden, Record One mobile_phone = Record Two mobile_phone ODER Record One mobile_phone = Record Two home_phone ODER Record One home_phone = Record Two home_phone ODERRecord One home_phone = Record Two mobile_phone.

Spiel-ID (MatchID)

Bei regelbasiertem Abgleich und ML-Abgleich ist dies die ID, die von jedem übereinstimmenden Datensatz generiert AWS Entity Resolution und auf ihn angewendet wird. Dies ist Teil der passenden Workflow-Metadaten, die in die Ausgabe aufgenommen werden.

Schlüssel abgleichen (MatchKey)

Der Abgleichschlüssel gibt an AWS Entity Resolution , welche Eingabefelder als ähnliche Daten und welche als unterschiedliche Daten betrachtet werden sollen. Dies hilft dabei, AWS Entity Resolution automatisch regelbasierte Abgleichsregeln zu konfigurieren und ähnliche Daten zu vergleichen, die in verschiedenen Eingabefeldern gespeichert sind.

Wenn Ihre Daten mehrere Arten von Telefonnummerninformationen wie ein mobile_phone Eingabefeld und ein home_phone Eingabefeld enthalten, die Sie miteinander vergleichen möchten, können Sie beiden den Vergleichsschlüssel „Telefon“ geben. Dann kann der regelbasierte Abgleich so konfiguriert werden, dass Daten mithilfe von „oder“ -Anweisungen in allen Eingabefeldern mit dem One-to-One Abgleichschlüssel „Telefon“ verglichen werden (siehe Abgleichen und Abgleichen von Definitionen im Abschnitt Many-to-Many Abgleichen von Arbeitsabläufen).

Wenn Sie möchten, dass beim regelbasierten Abgleich verschiedene Arten von Telefonnummerninformationen völlig getrennt betrachtet werden, können Sie spezifischere Vergleichsschlüssel wie „Mobile_Phone“ und „“ erstellen. Home_Phone Wenn Sie dann einen Abgleichsworkflow einrichten, können Sie angeben, wie die einzelnen Telefonabgleichsschlüssel beim regelbasierten Abgleich verwendet werden sollen.

Wenn für ein bestimmtes Eingabefeld „Nein“ angegeben MatchKey ist, kann es nicht für den Abgleich verwendet werden. Es kann jedoch den passenden Workflow-Prozess durchlaufen und bei Bedarf ausgegeben werden.

Name des Abgleichsschlüssels

Der Name, der einem Match-Schlüssel zugewiesen ist.

Regel abgleichen (MatchRule)

Bei regelbasiertem Abgleich ist dies die angewendete Regelnummer, die eine übereinstimmende Datensatzgruppe generiert hat. Dies ist Teil der passenden Workflow-Metadaten, die in die Ausgabe aufgenommen werden.

Übereinstimmung

Der Prozess, bei dem Daten aus verschiedenen Eingabefeldern, Tabellen oder Datenbanken kombiniert und verglichen werden und anhand der Erfüllung bestimmter Abgleichskriterien (z. B. durch Vergleichsregeln oder Modelle) bestimmt wird, welche davon ähnlich sind — oder „übereinstimmen“.

Passender Arbeitsablauf

Der Prozess, den Sie eingerichtet haben, um die Eingabedaten anzugeben, die miteinander verglichen werden sollen, und die Art und Weise, wie der Abgleich durchgeführt werden soll.

Passende Workflow-Beschreibung

Eine optionale Beschreibung des passenden Workflows, den Sie eingeben können. Beschreibungen helfen Ihnen dabei, zwischen passenden Workflows zu unterscheiden, wenn Sie mehr als einen erstellen.

Passender Workflow-Name

Der Name für den passenden Workflow, den Sie angeben.

Anmerkung

Passende Workflow-Namen müssen eindeutig sein. Sie dürfen nicht denselben Namen haben, da sonst ein Fehler zurückgegeben wird.

Passende Workflow-Metadaten

Informationen, die AWS Entity Resolution während eines passenden Workflow-Jobs generiert und ausgegeben wurden. Diese Information ist bei der Ausgabe erforderlich.

Normalisierung () ApplyNormalization

Wählen Sie, ob die Eingabedaten wie im Schema definiert normalisiert werden sollen. Bei der Normalisierung werden Daten standardisiert, indem zusätzliche Leerzeichen und Sonderzeichen entfernt und das Format auf Kleinbuchstaben standardisiert wird.

Wenn ein Eingabefeld beispielsweise den Attributtyp Vollständige Telefonnummer hat und die Werte in der Eingabetabelle als formatiert sind(123) 456-7890, AWS Entity Resolution werden die Werte auf normalisiert. 1234567890

Anmerkung

Die Normalisierung wird nur für den Gruppentyp für Name, Adresse , Telefon und E-Mail unterstützt.

In den folgenden Abschnitten werden unsere Standardregeln für die Normalisierung beschrieben.

Informationen zum speziellen ML-based Abgleich finden Sie unterNormalisierung () — nur ApplyNormalization ML-based.

Name

Anmerkung

Die Normalisierung wird nur für den Gruppentyp Name unterstützt.

Der Gruppentyp Name wird in der Konsole und wie in der API als NAME Vollständiger Name angezeigt.

Wenn Sie die Untertypen des Gruppentyps Name normalisieren möchten, gehen Sie wie folgt vor:

  • Weisen Sie in der Konsole der Gruppe „Vollständiger Name“ die folgenden Untertypen zu: Vorname, Zweiter Vorname und Nachname.

  • Weisen Sie der NAME GroupName in der CreateSchemaMapping API die folgenden Typen zu: NAME_FIRSTNAME_MIDDLE, und. NAME_LAST

  • TRIM = Schneidet führende und nachfolgende Leerzeichen ab

  • LOWERCASE = Alle Alphazeichen werden in Kleinbuchstaben geschrieben

  • CONVERT_ACCENT = Wandelt Buchstaben mit Akzent in normale Buchstaben um

  • REMOVE_ALL_NON_ALPHA = Entfernt alle Nicht-Alpha-Zeichen [a-z] A-Z

Email

Anmerkung

Die Normalisierung wird für den Gruppentyp E-Mail unterstützt.

Der Gruppentyp E-Mail wird in der Konsole als E-Mail-Adresse und EMAIL_ADDRESS in der API angezeigt.

  • TRIM = Schneidet führende und nachfolgende Leerzeichen ab

  • LOWERCASE = Alle Alphazeichen werden in Kleinbuchstaben geschrieben

  • CONVERT_ACCENT = Wandelt Buchstaben mit Akzent in normale Buchstaben um

  • EMAIL_ADDRESS_UTIL_NORM = Entfernt alle Punkte (.) aus dem Nutzernamen, entfernt alles, was nach einem Pluszeichen (+) im Nutzernamen steht, und standardisiert gängige Domainvarianten

  • REMOVE_ALL_NON_EMAIL_CHARS = Entfernt alle nicht-alphanumerischen Zeichen [a-z] und [.@ -] A-Z0-9

Phone

Anmerkung

Die Normalisierung wird nur für den Gruppentyp Telefon unterstützt.

Der Gruppentyp Telefon wird in der Konsole und wie PHONE in der API als Vollständige Telefonnummer angezeigt.

Wenn Sie die Untertypen des Gruppentyps Telefon normalisieren möchten, gehen Sie wie folgt vor:

  • Weisen Sie in der Konsole der vollständigen Telefongruppe die folgenden Untertypen zu: Telefonnummer und Telefonvorwahl.

  • Weisen Sie in der CreateSchemaMapping API dem PHONE GroupName die folgenden Typen zu: PHONE_NUMBER und. PHONE_COUNTRYCODE

  • TRIM = Schneidet führende und nachfolgende Leerzeichen ab

  • REMOVE_ALL_NON_NUMERIC = Entfernt alle nicht numerischen Zeichen [0-9]

  • REMOVE_ALL_LEADING_ZEROES = Entfernt alle führenden Nullen

  • ENSURE_PREFIX_WITH_MAP, „phone" = Überprüft jede Telefonnummer und versucht, sie mit den Mustern im Telefon abzugleichen. PrefixMap PrefixMap Wenn eine Übereinstimmung gefunden wird, fügt die Regel das Präfix der Telefonnummer hinzu oder ändert es, um sicherzustellen, dass es dem in der Karte angegebenen standardisierten Format entspricht.

Adresse

Anmerkung

Die Normalisierung wird nur für den Gruppentyp „Adresse“ unterstützt.

Der Adressgruppentyp wird in der Konsole und wie ADDRESS in der API als Vollständige Adresse angezeigt.

Gehen Sie wie folgt vor, wenn Sie die Untertypen des Adressgruppentyps normalisieren möchten:

  • Weisen Sie in der Konsole der vollständigen Adressgruppe die folgenden Untertypen zu: Straße 1, Straße 2: Straße 3, Name der Stadt, Bundesland , Land und Postleitzahl t

  • Weisen Sie dem ADDRESS GroupName in der CreateSchemaMapping API die folgenden Typen zu:ADDRESS_STREET1,ADDRESS_STREET2,ADDRESS_STREET3, ADDRESS_CITY ADDRESS_STATEADDRESS_COUNTRY, und. ADDRESS_POSTALCODE

  • TRIM = Schneidet führende und nachfolgende Leerzeichen ab

  • LOWERCASE = Alle Alphazeichen werden in Kleinbuchstaben geschrieben

  • CONVERT_ACCENT = Wandelt Buchstaben mit Akzent in normale Buchstaben um

  • REMOVE_ALL_NON_ALPHA = Entfernt alle Nicht-Alpha-Zeichen [a-z] A-Z

  • RAME_WORDS mit ADDRESS_RAME_WORD_MAP = ersetzt Wörter in der Adresszeichenfolge durch Wörter aus ADDRESS_RAME_WORD_MAP ADDRESS_RENAME_WORD_MAP

  • RAME_DELIMITERS mit ADDRESS_RAME_DELIMITER_MAP = Ersetze die Trennzeichen in der Adresszeichenfolge durch eine Zeichenfolge aus ADDRESS_RAME_DELIMITER_MAP

  • RAME_DIRECTIONS mit ADDRESS_RAME_DIRECTION_MAP = Ersetze die Trennzeichen in der Adresszeichenfolge durch eine Zeichenfolge aus ADDRESS_RAME_DIRECTION_MAP ADDRESS_RENAME_DIRECTION_MAP

  • RAME_NUMBERS mit ADDRESS_RAME_NUMBER_MAP = ersetzt Zahlen in der Adresszeichenfolge durch eine Zeichenfolge aus ADDRESS_RAME_NUMBER_MAP

  • RAME_SPECIAL_CHARS mit ADDRESS_RAME_SPECIAL_CHAR_MAP = Ersetze Sonderzeichen in der Adresszeichenfolge durch eine Zeichenfolge aus ADDRESS_RAME_SPECIAL_CHAR_MAP

ADDRESS_RENAME_WORD_MAP

Dies sind die Wörter, die bei der Normalisierung der Adresszeichenfolge umbenannt werden.

"avenue": "ave", "bouled": "blvd", "circle": "cir", "circles": "cirs", "court": "ct", "centre": "ctr", "center": "ctr", "drive": "dr", "freeway": "fwy", "frwy": "fwy", "highway": "hwy", "lane": "ln", "parks": "park", "parkways": "pkwy", "pky": "pkwy", "pkway": "pkwy", "pkwys": "pkwy", "parkway": "pkwy", "parkwy": "pkwy", "place": "pl", "plaza": "plz", "plza": "plz", "road": "rd", "square": "sq", "squ": "sq", "sqr": "sq", "street": "st", "str": "st", "str.": "strasse"

ADDRESS_RENAME_DELIMITER_MAP

Dies sind die Trennzeichen, die bei der Normalisierung der Adresszeichenfolge umbenannt werden.

",": " ", ".": " ", "[": " ", "]": " ", "/": " ", "-": " ", "#": " number "

ADDRESS_RENAME_DIRECTION_MAP

Dies sind die Richtungskennungen, die bei der Normalisierung der Adresszeichenfolge umbenannt werden.

"east": "e", "north": "n", "south": "s", "west": "w", "northeast": "ne", "northwest": "nw", "southeast": "se", "southwest": "sw"

ADDRESS_RENAME_NUMBER_MAP

Dies sind die Zahlenzeichenfolgen, die bei der Normalisierung der Adresszeichenfolge umbenannt werden.

"número": "number", "numero": "number", "no": "number", "núm": "number", "num": "number"

ADDRESS_RENAME_SPECIAL_CHAR_MAP

Dies ist die Zeichenfolge mit Sonderzeichen, die bei der Normalisierung der Adresszeichenfolge umbenannt wird.

"ß": "ss", "ä": "ae", "ö": "oe", "ü": "ue", "ø": "o", "æ": "ae"

Gehasht

  • TRIM = Schneidet führende und nachfolgende Leerzeichen ab

Source_ID

  • TRIM = Schneidet Leerzeichen am Anfang und am Ende ab

Normalisierung () — nur ApplyNormalization ML-based

Wählen Sie, ob die Eingabedaten wie im Schema definiert normalisiert werden sollen. Bei der Normalisierung werden Daten standardisiert, indem zusätzliche Leerzeichen und Sonderzeichen entfernt und das Format auf Kleinbuchstaben standardisiert wird.

Wenn ein Eingabefeld beispielsweise den Attributtyp hat und die Werte in der NAME Eingabetabelle als formatiert sindJohns Smith, AWS Entity Resolution werden die Werte auf normalisiert. john smith

In den folgenden Abschnitten werden die Normalisierungsregeln für Matching-Workflows beschrieben, die auf maschinellem Lernen basieren.

Name

  • TRIM = Schneidet führende und nachfolgende Leerzeichen ab

  • LOWERCASE = Alle Alphazeichen werden in Kleinbuchstaben geschrieben

Email

  • LOWERCASE = Alle Alphazeichen werden in Kleinbuchstaben geschrieben

  • Ersetzt nur (at) (Groß- und Kleinschreibung beachten) durch ein @-Symbol

  • Entfernt alle Leerzeichen an einer beliebigen Stelle im Wert

  • Entfernt alles, was sich außerhalb des ersten befindet, "< >" falls es existiert

Phone

  • TRIM = Schneidet führende und nachfolgende Leerzeichen ab

  • REMOVE_ALL_NON_NUMERIC = Entfernt alle nicht numerischen Zeichen [0-9]

  • REMOVE_ALL_LEADING_ZEROES = Entfernt alle führenden Nullen

  • ENSURE_PREFIX_WITH_MAP, „phone" = Überprüft jede Telefonnummer und versucht, sie mit den Mustern im Telefon abzugleichen. PrefixMap PrefixMap Wenn eine Übereinstimmung gefunden wird, fügt die Regel das Präfix der Telefonnummer hinzu oder ändert es, um sicherzustellen, dass es dem in der Karte angegebenen standardisierten Format entspricht.

One-to-One übereinstimmend

One-to-one Matching vergleicht einzelne Instanzen ähnlicher Daten. Eingabefelder mit demselben Vergleichsschlüssel und Werten in demselben Eingabefeld werden miteinander verglichen.

Beispielsweise könnten Sie mehrere Eingabefelder für Telefonnummern wie mobile_phone und home_phone haben denselben Vergleichsschlüssel „Telefon“. Verwenden Sie den Eins-zu-Eins-Abgleich, um Daten im mobile_phone Eingabefeld mit Daten im mobile_phone Eingabefeld zu vergleichen und um Daten im home_phone Eingabefeld mit Daten im home_phone Eingabefeld zu vergleichen. Die Daten im mobile_phone Eingabefeld werden nicht mit den Daten im home_phone Eingabefeld verglichen.

Vergleichsregeln werten Daten in mehreren Eingabefeldern mit demselben Vergleichsschlüssel mithilfe einer (ODER) -Operation aus, und beim Eins-zu-Viele-Abgleich werden Werte in einem einzelnen Eingabefeld verglichen. Das heißt, wenn mobile_phone oder zwischen zwei Datensätzen home_phone übereinstimmt, gibt der Vergleichsschlüssel „Telefon“ einen Treffer zurück. Für die Suchtaste „Telefon“, um eine Übereinstimmung zu finden, Record One mobile_phone = Record Two mobile_phone ODERRecord One home_phone = Record Two home_phone.

Vergleichsregeln werten Daten in Eingabefeldern mit unterschiedlichen Vergleichstasten mit einer (und) -Operation aus. Wenn Sie möchten, dass beim regelbasierten Abgleich verschiedene Arten von Telefonnummerninformationen völlig getrennt betrachtet werden, können Sie spezifischere Vergleichsschlüssel wie „mobile_phone“ und „home_phone“ erstellen. Wenn Sie beide Vergleichstasten in einer Regel verwenden möchten, um Übereinstimmungen zu finden, UND. Record One mobile_phone = Record Two mobile_phone Record One home_phone = Record Two home_phone

Ausgabe

Eine Liste von OutputAttribute Objekten, von denen jedes die Felder Name und Hashed hat. Jedes dieser Objekte steht für eine Spalte, die in die AWS Glue Ausgabetabelle aufgenommen werden soll, und gibt an, ob die Werte in der Spalte gehasht werden sollen.

Gibt S3Path aus

Das S3-Ziel, in das die AWS Entity Resolution Ausgabetabelle geschrieben wird.

OutputSourceConfig

Eine Liste von OutputSource Objekten, von denen jedes die Felder Outputs3Path und Output enthält. ApplyNormalization

Abgleich auf Basis des Provider-Dienstes

Beim Anbieterservice-basierten Abgleich werden Ihre Datensätze mit bevorzugten Datendienstanbietern und lizenzierten Datensätzen abgeglichen, verknüpft und erweitert. Sie müssen über ein Abonnement beim Anbieterdienst AWS Data Exchange verfügen, um diese Matching-Technik verwenden zu können.

AWS Entity Resolution ist derzeit in die folgenden Datendienstanbieter integriert:

  • LiveRamp

  • TransUnion

  • UID 2.0

Rule-based übereinstimmend

Rule-based Matching ist ein Prozess, der entwickelt wurde, um genaue Übereinstimmungen zu finden. Rule-based Beim Abgleichen handelt es sich um einen hierarchischen Satz von Regeln für den Wasserfallvergleich, der von Ihnen vorgeschlagen wird AWS Entity Resolution, auf der Grundlage der von Ihnen eingegebenen Daten und vollständig von Ihnen konfigurierbar ist. Alle in den Regelkriterien angegebenen Vergleichsschlüssel müssen exakt übereinstimmen, damit verglichene Daten als Treffer deklariert und die zugehörigen Metadaten ausgegeben werden können. Rule-based matching gibt eine Match-ID und eine Regelnummer für jeden übereinstimmenden Datensatz zurück.

Wir empfehlen, Regeln zu definieren, mit denen eine Entität eindeutig identifiziert werden kann. Ordnen Sie Ihre Regeln so an, dass Sie zuerst genauere Treffer finden.

Nehmen wir zum Beispiel an, Sie haben zwei Regeln, Regel 1 und Regel 2.

Diese Regeln haben die folgenden Vergleichsschlüssel:

  • Regel 1 beinhaltet den vollständigen Namen und die Adresse

  • Regel 2 beinhaltet den vollständigen Namen, die Adresse und die Telefonnummer

Da Regel 1 zuerst ausgeführt wird, werden nach Regel 2 keine Treffer gefunden, da nach Regel 1 alle Treffer gefunden worden wären.

Ordnen Sie die Regeln wie folgt neu an, um Übereinstimmungen zu finden, die nach Telefonnummer unterschieden werden:

  • Regel 2 beinhaltet den vollständigen Namen, die Adresse und die Telefonnummer

  • Regel 1 beinhaltet den vollständigen Namen und die Adresse

Transitiver Abgleich

Transitiver Abgleich ist eine optionale Funktion für regelbasierte Matching-Workflows, die den Regeltyp „Erweitert“ verwenden. AWS Entity Resolution Verwendet standardmäßig einen Wasserfallabgleich, bei dem Datensätze, die auf einer höheren Regelebene übereinstimmen, von nachfolgenden Regeln ausgeschlossen werden. Wenn der transitive Abgleich aktiviert ist, werden alle Datensätze auf allen Regelebenen verarbeitet. Die Übereinstimmungs-ID eines Datensatzes wird bei seinem ersten Treffer festgelegt, aber der Datensatz fungiert weiterhin als Link, um Datensätze, die nicht übereinstimmen, aus späteren Regeln mit Übereinstimmungsgruppen aus früheren Regeln zu verbinden.

Weitere Informationen finden Sie unter Verwendung von transitivem Matching.

Schema

Der Begriff, der für eine Struktur oder ein Layout verwendet wird, das definiert, wie ein Datensatz organisiert und verknüpft ist.

Beschreibung des Schemas

Eine optionale Beschreibung des Schemas, die Sie eingeben können. Beschreibungen helfen Ihnen dabei, zwischen Schemazuordnungen zu unterscheiden, wenn Sie mehrere erstellen.

Name des Schemas

Der Name des Schemas.

Anmerkung

Schemanamen müssen eindeutig sein. Sie dürfen nicht denselben Namen haben, da sonst ein Fehler zurückgegeben wird.

Schema-Zuordnung

Schema-Mapping AWS Entity Resolution ist der Prozess, bei dem Sie angeben, AWS Entity Resolution wie Ihre Daten für den Abgleich zu interpretieren sind. Sie definieren das Schema der Eingabedatentabelle, das Sie in einen passenden Workflow einlesen möchten AWS Entity Resolution .

ARN für Schemazuordnung

Der Amazon-Ressourcenname (ARN), der für die Schemazuordnung generiert wurde.

Eindeutige ID

Eine eindeutige Kennung, die Sie angeben und die jeder Zeile mit Eingabedaten zugewiesen werden muss, die AWS Entity Resolution gelesen wird.

Beispiel

Beispiel: Primary_key, Row_ID oder Record_ID.

Die Spalte Eindeutige ID ist erforderlich.

Die eindeutige ID muss ein eindeutiger Bezeichner innerhalb einer einzelnen Tabelle sein.

Die eindeutige ID muss diesem Muster entsprechen: [a-zA-Z0-9_-]

In verschiedenen Tabellen kann die eindeutige ID doppelte Werte enthalten.

Die maximale Länge der eindeutigen ID beträgt 38 für einen passenden Workflow

Die maximale Länge einer eindeutigen ID beträgt 257 Zeichen für eine Arbeitsablauf für die ID-Zuordnung

Wenn der Matching-Workflow ausgeführt wird, wird der Datensatz abgelehnt, wenn die eindeutige ID:

  • ist nicht angegeben

  • ist innerhalb derselben Tabelle nicht eindeutig

  • überschneidet sich in Bezug auf den Attributnamen zwischen den Quellen

  • überschreitet 38 Zeichen (nur regelbasierte Matching-Workflows)