View a markdown version of this page

Résolution des entités AWS Glossaire - Résolution des entités AWS

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Résolution des entités AWS Glossaire

Amazon Resource Name (ARN)

Identifiant unique pour les AWS ressources. Les ARN sont requis lorsque vous devez spécifier une ressource sans ambiguïté dans tous les domaines, par exemple dans les Résolution des entités AWS politiques Résolution des entités AWS, les balises Amazon Relational Database Service (Amazon RDS) et les appels d'API.

Type d'attribut

Type d'attribut pour le champ de saisie. Lorsque vous créez un mappage de schéma, vous sélectionnez le type d'attribut dans une liste préconfigurée de valeurs telles que le nom, l'adresse, le numéro de téléphone ou l'adresse e-mail. Le type d'attribut indique le Résolution des entités AWS type de données que vous lui présentez, ce qui permet de les classer et de les normaliser correctement.

Traitement automatique

Une option de cadence de traitement pour une tâche de flux de travail correspondante qui permet de l'exécuter automatiquement lorsque votre saisie de données change.

Cette option n'est disponible que pour la correspondance Rule-based correspondant basée sur des règles.

Par défaut, la cadence de traitement d'une tâche de flux de travail correspondante est définie sur Manuel , ce qui permet de l'exécuter à la demande. Vous pouvez configurer le traitement automatique pour exécuter automatiquement la tâche de flux de travail correspondante lorsque votre saisie de données change. Cela permet de maintenir à jour les résultats de votre flux de travail correspondant.

AWS KMS key ARN

Il s'agit de votre AWS KMS Amazon Resource Name (ARN) pour le chiffrement au repos. Si elle n'est pas fournie, le système utilisera une clé KMS Résolution des entités AWS gérée.

Workflow par lots

Processus qui s'exécute à intervalles réguliers pour faire correspondre et résoudre les données d'un ensemble de données complet. Les flux de travail par lots Résolution des entités AWS sont mieux utilisés pour la configuration initiale, les actualisations complètes périodiques et les scénarios comportant des modifications importantes dans les ensembles de données source et cible.

Texte clair

Données qui ne sont pas protégées par cryptographie.

Niveau de confiance (ConfidenceLevel)

Pour la correspondance ML, il s'agit du niveau de confiance appliqué Résolution des entités AWS lorsque ML identifie un ensemble d'enregistrements correspondant. Cela fait partie des métadonnées de flux de travail correspondantes qui seront incluses dans la sortie.

Niveau de confiance record (RecordConfidenceLevel)

Pour la correspondance incrémentielle ML, il s'agit du niveau de confiance par enregistrement appliqué Résolution des entités AWS lorsque ML identifie un ensemble d'enregistrements correspondant. Cela fait partie des métadonnées de flux de travail correspondantes qui seront incluses dans la sortie.

Déchiffrement

Processus de transformation des données chiffrées pour leur redonner leur forme d'origine. Le déchiffrement ne peut être effectué que si vous avez accès à la clé secrète.

Chiffrement

Processus de codage des données sous une forme qui semble aléatoire à l'aide d'une valeur secrète appelée clé. Il est impossible de déterminer le texte en clair d'origine sans accéder à la clé.

Nom du groupe

Le nom du groupe fait référence à l'ensemble des champs de saisie et peut vous aider à regrouper les données analysées à des fins de correspondance.

Par exemple, s'il existe trois champs de saisie : first_namemiddle_name, etlast_name, vous pouvez les regrouper en saisissant le nom du groupe comme full_name pour la correspondance et la sortie.

Hachage

Le hachage consiste à appliquer un algorithme cryptographique qui produit une chaîne de caractères irréversible et unique de taille fixe, appelée hachage. Résolution des entités AWS utilise le protocole de hachage Secure Hash Algorithm 256 bits (SHA256) et génère une chaîne de caractères de 32 octets. Dans Résolution des entités AWS, vous pouvez choisir de hacher ou non les valeurs de données dans votre sortie.

Protocole de hachage (HashingProtocol)

Résolution des entités AWS utilise le protocole de hachage Secure Hash Algorithm 256 bits (SHA256) et génère une chaîne de caractères de 32 octets. Cela fait partie des métadonnées de flux de travail correspondantes qui seront incluses dans la sortie.

Méthode de mappage des ID

Comment vous souhaitez que le mappage des identifiants soit effectué.

Il existe deux méthodes de mappage des identifiants :

  • Rule-based — Méthode par laquelle vous utilisez des règles de correspondance pour traduire les données propriétaires d'une source vers une cible dans un flux de travail de mappage d'ID.

  • Services du fournisseur : méthode par laquelle vous utilisez un service du fournisseur pour traduire des données codées par des tiers d'une source vers une cible dans un flux de travail de mappage d'identifiants.

    Résolution des entités AWS est actuellement prise en charge en LiveRamp tant que méthode de mappage d'ID basée sur les services du fournisseur. Vous devez être abonné à LiveRamp through AWS Data Exchange pour utiliser cette méthode. Pour de plus amples informations, veuillez consulter Étape 1 : Abonnez-vous au service d'un fournisseur sur AWS Data Exchange.

Workflow de mappage des identifiants

Tâche de traitement de données qui fait correspondre les données d'une source de données d'entrée à une cible de données d'entrée en fonction de la méthode de mappage d'ID spécifiée. Il produit une table de mappage des identifiants. Ce flux de travail vous oblige à spécifier la méthode de mappage des identifiants et les données d'entrée que vous souhaitez traduire d'une source vers une cible.

Vous pouvez configurer un flux de travail de mappage d'ID à exécuter vous-même Compte AWS ou sur deux Comptes AWS.

espace de noms ID

Ressource contenant des Résolution des entités AWS métadonnées expliquant les ensembles de données de plusieurs types Comptes AWS et expliquant comment les utiliser dans un flux de travail de mappage d'identifiants.

Il existe deux types d'espaces de noms d'identification : SOURCE etTARGET. SOURCEIl contient des configurations pour les données sources qui seront traitées dans un flux de travail de mappage d'ID. TARGETContient une configuration des données cibles vers laquelle toutes les sources seront résolues. Pour définir les données d'entrée que vous souhaitez résoudre sur deux Comptes AWS, créez une source d'espace de noms ID et une cible d'espace de noms ID pour traduire vos données d'un ensemble (SOURCE) vers un autre (). TARGET

Une fois que vous et un autre membre avez créé des espaces de noms d'ID et exécuté un flux de travail de mappage d'ID, vous pouvez rejoindre une collaboration AWS Clean Rooms pour exécuter une jointure multi-tables sur la table de mappage des ID et analyser les données.

Pour plus d’informations, consultez le Guide de l’utilisateur AWS Clean Rooms.

Flux de travail incrémentiel

Processus qui met uniquement en correspondance et résout les enregistrements nouveaux ou mis à jour depuis la dernière exécution, au lieu de traiter l'ensemble de données dans son intégralité. Les flux de travail incrémentiels Résolution des entités AWS intégrés sont mieux utilisés pour les mises à jour fréquentes afin de maintenir l'actualité des données lorsque seule une petite partie de l'ensemble de données a été modifiée.

Champ de saisie

Un champ de saisie correspond au nom d'une colonne de votre table de données AWS Glue d'entrée.

ARN de la source d'entrée (InputSourceARN)

L'Amazon Resource Name (ARN) qui a été généré pour une entrée de AWS Glue table. Cela fait partie des métadonnées de flux de travail correspondantes qui seront incluses dans la sortie.

Correspondance par machine learning

La correspondance basée sur l'apprentissage automatique (correspondance ML) permet de trouver des correspondances entre vos données qui peuvent être incomplètes ou ne pas se ressembler exactement. La correspondance ML est un processus prédéfini qui tente de faire correspondre les enregistrements de toutes les données que vous saisissez. La correspondance ML renvoie un identifiant de correspondance et un niveau de confiance pour chaque ensemble de données correspondant.

Traitement manuel

Option de cadence de traitement pour une tâche de flux de travail correspondante qui permet de l'exécuter à la demande.

Cette option est définie par défaut et est disponible à la fois pour la correspondance basée sur des règles et la correspondance basée sur l'apprentissage automatique.

Many-to-Many correspondant

Many-to-many la correspondance permet de comparer plusieurs instances de données similaires. Les valeurs des champs de saisie auxquels la même clé de correspondance a été attribuée seront comparées les unes aux autres, qu'elles se trouvent dans le même champ de saisie ou dans des champs de saisie différents.

Par exemple, vous pouvez avoir plusieurs champs de saisie de numéro de téléphone, tels mobile_phone home_phone que « Téléphone », qui ont la même touche de correspondance. Utilisez la correspondance plusieurs-à-plusieurs pour comparer les données du champ de mobile_phone saisie avec les données du champ de mobile_phone saisie et les données du champ de home_phone saisie.

Les règles de correspondance évaluent les données de plusieurs champs de saisie avec la même clé de correspondance avec une opération (ou), et la correspondance un-à-plusieurs compare les valeurs de plusieurs champs de saisie. Cela signifie que si deux enregistrements sont combinés mobile_phone ou home_phone correspondent, la touche de correspondance « Téléphone » renverra une correspondance. Appuyez sur la touche « Téléphone » pour trouver une correspondance, Record One mobile_phone = Record Two mobile_phone OU Record One mobile_phone = Record Two home_phone OU Record One home_phone = Record Two home_phone OURecord One home_phone = Record Two mobile_phone.

Identifiant du match (MatchID)

Pour la correspondance basée sur des règles et la correspondance ML, il s'agit de l'identifiant généré Résolution des entités AWS et appliqué à chaque ensemble d'enregistrements correspondant. Cela fait partie des métadonnées de flux de travail correspondantes qui seront incluses dans la sortie.

Clé de correspondance (MatchKey)

La touche Match indique Résolution des entités AWS quels champs de saisie doivent être considérés comme des données similaires et lesquels doivent être considérés comme des données différentes. Cela permet de configurer Résolution des entités AWS automatiquement des règles de correspondance basées sur des règles et de comparer des données similaires stockées dans différents champs de saisie.

S'il existe plusieurs types d'informations relatives à un mobile_phone numéro de téléphone, comme un champ de home_phone saisie et un champ de saisie dans vos données, que vous souhaitez comparer, vous pouvez leur attribuer la touche correspondante « Téléphone ». Ensuite, la correspondance basée sur des règles peut être configurée pour comparer les données à l'aide d'instructions « ou » dans tous les champs de saisie avec la touche de correspondance « Téléphone » (voir One-to-One Correspondance et définitions Many-to-Many correspondantes dans la section Matching Workflow).

Si vous souhaitez que la correspondance basée sur des règles prenne en compte les différents types d'informations relatives aux numéros de téléphone de manière complètement séparée, vous pouvez créer des clés de correspondance plus spécifiques telles que « Mobile_Phone » et « Home_Phone ». Ensuite, lors de la configuration d'un flux de travail correspondant, vous pouvez spécifier comment chaque touche de correspondance téléphonique sera utilisée dans le cadre de la correspondance basée sur des règles.

Si aucun n' MatchKey est spécifié pour un champ de saisie particulier, il ne peut pas être utilisé pour la correspondance mais peut être effectué via le processus de correspondance et peut être généré si vous le souhaitez.

Nom de clé de correspondance

Le nom attribué à une touche Match.

Règle de match (MatchRule)

Pour la correspondance basée sur des règles, il s'agit du numéro de règle appliqué qui a généré un ensemble d'enregistrements correspondant. Cela fait partie des métadonnées de flux de travail correspondantes qui seront incluses dans la sortie.

Correspondance

Processus qui consiste à combiner et à comparer des données provenant de différents champs de saisie, tables ou bases de données et à déterminer laquelle d'entre elles est similaire (ou « correspond ») en fonction de la satisfaction de certains critères de correspondance (par exemple, au moyen de règles ou de modèles de correspondance).

Flux de travail correspondant

Processus que vous configurez pour spécifier les données d'entrée à associer et la manière dont la correspondance doit être effectuée.

Description du flux de travail correspondant

Description facultative du flux de travail correspondant que vous pouvez choisir de saisir. Les descriptions vous aident à différencier les flux de travail correspondants si vous en créez plusieurs.

Nom du flux de travail correspondant

Le nom du flux de travail correspondant que vous spécifiez.

Note

Les noms de flux de travail correspondants doivent être uniques. Ils ne peuvent pas avoir le même nom, sinon une erreur sera renvoyée.

Métadonnées de flux de travail correspondantes

Informations générées et sorties Résolution des entités AWS lors d'une tâche de flux de travail correspondante. Ces informations sont requises en sortie.

Normalisation (ApplyNormalization)

Choisissez si vous souhaitez normaliser les données d'entrée comme défini dans le schéma. La normalisation normalise les données en supprimant les espaces et les caractères spéciaux supplémentaires et en les normalisant au format minuscule.

Par exemple, si un champ de saisie possède un type d'attribut Téléphone Téléphone complet et que les valeurs de la table de saisie sont formatées comme suit(123) 456-7890, les valeurs Résolution des entités AWS seront normalisées à1234567890.

Note

La normalisation n'est prise en charge que pour le type de groupe pour le nom , l'adresse, le téléphone et l'e-mail.

Les sections suivantes décrivent nos règles de normalisation standard.

Pour une ML-based correspondance spécifique, voirNormalisation (ApplyNormalization) — ML-based uniquement.

Nom

Note

La normalisation n'est prise en charge que pour le type de groupe de noms.

Le type de groupe de noms apparaît sous la forme Nom complet dans la console et NAME dans l'API.

Si vous souhaitez normaliser les sous-types du type de groupe Name :

  • Dans la console, attribuez les sous-types suivants au groupe Nom complet : prénom, deuxième prénom et nom de famille.

  • Dans l'CreateSchemaMappingAPI, attribuez les types suivants au NAME nom du groupe  : NAME_FIRSTNAME_MIDDLE, etNAME_LAST.

  • TRIM = Coupe les espaces blancs de début et de fin

  • LOWERCASE = Tous les caractères alphabétiques sont en minuscules

  • CONVERT_ACCENT = Lettre accentuée secrète en lettre normale

  • REMOVE_ALL_NON_ALPHA = Supprime tous les caractères non alphabétiques [a-z] A-Z

E-mail

Note

La normalisation est prise en charge pour le type de groupe de courrier électronique.

Le type de groupe d'e-mails apparaît en tant qu'adresse e-mail dans la console et EMAIL_ADDRESS dans l'API.

  • TRIM = Coupe les espaces blancs de début et de fin

  • LOWERCASE = Tous les caractères alphabétiques sont en minuscules

  • CONVERT_ACCENT = Lettre accentuée secrète en lettre normale

  • EMAIL_ADDRESS_UTIL_NORM = Supprime tous les points (.) du nom d'utilisateur, supprime tout ce qui se trouve après un signe plus (+) dans le nom d'utilisateur et normalise les variantes de domaine courantes

  • REMOVE_ALL_NON_EMAIL_CHARS = Supprime tous les caractères non alphanumériques [a-z] et [.@-] A-Z0-9

Téléphone

Note

La normalisation n'est prise en charge que pour le type de groupe téléphonique.

Le type de groupe Téléphone apparaît comme Téléphone complet dans la console et PHONE dans l'API.

Si vous souhaitez normaliser les sous-types du type de groupe téléphonique :

  • Dans la console, attribuez les sous-types suivants au groupe téléphonique complet : numéro de téléphone et code de pays du téléphone.

  • Dans l'CreateSchemaMappingAPI, attribuez les types suivants au PHONE nom du groupe  : PHONE_NUMBER etPHONE_COUNTRYCODE.

  • TRIM = Coupe les espaces blancs de début et de fin

  • REMOVE_ALL_NON_NUMERIC = Supprime tous les caractères non numériques [0-9]

  • REMOVE_ALL_LEADING_ZEROES = Supprime tous les zéros de début

  • ENSURE_PREFIX_WITH_MAP, « phonePrefixMap" = Examine chaque numéro de téléphone et essaie de le comparer aux modèles du téléphone. PrefixMap Si une correspondance est trouvée, la règle ajoutera ou modifiera le préfixe du numéro de téléphone pour s'assurer qu'il est conforme au format normalisé spécifié sur la carte.

Adresse

Note

La normalisation n'est prise en charge que pour le type de groupe d'adresses.

Le type de groupe d'adresses apparaît sous la forme Adresse complète dans la console et ADDRESS dans l'API.

Si vous souhaitez normaliser les sous-types du type de groupe d'adresses :

  • Dans la console, attribuez les sous-types suivants au groupe d'adresses complet : Adresse postale 1, Adresse postale 2  : nom de l'adresse 3, nom de la ville, État , pays et code postal t

  • Dans l'CreateSchemaMappingAPI, attribuez les types suivants au ADDRESS nom du groupe  : ADDRESS_STREET1ADDRESS_STREET2,ADDRESS_STREET3,ADDRESS_CITY, ADDRESS_STATEADDRESS_COUNTRY, etADDRESS_POSTALCODE.

  • TRIM = Coupe les espaces blancs de début et de fin

  • LOWERCASE = Tous les caractères alphabétiques sont en minuscules

  • CONVERT_ACCENT = Lettre accentuée secrète en lettre normale

  • REMOVE_ALL_NON_ALPHA = Supprime tous les caractères non alphabétiques [a-z] A-Z

  • RENAME_WORDS en utilisant ADDRESS_RENAME_WORD_MAP = remplacez les mots de la chaîne d'adresses par des mots de ADDRESS_RENAME_WORD_MAP ADRESSE_RENOMME_WORD_MAP

  • RENAME_DELIMITERS à l'aide de ADDRESS_RENAME_DELIMITER_MAP = remplacez les délimiteurs de la chaîne d'adresses par la chaîne ADDRESS_RENAME_DELIMITER_MAP ADRESSE_RENAME_DELIMITER_MAP

  • RENAME_DIRECTIONS en utilisant ADDRESS_RENAME_DIRECTION_MAP = remplacez les délimiteurs de la chaîne d'adresses par la chaîne ADDRESS_RENAME_DIRECTION_MAP ADRESSE_RENOMME_DIRECTION_MAP

  • RENAME_NUMBERS en utilisant ADDRESS_RENAME_NUMBER_MAP = remplacez les numéros de la chaîne d'adresses par la chaîne ADDRESS_RENAME_NUMBER_MAP

  • RENAME_SPECIAL_CHARS à l'aide de ADDRESS_RENAME_SPECIAL_CHAR_MAP = remplacez les caractères spéciaux de la chaîne d'adresse par la chaîne de ADDRESS_RENAME_SPECIAL_CHAR_MAP

ADRESSE_RENOMME_WORD_MAP

Ce sont les mots qui seront renommés lors de la normalisation de la chaîne d'adresse.

"avenue": "ave", "bouled": "blvd", "circle": "cir", "circles": "cirs", "court": "ct", "centre": "ctr", "center": "ctr", "drive": "dr", "freeway": "fwy", "frwy": "fwy", "highway": "hwy", "lane": "ln", "parks": "park", "parkways": "pkwy", "pky": "pkwy", "pkway": "pkwy", "pkwys": "pkwy", "parkway": "pkwy", "parkwy": "pkwy", "place": "pl", "plaza": "plz", "plza": "plz", "road": "rd", "square": "sq", "squ": "sq", "sqr": "sq", "street": "st", "str": "st", "str.": "strasse"

ADRESSE_RENAME_DELIMITER_MAP

Ce sont les délimiteurs qui seront renommés lors de la normalisation de la chaîne d'adresse.

",": " ", ".": " ", "[": " ", "]": " ", "/": " ", "-": " ", "#": " number "

ADRESSE_RENOMME_DIRECTION_MAP

Il s'agit des identificateurs de direction qui seront renommés lors de la normalisation de la chaîne d'adresse.

"east": "e", "north": "n", "south": "s", "west": "w", "northeast": "ne", "northwest": "nw", "southeast": "se", "southwest": "sw"

ADRESSE_RENAME_NUMBER_MAP

Il s'agit des chaînes numériques qui seront renommées lors de la normalisation de la chaîne d'adresse.

"número": "number", "numero": "number", "no": "number", "núm": "number", "num": "number"

ADRESSE_RENAME_SPECIAL_CHAR_MAP

Il s'agit de la chaîne de caractères spéciaux qui sera renommée lors de la normalisation de la chaîne d'adresse.

"ß": "ss", "ä": "ae", "ö": "oe", "ü": "ue", "ø": "o", "æ": "ae"

Haché

  • TRIM = Coupe les espaces blancs de début et de fin

Source_ID

  • TRIM = Coupe les espaces blancs de début et de fin

Normalisation (ApplyNormalization) — ML-based uniquement

Choisissez si vous souhaitez normaliser les données d'entrée comme défini dans le schéma. La normalisation normalise les données en supprimant les espaces et les caractères spéciaux supplémentaires et en les normalisant au format minuscule.

Par exemple, si un champ de saisie possède un type d'attribut de NAME et que les valeurs de la table en entrée sont mises en formeJohns Smith, les valeurs Résolution des entités AWS seront normalisées àjohn smith.

Les sections suivantes décrivent les règles de normalisation pour les flux de travail de correspondance basés sur l'apprentissage automatique.

Nom

  • TRIM = Coupe les espaces blancs de début et de fin

  • LOWERCASE = Tous les caractères alphabétiques sont en minuscules

E-mail

  • LOWERCASE = Tous les caractères alphabétiques sont en minuscules

  • Remplace uniquement (at) (distinction majuscules/minuscules) par un symbole @

  • Supprime tous les espaces, n'importe où dans la valeur

  • Supprime tout ce qui est en dehors du premier "< >" s'il existe

Téléphone

  • TRIM = Coupe les espaces blancs de début et de fin

  • REMOVE_ALL_NON_NUMERIC = Supprime tous les caractères non numériques [0-9]

  • REMOVE_ALL_LEADING_ZEROES = Supprime tous les zéros de début

  • ENSURE_PREFIX_WITH_MAP, « phonePrefixMap" = Examine chaque numéro de téléphone et essaie de le comparer aux modèles du téléphone. PrefixMap Si une correspondance est trouvée, la règle ajoutera ou modifiera le préfixe du numéro de téléphone pour s'assurer qu'il est conforme au format normalisé spécifié sur la carte.

One-to-One correspondant

One-to-one la correspondance permet de comparer des instances uniques de données similaires. Les champs de saisie avec la même clé de correspondance et les mêmes valeurs dans le même champ de saisie seront comparés les uns aux autres.

Par exemple, vous pouvez avoir plusieurs champs de saisie de numéro de téléphone, tels mobile_phone home_phone que « Téléphone », qui ont la même touche de correspondance. Utilisez la correspondance biunivoque pour comparer les données du champ de mobile_phone saisie avec les données du champ de mobile_phone saisie et pour comparer les données du champ de home_phone saisie avec les données du champ de home_phone saisie. Les données du champ de mobile_phone saisie ne seront pas comparées aux données du champ de home_phone saisie.

Les règles de correspondance évaluent les données de plusieurs champs de saisie avec la même clé de correspondance avec une opération (ou), et la correspondance un-à-plusieurs compare les valeurs d'un seul champ de saisie. Cela signifie que si deux enregistrements home_phone correspondent mobile_phone ou correspondent, la touche de correspondance « Téléphone » renverra une correspondance. Pour trouver une correspondance, appuyez sur la touche « Téléphone » Record One mobile_phone = Record Two mobile_phone ouRecord One home_phone = Record Two home_phone.

Les règles de correspondance évaluent les données des champs de saisie avec différentes clés de correspondance à l'aide d'une opération (et). Si vous souhaitez que la correspondance basée sur des règles prenne en compte les différents types d'informations relatives aux numéros de téléphone de manière complètement séparée, vous pouvez créer des clés de correspondance plus spécifiques telles que « mobile_phone » et « home_phone ». Si vous souhaitez utiliser les deux touches de correspondance dans une règle pour rechercher des correspondances, Record One mobile_phone = Record Two mobile_phone ETRecord One home_phone = Record Two home_phone.

Output

Une liste d'OutputAttributeobjets, dont chacun possède les champs Nom et Hashed. Chacun de ces objets représente une colonne à inclure dans la table de AWS Glue sortie et indique si vous souhaitez que les valeurs de la colonne soient hachées.

Sorties 3 voies

Destination S3 vers laquelle Résolution des entités AWS sera écrite la table de sortie.

OutputSourceConfig

Liste d' OutputSource objets, dont chacun possède les champs Outputs3Path, ApplyNormalization et Output.

Correspondance basée sur les services des fournisseurs

L'appariement basé sur les services des fournisseurs est un processus conçu pour faire correspondre, relier et améliorer vos enregistrements avec les fournisseurs de services de données préférés et les ensembles de données sous licence. Vous devez disposer d'un abonnement AWS Data Exchange auprès du service du fournisseur pour utiliser cette technique de correspondance.

Résolution des entités AWS s'intègre actuellement aux fournisseurs de services de données suivants :

  • LiveRamp

  • TransUnion

  • UID 2.0

Rule-based correspondant

Rule-based l'appariement est un processus conçu pour trouver des correspondances exactes. Rule-based la correspondance est un ensemble hiérarchique de règles de correspondance en cascade, suggérées par Résolution des entités AWS, en fonction des données que vous saisissez et entièrement configurables par vos soins. Toutes les clés de correspondance fournies dans les critères de règle doivent correspondre exactement pour que les données comparées soient déclarées concordantes et pour que les métadonnées associées soient sorties. Rule-based matching renvoie un identifiant de correspondance et un numéro de règle pour chaque ensemble de données correspondant.

Nous vous recommandons de définir des règles permettant d'identifier une entité de manière unique. Organisez vos règles pour trouver d'abord des matchs plus précis.

Par exemple, supposons que vous ayez deux règles, la Règle 1 et la Règle 2.

Ces règles comportent les clés de match suivantes :

  • La règle 1 inclut le nom complet et l'adresse

  • La règle 2 inclut le nom complet, l'adresse et le téléphone

Comme la Règle 1 s'applique en premier, aucune correspondance ne sera trouvée selon la Règle 2 car elles auraient toutes été trouvées selon la Règle 1.

Pour trouver des matchs différenciés par téléphone, réorganisez les règles comme suit :

  • La règle 2 inclut le nom complet, l'adresse et le téléphone

  • La règle 1 inclut le nom complet et l'adresse

Correspondance transitive

La correspondance transitive est une fonctionnalité facultative pour les flux de travail de correspondance basés sur des règles qui utilisent le type de règle avancé. Par défaut, Résolution des entités AWS utilise une approche de correspondance en cascade dans laquelle les enregistrements correspondant à un niveau de règle supérieur sont exclus des règles suivantes. Lorsque la correspondance transitive est activée, tous les enregistrements sont traités à tous les niveaux de règles. L'identifiant de correspondance d'un enregistrement est fixé lors de sa première correspondance, mais l'enregistrement continue de servir de lien pour connecter les enregistrements non correspondants des règles ultérieures aux groupes correspondants des règles précédentes.

Pour de plus amples informations, veuillez consulter Utilisation de la correspondance transitive.

Schema

Terme utilisé pour désigner une structure ou une mise en page définissant la manière dont un ensemble de données est organisé et connecté.

Description du schéma

Description facultative du schéma que vous pouvez choisir de saisir. Les descriptions vous aident à différencier les mappages de schémas si vous en créez plusieurs.

Nom du schéma

Nom du schéma.

Note

Les noms de schéma doivent être uniques. Ils ne peuvent pas avoir le même nom, sinon une erreur sera renvoyée.

Mappage de schémas

Le mappage de schémas Résolution des entités AWS est le processus par lequel vous indiquez Résolution des entités AWS comment interpréter vos données pour les faire correspondre. Vous définissez le schéma de la table de données en entrée que vous Résolution des entités AWS souhaitez lire dans un flux de travail correspondant.

ARN de mappage de schémas

L'Amazon Resource Name (ARN) généré pour le mappage du schéma.

Identifiant unique

Identifiant unique que vous désignez et qui doit être attribué à chaque ligne de données d'entrée Résolution des entités AWS lue.

Exemple

Par exemple : Primary_key, Row_ID ou Record_ID.

La colonne ID unique est obligatoire.

L'identifiant unique doit être un identifiant unique au sein d'une seule table.

L'identifiant unique doit respecter le schéma suivant : [a-zA-Z0-9_-]

Dans les différentes tables, l'identifiant unique peut avoir des valeurs dupliquées.

La longueur maximale de l'identifiant unique est de 38 pour un flux de travail correspondant

La longueur maximale de l'identifiant unique est de 257 caractères pour un Workflow de mappage des identifiants

Lorsque le flux de travail correspondant est exécuté, l'enregistrement est rejeté si l'identifiant unique  :

  • n'est pas spécifié

  • n'est pas unique au sein d'une même table

  • chevauchements en termes de nom d'attribut entre les sources

  • dépasse 38 caractères (flux de travail correspondants basés sur des règles uniquement)