Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Création d'un flux de travail de correspondance basé sur l'apprentissage automatique
La correspondance basée sur l'apprentissage automatique est un processus prédéfini qui tente de faire correspondre les enregistrements de toutes les données que vous saisissez. Le flux de travail de correspondance basé sur l'apprentissage automatique vous permet de comparer des données en texte clair pour trouver un large éventail de correspondances à l'aide d'un modèle d'apprentissage automatique.
Note
Le modèle d'apprentissage automatique ne permet pas la comparaison de données hachées.
Lorsqu'il Résolution des entités AWS trouve une correspondance entre deux enregistrements ou plus dans vos données, il attribue :
-
Un identifiant de correspondance avec les enregistrements de l'ensemble de données correspondant
-
Le pourcentage du niveau de confiance des matchs.
Vous pouvez utiliser la sortie d'un flux de travail ML-based correspondant comme entrée pour la mise en correspondance des fournisseurs de services de données, ou vice-versa pour atteindre vos objectifs spécifiques. Par exemple, vous pouvez exécuter une ML-based correspondance pour rechercher des correspondances entre vos sources de données en premier lieu sur vos propres enregistrements. Si aucun sous-ensemble n'a été mis en correspondance, vous pouvez alors exécuter une correspondance basée sur le service du fournisseur pour trouver des correspondances supplémentaires.
Conditions préalables
Avant de créer un flux de travail ML-based correspondant, vous devez :
-
Créez un mappage de schéma. Pour de plus amples informations, veuillez consulter Création d'un mappage de schéma.
-
Si vous utilisez Connect Customer Customer Profiles comme destination de sortie, assurez-vous que les autorisations appropriées sont configurées.
Pour créer un flux de travail ML-based correspondant :
-
Connectez-vous à Console de gestion AWS et ouvrez la Résolution des entités AWS console à l'adresse https://console.aws.amazon.com/entityresolution/
. -
Dans le volet de navigation de gauche, sous Workflows, choisissez Matching.
-
Sur la page Flux de travail correspondants, dans le coin supérieur droit, choisissez Créer un flux de travail correspondant.
-
Pour l'étape 1 : Spécifiez les détails du flux de travail correspondants, procédez comme suit :
-
Entrez un nom de flux de travail correspondant et une description facultative.
-
Pour la saisie de données, choisissez une Région AWS AWS Glue base de données, la AWS Glue table, puis le mappage de schéma correspondant.
Vous pouvez ajouter jusqu'à 20 entrées de données.
-
L'option Normaliser les données est sélectionnée par défaut, de sorte que les entrées de données soient normalisées avant d'être mises en correspondance. Si vous ne souhaitez pas normaliser les données, désélectionnez l'option Normaliser les données.
La correspondance basée sur l'apprentissage automatique ne fait que normaliserNom, Téléphone et. E-mail
-
Pour spécifier les autorisations d'accès au service, choisissez une option et effectuez l'action recommandée.
Option Action recommandée Création et utilisation d'un nouveau rôle de service -
Résolution des entités AWS crée un rôle de service avec la politique requise pour cette table.
-
Le nom du rôle de service par défaut est
entityresolution-matching-workflow-<timestamp>. -
Vous devez disposer des autorisations nécessaires pour créer des rôles et associer des politiques.
-
Si vos données d'entrée sont cryptées, choisissez l'option Ces données sont cryptées par une clé KMS. Entrez ensuite la AWS KMS clé utilisée pour déchiffrer les données saisies.
Utiliser un rôle de service existant -
Choisissez un nom de rôle de service existant dans la liste déroulante.
La liste des rôles s'affiche si vous êtes autorisé à répertorier les rôles.
Si vous n'êtes pas autorisé à répertorier les rôles, vous pouvez saisir l'Amazon Resource Name (ARN) du rôle que vous souhaitez utiliser.
S'il n'existe aucun rôle de service, l'option Utiliser un rôle de service existant n'est pas disponible.
-
Consultez le rôle de service en choisissant le lien externe Afficher dans IAM.
Par défaut, Résolution des entités AWS n'essaie pas de mettre à jour la politique de rôle existante pour ajouter les autorisations nécessaires.
-
-
(Facultatif) Pour activer les balises pour la ressource, choisissez Ajouter une nouvelle étiquette, puis entrez la paire clé/valeur.
-
Choisissez Suivant.
-
-
Pour l'étape 2 : Choisissez la technique de correspondance :
-
Pour la méthode de correspondance, choisissez la correspondance basée sur l'apprentissage automatique.
-
Pour Cadence de traitement, sélectionnez l'une des options suivantes.
-
Choisissez Manuel pour exécuter un flux de travail de correspondance par lots, qui traite l'intégralité des données de votre compartiment S3.
-
Choisissez Automatique pour exécuter un flux de travail de correspondance incrémentielle, qui traite uniquement les données incrémentielles de votre compartiment S3.
-
-
Choisissez Suivant.
-
-
Pour l'étape 3 : Spécifiez la sortie et le format des données :
-
Dans Destination et format de sortie des données, choisissez l'emplacement Amazon S3 pour la sortie des données et indiquez si le format des données sera des données normalisées ou des données d'origine.
-
Pour le chiffrement, si vous choisissez de personnaliser les paramètres de chiffrement, entrez la AWS KMS clé ARN.
-
Afficher la sortie générée par le système.
-
Pour la sortie des données, choisissez les champs que vous souhaitez inclure, masquer ou masquer, puis prenez les mesures recommandées en fonction de vos objectifs.
Votre objectif Option recommandée Inclure des champs Conservez l'état de sortie comme inclus. Masquer les champs (exclure de la sortie) Choisissez le champ de sortie, puis choisissez Masquer. Champs de masque Choisissez le champ Sortie, puis choisissez Hash output. Réinitialiser les paramètres précédents Choisissez Réinitialiser. -
Choisissez Suivant.
-
-
Pour l'étape 4 : Vérifiez et créez :
-
Passez en revue les sélections que vous avez effectuées pour les étapes précédentes et modifiez-les si nécessaire.
-
Choisissez Créer et exécuter.
Un message s'affiche, indiquant que le flux de travail correspondant a été créé et que la tâche a démarré.
-
-
Sur la page des détails du flux de travail correspondant, dans l'onglet Mesures, affichez les informations suivantes sous Mesures de la dernière tâche :
-
L'identifiant du poste.
-
État de la tâche de flux de travail correspondante : en file d'attente, en cours, terminée , échouée
-
Temps écoulé pour la tâche de flux de travail.
-
Le nombre d'enregistrements traités.
-
Le nombre d'enregistrements non traités.
-
Les identifiants de correspondance uniques générés.
-
Le nombre d'enregistrements d'entrée.
Vous pouvez également consulter les statistiques des tâches correspondant aux tâches de flux de travail qui ont déjà été exécutées dans l'historique des tâches.
-
-
Une fois la tâche de flux de travail correspondante terminée (le statut est terminé), vous pouvez accéder à l'onglet Sortie des données, puis sélectionner votre emplacement Amazon S3 pour afficher les résultats.
-
(Type de traitement manuel uniquement) Si vous avez créé un flux de travail correspondant basé sur l'apprentissage automatique avec le type de traitement manuel, vous pouvez exécuter le flux de travail correspondant à tout moment en choisissant Exécuter le flux de travail sur la page des détails du flux de travail correspondant.