View a markdown version of this page

Abbina i dati di input utilizzando un flusso di lavoro per il matching - AWS Entity Resolution

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

Abbina i dati di input utilizzando un flusso di lavoro per il matching

Un flusso di lavoro corrispondente è un processo di elaborazione dati che combina e confronta i dati provenienti da diverse fonti di input e determina quali record corrispondono in base a diverse tecniche di corrispondenza. AWS Entity Resolution legge i dati dalle posizioni specificate, trova le corrispondenze tra i record e assegna un Match ID a ciascun set di dati corrispondente.

Il diagramma seguente riassume come creare un flusso di lavoro corrispondente.

A summary of the four steps to create a matching workflow in AWS Entity Resolution

Tipi di flusso di lavoro corrispondenti

AWS Entity Resolution supporta tre tipi di flussi di lavoro corrispondenti:

Rule-based abbinamento

Utilizza regole configurabili per identificare i record corrispondenti in base alla corrispondenza esatta o sfocata dei campi specificati. È possibile definire i criteri di corrispondenza, ad esempio i nomi corrispondenti scritti in modo simile o gli indirizzi con un formato diverso.

Abbinamento basato sul machine learning

Utilizza modelli di apprendimento automatico per identificare record simili, anche quando i dati presentano variazioni, errori o campi mancanti. Questo approccio è in grado di rilevare corrispondenze più complesse rispetto a quelle basate su regole.

Abbinamento basato sui servizi del fornitore

Utilizza fornitori di dati di terze parti per arricchire e convalidare i dati prima della corrispondenza. Questo tipo di abbinamento non è compatibile con l'output di Connect Customer Customer Profiles.

Opzioni di output dei dati

AWS Entity Resolution può scrivere file di output di dati su:

  • Una posizione Amazon S3 specificata da te

  • Connect Customer Customer Profiles (per la deduplicazione dei dati dei clienti)

Importante

L'esportazione in Connect Customer Customer Profiles non è compatibile con la corrispondenza basata sul provider. Per esportare in Connect Customer Customer Profiles, è necessario utilizzare la corrispondenza basata su regole o la corrispondenza basata sull'apprendimento automatico.

Se lo desideri, puoi AWS Entity Resolution utilizzare l'hashing dei dati di output, aiutandoti a mantenere il controllo sui tuoi dati.

La tabella seguente mostra i tre tipi di flussi di lavoro corrispondenti e le relative destinazioni di output supportate.

Tipo di corrispondenza output S3 Output dei profili dei clienti
basato su regole
basato sull'apprendimento automatico
basato sul servizio del fornitore No

Risultati del flusso di lavoro corrispondenti

Dopo aver creato ed eseguito un flusso di lavoro corrispondente, è possibile visualizzare i risultati nella sede S3 specificata o in Connect Customer Profiles. I flussi di lavoro corrispondenti generano ID dopo l'indicizzazione dei dati.

Un flusso di lavoro corrispondente può avere più esecuzioni e i risultati (successi o errori) vengono scritti in una cartella con come nome. jobId

Per ogni esecuzione per le destinazioni di output S3:

  • L'output dei dati contiene sia un file per le corrispondenze riuscite sia un file per gli errori

  • I risultati positivi vengono scritti in una success cartella contenente più file

  • Gli errori vengono scritti in una error cartella con più campi

Per ogni esecuzione delle destinazioni di output di Connect Customer Profiles:

  • I record dei clienti deduplicati vengono inviati direttamente all'istanza Connect Customer

  • Puoi visualizzare la cronologia dei lavori recenti nella console AWS Entity Resolution

  • I profili esistenti in Connect Customer non sono inclusi nel processo di deduplicazione

Dopo aver creato ed eseguito un flusso di lavoro corrispondente, è possibile utilizzare l'output della corrispondenza basata su regole o del machine learning (ML) come input per la corrispondenza basata sui servizi del fornitore o viceversa per soddisfare le esigenze aziendali.

Ad esempio, per risparmiare sui costi di abbonamento del provider, puoi prima eseguire la corrispondenza basata su regole per trovare corrispondenze nei tuoi dati. Quindi, puoi inviare un sottoinsieme di record non corrispondenti alla corrispondenza basata sui servizi del provider. Tieni presente che se intendi esportare in Profili cliente, devi utilizzare solo la corrispondenza basata su regole o sull'apprendimento automatico.

Per ulteriori informazioni sulla risoluzione degli errori, consulta. Risoluzione dei problemi relativi ai flussi di lavoro corrispondenti