As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.
Combinar dados de entrada usando um fluxo de trabalho de correspondência
Um fluxo de trabalho de correspondência é um trabalho de processamento de dados que combina e compara dados de diferentes fontes de entrada e determina quais registros correspondem com base em diferentes técnicas de correspondência. AWS Entity Resolution lê seus dados de seus locais especificados, encontra correspondências entre registros e atribui um ID de correspondência a cada conjunto de dados correspondente.
O diagrama a seguir resume como criar um fluxo de trabalho correspondente.
Tópicos
Criação de um fluxo de trabalho de correspondência baseado em regras
Criação de um fluxo de trabalho de correspondência baseado em aprendizado de máquina
Criação de um fluxo de trabalho de correspondência baseado em serviços de provedores
Procurando um ID de correspondência para um fluxo de trabalho de correspondência baseado em regras
Excluindo registros de um fluxo de trabalho baseado em regras ou correspondente ML-based
Tipos de fluxo de trabalho correspondentes
AWS Entity Resolution oferece suporte a três tipos de fluxos de trabalho correspondentes:
- Rule-based combinando
-
Usa regras configuráveis para identificar registros correspondentes com base na correspondência exata ou difusa de campos especificados. Você define os critérios de correspondência, como nomes correspondentes que são escritos de forma semelhante ou endereços com formatação diferente.
- Correspondência baseada em machine learning
-
Usa modelos de aprendizado de máquina para identificar registros semelhantes, mesmo quando os dados têm variações, erros ou campos ausentes. Essa abordagem pode detectar correspondências mais complexas do que a correspondência baseada em regras.
- Correspondência baseada em serviços do provedor
-
Usa provedores de dados terceirizados para enriquecer e validar seus dados antes da correspondência. Esse tipo de correspondência não é compatível com a saída Connect Customer Customer Profiles.
Opções de saída de dados
AWS Entity Resolution pode gravar arquivos de saída de dados em:
-
Um local do Amazon S3 que você especificar
-
Conecte perfis de clientes (para desduplicação de dados do cliente)
Importante
A exportação de perfis de clientes do Connect Customer não é compatível com a correspondência baseada no provedor. Para exportar para os perfis de clientes do Connect Customer, você deve usar a correspondência baseada em regras ou a correspondência baseada em aprendizado de máquina.
Você pode AWS Entity Resolution usar o hash de saída de dados, se desejar, ajudando você a manter o controle sobre seus dados.
A tabela a seguir mostra os três tipos de fluxos de trabalho correspondentes e seus destinos de saída compatíveis.
| Tipo de correspondência | saída do S3 | Saída de perfis de clientes |
|---|---|---|
| baseado em regras | ||
| baseado em aprendizado de máquina | ||
| baseado em serviços do provedor |
Resultados do fluxo de trabalho correspondentes
Depois de criar e executar um fluxo de trabalho correspondente, você pode visualizar os resultados no local especificado no S3 ou nos perfis de clientes do Connect Customer. Os fluxos de trabalho correspondentes geram IDs depois que os dados são indexados.
Um fluxo de trabalho correspondente pode ter várias execuções e os resultados (sucessos ou erros) são gravados em uma pasta com jobId o nome.
Para cada execução para destinos de saída do S3:
-
A saída de dados contém um arquivo para correspondências bem-sucedidas e um arquivo para erros.
-
Os resultados bem-sucedidos são gravados em uma
successpasta contendo vários arquivos -
Os erros são gravados em uma
errorpasta com vários campos
Para cada execução dos destinos de saída do Connect Customer Customer Profiles:
-
Os registros de clientes desduplicados são enviados diretamente para sua instância do Connect Customer
-
Você pode ver seu histórico de trabalho recente no AWS Entity Resolution console
-
Os perfis existentes no Connect Customer não estão incluídos no processo de desduplicação
Depois de criar e executar um fluxo de trabalho correspondente, você pode usar a saída da correspondência baseada em regras ou da correspondência de aprendizado de máquina (ML) como entrada para a correspondência baseada em serviços do provedor ou vice-versa para atender às suas necessidades comerciais.
Por exemplo, para economizar nos custos de assinatura do provedor, você pode primeiro executar a correspondência baseada em regras para encontrar correspondências em seus dados. Em seguida, você pode enviar um subconjunto de registros incomparáveis para o provedor de correspondência baseada em serviços. Observe que, se você planeja exportar para perfis de clientes, use somente a correspondência baseada em regras ou em aprendizado de máquina.
Para obter mais informações sobre como solucionar erros, consulteSolução de problemas de fluxos de trabalho correspondentes.