View a markdown version of this page

Combinar dados de entrada usando um fluxo de trabalho de correspondência - AWS Entity Resolution

As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.

Combinar dados de entrada usando um fluxo de trabalho de correspondência

Um fluxo de trabalho de correspondência é um trabalho de processamento de dados que combina e compara dados de diferentes fontes de entrada e determina quais registros correspondem com base em diferentes técnicas de correspondência. AWS Entity Resolution lê seus dados de seus locais especificados, encontra correspondências entre registros e atribui um ID de correspondência a cada conjunto de dados correspondente.

O diagrama a seguir resume como criar um fluxo de trabalho correspondente.

A summary of the four steps to create a matching workflow in AWS Entity Resolution

Tipos de fluxo de trabalho correspondentes

AWS Entity Resolution oferece suporte a três tipos de fluxos de trabalho correspondentes:

Rule-based combinando

Usa regras configuráveis para identificar registros correspondentes com base na correspondência exata ou difusa de campos especificados. Você define os critérios de correspondência, como nomes correspondentes que são escritos de forma semelhante ou endereços com formatação diferente.

Correspondência baseada em machine learning

Usa modelos de aprendizado de máquina para identificar registros semelhantes, mesmo quando os dados têm variações, erros ou campos ausentes. Essa abordagem pode detectar correspondências mais complexas do que a correspondência baseada em regras.

Correspondência baseada em serviços do provedor

Usa provedores de dados terceirizados para enriquecer e validar seus dados antes da correspondência. Esse tipo de correspondência não é compatível com a saída Connect Customer Customer Profiles.

Opções de saída de dados

AWS Entity Resolution pode gravar arquivos de saída de dados em:

  • Um local do Amazon S3 que você especificar

  • Conecte perfis de clientes (para desduplicação de dados do cliente)

Importante

A exportação de perfis de clientes do Connect Customer não é compatível com a correspondência baseada no provedor. Para exportar para os perfis de clientes do Connect Customer, você deve usar a correspondência baseada em regras ou a correspondência baseada em aprendizado de máquina.

Você pode AWS Entity Resolution usar o hash de saída de dados, se desejar, ajudando você a manter o controle sobre seus dados.

A tabela a seguir mostra os três tipos de fluxos de trabalho correspondentes e seus destinos de saída compatíveis.

Tipo de correspondência saída do S3 Saída de perfis de clientes
baseado em regras Yes (Sim) Yes (Sim)
baseado em aprendizado de máquina Yes (Sim) Yes (Sim)
baseado em serviços do provedor Sim Não

Resultados do fluxo de trabalho correspondentes

Depois de criar e executar um fluxo de trabalho correspondente, você pode visualizar os resultados no local especificado no S3 ou nos perfis de clientes do Connect Customer. Os fluxos de trabalho correspondentes geram IDs depois que os dados são indexados.

Um fluxo de trabalho correspondente pode ter várias execuções e os resultados (sucessos ou erros) são gravados em uma pasta com jobId o nome.

Para cada execução para destinos de saída do S3:

  • A saída de dados contém um arquivo para correspondências bem-sucedidas e um arquivo para erros.

  • Os resultados bem-sucedidos são gravados em uma success pasta contendo vários arquivos

  • Os erros são gravados em uma error pasta com vários campos

Para cada execução dos destinos de saída do Connect Customer Customer Profiles:

  • Os registros de clientes desduplicados são enviados diretamente para sua instância do Connect Customer

  • Você pode ver seu histórico de trabalho recente no AWS Entity Resolution console

  • Os perfis existentes no Connect Customer não estão incluídos no processo de desduplicação

Depois de criar e executar um fluxo de trabalho correspondente, você pode usar a saída da correspondência baseada em regras ou da correspondência de aprendizado de máquina (ML) como entrada para a correspondência baseada em serviços do provedor ou vice-versa para atender às suas necessidades comerciais.

Por exemplo, para economizar nos custos de assinatura do provedor, você pode primeiro executar a correspondência baseada em regras para encontrar correspondências em seus dados. Em seguida, você pode enviar um subconjunto de registros incomparáveis para o provedor de correspondência baseada em serviços. Observe que, se você planeja exportar para perfis de clientes, use somente a correspondência baseada em regras ou em aprendizado de máquina.

Para obter mais informações sobre como solucionar erros, consulteSolução de problemas de fluxos de trabalho correspondentes.