View a markdown version of this page

Creación de un flujo de trabajo coincidente basado en el aprendizaje automático - AWS Entity Resolution

Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.

Creación de un flujo de trabajo coincidente basado en el aprendizaje automático

La comparación basada en el aprendizaje automático es un proceso preestablecido que intenta hacer coincidir los registros de todos los datos que ingresa. El flujo de trabajo de comparación basado en el aprendizaje automático le permite comparar datos en texto plano para encontrar una amplia gama de coincidencias mediante un modelo de aprendizaje automático.

nota

El modelo de aprendizaje automático no admite la comparación de datos cifrados.

Cuando AWS Entity Resolution encuentra una coincidencia entre dos o más registros de sus datos, asigna:

Puede utilizar el resultado de un flujo de trabajo ML-based coincidente como entrada para hacer coincidir los proveedores de servicios de datos, o viceversa, para cumplir sus objetivos específicos. Por ejemplo, puede realizar una ML-based comparación para buscar primero las coincidencias entre las fuentes de datos de sus propios registros. Si un subconjunto no coincide, puedes ejecutar la comparación basada en el servicio del proveedor para encontrar más coincidencias.

Requisitos previos

Antes de crear un flujo de trabajo ML-based coincidente, debes:

  1. Cree un mapeo de esquemas. Para obtener más información, consulte Crear un esquema de mapeo.

  2. Si utiliza los perfiles de clientes de Connect como destino de salida, asegúrese de tener configurados los permisos adecuados.

Para crear un flujo de trabajo ML-based coincidente:
  1. Inicie sesión en Consola de administración de AWS y abra la AWS Entity Resolution consola en https://console.aws.amazon.com/entityresolution/.

  2. En el panel de navegación izquierdo, en Flujos de trabajo, seleccione Coincidencia.

  3. En la página Flujos de trabajo coincidentes, en la esquina superior derecha, elige Crear flujo de trabajo coincidente.

  4. Para el paso 1: especificar los detalles del flujo de trabajo coincidente, haga lo siguiente:

    1. Introduzca un nombre de flujo de trabajo coincidente y una descripción opcional.

    2. Para la entrada de datos, elija una AWS Glue base de datos Región de AWS, la AWS Glue tabla y, a continuación, la asignación de esquemas correspondiente.

      Puede agregar hasta 20 entradas de datos.

    3. La opción Normalizar datos está seleccionada de forma predeterminada, de modo que las entradas de datos se normalizan antes de hacer coincidir. Si no desea normalizar los datos, anule la selección de la opción Normalizar datos.

      La coincidencia basada en el aprendizaje automático solo se normalizaName, y. Teléfono Correo electrónico

    4. Para especificar los permisos de acceso al servicio, elija una opción y realice la acción recomendada.

      Opción Acción recomendada
      Crear y usar un nuevo rol de servicio
      • AWS Entity Resolution crea un rol de servicio con la política requerida para esta tabla.

      • El Nombre del rol de servicio predeterminado es entityresolution-matching-workflow-<timestamp>.

      • Debe tener permisos para crear roles y adjuntar políticas.

      • Si los datos de entrada están cifrados, elija la opción Estos datos se cifran con una clave de KMS. A continuación, introduzca una AWS KMS clave que se utilice para descifrar los datos introducidos.

      Usar un rol de servicio existente
      1. Seleccione un Nombre de rol de servicio existente en la lista desplegable.

        Si tiene permisos de listas de roles, se mostrará la lista de roles.

        Si no tiene permisos de listas de roles, puede ingresar el nombre de recurso de Amazon (ARN) del rol que desea usar.

        Si no hay ningún rol de servicio existente, la opción Usar un rol de servicio existente no estará disponible.

      2. Consulte el rol de servicio mediante la elección del enlace externo Ver en IAM.

        De forma predeterminada, AWS Entity Resolution no intenta actualizar la política de roles existente para añadir los permisos necesarios.

    5. (Opcional) Para habilitar las etiquetas del recurso, elija Agregar nueva etiqueta y, a continuación, introduzca el par clave y valor.

    6. Elija Siguiente.

  5. Para el paso 2: elige la técnica de coincidencia:

    1. Para el método de emparejamiento, elija el método de emparejamiento basado en el aprendizaje automático.

      AWS Entity Resolution interfaz de creación de flujos de trabajo coincidente con opciones para la comparación basada en reglas o mediante aprendizaje automático.
    2. En Cadencia de procesamiento, seleccione una de las siguientes opciones.

      • Elija Manual para ejecutar un flujo de trabajo de coincidencia por lotes, que procesa todos los datos de su bucket de S3.

      • Seleccione Automático para ejecutar un flujo de trabajo de coincidencia incremental, que procesa solo los datos incrementales de su depósito de S3.

    3. Elija Siguiente.

  6. Para el paso 3: especifique la salida y el formato de los datos:

    1. Para el destino y el formato de la salida de datos, elija la ubicación de Amazon S3 para la salida de datos y si el formato de datos será de datos normalizados o de datos originales.

    2. Para el cifrado, si elige personalizar la configuración de cifrado, introduzca la AWS KMS clave ARN.

    3. Vea el resultado generado por el sistema.

    4. En el caso de la salida de datos, decida qué campos quiere incluir, ocultar o enmascarar y, a continuación, tome las medidas recomendadas en función de sus objetivos.

      Su objetivo Opción recomendada
      Incluye campos Mantenga el estado de salida como Incluido.
      Ocultar campos (excluir de la salida) Seleccione el campo Salida y, a continuación, elija Ocultar.
      Enmascarar campos Elija el campo Salida y, a continuación, elija Salida hash.
      Restablece la configuración anterior Elija Restablecer.
    5. Elija Siguiente.

  7. Para el paso 4: Revisa y crea:

    1. Revise las selecciones que realizó en los pasos anteriores y edítelas si es necesario.

    2. Elija Create and run.

      Aparece un mensaje que indica que se ha creado el flujo de trabajo correspondiente y que el trabajo se ha iniciado.

  8. En la página de detalles del flujo de trabajo correspondiente, en la pestaña Métricas, consulta lo siguiente en Métricas del último trabajo:

    • El identificador del trabajo.

    • El estado del trabajo de flujo de trabajo correspondiente: En cola, En curso, Completado , Fallido

    • El tiempo de finalización del trabajo de flujo de trabajo.

    • El número de registros procesados.

    • El número de registros no procesados.

    • Los identificadores de coincidencia únicos generados.

    • El número de registros de entrada.

    También puedes ver las métricas de los trabajos para ver si coinciden con los trabajos del flujo de trabajo que se han ejecutado anteriormente en el historial de trabajos.

  9. Cuando se complete el trabajo del flujo de trabajo correspondiente (el estado es Completado), puede ir a la pestaña de salida de datos y, a continuación, seleccionar su ubicación de Amazon S3 para ver los resultados.

  10. (Solo el tipo de procesamiento manual) Si ha creado un flujo de trabajo coincidente basado en el aprendizaje automático con el tipo de procesamiento manual, puede ejecutar el flujo de trabajo correspondiente en cualquier momento seleccionando Ejecutar flujo de trabajo en la página de detalles del flujo de trabajo correspondiente.