View a markdown version of this page

Conjunto de datos de eventos - Amazon Fraud Detector

Amazon Fraud Detector ya no estará disponible para nuevos clientes a partir del 7 de noviembre de 2025. Para obtener capacidades similares a las de Amazon Fraud Detector SageMaker AutoGluon, explore Amazon y AWS WAF.

Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.

Conjunto de datos de eventos

Un conjunto de datos de eventos son los datos históricos de fraude de su empresa. Usted proporciona estos datos a Amazon Fraud Detector para crear modelos de detección de fraudes.

Amazon Fraud Detector utiliza modelos de aprendizaje automático para generar predicciones de fraude. Cada modelo se entrena con un tipo de modelo. El tipo de modelo especifica los algoritmos y las transformaciones que se utilizan para entrenar el modelo. El entrenamiento del modelo es el proceso de usar un conjunto de datos que usted proporciona para crear un modelo que pueda predecir eventos fraudulentos. Para obtener más información, consulte Cómo funciona Amazon Fraud Detector

El conjunto de datos utilizado para crear un modelo de detección de fraudes proporciona detalles de un evento. Un evento es una actividad empresarial que se evalúa para detectar el riesgo de fraude. Por ejemplo, el registro de una cuenta puede ser un evento. Los datos asociados al evento de registro de la cuenta pueden ser un conjunto de datos de eventos. Amazon Fraud Detector usa este conjunto de datos para evaluar el fraude en el registro de cuentas.

Antes de proporcionar su conjunto de datos a Amazon Fraud Detector para crear un modelo, asegúrese de definir su objetivo para crear el modelo. También debe determinar cómo quiere usar el modelo y definir sus métricas para evaluar si el modelo funciona en función de sus requisitos específicos.

Por ejemplo, tus objetivos al crear un modelo de detección de fraudes que evalúe el fraude en el registro de cuentas pueden ser los siguientes:

  • Aprobar automáticamente los registros legítimos.

  • Para capturar registros fraudulentos para su posterior investigación.

Una vez que hayas determinado tu objetivo, el siguiente paso es decidir cómo quieres usar el modelo. Algunos ejemplos de uso del modelo de detección de fraudes para evaluar el fraude en el registro son los siguientes:

  • Para la detección de fraudes en tiempo real para cada registro de cuenta.

  • Para evaluar sin conexión todos los registros de cuentas cada hora.

Algunos ejemplos de métricas que se pueden usar para medir el rendimiento del modelo son los siguientes:

  • Su rendimiento es consistentemente mejor que la línea base actual en producción.

  • Captura el X% de registros de fraude con una tasa del Y% de falsos positivos.

  • Acepta hasta un 5% de los registros fraudulentos aprobados automáticamente.

Estructura del conjunto de datos de eventos

Amazon Fraud Detector requiere que proporciones tu conjunto de datos de eventos en un archivo de texto con valores separados por comas (CSV) en el UTF-8 formato. La primera línea del archivo de conjunto de datos CSV debe contener los encabezados de los archivos. El encabezado del archivo se compone de metadatos y variables de eventos que describen cada elemento de datos asociado al evento. El encabezado va seguido de los datos del evento. Cada línea consta de elementos de datos de un solo evento.

  • Metadatos del evento: proporcionan información sobre el evento. Por ejemplo, EVENT_TIMESTAMP es un metadato de evento que especifica la hora en que ocurrió el evento. En función de su caso de uso empresarial y del tipo de modelo utilizado para crear y entrenar su modelo de detección de fraudes, Amazon Fraud Detector requiere que proporcione metadatos de eventos específicos. Al especificar los metadatos del evento en el encabezado del archivo CSV, utilice el mismo nombre de metadatos del evento que el especificado por Amazon Fraud Detector y utilice únicamente letras mayúsculas.

  • Variable de evento: representa los elementos de datos específicos de su evento y que desea utilizar para crear y entrenar su modelo de detección de fraudes. En función de su caso de uso empresarial y del tipo de modelo utilizado para crear y entrenar un modelo de detección de fraudes, Amazon Fraud Detector puede requerir o recomendar que proporcione variables de evento específicas. Si lo desea, también puede proporcionar otras variables de evento de su evento que desee incluir en la capacitación del modelo. Algunos ejemplos de variables de evento para un evento de registro en línea pueden ser la dirección de correo electrónico, la dirección IP y el número de teléfono. Cuando especifiques el nombre de la variable del evento en el encabezado del archivo CSV, usa cualquier nombre de variable que elijas y usa solo letras minúsculas.

  • Datos del evento: representan los datos recopilados del evento real. En tu archivo CSV, cada fila que sigue al encabezado del archivo consta de elementos de datos de un solo evento. Por ejemplo, en un archivo de datos de eventos de registro en línea, cada fila contiene datos de un único registro. Cada elemento de datos de la fila debe coincidir con los metadatos del evento o la variable de evento correspondientes.

El siguiente es un ejemplo de un archivo CSV que contiene datos de un evento de registro de cuenta. La fila del encabezado contiene los metadatos del evento en mayúsculas y las variables del evento en minúsculas, seguidas de los datos del evento. Cada fila del conjunto de datos contiene elementos de datos asociados al registro de una sola cuenta y cada elemento de datos corresponde al encabezado.

Archivo CSV con fila de encabezado que muestra los metadatos y variables del evento, seguido de filas de datos del evento.

Obtenga los requisitos del conjunto de datos de eventos mediante el explorador de modelos de datos

El tipo de modelo que elija para crear su modelo define los requisitos de su conjunto de datos. Amazon Fraud Detector utiliza el conjunto de datos que usted proporciona para crear y entrenar su modelo de detección de fraudes. Antes de que Amazon Fraud Detector comience a crear su modelo, comprueba si el conjunto de datos cumple con los requisitos de tamaño, formato y otros requisitos. Si el conjunto de datos no cumple los requisitos, se produce un error en la creación y el entrenamiento del modelo. Puede utilizar el explorador de modelos de datos para identificar un tipo de modelo y utilizarlo en su caso práctico empresarial y para obtener información sobre los requisitos del conjunto de datos para el tipo de modelo identificado.

Explorador de modelos de datos

El explorador de modelos de datos es una herramienta de la consola de Amazon Fraud Detector que alinea el caso de uso empresarial con el tipo de modelo compatible con Amazon Fraud Detector. El explorador de modelos de datos también proporciona información sobre los elementos de datos que Amazon Fraud Detector necesita para crear su modelo de detección de fraudes. Antes de empezar a preparar su conjunto de datos de eventos, utilice el explorador de modelos de datos para averiguar el tipo de modelo que Amazon Fraud Detector recomienda para su uso empresarial y también para ver una lista de los elementos de datos obligatorios, recomendados y opcionales que necesitará para crear su conjunto de datos.

Para usar el explorador de modelos de datos,
  1. Inicie sesión en la Consola de administración de AWS e inicie sesión en su cuenta. Navegue hasta Amazon Fraud Detector.

  2. En el panel de navegación izquierdo, seleccione Explorador de modelos de datos.

  3. En la página del explorador de modelos de datos, en Caso de uso empresarial, seleccione el caso de uso empresarial que desee evaluar para determinar el riesgo de fraude.

  4. Amazon Fraud Detector muestra el tipo de modelo recomendado que coincide con su caso de uso empresarial. El tipo de modelo define los algoritmos, los enriquecimientos y las transformaciones que Amazon Fraud Detector utilizará para entrenar su modelo de detección de fraudes.

    Anote el tipo de modelo recomendado. Lo necesitará más adelante cuando cree el modelo.

    nota

    Si no encuentra su caso de uso empresarial, utilice el enlace de contacto que aparece en la descripción para proporcionarnos los detalles de su caso de uso empresarial. Le recomendaremos el tipo de modelo que debe utilizar para crear un modelo de detección de fraude para su caso de uso empresarial.

  5. El panel de información sobre el modelo de datos proporciona información sobre los elementos de datos obligatorios, recomendados y opcionales necesarios para crear y capacitar un modelo de detección de fraude para su caso de uso empresarial. Usa la información del panel de información para recopilar los datos de tus eventos y crear tu conjunto de datos.

Recopile los datos del evento

La recopilación de los datos de tus eventos es un paso importante para crear tu modelo. Esto se debe a que el rendimiento de su modelo a la hora de predecir el fraude depende de la calidad de su conjunto de datos. Cuando comience a recopilar los datos de sus eventos, tenga en cuenta la lista de elementos de datos que el explorador de modelos de datos le proporcionó para crear su conjunto de datos. Deberás recopilar todos los datos obligatorios (metadatos del evento) y decidir qué elementos de datos (variables de eventos) recomendados y opcionales incluir en función de tus objetivos al crear el modelo. También es importante decidir el formato de cada variable de evento que pretendes incluir y el tamaño total del conjunto de datos.

Calidad del conjunto de datos de eventos

Para recopilar un conjunto de datos de alta calidad para su modelo, le recomendamos lo siguiente:

  • Recopile datos maduros: el uso de los datos más recientes ayuda a identificar el patrón de fraude más reciente. Sin embargo, para detectar casos de uso fraudulento, permita que los datos maduren. El período de vencimiento depende de su empresa y puede tardar entre dos semanas y tres meses. Por ejemplo, si tu evento incluye una transacción con tarjeta de crédito, el vencimiento de los datos podría determinarse en función del período de devolución de la tarjeta de crédito o del tiempo que un investigador haya tardado en tomar una determinación.

    Asegúrate de que el conjunto de datos utilizado para entrenar el modelo haya tenido tiempo suficiente para madurar según tu empresa.

  • Asegúrese de que la distribución de los datos no varíe significativamente: el proceso de entrenamiento del modelo de Amazon Fraud Detector toma muestras y divide su conjunto de datos en función de EVENT_TIMESTAMP. Por ejemplo, si su conjunto de datos consiste en eventos de fraude obtenidos en los últimos 6 meses, pero solo se incluye el último mes de eventos legítimos, se considera que la distribución de datos es variable e inestable. Un conjunto de datos inestable puede generar sesgos en la evaluación del rendimiento del modelo. Si descubres que la distribución de los datos varía considerablemente, considera la posibilidad de equilibrar el conjunto de datos recopilando datos similares a los de la distribución de datos actual.

  • Asegúrate de que el conjunto de datos sea representativo del caso de uso en el que se encuentra el modelo implemented/tested; de lo contrario, el rendimiento estimado podría estar sesgado. Supongamos que está utilizando un modelo para rechazar automáticamente a todas las candidaturas que se presenten en el mercado interno, pero su modelo se basa en un conjunto de datos que contiene datos históricos data/labels de las candidaturas aprobadas anteriormente. Por lo tanto, es posible que la evaluación de tu modelo sea inexacta, ya que se basa en un conjunto de datos que no representa a los candidatos rechazados.

Formato de datos del evento

Amazon Fraud Detector transforma la mayoría de sus datos al formato requerido como parte de su modelo de proceso de formación. Sin embargo, hay algunos formatos estándar que puede usar fácilmente para proporcionar sus datos y que pueden ayudar a evitar problemas más adelante, cuando Amazon Fraud Detector valide su conjunto de datos. La siguiente tabla proporciona orientación sobre los formatos para proporcionar los metadatos de eventos recomendados.

nota

Cuando crees tu archivo CSV, asegúrate de introducir el nombre de los metadatos del evento tal y como se indica a continuación, en mayúsculas.

Nombre de los metadatos Formato Obligatorio

EVENT_ID

Si se proporciona, debe cumplir los siguientes requisitos:

  • Es único para ese evento.

  • Representa información que es significativa para su empresa.

  • Sigue el patrón de expresiones regulares (por ejemplo, ^[0-9a-z_-]+$.)

  • Además de los requisitos anteriores, te recomendamos que no añadas una marca de tiempo al EVENT_ID. Hacerlo podría causar problemas al actualizar el evento. Esto se debe a que debes proporcionar exactamente el mismo EVENT_ID si lo haces.

Depende del tipo de modelo

EVENT_TIMESTAMP

  • Debe especificarse en uno de los siguientes formatos:

    • %yyy-%mm-%ddt%hh: %mm: %ssZ (la norma ISO 8601 solo está disponible en UTC, sin milisegundos)

      Ejemplo: 2019-11-30 T13:01:01Z

    • %aaay/%mm/%d %h: %mm: %s () AM/PM

      Ejemplos 2019/11: /30 1:01:01 p.m., o /30 13:01:01 2019/11

    • %mm/%dd/%yyy %h: %m: %s

      Ejemplos: /2019 1:01:01 p.m., /2019 11/30 13:01:01 11/30

    • %mm/%dd/%yy %h: %mm: %s

      Ejemplos: /19 1:01:01 p.m., /19 11/30 13:01:01 11/30

  • Amazon Fraud Detector parte de las siguientes suposiciones al analizar los formatos para las marcas de hora de los eventos: date/timestamp

    • Si utiliza la norma ISO 8601, debe coincidir exactamente con la especificación anterior

    • Si utiliza uno de los otros formatos, hay flexibilidad adicional:

      • Para meses y días, puedes proporcionar un dígito único o doble. Por ejemplo, 1/12 /2019 es una fecha válida.

      • No necesitas incluir hh:mm:ss si no los tienes (es decir, puedes simplemente indicar una fecha). También puede proporcionar un subconjunto de solo la hora y los minutos (por ejemplo, hh:mm). No se admite simplemente proporcionar la hora. Tampoco se admiten milisegundos.

      • Si proporciona AM/PM etiquetas, se presupone que el reloj es de 12 horas. Si no hay AM/PM información, se asume que es un reloj de 24 horas.

      • Puede utilizar «/» o «-» como delimitadores para los elementos de fecha. Se presupone que «:» se utiliza para los elementos de marca de tiempo.

ENTITY_ID

  • Debe seguir el patrón de expresión regular:. ^[0-9A-Za-z_.@+-]+$

  • Si la identificación de la entidad no está disponible en el momento de la evaluación, especifique la identificación de la entidad como desconocida.

Depende del tipo de modelo

ENTITY_TYPE

Puedes usar cualquier cadena

Depende del tipo de modelo

EVENT_LABEL

Puedes usar cualquier etiqueta, como «fraude», «legítimo», «1" o «0".

Obligatorio si se incluye LABEL_TIMESTAMP

LABEL_TIMESTAMP

Debe seguir el formato de marca de tiempo.

Obligatorio si se incluye EVENT_LABEL

Para obtener información sobre las variables de eventos, consulte Variables.

importante

Si está creando un modelo Account Takeover Insights (ATI), consulte Preparación de datos para obtener más información sobre la preparación y selección de datos.

Faltan valores o son nulos

Las variables EVENT_TIMESTAMP y EVENT_LABEL no deben contener ningún valor nulo o faltante. Puede tener valores nulos o faltantes para otras variables. Sin embargo, le recomendamos que solo utilice un número pequeño de nulos para esas variables. Si Amazon Fraud Detector determina que faltan demasiados valores nulos o que faltan para una variable de evento, omitirá automáticamente la variable de su modelo.

Variables mínimas

Al crear el modelo, el conjunto de datos debe incluir al menos dos variables de eventos además de los metadatos de eventos requeridos. Las dos variables de eventos deben pasar la comprobación de validación.

Tamaño del conjunto de datos de eventos

Obligatorio

Su conjunto de datos debe cumplir los siguientes requisitos básicos para que el entrenamiento del modelo sea exitoso.

  • Datos de al menos 100 eventos.

  • El conjunto de datos debe incluir al menos 50 eventos (filas) clasificados como fraudulentos.

Recomendado

Le recomendamos que su conjunto de datos incluya lo siguiente para que el entrenamiento del modelo sea exitoso y tenga un buen rendimiento.

  • Incluya un mínimo de tres semanas de datos históricos, pero como máximo seis meses de datos.

  • Incluya un mínimo de 10 000 datos totales de eventos.

  • Incluye al menos 400 eventos (filas) clasificados como fraudulentos y 400 eventos (filas) clasificados como legítimos.

  • Incluya más de 100 entidades únicas, si su tipo de modelo requiere ENTITY_ID.

Validación del conjunto de datos

Antes de que Amazon Fraud Detector comience a crear su modelo, comprueba si las variables incluidas en el conjunto de datos para entrenar el modelo cumplen con los requisitos de tamaño, formato y otros requisitos. Si el conjunto de datos no supera la validación, no se crea el modelo. Primero debes corregir las variables que no superaron la validación antes de crear el modelo. Amazon Fraud Detector le proporciona un generador de perfiles de datos que puede utilizar para identificar y solucionar problemas con su conjunto de datos antes de empezar a entrenar su modelo

Generador de perfiles de datos

Amazon Fraud Detector proporciona una herramienta de código abierto para crear perfiles y preparar los datos para el entrenamiento con modelos. Este generador de perfiles de datos automatizado le ayuda a evitar errores comunes en la preparación de datos y a identificar posibles problemas, como los tipos de variables mal mapeados, que podrían afectar negativamente al rendimiento del modelo. El generador de perfiles genera un informe intuitivo y completo de su conjunto de datos, que incluye estadísticas de variables, distribución de etiquetas, análisis categóricos y numéricos y correlaciones entre variables y etiquetas. Proporciona orientación sobre los tipos de variables, así como una opción para transformar el conjunto de datos en el formato que Amazon Fraud Detector requiera.

Uso del generador de perfiles de datos

El generador de perfiles de datos automatizado está construido con una AWS CloudFormation pila, que puede iniciar fácilmente con unos pocos clics. Todos los códigos están disponibles en Github. Para obtener información sobre cómo usar el generador de perfiles de datos, siga las instrucciones de nuestro blog Entrene modelos más rápido con un generador de perfiles de datos automatizado para Amazon Fraud Detector

Errores comunes en los conjuntos de datos de eventos

Los siguientes son algunos de los problemas comunes con los que se enfrenta Amazon Fraud Detector al validar un conjunto de datos de eventos. Después de ejecutar el generador de perfiles de datos, utilice esta lista para comprobar si hay errores en el conjunto de datos antes de crear el modelo.

  • El archivo CSV no tiene ese UTF-8 formato.

  • La cantidad de eventos en el conjunto de datos es inferior a 100.

  • El número de eventos identificados como fraudulentos o legítimos es inferior a 50.

  • El número de entidades únicas asociadas a un evento de fraude es inferior a 100.

  • Más del 0,1% de los valores de EVENT_TIMESTAMP contienen valores nulos o valores distintos de los formatos admitidos. date/timestamp

  • Más del 1% de los valores de EVENT_LABEL contienen valores nulos o distintos de los definidos en el tipo de evento.

  • Hay menos de dos variables disponibles para el entrenamiento del modelo.

Almacenamiento de conjuntos de datos

Después de recopilar el conjunto de datos, lo almacena internamente con Amazon Fraud Detector o externamente con Amazon Simple Storage Service (Amazon S3). Le recomendamos que elija dónde almacenar su conjunto de datos en función del modelo que utilice para generar predicciones de fraude. Para obtener más información sobre los tipos de modelo, consulta Elegir un tipo de modelo. Para obtener más información sobre cómo almacenar el conjunto de datos, consulteAlmacenamiento de datos de eventos.