Amazon Fraud Detector ya no estará disponible para nuevos clientes a partir del 7 de noviembre de 2025. Para obtener capacidades similares a las de Amazon Fraud Detector SageMaker AutoGluon, explore Amazon y AWS WAF.
Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.
Conjunto de datos de eventos
Un conjunto de datos de eventos son los datos históricos de fraude de su empresa. Usted proporciona estos datos a Amazon Fraud Detector para crear modelos de detección de fraudes.
Amazon Fraud Detector utiliza modelos de aprendizaje automático para generar predicciones de fraude. Cada modelo se entrena con un tipo de modelo. El tipo de modelo especifica los algoritmos y las transformaciones que se utilizan para entrenar el modelo. El entrenamiento del modelo es el proceso de usar un conjunto de datos que usted proporciona para crear un modelo que pueda predecir eventos fraudulentos. Para obtener más información, consulte Cómo funciona Amazon Fraud Detector
El conjunto de datos utilizado para crear un modelo de detección de fraudes proporciona detalles de un evento. Un evento es una actividad empresarial que se evalúa para detectar el riesgo de fraude. Por ejemplo, el registro de una cuenta puede ser un evento. Los datos asociados al evento de registro de la cuenta pueden ser un conjunto de datos de eventos. Amazon Fraud Detector usa este conjunto de datos para evaluar el fraude en el registro de cuentas.
Antes de proporcionar su conjunto de datos a Amazon Fraud Detector para crear un modelo, asegúrese de definir su objetivo para crear el modelo. También debe determinar cómo quiere usar el modelo y definir sus métricas para evaluar si el modelo funciona en función de sus requisitos específicos.
Por ejemplo, tus objetivos al crear un modelo de detección de fraudes que evalúe el fraude en el registro de cuentas pueden ser los siguientes:
Aprobar automáticamente los registros legítimos.
Para capturar registros fraudulentos para su posterior investigación.
Una vez que hayas determinado tu objetivo, el siguiente paso es decidir cómo quieres usar el modelo. Algunos ejemplos de uso del modelo de detección de fraudes para evaluar el fraude en el registro son los siguientes:
Para la detección de fraudes en tiempo real para cada registro de cuenta.
Para evaluar sin conexión todos los registros de cuentas cada hora.
Algunos ejemplos de métricas que se pueden usar para medir el rendimiento del modelo son los siguientes:
Su rendimiento es consistentemente mejor que la línea base actual en producción.
Captura el X% de registros de fraude con una tasa del Y% de falsos positivos.
Acepta hasta un 5% de los registros fraudulentos aprobados automáticamente.
Estructura del conjunto de datos de eventos
Amazon Fraud Detector requiere que proporciones tu conjunto de datos de eventos en un archivo de texto con valores separados por comas (CSV) en el UTF-8 formato. La primera línea del archivo de conjunto de datos CSV debe contener los encabezados de los archivos. El encabezado del archivo se compone de metadatos y variables de eventos que describen cada elemento de datos asociado al evento. El encabezado va seguido de los datos del evento. Cada línea consta de elementos de datos de un solo evento.
-
Metadatos del evento: proporcionan información sobre el evento. Por ejemplo, EVENT_TIMESTAMP es un metadato de evento que especifica la hora en que ocurrió el evento. En función de su caso de uso empresarial y del tipo de modelo utilizado para crear y entrenar su modelo de detección de fraudes, Amazon Fraud Detector requiere que proporcione metadatos de eventos específicos. Al especificar los metadatos del evento en el encabezado del archivo CSV, utilice el mismo nombre de metadatos del evento que el especificado por Amazon Fraud Detector y utilice únicamente letras mayúsculas.
-
Variable de evento: representa los elementos de datos específicos de su evento y que desea utilizar para crear y entrenar su modelo de detección de fraudes. En función de su caso de uso empresarial y del tipo de modelo utilizado para crear y entrenar un modelo de detección de fraudes, Amazon Fraud Detector puede requerir o recomendar que proporcione variables de evento específicas. Si lo desea, también puede proporcionar otras variables de evento de su evento que desee incluir en la capacitación del modelo. Algunos ejemplos de variables de evento para un evento de registro en línea pueden ser la dirección de correo electrónico, la dirección IP y el número de teléfono. Cuando especifiques el nombre de la variable del evento en el encabezado del archivo CSV, usa cualquier nombre de variable que elijas y usa solo letras minúsculas.
-
Datos del evento: representan los datos recopilados del evento real. En tu archivo CSV, cada fila que sigue al encabezado del archivo consta de elementos de datos de un solo evento. Por ejemplo, en un archivo de datos de eventos de registro en línea, cada fila contiene datos de un único registro. Cada elemento de datos de la fila debe coincidir con los metadatos del evento o la variable de evento correspondientes.
El siguiente es un ejemplo de un archivo CSV que contiene datos de un evento de registro de cuenta. La fila del encabezado contiene los metadatos del evento en mayúsculas y las variables del evento en minúsculas, seguidas de los datos del evento. Cada fila del conjunto de datos contiene elementos de datos asociados al registro de una sola cuenta y cada elemento de datos corresponde al encabezado.
Obtenga los requisitos del conjunto de datos de eventos mediante el explorador de modelos de datos
El tipo de modelo que elija para crear su modelo define los requisitos de su conjunto de datos. Amazon Fraud Detector utiliza el conjunto de datos que usted proporciona para crear y entrenar su modelo de detección de fraudes. Antes de que Amazon Fraud Detector comience a crear su modelo, comprueba si el conjunto de datos cumple con los requisitos de tamaño, formato y otros requisitos. Si el conjunto de datos no cumple los requisitos, se produce un error en la creación y el entrenamiento del modelo. Puede utilizar el explorador de modelos de datos para identificar un tipo de modelo y utilizarlo en su caso práctico empresarial y para obtener información sobre los requisitos del conjunto de datos para el tipo de modelo identificado.
Explorador de modelos de datos
El explorador de modelos de datos es una herramienta de la consola de Amazon Fraud Detector que alinea el caso de uso empresarial con el tipo de modelo compatible con Amazon Fraud Detector. El explorador de modelos de datos también proporciona información sobre los elementos de datos que Amazon Fraud Detector necesita para crear su modelo de detección de fraudes. Antes de empezar a preparar su conjunto de datos de eventos, utilice el explorador de modelos de datos para averiguar el tipo de modelo que Amazon Fraud Detector recomienda para su uso empresarial y también para ver una lista de los elementos de datos obligatorios, recomendados y opcionales que necesitará para crear su conjunto de datos.
Para usar el explorador de modelos de datos,
-
Inicie sesión en la Consola de administración de AWS
e inicie sesión en su cuenta. Navegue hasta Amazon Fraud Detector. -
En el panel de navegación izquierdo, seleccione Explorador de modelos de datos.
-
En la página del explorador de modelos de datos, en Caso de uso empresarial, seleccione el caso de uso empresarial que desee evaluar para determinar el riesgo de fraude.
-
Amazon Fraud Detector muestra el tipo de modelo recomendado que coincide con su caso de uso empresarial. El tipo de modelo define los algoritmos, los enriquecimientos y las transformaciones que Amazon Fraud Detector utilizará para entrenar su modelo de detección de fraudes.
Anote el tipo de modelo recomendado. Lo necesitará más adelante cuando cree el modelo.
nota
Si no encuentra su caso de uso empresarial, utilice el enlace de contacto que aparece en la descripción para proporcionarnos los detalles de su caso de uso empresarial. Le recomendaremos el tipo de modelo que debe utilizar para crear un modelo de detección de fraude para su caso de uso empresarial.
-
El panel de información sobre el modelo de datos proporciona información sobre los elementos de datos obligatorios, recomendados y opcionales necesarios para crear y capacitar un modelo de detección de fraude para su caso de uso empresarial. Usa la información del panel de información para recopilar los datos de tus eventos y crear tu conjunto de datos.
Recopile los datos del evento
La recopilación de los datos de tus eventos es un paso importante para crear tu modelo. Esto se debe a que el rendimiento de su modelo a la hora de predecir el fraude depende de la calidad de su conjunto de datos. Cuando comience a recopilar los datos de sus eventos, tenga en cuenta la lista de elementos de datos que el explorador de modelos de datos le proporcionó para crear su conjunto de datos. Deberás recopilar todos los datos obligatorios (metadatos del evento) y decidir qué elementos de datos (variables de eventos) recomendados y opcionales incluir en función de tus objetivos al crear el modelo. También es importante decidir el formato de cada variable de evento que pretendes incluir y el tamaño total del conjunto de datos.
Calidad del conjunto de datos de eventos
Para recopilar un conjunto de datos de alta calidad para su modelo, le recomendamos lo siguiente:
Recopile datos maduros: el uso de los datos más recientes ayuda a identificar el patrón de fraude más reciente. Sin embargo, para detectar casos de uso fraudulento, permita que los datos maduren. El período de vencimiento depende de su empresa y puede tardar entre dos semanas y tres meses. Por ejemplo, si tu evento incluye una transacción con tarjeta de crédito, el vencimiento de los datos podría determinarse en función del período de devolución de la tarjeta de crédito o del tiempo que un investigador haya tardado en tomar una determinación.
Asegúrate de que el conjunto de datos utilizado para entrenar el modelo haya tenido tiempo suficiente para madurar según tu empresa.
Asegúrese de que la distribución de los datos no varíe significativamente: el proceso de entrenamiento del modelo de Amazon Fraud Detector toma muestras y divide su conjunto de datos en función de EVENT_TIMESTAMP. Por ejemplo, si su conjunto de datos consiste en eventos de fraude obtenidos en los últimos 6 meses, pero solo se incluye el último mes de eventos legítimos, se considera que la distribución de datos es variable e inestable. Un conjunto de datos inestable puede generar sesgos en la evaluación del rendimiento del modelo. Si descubres que la distribución de los datos varía considerablemente, considera la posibilidad de equilibrar el conjunto de datos recopilando datos similares a los de la distribución de datos actual.
Asegúrate de que el conjunto de datos sea representativo del caso de uso en el que se encuentra el modelo implemented/tested; de lo contrario, el rendimiento estimado podría estar sesgado. Supongamos que está utilizando un modelo para rechazar automáticamente a todas las candidaturas que se presenten en el mercado interno, pero su modelo se basa en un conjunto de datos que contiene datos históricos data/labels de las candidaturas aprobadas anteriormente. Por lo tanto, es posible que la evaluación de tu modelo sea inexacta, ya que se basa en un conjunto de datos que no representa a los candidatos rechazados.
Formato de datos del evento
Amazon Fraud Detector transforma la mayoría de sus datos al formato requerido como parte de su modelo de proceso de formación. Sin embargo, hay algunos formatos estándar que puede usar fácilmente para proporcionar sus datos y que pueden ayudar a evitar problemas más adelante, cuando Amazon Fraud Detector valide su conjunto de datos. La siguiente tabla proporciona orientación sobre los formatos para proporcionar los metadatos de eventos recomendados.
nota
Cuando crees tu archivo CSV, asegúrate de introducir el nombre de los metadatos del evento tal y como se indica a continuación, en mayúsculas.
| Nombre de los metadatos | Formato | Obligatorio |
|---|---|---|
|
EVENT_ID |
Si se proporciona, debe cumplir los siguientes requisitos:
|
Depende del tipo de modelo |
|
EVENT_TIMESTAMP |
|
Sí |
|
ENTITY_ID |
|
Depende del tipo de modelo |
|
ENTITY_TYPE |
Puedes usar cualquier cadena |
Depende del tipo de modelo |
|
EVENT_LABEL |
Puedes usar cualquier etiqueta, como «fraude», «legítimo», «1" o «0". |
Obligatorio si se incluye LABEL_TIMESTAMP |
|
LABEL_TIMESTAMP |
Debe seguir el formato de marca de tiempo. |
Obligatorio si se incluye EVENT_LABEL |
Para obtener información sobre las variables de eventos, consulte Variables.
importante
Si está creando un modelo Account Takeover Insights (ATI), consulte Preparación de datos para obtener más información sobre la preparación y selección de datos.
Faltan valores o son nulos
Las variables EVENT_TIMESTAMP y EVENT_LABEL no deben contener ningún valor nulo o faltante. Puede tener valores nulos o faltantes para otras variables. Sin embargo, le recomendamos que solo utilice un número pequeño de nulos para esas variables. Si Amazon Fraud Detector determina que faltan demasiados valores nulos o que faltan para una variable de evento, omitirá automáticamente la variable de su modelo.
Variables mínimas
Al crear el modelo, el conjunto de datos debe incluir al menos dos variables de eventos además de los metadatos de eventos requeridos. Las dos variables de eventos deben pasar la comprobación de validación.
Tamaño del conjunto de datos de eventos
Obligatorio
Su conjunto de datos debe cumplir los siguientes requisitos básicos para que el entrenamiento del modelo sea exitoso.
-
Datos de al menos 100 eventos.
-
El conjunto de datos debe incluir al menos 50 eventos (filas) clasificados como fraudulentos.
Recomendado
Le recomendamos que su conjunto de datos incluya lo siguiente para que el entrenamiento del modelo sea exitoso y tenga un buen rendimiento.
-
Incluya un mínimo de tres semanas de datos históricos, pero como máximo seis meses de datos.
-
Incluya un mínimo de 10 000 datos totales de eventos.
-
Incluye al menos 400 eventos (filas) clasificados como fraudulentos y 400 eventos (filas) clasificados como legítimos.
-
Incluya más de 100 entidades únicas, si su tipo de modelo requiere ENTITY_ID.
Validación del conjunto de datos
Antes de que Amazon Fraud Detector comience a crear su modelo, comprueba si las variables incluidas en el conjunto de datos para entrenar el modelo cumplen con los requisitos de tamaño, formato y otros requisitos. Si el conjunto de datos no supera la validación, no se crea el modelo. Primero debes corregir las variables que no superaron la validación antes de crear el modelo. Amazon Fraud Detector le proporciona un generador de perfiles de datos que puede utilizar para identificar y solucionar problemas con su conjunto de datos antes de empezar a entrenar su modelo
Generador de perfiles de datos
Amazon Fraud Detector proporciona una herramienta de código abierto para crear perfiles y preparar los datos para el entrenamiento con modelos. Este generador de perfiles de datos automatizado le ayuda a evitar errores comunes en la preparación de datos y a identificar posibles problemas, como los tipos de variables mal mapeados, que podrían afectar negativamente al rendimiento del modelo. El generador de perfiles genera un informe intuitivo y completo de su conjunto de datos, que incluye estadísticas de variables, distribución de etiquetas, análisis categóricos y numéricos y correlaciones entre variables y etiquetas. Proporciona orientación sobre los tipos de variables, así como una opción para transformar el conjunto de datos en el formato que Amazon Fraud Detector requiera.
Uso del generador de perfiles de datos
El generador de perfiles de datos automatizado está construido con una AWS CloudFormation pila, que puede iniciar fácilmente con unos pocos clics. Todos los códigos están disponibles en Github
Errores comunes en los conjuntos de datos de eventos
Los siguientes son algunos de los problemas comunes con los que se enfrenta Amazon Fraud Detector al validar un conjunto de datos de eventos. Después de ejecutar el generador de perfiles de datos, utilice esta lista para comprobar si hay errores en el conjunto de datos antes de crear el modelo.
El archivo CSV no tiene ese UTF-8 formato.
La cantidad de eventos en el conjunto de datos es inferior a 100.
El número de eventos identificados como fraudulentos o legítimos es inferior a 50.
El número de entidades únicas asociadas a un evento de fraude es inferior a 100.
Más del 0,1% de los valores de EVENT_TIMESTAMP contienen valores nulos o valores distintos de los formatos admitidos. date/timestamp
Más del 1% de los valores de EVENT_LABEL contienen valores nulos o distintos de los definidos en el tipo de evento.
Hay menos de dos variables disponibles para el entrenamiento del modelo.
Almacenamiento de conjuntos de datos
Después de recopilar el conjunto de datos, lo almacena internamente con Amazon Fraud Detector o externamente con Amazon Simple Storage Service (Amazon S3). Le recomendamos que elija dónde almacenar su conjunto de datos en función del modelo que utilice para generar predicciones de fraude. Para obtener más información sobre los tipos de modelo, consulta Elegir un tipo de modelo. Para obtener más información sobre cómo almacenar el conjunto de datos, consulteAlmacenamiento de datos de eventos.