Amazon Fraud Detector n'est plus ouvert aux nouveaux clients depuis le 7 novembre 2025. Pour des fonctionnalités similaires à celles d'Amazon Fraud Detector SageMaker, explorez Amazon AutoGluon, et AWS WAF.
Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Ensemble de données d'événements
Un ensemble de données d'événements est constitué des données historiques sur les fraudes de votre entreprise. Vous fournissez ces données à Amazon Fraud Detector pour créer des modèles de détection des fraudes.
Amazon Fraud Detector utilise des modèles d'apprentissage automatique pour générer des prévisions de fraude. Chaque modèle est entraîné à l'aide d'un type de modèle. Le type de modèle spécifie les algorithmes et les transformations utilisés pour entraîner le modèle. L'apprentissage des modèles consiste à utiliser un ensemble de données que vous fournissez pour créer un modèle capable de prédire les événements frauduleux. Pour plus d'informations, consultez Comment fonctionne Amazon Fraud Detector
L'ensemble de données utilisé pour créer un modèle de détection des fraudes fournit les détails d'un événement. Un événement est une activité commerciale évaluée pour le risque de fraude. Par exemple, l'enregistrement d'un compte peut être un événement. Les données associées à l'événement d'enregistrement du compte peuvent être un ensemble de données d'événements. Amazon Fraud Detector utilise cet ensemble de données pour évaluer les fraudes liées à l'enregistrement des comptes.
Avant de fournir votre ensemble de données à Amazon Fraud Detector pour créer un modèle, assurez-vous de définir votre objectif pour la création du modèle. Vous devez également déterminer la manière dont vous souhaitez utiliser le modèle et définir vos mesures pour évaluer si le modèle fonctionne en fonction de vos besoins spécifiques.
Par exemple, vos objectifs en matière de création d'un modèle de détection des fraudes évaluant les fraudes liées à l'enregistrement de comptes peuvent être les suivants :
Pour approuver automatiquement les inscriptions légitimes.
Capturer les inscriptions frauduleuses pour une enquête ultérieure.
Une fois que vous avez déterminé votre objectif, l'étape suivante consiste à décider de la manière dont vous souhaitez utiliser le modèle. Voici quelques exemples d'utilisation du modèle de détection des fraudes pour évaluer la fraude à l'enregistrement :
Pour une détection des fraudes en temps réel pour chaque enregistrement de compte.
Pour une évaluation hors ligne de tous les enregistrements de comptes toutes les heures.
Voici quelques exemples de mesures qui peuvent être utilisées pour mesurer les performances du modèle :
Performe constamment mieux que la référence actuelle en matière de production.
Capture X % d'enregistrements frauduleux avec un taux de faux positifs Y %.
Accepte jusqu'à 5 % des inscriptions frauduleuses approuvées automatiquement.
Structure du jeu de données d'événements
Amazon Fraud Detector exige que vous fournissiez votre ensemble de données d'événements dans un fichier texte en utilisant une valeur séparée par des virgules (CSV) au UTF-8 format. La première ligne de votre fichier de jeu de données CSV doit contenir des en-têtes de fichier. L'en-tête du fichier se compose de métadonnées d'événement et de variables d'événement qui décrivent chaque élément de données associé à l'événement. L'en-tête est suivi des données relatives à l'événement. Chaque ligne est composée d'éléments de données provenant d'un événement unique.
-
Métadonnées de l'événement : fournissent des informations sur l'événement. Par exemple, EVENT_TIMESTAMP est une métadonnée d'événement qui spécifie l'heure à laquelle l'événement s'est produit. En fonction de votre cas d'utilisation professionnel et du type de modèle utilisé pour créer et entraîner votre modèle de détection des fraudes, Amazon Fraud Detector vous demande de fournir des métadonnées d'événements spécifiques. Lorsque vous spécifiez des métadonnées d'événement dans l'en-tête de votre fichier CSV, utilisez le même nom de métadonnées d'événement que celui spécifié par Amazon Fraud Detector et utilisez uniquement des lettres majuscules.
-
Variable d'événement : représente les éléments de données spécifiques à votre événement que vous souhaitez utiliser pour créer et entraîner votre modèle de détection des fraudes. En fonction de votre cas d'utilisation professionnel et du type de modèle utilisé pour créer et entraîner un modèle de détection des fraudes, Amazon Fraud Detector peut vous demander ou vous recommander de fournir des variables d'événements spécifiques. Vous pouvez également éventuellement fournir d'autres variables d'événement issues de votre événement que vous souhaitez inclure dans l'entraînement du modèle. Voici quelques exemples de variables d'événement pour un événement d'inscription en ligne : adresse e-mail, adresse IP et numéro de téléphone. Lorsque vous spécifiez le nom de la variable d'événement dans l'en-tête de votre fichier CSV, utilisez le nom de variable de votre choix et utilisez uniquement des lettres minuscules.
-
Données relatives à l'événement : elles représentent les données collectées lors de l'événement réel. Dans votre fichier CSV, chaque ligne qui suit l'en-tête du fichier contient des éléments de données provenant d'un seul événement. Par exemple, dans un fichier de données d'inscription en ligne, chaque ligne contient les données d'une seule inscription. Chaque élément de données de la ligne doit correspondre aux métadonnées d'événement correspondantes ou à la variable d'événement.
Voici un exemple de fichier CSV contenant les données d'un événement d'enregistrement de compte. La ligne d'en-tête contient à la fois les métadonnées de l'événement en majuscules et les variables d'événement en minuscules, suivies des données de l'événement. Chaque ligne de l'ensemble de données contient des éléments de données associés à l'enregistrement d'un compte unique, chaque élément de données correspondant à l'en-tête.
Découvrez les exigences relatives aux jeux de données d'événements à l'aide de l'explorateur de modèles
Le type de modèle que vous choisissez pour créer votre modèle définit les exigences de votre jeu de données. Amazon Fraud Detector utilise l'ensemble de données que vous fournissez pour créer et entraîner votre modèle de détection des fraudes. Avant qu'Amazon Fraud Detector ne commence à créer votre modèle, il vérifie si le jeu de données répond à la taille, au format et à d'autres exigences. Si le jeu de données ne répond pas aux exigences, la création et l'apprentissage du modèle échouent. Vous pouvez utiliser l'explorateur de modèles de données pour identifier un type de modèle à utiliser pour votre cas d'utilisation métier et pour obtenir des informations sur les exigences en matière de jeu de données pour le type de modèle identifié.
Explorateur de modèles de données
L'explorateur de modèles de données est un outil de la console Amazon Fraud Detector qui aligne votre cas d'utilisation professionnelle sur le type de modèle pris en charge par Amazon Fraud Detector. L'explorateur de modèles de données fournit également des informations sur les éléments de données requis par Amazon Fraud Detector pour créer votre modèle de détection des fraudes. Avant de commencer à préparer votre jeu de données d'événements, utilisez l'explorateur de modèles de données pour déterminer le type de modèle qu'Amazon Fraud Detector recommande pour votre utilisation professionnelle et pour consulter la liste des éléments de données obligatoires, recommandés et facultatifs dont vous aurez besoin pour créer votre jeu de données.
Pour utiliser l'explorateur de modèles de données,
-
Ouvrez la console de gestion AWS
et connectez-vous à votre compte. Accédez à Amazon Fraud Detector. -
Dans le volet de navigation de gauche, sélectionnez Explorateur de modèles de données.
-
Sur la page de l'explorateur de modèles de données, sous Cas d'utilisation métier, sélectionnez le cas d'utilisation métier que vous souhaitez évaluer en termes de risque de fraude.
-
Amazon Fraud Detector affiche le type de modèle recommandé qui correspond à votre cas d'utilisation professionnelle. Le type de modèle définit les algorithmes, les enrichissements et les transformations qu'Amazon Fraud Detector utilisera pour entraîner votre modèle de détection des fraudes.
Prenez note du type de modèle recommandé. Vous en aurez besoin ultérieurement lors de la création de votre modèle.
Note
Si vous ne trouvez pas votre cas d'utilisation professionnel, utilisez le lien « Contactez-nous » dans la description pour nous fournir les détails de votre cas d'utilisation professionnel. Nous vous recommanderons le type de modèle à utiliser pour créer un modèle de détection des fraudes adapté à votre cas d'utilisation professionnel.
-
Le volet Informations sur les modèles de données fournit un aperçu des éléments de données obligatoires, recommandés et facultatifs nécessaires pour créer et entraîner un modèle de détection des fraudes pour votre cas d'utilisation professionnel. Utilisez les informations du volet Informations pour collecter les données de votre événement et créer votre ensemble de données.
Collectez les données des événements
La collecte des données relatives à votre événement est une étape importante dans la création de votre modèle. En effet, les performances de votre modèle en matière de prédiction de la fraude dépendent de la qualité de votre ensemble de données. Lorsque vous commencez à collecter les données de votre événement, gardez à l'esprit la liste des éléments de données que l'explorateur de modèles de données vous a fournis pour créer votre jeu de données. Vous devrez rassembler toutes les données obligatoires (métadonnées de l'événement) et décider quels éléments de données recommandés et facultatifs (variables d'événement) inclure en fonction de vos objectifs de création du modèle. Il est également important de décider du format de chaque variable d'événement que vous souhaitez inclure et de la taille totale de votre ensemble de données.
Qualité du jeu de données d'événements
Pour collecter un ensemble de données de haute qualité pour votre modèle, nous vous recommandons ce qui suit :
Collectez des données matures — L'utilisation des données les plus récentes permet d'identifier le modèle de fraude le plus récent. Toutefois, pour détecter les cas d'utilisation frauduleuse, laissez les données mûrir. La période d'échéance dépend de votre activité et peut aller de deux semaines à trois mois. Par exemple, si votre événement inclut une transaction par carte de crédit, la maturité des données peut être déterminée par la période de rétrofacturation de la carte de crédit ou par le temps nécessaire à un enquêteur pour prendre une décision.
Assurez-vous que l'ensemble de données utilisé pour entraîner le modèle a eu suffisamment de temps pour mûrir conformément à votre activité.
Assurez-vous que la distribution des données ne dérive pas de manière significative : Amazon Fraud Detector modélise le processus d'entraînement et partitionne votre ensemble de données en fonction de EVENT_TIMESTAMP. Par exemple, si votre ensemble de données se compose d'événements frauduleux extraits des 6 derniers mois, mais que seuls les événements légitimes du dernier mois sont inclus, la distribution des données est considérée comme étant variable et instable. Un ensemble de données instable peut entraîner des biais dans l'évaluation des performances du modèle. Si vous constatez que la distribution des données varie de manière significative, pensez à équilibrer votre ensemble de données en collectant des données similaires à la distribution de données actuelle.
Assurez-vous que l'ensemble de données est représentatif du cas d'utilisation dans lequel se trouve le modèle. Sinon, les performances estimées pourraient être biaisées. implemented/tested Supposons que vous utilisiez un modèle pour refuser automatiquement tous les candidats internes, mais que votre modèle soit entraîné à l'aide d'un ensemble de données contenant des historiques data/labels approuvés précédemment. Dans ce cas, l'évaluation de votre modèle peut être inexacte car elle est basée sur l'ensemble de données qui ne contient pas de représentation des candidats refusés.
Format de données d'événement
Amazon Fraud Detector transforme la plupart de vos données au format requis dans le cadre de son processus de formation des modèles. Cependant, il existe certains formats standard que vous pouvez facilement utiliser pour fournir vos données afin d'éviter des problèmes ultérieurement lorsque Amazon Fraud Detector validera votre ensemble de données. Le tableau suivant fournit des conseils sur les formats à utiliser pour fournir les métadonnées d'événements recommandées.
Note
Lorsque vous créez votre fichier CSV, veillez à saisir le nom des métadonnées de l'événement comme indiqué ci-dessous, en majuscules.
| Nom des métadonnées | Format | Obligatoire |
|---|---|---|
|
IDENTIFIANT DE L'ÉVÉNEMENT |
S'il est fourni, il doit répondre aux exigences suivantes :
|
Dépend du type de modèle |
|
HORODATAGE DE L'ÉVÉNEMENT |
|
Oui |
|
IDENTIFIANT_ENTITÉ |
|
Dépend du type de modèle |
|
TYPE_D'ENTITÉ |
Vous pouvez utiliser n'importe quelle chaîne |
Dépend du type de modèle |
|
ÉTIQUET_ÉVÉNEMENT |
Vous pouvez utiliser n'importe quelle étiquette, telle que « fraude », « légitime », « 1 » ou « 0 ». |
Obligatoire si LABEL_TIMESTAMP est inclus |
|
LABEL_TIMESTAMP |
Il doit respecter le format d'horodatage. |
Obligatoire si EVENT_LABEL est inclus |
Pour plus d'informations sur les variables d'événement, voir Variables.
Important
Si vous créez un modèle Account Takeover Insights (ATI), consultez Préparation des données pour plus de détails sur la préparation et la sélection des données.
Valeurs nulles ou manquantes
Les variables EVENT_TIMESTAMP et EVENT_LABEL ne doivent contenir aucune valeur nulle ou manquante. Vous pouvez avoir des valeurs nulles ou manquantes pour d'autres variables. Cependant, nous vous recommandons de n'utiliser qu'un petit nombre de valeurs nulles pour ces variables. Si Amazon Fraud Detector détermine qu'il y a trop de valeurs nulles ou manquantes pour les variables d'un événement, il omet automatiquement cette variable de votre modèle.
Variables minimales
Lorsque vous créez votre modèle, le jeu de données doit inclure au moins deux variables d'événement en plus des métadonnées d'événement requises. Les deux variables d'événement doivent réussir le contrôle de validation.
Taille du jeu de données d'événements
Obligatoire
Votre jeu de données doit répondre aux exigences de base suivantes pour réussir l'apprentissage des modèles.
-
Données relatives à au moins 100 événements.
-
L'ensemble de données doit inclure au moins 50 événements (lignes) classés comme frauduleux.
Recommandée
Nous vous recommandons d'inclure dans votre jeu de données les éléments suivants pour un apprentissage réussi du modèle et une bonne performance du modèle.
-
Incluez au moins trois semaines de données historiques, mais au mieux six mois de données.
-
Incluez un minimum de 10 000 données d'événements au total.
-
Incluez au moins 400 événements (lignes) classés comme frauduleux et 400 événements (lignes) classés comme légitimes.
-
Incluez plus de 100 entités uniques, si votre type de modèle nécessite ENTITY_ID.
Validation d’un jeu de données
Avant qu'Amazon Fraud Detector ne commence à créer votre modèle, il vérifie si les variables incluses dans l'ensemble de données pour l'entraînement du modèle répondent à la taille, au format et à d'autres exigences. Si le jeu de données ne passe pas la validation, le modèle n'est pas créé. Vous devez d'abord corriger les variables qui n'ont pas réussi la validation avant de créer le modèle. Amazon Fraud Detector met à votre disposition un profileur de données que vous pouvez utiliser pour vous aider à identifier et à résoudre les problèmes liés à votre ensemble de données avant de commencer à entraîner votre modèle
Profileur de données
Amazon Fraud Detector fournit un outil open source permettant de profiler et de préparer vos données pour la formation des modèles. Ce profileur de données automatisé vous permet d'éviter les erreurs courantes de préparation des données et d'identifier les problèmes potentiels, tels que les types de variables mal mappés qui auraient un impact négatif sur les performances du modèle. Le profileur génère un rapport intuitif et complet de votre ensemble de données, comprenant des statistiques sur les variables, la distribution des étiquettes, une analyse catégorique et numérique et des corrélations entre variables et étiquettes. Il fournit des conseils sur les types de variables ainsi qu'une option permettant de transformer l'ensemble de données dans le format requis par Amazon Fraud Detector.
Utilisation du profileur de données
Le profileur de données automatisé est construit avec une AWS CloudFormation pile que vous pouvez facilement lancer en quelques clics. Tous les codes sont disponibles sur Github
Erreurs courantes du jeu de données d'événements
Voici quelques-uns des problèmes courants rencontrés par Amazon Fraud Detector lors de la validation d'un ensemble de données d'événements. Après avoir exécuté le profileur de données, utilisez cette liste pour vérifier la présence d'erreurs dans votre jeu de données avant de créer votre modèle.
Le fichier CSV n'est pas au UTF-8 format.
Le nombre d'événements contenus dans l'ensemble de données est inférieur à 100.
Le nombre d'événements identifiés comme frauduleux ou légitimes est inférieur à 50.
Le nombre d'entités uniques associées à un événement de fraude est inférieur à 100.
Plus de 0,1 % des valeurs de EVENT_TIMESTAMP contiennent des valeurs nulles ou des valeurs autres que les formats pris en charge. date/timestamp
Plus de 1 % des valeurs de EVENT_LABEL contiennent des valeurs nulles ou des valeurs autres que celles définies dans le type d'événement.
Moins de deux variables sont disponibles pour l'entraînement des modèles.
Stockage des ensembles de données
Une fois que vous avez rassemblé votre ensemble de données, vous le stockez en interne à l'aide d'Amazon Fraud Detector ou en externe avec Amazon Simple Storage Service (Amazon S3). Nous vous recommandons de choisir l'emplacement de stockage de votre ensemble de données en fonction du modèle que vous utilisez pour générer des prévisions de fraude. Pour plus d'informations sur les types de modèles, voir Choisir un type de modèle. Pour plus d'informations sur le stockage de votre ensemble de données, consultezStockage des données d'événements.