View a markdown version of this page

Event-Datensatz - Amazon Fraud Detector

Amazon Fraud Detector steht seit dem 7. November 2025 nicht mehr für Neukunden zur Verfügung. Funktionen, die denen von Amazon Fraud Detector ähneln SageMaker AutoGluon, finden Sie unter Amazon und AWS WAF.

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Event-Datensatz

Ein Ereignisdatensatz besteht aus historischen Betrugsdaten für Ihr Unternehmen. Sie stellen diese Daten Amazon Fraud Detector zur Verfügung, um Modelle zur Betrugserkennung zu erstellen.

Amazon Fraud Detector verwendet Modelle für maschinelles Lernen zur Generierung von Betrugsvorhersagen. Jedes Modell wird mit einem Modelltyp trainiert. Der Modelltyp spezifiziert die Algorithmen und Transformationen, die für das Training des Modells verwendet werden. Beim Modelltraining wird anhand eines von Ihnen bereitgestellten Datensatzes ein Modell erstellt, das betrügerische Ereignisse vorhersagen kann. Weitere Informationen finden Sie unter So funktioniert Amazon Fraud Detector

Der Datensatz, der für die Erstellung eines Betrugserkennungsmodells verwendet wurde, enthält Einzelheiten zu einem Ereignis. Ein Ereignis ist eine geschäftliche Aktivität, die auf Betrugsrisiken überprüft wird. Beispielsweise kann eine Kontoregistrierung ein Ereignis sein. Bei den Daten, die mit dem Kontoregistrierungsereignis verknüpft sind, kann es sich um einen Ereignisdatensatz handeln. Amazon Fraud Detector verwendet diesen Datensatz, um Betrug bei der Kontoregistrierung zu bewerten.

Bevor Sie Amazon Fraud Detector Ihren Datensatz zur Erstellung eines Modells zur Verfügung stellen, stellen Sie sicher, dass Sie Ihr Ziel für die Modellerstellung definieren. Sie müssen auch festlegen, wie Sie das Modell verwenden möchten, und Ihre Metriken definieren, um zu beurteilen, ob das Modell Ihren spezifischen Anforderungen entspricht.

Ihre Ziele bei der Erstellung eines Betrugserkennungsmodells, das Betrug bei der Kontoregistrierung bewertet, können beispielsweise folgende sein:

  • Um legitime Registrierungen automatisch zu genehmigen.

  • Um betrügerische Registrierungen zur späteren Untersuchung zu erfassen.

Nachdem Sie Ihr Ziel festgelegt haben, müssen Sie im nächsten Schritt entscheiden, wie Sie das Modell verwenden möchten. Im Folgenden finden Sie einige Beispiele für die Verwendung des Betrugserkennungsmodells zur Bewertung von Registrierungsbetrug:

  • Zur Betrugserkennung in Echtzeit bei jeder Kontoregistrierung.

  • Zur stündlichen Offline-Auswertung aller Kontoregistrierungen.

Einige Beispiele für Metriken, die zur Messung der Leistung des Modells verwendet werden können, umfassen die folgenden:

  • Die Leistung in der Produktion ist durchweg besser als der aktuelle Ausgangswert.

  • Erfasst Betrugsanmeldungen von X% mit einer Falschalarmquote von Y%

  • Akzeptiert bis zu 5% der automatisch genehmigten Registrierungen, die betrügerisch sind.

Struktur des Event-Datensatzes

Amazon Fraud Detector verlangt, dass Sie Ihren Event-Datensatz in einer Textdatei mit kommagetrennten Werten (CSV) im UTF-8 Format angeben. Die erste Zeile Ihrer CSV-Datensatzdatei muss Dateiüberschriften enthalten. Der Dateiheader besteht aus Ereignismetadaten und Ereignisvariablen, die jedes Datenelement beschreiben, das mit dem Ereignis verknüpft ist. Auf den Header folgen Ereignisdaten. Jede Zeile besteht aus Datenelementen eines einzelnen Ereignisses.

  • Event-Metadaten — stellen Informationen über das Ereignis bereit. EVENT_TIMESTAMP ist beispielsweise eine Ereignismetadate, die den Zeitpunkt des Eintritts des Ereignisses angibt. Abhängig von Ihrem geschäftlichen Anwendungsfall und dem Modelltyp, der für die Erstellung und Schulung Ihres Betrugserkennungsmodells verwendet wird, verlangt Amazon Fraud Detector, dass Sie bestimmte Event-Metadaten angeben. Verwenden Sie bei der Angabe von Event-Metadaten in Ihrem CSV-Datei-Header denselben Namen für die Event-Metadaten, der von Amazon Fraud Detector angegeben wurde, und verwenden Sie nur Großbuchstaben.

  • Ereignisvariable — steht für die für Ihr Ereignis spezifischen Datenelemente, die Sie für die Erstellung und Schulung Ihres Betrugserkennungsmodells verwenden möchten. Abhängig von Ihrem geschäftlichen Anwendungsfall und dem Modelltyp, der für die Erstellung und Schulung eines Betrugserkennungsmodells verwendet wird, verlangt oder empfiehlt Amazon Fraud Detector möglicherweise, dass Sie bestimmte Ereignisvariablen angeben. Sie können optional auch andere Ereignisvariablen aus Ihrem Ereignis angeben, die Sie in das Training des Modells einbeziehen möchten. Einige Beispiele für Ereignisvariablen für ein Online-Registrierungsereignis können E-Mail-Adresse, IP-Adresse und Telefonnummer sein. Wenn Sie den Namen der Veranstaltungsvariablen in Ihrem CSV-Datei-Header angeben, verwenden Sie einen beliebigen Variablennamen Ihrer Wahl und verwenden Sie nur Kleinbuchstaben.

  • Veranstaltungsdaten — stellen die Daten dar, die im Rahmen des tatsächlichen Ereignisses erfasst wurden. In Ihrer CSV-Datei besteht jede Zeile, die auf den Dateiheader folgt, aus Datenelementen eines einzelnen Ereignisses. In einer Datendatei für ein Online-Registrierungsereignis enthält beispielsweise jede Zeile Daten aus einer einzelnen Registrierung. Jedes Datenelement in der Zeile muss mit den entsprechenden Event-Metadaten oder der Eventvariablen übereinstimmen.

Das Folgende ist ein Beispiel für eine CSV-Datei, die Daten aus einem Kontoregistrierungsereignis enthält. Die Kopfzeile enthält sowohl Ereignismetadaten in Großbuchstaben als auch Ereignisvariablen in Kleinbuchstaben, gefolgt von den Ereignisdaten. Jede Zeile im Datensatz enthält Datenelemente, die mit der Registrierung eines einzelnen Kontos verknüpft sind, wobei jedes Datenelement dem Header entspricht.

CSV-Datei mit einer Kopfzeile, die Event-Metadaten und Variablen anzeigt, gefolgt von Zeilen mit Eventdaten.

Rufen Sie die Anforderungen an Event-Datensätze mithilfe des Datenmodell-Explorers ab

Der Modelltyp, den Sie für die Erstellung Ihres Modells auswählen, definiert die Anforderungen an Ihren Datensatz. Amazon Fraud Detector verwendet den von Ihnen bereitgestellten Datensatz, um Ihr Modell zur Betrugserkennung zu erstellen und zu trainieren. Bevor Amazon Fraud Detector mit der Erstellung Ihres Modells beginnt, prüft es, ob der Datensatz die Anforderungen an Größe, Format und andere Anforderungen erfüllt. Wenn der Datensatz die Anforderungen nicht erfüllt, schlagen die Modellerstellung und das Training fehl. Sie können den Datenmodell-Explorer verwenden, um einen Modelltyp zu identifizieren, der für Ihren geschäftlichen Anwendungsfall verwendet werden soll, und um Einblicke in die Datensatzanforderungen für den identifizierten Modelltyp zu gewinnen.

Datenmodelle-Explorer

Der Datenmodell-Explorer ist ein Tool in der Amazon Fraud Detector-Konsole, das Ihren geschäftlichen Anwendungsfall an den von Amazon Fraud Detector unterstützten Modelltyp anpasst. Der Datenmodell-Explorer bietet auch Einblicke in die Datenelemente, die Amazon Fraud Detector zur Erstellung Ihres Betrugserkennungsmodells benötigt. Bevor Sie mit der Vorbereitung Ihres Event-Datensatzes beginnen, verwenden Sie den Datenmodell-Explorer, um herauszufinden, welchen Modelltyp Amazon Fraud Detector für Ihre geschäftliche Nutzung empfiehlt. Außerdem erhalten Sie eine Liste der obligatorischen, empfohlenen und optionalen Datenelemente, die Sie für die Erstellung Ihres Datensatzes benötigen.

Um den Datenmodell-Explorer zu verwenden,
  1. Öffnen Sie die AWS -Management-Konsole und melden Sie sich bei Ihrem Konto an. Navigieren Sie zu Amazon Fraud Detector.

  2. Wählen Sie im linken Navigationsbereich den Datenmodell-Explorer aus.

  3. Wählen Sie auf der Explorer-Seite für Datenmodelle unter Geschäftlicher Anwendungsfall den Geschäftsanwendungsfall aus, den Sie auf Betrugsrisiken hin untersuchen möchten.

  4. Amazon Fraud Detector zeigt den empfohlenen Modelltyp an, der Ihrem geschäftlichen Anwendungsfall entspricht. Der Modelltyp definiert die Algorithmen, Erweiterungen und Transformationen, die Amazon Fraud Detector verwendet, um Ihr Betrugserkennungsmodell zu trainieren.

    Notieren Sie sich den empfohlenen Modelltyp. Sie benötigen ihn später, wenn Sie Ihr Modell erstellen.

    Anmerkung

    Wenn Sie Ihren geschäftlichen Anwendungsfall nicht finden, verwenden Sie den Link „Kontaktieren Sie uns“ in der Beschreibung, um uns die Details Ihres geschäftlichen Anwendungsfalls mitzuteilen. Wir empfehlen Ihnen den Modelltyp, den Sie für die Erstellung eines Betrugserkennungsmodells für Ihren geschäftlichen Anwendungsfall verwenden sollten.

  5. Der Bereich „Einblicke in das Datenmodell“ bietet einen Einblick in die obligatorischen, empfohlenen und optionalen Datenelemente, die für die Erstellung und Schulung eines Betrugserkennungsmodells für Ihren geschäftlichen Anwendungsfall erforderlich sind. Verwenden Sie die Informationen im Bereich „Einblicke“, um Ihre Veranstaltungsdaten zu sammeln und Ihren Datensatz zu erstellen.

Sammeln Sie Eventdaten

Das Sammeln Ihrer Eventdaten ist ein wichtiger Schritt bei der Erstellung Ihres Modells. Das liegt daran, dass die Leistung Ihres Modells bei der Betrugsprognose von der Qualität Ihres Datensatzes abhängt. Wenn Sie mit der Erfassung Ihrer Ereignisdaten beginnen, sollten Sie die Liste der Datenelemente berücksichtigen, die Ihnen der Datenmodell-Explorer für die Erstellung Ihres Datensatzes bereitgestellt hat. Sie müssen alle obligatorischen Daten (Event-Metadaten) sammeln und entscheiden, welche empfohlenen und optionalen Datenelemente (Ereignisvariablen) Sie auf der Grundlage Ihrer Ziele für die Modellerstellung einbeziehen möchten. Es ist auch wichtig, das Format jeder Ereignisvariablen, die Sie einbeziehen möchten, und die Gesamtgröße Ihres Datensatzes festzulegen.

Qualität des Event-Datensatzes

Um qualitativ hochwertige Datensätze für Ihr Modell zu sammeln, empfehlen wir Folgendes:

  • Erfassung ausgereifter Daten — Die Verwendung der neuesten Daten hilft dabei, das neueste Betrugsmuster zu identifizieren. Um Betrugsfälle zu erkennen, sollten Sie die Daten jedoch erst reifen lassen. Die Laufzeit hängt von Ihrem Unternehmen ab und kann zwischen zwei Wochen und drei Monaten dauern. Wenn Ihre Veranstaltung beispielsweise eine Kreditkartentransaktion beinhaltet, kann die Fälligkeit der Daten durch die Rückbuchungsfrist der Kreditkarte oder die Zeit bestimmt werden, die ein Prüfer für die Feststellung benötigt hat.

    Stellen Sie sicher, dass der Datensatz, der für das Training des Modells verwendet wurde, gemäß Ihrem Unternehmen ausreichend Zeit hatte, um ausgereift zu sein.

  • Stellen Sie sicher, dass die Datenverteilung nicht wesentlich schwankt. Der Amazon Fraud Detector-Modelltrainingsprozess nimmt Stichproben und partitioniert Ihren Datensatz auf der Grundlage von EVENT_TIMESTAMP. Wenn Ihr Datensatz beispielsweise aus Betrugsereignissen der letzten 6 Monate besteht, aber nur der letzte Monat legitimer Ereignisse enthalten ist, wird die Datenverteilung als schwankend und instabil angesehen. Ein instabiler Datensatz kann zu Verzerrungen bei der Bewertung der Modellleistung führen. Wenn Sie feststellen, dass die Datenverteilung erheblich schwankt, sollten Sie erwägen, Ihren Datensatz auszugleichen, indem Sie Daten sammeln, die der aktuellen Datenverteilung ähneln.

  • Stellen Sie sicher, dass der Datensatz für den Anwendungsfall repräsentativ ist, in dem sich das Modell befindet implemented/tested. Andernfalls könnte die geschätzte Leistung verzerrt sein. Nehmen wir an, Sie verwenden ein Modell, um alle internen Bewerber automatisch abzulehnen, aber Ihr Modell wird mit einem Datensatz trainiert, der historische Daten enthält, data/labels die zuvor genehmigt wurden. Dann ist die Bewertung Ihres Modells möglicherweise ungenau, da die Bewertung auf dem Datensatz basiert, der keine Angaben zu abgelehnten Bewerbern enthält.

Format der Veranstaltungsdaten

Amazon Fraud Detector wandelt die meisten Ihrer Daten im Rahmen des Modelltrainingsprozesses in das erforderliche Format um. Es gibt jedoch einige Standardformate, die Sie problemlos für die Bereitstellung Ihrer Daten verwenden können, um Probleme zu vermeiden, die später auftreten, wenn Amazon Fraud Detector Ihren Datensatz validiert. Die folgende Tabelle enthält Hinweise zu den Formaten für die Bereitstellung der empfohlenen Veranstaltungsmetadaten.

Anmerkung

Achten Sie beim Erstellen Ihrer CSV-Datei darauf, den Namen der Event-Metadaten wie unten aufgeführt in Großbuchstaben einzugeben.

Name der Metadaten Format Erforderlich

EVENT_ID

Falls angegeben, muss es die folgenden Anforderungen erfüllen:

  • Es ist einzigartig für diese Veranstaltung.

  • Es stellt Informationen dar, die für Ihr Unternehmen von Bedeutung sind.

  • Es folgt dem Muster regulärer Ausdrücke (zum Beispiel ^[0-9a-z_-]+$.)

  • Zusätzlich zu den oben genannten Anforderungen empfehlen wir, keinen Zeitstempel an die EVENT_ID anzuhängen. Dies kann zu Problemen führen, wenn Sie das Ereignis aktualisieren. Dies liegt daran, dass Sie in diesem Fall genau dieselbe EVENT_ID angeben müssen.

Hängt vom Modelltyp ab

EVENT_TIMESTAMP

  • Es muss in einem der folgenden Formate angegeben werden:

    • %yyyy-%mm-%ddt%HH: %mm: %ssZ (ISO 8601-Standard nur in UTC ohne Millisekunden)

      Beispiel: 30.11.2019 T13:01:01Z

    • %yyyy/%mm/%dd %h: %mm: %s () AM/PM

      Beispiele 2019/11: /30 13:01:01 PM oder /30 13:01:01 2019/11

    • %mm/%dd/%yyyy %h: %mm: %s

      Beispiele: /2019 13:01:01 PM, /2019 11/30 13:01:01 11/30

    • %mm/%dd/%yy %h: %mm: %s

      Beispiele 11/30: /19 13:01:01 PM, /19 13:01:01 11/30

  • Amazon Fraud Detector geht beim Analysieren von Formaten nach Zeitstempeln von Ereignissen von den folgenden Annahmen aus: date/timestamp

    • Wenn Sie den ISO 8601-Standard verwenden, muss dieser exakt mit der vorherigen Spezifikation übereinstimmen

    • Wenn Sie eines der anderen Formate verwenden, gibt es zusätzliche Flexibilität:

      • Für Monate und Tage können Sie ein- oder zweistellige Zahlen angeben. Beispielsweise ist 1/12 /2019 ein gültiges Datum.

      • Sie müssen hh:mm:ss nicht angeben, wenn Sie sie nicht haben (das heißt, Sie können einfach ein Datum angeben). Sie können auch nur eine Teilmenge von Stunden und Minuten angeben (z. B. hh:mm). Nur die Angabe von Stunden wird nicht unterstützt. Millisekunden werden ebenfalls nicht unterstützt.

      • Wenn Sie AM/PM Beschriftungen angeben, wird von einer 12-Stunden-Uhr ausgegangen. Wenn keine AM/PM Informationen vorliegen, wird von einer 24-Stunden-Uhr ausgegangen.

      • Sie können „/“ oder „-“ als Trennzeichen für die Datumselemente verwenden. Für die Zeitstempelelemente wird von „:“ ausgegangen.

Ja

ENTITY_ID

  • Es muss dem Muster für reguläre Ausdrücke folgen:. ^[0-9A-Za-z_.@+-]+$

  • Wenn die Entitäts-ID zum Zeitpunkt der Bewertung nicht verfügbar ist, geben Sie die Entitäts-ID als unbekannt an.

Hängt vom Modelltyp ab

ENTITY_TYPE

Sie können eine beliebige Zeichenfolge verwenden

Hängt vom Modelltyp ab

EVENT_LABEL

Sie können beliebige Bezeichnungen verwenden, z. B. „Betrug“, „legitim“, „1" oder „0".

Erforderlich, wenn LABEL_TIMESTAMP enthalten ist

LABEL_TIMESTAMP

Es muss dem Zeitstempelformat folgen.

Erforderlich, wenn EVENT_LABEL enthalten ist

Hinweise zu Ereignisvariablen finden Sie unter Variablen.

Wichtig

Wenn Sie ein ATI-Modell (Account Takeover Insights) erstellen, finden Sie weitere Informationen Vorbereiten von Daten zur Vorbereitung und Auswahl von Daten unter.

Null oder fehlende Werte

Die Variablen EVENT_TIMESTAMP und EVENT_LABEL dürfen keine Nullwerte oder fehlende Werte enthalten. Sie können Nullwerte oder fehlende Werte für andere Variablen haben. Wir empfehlen jedoch, für diese Variablen nur eine kleine Zahl von Nullen zu verwenden. Wenn Amazon Fraud Detector feststellt, dass zu viele Nullwerte oder fehlende Werte für eine Ereignisvariable vorhanden sind, wird die Variable automatisch aus Ihrem Modell weggelassen.

Mindestanzahl an Variablen

Wenn Sie Ihr Modell erstellen, muss das Dataset zusätzlich zu den erforderlichen Ereignismetadaten mindestens zwei Ereignisvariablen enthalten. Die beiden Ereignisvariablen müssen die Validierungsprüfung bestehen.

Größe des Event-Datensatzes

Erforderlich

Ihr Datensatz muss die folgenden grundlegenden Anforderungen für ein erfolgreiches Modelltraining erfüllen.

  • Daten von mindestens 100 Ereignissen.

  • Der Datensatz muss mindestens 50 Ereignisse (Zeilen) enthalten, die als betrügerisch eingestuft wurden.

Empfohlen

Für ein erfolgreiches Modelltraining und eine gute Modellleistung empfehlen wir, dass Ihr Datensatz Folgendes enthält.

  • Schließen Sie mindestens drei Wochen an historischen Daten ein, bestenfalls jedoch an Daten aus sechs Monaten.

  • Schließen Sie insgesamt mindestens 10.000 Ereignisdaten ein.

  • Schließen Sie mindestens 400 als betrügerisch eingestufte Ereignisse (Zeilen) und 400 als legitim eingestufte Ereignisse (Zeilen) ein.

  • Schließen Sie mehr als 100 eindeutige Entitäten ein, wenn Ihr Modelltyp ENTITY_ID erfordert.

Datensatzvalidierung

Bevor Amazon Fraud Detector mit der Erstellung Ihres Modells beginnt, prüft es, ob die Variablen, die im Datensatz für das Training des Modells enthalten sind, die Größe, das Format und andere Anforderungen erfüllen. Wenn der Datensatz die Validierung nicht besteht, wird das Modell nicht erstellt. Sie müssen zuerst die Variablen korrigieren, die die Validierung nicht bestanden haben, bevor Sie das Modell erstellen. Amazon Fraud Detector stellt Ihnen einen Datenprofiler zur Verfügung, mit dem Sie Probleme mit Ihrem Datensatz identifizieren und beheben können, bevor Sie mit dem Training Ihres Modells beginnen

Datenprofiler

Amazon Fraud Detector bietet ein Open-Source-Tool zur Profilerstellung und Vorbereitung Ihrer Daten für das Modelltraining. Mit diesem automatisierten Datenprofiler können Sie häufige Fehler bei der Datenvorbereitung vermeiden und potenzielle Probleme wie falsch zugeordnete Variablentypen identifizieren, die sich negativ auf die Modellleistung auswirken würden. Der Profiler generiert einen intuitiven und umfassenden Bericht über Ihren Datensatz, der Variablenstatistiken, Labelverteilung, kategoriale und numerische Analysen sowie Variablen- und Labelkorrelationen umfasst. Er bietet Anleitungen zu Variablentypen sowie eine Option zur Umwandlung des Datensatzes in ein Format, das Amazon Fraud Detector benötigt.

Verwenden des Datenprofilers

Der automatisierte Datenprofiler besteht aus einem AWS CloudFormation Stack, den Sie einfach mit wenigen Klicks starten können. Alle Codes sind auf Github verfügbar. Informationen zur Verwendung des Datenprofilers finden Sie in unserem Blog Trainiere Modelle schneller mit einem automatisierten Datenprofiler für Amazon Fraud Detector

Häufige Fehler im Event-Datensatz

Im Folgenden sind einige der häufigsten Probleme aufgeführt, auf die Amazon Fraud Detector bei der Validierung eines Ereignisdatensatzes stößt. Nachdem Sie den Datenprofiler ausgeführt haben, verwenden Sie diese Liste, um Ihren Datensatz auf Fehler zu überprüfen, bevor Sie Ihr Modell erstellen.

  • Die CSV-Datei hat das UTF-8 Format nicht.

  • Die Anzahl der Ereignisse im Datensatz ist weniger als 100.

  • Die Anzahl der Ereignisse, die als Betrug oder legitim identifiziert wurden, liegt unter 50.

  • Die Anzahl der eindeutigen Entitäten, die einem Betrugsereignis zugeordnet sind, liegt unter 100.

  • Mehr als 0,1% der Werte in EVENT_TIMESTAMP enthalten Nullen oder andere Werte als die unterstützten Formate. date/timestamp

  • Mehr als 1% der Werte in EVENT_LABEL enthalten Nullen oder andere als die im Ereignistyp definierten Werte.

  • Für das Modelltraining stehen weniger als zwei Variablen zur Verfügung.

Speicherung von Datensätzen

Nachdem Sie Ihren Datensatz erfasst haben, speichern Sie ihn intern mit Amazon Fraud Detector oder extern mit Amazon Simple Storage Service (Amazon S3). Wir empfehlen Ihnen, anhand des Modells, das Sie für die Generierung von Betrugsprognosen verwenden, auszuwählen, wo Ihr Datensatz gespeichert werden soll. Weitere Informationen zu Modelltypen finden Sie unter Wählen Sie einen Modelltyp. Weitere Informationen zum Speichern Ihres Datensatzes finden Sie unterSpeicherung von Veranstaltungsdaten.