Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Privacy-enhanced Generierung synthetischer Datensätze
Ein synthetischer Datensatz hat ähnliche statistische Eigenschaften wie der ursprüngliche Datensatz, auf dem er basiert, enthält jedoch nicht die realen Beobachtungen, die im Originaldatensatz enthalten sind. Durch die Verwendung von synthetischen Datensätzen mit verstärktem Datenschutz können Sie neue Anwendungsfälle für das Training von Modellen des maschinellen Lernens (ML) erschließen, die zuvor durch Datenschutzbedenken verhindert wurden. Wenn Sie einen ML-Eingabekanal erstellen, können Sie synthetische Daten generieren, um vertrauliche Informationen beim Training von ML-Modellen zu schützen.
Wenn Sie eine Vorlage mit synthetischen Daten erstellen, müssen Sie:
-
Erfordern Sie, dass die Vorlagenausgabe synthetisch ist
-
Klassifizieren Sie die Spalten des Ausgabeschemas als numerisch oder kategorial
-
Passen Sie synthetische Daten an die Bedürfnisse des Unternehmens an
-
Passen Sie die Datenschutzeinstellungen an:
-
Datenschutzstufe festlegen (Epsilon)
-
Datenschutzschwelle konfigurieren
-
Warnung
Die Generierung synthetischer Daten schützt davor, individuelle Merkmale abzuleiten, unabhängig davon, ob bestimmte Personen im Originaldatensatz enthalten sind oder ob Lernmerkmale dieser Personen vorhanden sind. Sie verhindert jedoch nicht, dass literale Werte aus dem ursprünglichen Datensatz, einschließlich personenbezogener Daten (PII), im synthetischen Datensatz erscheinen.
Wir empfehlen, Werte im Eingabedatensatz zu vermeiden, die nur einer betroffenen Person zugeordnet sind, da diese eine betroffene Person möglicherweise erneut identifizieren. Wenn beispielsweise nur ein Benutzer in einer Postleitzahl lebt, würde das Vorhandensein dieser Postleitzahl im synthetischen Datensatz bestätigen, dass dieser Benutzer im ursprünglichen Datensatz war. Techniken wie das Kürzen hochgenauer Werte oder das Ersetzen ungewöhnlicher Kataloge durch andere können verwendet werden, um dieses Risiko zu mindern. Diese Transformationen können Teil der Abfrage sein, die zur Erstellung des ML-Eingabekanals verwendet wird.
Weitere Informationen zum Generieren synthetischer Daten für das Training benutzerdefinierter Modelle finden Sie unterErstellen einer SQL-Analysevorlage.
Analysevorlagen mit synthetischen Ausgaben können nur zum Erstellen von ML-Eingabekanälen verwendet werden. Weitere Informationen finden Sie unter Erstellen eines ML-Eingabekanals in AWS Clean Rooms ML.