Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Privacy-enhanced generazione di set di dati sintetici
Un set di dati sintetici ha proprietà statistiche simili al set di dati originale su cui si basa, ma non contiene le osservazioni del mondo reale presenti nel set di dati originale. Utilizzando set di dati sintetici ottimizzati per la privacy, puoi sbloccare nuovi casi d'uso di training su modelli di machine learning (ML) che i problemi di privacy dei dati in precedenza erano evitati. Quando si crea un canale di input ML, è possibile generare dati sintetici per proteggere le informazioni sensibili durante l'addestramento dei modelli ML.
Quando si crea un modello con dati sintetici, è necessario:
-
Richiedi che l'output del modello sia sintetico
-
Classifica le colonne dello schema di output come numeriche o categoriali
-
Personalizza i dati sintetici in base alle esigenze organizzative
-
Modifica le impostazioni sulla privacy:
-
Imposta il livello di privacy (epsilon)
-
Configura la soglia di privacy
-
avvertimento
La generazione di dati sintetici impedisce di dedurre attributi individuali, indipendentemente dalla presenza di individui specifici nel set di dati originale o dalla presenza di attributi di apprendimento di tali individui. Tuttavia, non impedisce la visualizzazione di valori letterali del set di dati originale, comprese le informazioni di identificazione personale (PII) nel set di dati sintetici.
Si consiglia di evitare nel set di dati di input valori associati a un solo interessato perché potrebbero identificare nuovamente un interessato. Ad esempio, se un solo utente vive in un codice postale, la presenza di quel codice postale nel set di dati sintetici confermerebbe che l'utente si trovava nel set di dati originale. Tecniche come il troncamento di valori ad alta precisione o la sostituzione di cataloghi non comuni con altri possono essere utilizzate per mitigare questo rischio. Queste trasformazioni possono far parte dell'interrogazione utilizzata per creare il canale di ingresso ML.
Per ulteriori informazioni su come generare dati sintetici per l'addestramento di modelli personalizzati, vedereCreazione di un modello di analisi SQL.
I modelli di analisi con output sintetici possono essere utilizzati solo per creare canali di input ML. Per ulteriori informazioni, consulta Creazione di un canale di input ML in AWS Clean Rooms ML.