Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Exigences en matière de données de formation pour Clean Rooms ML
Pour réussir à créer un modèle similaire, vos données d'entraînement doivent répondre aux exigences suivantes :
-
Les données de formation doivent être au format Parquet, CSV ou JSON.
Note
Les données Parquet compressées Zstandard (ZSTD) ne sont pas prises en charge.
-
Vos données d'entraînement doivent être cataloguées dans. AWS Glue Pour plus d'informations, consultez la section Démarrage avec le catalogue de données AWS Glue dans le Guide du AWS Glue développeur. Nous vous recommandons d'utiliser AWS Glue des robots d'exploration pour créer vos tables car le schéma est déduit automatiquement.
-
Le compartiment Amazon S3 qui contient les données d'entraînement et les données de départ se trouve dans la même AWS région que vos autres ressources Clean Rooms ML.
-
Les données de formation doivent contenir au moins 100 000 identifiants utilisateur uniques comportant chacun au moins deux interactions entre éléments.
-
Les données d'entraînement doivent contenir au moins 1 million d'enregistrements.
-
Le schéma spécifié dans l'CreateTrainingDatasetaction doit correspondre au schéma défini lors de la création de la AWS Glue table.
-
Les champs obligatoires, tels que définis dans le tableau fourni, sont définis dans l'CreateTrainingDatasetaction.
Type de champ Types de données pris en charge Obligatoire Description USER_ID chaîne, int, bigint Oui Un identifiant unique pour chaque utilisateur de l'ensemble de données. Il doit s'agir d'une valeur d'information non personnellement identifiable (PII). Il peut s'agir d'un identifiant haché ou d'un identifiant client. ITEM_ID chaîne, int, bigint Oui Un identifiant unique pour chaque élément avec lequel un utilisateur interagit. TIMESTAMP bigint, int, horodatage Oui Heure à laquelle un utilisateur a interagi avec l'élément. Les valeurs doivent être au format d'époque Unix en secondes. FONCTIONNALITÉ_CATÉGORIELLE chaîne, entier, flottant, bigint, double, booléen, tableau Non Capture les données catégorielles relatives à l'utilisateur ou à l'élément. Cela peut inclure des éléments tels qu'un type d'événement (tel qu'un clic ou un achat), les données démographiques des utilisateurs (tranche d'âge, sexe, anonymisé), la localisation de l'utilisateur (ville, pays, anonymisé), la catégorie d'article (comme les vêtements ou les appareils électroniques) ou la marque de l'article. CARACTÉRISTIQUE_NUMÉRIQUE double, float, int, bigint Non Capture les données numériques relatives à l'utilisateur ou à l'article. Cela peut inclure des éléments tels que l'historique des achats des utilisateurs (montant total dépensé), le prix de l'article, le nombre de fois qu'un article a été visité ou les évaluations des utilisateurs pour les articles. -
Vous pouvez éventuellement fournir jusqu'à 10 caractéristiques catégorielles ou numériques au total.
Voici un exemple d'ensemble de données d'entraînement valide au format CSV
USER_ID,ITEM_ID,TIMESTAMP,EVENT_TYPE(CATEGORICAL FEATURE),EVENT_VALUE (NUMERICAL FEATURE) 196,242,881250949,click,15 186,302,891717742,click,13 22,377,878887116,click,10 244,51,880606923,click,20 166,346,886397596,click,10