View a markdown version of this page

Métriques d'évaluation du modèle AWS Clean Rooms ML - AWS Clean Rooms

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Métriques d'évaluation du modèle AWS Clean Rooms ML

Clean Rooms ML calcule le score de rappel et de pertinence pour déterminer les performances de votre modèle. Recall compare la similitude entre les données similaires et les données d'entraînement. Le score de pertinence est utilisé pour décider de la taille de l'audience, et non pour déterminer si le modèle est performant.

Le rappel est une mesure impartiale de la similitude entre le segment similaire et les données d'entraînement. Le rappel est le pourcentage des utilisateurs les plus similaires (par défaut, les 20 % les plus similaires) à partir d'un échantillon de données de formation incluses dans l'audience de départ par la tâche de génération d'audience. Les valeurs sont comprises entre 0 et 1, les valeurs les plus élevées indiquent une meilleure audience. Une valeur de rappel approximativement égale au pourcentage maximum de bacs indique que le modèle d'audience est équivalent à une sélection aléatoire.

Nous considérons qu'il s'agit d'un meilleur indicateur d'évaluation que l'exactitude, la précision et les scores F1, car Clean Rooms ML n'a pas étiqueté avec précision les utilisateurs réellement négatifs lors de la création de son modèle.

Segment-level le score de pertinence est une mesure de similitude avec des valeurs allant de -1 (le moins similaire) à 1 (le plus similaire). Clean Rooms ML calcule un ensemble de scores de pertinence pour différentes tailles de segments afin de vous aider à déterminer la meilleure taille de segment pour vos données. Les scores de pertinence diminuent de façon monotone à mesure que la taille du segment augmente. Ainsi, à mesure que la taille du segment augmente, elle peut être moins similaire aux données de départ. Lorsque le score de pertinence au niveau du segment atteint 0, le modèle prédit que tous les utilisateurs du segment similaire proviennent de la même distribution que les données de départ. L'augmentation de la taille de sortie est susceptible d'inclure les utilisateurs du segment similaire qui ne proviennent pas de la même distribution que les données de départ.

Les scores de pertinence sont normalisés au sein d'une même campagne et ne doivent pas être utilisés pour comparer les différentes campagnes. Les scores de pertinence ne doivent pas être utilisés comme une source unique de preuve d'un résultat commercial, car ceux-ci sont influencés par de multiples facteurs complexes en plus de la pertinence, tels que la qualité des stocks, le type d'inventaire, le moment de la publicité, etc.

Les scores de pertinence ne doivent pas être utilisés pour juger de la qualité de la graine, mais plutôt pour savoir si elle peut être augmentée ou diminuée. Considérez les exemples suivants :

  • Tous les scores positifs : cela indique qu'il y a plus d'utilisateurs de sortie dont la similarité est prévue que le nombre d'utilisateurs inclus dans le segment similaire. Cela est courant pour les données sur les semences qui font partie d'un vaste marché, comme toutes les personnes qui ont acheté du dentifrice le mois dernier. Nous vous recommandons d'examiner les données relatives aux semences de moindre envergure, par exemple toutes les personnes ayant acheté du dentifrice plus d'une fois au cours du mois dernier.

  • Tous les scores sont négatifs ou négatifs pour la taille de segment similaire souhaitée : cela indique que Clean Rooms ML prédit qu'il n'y a pas assez d'utilisateurs similaires dans la taille de segment similaire souhaitée. Cela peut être dû au fait que les données sur les semences sont trop spécifiques ou que le marché est trop restreint. Nous recommandons soit d'appliquer moins de filtres aux données sur les semences, soit d'élargir le marché. Par exemple, si les données initiales concernaient des clients ayant acheté une poussette et un siège auto, vous pourriez élargir le marché aux clients ayant acheté plusieurs produits pour bébés.

Les fournisseurs de données de formation déterminent si les scores de pertinence sont exposés et les catégories dans lesquelles les scores de pertinence sont calculés.