View a markdown version of this page

Utilisation de la formation incrémentielle dans AWS Clean Rooms ML - AWS Clean Rooms

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Utilisation de la formation incrémentielle dans AWS Clean Rooms ML

Prérequis :

  • Et Compte AWS avec accès à AWS Clean Rooms

  • Un modèle formé existant dans le cadre d'une collaboration

  • Un ensemble de données nouveau ou mis à jour pour un entraînement incrémentiel

  • Autorisations appropriées pour créer et gérer des modèles de machine learning dans le cadre de la collaboration

  • Connaissance des hyperparamètres et de la configuration du modèle existant

Grâce à l'entraînement incrémentiel, vous pouvez utiliser les artefacts d'un modèle existant et d'un jeu de données mis à jour pour entraîner un nouveau modèle. L'entraînement incrémentiel permet de gagner du temps et des ressources.

Employez l'entraînement incrémentiel pour :

  • Entraînez un nouveau modèle à l'aide d'un ensemble de données étendu dont le schéma sous-jacent n'a pas été pris en compte lors de l'entraînement précédent.

  • Entraînez plusieurs variantes d'un modèle, soit avec des hyperparamètres différents, soit en utilisant différents ensembles de données.

Console
Pour exécuter une tâche d'entraînement incrémentielle (console)
  1. Connectez-vous à Console de gestion AWS et ouvrez la AWS Clean Rooms console à l'adresse https://console.aws.amazon.com/cleanrooms.

  2. Dans le volet de navigation de gauche, choisissez Collaborations.

  3. Sur la page Collaborations, choisissez la collaboration dans laquelle existent les artefacts du modèle que vous souhaitez utiliser pour la formation incrémentielle.

  4. Une fois la collaboration ouverte, choisissez l'onglet Modèles ML.

  5. Sous Modèles ML personnalisés, dans la section Modèles entraînés, cliquez sur le bouton radio à côté du modèle entraîné que vous souhaitez entraîner de manière incrémentielle.

  6. Sur la page Aperçu, sous Versions,

    1. Cliquez sur le bouton radio à côté du modèle entraîné que vous souhaitez entraîner progressivement.

    2. Choisissez Train à partir de la version.

  7. Sur la page Créer un modèle entraîné à partir de la version, pour Version du modèle entraîné, choisissez la version.

    La version du modèle de base est automatiquement sélectionnée. Vous pouvez modifier cette version s'il en existe d'autres.

  8. Pour plus de détails sur le modèle Trained, entrez les informations suivantes :

    1. Dans le champ Nom, entrez un nom unique pour le modèle de la collaboration.

    2. (Facultatif) Dans Description, entrez une description du modèle entraîné.

    3. Pour le mode de saisie des données d'entraînement, choisissez l'une des options suivantes :

      • Sélectionnez Fichier si vous disposez d'un ensemble de données plus petit pouvant tenir sur le volume de stockage ML et si vous préférez un accès au système de fichiers traditionnel pour votre script de formation.

      • Sélectionnez Pipe pour les grands ensembles de données afin de diffuser des données directement depuis S3, évitant ainsi de tout télécharger sur disque, ce qui peut améliorer la vitesse d'apprentissage et réduire les besoins de stockage.

      • Sélectionnez FastFile cette option si vous souhaitez combiner les avantages du streaming depuis S3 avec l'accès au système de fichiers, en particulier pour les données lues de manière séquentielle ou pour traiter moins de fichiers pour accélérer les démarrages.

    4. Pour Nom du canal de formation incrémentiel, entrez un nom pour le canal de formation incrémentiel

      Note

      Si vous spécifiez le nom du canal de formation incrémentielle sans identifiant de version, le système utilise le modèle de base pour la formation incrémentielle.

  9. Pour plus de détails sur le canal d'entrée ML, procédez comme suit :

    1. Pour le canal d'entrée ML, spécifiez le canal d'entrée ML qui fournit les données à l'algorithme du modèle.

      Pour ajouter un autre canal, choisissez Ajouter un autre canal d'entrée ML. Vous pouvez ajouter jusqu'à 19 canaux d'entrée ML supplémentaires.

    2. Dans Nom du canal, entrez le nom du canal d'entrée ML.

    3. Pour le type de distribution de données Amazon S3, choisissez l'une des options suivantes :

      • Sélectionnez Entièrement répliqué pour fournir à chaque instance d'entraînement une copie complète de votre jeu de données. Cela fonctionne mieux lorsque votre ensemble de données est suffisamment petit pour tenir en mémoire ou lorsque chaque instance doit accéder à toutes les données.

      • Sélectionnez Sharded by S3 key pour diviser votre ensemble de données entre les instances d'entraînement en fonction des clés S3. Chaque instance reçoit environ 1/n du total des objets S3, où « n » est le nombre d'instances. Cela fonctionne mieux pour les grands ensembles de données que vous souhaitez traiter en parallèle.

      Note

      Tenez compte de la taille de votre ensemble de données et des exigences de formation lorsque vous sélectionnez un type de distribution. La réplication complète fournit un accès complet aux données mais nécessite davantage de stockage, tandis que la clé Sharded by S3 permet le traitement distribué de grands ensembles de données.

  10. Pour Durée d'entraînement maximale, choisissez la durée maximale pendant laquelle vous souhaitez entraîner votre modèle.

  11. Pour les hyperparamètres, spécifiez tous les paramètres spécifiques à l'algorithme et leurs valeurs prévues. Les hyperparamètres sont spécifiques au modèle en cours d'apprentissage et sont utilisés pour affiner l'entraînement du modèle.

  12. Pour les variables d'environnement, spécifiez toutes les variables spécifiques à l'algorithme et leurs valeurs prévues. Les variables d'environnement sont définies dans le conteneur Docker.

  13. Pour le chiffrement, pour utiliser un code personnalisé AWS KMS key, cochez la case Chiffrer le secret avec une clé KMS personnalisée.

  14. Pour la configuration des ressources EC2, spécifiez des informations sur les ressources de calcul utilisées pour l'apprentissage des modèles.

    1. Dans Type d'instance, choisissez le type d'instance que vous souhaitez exécuter.

    2. Dans le champ Nombre d'instances, entrez le nombre d'instances.

    3. Pour Taille du volume en Go, entrez la taille du volume de stockage ML.

  15. Choisissez Créer un modèle entraîné à partir de la version.

API

Pour exécuter une tâche de formation incrémentielle (API)

Exécutez le code suivant avec vos paramètres spécifiques :

import boto3 acr_ml_client= boto3.client('cleanroomsml') acr_ml_client.create_trained_model( membershipIdentifier= 'membership_id', configuredModelAlgorithmAssociationArn = 'arn:aws:cleanrooms-ml:region:account:membership/membershipIdentifier/configured-model-algorithm-association/identifier', name='trained_model_name', resourceConfig={ 'instanceType': 'ml.m5.xlarge', 'volumeSizeInGB': 1 }, incrementalTrainingDataChannels=[ { 'trainedModelArn': trained_model_arn, 'channelName': 'channel_name' }, ] dataChannels=[ { 'mlInputChannelArn': channel_arn_1, 'channelName': 'channel_name' }, { 'mlInputChannelArn': channel_arn_2, 'channelName': 'channel_name' } ] )
Note

Limite : maximum de 20 chaînes au total (y compris les deux dataChannels etincrementalTrainingDataChannels).

Note

Une fois le modèle entraîné créé, vous ne pouvez plus le modifier. Pour apporter des modifications, supprimez le modèle entraîné et créez-en un nouveau.