View a markdown version of this page

Utilizzo della formazione incrementale in AWS Clean Rooms ML - AWS Clean Rooms

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

Utilizzo della formazione incrementale in AWS Clean Rooms ML

Prerequisiti:

  • E con accesso a Account AWS AWS Clean Rooms

  • Un modello addestrato esistente in una collaborazione

  • Un set di dati nuovo o aggiornato per la formazione incrementale

  • Autorizzazioni appropriate per creare e gestire modelli ML in collaborazione

  • Familiarità con gli iperparametri e la configurazione del modello esistente

Con l'addestramento incrementale, puoi utilizzare gli artefatti di un modello esistente e un set di dati aggiornato per addestrare un nuovo modello. L’addestramento incrementale consente di risparmiare tempo e risorse.

Utilizza l’addestramento incrementale per:

  • Addestra un nuovo modello utilizzando un set di dati espanso con un modello sottostante che non era stato preso in considerazione nel training precedente.

  • Addestra diverse varianti di un modello, con iperparametri diversi o utilizzando set di dati diversi.

Console
Per eseguire un processo di formazione incrementale (console)
  1. Accedi a Console di gestione AWS e apri la AWS Clean Rooms console all'indirizzo https://console.aws.amazon.com/cleanrooms.

  2. Nel riquadro di navigazione a sinistra, scegli Collaborazioni.

  3. Nella pagina Collaborazioni, scegli la collaborazione in cui sono presenti gli artefatti del modello che desideri utilizzare per la formazione incrementale.

  4. Dopo l'apertura della collaborazione, scegli la scheda Modelli ML.

  5. In Modelli ML personalizzati, nella sezione Modelli addestrati, scegli il pulsante di opzione accanto al modello addestrato che desideri addestrare in modo incrementale.

  6. Nella pagina Panoramica, in Versioni,

    1. Scegli il pulsante di opzione accanto al modello addestrato che desideri addestrare in modo incrementale.

    2. Scegli Train dalla versione.

  7. Nella pagina Crea modello addestrato dalla versione, per Versione modello addestrato, scegli la versione.

    La versione del modello base viene selezionata automaticamente. È possibile modificare questa versione se esistono altre versioni.

  8. Per i dettagli del modello addestrato, inserisci quanto segue:

    1. Per Nome, inserisci un nome univoco per il modello nella collaborazione.

    2. (Facoltativo) Per Descrizione, inserire una descrizione del modello addestrato.

    3. Per la modalità di immissione dei dati di addestramento, scegliete una delle seguenti opzioni:

      • Selezionate File se disponete di un set di dati più piccolo che può contenere il volume di archiviazione ML e preferite l'accesso tradizionale al file system per lo script di training.

      • Scegliete Pipe per set di dati di grandi dimensioni per lo streaming di dati direttamente da S3, evitando la necessità di scaricare tutto su disco, il che può migliorare la velocità di formazione e ridurre i requisiti di archiviazione.

      • Scegli FastFile se desideri combinare i vantaggi dello streaming da S3 con l'accesso al file system, in particolare per i dati letti in sequenza o quando hai a che fare con un numero inferiore di file per tempi di avvio più rapidi.

    4. Per Nome del canale di formazione incrementale, inserisci un nome per il canale di formazione incrementale

      Nota

      Se specificate il nome del canale di formazione incrementale senza un ID di versione, il sistema utilizza il modello base per l'addestramento incrementale.

  9. Per i dettagli del canale di ingresso ML, effettuate le seguenti operazioni:

    1. Per il canale di ingresso ML, specificate il canale di ingresso ML che fornisce dati all'algoritmo del modello.

      Per aggiungere un altro canale, scegliete Aggiungi un altro canale di ingresso ML. È possibile aggiungere fino a 19 canali di ingresso ML aggiuntivi.

    2. Per Nome del canale, immettete il nome del canale di ingresso ML.

    3. Per il tipo di distribuzione dei dati di Amazon S3, scegli una delle seguenti opzioni:

      • Seleziona Fully replicated per fornire a ciascuna istanza di formazione una copia completa del set di dati. Funziona meglio quando il set di dati è sufficientemente piccolo da contenere la memoria o quando ogni istanza deve accedere a tutti i dati.

      • Seleziona Sharded by S3 key per dividere il set di dati tra le istanze di training in base alle chiavi S3. Ogni istanza riceve circa il totale 1/n degli oggetti S3, dove «n» è il numero di istanze. È la soluzione migliore per set di dati di grandi dimensioni che si desidera elaborare in parallelo.

      Nota

      Considerate le dimensioni del set di dati e i requisiti di formazione quando selezionate un tipo di distribuzione. La replica completa fornisce un accesso completo ai dati ma richiede più spazio di archiviazione, mentre Sharded by S3 key consente l'elaborazione distribuita di set di dati di grandi dimensioni.

  10. Per Durata massima dell'addestramento, scegli la quantità massima di tempo in cui desideri addestrare il tuo modello.

  11. Per Hyperparameters, specificate tutti i parametri specifici dell'algoritmo e i relativi valori previsti. Gli iperparametri sono specifici del modello in fase di addestramento e vengono utilizzati per ottimizzare l'addestramento del modello.

  12. Per le variabili di ambiente, specificate tutte le variabili specifiche dell'algoritmo e i relativi valori previsti. Le variabili di ambiente sono impostate nel contenitore Docker.

  13. Per la crittografia, per utilizzare una chiave personalizzata AWS KMS key, seleziona la casella di controllo Encrypt secret with a custom KMS key.

  14. Per la configurazione delle risorse EC2, specificare le informazioni sulle risorse di calcolo utilizzate per l'addestramento dei modelli.

    1. Per Tipo di istanza, scegli il tipo di istanza che desideri eseguire.

    2. Per Numero di istanze, inserisci il numero di istanze.

    3. Per Dimensioni del volume in GB, inserisci la dimensione del volume di archiviazione ML.

  15. Scegliete Crea modello addestrato a partire dalla versione.

API

Per eseguire un processo di formazione incrementale (API)

Esegui il codice seguente con i tuoi parametri specifici:

import boto3 acr_ml_client= boto3.client('cleanroomsml') acr_ml_client.create_trained_model( membershipIdentifier= 'membership_id', configuredModelAlgorithmAssociationArn = 'arn:aws:cleanrooms-ml:region:account:membership/membershipIdentifier/configured-model-algorithm-association/identifier', name='trained_model_name', resourceConfig={ 'instanceType': 'ml.m5.xlarge', 'volumeSizeInGB': 1 }, incrementalTrainingDataChannels=[ { 'trainedModelArn': trained_model_arn, 'channelName': 'channel_name' }, ] dataChannels=[ { 'mlInputChannelArn': channel_arn_1, 'channelName': 'channel_name' }, { 'mlInputChannelArn': channel_arn_2, 'channelName': 'channel_name' } ] )
Nota

Limite: massimo 20 canali in totale (inclusi entrambi dataChannels eincrementalTrainingDataChannels).

Nota

Dopo aver creato il modello addestrato, non è possibile modificarlo. Per apportare modifiche, elimina il modello addestrato e creane uno nuovo.