Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.
Uso de la formación incremental en AWS Clean Rooms ML
Requisitos previos:
-
Y Cuenta de AWS con acceso a AWS Clean Rooms
-
Un modelo capacitado existente en una colaboración
-
Un conjunto de datos nuevo o actualizado para el entrenamiento incremental
-
Permisos adecuados para crear y administrar modelos de aprendizaje automático en la colaboración
-
Familiaridad con los hiperparámetros y la configuración del modelo existente
Con el entrenamiento incremental, puede usar los artefactos de un modelo existente y un conjunto de datos actualizado para entrenar un modelo nuevo. La capacitación incremental le ahorra tiempo y recursos.
Utilice la capacitación incremental para:
-
Entrena un modelo nuevo con un conjunto de datos expandido que tenga un patrón subyacente que no se tuvo en cuenta en el entrenamiento anterior.
-
Entrene varias variantes de un modelo, ya sea con diferentes hiperparámetros o con diferentes conjuntos de datos.
- Console
-
Para ejecutar un trabajo de entrenamiento incremental (consola)
-
Inicie sesión en Consola de administración de AWS y abra la AWS Clean Rooms consola en https://console.aws.amazon.com/cleanrooms.
-
En el panel de navegación izquierdo, elija Colaboraciones.
-
En la página de colaboraciones, elige la colaboración en la que existen los artefactos modelo que quieres usar para el entrenamiento incremental.
-
Cuando se abra la colaboración, elija la pestaña de modelos de aprendizaje automático.
-
En Modelos de aprendizaje automático personalizados, en la sección Modelos entrenados, selecciona el botón de radio situado junto al modelo entrenado que quieres entrenar de forma incremental.
-
En la página de descripción general, en Versiones,
-
Selecciona el botón de radio situado junto al modelo entrenado que quieres entrenar de forma incremental.
-
Selecciona Entrenar a partir de la versión.
-
En la página Crear un modelo entrenado a partir de una versión, en Versión de modelo entrenado, elija la versión.
La versión del modelo base se selecciona automáticamente. Puede cambiar esta versión si existen otras versiones.
-
Para obtener más información sobre el modelo Trained, introduzca lo siguiente:
-
En Nombre, introduzca un nombre único para el modelo de la colaboración.
-
(Opcional) En Descripción, introduzca una descripción del modelo entrenado.
-
Para el modo de entrada de datos de entrenamiento, elige una de las siguientes opciones:
-
Seleccione Archivo si tiene un conjunto de datos más pequeño que cabe en el volumen de almacenamiento de aprendizaje automático y prefiere el acceso tradicional al sistema de archivos para su guion de entrenamiento.
-
Seleccione Pipe si desea transmitir datos directamente desde S3 con conjuntos de datos de gran tamaño, evitando la necesidad de descargarlo todo en un disco, lo que puede mejorar la velocidad de entrenamiento y reducir los requisitos de almacenamiento.
-
Seleccione esta opción FastFile si desea combinar las ventajas de la transmisión desde S3 con el acceso al sistema de archivos, especialmente para leer los datos de forma secuencial o cuando se trabaja con menos archivos para acelerar los tiempos de inicio.
-
Para el nombre del canal de formación incremental, introduce un nombre para el canal de formación incremental
Si especificas el nombre del canal de entrenamiento incremental sin un identificador de versión, el sistema usa el modelo base para el entrenamiento incremental.
-
Para obtener información detallada sobre el canal de entrada de aprendizaje automático, haga lo siguiente:
-
Para el canal de entrada ML, especifique el canal de entrada ML que proporciona datos al algoritmo del modelo.
Para agregar otro canal, elija Agregar otro canal de entrada ML. Puede añadir hasta 19 canales de entrada ML adicionales.
-
En Nombre del canal, introduzca el nombre del canal de entrada ML.
-
Para el tipo de distribución de datos de Amazon S3, elija una de las siguientes opciones:
-
Seleccione Totalmente replicado para proporcionar a cada instancia de entrenamiento una copia completa de su conjunto de datos. Esto funciona mejor cuando el conjunto de datos es lo suficientemente pequeño como para caber en la memoria o cuando cada instancia necesita acceder a todos los datos.
-
Selecciona Dividido por clave de S3 para dividir tu conjunto de datos entre instancias de entrenamiento en función de las claves de S3. Cada instancia recibe aproximadamente una 1/n parte del total de objetos de S3, donde «n» es la cantidad de instancias. Esto funciona mejor para conjuntos de datos de gran tamaño que desee procesar en paralelo.
Tenga en cuenta el tamaño del conjunto de datos y los requisitos de formación al seleccionar un tipo de distribución. La replicación completa proporciona un acceso completo a los datos, pero requiere más almacenamiento, mientras que la clave Sharded by S3 permite el procesamiento distribuido de grandes conjuntos de datos.
-
Para obtener la duración máxima del entrenamiento, elige la cantidad máxima de tiempo que deseas entrenar tu modelo.
-
En el caso de los hiperparámetros, especifique los parámetros específicos del algoritmo y sus valores previstos. Los hiperparámetros son específicos del modelo que se está entrenando y se utilizan para ajustar con precisión el entrenamiento del modelo.
-
En el caso de las variables de entorno, especifique las variables específicas del algoritmo y sus valores previstos. Las variables de entorno se configuran en el contenedor Docker.
-
En el caso del cifrado, para usar un cifrado personalizado AWS KMS key, seleccione la casilla Cifrar el secreto con una clave de KMS personalizada.
-
Para la configuración de los recursos de EC2, especifique la información sobre los recursos informáticos que se utilizan para el entrenamiento de modelos.
-
En Tipo de instancia, elija el tipo de instancia que desea ejecutar.
-
En Recuento de instancias, introduzca el número de instancias.
-
Para el tamaño del volumen en GB, introduzca el tamaño del volumen de almacenamiento de ML.
-
Seleccione Crear modelo entrenado a partir de la versión.
- API
-
Para ejecutar un trabajo de entrenamiento incremental (API)
Ejecuta el siguiente código con tus parámetros específicos:
import boto3
acr_ml_client= boto3.client('cleanroomsml')
acr_ml_client.create_trained_model(
membershipIdentifier= 'membership_id',
configuredModelAlgorithmAssociationArn = 'arn:aws:cleanrooms-ml:region:account:membership/membershipIdentifier/configured-model-algorithm-association/identifier',
name='trained_model_name',
resourceConfig={
'instanceType': 'ml.m5.xlarge',
'volumeSizeInGB': 1
},
incrementalTrainingDataChannels=[
{
'trainedModelArn': trained_model_arn,
'channelName': 'channel_name'
},
]
dataChannels=[
{
'mlInputChannelArn': channel_arn_1,
'channelName': 'channel_name'
},
{
'mlInputChannelArn': channel_arn_2,
'channelName': 'channel_name'
}
]
)
Límite: máximo de 20 canales en total (incluidos ambos dataChannels yincrementalTrainingDataChannels).
Una vez creado el modelo entrenado, no puedes editarlo. Para hacer cambios, borre el modelo entrenado y cree uno nuevo.