View a markdown version of this page

Personnalisation d'Amazon Nova sur SageMaker HyperPod - Amazon Nova

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Personnalisation d'Amazon Nova sur SageMaker HyperPod

Vous pouvez personnaliser les modèles Amazon Nova, y compris les modèles Amazon Nova 2.0 améliorés, à l'aide de recettes Amazon Nova et les entraîner sur Hyperpod. Une recette est un fichier de configuration YAML qui fournit des informations à SageMaker AI sur la façon d'exécuter votre tâche de personnalisation de modèle. SageMaker HyperPod prend en charge deux types de services : Forge et Non-forge.

Hyperpod propose un calcul haute performance avec des instances GPU optimisées et Amazon FSx pour le stockage Lustre, une surveillance robuste grâce à l'intégration d'outils tels que TensorBoard la gestion flexible des points de contrôle pour une amélioration itérative, un déploiement fluide sur Amazon Bedrock pour l'inférence et une formation distribuée multi-nœuds évolutive efficace, le tout fonctionnant ensemble pour fournir aux entreprises un environnement sécurisé, performant et flexible leur permettant d'adapter les modèles Amazon Nova à leurs besoins commerciaux spécifiques.

La personnalisation d'Amazon Nova sur SageMaker HyperPod les artefacts des modèles de magasins, y compris les points de contrôle des modèles, dans un compartiment Amazon S3 géré par les services. Les artefacts du compartiment géré par les services sont chiffrés à l'aide SageMaker AI-managed AWS KMS de clés. Service-managed Les compartiments Amazon S3 ne prennent actuellement pas en charge le chiffrement des données à l'aide de clés KMS gérées par le client. Vous pouvez utiliser cet emplacement de point de contrôle pour les tâches d’évaluation ou l’inférence Amazon Bedrock.

La tarification standard peut s’appliquer aux instances de calcul, au stockage Amazon S3 et à FSx for Lustre. Pour plus de détails sur les tarifs, consultez les rubriques Tarification Hyperpod , Tarification Amazon S3 et Tarification FSx for Lustre.

Exigences de calcul pour les modèles Amazon Nova 2

Les tableaux suivants résument les exigences de calcul SageMaker HyperPod et les tâches de formation à l' SageMaker IA pour les modèles Amazon Nova 2.

Exigences de formation pour Nova 2

Technique d'entraînement

Nombre minimal d'instances

Type d'instance

Nombre de GPU

Remarques

Modèles pris en charge

SFT (LoRa)

4

P5.48xlarge

16

Parameter-efficient réglage fin

Nova 2 Lite

SFT (classement complet)

4

P5.48xlarge

32

Ajustement complet du modèle

Nova 2 Lite

RFT sur les emplois SageMaker de formation (LoRa)

2

P5.48xlarge

16

Fonctions de récompense personnalisées dans votre AWS environnement

Nova 2 Lite

RFT sur les emplois SageMaker de formation (rang complet)

4

P5.48xlarge

32

Longueur de contexte de 32 Ko

Nova 2 Lite

RFT activé SageMaker HyperPod

8

P5.48xlarge

64

Longueur de contexte 8192 par défaut

Nova 2 Lite

CPT

4

P5.48xlarge

16

Traite environ 400 millions de jetons par instance et par jour

Nova 2 Lite

Pour optimiser vos flux de travail de personnalisation de modèles Amazon Nova sur Hyperpod, suivez ces bonnes pratiques recommandées pour une formation efficace, une gestion des ressources et un déploiement de modèles réussi.

Meilleures pratiques pour la personnalisation d'Amazon Nova

Vue d’ensemble

Cette section fournit un aperçu des techniques de personnalisation et vous aide à choisir la meilleure approche en fonction de vos besoins et des données disponibles.

Deux étapes de la formation LLM

La formation sur un modèle linguistique à grande échelle comprend deux étapes principales : la pré-formation et la post-formation. Pendant le pré-entraînement, le modèle traite les jetons de texte brut et les optimise pour la prédiction du jeton suivant. Ce processus crée un compilateur de modèles qui absorbe la syntaxe, la sémantique, les faits et les modèles de raisonnement du Web et du texte sélectionné. Cependant, le modèle pré-entraîné ne comprend pas les instructions, les objectifs de l'utilisateur ou le comportement adapté au contexte. Il poursuit le texte dans le style qui convient à sa distribution d'entraînement. Un modèle pré-entraîné se complète automatiquement au lieu de suivre les instructions, produit un formatage incohérent et peut refléter des biais indésirables ou un contenu dangereux des données d'apprentissage. Pre-training renforce les compétences générales, et non l'utilité des tâches.

Post-training transforme le compléteur de motifs en un assistant utile. Vous exécutez plusieurs cycles de supervision Fine-Tuning (SFT) pour apprendre au modèle à suivre les instructions, à respecter les schémas et les politiques, à appeler des outils et à produire des résultats fiables en imitant des démonstrations de haute qualité. Cet alignement apprend au modèle à répondre aux instructions sous forme de tâches plutôt que sous forme de texte pour continuer. Vous appliquez ensuite le renforcement Fine-Tuning (RFT) pour optimiser le comportement à l'aide de commentaires mesurables (tels que des vérificateurs ou un LLM-as-a-judge), en équilibrant des compromis tels que la précision par rapport à la brièveté, la sécurité par rapport à la couverture, ou un raisonnement en plusieurs étapes soumis à des contraintes. Dans la pratique, vous alternez SFT et RFT par cycles pour transformer le modèle pré-entraîné en un système fiable et aligné sur les règles qui exécute des tâches complexes de manière cohérente.

Choisissez la bonne approche de personnalisation

Dans cette section, nous aborderons les stratégies de personnalisation après la formation : RFT et SFT.

Réglage fin des renforts (RFT)

Le réglage par renforcement améliore les performances du modèle grâce à des signaux de feedback (des scores mesurables ou des récompenses qui indiquent la qualité des réponses) plutôt qu'à une supervision directe avec des réponses exactes et correctes. Contrairement à l'ajustement supervisé traditionnel qui apprend à partir de paires d'entrées-sorties, le RFT utilise des fonctions de récompense pour évaluer les réponses du modèle et optimise le modèle de manière itérative pour maximiser ces récompenses. Cette approche fonctionne bien pour les tâches où il est difficile de définir la sortie exacte correcte, mais vous pouvez mesurer de manière fiable la qualité de la réponse. La RFT permet aux modèles d'apprendre des comportements et des préférences complexes par le biais d'essais et de commentaires, ce qui en fait la solution idéale pour les applications qui nécessitent une prise de décision nuancée, une résolution créative de problèmes ou le respect de critères de qualité spécifiques que vous pouvez évaluer par programmation. Par exemple, répondre à des questions juridiques complexes constitue un cas d'utilisation idéal pour la RFT, car vous souhaitez apprendre au modèle à mieux raisonner pour répondre aux questions avec plus de précision.

Comment ça marche

Pour affiner le renforcement, vous partez d'une base de référence adaptée aux instructions et vous traitez chaque invite comme un petit tournoi. Pour une entrée donnée, vous échantillonnez une poignée de réponses candidates à partir du modèle, vous attribuez une note à chacune d'elles à l'aide de la fonction de récompense, puis vous les classez dans ce groupe. L'étape de mise à jour renforce le modèle afin de rendre les candidats les mieux notés plus susceptibles la prochaine fois et les candidats les moins bien notés moins susceptibles de le faire, tandis qu'une contrainte de rester proche de la base de référence empêche les comportements de dériver, de devenir verbeux ou abusif. Vous répétez cette boucle en répétant de nombreuses instructions, en actualisant les cas complexes, en renforçant les vérificateurs ou les rubriques d'évaluation lorsque vous constatez des exploits, et vous suivez en permanence les indicateurs des tâches.

Quand utiliser la RFT

Les tâches qui bénéficient le plus de la RFT partagent plusieurs caractéristiques. Ils présentent des signaux de réussite mesurables, même lorsqu'il est difficile de spécifier une seule sortie correcte. Ils admettent un crédit partiel ou une qualité notée, ce qui vous permet de classer les meilleures réponses par rapport aux mauvaises réponses en un clin d'œil ou en utilisant une fonction de récompense. Ils impliquent de multiples objectifs qui doivent être équilibrés (tels que précision et brièveté, clarté, sécurité ou coût). Ils nécessitent le respect de contraintes explicites que vous pouvez vérifier par programmation. Ils fonctionnent dans des environnements médiatisés par des outils ou basés sur l'environnement où les résultats sont observables (succès ou échec, latence, utilisation des ressources). Ils se produisent dans des régimes bas de gamme où la collecte de cibles aurifères coûte cher mais où les commentaires automatisés ou basés sur des rubriques sont nombreux. La RFT fonctionne mieux lorsque vous pouvez transformer la qualité en un scalaire ou un classement fiable et que vous souhaitez que le modèle amplifie de préférence les comportements les plus performants sans avoir besoin de cibles étiquetées exhaustives.

Envisagez d'autres méthodes lorsque :

  • Vous disposez de paires d'entrées-sorties étiquetées abondantes et fiables — Utilisez SFT

  • La principale lacune concerne les connaissances ou le jargon — Utilisez la génération augmentée par extraction (RAG)

  • Votre signal de récompense est bruyant ou peu fiable et vous ne pouvez pas le corriger avec de meilleures rubriques ou de meilleurs pions. Stabilisez-le d'abord avant la RFT

Quand ne pas utiliser la RFT

Évitez la RFT dans les situations suivantes :

  • Vous pouvez produire à moindre coût des paires d'entrées-sorties étiquetées fiables (le SFT est plus simple, moins cher et plus stable)

  • L'écart est dû aux connaissances ou au jargon plutôt qu'au comportement (utilisez le RAG)

  • Votre signal de récompense est bruyant, clairsemé, facile à jouer, coûteux ou lent à calculer (corrigez d'abord l'évaluateur)

  • Les performances de base sont proches de zéro (bootstrap avec SFT avant d'optimiser les préférences)

  • La tâche comporte des schémas déterministes, un formatage strict ou une seule réponse correcte (la validation SFT ou basée sur des règles fonctionne mieux)

  • Les budgets de latence ou de coûts serrés ne peuvent pas absorber l'échantillonnage ou l'exploration supplémentaires requis par la RFT

  • Les contraintes de sécurité ou de politique ne sont pas clairement spécifiées et applicables dans la récompense

Si vous pouvez indiquer « la bonne réponse », utilisez SFT. Si vous avez besoin de nouvelles connaissances, utilisez RAG. N'utilisez RFT qu'après avoir établi une base de référence solide et une fonction de récompense robuste, rapide et difficile à exploiter.

Peaufinage supervisé (SFT)

Le réglage fin supervisé entraîne le LLM sur un ensemble de données de paires d'entrées-sorties étiquetées par l'homme pour votre tâche. Vous fournissez des exemples d'instructions (questions, instructions, etc.) avec les réponses correctes ou souhaitées, et vous continuez à entraîner le modèle sur ces exemples. Le modèle ajuste ses poids pour minimiser une perte supervisée (généralement une entropie croisée entre ses prédictions et les jetons de sortie cibles). Il s'agit de la même formation que celle utilisée dans la plupart des tâches d'apprentissage automatique supervisées, appliquée pour spécialiser un LLM.

La SFT modifie les comportements, pas les connaissances. Il n'enseigne pas au modèle de nouveaux faits ou un jargon qu'il n'avait pas vus lors de la formation préalable. Il enseigne au modèle comment répondre, et non pas ce qu'il doit savoir. Si vous avez besoin de nouvelles connaissances dans un domaine (comme la terminologie interne), utilisez la génération augmentée par extraction (RAG) pour fournir ce contexte au moment de l'inférence. SFT ajoute ensuite le comportement de suivi des instructions souhaité en haut de la page.

Comment ça marche

SFT optimise le LLM en minimisant la perte d'entropie croisée moyenne sur les jetons de réponse, en traitant les jetons d'invite comme un contexte et en les masquant de la perte. Le modèle internalise le style, la structure et les règles de décision de votre cible, en apprenant à générer la saisie correcte pour chaque invite. Par exemple, pour classer les documents dans des catégories personnalisées, vous pouvez affiner le modèle à l'aide d'instructions (le texte du document) et de compléments étiquetés (les libellés des catégories). Vous vous entraînez sur ces paires jusqu'à ce que le modèle affiche la bonne étiquette pour chaque invite avec une probabilité élevée.

Vous pouvez effectuer une SFT avec quelques centaines d'exemples seulement et passer à quelques centaines de milliers. Les échantillons SFT doivent être de haute qualité et directement alignés sur le comportement souhaité du modèle.

Quand utiliser SFT

Utilisez SFT lorsque vous avez une tâche bien définie avec des résultats souhaités clairs. Si vous pouvez indiquer explicitement « Une entrée X donnée, la sortie correcte est Y » et rassembler des exemples de tels mappages, le réglage fin supervisé est un bon choix. SFT excelle dans les scénarios suivants :

  • Tâches de classification structurées ou complexes — Classez les documents internes ou les contrats dans de nombreuses catégories personnalisées. Avec SFT, le modèle apprend ces catégories spécifiques mieux qu'il ne le fait uniquement à l'aide d'une incitation.

  • Question-answering ou des tâches de transformation dont les réponses sont connues  : Fine-tune un modèle permettant de répondre à des questions issues de la base de connaissances d'une entreprise ou de convertir des données entre des formats dans lesquels chaque entrée a une réponse correcte.

  • Formatage et cohérence du style — Entraînez le modèle à toujours répondre dans un certain format ou une certaine tonalité en peaufinant les exemples du format ou du ton appropriés. Par exemple, une formation sur les paires de réponses rapides qui illustrent la voix d'une marque particulière enseigne au modèle à générer des résultats avec ce style. Instruction-following le comportement est souvent initialement enseigné par le biais de la SFT sur la base d'exemples sélectionnés de bon comportement d'assistant.

La SFT est le moyen le plus direct d'enseigner à un LLM une nouvelle compétence ou un nouveau comportement lorsque vous pouvez spécifier à quoi ressemble le bon comportement. Il utilise la compréhension linguistique existante du modèle et la concentre sur votre tâche. Utilisez SFT lorsque vous souhaitez que le modèle fasse une action spécifique et que vous avez ou pouvez créer un ensemble de données d'exemples.

Utilisez SFT lorsque vous pouvez assembler des paires d'invite et de réponse de haute qualité qui reflètent fidèlement le comportement souhaité. Il adapte les tâches avec des cibles claires ou des formats déterministes tels que des schémas, des appels de fonctions ou d'outils, et des réponses structurées où l'imitation est un signal d'entraînement approprié. L'objectif est de façonner le comportement : apprendre au modèle à traiter les invites comme des tâches, à suivre les instructions, à adopter des politiques de ton et de refus et à produire une mise en forme cohérente. Prévoyez au moins des centaines de démonstrations, la qualité, la cohérence et la déduplication des données étant plus importantes que le volume brut. Pour une mise à jour simple et rentable, utilisez des méthodes économes en paramètres, telles que Low-Rank Adaptation, pour entraîner de petits adaptateurs sans toucher à la majeure partie de la colonne vertébrale.

Quand ne pas utiliser SFT

N'utilisez pas SFT lorsque l'écart est lié aux connaissances plutôt qu'au comportement. Il n'enseigne pas au modèle de nouveaux faits, de jargon ou d'événements récents. Dans ces cas, utilisez la génération augmentée par extraction pour apporter des connaissances externes lors de l'inférence. Évitez le SFT lorsque vous pouvez mesurer la qualité mais que vous ne pouvez pas étiqueter une seule bonne réponse. Ajustez le renforcement avec des récompenses vérifiables ou LLM-as-a-judge optimisez directement ces récompenses. Si vos besoins ou votre contenu changent fréquemment, misez sur la récupération et l'utilisation des outils plutôt que sur une nouvelle formation du modèle.