View a markdown version of this page

Préparation des données pour le CPT sur Amazon Nova 2 - Amazon Nova

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Préparation des données pour le CPT sur Amazon Nova 2

CPT sur Amazon Nova 2 s'entraîne sur le texte brut pour aider le modèle à acquérir des connaissances plus approfondies sur des domaines, une terminologie et des modèles d'écriture spécifiques. Cette page décrit le format de données, les fonctionnalités prises en charge, les contraintes et les meilleures pratiques pour préparer les données d'entraînement CPT pour les modèles Amazon Nova 2.

Astuce

Pour valider le format de votre jeu de données avant de commencer une tâche de formation, consultezOutils de validation.

Format de données

Les ensembles de données d'entraînement et de validation CPT doivent être des fichiers JSONL, où chaque ligne est un objet JSON contenant un seul text champ avec une valeur de chaîne. Les entrées de texte doivent contenir un contenu naturellement fluide et de haute qualité qui représente le domaine cible.

Obligatoire. Chaîne contenant le contenu de formation pour cet exemple.

{"text": "training content"}
Note

Lorsque vous utilisez le mixage de données, exécutez la première tâche avec. max_steps=2 Cela permettra de créer des optimisations dans le cluster pour l'accès aux données et de valider la disponibilité de tous les mélanges de données.

Entrées d'échantillons

Ce qui suit montre un ensemble de données CPT JSONL de base avec plusieurs exemples de texte :

{"text": "AWS stands for Amazon Web Services"} {"text": "Amazon SageMaker is a fully managed machine learning service"} {"text": "Amazon Bedrock is a fully managed service for foundation models"}

Fonctionnalités prises en charge

Le tableau suivant récapitule les fonctionnalités prises en charge pour le CPT sur Amazon Nova 2.

Prise en charge des fonctionnalités CPT
Fonctionnalité CPT sur Amazon Nova 2
Compréhension de texte Pris en charge sur Nova 2.0 Lite. Consultez General/Text compréhension.
Compréhension des images Non pris en charge
Compréhension des vidéos Non pris en charge
Compréhension des documents Non pris en charge
Appel d'outils Non pris en charge
Raisonnement Non pris en charge

General/Text compréhension

Cette section récapitule les contraintes générales et les meilleures pratiques relatives à la préparation des données d'entraînement CPT sur Amazon Nova 2.

Contraintes

Contraintes générales du jeu de données
Contrainte Détails
Format du jeu de données JSONL (un objet JSON par ligne) avec un champ de text chaîne.
Modalités prises en charge Texte uniquement
Volume de données recommandé Des dizaines de milliards de jetons de contenu spécifique à un domaine pour de meilleurs résultats.

Bonnes pratiques

  • Utilisez un contenu naturellement fluide et de haute qualité qui représente votre domaine cible.

  • La qualité des données de formation est le facteur déterminant le plus important pour le succès de la formation préalable continue. Bien que les données CPT soient souvent décrites comme « non étiquetées », la manière dont les données sont structurées, formatées et présentées détermine si le modèle permettra d'acquérir les connaissances et les compétences requises pour votre cas d'utilisation commercial.

  • Après le CPT, prévoyez d'exécuter un réglage supplémentaire des instructions (SFT ou RFT) afin que le modèle puisse utiliser les connaissances nouvellement acquises pour effectuer des tâches utiles.

Exemple d'entrée

{"text": "AWS stands for Amazon Web Services"} {"text": "Amazon SageMaker is a fully managed machine learning service"} {"text": "Amazon Bedrock is a fully managed service for foundation models"}

Préparation d'ensembles de données commerciales structurés pour le CPT

La plupart des entreprises possèdent de riches référentiels de données structurées : catalogues de produits, profils utilisateurs, journaux de transactions, soumissions de formulaires, appels d'API et métadonnées opérationnelles. À première vue, cela semble très différent du texte Web non structuré généralement utilisé lors de la formation préalable standard.

Pour tirer des enseignements efficaces des données commerciales structurées, réfléchissez bien aux tâches en aval et concevez la présentation des données de manière à forcer le modèle à apprendre les bonnes relations prédictives.

Pour exploiter tout le potentiel de la formation préalable continue, pensez à :

  • Quelles tâches le modèle doit effectuer au moment de l'inférence

  • Quelles informations sont présentes dans les données brutes

  • Comment structurer ces données pour que le modèle apprenne à extraire et à manipuler correctement les informations

Le simple fait de transférer des données structurées dans la formation n'apprendra pas au modèle à raisonner à ce sujet. Façonnez activement la présentation des données pour orienter les enseignements du modèle.

Données structurées pour la CPT dans la littérature

Le CPT peut intégrer des faits de domaine dans le modèle, mais ne parvient souvent pas à les rendre récupérables et manipulables lorsque les entrées ou les tâches changent. Des expériences contrôlées montrent que sans augmentation diversifiée pendant le pré-entraînement, les modèles mémorisent les faits de manière fragile qui restent difficiles à extraire même après un réglage ultérieur des instructions, et ils recommandent d'injecter des instructions sous forme de signaux au début de l'entraînement. Pour les données semi-structurées, la sérialisation aléatoire et d'autres augmentations réduisent le surajustement des schémas. C'est pourquoi le CPT doit être associé à des tâches de style d'instruction plutôt que d'être exécuté en premier et IFT plus tard. Des travaux axés sur les finances révèlent en outre que le fait de mélanger conjointement les données CPT et les données d'instructions par lots améliore la généralisation et réduit les oublis par rapport à la recette séquentielle. Le rapport technique de Qwen converge vers le même modèle en intégrant des données d'enseignement de haute qualité dans la préformation elle-même, ce qui stimule l'apprentissage contextuel et préserve le suivi des instructions tout en acquérant de nouvelles connaissances dans le domaine.

L'augmentation des données pour les corpus semi-structurés est un levier clé. Le CPT, qui prend en compte les graphes synthétiques, étend de petits ensembles de domaines en corpus liés à des entités qui enseignent explicitement les relations et les composés avec une récupération au moment de l'inférence. Le mélange conjoint du CPT et des instructions surpasse les pipelines séquentiels dans le domaine de la finance et l'équilibrage du domaine avec les données générales réduit la dégradation des compétences générales. Le CPT à très grande échelle peut également conserver une grande capacité et même permettre des compromis grâce à la fusion de modèles, tout en indiquant toujours que le réglage des instructions est la prochaine étape essentielle, ce qui renforce l'intérêt de l'introduction de signaux d'instruction pendant le CPT.

Injecter de la diversité grâce à la randomisation et au remaniement

Une stratégie générale qui permet d'enseigner efficacement un modèle à partir des ensembles de données structurés et semi-structurés consiste à modifier l'ordre des champs dans les ensembles de données, et même à supprimer certaines clés de manière aléatoire.

Le brassage des champs force le modèle à lire la signification de chaque valeur au lieu de son emplacement et à apprendre les relations entre tous les champs. Par exemple, dans le cas d'un jeu vidéo publié sur Amazon Store, lorsque « Titre », « Plateforme », « Prix », « État » et « Édition » arrivent dans des permutations différentes, le modèle ne peut pas se fier à « le troisième emplacement est la plateforme » ; il doit associer des étiquettes aux valeurs et apprendre les relations bilatérales entre les attributs : titre, plateforme, prix, condition, prix. Ainsi, il peut, par exemple, déduire une plateforme probable à partir du nom d'un jeu et d'un prix observé, ou estimer une fourchette de prix plausible en fonction d'un titre et d'une plateforme.

La suppression aléatoire de clés pendant la sérialisation agit comme la suppression de caractéristiques : elle empêche la co-adaptation sur un champ donné et oblige le modèle à récupérer les informations manquantes à partir des preuves restantes. Si « Plateforme » est absente, le modèle doit la récupérer dans la chaîne de titre ou dans le texte de compatibilité ; si « Prix » est masqué, il doit effectuer une triangulation à partir de la plate-forme, de l'édition et de l'état. Cela renforce la symétrie (A→B et B→A), la robustesse face aux listes compliquées du monde réel et l'invariance des schémas lorsque des champs sont manquants, renommés ou réorganisés.

Un exemple de style d'achat le rend concret. Sérialisez le même article de plusieurs manières : « Titre : 'Elden Ring' | Plateforme : PlayStation 5 | État : d'occasion, comme neuf | Prix : 34,99$ » et une permutation du type « Prix : 34,99$ | Titre : 'Elden Ring' | État : Usagé, comme neuf | Plateforme : 5 ». Sur certains pass, supprimez « Plateforme » en laissant « Compatible avec PS5 » dans la description. PlayStation Définissez des objectifs complémentaires tels que la prédiction de la plateforme à partir de {title, price} et la prédiction d'une tranche de prix à partir de {title, platform}. Étant donné que l'ordre et même la présence des clés varient, la seule stratégie stable consiste à apprendre les véritables relations entre les attributs plutôt que de mémoriser un modèle.

La façon dont les données sont présentées est importante

Les LLM apprennent en prédisant le prochain jeton à partir de ce qu'ils ont déjà vu. L'ordre des champs et des événements affichés pendant la formation détermine ce que le modèle peut apprendre. Si le format d'entraînement correspond à la tâche réelle, la perte se répercute sur les jetons de décision exacts. Si les champs sont mélangés sans structure, le modèle apprend les raccourcis ou mémorise la popularité, puis échoue lorsqu'on lui demande de choisir parmi les options.

Montrez d'abord la situation, puis les options, puis la décision. Si le modèle doit également en apprendre davantage sur les résultats ou les explications, placez-les après la décision.

Échantillons d'emballage pour CPT

Qu'est-ce que l'emballage ?

L'encapsulation consiste à remplir chaque fenêtre de séquence des données d'entraînement avec plusieurs exemples entiers afin que la fenêtre soit dense avec de vrais jetons, et non pas de remplissage.

Pourquoi est-ce important ?

Pendant l'entraînement, une longueur de contexte maximale est définie (par exemple, 8 192 jetons). Les lots sont mis en forme selon [taille du lot × longueur du contexte]. Si un exemple d'entraînement est plus court que la longueur du contexte, les positions restantes sont complétées. Le remplissage passe toujours par l'attention et les noyaux MLP même si la perte est masquée. Le calcul est donc payé pour les jetons qui ne transmettent aucun signal d'apprentissage.

Comment faire l'emballage

Pour regrouper plusieurs échantillons, concaténez plusieurs échantillons d'apprentissage en les séparant par un [DOC] séparateur (notez l'espace avant et après[DOC]), de telle sorte que la longueur totale reste dans les limites de la longueur de contexte souhaitée.

Voici un exemple de document compressé :

{"text": "training sample 1 [DOC] training sample 2 [DOC] training sample 3"}