View a markdown version of this page

Preparazione dei dati per il CPT su Amazon Nova 2 - Amazon Nova

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

Preparazione dei dati per il CPT su Amazon Nova 2

Il CPT su Amazon Nova 2 si basa su testo non elaborato per aiutare il modello ad acquisire una conoscenza più approfondita di domini, terminologia e modelli di scrittura specifici. Questa pagina descrive il formato dei dati, le funzionalità supportate, i vincoli e le best practice per la preparazione dei dati di addestramento CPT per i modelli Amazon Nova 2.

Suggerimento

Per convalidare il formato del set di dati prima di iniziare un processo di formazione, consulta. Strumenti di convalida

Formato dei dati

I set di dati di addestramento e convalida CPT devono essere file JSONL, in cui ogni riga è un oggetto JSON contenente un singolo campo con un valore stringa. text Le voci di testo devono contenere contenuti fluidi e di alta qualità che rappresentino il dominio di destinazione.

Obbligatorio. Una stringa contenente i contenuti di formazione per questo esempio.

{"text": "training content"}
Nota

Quando si utilizza il datamixing, esegui il primo lavoro con. max_steps=2 Ciò contribuirà a creare ottimizzazioni nel cluster per l'accesso ai dati e a convalidare che tutti i datamix siano disponibili.

Ingressi di esempio

Quanto segue mostra un set di dati CPT JSONL di base con più esempi di testo:

{"text": "AWS stands for Amazon Web Services"} {"text": "Amazon SageMaker is a fully managed machine learning service"} {"text": "Amazon Bedrock is a fully managed service for foundation models"}

Funzionalità supportate

La tabella seguente riassume il supporto delle funzionalità per CPT su Amazon Nova 2.

Supporto delle funzionalità CPT
Funzionalità CPT su Amazon Nova 2
Comprensione del testo Supportato su Nova 2.0 Lite. Consulta General/Text comprensione.
Comprensione delle immagini Non supportata
Comprensione dei video Non supportata
Comprensione dei documenti Non supportata
Chiamata tramite strumenti Non supportata
Ragionamento Non supportata

General/Text comprensione

Questa sezione riassume i vincoli generali e le best practice per la preparazione dei dati di formazione CPT su Amazon Nova 2.

Vincoli

Vincoli generali dei set di dati
Vincolo Informazioni
Formato del set di dati JSONL (un oggetto JSON per riga) con un campo stringa. text
Modalità supportate Solo testo
Volume di dati consigliato Decine di miliardi di token di contenuti specifici del dominio per ottenere i migliori risultati.

Best practice

  • Utilizza contenuti fluidi e di alta qualità che rappresentino il tuo dominio di destinazione.

  • La qualità dei dati di formazione è il fattore determinante più cruciale per il successo della pre-formazione continua. Sebbene i dati CPT siano spesso descritti come «senza etichetta», il modo in cui i dati vengono strutturati, formattati e presentati determina se il modello acquisirà le conoscenze e le competenze richieste per il caso d'uso aziendale.

  • Dopo il CPT, pianificate di eseguire un'ulteriore ottimizzazione delle istruzioni (SFT o RFT) in modo che il modello possa utilizzare le nuove conoscenze acquisite per completare attività utili.

Esempio di input

{"text": "AWS stands for Amazon Web Services"} {"text": "Amazon SageMaker is a fully managed machine learning service"} {"text": "Amazon Bedrock is a fully managed service for foundation models"}

Preparazione di set di dati aziendali strutturati per il CPT

La maggior parte delle aziende dispone di ricchi archivi di dati strutturati: cataloghi di prodotti, profili utente, registri delle transazioni, invio di moduli, chiamate API e metadati operativi. A prima vista, questo sembra molto diverso dal testo web non strutturato tipicamente utilizzato nella preformazione standard.

Per imparare in modo efficace dai dati aziendali strutturati, rifletti attentamente sulle attività a valle e progetta la presentazione dei dati in modo da costringere il modello ad apprendere le corrette relazioni predittive.

Per sfruttare appieno il potenziale della formazione preliminare continua, considera:

  • Quali attività deve eseguire il modello al momento dell'inferenza

  • Quali informazioni sono presenti nei dati grezzi

  • Come strutturare i dati in modo che il modello impari a estrarre e manipolare le informazioni correttamente

Il semplice inserimento di dati strutturati nel training non insegnerà al modello a ragionare al riguardo. Modella attivamente la presentazione dei dati per guidare ciò che il modello apprende.

Dati strutturati per il CPT in letteratura

Il CPT può inserire dati di dominio nel modello, ma spesso non riesce a renderli recuperabili e manipolabili quando gli input o le attività cambiano. Gli esperimenti controllati dimostrano che, in assenza di potenziamenti diversificati durante il pretraining, i modelli memorizzano i dati in modi fragili che rimangono difficili da estrarre anche dopo una successiva ottimizzazione delle istruzioni, e raccomandano di iniettare istruzioni come segnali nelle prime fasi dell'addestramento. Per i dati semistrutturati, la serializzazione randomizzata e altri miglioramenti riducono il sovradimensionamento dello schema, motivo per cui il CPT dovrebbe essere intercalato con le attività in stile istruzione anziché essere eseguite prima e IFT successivamente. Un lavoro incentrato sulla finanza ha inoltre rilevato che la combinazione congiunta dei dati CPT e delle istruzioni in batch migliora la generalizzazione e riduce l'oblio rispetto alla ricetta sequenziale. Il rapporto tecnico di Qwen converge sullo stesso modello integrando dati di istruzione di alta qualità nella fase di pre-formazione stessa, il che favorisce l'apprendimento contestuale e preserva il seguito delle istruzioni acquisendo nuove conoscenze di dominio.

L'aumento dei dati per corpora semistrutturati è una leva fondamentale. Il CPT sintetico compatibile con i grafi espande piccoli set di domini in corpora collegati a entità che insegnano esplicitamente relazioni e composti con recupero al momento dell'inferenza. Il CPT congiunto e la combinazione delle istruzioni superano le pipeline sequenziali in ambito finanziario e il bilanciamento con i dati generali riduce il degrado delle competenze generali. Il CPT in un settore su larga scala può inoltre mantenere ampie capacità e persino consentire compromessi mediante la fusione dei modelli, ma indica comunque l'ottimizzazione delle istruzioni come un passo successivo essenziale, rafforzando il valore dell'introduzione di segnali di istruzioni durante il CPT.

Iniettare la diversità attraverso la randomizzazione e lo shuffling

Una strategia generale che aiuta a insegnare il modello in modo efficace a partire dai set di dati strutturati e semistrutturati consiste nel mescolare l'ordine dei campi nei set di dati e persino eliminare casualmente alcune chiavi.

La combinazione dei campi obbliga il modello a leggere il significato di ciascun valore anziché il punto in cui appare e ad apprendere le relazioni tra tutti i campi. Ad esempio, nel caso di un videogioco pubblicato su Amazon Store, quando «Titolo», «Piattaforma», «Prezzo», «Condizione» ed «Edizione» arrivano in diverse permutazioni, il modello non può fare affidamento su «il terzo slot è la piattaforma»; deve associare le etichette ai valori e conoscere le relazioni bilaterali tra gli attributi: titolo ⇄ piattaforma, piattaforma ⇄ prezzo, condizione ⇄ prezzo. Quindi può, ad esempio, dedurre una probabile piattaforma dal nome di un gioco e da un prezzo osservato, o stimare una fascia di prezzo plausibile dati un titolo e una piattaforma.

L'inserimento casuale delle chiavi durante la serializzazione si comporta come una perdita di funzionalità: impedisce il co-adattamento su un campo qualsiasi e obbliga il modello a recuperare le informazioni mancanti dalle prove rimanenti. Se «Platform» è assente, il modello deve selezionarlo dalla stringa del titolo o dal testo di compatibilità; se «Price» è nascosto, deve triangolarlo in base a piattaforma, edizione e condizione. Questo crea simmetria (A→B e B→A), robustezza rispetto agli elenchi disordinati del mondo reale e invarianza dello schema quando i campi mancano, vengono rinominati o riordinati.

Un esempio in stile shopping lo rende concreto. Serializza lo stesso articolo in più modi: «Titolo: 'Elden Ring' | Piattaforma: PlayStation 5 | Condizione: usato—Come nuovo | Prezzo: $34.99" e una permutazione come «Prezzo: $34.99 | Titolo: 'Elden Ring' | Condizione: usato—Come nuovo | Piattaforma: PlayStation 5"—e in alcuni passaggi inserisci «Piattaforma» lasciando «Compatibile con PS5" nella descrizione. Addestra obiettivi complementari come la previsione della piattaforma da {title, price} e la previsione di un bucket di prezzi da {title, platform}. Poiché l'ordine e persino la presenza delle chiavi variano, l'unica strategia stabile consiste nell'apprendere le vere relazioni tra gli attributi piuttosto che memorizzare un modello.

Il modo in cui i dati vengono presentati è importante

Gli LLM imparano prevedendo il prossimo token in base a ciò che hanno già visto. L'ordine dei campi e degli eventi mostrati durante l'addestramento decide cosa può apprendere il modello. Se il formato di addestramento corrisponde all'attività reale, la perdita si ripercuote sui token decisionali esatti. Se i campi vengono raggruppati senza struttura, il modello apprende le scorciatoie o memorizza la popolarità e poi fallisce quando viene chiesto di scegliere tra le opzioni.

Mostra prima la situazione, poi le opzioni, poi la decisione. Se il modello deve anche conoscere i risultati o le spiegazioni, inseriscili dopo la decisione.

Esempi di imballaggio per CPT

Che cos'è l'imballaggio?

Imballare significa riempire ogni finestra della sequenza nei dati di addestramento con più esempi completi in modo che la finestra sia densa di token reali, non di padding.

Perché è importante

Durante l'addestramento, viene impostata una lunghezza massima del contesto (ad esempio, 8.192 token). I batch hanno la forma [dimensione del batch × lunghezza del contesto]. Se un esempio di training è più corto della lunghezza del contesto, le posizioni rimanenti vengono riempite. Il riempimento viene comunque eseguito dai kernel di attenzione e MLP anche se la perdita è mascherata, quindi il calcolo viene pagato per i token privi di segnale di apprendimento.

Come fare l'imballaggio

Per impacchettare più campioni, concatena più campioni di addestramento con un [DOC] separatore tra di essi (annota lo spazio prima e dopo[DOC]), in modo che l'intera lunghezza rimanga entro la lunghezza del contesto desiderata.

Un esempio di documento compresso ha il seguente aspetto:

{"text": "training sample 1 [DOC] training sample 2 [DOC] training sample 3"}