View a markdown version of this page

Daten für CPT auf Amazon Nova 2 vorbereiten - Amazon Nova

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Daten für CPT auf Amazon Nova 2 vorbereiten

CPT auf Amazon Nova 2 trainiert anhand von Rohtext, um dem Modell zu helfen, tiefere Kenntnisse über bestimmte Bereiche, Terminologie und Schreibmuster zu erwerben. Auf dieser Seite werden das Datenformat, die unterstützten Funktionen, Einschränkungen und bewährten Methoden für die Vorbereitung von CPT-Trainingsdaten für Amazon Nova 2-Modelle beschrieben.

Tipp

Informationen zur Validierung Ihres Datensatzformats, bevor Sie mit einem Trainingsjob beginnen, finden Sie unterTools zur Validierung.

Data format (Datenformat)

CPT-Trainings- und Validierungsdatensätze müssen JSONL-Dateien sein, wobei jede Zeile ein JSON-Objekt ist, das ein einzelnes text Feld mit einem Zeichenfolgenwert enthält. Texteinträge sollten natürlich fließende, qualitativ hochwertige Inhalte enthalten, die die Zieldomäne repräsentieren.

Erforderlich Eine Zeichenfolge, die den Schulungsinhalt für dieses Beispiel enthält.

{"text": "training content"}
Anmerkung

Wenn Sie Datamixing verwenden, führen Sie den ersten Job mit aus. max_steps=2 Dies hilft dabei, Optimierungen im Cluster für den Datenzugriff vorzunehmen und zu überprüfen, ob alle Datenmixe verfügbar sind.

Beispiele für Eingaben

Das Folgende zeigt einen grundlegenden CPT-JSONL-Datensatz mit mehreren Textbeispielen:

{"text": "AWS stands for Amazon Web Services"} {"text": "Amazon SageMaker is a fully managed machine learning service"} {"text": "Amazon Bedrock is a fully managed service for foundation models"}

Unterstützte Features

Die folgende Tabelle fasst die Funktionsunterstützung für CPT auf Amazon Nova 2 zusammen.

Unterstützung von CPT-Funktionen
Feature CPT auf Amazon Nova 2
Textverständnis Wird auf Nova 2.0 Lite unterstützt. Siehe General/Text Verständnis.
Bildverständnis Nicht unterstützt
Video-Verständnis Nicht unterstützt
Verstehen von Dokumenten Nicht unterstützt
Aufrufen des Tools Nicht unterstützt
Reasoning Nicht unterstützt

General/Text Verständnis

In diesem Abschnitt werden die allgemeinen Einschränkungen und bewährten Methoden für die Vorbereitung von CPT auf Amazon Nova 2-Schulungsdaten zusammengefasst.

Beschränkungen

Allgemeine Einschränkungen bei Datensätzen
Einschränkung Details
Format des Datensatzes JSONL (ein JSON-Objekt pro Zeile) mit einem text Zeichenfolgenfeld.
Unterstützte Modalitäten Nur Text
Empfohlenes Datenvolumen Dutzende Milliarden von Tokens mit domänenspezifischen Inhalten für beste Ergebnisse.

Bewährte Methoden

  • Verwenden Sie natürlich fließende, qualitativ hochwertige Inhalte, die Ihre Zieldomain repräsentieren.

  • Die Qualität der Trainingsdaten ist der wichtigste entscheidende Faktor für den Erfolg eines kontinuierlichen Vortrainings. CPT-Daten werden zwar oft als „unbeschriftet“ beschrieben, aber die Art und Weise, wie Daten strukturiert, formatiert und präsentiert werden, hängt davon ab, ob das Modell die Kenntnisse und Fähigkeiten erwirbt, die für Ihren geschäftlichen Anwendungsfall erforderlich sind.

  • Planen Sie nach dem CPT eine zusätzliche Befehlsoptimierung (SFT oder RFT) ein, damit das Modell das neu erworbene Wissen nutzen kann, um nützliche Aufgaben zu erledigen.

Eingabe eines Beispiels

{"text": "AWS stands for Amazon Web Services"} {"text": "Amazon SageMaker is a fully managed machine learning service"} {"text": "Amazon Bedrock is a fully managed service for foundation models"}

Vorbereitung strukturierter Geschäftsdatensätze für CPT

Die meisten Unternehmen verfügen über umfangreiche Repositorys strukturierter Daten: Produktkataloge, Benutzerprofile, Transaktionsprotokolle, Formularübermittlungen, API-Aufrufe und Betriebsmetadaten. Auf den ersten Blick sieht das ganz anders aus als der unstrukturierte Webtext, der normalerweise in der Standardvorbereitung verwendet wird.

Um effektiv aus strukturierten Geschäftsdaten zu lernen, denken Sie sorgfältig über nachgelagerte Aufgaben nach und gestalten Sie die Datenpräsentation so, dass das Modell gezwungen ist, die richtigen prädiktiven Zusammenhänge zu erlernen.

Um das volle Potenzial kontinuierlicher Vorschulungen auszuschöpfen, sollten Sie Folgendes in Betracht ziehen:

  • Welche Aufgaben sollte das Modell zur Zeit der Inferenz erfüllen

  • Welche Informationen sind in den Rohdaten enthalten

  • Wie strukturiert man diese Daten, damit das Modell lernt, die Informationen korrekt zu extrahieren und zu bearbeiten

Einfach strukturierte Daten in das Training zu übertragen, bringt dem Modell nicht bei, darüber nachzudenken. Gestalten Sie die Datenpräsentation aktiv so, dass Sie sich an den Erkenntnissen des Modells orientieren können.

Strukturierte Daten für CPT in der Literatur

CPT kann fachspezifische Fakten in das Modell aufnehmen, aber oft gelingt es nicht, diese Fakten abrufbar und manipulierbar zu machen, wenn sich Eingaben oder Aufgaben ändern. Kontrollierte Experimente zeigen, dass Modelle ohne vielfältige Augmentation während des Vortrainings Fakten auf spröde Weise auswendig lernen, die auch nach einer späteren Anpassung der Anweisungen schwer zu extrahieren sind, und sie empfehlen, zu Beginn des Trainings Anweisungen wie Signale zu injizieren. Bei halbstrukturierten Daten reduzieren randomisierte Serialisierung und andere Augmentierungen eine Überanpassung der Schemata. Aus diesem Grund sollte CPT mit Aufgaben im Befehlsstil verknüpft werden, anstatt sie zuerst auszuführen und dann IFT. Bei der Arbeit mit Schwerpunkt Finanzen wurde außerdem festgestellt, dass das gemeinsame Mischen von CPT- und Befehlsdaten im Batch-Modus die Generalisierung verbessert und das Vergessen im Vergleich zum sequentiellen Rezept reduziert. Der technische Bericht von Qwen folgt dem gleichen Muster, indem er qualitativ hochwertige Unterrichtsdaten in das Vortraining selbst integriert. Dadurch wird das Lernen im Kontext gefördert und der Unterricht bleibt erhalten, während gleichzeitig neues Fachwissen erworben wird.

Die Datenerweiterung für halbstrukturierte Korpora ist ein wichtiger Hebel. CPT, das synthetische Graphen berücksichtigt, erweitert kleine Domänensätze in Entitätsverknüpften Korpora, die beim Abrufen zur Inferenzzeit explizit Beziehungen und Verbindungen vermitteln. Gemeinsames CPT plus Kombination von Instruktionen übertrifft sequentielle Pipelines im Finanz- und Bilanzierungsbereich mit allgemeinen Daten, wodurch die Verschlechterung der allgemeinen Fähigkeiten verringert wird. Sehr groß angelegtes CPT kann auch weiterhin breit gefächert sein und sogar Kompromisse durch Modellzusammenführung ermöglichen, weist aber immer noch darauf hin, dass die Anpassung von Anweisungen ein wesentlicher nächster Schritt ist, was den Wert der Einführung von Befehlssignalen während des CPT verstärkt.

Schaffung von Diversität durch Randomisierung und Mischen

Eine allgemeine Strategie, die dabei hilft, anhand der strukturierten und halbstrukturierten Datensätze das Modell effektiv zu erlernen, besteht darin, die Reihenfolge der Felder in den Datensätzen zu mischen und sogar einige Schlüssel zufällig wegzulassen.

Das Mischen der Felder zwingt das Modell dazu, zu lesen, was jeder Wert bedeutet, und nicht, wo er erscheint, und die Beziehungen zwischen allen Feldern zu lernen. Wenn beispielsweise ein Videospiel im Amazon Store veröffentlicht wird und „Titel“, „Plattform“, „Preis“, „Zustand“ und „Ausgabe“ in unterschiedlichen Varianten erscheinen, kann sich das Modell nicht auf „Der dritte Slot ist Plattform“ verlassen. Es muss Beschriftungen an Werte binden und die bilateralen Beziehungen zwischen den Attributen lernen: Titel — Plattform — Preis —. So kann es beispielsweise anhand eines Spielnamens und eines beobachteten Preises auf eine wahrscheinliche Plattform schließen oder eine plausible Preisspanne anhand eines Titels und einer Plattform abschätzen.

Das zufällige Löschen von Schlüsseln während der Serialisierung wirkt wie ein Ausfallen eines Features: Es verhindert die Koadaption in einem beliebigen Feld und zwingt das Modell, fehlende Informationen aus den verbleibenden Beweisen wiederherzustellen. Fehlt „Plattform“, muss das Modell es aus der Titelzeichenfolge oder dem Kompatibilitätstext übernehmen; wenn „Preis“ ausgeblendet ist, muss es nach Plattform, Ausgabe und Zustand triangulieren. Dies sorgt für Symmetrie (A→B und B→A), Robustheit gegenüber unordentlichen Auflistungen in der realen Welt und Schemainvarianz, wenn Felder fehlen, umbenannt oder neu angeordnet werden.

Ein Beispiel im Einkaufsstil macht es konkret. Serialisiere denselben Artikel auf mehrere Arten — „Titel: 'Elden Ring' | Plattform: PlayStation 5 | Zustand: Gebraucht — Wie neu | Preis: 34,99$“ und eine Permutation wie „Preis: 34,99$ | Titel: 'Elden Ring' | Zustand: Gebraucht—Wie neu | Plattform: 5“ — und bei manchen Pässen wird „Plattform“ weggelassen, während in der Beschreibung „Kompatibel mit PS5" verbleibt. PlayStation Trainieren Sie ergänzende Ziele wie die Vorhersage der Plattform von {title, price} aus und die Vorhersage eines Preissegments von {title, platform} aus. Da die Reihenfolge und sogar das Vorhandensein von Schlüsseln unterschiedlich sind, besteht die einzig stabile Strategie darin, die wahren Beziehungen zwischen den Attributen zu lernen, anstatt sich eine Vorlage auswendig zu lernen.

Die Art und Weise, wie Daten präsentiert werden, ist wichtig

LLMs lernen, indem sie anhand dessen, was sie bereits gesehen haben, das nächste Token vorhersagen. Die Reihenfolge der Felder und Ereignisse, die während des Trainings angezeigt werden, entscheidet darüber, was das Modell lernen kann. Stimmt das Trainingsformat mit der realen Aufgabe überein, landet der Verlust auf den exakten Entscheidungssteinen. Wenn Felder ohne Struktur zusammengewürfelt werden, lernt das Modell Abkürzungen oder merkt sich Beliebtheit und scheitert dann, wenn es aufgefordert wird, zwischen Optionen zu wählen.

Zeigen Sie zuerst die Situation, dann die Optionen und dann die Entscheidung. Wenn das Modell auch etwas über Ergebnisse oder Erklärungen erfahren soll, fügen Sie diese der Entscheidung hinzu.

Proben für CPT verpacken

Was ist Verpacken?

Packen bedeutet, jedes Sequenzfenster in den Trainingsdaten mit mehreren ganzen Beispielen zu füllen, sodass das Fenster dicht mit echten Tokens und nicht mit Füllungen ist.

Warum dies wichtig ist

Während des Trainings wird eine maximale Kontextlänge festgelegt (z. B. 8.192 Token). Stapel werden so geformt, dass sie [Batchgröße × Kontextlänge] sind. Wenn ein Trainingsbeispiel kürzer als die Kontextlänge ist, werden die verbleibenden Positionen aufgefüllt. Das Padding wird immer noch durch Aufmerksamkeit und MLP-Kernel gesteuert, auch wenn der Verlust maskiert wird. Daher wird Rechenleistung für Token bezahlt, die kein Lernsignal enthalten.

Wie packe ich

Um mehrere Proben zu packen, verketten Sie mehrere Trainingsproben mit einem [DOC] Trennzeichen dazwischen (beachten Sie das Leerzeichen davor und danach[DOC]), sodass die gesamte Länge innerhalb der gewünschten Kontextlänge bleibt.

Ein Beispiel für ein gepacktes Dokument sieht wie folgt aus:

{"text": "training sample 1 [DOC] training sample 2 [DOC] training sample 3"}