View a markdown version of this page

Funktionen des Inferenzcontainers - Amazon Nova

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Funktionen des Inferenzcontainers

Der Amazon SageMaker Nova-Inferenzcontainer enthält eine Reihe von Funktionen, die Sie aktivieren können, um das Modellverhalten während der Inferenz anzupassen. Jede Funktion wird in einer bestimmten Container-Version eingeführt und erfordert möglicherweise Umgebungsvariablen, Anforderungsparameter oder beides, um aktiviert zu werden.

Diese Seite listet die im Inferenzcontainer verfügbaren Funktionen auf, beschreibt, wie die einzelnen Funktionen aktiviert werden, und identifiziert die Container-Version, in der die Funktion eingeführt wurde. Verwenden Sie diese Referenz, um zu ermitteln, welche Funktionen für Ihre Bereitstellung verfügbar sind und wie Sie sie konfigurieren.

Funktionen, die über Umgebungsvariablen aktiviert werden, werden festgelegt, wenn Sie die SageMaker Modell- oder Endpunktkonfiguration erstellen. Nehmen Sie sie in den Environment Parameter des CreateModel API-Aufrufs auf. Funktionen, die über Anforderungsparameter aktiviert werden, werden pro Aufruf im Anforderungstext festgelegt.

Anmerkung

Verwenden Sie immer das neueste Container-Image, um Zugriff auf alle verfügbaren Funktionen zu erhalten. Das SM-Inference-latest Tag verweist derzeit aufv1.4.

Übersicht der Funktionen

Die folgende Tabelle bietet eine Kurzübersicht aller Funktionen, die im Amazon SageMaker Nova-Inferenzcontainer unterstützt werden.

Zusammenfassung der Funktionen des Inference-Containers
Feature Wie aktiviere ich Standard Unterstützte Modelle Eingeführt in
Standardtemperatur Umgebungsvariable 1.0 Alle Amazon Nova-Modelle v1.0
Standardmäßige Aufladung Umgebungsvariable 1.0 Alle Amazon Nova-Modelle v1.0
Standard top-k Umgebungsvariable -1(deaktiviert) Alle Amazon Nova-Modelle v1.0
Standardeinstellung für maximale Anzahl neuer Token Umgebungsvariable Maximale Kontextlänge des Modells Alle Amazon Nova-Modelle v1.0
Standard-Logprobs Umgebungsvariable Disabled Alle Amazon Nova-Modelle v1.0
Spekulative Eagle-3-Decodierung Standardmäßig aktiviert. Aktiviert Alle Amazon Nova-Modelle v1.0
KV-Cache-Datentyp Umgebungsvariable Entspricht dem Modelldatentyp Alle Amazon Nova-Modelle v1.3
Quantisierung Umgebungsvariable Deaktiviert* Alle Amazon Nova-Modelle v1.3
Anzahl der spekulativen Token Umgebungsvariable 3 Alle Amazon Nova-Modelle v1.4
Decodierung von Suffixen Umgebungsvariable Disabled Alle Amazon Nova-Modelle v1.4
Wichtig

* Die FP8-Quantisierung wird automatisch aktiviert und kann für die folgenden Kombinationen aus Modell und Instanztyp nicht deaktiviert werden:

  • Amazon Nova Lite aktiviert oder ml.g6.12xlarge ml.g6.24xlarge

  • Nova 2 Lite an ml.g6.48xlarge

Für diese Konfigurationen müssen Sie nichts einstellenQUANTIZATION_DTYPE. Details dazu finden Sie unter Quantisierung.

Standardtemperatur

Legt die Standard-Abtasttemperatur für alle an den Endpunkt gesendeten Inferenzanforderungen fest. Die Temperatur steuert, wie zufällig oder vorhersehbar die Ausgabe des Modells ist. Bei einem Wert von 0 wählt das Modell immer das wahrscheinlichste nächste Wort aus, wodurch eine konsistente und wiederholbare Ausgabe erzielt wird. Bei höheren Werten (bis zu2) ist das Modell eher bereit, weniger wahrscheinliche Wörter auszuwählen, was zu kreativeren und abwechslungsreicheren Antworten führt.

Verwendungszweck: Senken Sie die Temperatur (z. B. 0.1 auf0.3) für Aufgaben, für die sachliche, konsistente Antworten wie Klassifikation oder Datenextraktion erforderlich sind. Erhöhen Sie den Wert (z. B. 0.7 auf1.0) für kreative Aufgaben wie das Schreiben von Geschichten oder Brainstorming. Temperature arbeitet zusammen mit Top-P und Top-K — alle drei steuern, wie das Modell Tokens auswählt, und Sie können sie kombinieren, um das Ausgabeverhalten zu optimieren.

Eingeführt in

v1.0

Unterstützte Modelle

Alle Amazon Nova-Modelle

Wie aktiviere ich

Legen Sie die DEFAULT_TEMPERATURE Umgebungsvariable fest, wenn Sie das SageMaker Modell erstellen.

Standardwert

1.0

Zulässige Werte

Schwebe zwischen 0 und 2 (einschließlich)

Umgebungsvariable

"Environment": { "DEFAULT_TEMPERATURE": "0.7" }
Anmerkung

Sie können diese Standardeinstellung pro Anfrage überschreiben, indem Sie den temperature Parameter in den Anforderungstext aufnehmen.

Standardmäßige Aufladung

Legt den Standard-Top-P-Wert für alle Inferenzanforderungen fest. Top-p steuert die Ausgabediversität, indem die Auswahlmöglichkeiten des Modells auf eine Teilmenge der wahrscheinlichsten Wörter beschränkt werden. Insbesondere sortiert das Modell alle möglichen nächsten Wörter nach Wahrscheinlichkeit und berücksichtigt nur die kleinste Gruppe, deren kombinierte Wahrscheinlichkeit den obersten p-Wert erreicht. Ein Top-p von 0.9 bedeutet beispielsweise, dass das Modell nur Wörter berücksichtigt, die zusammen 90% der Wahrscheinlichkeit ausmachen, wobei die verbleibenden unwahrscheinlichen Optionen ignoriert werden.

Verwendungszweck: Verwenden Sie einen niedrigeren Top-p-Wert (z. B.0.5), damit sich das Modell an Wörter mit hoher Konfidenz hält und die Ausgabe zielgerichteter ist. Verwenden Sie einen höheren Wert (z. B.0.95), um mehr Abwechslung zu ermöglichen. Top-p wird häufig als Alternative zur Temperatur verwendet — beide regeln die Ausgangsdiversität, aber Top-P passt sich dynamisch an, basierend auf der Zuverlässigkeit des Modells bei jedem Schritt. Sie können beide zusammen verwenden. In diesem Fall wendet das Modell bei jedem Schritt die restriktivere Beschränkung an.

Eingeführt in

v1.0

Unterstützte Modelle

Alle Amazon Nova-Modelle

Wie aktiviere ich

Legen Sie die DEFAULT_TOP_P Umgebungsvariable fest, wenn Sie das SageMaker Modell erstellen.

Standardwert

1.0

Zulässige Werte

Schwebe zwischen 1e-10 und 1 (einschließlich)

Umgebungsvariable

"Environment": { "DEFAULT_TOP_P": "0.9" }
Anmerkung

Sie können diese Standardeinstellung pro Anfrage überschreiben, indem Sie den top_p Parameter in den Anforderungstext aufnehmen.

Standard top-k

Legt den Standard-Top-K-Wert für alle Inferenzanforderungen fest. Top-k begrenzt die Auswahlmöglichkeiten des Modells auf eine feste Anzahl der wahrscheinlichsten nächsten Wörter. Ein Wert von Top-K 50 bedeutet beispielsweise, dass das Modell in jedem Schritt nur die 50 wahrscheinlichsten Wörter berücksichtigt, unabhängig von ihren individuellen Wahrscheinlichkeiten. Der Wert von -1 deaktiviert diese Grenze, sodass das Modell alle möglichen Wörter berücksichtigen kann.

Verwendungszweck: Verwenden Sie top-k, wenn Sie eine feste Obergrenze für die Anzahl der vom Modell berücksichtigten Wortwahlen festlegen möchten. Niedrigere Werte (z. B.10) führen zu einer besser vorhersehbaren Ausgabe, während höhere Werte eine größere Vielfalt ermöglichen. Top-k können mit Temperatur und Top-p kombiniert werden — wenn mehrere Probenahmesteuerungen aktiv sind, wendet das Modell alle an, wobei für jeden Schritt die restriktivste Option verwendet wird.

Eingeführt in

v1.0

Unterstützte Modelle

Alle Amazon Nova-Modelle

Wie aktiviere ich

Legen Sie die DEFAULT_TOP_K Umgebungsvariable fest, wenn Sie das SageMaker Modell erstellen.

Standardwert

-1(deaktiviert)

Zulässige Werte

Ganzzahl -1 oder größer. Wird verwendet-1, um alle Tokens zu berücksichtigen.

Umgebungsvariable

"Environment": { "DEFAULT_TOP_K": "50" }
Anmerkung

Sie können diese Standardeinstellung pro Anfrage überschreiben, indem Sie den top_k Parameter in den Anforderungstext aufnehmen.

Standardeinstellung für maximale Anzahl neuer Token

Legt die standardmäßige maximale Anzahl von Tokens (Wörter oder Wortstücke) fest, die das Modell in einer Antwort generiert. Dieser Wert gilt für alle Anfragen, sofern er nicht überschrieben wird. Verwenden Sie diesen Wert, um die Antwortdauer zu kontrollieren und die Kosten an Ihrem Endpunkt zu verwalten.

Verwendungszweck: Legen Sie diese Option fest, wenn Sie eine konsistente maximale Antwortlänge für alle Anfragen durchsetzen möchten. Stellen Sie sie beispielsweise auf 256 für Aufgaben mit kurzen Antworten oder 2048 für die Generierung längerer Inhalte ein. Der zulässige Höchstwert hängt von dem für Ihren Endpunkt CONTEXT_LENGTH konfigurierten Wert ab, da Eingabe-Tokens plus Ausgabetokens die Kontextlänge nicht überschreiten dürfen.

Eingeführt in

v1.0

Unterstützte Modelle

Alle Amazon Nova-Modelle

Wie aktiviere ich

Legen Sie die DEFAULT_MAX_NEW_TOKENS Umgebungsvariable fest, wenn Sie das SageMaker Modell erstellen.

Standardwert

Die maximale Kontextlänge des Modells

Zulässige Werte

Ganzzahl 1 oder größer

Umgebungsvariable

"Environment": { "DEFAULT_MAX_NEW_TOKENS": "512" }
Anmerkung

Sie können diesen Standard pro Anfrage überschreiben, indem Sie den max_completion_tokens Parameter max_tokens or in den Anforderungstext aufnehmen. Der zulässige Höchstwert hängt von dem für Ihren Endpunkt CONTEXT_LENGTH konfigurierten Wert ab.

Standard-Logprobs

Legt die Standardanzahl von Log-Wahrscheinlichkeiten fest, die für jedes generierte Token zurückgegeben werden. Eine logarithmische Wahrscheinlichkeit ist ein numerischer Wert, der angibt, wie sicher das Modell bei der Auswahl der einzelnen Wörter war. Wenn diese Option aktiviert ist, enthält die Antwortvariable diese Werte für jedes Ausgabe-Token. Dies ist nützlich, um die Modellsicherheit zu bewerten, alternative Wortwahlen zu vergleichen und das Generierungsverhalten zu debuggen.

Verwendungszweck: Aktivieren Sie Logprobs, wenn Sie beurteilen möchten, wie zuverlässig das Modell in seiner Ausgabe ist — zum Beispiel, um Antworten mit niedriger Konfidenz für eine menschliche Überprüfung zu kennzeichnen oder um die Wahrscheinlichkeit verschiedener Abschlüsse zu vergleichen. Die Aktivierung von Logprobs kann die Antwortlatenz und die Größe der Antwortnutzlast leicht erhöhen.

Eingeführt in

v1.0

Unterstützte Modelle

Alle Amazon Nova-Modelle

Wie aktiviere ich

Legen Sie die DEFAULT_LOGPROBS Umgebungsvariable fest, wenn Sie das SageMaker Modell erstellen.

Standardwert

Disabled

Zulässige Werte

Ganzzahl zwischen 1 und 20 (einschließlich)

Umgebungsvariable

"Environment": { "DEFAULT_LOGPROBS": "5" }
Anmerkung

Sie können diese Standardeinstellung pro Anfrage überschreiben, indem Sie die top_logprobs Parameter logprobs und in den Anforderungstext aufnehmen. Die Aktivierung von Logprobs kann die Antwortlatenz leicht erhöhen.

Spekulative Eagle-3-Decodierung

Die spekulative Eagle3-Decodierung ist eine Optimierungstechnik, die die Textgenerierung beschleunigt. Dabei wird ein kleineres, schnelleres Entwurfsmodell verwendet, um mehrere Token im Voraus vorherzusagen, und diese Vorhersagen dann in einem einzigen Schritt mit dem Primärmodell verglichen. Wenn die Vorhersagen korrekt sind, generiert das Modell effektiv mehrere Token in der Zeit, die normalerweise benötigt würde, um eines zu generieren. Das primäre Modell verifiziert immer die Draft-Token, sodass die endgültige Ausgabe identisch mit der ist, die das primäre Modell alleine produzieren würde — nur die Geschwindigkeit ändert sich, nicht die Qualität.

Verwendungszweck: Die spekulative Decodierung von Eagle3 ist standardmäßig aktiviert und kommt den meisten Workloads zugute. Erwägen Sie, sie nur zu deaktivieren, wenn Sie unerwartetes Verhalten beobachten oder Leistungsmerkmale beim Debuggen isolieren müssen.

Eingeführt in

v1.0. Unterstützung für FP8-Quantisierung mit spekulativer Eagle3-Decodierung wurde hinzugefügt. v1.4

Unterstützte Modelle

Alle Amazon Nova-Modelle

Wie aktiviere ich

Die spekulative Eagle3-Decodierung ist standardmäßig aktiviert, ohne dass eine Konfiguration erforderlich ist. Verwenden Sie, um DISABLE_SPECULATIVE_DECODING es zu deaktivieren.

Standardwert

false(Die spekulative Eagle3-Decodierung ist aktiviert)

Zulässige Werte

true, false

Umgebungsvariable

Das folgende Beispiel deaktiviert die spekulative Eagle3-Decodierung:

"Environment": { "DISABLE_SPECULATIVE_DECODING": "true" }

KV-Cache-Datentyp

Legt den Datentyp für den Schlüsselwert-Cache (KV) fest, der bei der Inferenz verwendet wird. Der KV-Cache speichert den Speicher des Modells an frühere Token in einer Konversation, sodass jedes neue Token generiert werden kann, ohne die gesamte Eingabe erneut verarbeiten zu müssen. Bei langen Sequenzen kann dieser Cache viel GPU-Speicher verbrauchen. Wenn Sie den KV-Cache auf einen Datentyp mit niedrigerer Genauigkeit wie FP8 einstellen, wird der Speicherverbrauch reduziert und der Durchsatz kann auf Kosten geringfügiger numerischer Unterschiede in der Ausgabe verbessert werden.

Verwendungszweck: Aktivieren Sie den FP8-KV-Cache, wenn Sie längere Kontextlängen oder eine höhere Parallelität auf Ihrer Instance unterstützen müssen. Dies ist besonders bei GPU-Instances mit begrenztem Arbeitsspeicher nützlich. Testen Sie Ihren Anwendungsfall, um sicherzustellen, dass die Ausgabequalität Ihren Anforderungen entspricht, da eine geringere Genauigkeit zu leicht unterschiedlichen Ergebnissen führen kann.

Eingeführt in

v1.3

Unterstützte Modelle

Alle Amazon Nova-Modelle

Wie aktiviere ich

Legen Sie die KV_CACHE_DTYPE Umgebungsvariable fest, wenn Sie das SageMaker Modell erstellen.

Standardwert

Entspricht dem Datentyp des Modells

Zulässige Werte

fp8

Umgebungsvariable

"Environment": { "KV_CACHE_DTYPE": "fp8" }
Anmerkung

Eine Änderung des KV-Cache-Datentyps kann zu leicht unterschiedlichen Ausgaben führen als bei der Standardgenauigkeit. Testen Sie Ihren Anwendungsfall, um sicherzustellen, dass die Ausgabequalität Ihren Anforderungen entspricht.

Quantisierung

Legt den Quantisierungsdatentyp für Modellgewichte fest. Durch die Quantisierung werden die Gewichte des Modells in ein Format mit niedrigerer Genauigkeit (FP8 statt der standardmäßigen höheren Genauigkeit) komprimiert, wodurch der für das Modell benötigte GPU-Speicher reduziert wird. Dies kann den Inferenzdurchsatz verbessern und es größeren Modellen ermöglichen, auf kleinere Instanztypen zu passen, ohne dass sich dies auf die Ausgabequalität auswirkt.

Verwendungszweck: Verwenden Sie die FP8-Quantisierung, wenn Sie den Speicherverbrauch reduzieren möchten, um eine höhere Parallelität zu unterstützen, oder wenn Sie ein Modell an einen kleineren Instanztyp anpassen möchten. Beachten Sie, dass für einige Kombinationen aus Modell und Instanztyp eine automatische FP8-Quantisierung erforderlich ist — siehe die Warnung unten.

Eingeführt in

v1.3

Unterstützte Modelle

Alle Amazon Nova-Modelle

Wie aktiviere ich

Legen Sie die QUANTIZATION_DTYPE Umgebungsvariable fest, wenn Sie das SageMaker Modell erstellen.

Standardwert

Deaktiviert. Die FP8-Quantisierung wird jedoch automatisch für bestimmte Kombinationen aus Modell und Instanztyp aktiviert. Siehe den Hinweis unten.

Zulässige Werte

fp8

Umgebungsvariable

"Environment": { "QUANTIZATION_DTYPE": "fp8" }
Wichtig

Die folgenden Kombinationen aus Modell und Instanztyp erfordern eine FP8-Quantisierung. Für diese Konfigurationen wird die Quantisierung automatisch aktiviert und kann nicht deaktiviert oder überschrieben werden:

  • Amazon Nova Lite aktiviert oder ml.g6.12xlarge ml.g6.24xlarge

  • Nova 2 Lite an ml.g6.48xlarge

Einzelheiten zu allen anderen Konfigurationen finden Unterstützte Modelle und Instanzen Sie unter.

Anzahl der spekulativen Token

Steuert, wie viele Token das Entwurfsmodell bei jedem spekulativen Decodierungsschritt von Eagle3 im Voraus vorhersagt. Ein höherer Wert bedeutet, dass das Entwurfsmodell versucht, mehr Token gleichzeitig vorherzusagen, was den Durchsatz verbessern kann, wenn die Vorhersagen korrekt sind. Wenn die Prognosen des Modellentwurfs häufig vom Primärmodell abweichen, kann ein niedrigerer Wert effizienter sein.

Verwendungszweck: Erhöhen Sie diesen Wert, wenn Ihre Arbeitslast vorhersehbare Ausgabemuster (z. B. strukturierte Daten oder Vorlagentext) erzeugt, bei denen der Modellentwurf wahrscheinlich richtig tippt. Verringern Sie den Wert für kreative oder stark variable Ergebnisse, bei denen die Vorhersagen weniger zuverlässig sind.

Eingeführt in

v1.4

Unterstützte Modelle

Alle Amazon Nova-Modelle

Wie aktiviere ich

Legen Sie die NUM_SPECULATIVE_TOKENS Umgebungsvariable fest, wenn Sie das SageMaker Modell erstellen.

Standardwert

3

Zulässige Werte

Ganzzahl zwischen 1 und 10 (einschließlich)

Umgebungsvariable

"Environment": { "NUM_SPECULATIVE_TOKENS": "5" }
Anmerkung

Diese Einstellung gilt nur, wenn die spekulative Eagle3-Decodierung aktiviert ist (ist). DISABLE_SPECULATIVE_DECODING false Sie hat keine Auswirkung, wenn die spekulative Dekodierung deaktiviert ist oder wenn die Suffixdekodierung verwendet wird.

Decodierung von Suffixen

Die Suffixdecodierung ist eine alternative Methode zur Beschleunigung der Textgenerierung. Anstatt ein separates Entwurfsmodell zu verwenden (wie es Eagle3 tut), sucht die Suffixdekodierung nach wiederholten Mustern im bereits generierten Text oder in der Eingabeaufforderung und verwendet diese Muster erneut, um zukünftige Tokens vorherzusagen. Dieser Ansatz eignet sich gut, wenn die Ausgabe wahrscheinlich wiederholte Phrasen, strukturierte Formate oder Inhalte enthält, die der Eingabe sehr ähnlich sind.

Einsatzgebiet: Verwenden Sie die Suffixdekodierung für Aufgaben, bei denen die Ausgabe sich wiederholende Muster enthält, z. B. das Generieren strukturierter Daten, das Ausfüllen von Vorlagen oder das Zusammenfassen von Inhalten, bei denen Phrasen aus der Quelle wiederverwendet werden. Für allgemeine Generierungen, bei denen die Ausgabe sehr unterschiedlich ist, bietet die Eagle3-Standardmethode in der Regel einen besseren Durchsatz.

Eingeführt in

v1.4

Unterstützte Modelle

Alle Amazon Nova-Modelle

Wie aktiviere ich

Stellen Sie die SPECULATIVE_DECODING_METHOD Umgebungsvariable suffix beim Erstellen des SageMaker Modells auf ein.

Standardwert

eagle3

Zulässige Werte

eagle3, suffix

Umgebungsvariable

"Environment": { "SPECULATIVE_DECODING_METHOD": "suffix" }
Anmerkung

Um die Suffixdekodierung verwenden zu können, DISABLE_SPECULATIVE_DECODING muss sie auf false (Standardeinstellung) gesetzt sein. Die Einstellung DISABLE_SPECULATIVE_DECODING auf true deaktiviert alle spekulativen Dekodierungsmethoden, einschließlich der Suffixdekodierung.