Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Funktionen des Inferenzcontainers
Der Amazon SageMaker Nova-Inferenzcontainer enthält eine Reihe von Funktionen, die Sie aktivieren können, um das Modellverhalten während der Inferenz anzupassen. Jede Funktion wird in einer bestimmten Container-Version eingeführt und erfordert möglicherweise Umgebungsvariablen, Anforderungsparameter oder beides, um aktiviert zu werden.
Diese Seite listet die im Inferenzcontainer verfügbaren Funktionen auf, beschreibt, wie die einzelnen Funktionen aktiviert werden, und identifiziert die Container-Version, in der die Funktion eingeführt wurde. Verwenden Sie diese Referenz, um zu ermitteln, welche Funktionen für Ihre Bereitstellung verfügbar sind und wie Sie sie konfigurieren.
Funktionen, die über Umgebungsvariablen aktiviert werden, werden festgelegt, wenn Sie die SageMaker Modell- oder Endpunktkonfiguration erstellen. Nehmen Sie sie in den Environment Parameter des CreateModel API-Aufrufs auf. Funktionen, die über Anforderungsparameter aktiviert werden, werden pro Aufruf im Anforderungstext festgelegt.
Anmerkung
Verwenden Sie immer das neueste Container-Image, um Zugriff auf alle verfügbaren Funktionen zu erhalten. Das SM-Inference-latest Tag verweist derzeit aufv1.4.
Übersicht der Funktionen
Die folgende Tabelle bietet eine Kurzübersicht aller Funktionen, die im Amazon SageMaker Nova-Inferenzcontainer unterstützt werden.
| Feature | Wie aktiviere ich | Standard | Unterstützte Modelle | Eingeführt in |
|---|---|---|---|---|
| Standardtemperatur | Umgebungsvariable | 1.0 |
Alle Amazon Nova-Modelle | v1.0 |
| Standardmäßige Aufladung | Umgebungsvariable | 1.0 |
Alle Amazon Nova-Modelle | v1.0 |
| Standard top-k | Umgebungsvariable | -1(deaktiviert) |
Alle Amazon Nova-Modelle | v1.0 |
| Standardeinstellung für maximale Anzahl neuer Token | Umgebungsvariable | Maximale Kontextlänge des Modells | Alle Amazon Nova-Modelle | v1.0 |
| Standard-Logprobs | Umgebungsvariable | Disabled | Alle Amazon Nova-Modelle | v1.0 |
| Spekulative Eagle-3-Decodierung | Standardmäßig aktiviert. | Aktiviert | Alle Amazon Nova-Modelle | v1.0 |
| KV-Cache-Datentyp | Umgebungsvariable | Entspricht dem Modelldatentyp | Alle Amazon Nova-Modelle | v1.3 |
| Quantisierung | Umgebungsvariable | Deaktiviert* | Alle Amazon Nova-Modelle | v1.3 |
| Anzahl der spekulativen Token | Umgebungsvariable | 3 |
Alle Amazon Nova-Modelle | v1.4 |
| Decodierung von Suffixen | Umgebungsvariable | Disabled | Alle Amazon Nova-Modelle | v1.4 |
Wichtig
* Die FP8-Quantisierung wird automatisch aktiviert und kann für die folgenden Kombinationen aus Modell und Instanztyp nicht deaktiviert werden:
-
Amazon Nova Lite aktiviert oder
ml.g6.12xlargeml.g6.24xlarge -
Nova 2 Lite an
ml.g6.48xlarge
Für diese Konfigurationen müssen Sie nichts einstellenQUANTIZATION_DTYPE. Details dazu finden Sie unter Quantisierung.
Standardtemperatur
Legt die Standard-Abtasttemperatur für alle an den Endpunkt gesendeten Inferenzanforderungen fest. Die Temperatur steuert, wie zufällig oder vorhersehbar die Ausgabe des Modells ist. Bei einem Wert von 0 wählt das Modell immer das wahrscheinlichste nächste Wort aus, wodurch eine konsistente und wiederholbare Ausgabe erzielt wird. Bei höheren Werten (bis zu2) ist das Modell eher bereit, weniger wahrscheinliche Wörter auszuwählen, was zu kreativeren und abwechslungsreicheren Antworten führt.
Verwendungszweck: Senken Sie die Temperatur (z. B. 0.1 auf0.3) für Aufgaben, für die sachliche, konsistente Antworten wie Klassifikation oder Datenextraktion erforderlich sind. Erhöhen Sie den Wert (z. B. 0.7 auf1.0) für kreative Aufgaben wie das Schreiben von Geschichten oder Brainstorming. Temperature arbeitet zusammen mit Top-P und Top-K — alle drei steuern, wie das Modell Tokens auswählt, und Sie können sie kombinieren, um das Ausgabeverhalten zu optimieren.
- Eingeführt in
v1.0- Unterstützte Modelle
Alle Amazon Nova-Modelle
- Wie aktiviere ich
-
Legen Sie die
DEFAULT_TEMPERATUREUmgebungsvariable fest, wenn Sie das SageMaker Modell erstellen. - Standardwert
1.0- Zulässige Werte
Schwebe zwischen
0und2(einschließlich)
Umgebungsvariable
"Environment": { "DEFAULT_TEMPERATURE": "0.7" }
Anmerkung
Sie können diese Standardeinstellung pro Anfrage überschreiben, indem Sie den temperature Parameter in den Anforderungstext aufnehmen.
Standardmäßige Aufladung
Legt den Standard-Top-P-Wert für alle Inferenzanforderungen fest. Top-p steuert die Ausgabediversität, indem die Auswahlmöglichkeiten des Modells auf eine Teilmenge der wahrscheinlichsten Wörter beschränkt werden. Insbesondere sortiert das Modell alle möglichen nächsten Wörter nach Wahrscheinlichkeit und berücksichtigt nur die kleinste Gruppe, deren kombinierte Wahrscheinlichkeit den obersten p-Wert erreicht. Ein Top-p von 0.9 bedeutet beispielsweise, dass das Modell nur Wörter berücksichtigt, die zusammen 90% der Wahrscheinlichkeit ausmachen, wobei die verbleibenden unwahrscheinlichen Optionen ignoriert werden.
Verwendungszweck: Verwenden Sie einen niedrigeren Top-p-Wert (z. B.0.5), damit sich das Modell an Wörter mit hoher Konfidenz hält und die Ausgabe zielgerichteter ist. Verwenden Sie einen höheren Wert (z. B.0.95), um mehr Abwechslung zu ermöglichen. Top-p wird häufig als Alternative zur Temperatur verwendet — beide regeln die Ausgangsdiversität, aber Top-P passt sich dynamisch an, basierend auf der Zuverlässigkeit des Modells bei jedem Schritt. Sie können beide zusammen verwenden. In diesem Fall wendet das Modell bei jedem Schritt die restriktivere Beschränkung an.
- Eingeführt in
v1.0- Unterstützte Modelle
Alle Amazon Nova-Modelle
- Wie aktiviere ich
-
Legen Sie die
DEFAULT_TOP_PUmgebungsvariable fest, wenn Sie das SageMaker Modell erstellen. - Standardwert
1.0- Zulässige Werte
Schwebe zwischen
1e-10und1(einschließlich)
Umgebungsvariable
"Environment": { "DEFAULT_TOP_P": "0.9" }
Anmerkung
Sie können diese Standardeinstellung pro Anfrage überschreiben, indem Sie den top_p Parameter in den Anforderungstext aufnehmen.
Standard top-k
Legt den Standard-Top-K-Wert für alle Inferenzanforderungen fest. Top-k begrenzt die Auswahlmöglichkeiten des Modells auf eine feste Anzahl der wahrscheinlichsten nächsten Wörter. Ein Wert von Top-K 50 bedeutet beispielsweise, dass das Modell in jedem Schritt nur die 50 wahrscheinlichsten Wörter berücksichtigt, unabhängig von ihren individuellen Wahrscheinlichkeiten. Der Wert von -1 deaktiviert diese Grenze, sodass das Modell alle möglichen Wörter berücksichtigen kann.
Verwendungszweck: Verwenden Sie top-k, wenn Sie eine feste Obergrenze für die Anzahl der vom Modell berücksichtigten Wortwahlen festlegen möchten. Niedrigere Werte (z. B.10) führen zu einer besser vorhersehbaren Ausgabe, während höhere Werte eine größere Vielfalt ermöglichen. Top-k können mit Temperatur und Top-p kombiniert werden — wenn mehrere Probenahmesteuerungen aktiv sind, wendet das Modell alle an, wobei für jeden Schritt die restriktivste Option verwendet wird.
- Eingeführt in
v1.0- Unterstützte Modelle
Alle Amazon Nova-Modelle
- Wie aktiviere ich
-
Legen Sie die
DEFAULT_TOP_KUmgebungsvariable fest, wenn Sie das SageMaker Modell erstellen. - Standardwert
-1(deaktiviert)- Zulässige Werte
Ganzzahl
-1oder größer. Wird verwendet-1, um alle Tokens zu berücksichtigen.
Umgebungsvariable
"Environment": { "DEFAULT_TOP_K": "50" }
Anmerkung
Sie können diese Standardeinstellung pro Anfrage überschreiben, indem Sie den top_k Parameter in den Anforderungstext aufnehmen.
Standardeinstellung für maximale Anzahl neuer Token
Legt die standardmäßige maximale Anzahl von Tokens (Wörter oder Wortstücke) fest, die das Modell in einer Antwort generiert. Dieser Wert gilt für alle Anfragen, sofern er nicht überschrieben wird. Verwenden Sie diesen Wert, um die Antwortdauer zu kontrollieren und die Kosten an Ihrem Endpunkt zu verwalten.
Verwendungszweck: Legen Sie diese Option fest, wenn Sie eine konsistente maximale Antwortlänge für alle Anfragen durchsetzen möchten. Stellen Sie sie beispielsweise auf 256 für Aufgaben mit kurzen Antworten oder 2048 für die Generierung längerer Inhalte ein. Der zulässige Höchstwert hängt von dem für Ihren Endpunkt CONTEXT_LENGTH konfigurierten Wert ab, da Eingabe-Tokens plus Ausgabetokens die Kontextlänge nicht überschreiten dürfen.
- Eingeführt in
v1.0- Unterstützte Modelle
Alle Amazon Nova-Modelle
- Wie aktiviere ich
-
Legen Sie die
DEFAULT_MAX_NEW_TOKENSUmgebungsvariable fest, wenn Sie das SageMaker Modell erstellen. - Standardwert
Die maximale Kontextlänge des Modells
- Zulässige Werte
Ganzzahl
1oder größer
Umgebungsvariable
"Environment": { "DEFAULT_MAX_NEW_TOKENS": "512" }
Anmerkung
Sie können diesen Standard pro Anfrage überschreiben, indem Sie den max_completion_tokens Parameter max_tokens or in den Anforderungstext aufnehmen. Der zulässige Höchstwert hängt von dem für Ihren Endpunkt CONTEXT_LENGTH konfigurierten Wert ab.
Standard-Logprobs
Legt die Standardanzahl von Log-Wahrscheinlichkeiten fest, die für jedes generierte Token zurückgegeben werden. Eine logarithmische Wahrscheinlichkeit ist ein numerischer Wert, der angibt, wie sicher das Modell bei der Auswahl der einzelnen Wörter war. Wenn diese Option aktiviert ist, enthält die Antwortvariable diese Werte für jedes Ausgabe-Token. Dies ist nützlich, um die Modellsicherheit zu bewerten, alternative Wortwahlen zu vergleichen und das Generierungsverhalten zu debuggen.
Verwendungszweck: Aktivieren Sie Logprobs, wenn Sie beurteilen möchten, wie zuverlässig das Modell in seiner Ausgabe ist — zum Beispiel, um Antworten mit niedriger Konfidenz für eine menschliche Überprüfung zu kennzeichnen oder um die Wahrscheinlichkeit verschiedener Abschlüsse zu vergleichen. Die Aktivierung von Logprobs kann die Antwortlatenz und die Größe der Antwortnutzlast leicht erhöhen.
- Eingeführt in
v1.0- Unterstützte Modelle
Alle Amazon Nova-Modelle
- Wie aktiviere ich
-
Legen Sie die
DEFAULT_LOGPROBSUmgebungsvariable fest, wenn Sie das SageMaker Modell erstellen. - Standardwert
Disabled
- Zulässige Werte
Ganzzahl zwischen
1und20(einschließlich)
Umgebungsvariable
"Environment": { "DEFAULT_LOGPROBS": "5" }
Anmerkung
Sie können diese Standardeinstellung pro Anfrage überschreiben, indem Sie die top_logprobs Parameter logprobs und in den Anforderungstext aufnehmen. Die Aktivierung von Logprobs kann die Antwortlatenz leicht erhöhen.
Spekulative Eagle-3-Decodierung
Die spekulative Eagle3-Decodierung ist eine Optimierungstechnik, die die Textgenerierung beschleunigt. Dabei wird ein kleineres, schnelleres Entwurfsmodell verwendet, um mehrere Token im Voraus vorherzusagen, und diese Vorhersagen dann in einem einzigen Schritt mit dem Primärmodell verglichen. Wenn die Vorhersagen korrekt sind, generiert das Modell effektiv mehrere Token in der Zeit, die normalerweise benötigt würde, um eines zu generieren. Das primäre Modell verifiziert immer die Draft-Token, sodass die endgültige Ausgabe identisch mit der ist, die das primäre Modell alleine produzieren würde — nur die Geschwindigkeit ändert sich, nicht die Qualität.
Verwendungszweck: Die spekulative Decodierung von Eagle3 ist standardmäßig aktiviert und kommt den meisten Workloads zugute. Erwägen Sie, sie nur zu deaktivieren, wenn Sie unerwartetes Verhalten beobachten oder Leistungsmerkmale beim Debuggen isolieren müssen.
- Eingeführt in
v1.0. Unterstützung für FP8-Quantisierung mit spekulativer Eagle3-Decodierung wurde hinzugefügt.v1.4- Unterstützte Modelle
Alle Amazon Nova-Modelle
- Wie aktiviere ich
-
Die spekulative Eagle3-Decodierung ist standardmäßig aktiviert, ohne dass eine Konfiguration erforderlich ist. Verwenden Sie, um
DISABLE_SPECULATIVE_DECODINGes zu deaktivieren. - Standardwert
false(Die spekulative Eagle3-Decodierung ist aktiviert)- Zulässige Werte
true,false
Umgebungsvariable
Das folgende Beispiel deaktiviert die spekulative Eagle3-Decodierung:
"Environment": { "DISABLE_SPECULATIVE_DECODING": "true" }
KV-Cache-Datentyp
Legt den Datentyp für den Schlüsselwert-Cache (KV) fest, der bei der Inferenz verwendet wird. Der KV-Cache speichert den Speicher des Modells an frühere Token in einer Konversation, sodass jedes neue Token generiert werden kann, ohne die gesamte Eingabe erneut verarbeiten zu müssen. Bei langen Sequenzen kann dieser Cache viel GPU-Speicher verbrauchen. Wenn Sie den KV-Cache auf einen Datentyp mit niedrigerer Genauigkeit wie FP8 einstellen, wird der Speicherverbrauch reduziert und der Durchsatz kann auf Kosten geringfügiger numerischer Unterschiede in der Ausgabe verbessert werden.
Verwendungszweck: Aktivieren Sie den FP8-KV-Cache, wenn Sie längere Kontextlängen oder eine höhere Parallelität auf Ihrer Instance unterstützen müssen. Dies ist besonders bei GPU-Instances mit begrenztem Arbeitsspeicher nützlich. Testen Sie Ihren Anwendungsfall, um sicherzustellen, dass die Ausgabequalität Ihren Anforderungen entspricht, da eine geringere Genauigkeit zu leicht unterschiedlichen Ergebnissen führen kann.
- Eingeführt in
v1.3- Unterstützte Modelle
Alle Amazon Nova-Modelle
- Wie aktiviere ich
-
Legen Sie die
KV_CACHE_DTYPEUmgebungsvariable fest, wenn Sie das SageMaker Modell erstellen. - Standardwert
Entspricht dem Datentyp des Modells
- Zulässige Werte
fp8
Umgebungsvariable
"Environment": { "KV_CACHE_DTYPE": "fp8" }
Anmerkung
Eine Änderung des KV-Cache-Datentyps kann zu leicht unterschiedlichen Ausgaben führen als bei der Standardgenauigkeit. Testen Sie Ihren Anwendungsfall, um sicherzustellen, dass die Ausgabequalität Ihren Anforderungen entspricht.
Quantisierung
Legt den Quantisierungsdatentyp für Modellgewichte fest. Durch die Quantisierung werden die Gewichte des Modells in ein Format mit niedrigerer Genauigkeit (FP8 statt der standardmäßigen höheren Genauigkeit) komprimiert, wodurch der für das Modell benötigte GPU-Speicher reduziert wird. Dies kann den Inferenzdurchsatz verbessern und es größeren Modellen ermöglichen, auf kleinere Instanztypen zu passen, ohne dass sich dies auf die Ausgabequalität auswirkt.
Verwendungszweck: Verwenden Sie die FP8-Quantisierung, wenn Sie den Speicherverbrauch reduzieren möchten, um eine höhere Parallelität zu unterstützen, oder wenn Sie ein Modell an einen kleineren Instanztyp anpassen möchten. Beachten Sie, dass für einige Kombinationen aus Modell und Instanztyp eine automatische FP8-Quantisierung erforderlich ist — siehe die Warnung unten.
- Eingeführt in
v1.3- Unterstützte Modelle
Alle Amazon Nova-Modelle
- Wie aktiviere ich
-
Legen Sie die
QUANTIZATION_DTYPEUmgebungsvariable fest, wenn Sie das SageMaker Modell erstellen. - Standardwert
Deaktiviert. Die FP8-Quantisierung wird jedoch automatisch für bestimmte Kombinationen aus Modell und Instanztyp aktiviert. Siehe den Hinweis unten.
- Zulässige Werte
fp8
Umgebungsvariable
"Environment": { "QUANTIZATION_DTYPE": "fp8" }
Wichtig
Die folgenden Kombinationen aus Modell und Instanztyp erfordern eine FP8-Quantisierung. Für diese Konfigurationen wird die Quantisierung automatisch aktiviert und kann nicht deaktiviert oder überschrieben werden:
-
Amazon Nova Lite aktiviert oder
ml.g6.12xlargeml.g6.24xlarge -
Nova 2 Lite an
ml.g6.48xlarge
Einzelheiten zu allen anderen Konfigurationen finden Unterstützte Modelle und Instanzen Sie unter.
Anzahl der spekulativen Token
Steuert, wie viele Token das Entwurfsmodell bei jedem spekulativen Decodierungsschritt von Eagle3 im Voraus vorhersagt. Ein höherer Wert bedeutet, dass das Entwurfsmodell versucht, mehr Token gleichzeitig vorherzusagen, was den Durchsatz verbessern kann, wenn die Vorhersagen korrekt sind. Wenn die Prognosen des Modellentwurfs häufig vom Primärmodell abweichen, kann ein niedrigerer Wert effizienter sein.
Verwendungszweck: Erhöhen Sie diesen Wert, wenn Ihre Arbeitslast vorhersehbare Ausgabemuster (z. B. strukturierte Daten oder Vorlagentext) erzeugt, bei denen der Modellentwurf wahrscheinlich richtig tippt. Verringern Sie den Wert für kreative oder stark variable Ergebnisse, bei denen die Vorhersagen weniger zuverlässig sind.
- Eingeführt in
v1.4- Unterstützte Modelle
Alle Amazon Nova-Modelle
- Wie aktiviere ich
-
Legen Sie die
NUM_SPECULATIVE_TOKENSUmgebungsvariable fest, wenn Sie das SageMaker Modell erstellen. - Standardwert
3- Zulässige Werte
Ganzzahl zwischen
1und10(einschließlich)
Umgebungsvariable
"Environment": { "NUM_SPECULATIVE_TOKENS": "5" }
Anmerkung
Diese Einstellung gilt nur, wenn die spekulative Eagle3-Decodierung aktiviert ist (ist). DISABLE_SPECULATIVE_DECODING false Sie hat keine Auswirkung, wenn die spekulative Dekodierung deaktiviert ist oder wenn die Suffixdekodierung verwendet wird.
Decodierung von Suffixen
Die Suffixdecodierung ist eine alternative Methode zur Beschleunigung der Textgenerierung. Anstatt ein separates Entwurfsmodell zu verwenden (wie es Eagle3 tut), sucht die Suffixdekodierung nach wiederholten Mustern im bereits generierten Text oder in der Eingabeaufforderung und verwendet diese Muster erneut, um zukünftige Tokens vorherzusagen. Dieser Ansatz eignet sich gut, wenn die Ausgabe wahrscheinlich wiederholte Phrasen, strukturierte Formate oder Inhalte enthält, die der Eingabe sehr ähnlich sind.
Einsatzgebiet: Verwenden Sie die Suffixdekodierung für Aufgaben, bei denen die Ausgabe sich wiederholende Muster enthält, z. B. das Generieren strukturierter Daten, das Ausfüllen von Vorlagen oder das Zusammenfassen von Inhalten, bei denen Phrasen aus der Quelle wiederverwendet werden. Für allgemeine Generierungen, bei denen die Ausgabe sehr unterschiedlich ist, bietet die Eagle3-Standardmethode in der Regel einen besseren Durchsatz.
- Eingeführt in
v1.4- Unterstützte Modelle
Alle Amazon Nova-Modelle
- Wie aktiviere ich
-
Stellen Sie die
SPECULATIVE_DECODING_METHODUmgebungsvariablesuffixbeim Erstellen des SageMaker Modells auf ein. - Standardwert
eagle3- Zulässige Werte
eagle3,suffix
Umgebungsvariable
"Environment": { "SPECULATIVE_DECODING_METHOD": "suffix" }
Anmerkung
Um die Suffixdekodierung verwenden zu können, DISABLE_SPECULATIVE_DECODING muss sie auf false (Standardeinstellung) gesetzt sein. Die Einstellung DISABLE_SPECULATIVE_DECODING auf true deaktiviert alle spekulativen Dekodierungsmethoden, einschließlich der Suffixdekodierung.