Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Amazon-Bedrock-Inferenz
Nachdem Sie Ihr Amazon Nova-Modell trainiert und getestet haben, können Sie es auf Amazon Bedrock bereitstellen, um daraus Rückschlüsse im Produktionsmaßstab ziehen zu können. Der Bereitstellungsprozess umfasst die Erstellung eines Amazon Bedrock-Modells mit der CreateCustomModel API, den Export Ihrer Modellartefakte aus einem verwalteten Amazon S3-Bucket dorthin und dann, sobald das Modell AKTIV ist, die Konfiguration eines Endpunkts mit bedarfsgesteuerter oder bereitgestellter Durchsatzinferenz.
Nachdem Sie ein benutzerdefiniertes Modell erstellt haben SageMaker, können Sie es mithilfe der CreateCustomModel API vom Treuhandkonto aus auf Amazon Bedrock bereitstellen, um die Inferenz auszuführen. SageMaker Sie können es dann verwenden CreateCustomModelDeployment , um einen OD-Inferenzendpunkt zu erstellen oder eine bereitgestellte Durchsatzinferenz für ein PEFT-Modell (Parameter Efficient Fine Tuned) einzurichten. Sie können eine bereitgestellte Durchsatzinferenz für ein benutzerdefiniertes Full-Rank-Modell einrichten.
Sie können das SageMaker Python-SDK auch verwenden, um benutzerdefinierte Amazon Nova-Modelle bereitzustellen. Das SageMaker Python-SDK bietet eine optimierte Erfahrung für die Bereitstellung trainierter Modelle auf Amazon Bedrock On-Demand - oder SageMaker AI Real-time Inference-Endpunkten. Weitere Informationen finden Sie unter Anpassen mit dem Python-SDK. SageMaker
Eine ausführliche Anleitung zum Einrichten der Amazon Bedrock-Inferenz für ein benutzerdefiniertes Modell finden Sie unter Bereitstellen benutzerdefinierter Amazon Nova-Modelle auf Amazon Bedrock.
Der folgende Abschnitt enthält weitere Informationen zur On-Demand Inferenz auf benutzerdefinierten Modellen.
On-demand Rückschlüsse auf benutzerdefinierte Modelle
On-demand Mit der (OD) -Inferenz können Sie Inferenzen für Ihre benutzerdefinierten Amazon Nova-Modelle ausführen, ohne die bereitgestellten Durchsatzendpunkte beibehalten zu müssen. Dies unterstützt Sie bei der Kostenoptimierung und ermöglicht eine effiziente Skalierung. Bei On-demand Inferenz werden Ihnen Gebühren auf der Grundlage der Nutzung berechnet, gemessen in Tokens, sowohl ein- als auch ausgehender.
Kompatibilitätsanforderungen
Es gelten die folgenden Kompatibilitätsanforderungen:
-
OD-Inferenz wird für benutzerdefinierte Verständigungsmodelle von Amazon Nova Pro, Lite und Micro unterstützt. OD-Inferenz wird für Nova-Modelle zur benutzerdefinierten Inhaltsgenerierung nicht unterstützt.
-
OD-Inferenz wird für benutzerdefinierte Understanding-Modelle von Amazon Nova unterstützt, die nach dem 16. Juli 2025 trainiert wurden. Benutzerdefinierte Modelle, die vor dem 16. Juli 2025 trainiert wurden, sind nicht mit OD-Inferenz kompatibel.
-
Amazon-Bedrock-Anpassung: OD-Inferenz wird für Modelle unterstützt, die mit Amazon Bedrock angepasst wurden, sowie für Schülermodelle, die mit Amazon Bedrock aus einem Lehrermodell destilliert wurden.
-
SageMaker KI-Anpassung: Bei Modellen, die in SageMaker KI angepasst wurden, wird die OD-Inferenz nur für Parameter-efficient fein abgestimmte Modelle (PEFT) unterstützt, wenn das Modell auf Amazon Bedrock gehostet wird. Dazu gehören Direkte Präferenzoptimierung und PEFT. OD-Inferenz wird für fein abgestimmte Modelle nicht unterstützt. Full-rank
Modelltraining und Inferenz
Wenn Sie nach dem 16. Juli 2025 ein neues benutzerdefiniertes Amazon Nova Pro-, Lite- oder Micro-Modell auf Amazon Bedrock oder SageMaker AI mithilfe von PEFT trainieren, ist das Modell automatisch sowohl mit bereitgestellten als auch mit On-Demand-Inferenzoptionen kompatibel. Sie können bei der Bereitstellung Ihres Modells Ihre bevorzugte Inferenzmethode auswählen.
Um die OD-Inferenz mit einem nach dem 16. Juli 2025 trainierten Modell zu verwenden, führen Sie bitte die folgenden Schritte aus:
-
Erstellen Sie einen neuen Feinabstimmungsjob entweder mit der Amazon Bedrock-Anpassungs-API oder der AI-Anpassungs-API. SageMaker
-
Stellen Sie das neu trainierte Modell mithilfe der API auf Amazon Bedrock bereit. CreateCustomModel
-
Stellen Sie es mithilfe der API für On-Demand-Inferenzen bereit. CustomModelDeployment
Ratenbegrenzungen
Die folgenden Begrenzungen für Anfragen pro Minute (RPM) und Token pro Minute (TPM) gelten für On-Demand-Inferenzanfragen:
| Basismodell für benutzerdefiniertes Modell | RPM pro Bereitstellung eines benutzerdefinierten Modells | TPM pro benutzerdefinierter Modellbereitstellung |
|---|---|---|
| Nova 2 Lite | 2.000 | 4.000.000 |
Weitere Informationen zu den für Amazon Nova verfügbaren Kontingenten finden Sie unter Kontingente für Amazon Nova.
Latenz
Es ist mit einem Unterschied in der End-to-End-Latenz (d. h. Time To First Token, TTFT) von 20 bis 55 % zwischen dem Aufruf des Basismodells und dem Adapter zu rechnen. Der genaue Latenzwert variiert je nach Modellgröße und entspricht den Branchenstandards.