Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Optimieren der Modellinferenz für die Latenz
Anmerkung
Die Funktion „Latenzoptimierte Inferenz“ befindet sich in der Vorschauversion von Amazon Bedrock und kann sich ändern.
Latency-optimized Inferenz für Basismodelle Amazon Bedrock bietet schnellere Reaktionszeiten und eine verbesserte Reaktionsfähigkeit für KI-Anwendungen. Die optimierten Versionen von Amazon Nova Pro, des Modells Claude 3.5 Haiku von Anthropic
Für den Zugriff auf die Funktion zur Latenzoptimierung sind keine zusätzlichen Einstellungen oder Modellfeinabstimmungen erforderlich, sodass bestehende Anwendungen sofort verbessert und schnellere Reaktionszeiten erzielt werden können. Sie können den Parameter „Latenz“ auf „optimiert“ festlegen, während Sie die Laufzeit-API von Amazon Bedrock aufrufen. Wenn Sie „Standard“ als Aufrufoption auswählen, werden Ihre Anforderungen per Standardinferenz bearbeitet. Standardmäßig werden alle Anforderungen über „Standard“ weitergeleitet.
"performanceConfig" : { "latency" : "standard | optimized" }
Sobald Sie das Nutzungskontingent für die Latenzoptimierung für ein Modell erreicht haben, versuchen wir, die Anforderung mit der Standardlatenz zu bearbeiten. In solchen Fällen wird die Anforderung mit Standard-Latenzraten berechnet. Die Latenzkonfiguration für eine bereitgestellte Anfrage ist in der API-Antwort und AWS CloudTrail den Protokollen sichtbar. Sie können Metriken für latenzoptimierte Anfragen auch in den Amazon CloudWatch Protokollen unter „Model-ID+Latency-Optimized“ einsehen.
Latenzoptimierte Inferenz ist für Llama 3.1 70B und 405B von Meta sowie Claude 3.5 Haiku von Anthropic in den Regionen USA Ost (Ohio) und USA West (Oregon) durch regionsübergreifende Inferenz verfügbar. bedrock/latest/userguide/cross-region-inference.html
Latenzoptimierte Inferenz ist für Amazon Nova Pro die Regionen USA Ost (Nord-Virginia), USA Ost (Ohio) und USA West (Oregon) durch regionsübergreifende Inferenz verfügbar. bedrock/latest/userguide/cross-region-inference.html
Weitere Informationen zur Preisgestaltung finden Sie auf der Seite mit den Preisen
Anmerkung
Die latenzoptimierte Inferenz für Llama 3.1 405B unterstützt derzeit Anforderungen mit einer Gesamtzahl von Eingabe- und Ausgabetoken von bis zu 11 000. Bei Anforderungen mit einer größeren Token-Zahl greifen wir auf den Standardmodus zurück.
Die folgende Tabelle zeigt die Inferenzprofile, die die Latenzoptimierung unterstützen:
| Anbieter | Modell | Modell-ID | Cross-region Unterstützung von Inferenzprofilen |
|---|---|---|---|
| Amazon | Nova Pro | amazon.nova-pro-v1:0 |
us-east-1 us-east-2 |
| Anthropic | Claude 3.5 Haiku | anthropic.claude-3-5-haiku-20241022-v1:0 |
us-east-2 us-west-2 |
| Meta | Llama 3.1 405B Instruct | meta.llama3-1-405b-instruct-v1:0 |
us-east-2 |
| Meta | Llama 3,1 70B Instruct | meta.llama3-1-70b-instruct-v1:0 |
us-east-2 us-west-2 |
Weitere Informationen zu Inferenzprofilen finden Sie unter. Unterstützte Regionen und Modelle für Inferenzprofile