Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Von Amazon Bedrock unterstützte Endpunkte
Amazon Bedrock unterstützt verschiedene Endpunkte für die Durchführung von Inferenzoperationen. Inferenzanfragen stellen
Inferenzoperationen
Für neue Anwendungen empfehlen wir den bedrock-runtime Endpunkt. Er unterstützt die APIs Bedrock-native InvokeModel und Converse, die APIs für OpenAI-compatible Antworten und Chat-Abschlüsse sowie die Anthropic Messages API. Hier sind Amazon Bedrock-Funktionen wie Guardrails, intelligentes Prompt-Routing und regionsübergreifende Inferenz verfügbar. Weiterleiten von Modellinferenzanfragen AWS-Regionen mit regionsübergreifender Inferenz Amazon Bedrock unterstützt auch einen zweiten Endpunktbedrock-mantle, der derzeit zusätzliche Funktionen wie die serverseitige und vorkonfigurierte Nutzung von Tools (einschließlich Websuche), asynchrone Inferenz mit und Erstellung von Projekten und Arbeitsbereichen bietet. background=true Projekte (OpenAI-compatible) Arbeitsbereiche () Anthropic-compatible Informationen darüber, welchen Endpunkt jedes Modell unterstützt, finden Sie unter. Verfügbarkeit von Endpunkten nach Modellen
| Endpunkt | Unterstützte APIs | Beschreibung |
|---|---|---|
bedrock-runtime.{region}.amazonaws.com (empfohlen) |
InvokeModel/Converse//Chat-Abschlüsse//Antworten-API /Nachrichten-API | Region-specific Endpunkte für Inferenzanfragen für Modelle, die mithilfe der APIs in Amazon Bedrock gehostet werden. InvokeModel/Converse/Chat Completions/Responses/Messages Weitere Informationen zu den Bedrock-native Vorgängen finden Sie unter Amazon Bedrock Runtime API-Operationen. Die OpenAI-compatible APIs werden auf den /openai/v1 Pfaden dieses Endpunkts und nicht über die AWS SDKs aufgerufen. |
bedrock-mantle.{region}.api.aws |
Antworten-API//API für Chat-Abschlüsse//Nachrichten-API | Region-specific Endpunkte, um mithilfe der OpenAI-compatible Endpunkte und der Anthropic Messages API Inferenzanfragen für Modelle zu stellen, die in Amazon Bedrock gehostet werden. |
Bestehende Anwendungen, die verwendet werden, werden bedrock-mantle weiterhin vollständig unterstützt und müssen nicht geändert werden. Mit beiden Endpunkten können Sie eine bestehende OpenAI-SDK-Codebasis auf Amazon Bedrock übertragen, indem Sie nur die Basis-URL und den API-Schlüssel ändern. Beide unterstützen die APIs für OpenAI-compatible Antworten und Chat-Abschlüsse sowie die Anthropic Messages-API.
In den folgenden Tabellen wird verglichen, was auf den einzelnen Endpunkten verfügbar ist.
| API | bedrock-runtime |
bedrock-mantle |
|---|---|---|
| InvokeModel | ||
| Converse/ ConverseStream | ||
| Abschlüsse des Chats () OpenAI-compatible | ||
| API für Antworten () OpenAI-compatible | ||
| Nachrichten-API (Anthropic-native) |
Anmerkung
Die Nachrichten-API ist auf beiden Endpunkten verfügbar, aber die beiden Oberflächen bieten keine identischen Funktionen. Insbesondere werden strukturierte Ausgaben (der output_config.format Parameter) nicht unterstützt bedrock-mantle — Anfragen, die Folgendes enthalten, output_config.format werden mit einem Fehler vom Typ 400 zurückgewiesen. Um strukturierte Ausgaben mit Anthropic Claude-Modellen zu verwenden, rufen Sie Converse oder InvokeModel APIs auf. bedrock-runtime
Anmerkung
Die Responses API ist auch auf beiden Endpunkten verfügbar, ohne dass identische Funktionen unterstützt werden. Unter bedrock-runtime:
Anfragen sind immer synchron.
background=truewird mit einem Fehler vom Typ 400 abgelehnt. DerstoreParameter bleibt davon unberührt und behält seine Standardeinstellung beitrue, sodass gespeicherte Konversationen mit mehreren Runden normal funktionieren.Server-side Die Verwendung von Tools und vorkonfigurierte Tools, einschließlich der Websuche, sind nicht verfügbar. Client-side Die Verwendung von Tools funktioniert auf beiden Endpunkten.
Nur das Standardprojekt wird unterstützt. Siehe Projekte (OpenAI-compatible).
Eine gespeicherte Antwort gehört demjenigen AWS-Region , der sie bereitgestellt hat. Das Abrufen, Abbrechen oder Löschen und die Fortsetzung der Konversation mit
previous_response_idwerden alle von dieser Region abgewickelt.
| Funktion | bedrock-runtime |
bedrock-mantle |
|---|---|---|
| Cross-region Inferenz (geografische und globale Profile) | ||
| Zustandsorientiertes Gesprächsmanagement | ||
| Asynchrone (lang andauernde) Inferenz | ||
| Client-side Verwendung von Werkzeugen | ||
| Server-side Verwendung von Werkzeugen | ||
| Pre-configured gebrauchsfertige Werkzeuge | ||
| Projekte | Nur Standardprojekt | |
| Arbeitsbereiche |
| Item | bedrock-runtime |
bedrock-mantle |
|---|---|---|
| AWS SigV4-Authentifizierung | ||
| Bedrock API-Schlüssel (funktioniert auch mit OpenAI SDK) | ||
| Zuordnung der Nutzung | IAM-Prinzipal, Metadaten-Tagging Per-request Tagging von Metadaten pro Anfrage, Anwendungsinferenzprofile Anwendungsinferenzprofile | Projekte (OpenAI-compatible)Projekte, Arbeitsbereiche |
Anmerkung
Anbedrock-runtime, die Responses API attributiert die Nutzung nur durch den IAM-Prinzipal. Per-request Metadaten-Tagging und Anwendungsinferenzprofile sind darin nicht verfügbar. Eine Anfrage, die ein Anwendungsinferenzprofil als Inferenzziel benennt, wird mit einem Fehler vom Typ 400 zurückgewiesen. Dies wirkt sich nicht auf die regionsübergreifende Inferenz aus: Die systemdefinierten geografischen und globalen Inferenzprofile funktionieren normal.
| Feature | bedrock-runtime |
bedrock-mantle |
|---|---|---|
| Leitplanken | ||
| Promptes Zwischenspeichern | ||
| Intelligentes Routing von Eing |
Anmerkung
Die Unterstützung für das Prompt-Caching bedrock-mantle hängt vom jeweiligen Modell ab. Weitere Informationen finden Sie auf den einzelnen Modellkarten Modelle im Überblick unten.
Ansatz für Durchsatz und Quote
Jeder Endpunkt verwendet einen anderen Ansatz zur Verwaltung des Durchsatzes.
-
bedrock-runtime— Bei vielen herkömmlichen Diensten mit mehreren Mandanten basiert die Architektur auf Kontingenten pro Konto, um den fairen Zugriff auf gemeinsam genutzte Ressourcen zu gewährleisten. Dies ist der Ansatz, der bei verwendet wird.bedrock-runtimeJedes Modell hat feste Durchsatzquoten (RPM und TPM), für die Sie Erhöhungen beantragen können. Details hierzu finden Sie unter Kontingente für den Bedrock-Runtime-Endpunkt. -
bedrock-mantle— Dieser Endpunkt ist mit fortschrittlichen Planungs- und Warteschlangenmechanismen ausgestattet, die eine faire Verteilung ermöglichen und gleichzeitig höhere anfängliche Durchsatzgrenzen unterstützen. Dieses Design ermöglicht es auch, eine breite Palette von Modellenbedrock-mantlezu hosten und die gesamte Bandbreite der im Modellkatalog verfügbaren Funktionen bereitzustellen. In den meisten Fällen werden Anfragen sofort bearbeitet. In einigen Fällen kann eine Anfrage kurzzeitig in die Warteschlange gestellt werden, während die Workloads während des Fluges abgeschlossen sind und der Durchsatz verfügbar ist. Details dazu finden Sie unter Kontingente für den Endpunkt „Bedrock-Mantle“ und Bewährte Methoden für Skalierung und Durchsatz.
Preise
Per-token Die Preise für dasselbe Modell sind auf und identisch. bedrock-runtime bedrock-mantle Wählen Sie einen Endpunkt, der auf den APIs und Funktionen basiert, die Sie benötigen, und nicht auf der Grundlage der Kosten. Aktuelle Preise finden Sie unter Amazon Bedrock-Preise
Wann sollte jeder Endpunkt ausgewählt werden
Beginnen Sie damit, bedrock-runtime wann Sie:
Rufen Sie die OpenAI-compatible Responses oder Chat Completions APIs oder die Anthropic Messages API auf.
Verwenden Sie die Bedrock-native InvokeModel oder die Converse-APIs.
Verwenden Sie Amazon Bedrock-Funktionen, die nur auf diesem Endpunkt verfügbar sind, wie Guardrails und intelligentes Prompt-Routing.
Verwenden Sie regionsübergreifende Inferenz, um Anfragen geografisch oder global weiterzuleiten.
Verwenden Siebedrock-mantle, wenn Sie:
Erstellen Sie agentische Workflows mithilfe serverseitiger Tools oder mit vorkonfigurierten Tools, einschließlich Websuche. Web-Suche
Führen Sie asynchrone oder lang andauernde Inferenz-Workloads aus, einschließlich Beantwortungen von Anfragen mit.
background=trueErstellen Projekte (OpenAI-compatible) oder isolieren Arbeitsbereiche () Anthropic-compatible Sie Workloads und verfolgen Sie Kosten und Nutzung auf Anwendungsebene.
Verwenden Sie ein Modell, das nur für verfügbar ist.
bedrock-mantleSiehe Verfügbarkeit von Endpunkten nach Modellen.
Beide Endpunkte können zusammen von derselben Anwendung aus verwendet werden — wählen Sie je nach Anwendungsfall.
Reduzieren Sie die Kosten für ausgehenden Datenfluss mit VPC-Schnittstellen-Endpunkten
Wenn Sie Amazon Bedrock von einer VPC aus aufrufen, sollten Sie die Verwendung von VPC-Schnittstellenendpunkten (AWS PrivateLink) in Betracht ziehen, um den Datenverkehr innerhalb des AWS-Netzwerks aufrechtzuerhalten und die Gebühren für ausgehenden Datenfluss im Zusammenhang mit NAT-Gateways oder Internet-Gateways zu vermeiden.