View a markdown version of this page

Kontingente für den Bedrock-Runtime-Endpunkt - Amazon Bedrock

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Kontingente für den Bedrock-Runtime-Endpunkt

Der bedrock-runtime.region.amazonaws.com Endpunkt ist der primäre Inferenzendpunkt für Amazon Bedrock. Der Inferenzverkehr zu diesem Endpunkt wird durch Token-basierte Kontingente pro Modell geregelt. Sie können diese Kontingente in der Service-Kontingente-Konsole einsehen, indem Sie Amazon Bedrock als Service auswählen, oder in der Amazon Bedrock-Servicekontingenttabelle unter. Allgemeine AWS-Referenz

Anmerkung

Die Kontingente eines Modells auf diesem Endpunkt gelten für alle Inferenz-APIs, mit denen Sie es aufrufen, einschließlich Converse InvokeModel , Responses und Chat Completions. Die Kontingentnamen beziehen sich zwar aufInvokeModel, sind aber nicht pro API angegeben. Der Verkehr zum bedrock-mantle Endpunkt wird separat gezählt — sieheKontingente für den Endpunkt „Bedrock-Mantle“.

Arten von Kontingenten

Die Inferenz auf dem bedrock-runtime Endpunkt wird durch die folgenden modellspezifischen Kontingente bestimmt:

Kontingente für Bedrock-Runtime pro Modell
Kontingent Scope Description
Cross-Region InvokeModel Tokens pro Minute für ${model} Pro Modell, pro Region Die maximale Anzahl von Tokens pro Minute (Eingabe und Ausgabe, kombiniert), die Ihr Konto für das Modell verwenden kann, wenn es über ein regionsübergreifendes Inferenzprofil aufgerufen wird.
On-demand InvokeModel Tokens pro Minute für ${model} Pro Modell, pro Region Die maximale Anzahl an Tokens pro Minute (Eingabe und Ausgabe, kombiniert), die Ihr Konto für das Modell verwenden kann, wenn es bei Bedarf in einer einzelnen Region aufgerufen wird.
Maximale Anzahl an Tokens pro Tag für den Modellaufruf ${model} Pro Modell, pro Region Die maximale Anzahl an Tokens pro Tag (Eingabe und Ausgabe, kombiniert), die Ihr Konto für das Modell verwenden kann. Standardmäßig ist dieser Wert das Kontingent pro Minute multipliziert mit 24 × 60. Neue erhalten AWS-Konten möglicherweise reduzierte Kontingente.
InvokeModel Anfragen pro Minute für ${model} Pro Modell, pro Region Die maximale Anzahl von Inferenzanfragen pro Minute, die Ihr Konto für das Modell einreichen kann. RPM wird für einige Modelle auf dem bedrock-runtime Endpunkt durchgesetzt, für andere nicht. Die genauen Kontingente, die für Ihr Modell gelten, finden Sie in der Servicequota-Konsole.

Bei den TPM-Kontingenten für den bedrock-runtime Endpunkt werden Eingabe- und Ausgabetokens zusammen zu einem einzigen Kontingent pro Modell gezählt. Der bedrock-mantle Endpunkt wendet separate Kontingente für Eingabe-Tokens pro Minute und für Ausgabe-Token pro Minute an. Einzelheiten finden Sie unter. Kontingente für den Endpunkt „Bedrock-Mantle“

Anmerkung

Die bedrock-runtime RPM-Kontingente auf dem Endpunkt sind modellspezifisch. Einige Modelle — zum Beispiel Anthropic Claude Opus 4.7 und Claude Opus 4.8 — haben keine RPM-Quote und unterliegen ausschließlich den in diesem Abschnitt beschriebenen Token-basierten Quoten. Bei Modellen, die ein RPM-Kontingent haben, sehen Sie sich den genauen Wert in der Service Quota-Konsole an.

Output-Token werden anhand einer modellspezifischen Burndown-Rate in die Kontingentnutzung umgewandelt. Einzelheiten dazu, wie Token-basierte Kontingente berechnet werden und wie sich der max_tokens Anforderungsparameter auf Abzüge auswirkt, finden Sie unter. So werden Token in Amazon Bedrock gezählt

Verwandte Laufzeitkontingente

Die folgenden Amazon Bedrock-Funktionen werden über den bedrock-runtime Endpunkt bereitgestellt und haben ihre eigenen Kontingente:

Diese Kontingente gelten nur für den bedrock-runtime Endpunkt und sind auf dem Endpunkt nicht verfügbar. bedrock-mantle

Beantragen einer Kontingenterhöhung

Die Schritte zur Beantragung einer Kontingenterhöhung für Ihr Konto hängen vom Wert in der Spalte Adjustable in der Kontingenttabelle der Amazon Bedrock-Servicekontingente ab.

Wichtig

Bevor Sie eine Kontingenterhöhung beantragen, stellen Sie sicher, dass sich das Modell nicht im Lebenszyklusstatus „Legacy“ oder „Veraltet“ befindet. Für Modelle, deren Ausmusterung geplant ist, werden keine Kontingenterhöhungen gewährt. Überprüfen Sie den Lebenszyklusstatus des Modells auf der Modelllebenszyklus Seite und ziehen Sie stattdessen eine Migration zum Nachfolgemodell in Betracht.

  • Wenn ein Kontingent mit Ja markiert ist, können Sie es anpassen, indem Sie die Schritte unter Anfordern einer Kontingenterhöhung im Benutzerhandbuch zu Service Quotas befolgen.

  • Für jedes Modell können Sie eine Erhöhung für die folgenden Kontingente gemeinsam anfordern:

    • Cross-Region InvokeModel Tokens pro Minute für ${model}

    • On-demand InvokeModel Tokens pro Minute für ${model}

    • Modellieren Sie die maximale Anzahl an Tokens pro Tag für ${model}

    Um eine Erhöhung für eine beliebige Kombination dieser Kontingente zu beantragen, fordern Sie eine Erhöhung der Cross-Region InvokeModel Tokens pro Minute für das ${model} Kontingent an, indem Sie die Schritte unter Anfordern einer Kontingenterhöhung im Servicekontingents-Benutzerhandbuch befolgen. Nachdem Sie dies getan haben, wird sich das Support-Team mit Ihnen in Verbindung setzen und Ihnen die Möglichkeit bieten, auch die anderen beiden Kontingente zu erhöhen.

    Anmerkung

    Aufgrund der hohen Nachfrage werden Kunden bevorzugt behandelt, deren Datenverkehr das ihnen zugewiesene Kontingent überschreitet. Ihre Anfrage wird möglicherweise abgelehnt, wenn Sie diese Bedingung nicht erfüllen.

Informationen zu bedrock-mantle Kontingenterhöhungen finden Sie unterBeantragen einer Kontingenterhöhung.