View a markdown version of this page

Quotas pour le paramètre d'exécution fondamental - Amazon Bedrock

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Quotas pour le paramètre d'exécution fondamental

Le bedrock-runtime.region.amazonaws.com point de terminaison est le principal point de terminaison d'inférence pour Amazon Bedrock. Le trafic d'inférence vers ce point de terminaison est régi par des quotas basés sur des jetons par modèle. Vous pouvez consulter ces quotas dans la console Service Quotas en sélectionnant Amazon Bedrock comme service, ou dans le tableau des quotas de service Amazon Bedrock du. Références générales AWS

Note

Les quotas d'un modèle sur ce point de terminaison sont partagés entre chaque API d'inférence avec laquelle vous l'appelez, y compris Converse InvokeModel , Responses et Chat Completions. Bien que les noms des quotas y fassent référenceInvokeModel, ils ne sont pas par API. Le trafic vers le bedrock-mantle terminal est compté séparément — voirQuotas pour la limite entre le substrat rocheux et le manteau.

Types de quotas

L'inférence sur le bedrock-runtime point final est régie par les quotas par modèle suivants :

quotas d'exécution de base par modèle
Quota Scope Description
Cross-Region InvokeModel jetons par minute pour ${model} Par modèle, par région Le nombre maximum de jetons par minute (entrée + sortie, combinés) que votre compte peut utiliser pour le modèle lorsqu'il est invoqué via un profil d'inférence interrégional.
On-demand InvokeModel jetons par minute pour ${model} Par modèle, par région Le nombre maximum de jetons par minute (entrée + sortie, combinés) que votre compte peut utiliser pour le modèle lorsqu'il est invoqué à la demande dans une seule région.
Nombre maximum de jetons d'invocation du modèle par jour pour ${model} Par modèle, par région Le nombre maximum de jetons par jour (entrée + sortie, combinés) que votre compte peut utiliser pour le modèle. Par défaut, cette valeur correspond au quota par minute multiplié par 24 × 60. Les nouveaux Comptes AWS pourraient bénéficier de quotas réduits.
InvokeModel demandes par minute pour ${model} Par modèle, par région Le nombre maximum de demandes d'inférence par minute que votre compte peut soumettre pour le modèle. Le RPM est appliqué pour certains modèles sur le bedrock-runtime terminal et pas pour d'autres ; consultez la console Service Quotas pour connaître les quotas exacts qui s'appliquent à votre modèle.

Les quotas TPM des bedrock-runtime terminaux comptent les jetons d'entrée et de sortie ensemble par rapport à un quota unique par modèle. Le bedrock-mantle point de terminaison applique des quotas distincts de jetons d'entrée par minute et de jetons de sortie par minute ; pour plus de détails, consultez. Quotas pour la limite entre le substrat rocheux et le manteau

Note

Les quotas RPM sur le bedrock-runtime terminal sont spécifiques au modèle. Certains modèles, par exemple Anthropic Claude Opus 4.7 et Claude Opus 4.8, n'ont pas de quota de RPM et sont régis uniquement par les quotas basés sur des jetons décrits dans cette section. Pour les modèles qui disposent d'un quota de tours par minute, consultez la valeur exacte dans la console Service Quotas.

Les jetons de sortie sont convertis en quotas d'utilisation selon un taux de combustion spécifique au modèle. Pour plus de détails sur la façon dont les quotas basés sur des jetons sont calculés et sur la manière dont le paramètre de max_tokens demande affecte les déductions, consultez. Mode de comptabilisation des jetons dans Amazon Bedrock

Quotas d'exécution associés

Les fonctionnalités Amazon Bedrock suivantes sont proposées via le bedrock-runtime terminal et disposent de leurs propres quotas distincts :

Ces quotas s'appliquent uniquement au bedrock-runtime terminal et ne sont pas exposés sur le bedrock-mantle terminal.

Demande d’augmentation de quota

Les étapes à suivre pour demander une augmentation de quota pour votre compte dépendent de la valeur figurant dans la colonne Ajustable du tableau des quotas dans les quotas de service Amazon Bedrock.

Important

Avant de demander une augmentation de quota, vérifiez que le modèle n'est pas dans un état de cycle de vie existant ou obsolète. Aucune augmentation de quota n'est accordée pour les modèles dont la mise à la retraite est prévue. Vérifiez l'état du cycle de vie du modèle sur la Cycle de vie des modèles page et envisagez plutôt de migrer vers le modèle suivant.

  • Si un quota est marqué Oui, vous pouvez l’ajuster en suivant les étapes décrites dans Demande d’augmentation de quota dans le Guide d’utilisation de Service Quotas.

  • Pour tout modèle, vous pouvez demander une augmentation pour les quotas suivants ensemble :

    • Cross-Region InvokeModel jetons par minute pour ${model}

    • On-demand InvokeModel jetons par minute pour ${model}

    • Nombre maximum de jetons d'invocation du modèle par jour pour ${model}

    Pour demander une augmentation pour n'importe quelle combinaison de ces quotas, demandez une augmentation du nombre de Cross-Region InvokeModel jetons par minute pour le ${model} quota en suivant les étapes de la section Demander une augmentation de quota dans le guide de l'utilisateur des quotas de service. Ensuite, l'équipe d'assistance vous contactera et vous proposera la possibilité d'augmenter également les deux autres quotas.

    Note

    En raison de la forte demande, la priorité sera accordée aux clients dont le trafic consomme le quota qui leur est alloué. Votre demande peut être refusée si vous ne remplissez pas cette condition.

Pour les augmentations de bedrock-mantle quotas, voirDemande d’augmentation de quota.