As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.
Endpoints compatíveis com o Amazon Bedrock
O Amazon Bedrock oferece suporte a vários endpoints para realizar operações de inferência.
Operações de inferência
Para novos aplicativos, recomendamos o bedrock-runtime endpoint. Ele suporta as APIs Bedrock-native InvokeModel e Converse, as APIs OpenAI-compatible Responses and Chat Complements e a API Anthropic Messages, e é onde os recursos do Amazon Bedrock, como Guardrails, roteamento inteligente de prompts e inferência entre regiões, estão disponíveis. Encaminhe as solicitações de inferência do modelo entre Regiões da AWS com inferência entre regiões O Amazon Bedrock também oferece suporte a um segundo endpointbedrock-mantle, que atualmente oferece recursos adicionais, como uso de ferramentas pré-configuradas e do lado do servidor (incluindo pesquisa na web), inferência assíncrona e criação de projetos e espaços de trabalho. background=true Projetos (OpenAI-compatible) Espaços de trabalho () Anthropic-compatible Para ver qual endpoint cada modelo suporta, consulteDisponibilidade de endpoints por modelos.
| Endpoint | APIs compatíveis | Descrição |
|---|---|---|
bedrock-runtime.{region}.amazonaws.com (recomendado) |
InvokeModel/Converse//Conclusões de bate-papos//API de respostas//API de mensagens | Region-specific endpoints para fazer solicitações de inferência para modelos hospedados no Amazon Bedrock usando as APIs. InvokeModel/Converse/Chat Completions/Responses/Messages Para obter mais informações sobre as Bedrock-native operações, consulte Operações da API Amazon Bedrock Runtime. As OpenAI-compatible APIs são chamadas nos /openai/v1 caminhos desse endpoint e não por meio dos AWS SDKs. |
bedrock-mantle.{region}.api.aws |
API de respostas//API de conclusão de bate-papos//API de mensagens | Region-specific endpoints para fazer solicitações de inferência para modelos hospedados no Amazon Bedrock usando os OpenAI-compatible endpoints e a API Anthropic Messages. |
Os aplicativos existentes que usam bedrock-mantle continuam sendo totalmente suportados e não precisam ser alterados. Ambos os endpoints permitem que você leve uma base de código existente do SDK OpenAI para o Amazon Bedrock alterando somente a URL básica e a chave da API, e ambos suportam as APIs de OpenAI-compatible respostas e preenchimentos de bate-papo e a API de mensagens antrópicas.
As tabelas a seguir comparam o que está disponível em cada endpoint.
| solicitações de | bedrock-runtime |
bedrock-mantle |
|---|---|---|
| InvokeModel | ||
| Converse/ ConverseStream | ||
| Conclusões do chat () OpenAI-compatible | ||
| API de respostas (OpenAI-compatible) | ||
| API de mensagens (Anthropic-native) |
nota
A API Messages está disponível em ambos os endpoints, mas as duas superfícies não têm suporte a recursos idênticos. Em particular, as saídas estruturadas (o output_config.format parâmetro) não são suportadas em bedrock-mantle — as solicitações que incluem output_config.format são rejeitadas com um erro 400. Para usar saídas estruturadas com modelos Anthropic Claude, ative o Converse ou as APIs. InvokeModel bedrock-runtime
nota
A API de respostas também está disponível em ambos os endpoints sem suporte a recursos idênticos. Em bedrock-runtime:
As solicitações são sempre síncronas.
background=trueé rejeitado com um erro 400. Ostoreparâmetro não é afetado e mantém o padrão detrue, portanto, as conversas armazenadas em vários turnos funcionam normalmente.Server-side o uso de ferramentas e as ferramentas pré-configuradas não estão disponíveis, incluindo pesquisa Pesquisa na Web na web. Client-side o uso da ferramenta funciona em ambos os terminais.
Somente o projeto padrão é suportado. Consulte Projetos (OpenAI-compatible).
Uma resposta armazenada pertence à pessoa Região da AWS que a forneceu. Recuperá-lo, cancelá-lo ou excluí-lo e continuar a conversa com
previous_response_idele são todos feitos por essa região.
| Recurso | bedrock-runtime |
bedrock-mantle |
|---|---|---|
| Cross-region inferência (perfis geográficos e globais) | ||
| Gerenciamento de conversas com bom estado | ||
| Inferência assíncrona (de longa duração) | ||
| Client-side uso de ferramentas | ||
| Server-side uso de ferramentas | ||
| Pre-configured ferramentas prontas para uso | ||
| Projetos | Somente projeto padrão | |
| Espaços de trabalho |
| Item | bedrock-runtime |
bedrock-mantle |
|---|---|---|
| Autenticação AWS SigV4 | ||
| Chave de API Bedrock (também funciona com o OpenAI SDK) | ||
| Atribuição de uso | IAM principal, marcação de metadados por solicitação, perfis de inferência de aplicativos Perfis de inferência de aplicações | Projetos, Espaços de trabalho |
nota
Ativadabedrock-runtime, a API de respostas atribui o uso somente pelo principal do IAM. Per-request a marcação de metadados e os perfis de inferência do aplicativo não estão disponíveis nele — uma solicitação que nomeia um perfil de inferência do aplicativo como seu alvo de inferência é rejeitada com um erro 400. Isso não afeta a inferência entre regiões: os perfis de inferência geográfica e global definidos pelo sistema funcionam normalmente.
| Recurso | bedrock-runtime |
bedrock-mantle |
|---|---|---|
| Corrimãos | ||
| Armazenamento imediato em cache | ||
| Roteamento rápido inteligente |
nota
O suporte imediato ao cache bedrock-mantle depende do modelo específico — consulte cada placa de modelo abaixo Modelos em resumo para obter detalhes.
Abordagem de taxa de transferência e cota
Cada endpoint usa uma abordagem diferente para gerenciar a taxa de transferência.
-
bedrock-runtime— Em muitos serviços multilocatários tradicionais, a arquitetura é projetada com base em cotas por conta para gerenciar o acesso justo aos recursos compartilhados. Essa é a abordagem usada combedrock-runtime. Cada modelo tem cotas de produtividade fixas (RPM e TPM) para as quais você pode solicitar aumentos. Para obter detalhes, consulte Cotas para o endpoint básico de tempo de execução. -
bedrock-mantle— Esse endpoint é arquitetado com mecanismos avançados de agendamento e filas de trabalho que oferecem distribuição justa e, ao mesmo tempo, suportam limites de produtividade inicial mais altos. Esse design também permitebedrock-mantlehospedar um amplo conjunto de modelos e oferecer toda a gama de recursos disponíveis no catálogo de modelos. Na maioria dos casos, as solicitações são atendidas imediatamente. Em alguns casos, uma solicitação pode ser enfileirada brevemente enquanto as cargas de trabalho em andamento são concluídas e a taxa de transferência fica disponível. Para obter mais detalhes, consulte Cotas para o endpoint rocho-mantle e Práticas recomendadas de escalabilidade e produtividade.
Preços
Per-token o preço do mesmo modelo é idêntico em bedrock-runtime bedrock-mantle e. Escolha um endpoint com base nas APIs e nos recursos de que você precisa, não no custo. Para ver os preços atuais, consulte os preços https://aws.amazon.com/bedrock/pricing/
Quando escolher cada endpoint
Comece com bedrock-runtime quando você quiser:
Ligue para as APIs de OpenAI-compatible respostas ou de conclusão de bate-papo ou para a API de mensagens antrópicas.
Use as APIs Bedrock-native InvokeModel ou Converse.
Use os recursos do Amazon Bedrock que estão disponíveis somente nesse endpoint, como Guardrails e roteamento inteligente de prompts.
Use a inferência entre regiões para rotear solicitações em uma região ou globalmente.
Use bedrock-mantle quando quiser:
Crie fluxos de trabalho autênticos com o uso de ferramentas do lado do servidor ou ferramentas pré-configuradas, incluindo pesquisa na web. Pesquisa na Web
Execute cargas de trabalho de inferência assíncronas ou de longa duração, incluindo solicitações de respostas com.
background=trueCrie Projetos (OpenAI-compatible) ou Espaços de trabalho () Anthropic-compatible isole cargas de trabalho e monitore o custo e o uso no nível do aplicativo.
Use um modelo que esteja disponível somente em
bedrock-mantle. Consulte Disponibilidade de endpoints por modelos.
Os dois endpoints podem ser usados juntos no mesmo aplicativo — escolha por caso de uso.
Reduza os custos de saída de dados com endpoints de interface VPC
Se você estiver ligando para a Amazon Bedrock de dentro de uma VPC, considere usar endpoints de interface VPC (AWS PrivateLink) para manter o tráfego na rede da AWS e evitar cobranças de saída de dados associadas a gateways NAT ou gateways de internet.