View a markdown version of this page

Endpoints compatíveis com o Amazon Bedrock - Amazon Bedrock

As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.

Endpoints compatíveis com o Amazon Bedrock

Um endpoint é a URL que seu aplicativo usa para enviar solicitações de inferência para o Amazon Bedrock. O Amazon Bedrock fornece dois endpoints de inferência. O endpoint escolhido determina quais APIs e recursos estão disponíveis.

Para a maioria dos novos aplicativos, use o bedrock-runtime endpoint. Use bedrock-mantle quando precisar especificamente de recursos que atualmente estão disponíveis somente lá, como ferramentas pré-configuradas e do lado do servidor (incluindo pesquisa na web), inferência em segundo plano, projetos ou espaços de trabalho. Projetos (OpenAI-compatible) Espaços de trabalho () Anthropic-compatible Para ver qual endpoint cada modelo suporta, consulteDisponibilidade do endpoint. A tabela a seguir compara os dois endpoints.

Endpoint APIs compatíveis Descrição
bedrock-runtime.{region}.amazonaws.com (recomendado) InvokeModel/Converse//Conclusões de bate-papos//API de respostas//API de mensagens Region-specific endpoints para fazer solicitações de inferência para modelos hospedados no Amazon Bedrock usando as APIs. InvokeModel/Converse/Chat Completions/Responses/Messages Para obter mais informações sobre as Bedrock-native operações, consulte Operações da API Amazon Bedrock Runtime. As OpenAI-compatible APIs são chamadas nos /openai/v1 caminhos desse endpoint e não por meio dos AWS SDKs.
bedrock-mantle.{region}.api.aws API de respostas//API de conclusão de bate-papos//API de mensagens Region-specific endpoints para fazer solicitações de inferência para modelos hospedados no Amazon Bedrock usando os OpenAI-compatible endpoints e a API Anthropic Messages.
nota

Ambos os endpoints usam o mesmo mecanismo de inferência Mantle subjacente e se beneficiam do design de acesso zero ao operador (ZOA) do Mantle. O bedrock-mantle nome identifica uma superfície de endpoint, não um mecanismo de inferência diferente.

Os aplicativos existentes que usam bedrock-mantle continuam sendo totalmente suportados e não precisam ser alterados. Ambos os endpoints permitem que você leve uma base de código existente do SDK OpenAI para o Amazon Bedrock alterando somente a URL básica e a chave da API, e ambos suportam as APIs de OpenAI-compatible respostas e preenchimentos de bate-papo e a API de mensagens antrópicas.

nota

A API Messages está disponível em ambos os endpoints, mas as duas superfícies não têm suporte a recursos idênticos. Em particular, as saídas estruturadas (o output_config.format parâmetro) não são suportadas em bedrock-mantle — as solicitações que incluem output_config.format são rejeitadas com um erro 400. Para usar saídas estruturadas com modelos Anthropic Claude, ative o Converse ou as APIs. InvokeModel bedrock-runtime

nota

A API de respostas também está disponível em ambos os endpoints sem suporte a recursos idênticos. Em bedrock-runtime:

  • As solicitações são sempre síncronas. background=trueé rejeitado com um erro 400. O store parâmetro não é afetado e mantém o padrão detrue, portanto, as conversas armazenadas em vários turnos funcionam normalmente.

  • Server-side o uso de ferramentas e as ferramentas pré-configuradas não estão disponíveis, incluindo pesquisa Pesquisa na Web na web. Client-side o uso da ferramenta funciona em ambos os terminais.

  • Somente o projeto padrão é suportado. Consulte Projetos (OpenAI-compatible).

  • Uma resposta armazenada pertence à pessoa Região da AWS que a forneceu. Recuperá-lo, cancelá-lo ou excluí-lo e continuar a conversa com previous_response_id ele são todos feitos por essa região.

A autenticação não concede acesso por si só. Se você usa SigV4 ou uma chave de API Bedrock, o principal do IAM associado deve ter permissão para a ação necessária. Para obter exemplos e requisitos completos de políticas, consultePré-requisitos para executar a inferência do modelo.

Operacional
Item bedrock-runtime bedrock-mantle
Autenticação AWS SigV4 supported supported
Chave de API Bedrock (também funciona com o OpenAI SDK) supported supported
Autorização do IAM para inferência bedrock:InvokeModelno alvo de inferência e, para a API Responses, no projeto padrão; bedrock:InvokeModelWithResponseStream para streaming bedrock-mantle:CreateInference
Atribuição de uso IAM principal, marcação de metadados por solicitação, perfis de inferência de aplicativos Perfis de inferência de aplicações Projetos, Espaços de trabalho
nota

Ativadabedrock-runtime, a API de respostas atribui o uso somente pelo principal do IAM. Per-request a marcação de metadados e os perfis de inferência do aplicativo não estão disponíveis nele — uma solicitação que nomeia um perfil de inferência do aplicativo como seu alvo de inferência é rejeitada com um erro 400. Isso não afeta a inferência entre regiões: os perfis de inferência geográfica e global definidos pelo sistema funcionam normalmente.

Disponibilidade de recursos Bedrock
Recurso bedrock-runtime bedrock-mantle
Corrimãos supported not-supported
Armazenamento imediato em cache supported supported
Roteamento rápido inteligente supported not-supported
nota

O suporte imediato ao cache bedrock-mantle depende do modelo específico — consulte cada placa de modelo abaixo Modelos em resumo para obter detalhes.

Abordagem de taxa de transferência e cota

Cada endpoint usa uma abordagem diferente para gerenciar a taxa de transferência.

  • bedrock-runtime— Em muitos serviços multilocatários tradicionais, a arquitetura é projetada com base em cotas por conta para gerenciar o acesso justo aos recursos compartilhados. Essa é a abordagem usada combedrock-runtime. Cada modelo tem cotas de produtividade fixas (RPM e TPM) para as quais você pode solicitar aumentos. Para obter detalhes, consulte Cotas para o endpoint básico de tempo de execução.

  • bedrock-mantle— Esse endpoint é arquitetado com mecanismos avançados de agendamento e filas de trabalho que oferecem distribuição justa e, ao mesmo tempo, suportam limites de produtividade inicial mais altos. Esse design também permite bedrock-mantle hospedar um amplo conjunto de modelos e oferecer toda a gama de recursos disponíveis no catálogo de modelos. Na maioria dos casos, as solicitações são atendidas imediatamente. Em alguns casos, uma solicitação pode ser enfileirada brevemente enquanto as cargas de trabalho em andamento são concluídas e a taxa de transferência fica disponível. Para obter mais detalhes, consulte Cotas para o endpoint rocho-mantle e Práticas recomendadas de escalabilidade e taxa de transferência.

Preços

Per-token o preço do mesmo modelo é idêntico em bedrock-runtime bedrock-mantle e. Escolha um endpoint com base nas APIs e nos recursos de que você precisa, não no custo. Para ver os preços atuais, consulte os preços https://aws.amazon.com/bedrock/pricing/ do Amazon Bedrock.

Quando escolher cada endpoint

Comece com bedrock-runtime quando você quiser:

Use bedrock-mantle quando quiser:

Os dois endpoints podem ser usados juntos no mesmo aplicativo — escolha por caso de uso.

Reduza os custos de saída de dados com endpoints de interface VPC

Se você estiver ligando para a Amazon Bedrock de dentro de uma VPC, considere usar endpoints de interface VPC (AWS PrivateLink) para manter o tráfego na rede da AWS e evitar cobranças de saída de dados associadas a gateways NAT ou gateways de internet.