View a markdown version of this page

Modelos de base disponíveis - SageMaker IA da Amazon

As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.

Modelos de base disponíveis

A Amazon SageMaker JumpStart oferece modelos de base proprietários, integrados e de última geração, disponíveis publicamente, para personalizar e integrar seus fluxos de trabalho generativos de IA.

As duas primeiras guias listam os modelos de base. As duas últimas guias listam os algoritmos integrados e os algoritmos clássicos de aprendizado de máquina que JumpStart também fornecem, que não são modelos básicos.

Para listar todos os modelos de JumpStart fundação disponíveis:

import boto3 sagemaker_client = boto3.client("sagemaker", region_name="us-west-2") # List all available models in the SageMakerPublicHub all_models = [] next_token = None while True: params = {"HubName": "SageMakerPublicHub", "HubContentType": "Model"} if next_token: params["NextToken"] = next_token response = sagemaker_client.list_hub_contents(**params) all_models.extend(response["HubContentSummaries"]) next_token = response.get("NextToken") if not next_token: break print(f"Total models available: {len(all_models)}") for model in all_models[:5]: print(model["HubContentName"], model["HubContentVersion"])

Para obter tipos de instância compatíveis e outros metadados para um modelo específico:

import json import boto3 sagemaker_client = boto3.client("sagemaker", region_name="us-west-2") model_id = "meta-textgeneration-llama-3-3-70b-instruct" response = sagemaker_client.describe_hub_content( HubName="SageMakerPublicHub", HubContentType="Model", HubContentName=model_id ) # Parse the model metadata model_doc = json.loads(response["HubContentDocument"]) print(f"Supported instances: {model_doc['SupportedInferenceInstanceTypes']}") print(f"Default instance: {model_doc['DefaultInferenceInstanceType']}")

As tabelas a seguir listam os modelos disponíveis com suas licenças e tipos de instância de inferência compatíveis em 29 de julho de 2026. Para obter as informações mais atuais, use os exemplos de API acima ou consulte o hub de modelos no SageMaker Studio.

Uma célula de licença diz “Não aplicável” quando o hub modelo não publica nenhuma licença para esse modelo. Verifique os termos da licença com o fornecedor do modelo antes de usar esse modelo. Um valor em branco ou de espaço reservado na tabela não concede direitos.

Alguns modelos oferecem configurações alternativas de implantação de hospedagem, além das configurações padrão. Cada configuração ajusta o modelo para um caso de uso e uma meta de desempenho, e cada uma oferece suporte a seu próprio conjunto de tipos de instância. Uma configuração geralmente oferece suporte a uma instância menor ou mais barata do que a padrão, portanto, verifique as configurações antes de concluir que um modelo precisa de uma instância grande.

Um nome de configuração combina um caso de uso com uma meta de desempenho. Esses são os mesmos casos de uso e metas de desempenho que o SageMaker Studio oferece na página Desempenho na página Implantar modelo no endpoint. Portanto, um nome aqui e uma opção ali descrevem a mesma implantação. O caso de uso descreve a carga de trabalho:

  • generate(Gerar): crie conteúdo longo, como artigos, relatórios ou código, a partir de um prompt.

  • interact(Interaja): potencialize conversas em tempo real, como chatbots ou assistentes virtuais.

  • summarize(Resumir): condense documentos, artigos ou dados extensos em resumos concisos.

  • modify(Modificar): transforme ou edite o conteúdo existente, incluindo reescrever, traduzir ou reformatar.

  • max_context(Contexto máximo): processe entradas grandes que exigem a janela de contexto completa do modelo.

A meta de desempenho descreve o que a configuração otimiza para:

  • best_price_performance(Equilibrado): uma compensação uniforme entre custo, latência e taxa de transferência. Bom para cargas de trabalho de uso geral ou quando você não tem certeza de qual métrica é mais importante.

  • lowest_cost(Custo otimizado): menor custo de infraestrutura por solicitação. Aceita maior latência e menor taxa de transferência para minimizar as despesas.

  • highest_throughput(Taxa de transferência otimizada): máximo de tokens por segundo para cargas de trabalho de alto volume. Usa decodificação especulativa para aumentar a taxa de transferência.

  • lowest_latency(Latência otimizada): menor tempo até o primeiro token (TTFT). Prioriza a velocidade em vez da taxa de transferência e do custo.

Em vez disso, alguns modelos nomeiam um contêiner de serviço, como lmi ou tgi ou use all_purpose para servir sem suposição de carga de trabalho.

Liste as configurações de um modelo, junto com suas métricas de referência e, em seguida, implante uma com o SDK do SageMaker Python:

from sagemaker.serve import ModelBuilder from sagemaker.core.jumpstart.configs import JumpStartConfig model_builder = ModelBuilder.from_jumpstart_config( jumpstart_config=JumpStartConfig(model_id="meta-textgeneration-llama-3-1-8b-instruct") ) # Print every configuration with its instance types and benchmark metrics. model_builder.list_deployment_configs() # Select a configuration and one of the instance types it supports. model_builder.set_deployment_config( config_name="generate_lowest_cost", instance_type="ml.g6e.xlarge", ) model = model_builder.build() endpoint = model_builder.deploy()

A implantação sem chamar set_deployment_config usa a configuração padrão e o tipo de instância padrão.

Open-Weight Models (436)

Open-weight modelos básicos são modelos disponíveis publicamente de fornecedores como Meta, Google, Mistral AI e outros. Você pode implantar, ajustar e personalizar esses modelos para seu caso de uso.

Para começar a usar um desses modelos, veja JumpStart uso do modelo básico ou explore um dos disponíveisCadernos de exemplo. Em um determinado exemplo de notebook, tente trocar o ID do modelo para fazer experiências com modelos diferentes dentro da mesma família de modelos.

Para obter mais informações sobre IDs de modelo e recursos sobre a implantação de modelos JumpStart básicos disponíveis publicamente com o SageMaker Python SDK, consulte. Use modelos de base com o SageMaker Python SDK

Fornecedor Nome do modelo ID do modelo Tarefa Licença Fine-tunable Tipos de instância de inferência compatíveis

01-Ai

Yi-1.5-34B

huggingface-llm-yi-1-5-34b

Geração de texto

apache-2.0

Não

ml.g5,12x grande, ml.g5,24x grande, ml.g5,48x grande, ml.p4d.24x grande

01-Ai

Yi-1.5-9B

huggingface-llm-yi-1-5-9b

Geração de texto

apache-2.0

Não

ml.g5.12xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge

Ahxt

Lite Llama 460M 1T

huggingface-llm-ahxt-litellama-460m-1t

Geração de texto

mit

Não

ml.g5.2xlarge

Ai-Forever

Multilingual GPT

huggingface-llm-ai-forever-mgpt

Geração de texto

apache-2.0

Não

ml.g5.2xlarge

Aisingapura

Llama3 8B v2.1 Instruct SEA-Lion

huggingface-llm-llama3-8b-sealionv21-instruct

Geração de texto

Chamada 3

Não

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g6.12xlarge, ml.g6.24xlarge, ml.g6.48xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.p4d.24xlarge, ml.p5.48xlarge grande

Aisingapura

SEA-LION 3B

huggingface-llm-sealion-3b

Geração de texto

mit

Não

ml.g4dn.2xlarge, ml.g4dn.xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.xlarge, ml.p3.8xlarge

Aisingapura

SEA-LION 7B

huggingface-llm-sealion-7b

Geração de texto

mit

Não

ml.g4dn.12xlarge, ml.g5,12xlarge, ml.g5.24xlarge, ml.g5.48xlarge, ml.p4d.24xlarge

Aisingapura

SEA-LION 7B Instruir

huggingface-llm-sealion-7b-instruct

Geração de texto

mit

Não

ml.g4dn.12xlarge, ml.g5,12xlarge, ml.g5.24xlarge, ml.g5.48xlarge, ml.p4d.24xlarge

Alibaba-Nlp

Alibaba-NLP obter- Qwen2-7B-instruct

huggingface-textembedding-gte-qwen2-7b-instruct

Incorporação de texto

Apache-2.0

Não

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g5.xlarge, ml.g6.12xlarge, ml.g6.24xlarge, ml.g6.2xlarge, ml.g6.48xlarge, ml.g6.4xlarge, ml.g6.4xlarge, ml.g6,8xlarge, ml.g6.xlarge, ml.p4d.24xlarge

Allenai

Olmo-3-7B-Instruct

huggingface-textgeneration-olmo-3-7b-instruct

Geração de texto

apache-2.0

Não

ml.g6e.24xlarge

Amazon

Chronos 2

pytorch-forecasting-chronos-2

Previsão de séries temporais

apache-2.0

Não

ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.xlarge, ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.xlarge, ml.g5.2xlarge, ml.g6.2xlarge, ml.g6.xlarge, ml.g6.xlarge, ml.g6e.2xlarge, ml.g6e.2xlarge por exemplo, xlarge, ml.m5.2xlarge, ml.m5.4xlarge, ml.m5.xlarge

Amazon

Falcon Lite

huggingface-llm-amazon-falconlite

Geração de texto

apache-2.0

Não

ml.g 5,12 x grande, ml.g 5,24 x grande, ml.g 5,48 x grande

Amazon

Falcon Lite 2

huggingface-llm-amazon-falconlite2

Geração de texto

apache-2.0

Não

ml.g 5,12 x grande, ml.g 5,24 x grande, ml.g 5,48 x grande

Amazon

Mistral Lite

huggingface-llm-amazon-mistrallite

Geração de texto

apache-2.0

Não

ml.g5,12 x grande, ml.g5,24 x grande, ml.g5,2 x grande, ml.g5,48 x grande, ml.p4d. 24 x grande

Autoglúon

Chronos-Bolt (Base)

autogluon-forecasting-chronos-bolt-base

Previsão de séries temporais

apache-2.0

Não

ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.xlarge, ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.m5.2xlarge, ml.m5.2xlarge, ml.m5.4xlarge, ml.m5.4xlarge, ml.m5.4xlarge, ml.m5.4xlarge x grande, ml.p 3,2 x grande

Autoglúon

Chronos-Bolt (Pequeno)

autogluon-forecasting-chronos-bolt-small

Previsão de séries temporais

apache-2.0

Não

ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.xlarge, ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.m5.2xlarge, ml.m5.2xlarge, ml.m5.4xlarge, ml.m5.4xlarge, ml.m5.4xlarge, ml.m5.4xlarge x grande, ml.p 3,2 x grande

Autoglúon

Chronos-T5 (Base)

autogluon-forecasting-chronos-t5-base

Previsão de séries temporais

apache-2.0

Não

ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.xlarge, ml.p3.2xlarge

Autoglúon

Chronos-T5 (Grande)

autogluon-forecasting-chronos-t5-large

Previsão de séries temporais

apache-2.0

Não

ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.xlarge, ml.p3.2xlarge

Autoglúon

Chronos-T5 (Pequeno)

autogluon-forecasting-chronos-t5-small

Previsão de séries temporais

apache-2.0

Não

ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.xlarge, ml.p3.2xlarge

Baai

BAAI bge-base-en-v1.5

huggingface-textembedding-bge-base-en-v1-5

Incorporação de texto

mit

Não

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g5.xlarge, ml.g6.12xlarge, ml.g6.24xlarge, ml.g6.2xlarge, ml.g6.48xlarge, ml.g6.4xlarge, ml.g6.4xlarge, ml.g6,8xlarge, ml.g6.xlarge, ml.p4d.24xlarge

Baai

BGE Base En

huggingface-sentencesimilarity-bge-base-en

Similaridade de frases

mit

Sim

ml.c6i.xlarge, ml.g4dn.2xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Baai

BGE Base En V1.5

huggingface-sentencesimilarity-bge-base-en-v1-5

Similaridade de frases

mit

Sim

ml.c6i.xlarge, ml.g4dn.2xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Baai

Extremidade grande BGE

huggingface-sentencesimilarity-bge-large-en

Similaridade de frases

mit

Sim

ml.c6i.xlarge, ml.g4dn.2xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Baai

Extremidade grande BGE V1.5

huggingface-sentencesimilarity-bge-large-en-v1-5

Similaridade de frases

mit

Sim

ml.c6i.xlarge, ml.g4dn.2xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Baai

GRANDE 1 M3

huggingface-sentencesimilarity-bge-m3

Similaridade de frases

mit

Sim

ml.c6i.xlarge, ml.g4dn.2xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Baai

Extremidade pequena BGE

huggingface-sentencesimilarity-bge-small-en

Similaridade de frases

mit

Sim

ml.c6i.xlarge, ml.g4dn.2xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Baai

Extremidade pequena BGE V1.5

huggingface-sentencesimilarity-bge-small-en-v1-5

Similaridade de frases

mit

Sim

ml.c6i.xlarge, ml.g4dn.2xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Berkeley-Nest

Starling LM 7B alfa

huggingface-llm-berkeley-nest-starling-lm-7b-alpha

Geração de texto

apache-2.0

Não

ml.g 5,12 x grande, ml.g 5,24 x grande, ml.g 5,2 x grande, ml.g 5,48 x grande

Bharatgenai

Param2-17B-A2.4B-Thinking

huggingface-llm-param2-17b-a2-4b-thinking

Geração de texto

Não aplicável

Não

ml.g7e.2xlarge, ml.g7e.4xlarge, ml.g7e.8xlarge

Código grande

StarCoder

huggingface-llm-starcoder

Geração de texto

código grande - openrail-m

Não

ml.g5,12x grande, ml.g5,24x grande, ml.g5,48x grande, ml.p4d.24x grande

Código grande

StarCoderBase

huggingface-llm-starcoderbase

Geração de texto

código grande - openrail-m

Não

ml.g5,12x grande, ml.g5,24x grande, ml.g5,48x grande, ml.p4d.24x grande

Grande ciência

Bloom 1b1

huggingface-textgeneration-bloom-1b1

Geração de texto

big science-bloom-rail-1.0

Não

ml.g5,16 x grande, ml.g5,2 x grande, ml.g5,4 x grande, ml.g5,8 x grande

Grande ciência

Bloom 3B

huggingface-textgeneration1-bloom-3b

Geração de texto

big science-bloom-rail-1.0

Sim

ml.g5,16 x grande, ml.g5,2 x grande, ml.g5,4 x grande, ml.g5,8 x grande

Grande ciência

Bloom 7B1

huggingface-textgeneration1-bloom-7b1

Geração de texto

big science-bloom-rail-1.0

Sim

ml.g5,16 x grande, ml.g5,2 x grande, ml.g5,4 x grande, ml.g5,8 x grande

Grande ciência

Bloomz 1b7

huggingface-textgeneration-bloomz-1b7

Geração de texto

big science-bloom-rail-1.0

Não

ml.g5,16 x grande, ml.g5,2 x grande, ml.g5,4 x grande, ml.g5,8 x grande

Grande ciência

BloomZ 7B1 FP16

huggingface-textgeneration1-bloomz-7b1-fp16

Geração de texto

big science-bloom-rail-1.0

Sim

ml.g5,16 x grande, ml.g5,2 x grande, ml.g5,4 x grande, ml.g5,8 x grande

Bingsu

Bingsu, minha difusão estável coreana v1 5

huggingface-txt2img-bingsu-my-korean-stable-diffusion-v1-5

Text-to-Image

creativml-openrail-m

Não

ml.g4dn.2xlarge, ml.g4dn.xlarge, ml.p3.2xlarge

Black-Forest-Labs

Laboratórios da Floresta Negra FLUX.1 [rápido]

huggingface-txt2img-black-forest-labs-flux-1-schnell

Text-to-Image

apache-2.0

Não

ml.g5,12 x grande, ml.g 5,24 x grande, ml.g5,48 x grande, ml.p4d. 24x grande, ml.p5,48 x grande

Black-Forest-Labs

FLUX.2-Klein-Base-4B

huggingface-img2img-flux-2-klein-base-4b

Image-Text-to-Image

Apache-2.0

Não

ml.g6.12xlarge, ml.g6.16xlarge, ml.g6.24xlarge, ml.g6.2xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.g6.xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.g6e.2xlarge, ml.g6e.2xlarge, ml.g6e.2xlarge, ml.g6e.2xlarge e.4xlarge, ml.g6e.8xlarge, ml.g6e.xlarge, ml.g7e.12xlarge, ml.g7e.24xlarge, ml.g7e.2xlarge, ml.g7e.48xlarge, ml.g7e.4xlarge, ml.g7e.8xlarge

Computações cognitivas

Dolphin 2.2.1 Mistral 7B

huggingface-llm-dolphin-2-2-1-mistral-7b

Geração de texto

apache-2.0

Não

ml.g 5,12 x grande, ml.g 5,24 x grande, ml.g 5,2 x grande, ml.g 5,48 x grande

Computações cognitivas

Dolphin 2.5 Mixtral 8 7B

huggingface-llm-dolphin-2-5-mixtral-8x7b

Geração de texto

apache-2.0

Não

ml.g5.48xlarge

Computações cognitivas

Dolphin 2.7 Mixtral 8 7B

huggingface-llm-dolphin-2-7-mixtral-8x7b

Geração de texto

apache-2.0

Não

ml.g5.48xlarge

Computações cognitivas

Dolphin 2.9 Llama 3 8b

huggingface-llm-cognitive-dolphin-29-llama3-8b

Geração de texto

outro

Não

ml.g5,16 x grande, ml.g5,2 x grande, ml.g5,4 x grande, ml.g5,8 x grande

Coerente para a IA

Aya 101

huggingface-llm-aya-101

Geração de texto

apache-2.0

Não

ml.g5,12x grande, ml.g5,24x grande, ml.g5,48x grande, ml.p4d.24x grande

Cross-Encoder

Codificador cruzado Nli Deberta Base

huggingface-zstc-cross-encoder-nli-deberta-base

Zero-Shot Classificação

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Cross-Encoder

Codificador cruzado Nli Distilroberta Base

huggingface-zstc-cross-encoder-nli-distilroberta-base

Zero-Shot Classificação

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Cross-Encoder

Codificador cruzado Nli MiniLM2 L6 H768

huggingface-zstc-cross-encoder-nli-minilm2-l6-h768

Zero-Shot Classificação

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Cross-Encoder

Codificador cruzado Nli Roberta Base

huggingface-zstc-cross-encoder-nli-roberta-base

Zero-Shot Classificação

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Agente cibernético

CyberAgentLM2-7B-Chat (CALM2-7B-Chat)

huggingface-llm-calm2-7b-chat-bf16

Geração de texto

apache-2.0

Sim

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.xlarge

Databricks

DBRX Base

huggingface-llm-dbrx-base

Geração de texto

modelo aberto de blocos de dados

Não

ml.p4d.24x grande, ml.p4de.24x grande, ml.p5,48x grande

Databricks

DBRX Instruct

huggingface-llm-dbrx-instruct

Geração de texto

modelo aberto de blocos de dados

Não

ml.p4d.24x grande, ml.p4de.24x grande, ml.p5,48x grande

Databricks

Dolly V2 12b BF16

huggingface-textgeneration-dolly-v2-12b-bf16

Geração de texto

apache-2.0

Não

ml.g5,12x grande, ml.g5,24x grande, ml.g5,48x grande, ml.p4d.24x grande

Databricks

Dolly V2 3b BF16

huggingface-textgeneration-dolly-v2-3b-bf16

Geração de texto

apache-2.0

Não

ml.g5,16 x grande, ml.g5,2 x grande, ml.g5,4 x grande, ml.g5,8 x grande

Deepseek-Ai

DeepSeek-OCR

deepseek-vlm-deepseek-ocr

Image-Text-to-Text

mit

Não

ml.g4dn.16xlarge, ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g4dn.xlarge, ml.g5.16xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g5.xlarge, ml.g6.16xlarge, ml.g6.2xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.g6.xlarge, ml.g6e.16xlarge, ml.g6e.2xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.g6e.xlarge, ml.p3.2xlarge

Deepseek-Ai

DeepSeek-R1

deepseek-llm-r1

Geração de texto

mit

Não

ml.p5e.48x grande, ml.p5en.48x grande

Deepseek-Ai

DeepSeek-R1-0528

deepseek-llm-r1-0528

Geração de texto

mit

Não

ml.p5e.48x grande, ml.p5en.48x grande

Deepseek-Ai

DeepSeek-R1-Distill-Llama-70B

deepseek-llm-r1-distill-llama-70b

Geração de texto

mit

Sim

Padrão: ml.g6.48xlarge, ml.g6e.12xlarge, ml.g6e.24xlarge, ml.g6e.48xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • djl(Contêiner de serviço da Deep Java Library): ml.g5.48xlarge, ml.g6.48xlarge, ml.p4d.24xlarge

  • generate_highest_throughput(Geração, produtividade otimizada), interact_highest_throughput (Interação, taxa de transferência otimizada): ml.g6.48xlarge, ml.g6e.24xlarge, ml.g6e.48xlarge

  • generate_lowest_cost(Geração, custo otimizado), generate_lowest_latency (Geração, latência otimizada), (Interação, equilíbrio), interact_best_price_performance (interação, custo otimizado), interact_lowest_cost (interação, latência otimizada): interact_lowest_latency ml.g6.48xlarge, ml.g6e.12xlarge, ml.g6e.24xlarge

  • modify_best_price_performance(Modificar, balancear), modify_highest_throughput (Modificar, otimizar a produtividade), modify_lowest_cost (Modificar, otimizar o custo), modify_lowest_latency (Modificar, otimizar a latência), summarize_best_price_performance (Resumir, balancear), summarize_highest_throughput (Resumir, otimizar a taxa de transferência), summarize_lowest_cost (Resumir, otimizar a latência): summarize_lowest_latency ml.g6e.48xlarge

Deepseek-Ai

DeepSeek-R1-Distill-Llama-8B

deepseek-llm-r1-distill-llama-8b

Geração de texto

mit

Sim

Padrão: ml.g6.12xlarge, ml.g6e.12xlarge, ml.g7e.12xlarge, ml.g7e.2xlarge, ml.g7e.4xlarge, ml.g7e.8xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • djl(Contêiner de serviço da Deep Java Library): ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.48xlarge, ml.g6.12xlarge, ml.g6.24xlarge, ml.g6.48xlarge

  • generate_best_price_performance(Gerar, balancear), generate_lowest_cost (Gerar, custo otimizado): ml.g6.xlarge, ml.g6e.xlarge, ml.g7e.2xlarge

  • generate_highest_throughput(Geração, taxa de transferência otimizada), interact_highest_throughput (Interação, taxa de transferência otimizada), (contexto máximo, taxa de transferência otimizada): max_context_highest_throughput ml.g6.48xlarge, ml.g6e.48xlarge, ml.g7e.12xlarge

  • generate_lowest_latency(Gerado, latência otimizada): ml.g6.12xlarge, ml.g6e.4xlarge, ml.g7e.2xlarge

  • interact_best_price_performance(Interact, Balanceado), (Modificar, Balancear), modify_best_price_performance (Modificar, modify_lowest_cost Custo otimizado): ml.g6.12xlarge, ml.g6e.xlarge, ml.g7e.2xlarge

  • interact_lowest_cost(Interact, custo otimizado): ml.g6.48xlarge, ml.g6e.xlarge, ml.g7e.2xlarge

  • interact_lowest_latency(Interact, latência otimizada), modify_lowest_latency (Modificar, latência otimizada): ml.g6.12xlarge, ml.g6e.2xlarge, ml.g7e.12xlarge

  • max_context_lowest_cost(Contexto máximo, custo otimizado), (Resumir, balancear), summarize_best_price_performance (Resumir, custo otimizado): summarize_lowest_cost ml.g6.12xlarge, ml.g6e.12xlarge, ml.g7e.2xlarge

  • max_context_lowest_latency(Contexto máximo, latência otimizada): ml.g6.24xlarge, ml.g6e.24xlarge, ml.g7e.2xlarge

  • modify_highest_throughput(Modificar, taxa de transferência otimizada): ml.g6.48xlarge, ml.g6e.24xlarge, ml.g7e.12xlarge

  • summarize_highest_throughput(Resumir, taxa de transferência otimizada), (Resumir, latência otimizada): summarize_lowest_latency ml.g6.12xlarge, ml.g6e.24xlarge, ml.g7e.12xlarge

Deepseek-Ai

DeepSeek-R1-Distill-Qwen-1.5B

deepseek-llm-r1-distill-qwen-1-5b

Geração de texto

mit

Sim

Padrão: ml.g6.12xlarge, ml.g6e.2xlarge, ml.g6e.4xlarge, ml.g6e.xlarge, ml.g7e.2xlarge, ml.g7e.4xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • generate_best_price_performance(Gerar, balancear), generate_lowest_cost (gerar, otimizar o custo), (interagir, balancear), interact_best_price_performance (interagir, otimizar o custo), interact_lowest_cost (resumir, balancear), summarize_best_price_performance (resumir, otimizar o custo): summarize_lowest_cost ml.g6.2xlarge, ml.g6e.xlarge, ml.g7e.2xlarge

  • generate_highest_throughput(Geração, produtividade otimizada), interact_highest_throughput (Interação, taxa de transferência otimizada): ml.g6.24xlarge, ml.g6e.12xlarge, ml.g7e.4xlarge

  • generate_lowest_latency(Gerado, latência otimizada): ml.g6.12xlarge, ml.g6e.16xlarge, ml.g7e.2xlarge

  • interact_lowest_latency(Interact, latência otimizada), max_context_lowest_latency (contexto máximo, latência otimizada): ml.g6.24xlarge, ml.g6e.16xlarge, ml.g7e.4xlarge

  • max_context_highest_throughput(Contexto máximo, taxa de transferência otimizada): ml.g6.24xlarge, ml.g6e.12xlarge, ml.g7e.2xlarge

  • max_context_lowest_cost(Contexto máximo, custo otimizado): ml.g6.12xlarge, ml.g6e.xlarge, ml.g7e.2xlarge

  • modify_best_price_performance(Modificar, balancear), modify_lowest_cost (Modificar, custo otimizado): ml.g6.4xlarge, ml.g6e.xlarge, ml.g7e.2xlarge

  • modify_highest_throughput(Modificar, taxa de transferência otimizada): ml.g6.24xlarge, ml.g6e.24xlarge, ml.g7e.4xlarge

  • modify_lowest_latency(Modificar, latência otimizada): ml.g6.24xlarge, ml.g6e.4xlarge, ml.g7e.4xlarge

  • summarize_highest_throughput(Resumindo, produtividade otimizada): ml.g6.24xlarge, ml.g6e.2xlarge, ml.g7e.2xlarge

  • summarize_lowest_latency(Resumindo, latência otimizada): ml.g6.24xlarge, ml.g6e.16xlarge, ml.g7e.2xlarge

Deepseek-Ai

DeepSeek-R1-Distill-Qwen-14B

deepseek-llm-r1-distill-qwen-14b

Geração de texto

mit

Sim

Padrão: ml.g6.48xlarge, ml.g6e.12xlarge, ml.g6e.24xlarge, ml.g6e.48xlarge, ml.p5en.48xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • generate_best_price_performance(Gerar, Balancear), generate_lowest_cost (Gerar, Custo otimizado), (Interagir, Balancear), interact_best_price_performance (Interagir, Custo otimizado): ml.g6.12xlarge, ml.g6e.xlarge, ml.g7e.2xlarge interact_lowest_cost

  • generate_highest_throughput(Geração, produtividade otimizada), interact_highest_throughput (Interação, taxa de transferência otimizada): ml.g6.48xlarge, ml.g6e.48xlarge, ml.g7e.4xlarge

  • generate_lowest_latency(Gerado, latência otimizada): ml.g6.12xlarge, ml.g6e.4xlarge, ml.g7e.4xlarge

  • interact_lowest_latency(Interact, latência otimizada): ml.g6.12xlarge, ml.g6e.2xlarge, ml.g7e.4xlarge

  • max_context_highest_throughput(Contexto máximo, taxa de transferência otimizada), max_context_lowest_cost (contexto máximo, custo otimizado), (contexto máximo, latência otimizada), max_context_lowest_latency (resumo, balanceado), summarize_best_price_performance (resumo, taxa de transferência otimizada): ml.g6.48xlarge, summarize_highest_throughput ml.g6e.12xlarge, ml.p5en.48xlarge

  • modify_best_price_performance(Modificar, balancear), modify_lowest_cost (Modificar, custo otimizado): ml.g6.12xlarge, ml.g6e.12xlarge, ml.g7e.2xlarge

  • modify_highest_throughput(Modificar, taxa de transferência otimizada): ml.g6.48xlarge, ml.g6e.24xlarge, ml.g7e.2xlarge

  • modify_lowest_latency(Modificar, latência otimizada): ml.g6e.24xlarge, ml.g7e.2xlarge, ml.p5en.48xlarge

  • summarize_lowest_cost(Resumindo, custo otimizado): ml.g6.48xlarge, ml.g6e.12xlarge, ml.g6e.24xlarge

  • summarize_lowest_latency(Resumindo, latência otimizada): ml.g6.48xlarge, ml.g6e.12xlarge, ml.g6e.48xlarge

Deepseek-Ai

DeepSeek-R1-Distill-Qwen-32B

deepseek-llm-r1-distill-qwen-32b

Geração de texto

mit

Sim

Padrão: ml.g6e.48xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • generate_best_price_performance(Gerar, Balancear), generate_lowest_cost (Gerar, Custo otimizado), (Interagir, Balancear), interact_best_price_performance (Interagir, Custo otimizado): ml.g6.12xlarge, ml.g6e.12xlarge, ml.g7e.2xlarge interact_lowest_cost

  • generate_highest_throughput(Geração, produtividade otimizada), interact_highest_throughput (Interação, taxa de transferência otimizada): ml.g6.48xlarge, ml.g6e.48xlarge, ml.g7e.4xlarge

  • generate_lowest_latency(Gerado, latência otimizada): ml.g6.24xlarge, ml.g6e.12xlarge, ml.g7e.4xlarge

  • interact_lowest_latency(Interact, latência otimizada): ml.g6.12xlarge, ml.g6e.24xlarge, ml.g7e.4xlarge

  • modify_best_price_performance(Modificar, balancear), modify_lowest_cost (Modificar, custo otimizado), (Modificar, modify_lowest_latency latência otimizada): ml.g6.48xlarge, ml.g6e.12xlarge, ml.g6e.24xlarge

  • modify_highest_throughput(Modificar, taxa de transferência otimizada): ml.g6.48xlarge, ml.g6e.24xlarge, ml.g6e.48xlarge

Deepseek-Ai

DeepSeek-R1-Distill-Qwen-7B

deepseek-llm-r1-distill-qwen-7b

Geração de texto

mit

Sim

Padrão: ml.g6.12xlarge, ml.g6.24xlarge, ml.g6e.12xlarge, ml.g6e.24xlarge, ml.g7e.2xlarge, ml.g7e.4xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • generate_best_price_performance(Gerar, Balancear), generate_lowest_cost (Gerar, Custo otimizado), (Interagir, Balancear), interact_best_price_performance (Interagir, Custo otimizado): ml.g6.4xlarge, ml.g6e.xlarge, ml.g7e.2xlarge interact_lowest_cost

  • generate_highest_throughput(Gerado, taxa de transferência otimizada): ml.g6.24xlarge, ml.g6e.24xlarge, ml.g7e.4xlarge

  • generate_lowest_latency(Gerado, latência otimizada): ml.g6.24xlarge, ml.g6e.xlarge, ml.g7e.2xlarge

  • interact_highest_throughput(Interact, taxa de transferência otimizada), interact_lowest_latency (Interação, latência otimizada), (contexto máximo, latência otimizada), max_context_lowest_latency modify_highest_throughput (modificação, taxa de transferência otimizada): ml.g6.24xlarge, ml.g6e.12xlarge, ml.g7e.2xlarge

  • max_context_highest_throughput(Contexto máximo, taxa de transferência otimizada): ml.g6.24xlarge, ml.g6e.24xlarge, ml.g7e.2xlarge

  • max_context_lowest_cost(Contexto máximo, custo otimizado), (Resumir, balancear), summarize_best_price_performance (Resumir, custo otimizado): summarize_lowest_cost ml.g6.12xlarge, ml.g6e.12xlarge, ml.g7e.2xlarge

  • modify_best_price_performance(Modificar, balancear), modify_lowest_cost (Modificar, custo otimizado), (Modificar, modify_lowest_latency latência otimizada): ml.g6.12xlarge, ml.g6e.xlarge, ml.g7e.2xlarge

  • summarize_highest_throughput(Resumindo, produtividade otimizada): ml.g6.24xlarge, ml.g6e.12xlarge, ml.g7e.4xlarge

  • summarize_lowest_latency(Resumindo, latência otimizada): ml.g6.12xlarge, ml.g6e.24xlarge, ml.g7e.4xlarge

Deepseek-Ai

DeepSeek-V3.1

deepseek-llm-deepseek-v3-1

Geração de texto

mit

Não

ml.p5e.48x grande, ml.p5en.48x grande

Deepseek-Ai

DeepSeek-V3.2

deepseek-llm-deepseek-v3-2

Geração de texto

mit

Não

ml.p5en.48xlarge

Destilbert

Estojo base DistilBert

huggingface-eqa-distilbert-base-cased

Perguntas e respostas

apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Destilbert

Estojo base DistilBert

huggingface-spc-distilbert-base-cased

Fill-Mask

apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Destilbert

Estojo base DistilBert

huggingface-tc-distilbert-base-cased

Classificação de texto

apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Destilbert

Caixa multilíngue DistilBert Base

huggingface-eqa-distilbert-base-multilingual-cased

Perguntas e respostas

apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Destilbert

Caixa multilíngue DistilBert Base

huggingface-spc-distilbert-base-multilingual-cased

Fill-Mask

apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Destilbert

Caixa multilíngue DistilBert Base

huggingface-tc-distilbert-base-multilingual-cased

Classificação de texto

apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Destilbert

DistilGPT 2

huggingface-textgeneration-distilgpt2

Geração de texto

apache-2.0

Não

ml.g5,16 x grande, ml.g5,2 x grande, ml.g5,4 x grande, ml.g5,8 x grande

Destilbert

DistilRoBERTa Base

huggingface-eqa-distilroberta-base

Perguntas e respostas

apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Destilbert

DistilRoBERTa Base

huggingface-tc-distilroberta-base

Classificação de texto

apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Destilbert

Perguntas e respostas

huggingface-eqa-distilbert-base-uncased

Perguntas e respostas

apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Destilbert

Classificação de pares de frases

huggingface-spc-distilbert-base-uncased

Fill-Mask

apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Destilbert

Classificação de texto

huggingface-tc-distilbert-base-uncased

Classificação de texto

apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Elastic

Base Distilbert sem embalagem

huggingface-ner-distilbert-base-uncased-finetuned-conll03-eng

Classificação de tokens

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Elastic

Reconhecimento de entidades nomeadas

huggingface-ner-distilbert-base-cased-finetuned-conll03-eng

Classificação de tokens

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Elastic

Reconhecimento de entidades nomeadas

huggingface-ner-distilbert-base-cased-finetuned-conll03-english

Classificação de tokens

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Eleutheria

GPT-J 6B

huggingface-textgeneration1-gpt-j-6b

Geração de texto

apache-2.0

Sim

ml.g5,12 x grande, ml.g5,2 x grande, ml.g5,4 x grande, ml.g5,8 x grande

Eleutheria

GPT-Neo 125M

huggingface-textgeneration1-gpt-neo-125m

Geração de texto

mit

Sim

ml.g5,16 x grande, ml.g5,2 x grande, ml.g5,4 x grande, ml.g5,8 x grande

Eleutheria

gpt-neox-20b

huggingface-textgeneration2-gpt-neox-20b-fp16

Geração de texto

Apache-2.0

Não

ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.48xlarge, ml.g6.12xlarge, ml.g6.24xlarge, ml.g6.48xlarge, ml.g6e.12xlarge, ml.g6e.24xlarge, ml.p4d.24xlarge

Eleutheria

Pythia 160m Deduped

huggingface-llm-eleutherai-pythia-160m-deduped

Geração de texto

apache-2.0

Não

ml.g5,12x grande, ml.g5,24x grande, ml.g5,2x grande

Eleutheria

Pythia 7m Deduped

huggingface-llm-eleutherai-pythia-70m-deduped

Geração de texto

apache-2.0

Não

ml.g 5,12 x grande, ml.g 5,24 x grande, ml.g 5,2 x grande, ml.g 5,48 x grande

Elyza

ELYZA-japanese-Llama-2-13b-chat

huggingface-llm-elyza-japanese-llama-2-13b-chat

Geração de texto

lhama2

Sim

ml.g5,12x grande, ml.g5,24x grande, ml.g5,48x grande, ml.p4d.24x grande

Elyza

ELYZA-japanese-Llama-2-13b-fast-chat

huggingface-llm-elyza-japanese-llama-2-13b-fast-chat

Geração de texto

lhama2

Sim

ml.g5,12x grande, ml.g5,24x grande, ml.g5,48x grande, ml.p4d.24x grande

Elyza

ELYZA-japanese-Llama-2-7b-chat

huggingface-llm-elyza-japanese-llama-2-7b-chat-bf16

Geração de texto

lhama2

Sim

ml.g5,12 x grande, ml.g5,24 x grande, ml.g5,2 x grande, ml.g5,48 x grande, ml.g5,4 x grande, ml.g5.x grande

Elyza

ELYZA-japanese-Llama-2-7b-fast-chat

huggingface-llm-elyza-japanese-llama-2-7b-fast-chat-bf16

Geração de texto

lhama2

Sim

ml.g5,12 x grande, ml.g5,24 x grande, ml.g5,2 x grande, ml.g5,48 x grande, ml.g5,4 x grande, ml.g5.x grande

Emrecan

Allnli Tr com capa turca baseada em berta americana

huggingface-zstc-emrecan-bert-base-turkish-cased-allnli-tr

Zero-Shot Classificação

mit

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Facebook

Zero-Shot Classificação de texto

huggingface-zstc-facebook-bart-large-mnli

Zero-Shot Classificação

mit

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Facebook AI

Robert A. Base

huggingface-eqa-roberta-base

Perguntas e respostas

mit

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Facebook AI

Robert A. Base

huggingface-spc-roberta-base

Fill-Mask

mit

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Facebook AI

Robert A. Base

huggingface-tc-roberta-base

Classificação de texto

mit

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Facebook AI

Robert A Large

huggingface-eqa-roberta-large

Perguntas e respostas

mit

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Facebook AI

Robert A Large

huggingface-spc-roberta-large

Fill-Mask

mit

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Facebook AI

Robert A Large

huggingface-tc-roberta-large

Classificação de texto

mit

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Facebook AI

XLM CLM English-German

huggingface-spc-xlm-clm-ende-1024

Fill-Mask

mit

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Facebook AI

XLM CLM English-German

huggingface-tc-xlm-clm-ende-1024

Classificação de texto

mit

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Facebook AI

XLM MLM 15 idiomas XNLI

huggingface-spc-xlm-mlm-xnli15-1024

Fill-Mask

cc-by-nc-4.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Facebook AI

XLM MLM English-German

huggingface-spc-xlm-mlm-ende-1024

Fill-Mask

cc-by-nc-4.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Facebook AI

XLM MLM English-German

huggingface-tc-xlm-mlm-ende-1024

Classificação de texto

cc-by-nc-4.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Facebook AI

XLM MLM English-Romanian

huggingface-spc-xlm-mlm-enro-1024

Fill-Mask

cc-by-nc-4.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Facebook AI

XLM MLM English-Romanian

huggingface-tc-xlm-mlm-enro-1024

Classificação de texto

cc-by-nc-4.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Facebook AI

XLM MLM TLM 15 idiomas XNLI

huggingface-spc-xlm-mlm-tlm-xnli15-1024

Fill-Mask

cc-by-nc-4.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Facebook AI

XLM MLM TLM 15 idiomas XNLI

huggingface-tc-xlm-mlm-tlm-xnli15-1024

Classificação de texto

cc-by-nc-4.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Fictiverso

Modelo de difusão estável fictício BalloonArt

huggingface-txt2img-fictiverse-stable-diffusion-balloonart

Text-to-Image

creativml-openrail-m

Não

ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Fictiverso

Modelo microscópico de difusão estável fictício

huggingface-txt2img-fictiverse-stable-diffusion-micro-model

Text-to-Image

trilho aberto

Não

ml.g4dn.2xlarge, ml.g4dn.xlarge, ml.p3.2xlarge

Fictiverso

Modelo de difusão estável fictício PaperCut

huggingface-txt2img-fictiverse-stable-diffusion-papercut-model

Text-to-Image

creativml-openrail-m

Não

ml.g4dn.2xlarge, ml.g4dn.xlarge, ml.p3.2xlarge

Fictiverso

Modelo de difusão estável fictício VoxelArt

huggingface-txt2img-fictiverse-stable-diffusion-voxelart-model

Text-to-Image

creativml-openrail-m

Não

ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Google

Arquivo grande do Bigbird Pegasus

huggingface-summarization-bigbird-pegasus-large-arxiv

Resumo de texto

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Google

Bigbird Pegasus Large Pubmed

huggingface-summarization-bigbird-pegasus-large-pubmed

Resumo de texto

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Google

Flan-T5 Base

huggingface-text2text-flan-t5-base

Geração de texto Text2Text

apache-2.0

Sim

ml.g5,16 x grande, ml.g5,2 x grande, ml.g5,4 x grande, ml.g5,8 x grande

Google

Flan-T5 Grande

huggingface-text2text-flan-t5-large

Geração de texto Text2Text

apache-2.0

Sim

ml.g5,16 x grande, ml.g5,2 x grande, ml.g5,4 x grande, ml.g5,8 x grande

Google

Flan-T5 Pequeno

huggingface-text2text-flan-t5-small

Geração de texto Text2Text

apache-2.0

Sim

ml.g5,16 x grande, ml.g5,2 x grande, ml.g5,4 x grande, ml.g5,8 x grande

Google

Flan-T5 XL

huggingface-text2text-flan-t5-xl

Geração de texto Text2Text

apache-2.0

Sim

ml.g5,16 x grande, ml.g5,2 x grande, ml.g5,4 x grande, ml.g5,8 x grande

Google

Flan-T5 XXL

huggingface-text2text-flan-t5-xxl

Geração de texto Text2Text

apache-2.0

Sim

ml.g5,12x grande, ml.g5,24x grande, ml.g5,48x grande, ml.p4d.24x grande

Google

Gemma 2 27B

huggingface-llm-gemma-2-27b

Geração de texto

gema

Não

ml.g5,48x grande, ml.p4d.24x grande

Google

Gemma 2 27B Instruct

huggingface-llm-gemma-2-27b-instruct

Geração de texto

gema

Não

ml.g5,48x grande, ml.p4d.24x grande

Google

Gemma 2 2B

huggingface-llm-gemma-2-2b

Geração de texto

gema

Não

ml.g5.12xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g5.xlarge, ml.p4de.24xlarge, ml.p5.48xlarge

Google

Gemma 2 2B Instruct

huggingface-llm-gemma-2-2b-instruct

Geração de texto

gema

Não

ml.g5.12xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g5.xlarge, ml.p4de.24xlarge, ml.p5.48xlarge

Google

Gemma 2 9B

huggingface-llm-gemma-2-9b

Geração de texto

gema

Não

ml.g5,12x grande, ml.g5,24x grande, ml.g5,48x grande, ml.p4d.24x grande

Google

Gemma 2 9B Instruct

huggingface-llm-gemma-2-9b-instruct

Geração de texto

gema

Não

ml.g5,12x grande, ml.g5,24x grande, ml.g5,48x grande, ml.p4d.24x grande

Google

Instrução Gemma 3 1B

huggingface-llm-gemma-3-1b-instruct

Geração de texto

gema

Não

ml.g5,16 x grande, ml.g5,2 x grande, ml.g5,4 x grande, ml.g5,8 x grande

Google

Gemma 3 27B Instruct

huggingface-vlm-gemma-3-27b-instruct

Image-Text-to-Text

gema

Não

ml.g5,48x grande, ml.g6,48x grande, ml.p4d.24x grande, ml.p5,48x grande

Google

Gemma 3 4B Instruct

huggingface-vlm-gemma-3-4b-instruct

Image-Text-to-Text

gema

Não

ml.g5,16 x grande, ml.g5,2 x grande, ml.g5,4 x grande, ml.g5,8 x grande

Google

gemma-2b

huggingface-llm-gemma-2b

Geração de texto

gema

Sim

Padrão: ml.g4dn.xlarge, ml.g5.xlarge, ml.g6.xlarge, ml.g6e.xlarge, ml.p3.2xlarge, ml.p4d.24xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • generate_best_price_performance(Gerado, balanceado): ml.g4dn.xlarge, ml.g5.2xlarge, ml.g6e.2xlarge

  • generate_highest_throughput(Geração, taxa de transferência otimizada), max_context_highest_throughput (contexto máximo, taxa de transferência otimizada): ml.g6e.12xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • generate_lowest_cost(Geração, custo otimizado), interact_lowest_cost (Interação, custo otimizado), (contexto máximo, max_context_lowest_cost custo otimizado): ml.g4dn.xlarge, ml.g5.xlarge, ml.g6.xlarge

  • generate_lowest_latency(Gerado, latência otimizada): ml.g6.12xlarge, ml.g6e.12xlarge, ml.p5en.48xlarge

  • interact_best_price_performance(Interact, Balanceado): ml.g4dn.xlarge, ml.g5.xlarge, ml.g6e.xlarge

  • interact_highest_throughput(Interact, taxa de transferência otimizada): ml.g6e.48xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • interact_lowest_latency(Interact, latência otimizada): ml.g4dn.2xlarge, ml.g6e.12xlarge, ml.p5en.48xlarge

  • max_context_lowest_latency(Contexto máximo, latência otimizada): ml.g6e.4xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

Google

gemma-2b-bit

huggingface-llm-gemma-2b-instruct

Geração de texto

gema

Sim

Padrão: ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.12xlarge, ml.p3.16xlarge, ml.p4d.24xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • generate_best_price_performance(Gerar, balancear), generate_lowest_cost (gerar, otimizar o custo), (interagir, balancear), interact_best_price_performance (interagir, otimizar o custo), interact_lowest_cost (contexto máximo, custo otimizado): ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g6.12xlarge max_context_lowest_cost

  • generate_highest_throughput(Geração, taxa de transferência otimizada), max_context_lowest_latency (contexto máximo, latência otimizada): ml.g6e.12xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • generate_lowest_latency(Geração, latência otimizada), max_context_highest_throughput (contexto máximo, taxa de transferência otimizada): ml.g6e.24xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • interact_highest_throughput(Interact, taxa de transferência otimizada), interact_lowest_latency (Interact, latência otimizada): ml.g6e.48xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

Google

gemma-4-26b-a4b-it

huggingface-vlm-gemma-4-26b-a4b-it

Geração de texto

apache-2.0

Não

Padrão: ml.g6.12xlarge, ml.g6.24xlarge, ml.g6e.12xlarge, ml.g6e.24xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • generate_highest_throughput(Geração, produtividade otimizada), (interação, taxa de transferência otimizada), interact_highest_throughput summarize_lowest_latency (resumo, latência otimizada): ml.g6e.24xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • generate_lowest_cost(Gerar, otimizar o custo), interact_best_price_performance (Interagir, equilibrar), (Interagir, otimizar o custo), interact_lowest_cost (Modificar, balancear), modify_best_price_performance (Modificar, otimizar o custo), modify_lowest_cost (Resumir, equilibrar), summarize_best_price_performance (Resumir, otimizar o custo): summarize_lowest_cost ml.g6.12xlarge, ml.g6e.12xlarge, ml.p5.48xlarge

  • generate_lowest_latency(Gerado, latência otimizada): ml.g6.12xlarge, ml.g6e.24xlarge, ml.p5.48xlarge

  • interact_lowest_latency(Interact, latência otimizada): ml.g6.24xlarge, ml.g6e.24xlarge, ml.p5en.48xlarge

  • modify_highest_throughput(Modificar, taxa de transferência otimizada), modify_lowest_latency (Modificar, latência otimizada), summarize_highest_throughput (Resumir, taxa de transferência otimizada): ml.g6e.12xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

Google

gemma-4-31b-it

huggingface-vlm-gemma-4-31b-it

Image-Text-to-Text

Apache-2.0

Sim

ml.g6,24xgrande, ml.g7e.2xgrande

Google

gema-4- E2B-it

huggingface-vlm-gemma-4-e2b-instruct

Image-Text-to-Text

Apache-2.0

Não

Padrão: ml.g6.12xlarge, ml.g6e.2xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.g6e.xlarge, ml.g7e.4xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • max_context_highest_throughput(Contexto máximo, taxa de transferência otimizada): ml.g6.48xlarge, ml.g6e.24xlarge, ml.g7e.4xlarge

  • max_context_lowest_cost(Contexto máximo, custo otimizado): ml.g6.4xlarge, ml.g6e.xlarge, ml.g7e.4xlarge

  • max_context_lowest_latency(Contexto máximo, latência otimizada): ml.g6.8xlarge, ml.g6e.8xlarge, ml.g7e.4xlarge

  • modify_best_price_performance(Modificar, Balancear), modify_lowest_cost (Modificar, Custo otimizado), (Resumir, Balancear), summarize_best_price_performance (Resumir, Custo otimizado): summarize_lowest_cost ml.g6.4xlarge, ml.g6e.xlarge, ml.g7e.2xlarge

  • modify_highest_throughput(Modificar, taxa de transferência otimizada): ml.g6.24xlarge, ml.g6e.24xlarge, ml.g7e.2xlarge

  • modify_lowest_latency(Modificar, latência otimizada): ml.g6.24xlarge, ml.g6e.8xlarge, ml.g7e.4xlarge

  • summarize_highest_throughput(Resumir, taxa de transferência otimizada), (Resumir, latência otimizada): summarize_lowest_latency ml.g6.24xlarge, ml.g6e.xlarge, ml.g7e.2xlarge

Google

gemma-4-e4b-it

huggingface-vlm-gemma-4-e4b-it

Geração de texto

apache-2.0

Sim

Padrão: ml.g6.12xlarge, ml.g6e.2xlarge, ml.g6e.4xlarge, ml.g6e.xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • generate_best_price_performance(Gerar, balancear), generate_lowest_cost (gerar, otimizar o custo), (interagir, balancear), interact_best_price_performance (interagir, otimizar o custo), interact_lowest_cost (modificar, balancear), modify_best_price_performance (modificar, otimizar o custo): ml.g6.xlarge, ml.g6e.xlarge, ml.p5.48xlarge modify_lowest_cost

  • generate_highest_throughput(Gerado, taxa de transferência otimizada): ml.g6e.24xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • generate_lowest_latency(Gerado, latência otimizada): ml.g6.2xlarge, ml.g6e.2xlarge, ml.p5en.48xlarge

  • interact_highest_throughput(Interact, taxa de transferência otimizada): ml.g6.48xlarge, ml.g6e.48xlarge, ml.p5.48xlarge

  • interact_lowest_latency(Interact, latência otimizada): ml.g6.16xlarge, ml.g6e.16xlarge, ml.p5.48xlarge

  • max_context_highest_throughput(Contexto máximo, taxa de transferência otimizada): ml.g6e.12xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • max_context_lowest_cost(Contexto máximo, custo otimizado), (Resumir, balancear), summarize_best_price_performance (Resumir, custo otimizado): summarize_lowest_cost ml.g6.12xlarge, ml.g6e.xlarge, ml.p5.48xlarge

  • max_context_lowest_latency(Contexto máximo, latência otimizada): ml.g6.24xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • modify_highest_throughput(Modificar, taxa de transferência otimizada): ml.g6.24xlarge, ml.g6e.24xlarge, ml.p5.48xlarge

  • modify_lowest_latency(Modificar, latência otimizada): ml.g6.12xlarge, ml.g6e.16xlarge, ml.p5.48xlarge

  • summarize_highest_throughput(Resumir, taxa de transferência otimizada), (Resumir, latência otimizada): summarize_lowest_latency ml.g6e.8xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

Google

gemma-7b

huggingface-llm-gemma-7b

Geração de texto

gema

Sim

ml.g6e.48x grande, ml.p4d.24x grande, ml.p5en.48x grande

Google

gemma-7b-it

huggingface-llm-gemma-7b-instruct

Geração de texto

gema

Sim

Padrão: ml.g5.48xlarge, ml.g6.48xlarge, ml.g6e.12xlarge, ml.g6e.24xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • generate_best_price_performance(Gerado, balanceado): ml.g6.48xlarge, ml.g6e.12xlarge, ml.p4d.24xlarge

  • generate_highest_throughput(Geração, produtividade otimizada), interact_highest_throughput (Interação, taxa de transferência otimizada): ml.g6e.48xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • generate_lowest_cost(Geração, custo otimizado), interact_lowest_cost (Interação, custo otimizado), (contexto máximo, custo otimizado): ml.g5.48xlarge, ml.g6.48xlarge, ml.g6e.12xlarge max_context_lowest_cost

  • generate_lowest_latency(Geração, latência otimizada), max_context_highest_throughput (contexto máximo, taxa de transferência otimizada): ml.g6e.12xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • interact_best_price_performance(Interact, Balanceado): ml.g5.48xlarge, ml.g6e.12xlarge, ml.p4d.24xlarge

  • interact_lowest_latency(Interact, latência otimizada): ml.g5.48xlarge, ml.g6e.24xlarge, ml.p5en.48xlarge

  • max_context_lowest_latency(Contexto máximo, latência otimizada): ml.g6e.24xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

Google-Bert

Base BERT cased

huggingface-eqa-bert-base-cased

Perguntas e respostas

apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Google-Bert

Base BERT cased

huggingface-spc-bert-base-cased

Fill-Mask

apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Google-Bert

Base BERT cased

huggingface-tc-bert-base-cased

Classificação de texto

apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Google-Bert

Estojo multilíngue Base BERT

huggingface-eqa-bert-base-multilingual-cased

Perguntas e respostas

apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Google-Bert

Estojo multilíngue Base BERT

huggingface-spc-bert-base-multilingual-cased

Fill-Mask

apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Google-Bert

Estojo multilíngue Base BERT

huggingface-tc-bert-base-multilingual-cased

Classificação de texto

apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Google-Bert

Base BERT multilíngue sem caixa

huggingface-eqa-bert-base-multilingual-uncased

Perguntas e respostas

apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Google-Bert

Base BERT multilíngue sem caixa

huggingface-spc-bert-base-multilingual-uncased

Fill-Mask

apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Google-Bert

Base BERT multilíngue sem caixa

huggingface-tc-bert-base-multilingual-uncased

Classificação de texto

apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Google-Bert

Base BERT uncased

huggingface-eqa-bert-base-uncased

Perguntas e respostas

apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Google-Bert

Base BERT uncased

huggingface-spc-bert-base-uncased

Fill-Mask

apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Google-Bert

Base BERT uncased

huggingface-tc-bert-base-uncased

Classificação de texto

apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Google-Bert

BERT grande cased

huggingface-eqa-bert-large-cased

Perguntas e respostas

apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Google-Bert

BERT grande cased

huggingface-spc-bert-large-cased

Fill-Mask

apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Google-Bert

BERT grande cased

huggingface-tc-bert-large-cased

Classificação de texto

apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Google-Bert

Máscara de palavras inteiras BERT grande cased

huggingface-eqa-bert-large-cased-whole-word-masking

Perguntas e respostas

apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Google-Bert

Máscara de palavras inteiras BERT grande cased

huggingface-spc-bert-large-cased-whole-word-masking

Fill-Mask

apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Google-Bert

BERT grande uncased

huggingface-spc-bert-large-uncased

Fill-Mask

apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Google-Bert

BERT grande uncased

huggingface-tc-bert-large-uncased

Classificação de texto

apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Google-Bert

Máscara de palavras inteiras BERT grande uncased

huggingface-spc-bert-large-uncased-whole-word-masking

Fill-Mask

apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Google-Bert

Máscara de enchimento

huggingface-fillmask-bert-base-uncased

Fill-Mask

apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Google-T5

Tradução de máquina

huggingface-translation-t5-small

Tradução

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Google-T5

t5 Base em

huggingface-translation-t5-base

Tradução

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Google-T5

t5 Large Pen

huggingface-translation-t5-large

Tradução

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Gradiente

Llama-3 8B Gradient Instruct 1048k

huggingface-llm-llama-3-8b-instruct-gradient

Geração de texto

Lhama3

Não

ml.g5.12xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge

Gradiente

Llama-3 8B Gradient Instruct 262k

huggingface-llm-gradientai-llama-3-8B-instruct-262k

Geração de texto

Lhama3

Não

ml.g5.12xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge

Helsinki-Nlp

Helsinque opus en es

huggingface-translation-opus-mt-en-es

Tradução

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Helsinki-Nlp

Helsinque opus en vi

huggingface-translation-opus-mt-en-vi

Tradução

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Helsinki-Nlp

Helsinque opus mul en

huggingface-translation-opus-mt-mul-en

Tradução

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Abraçando o rosto h4

HuggingFaceH4 zéfir-orpo-141b- A35b-v0.1

huggingface-llm-huggingfaceh4-zephyr-orpo-141b-a35b-v01

Geração de texto

apache-2.0

Não

ml.g5,48x grande, ml.p4d.24x grande

Abraçando o rosto h4

Star Chat Alpha

huggingface-llm-huggingfaceh4-starchat-alpha

Geração de texto

código grande - openrail-m

Não

ml.g 5,12 x grande, ml.g 5,24 x grande, ml.g 5,48 x grande

Abraçando o rosto h4

Star Chat Beta

huggingface-llm-huggingfaceh4-starchat-beta

Geração de texto

código grande - openrail-m

Não

ml.g5,12x grande, ml.g5,24x grande, ml.g5,48x grande, ml.p4d.24x grande

Abraçando o rosto h4

Zephyr 7B Beta

huggingface-llm-huggingfaceh4-zephyr-7b-beta

Geração de texto

mit

Não

ml.g5,12 x grande, ml.g5,24 x grande, ml.g5,2 x grande, ml.g5,48 x grande, ml.p4d. 24 x grande

Ibm

Quality Controlled Paraphrase Generation

huggingface-text2text-qcpg-sentences

Geração de texto Text2Text

apache-2.0

Não

ml.g5,16 x grande, ml.g5,2 x grande, ml.g5,4 x grande, ml.g5,8 x grande

Idea-Ccnl

IDEA CCNL Taiyi Difusão Estável 1B Chinesa EN v0.1

huggingface-txt2img-idea-ccnl-taiyi-1b-chinese-en-v01

Text-to-Image

creativml-openrail-m

Não

ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Idea-Ccnl

DIFUSÃO ESTÁVEL IDEA CCNL Taiyi 1B Chinesa v0.1

huggingface-txt2img-idea-ccnl-taiyi-1b-chinese-v0-1

Text-to-Image

creativml-openrail-m

Não

ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Infloat

Base E5

huggingface-sentencesimilarity-e5-base

Similaridade de frases

mit

Sim

ml.c6i.xlarge, ml.g4dn.2xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Infloat

E5 Base Versão 2

huggingface-sentencesimilarity-e5-base-v2

Similaridade de frases

mit

Sim

ml.c6i.xlarge, ml.g4dn.2xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Infloat

E5 Large V2

huggingface-sentencesimilarity-e5-large-v2

Similaridade de frases

mit

Sim

ml.c6i.xlarge, ml.g4dn.2xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Infloat

Base E5 multilíngue

huggingface-sentencesimilarity-multilingual-e5-base

Similaridade de frases

mit

Sim

ml.c6i.xlarge, ml.g4dn.2xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Infloat

E5 grande multilíngue

huggingface-sentencesimilarity-multilingual-e5-large

Similaridade de frases

mit

Sim

ml.c6i.xlarge, ml.g4dn.2xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Lancha

Difusão Langboat Guohua

huggingface-txt2img-langboat-guohua-diffusion

Text-to-Image

creativml-openrail-m

Não

ml.g4dn.2xlarge, ml.g4dn.xlarge, ml.p3.2xlarge

Luz eterna

Luz externa Nli Xlm R grega

huggingface-zstc-lighteternal-nli-xlm-r-greek

Zero-Shot Classificação

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Lightonai

LightOnOCR-2-1B

huggingface-vlm-lightonai-lightonocr-2-1b

Image-Text-to-Text

Apache-2.0

Não

ml.g6.2xlarge

Meta

Llama-2-7b-hf

meta-textgeneration-llama-2-7b

Geração de texto

lhama2

Sim

Padrão: ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • generate_best_price_performance(Gerar, balancear), generate_lowest_cost (Gerar, custo otimizado): ml.g5.4xlarge, ml.g6.4xlarge, ml.g6e.4xlarge

  • generate_highest_throughput(Geração, taxa de transferência otimizada), generate_lowest_latency (Geração, latência otimizada), (contexto máximo, taxa de transferência otimizada), max_context_highest_throughput (contexto máximo, latência otimizada): max_context_lowest_latency ml.p4d.24xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • interact_best_price_performance(Interact, Balanced), interact_lowest_cost (Interact, Custo otimizado): ml.g5.24xlarge, ml.g6.12xlarge, ml.g6e.2xlarge

  • interact_highest_throughput(Interact, taxa de transferência otimizada): ml.g6e.48xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

  • interact_lowest_latency(Interact, latência otimizada): ml.g6e.24xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

  • max_context_lowest_cost(Contexto máximo, custo otimizado): ml.g4dn.12xlarge, ml.g6.12xlarge, ml.g6e.xlarge

Meta

Llama-3.1-70B-Instruct

meta-textgeneration-llama-3-1-70b-instruct

Geração de texto

Chamada 3.1

Sim

Padrão: ml.g6e.48xlarge, ml.p5en.48xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • generate_best_price_performance(Gerado, balanceado): ml.g6e.12xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

  • generate_highest_throughput(Geração, produtividade otimizada), generate_lowest_latency (Geração, latência otimizada): ml.p4d.24xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • generate_lowest_cost(Geração, custo otimizado), (interação, equilíbrio), interact_best_price_performance (interação, custo otimizado): ml.g5.48xlarge, ml.g6.48xlarge, ml.g6e.12xlarge interact_lowest_cost

  • interact_highest_throughput(Interact, taxa de transferência otimizada), interact_lowest_latency (Interact, latência otimizada): ml.g5.48xlarge, ml.g6e.48xlarge, ml.p5en.48xlarge

  • modify_best_price_performance(Modificar, balancear), modify_highest_throughput (Modificar, produtividade otimizada), (Modificar, custo otimizado), modify_lowest_cost (Modificar, latência otimizada): modify_lowest_latency ml.g6e.48xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • summarize_best_price_performance(Resumir, balanceado), summarize_highest_throughput (Resumir, produtividade otimizada), (Resumir, otimizar custos), summarize_lowest_cost (Resumir, otimizar latência): summarize_lowest_latency ml.p5en.48xlarge

Meta

Llama-3.1-8B-Instruct

meta-textgeneration-llama-3-1-8b-instruct

Geração de texto

Chamada 3.1

Sim

Padrão: ml.g5.48xlarge, ml.g6.48xlarge, ml.g6e.12xlarge, ml.p3.16xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • generate_best_price_performance(Gerado, balanceado): ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g6e.xlarge

  • generate_highest_throughput(Geração, produtividade otimizada), interact_highest_throughput (interação, taxa de transferência otimizada), (contexto máximo, taxa de transferência otimizada), max_context_highest_throughput (contexto máximo, latência otimizada), max_context_lowest_latency (modificação, taxa de transferência otimizada), modify_highest_throughput (modificação, latência otimizada), (resumo, taxa de transferência otimizada), modify_lowest_latency summarize_highest_throughput (resumo, latência otimizada): ml.p4d.24xlarge, ml.p5.48xlarge, summarize_lowest_latency ml.p5en.48xlarge

  • generate_lowest_cost(Gerado, custo otimizado): ml.g4dn.12xlarge, ml.g6.12xlarge, ml.g6e.xlarge

  • generate_lowest_latency(Gerado, latência otimizada): ml.g6e.24xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • interact_best_price_performance(Interact, Balanceado): ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g6e.2xlarge

  • interact_lowest_cost(Interact, custo otimizado): ml.g4dn.12xlarge, ml.g6.12xlarge, ml.g6e.2xlarge

  • interact_lowest_latency(Interact, latência otimizada): ml.g6e.24xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • max_context_lowest_cost(Contexto máximo, custo otimizado): ml.g5.48xlarge, ml.g6.48xlarge, ml.g6e.12xlarge

  • modify_best_price_performance(Modificar, balanceado): ml.g4dn.12xlarge, ml.g6.12xlarge, ml.p4d.24xlarge

  • modify_lowest_cost(Modificar, custo otimizado): ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g6.12xlarge

  • summarize_best_price_performance(Resumindo, balanceado): ml.g6.12xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

  • summarize_lowest_cost(Resumindo, custo otimizado): ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.12xlarge

Meta

Llama-3.2-1B

meta-textgeneration-llama-3-2-1b

Geração de texto

Chamada 3.2

Sim

Padrão: ml.g4dn.12xlarge, ml.g5.48xlarge, ml.g6.12xlarge, ml.g6e.2xlarge, ml.p3.16xlarge, ml.p4d.24xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • generate_best_price_performance(Gerado, balanceado): ml.g4dn.xlarge, ml.g6.2xlarge, ml.g6e.2xlarge

  • generate_highest_throughput(Geração, produtividade otimizada), interact_highest_throughput (Interação, taxa de transferência otimizada): ml.g6e.48xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • generate_lowest_cost(Gerado, custo otimizado): ml.g4dn.xlarge, ml.g6.2xlarge, ml.g6e.xlarge

  • generate_lowest_latency(Gerado, latência otimizada): ml.g6e.16xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • interact_best_price_performance(Interact, Balanced), interact_lowest_cost (Interact, Custo otimizado): ml.g4dn.xlarge, ml.g5.2xlarge, ml.g6.xlarge

  • interact_lowest_latency(Interact, latência otimizada): ml.g5.16xlarge, ml.g6e.48xlarge, ml.p5en.48xlarge

  • max_context_highest_throughput(Contexto máximo, taxa de transferência otimizada): ml.g6e.24xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • max_context_lowest_cost(Contexto máximo, custo otimizado): ml.g4dn.12xlarge, ml.g6.8xlarge, ml.g6e.2xlarge

  • max_context_lowest_latency(Contexto máximo, latência otimizada): ml.g6.12xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • modify_best_price_performance(Modificar, balancear), modify_lowest_cost (Modificar, custo otimizado): ml.g4dn.xlarge, ml.g5.xlarge, ml.g6.xlarge

  • modify_highest_throughput(Modificar, taxa de transferência otimizada): ml.g6e.48xlarge, ml.p3.16xlarge, ml.p5en.48xlarge

  • modify_lowest_latency(Modificar, latência otimizada): ml.g5.2xlarge, ml.g6e.8xlarge, ml.p5en.48xlarge

  • summarize_best_price_performance(Resumir, balanceado), summarize_lowest_cost (Resumir, custo otimizado): ml.g5.xlarge, ml.g6.24xlarge, ml.g6e.xlarge

  • summarize_highest_throughput(Resumindo, produtividade otimizada): ml.g6e.12xlarge, ml.p3.16xlarge, ml.p5en.48xlarge

  • summarize_lowest_latency(Resumindo, latência otimizada): ml.g6e.4xlarge, ml.p3.16xlarge, ml.p5en.48xlarge

Meta

Llama-3.2-1B-Instruct

meta-textgeneration-llama-3-2-1b-instruct

Geração de texto

Chamada 3.2

Sim

Padrão: ml.g4dn.12xlarge, ml.g5.24xlarge, ml.g6.48xlarge, ml.g6e.12xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • generate_best_price_performance(Gerado, balanceado): ml.g4dn.xlarge, ml.g5.xlarge, ml.g6e.xlarge

  • generate_highest_throughput(Geração, taxa de transferência otimizada), (contexto máximo, taxa de transferência otimizada), max_context_highest_throughput (contexto máximo, latência otimizada): max_context_lowest_latency ml.p4d.24xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • generate_lowest_cost(Gerar, custo otimizado), (Modificar, balancear), modify_best_price_performance (Modificar, modify_lowest_cost custo otimizado): ml.g4dn.xlarge, ml.g5.xlarge, ml.g6.2xlarge

  • generate_lowest_latency(Gerado, latência otimizada): ml.g6.12xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • interact_best_price_performance(Interact, Balanceado): ml.g4dn.xlarge, ml.g5.2xlarge, ml.g6e.2xlarge

  • interact_highest_throughput(Interact, taxa de transferência otimizada): ml.g5.48xlarge, ml.g6e.12xlarge, ml.p5en.48xlarge

  • interact_lowest_cost(Interact, custo otimizado): ml.g4dn.xlarge, ml.g5.xlarge, ml.g6.8xlarge

  • interact_lowest_latency(Interact, latência otimizada): ml.g6.8xlarge, ml.g6e.24xlarge, ml.p5en.48xlarge

  • max_context_lowest_cost(Contexto máximo, custo otimizado): ml.g4dn.12xlarge, ml.g5.24xlarge, ml.g6e.xlarge

  • modify_highest_throughput(Modificar, taxa de transferência otimizada): ml.g6e.12xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • modify_lowest_latency(Modificar, latência otimizada): ml.g6e.4xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • summarize_best_price_performance(Resumindo, balanceado): ml.g5.xlarge, ml.g6.xlarge, ml.g6e.8xlarge

  • summarize_highest_throughput(Resumindo, produtividade otimizada): ml.g6e.24xlarge, ml.p3.16xlarge, ml.p5en.48xlarge

  • summarize_lowest_cost(Resumindo, custo otimizado): ml.g4dn.12xlarge, ml.g5.xlarge, ml.g6.xlarge

  • summarize_lowest_latency(Resumindo, latência otimizada): ml.g6e.8xlarge, ml.p3.16xlarge, ml.p5en.48xlarge

Meta

Llama-3.2-3B

meta-textgeneration-llama-3-2-3b

Geração de texto

Chamada 3.2

Sim

Padrão: ml.g5.48xlarge, ml.g6.48xlarge, ml.g6e.24xlarge, ml.g6e.48xlarge, ml.p3.16xlarge, ml.p5en.48xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • generate_best_price_performance(Gerado, balanceado): ml.g4dn.xlarge, ml.g5.xlarge, ml.g6e.2xlarge

  • generate_highest_throughput(Gerado, taxa de transferência otimizada): ml.g6e.24xlarge, ml.p3.8xlarge, ml.p5en.48xlarge

  • generate_lowest_cost(Gerado, custo otimizado), interact_lowest_cost (Interação, custo otimizado): ml.g4dn.xlarge, ml.g5.xlarge, ml.g6.xlarge

  • generate_lowest_latency(Gerado, latência otimizada): ml.g5.8xlarge, ml.g6e.8xlarge, ml.p5en.48xlarge

  • interact_best_price_performance(Interact, Balanceado): ml.g4dn.xlarge, ml.g5.xlarge, ml.g6e.xlarge

  • interact_highest_throughput(Interact, taxa de transferência otimizada), summarize_lowest_latency (Resumir, latência otimizada): ml.p3.16xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • interact_lowest_latency(Interact, latência otimizada): ml.g6.12xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • max_context_highest_throughput(Contexto máximo, taxa de transferência otimizada): ml.g6.48xlarge, ml.g6e.48xlarge, ml.p5en.48xlarge

  • max_context_lowest_cost(Contexto máximo, custo otimizado): ml.g5.24xlarge, ml.g6.12xlarge, ml.g6e.24xlarge

  • max_context_lowest_latency(Contexto máximo, latência otimizada): ml.g5.24xlarge, ml.g6.24xlarge, ml.p5en.48xlarge

  • modify_best_price_performance(Modificar, balanceado): ml.g5.xlarge, ml.g6.4xlarge, ml.g6e.2xlarge

  • modify_highest_throughput(Modificar, taxa de transferência otimizada): ml.g6e.48xlarge, ml.p3.16xlarge, ml.p4d.24xlarge

  • modify_lowest_cost(Modificar, custo otimizado): ml.g5.xlarge, ml.g6.4xlarge, ml.g6e.xlarge

  • modify_lowest_latency(Modificar, latência otimizada): ml.g6e.8xlarge, ml.p3.16xlarge, ml.p4d.24xlarge

  • summarize_best_price_performance(Resumindo, balanceado): ml.g4dn.12xlarge, ml.g6.12xlarge, ml.p5.48xlarge

  • summarize_highest_throughput(Resumindo, produtividade otimizada): ml.g6e.24xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • summarize_lowest_cost(Resumindo, custo otimizado): ml.g4dn.12xlarge, ml.g5.24xlarge, ml.g6.12xlarge

Meta

Llama-3.2-3B-Instruct

meta-textgeneration-llama-3-2-3b-instruct

Geração de texto

Chamada 3.2

Sim

Padrão: ml.g5.24xlarge, ml.g6.24xlarge, ml.g6e.48xlarge, ml.p3.16xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • generate_best_price_performance(Gerar, balancear), interact_best_price_performance (interagir, balancear): ml.g4dn.xlarge, ml.g5.xlarge, ml.g6e.xlarge

  • generate_highest_throughput(Geração, produtividade otimizada), interact_highest_throughput (interação, taxa de transferência otimizada), (contexto máximo, taxa de transferência otimizada), max_context_highest_throughput (resumo, taxa de transferência otimizada), summarize_highest_throughput (resumo, latência otimizada): ml.p4d.24xlarge, summarize_lowest_latency ml.p5.48xlarge, ml.p5en.48xlarge

  • generate_lowest_cost(Gerado, custo otimizado), interact_lowest_cost (Interação, custo otimizado): ml.g4dn.xlarge, ml.g5.xlarge, ml.g6.xlarge

  • generate_lowest_latency(Gerado, latência otimizada): ml.g6e.4xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • interact_lowest_latency(Interact, latência otimizada): ml.g6e.12xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • max_context_lowest_cost(Contexto máximo, custo otimizado): ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.12xlarge

  • max_context_lowest_latency(Contexto máximo, latência otimizada): ml.g6e.24xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • modify_best_price_performance(Modificar, balanceado): ml.g5.xlarge, ml.g6.2xlarge, ml.g6e.xlarge

  • modify_highest_throughput(Modificar, taxa de transferência otimizada): ml.g6e.12xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • modify_lowest_cost(Modificar, custo otimizado): ml.g5.xlarge, ml.g6.xlarge, ml.g6e.xlarge

  • modify_lowest_latency(Modificar, latência otimizada): ml.g6e.8xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • summarize_best_price_performance(Resumindo, balanceado): ml.g6.12xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

  • summarize_lowest_cost(Resumindo, custo otimizado): ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g6.12xlarge

Meta

Llama-Guard-3-1B

meta-textgeneration-llama-guard-3-1b

Geração de texto

Chamada 3.2

Não

ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.48xlarge, ml.g5.8xlarge, ml.g5.xlarge, ml.g6.12xlarge, ml.g6.24xlarge, ml.g6.48xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.16xlarge e.24xlarge, ml.g6e.2xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.g6e.xlarge, ml.p4d.24xlarge

Meta

Llama-Guard-3-8B

meta-textgeneration-llama-guard-3-8b

Geração de texto

Chamada 3.1

Não

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.48xlarge, ml.g6,12xlarge, ml.g6.24xlarge, ml.g6.48xlarge, ml.g6e.12xlarge, ml.g6e.24xlarge, ml.p4d.24xlarge

Meta

Code Llama 13B da Meta

meta-textgeneration-llama-codellama-13b

Geração de texto

lhama2

Sim

ml.g5,12x grande, ml.g5,24x grande, ml.g5,48x grande, ml.g6,12x grande, ml.p4d.24x grande

Meta

Code Llama 13B Instruct da Meta

meta-textgeneration-llama-codellama-13b-instruct

Geração de texto

lhama2

Não

ml.g5,12x grande, ml.g5,24x grande, ml.g5,48x grande, ml.g6,12x grande, ml.p4d.24x grande

Meta

Code Llama 13B Python da Meta

meta-textgeneration-llama-codellama-13b-python

Geração de texto

lhama2

Sim

ml.g5,12x grande, ml.g5,24x grande, ml.g5,48x grande, ml.g6,12x grande, ml.p4d.24x grande

Meta

Code Llama 34B da Meta

meta-textgeneration-llama-codellama-34b

Geração de texto

lhama2

Sim

Padrão: ml.g5.48xlarge, ml.p4d.24xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • lmi(Contêiner de inferência de modelo grande), lmi-optimized (recipiente de inferência de modelo grande usando decodificação especulativa): ml.g5.48xlarge, ml.g6.48xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge

Meta

Code Llama 34B Instruct da Meta

meta-textgeneration-llama-codellama-34b-instruct

Geração de texto

lhama2

Não

Padrão: ml.g5.48xlarge, ml.p4d.24xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • lmi(Contêiner de inferência de modelo grande), lmi-optimized (recipiente de inferência de modelo grande usando decodificação especulativa): ml.g5.48xlarge, ml.g6.48xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge

Meta

Code Llama 34B Python da Meta

meta-textgeneration-llama-codellama-34b-python

Geração de texto

lhama2

Sim

Padrão: ml.g5.48xlarge, ml.p4d.24xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • lmi(Contêiner de inferência de modelo grande), lmi-optimized (recipiente de inferência de modelo grande usando decodificação especulativa): ml.g5.48xlarge, ml.g6.48xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge

Meta

Code Llama 70B da Meta

meta-textgeneration-llama-codellama-70b

Geração de texto

lhama2

Sim

Padrão: ml.g5.48xlarge, ml.p4d.24xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • lmi(Contêiner de inferência de modelo grande), lmi-optimized (recipiente de inferência de modelo grande usando decodificação especulativa): ml.g5.48xlarge, ml.g6.48xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge

Meta

Code Llama 70B Instruct da Meta

meta-textgeneration-llama-codellama-70b-instruct

Geração de texto

lhama2

Não

Padrão: ml.g5.48xlarge, ml.p4d.24xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • lmi(Contêiner de inferência de modelo grande), lmi-optimized (recipiente de inferência de modelo grande usando decodificação especulativa): ml.g5.48xlarge, ml.g6.48xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge

Meta

Code Llama 70B Neuron da Meta

meta-textgenerationneuron-llama-codellama-70b

Geração de texto

lhama2

Não

ml.inf 2,48 x grande

Meta

Code Llama 70B Python da Meta

meta-textgeneration-llama-codellama-70b-python

Geração de texto

lhama2

Sim

Padrão: ml.g5.48xlarge, ml.p4d.24xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • lmi(Contêiner de inferência de modelo grande), lmi-optimized (recipiente de inferência de modelo grande usando decodificação especulativa): ml.g5.48xlarge, ml.g6.48xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge

Meta

Code Llama 7B da Meta

meta-textgeneration-llama-codellama-7b

Geração de texto

lhama2

Sim

Padrão: ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g6.2xlarge, ml.p4d.24xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • lmi-optimized(Contêiner de inferência de modelo grande usando decodificação especulativa): ml.g5.12xlarge, ml.g5.2xlarge, ml.g6.12xlarge, ml.g6.2xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge

Meta

Code Llama 7B Instruct da Meta

meta-textgeneration-llama-codellama-7b-instruct

Geração de texto

lhama2

Não

Padrão: ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g6.12xlarge, ml.g6.2xlarge, ml.p4d.24xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • lmi-optimized(Contêiner de inferência de modelo grande usando decodificação especulativa): ml.g5.12xlarge, ml.g5.2xlarge, ml.g6.12xlarge, ml.g6.2xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge

Meta

Code Llama 7B Neuron da Meta

meta-textgenerationneuron-llama-codellama-7b

Geração de texto

lhama2

Não

ml.inf2.8xlarge, ml.inf2.xlarge

Meta

Code Llama 7B Python da Meta

meta-textgeneration-llama-codellama-7b-python

Geração de texto

lhama2

Sim

Padrão: ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g6.12xlarge, ml.p4d.24xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • lmi-optimized(Contêiner de inferência de modelo grande usando decodificação especulativa): ml.g5.12xlarge, ml.g5.2xlarge, ml.g6.12xlarge, ml.g6.2xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge

Meta

Code Llama 7B Python Neuron da Meta

meta-textgenerationneuron-llama-codellama-7b-python

Geração de texto

lhama2

Não

ml.inf2.8xlarge, ml.inf2.xlarge

Meta

Meta Llama 2 13B

meta-textgeneration-llama-2-13b

Geração de texto

lhama2

Sim

ml.g5,12x grande, ml.g5,24x grande, ml.g5,48x grande, ml.g6,12x grande, ml.p4d.24x grande, ml.p5,48x grande

Meta

Llama 2 13B Chat da Meta

meta-textgeneration-llama-2-13b-f

Geração de texto

lhama2

Sim

ml.g5,12x grande, ml.g5,24x grande, ml.g5,48x grande, ml.g6,12x grande, ml.p4d.24x grande, ml.p5,48x grande

Meta

Llama 2 13B Chat Neuron da Meta

meta-textgenerationneuron-llama-2-13b-f

Geração de texto

lhama2

Não

ml.inf2,24 x grande, ml.inf2,48 x grande, ml.inf2,8 x grande

Meta

Llama 2 13B Neuron da Meta

meta-textgenerationneuron-llama-2-13b

Geração de texto

lhama2

Sim

ml.inf2,24 x grande, ml.inf2,48 x grande, ml.inf2,8 x grande

Meta

Meta Llama 2 70B

meta-textgeneration-llama-2-70b

Geração de texto

lhama2

Sim

Padrão: ml.g5.48xlarge, ml.p4d.24xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • lmi(Contêiner de inferência de modelo grande), lmi-optimized (recipiente de inferência de modelo grande usando decodificação especulativa): ml.g5.48xlarge, ml.g6.48xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge

Meta

Llama 2 70B Chat da Meta

meta-textgeneration-llama-2-70b-f

Geração de texto

lhama2

Sim

Padrão: ml.g5.48xlarge, ml.p4d.24xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • lmi(Contêiner de inferência de modelo grande), lmi-optimized (recipiente de inferência de modelo grande usando decodificação especulativa): ml.g5.48xlarge, ml.g6.48xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge

Meta

Llama 2 70B Chat Neuron da Meta

meta-textgenerationneuron-llama-2-70b-f

Geração de texto

lhama2

Não

ml.inf 2,48 x grande

Meta

Llama 2 70B Neuron da Meta

meta-textgenerationneuron-llama-2-70b

Geração de texto

lhama2

Não

ml.inf 2,48 x grande

Meta

Llama 2 7B Chat da Meta

meta-textgeneration-llama-2-7b-f

Geração de texto

lhama2

Sim

Padrão: ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g6.12xlarge, ml.p4d.24xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • lmi-optimized(Contêiner de inferência de modelo grande usando decodificação especulativa): ml.g5.12xlarge, ml.g5.2xlarge, ml.g6.12xlarge, ml.g6.2xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge

  • neuron(Aceleradores AWS Inferentia e Trainium): ml.inf2.24xlarge, ml.inf2.48xlarge, ml.inf2.8xlarge, ml.inf2.xlarge

Meta

Llama 2 7B Chat Neuron da Meta

meta-textgenerationneuron-llama-2-7b-f

Geração de texto

lhama2

Não

ml.inf2.24xlarge, ml.inf2.48xlarge, ml.inf2.8xlarge, ml.inf2.xlarge

Meta

Llama 2 7B Neuron da Meta

meta-textgenerationneuron-llama-2-7b

Geração de texto

lhama2

Sim

ml.inf2.24xlarge, ml.inf2.48xlarge, ml.inf2.8xlarge, ml.inf2.xlarge

Meta

Llama 3 1 8B Neuron da Meta

meta-textgenerationneuron-llama-3-1-8b

Geração de texto

Chamada 3.1

Não

ml.inf2.24xlarge, ml.inf2.48xlarge, ml.inf2.8xlarge, ml.trn1.2xlarge, ml.trn1.32xlarge, ml.trn1n.32xlarge

Meta

Llama 3 70B da Meta

meta-textgeneration-llama-3-70b

Geração de texto

Chamada 3

Sim

ml.g5,48x grande, ml.g6,48x grande, ml.p4d.24x grande, ml.p5,48x grande

Meta

Llama 3 70B Instruct da Meta

meta-textgeneration-llama-3-70b-instruct

Geração de texto

Chamada 3

Sim

ml.g5,48x grande, ml.g6,48x grande, ml.p4d.24x grande, ml.p5,48x grande

Meta

Llama 3 70B Instruct Neuron da Meta

meta-textgenerationneuron-llama-3-70b-instruct

Geração de texto

Chamada 3

Não

ml.trn1.32xlarge

Meta

Llama 3 70B Neuron da Meta

meta-textgenerationneuron-llama-3-70b

Geração de texto

Lhama3

Não

ml.trn1.32xlarge

Meta

Llama 3 8B Instruct da Meta

meta-textgeneration-llama-3-8b-instruct

Geração de texto

Lhama3

Sim

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g6.12xlarge, ml.g6.2xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

Meta

Llama 3 8B Instruct Neuron da Meta

meta-textgenerationneuron-llama-3-8b-instruct

Geração de texto

Lhama3

Não

ml.inf2,24 x grande, ml.inf2,48 x grande, ml.inf2,8 x grande

Meta

Llama 3 8B Neuron da Meta

meta-textgenerationneuron-llama-3-8b

Geração de texto

Lhama3

Não

ml.inf2,24 x grande, ml.inf2,48 x grande, ml.inf2,8 x grande

Meta

Llama 3.1 405B FP8 da Meta

meta-textgeneration-llama-3-1-405b-fp8

Geração de texto

Chamada 3.1

Sim

ml.p4de.24x grande, ml.p5.48x grande

Meta

Llama 3.1 405B Instruct FP8 da Meta

meta-textgeneration-llama-3-1-405b-instruct-fp8

Geração de texto

Chamada 3.1

Sim

ml.p4de.24x grande, ml.p5.48x grande

Meta

Llama 3.1 70B da Meta

meta-textgeneration-llama-3-1-70b

Geração de texto

Chamada 3.1

Sim

ml.g5,48x grande, ml.g6,48x grande, ml.p4d.24x grande, ml.p5,48x grande

Meta

Llama 3.1 70B Instruct Neuron da Meta

meta-textgenerationneuron-llama-3-1-70b-instruct

Geração de texto

Chamada 3.1

Não

ml.inf2,48xlarge, ml.trn1,32xlarge, ml.trn1n.32xlarge

Meta

Llama 3.1 70B Neuron da Meta

meta-textgenerationneuron-llama-3-1-70b

Geração de texto

Chamada 3.1

Não

ml.inf2,48xlarge, ml.trn1,32xlarge, ml.trn1n.32xlarge

Meta

Llama 3.1 8B da Meta

meta-textgeneration-llama-3-1-8b

Geração de texto

Chamada 3.1

Sim

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g6.12xlarge, ml.g6.24xlarge, ml.g6.2xlarge, ml.g6.48xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.p4d. 24x grande, ml.p5,48 x grande

Meta

Llama 3.1 8B Instruct Neuron da Meta

meta-textgenerationneuron-llama-3-1-8b-instruct

Geração de texto

Chamada 3.1

Não

ml.inf2.24xlarge, ml.inf2.48xlarge, ml.inf2.8xlarge, ml.trn1.2xlarge, ml.trn1.32xlarge, ml.trn1n.32xlarge

Meta

Visão Meta Llama 3.2 11B

meta-vlm-llama-3-2-11b-vision

Image-Text-to-Text

Chamada 3.2

Sim

ml.g6,12 x grande, ml.g6,24 x grande, ml.g6,48 x grande, ml.p4d.24x grande, ml.p4de.24x grande, ml.p5,48 x grande

Meta

Meta Llama 3.2 11B Vision Instruct

meta-vlm-llama-3-2-11b-vision-instruct

Image-Text-to-Text

Chamada 3.2

Sim

ml.g6,12 x grande, ml.g6,24 x grande, ml.g6,48 x grande, ml.p4d.24x grande, ml.p4de.24x grande, ml.p5,48 x grande

Meta

Meta Llama 3.2 1B Instruct Neurônio

meta-textgenerationneuron-llama-3-2-1b-instruct

Geração de texto

Chamada 3.2

Não

ml.inf2.24xlarge, ml.inf2.48xlarge, ml.inf2.8xlarge, ml.inf2.xlarge, ml.trn1.2xlarge, ml.trn1.32xlarge, ml.trn1n.32xlarge

Meta

Neurônio Meta Llama 3.2 1B

meta-textgenerationneuron-llama-3-2-1b

Geração de texto

Chamada 3.2

Não

ml.inf2.24xlarge, ml.inf2.48xlarge, ml.inf2.8xlarge, ml.inf2.xlarge, ml.trn1.2xlarge, ml.trn1.32xlarge, ml.trn1n.32xlarge

Meta

Meta Llama 3.2 3B Instruct Neurônio

meta-textgenerationneuron-llama-3-2-3b-instruct

Geração de texto

Chamada 3.2

Não

ml.inf2.24xlarge, ml.inf2.48xlarge, ml.inf2.8xlarge, ml.inf2.xlarge, ml.trn1.2xlarge, ml.trn1.32xlarge, ml.trn1n.32xlarge

Meta

Neurônio Meta Llama 3.2 3B

meta-textgenerationneuron-llama-3-2-3b

Geração de texto

Chamada 3.2

Não

ml.inf2.24xlarge, ml.inf2.48xlarge, ml.inf2.8xlarge, ml.inf2.xlarge, ml.trn1.2xlarge, ml.trn1.32xlarge, ml.trn1n.32xlarge

Meta

Visão Meta Llama 3.2 90B

meta-vlm-llama-3-2-90b-vision

Image-Text-to-Text

Chamada 3.2

Sim

ml.p4d.24x grande, ml.p4de.24x grande, ml.p5,48x grande

Meta

Meta Llama 3.2 90B Vision Instruct

meta-vlm-llama-3-2-90b-vision-instruct

Image-Text-to-Text

Chamada 3.2

Sim

ml.p4d.24x grande, ml.p4de.24x grande, ml.p5,48x grande

Meta

Instrução do Meta Llama 3.3 70B

meta-textgeneration-llama-3-3-70b-instruct

Geração de texto

Chama3.3

Sim

Padrão: ml.g5.48xlarge, ml.g6.48xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • lmi-optimized(Recipiente de inferência de modelo grande usando decodificação especulativa): ml.g5.16xlarge, ml.g5.48xlarge, ml.g6.48xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

Meta

Meta Llama 4 Maverick 17B 128E FP8

meta-vlm-llama-4-maverick-17b-128e-instruct-fp8

Image-Text-to-Text

Chamada 4

Não

ml.p5e.48x grande, ml.p5en.48x grande

Meta

Instrução de Meta Llama 4 Maverick 17B 128E

meta-vlm-llama-4-maverick-17b-128e-instruct

Image-Text-to-Text

Chamada 4

Não

ml.p5e.48x grande, ml.p5en.48x grande

Meta

Instrução do Meta Llama 4 Scout 17B 16E

meta-vlm-llama-4-scout-17b-16e-instruct

Image-Text-to-Text

Chamada 4

Sim

ml.g6e.48x grande, ml.p5,48x grande, ml.p5en.48x grande

Meta

Visão Meta Llama Guard 3 11B

meta-vlm-llama-guard-3-11b-vision

Image-Text-to-Text

Chamada 3.2

Não

ml.g6,12 x grande, ml.g6,24 x grande, ml.g6,48 x grande, ml.p4d.24x grande, ml.p4de.24x grande, ml.p5,48 x grande

Meta

Neurônio Meta Llama Guard 3 1B

meta-textgenerationneuron-llama-guard-3-1b

Geração de texto

Chamada 3.2

Não

ml.inf2.24xlarge, ml.inf2.48xlarge, ml.inf2.8xlarge, ml.inf2.xlarge, ml.trn1.2xlarge, ml.trn1.32xlarge, ml.trn1n.32xlarge

Meta

Neurônio Meta Llama Guard 3 8B

meta-textgenerationneuron-llama-guard-3-8b

Geração de texto

Chamada 3.1

Não

ml.inf2.24xlarge, ml.inf2.48xlarge, ml.inf2.8xlarge, ml.trn1.2xlarge, ml.trn1.32xlarge, ml.trn1n.32xlarge

Meta

Meta Llama Guard 7B

meta-textgeneration-llama-guard-7b

Geração de texto

lhama2

Não

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p4d.24xlarge

Meta

Meta Llama Prompt Guard 86M

meta-tc-llama-prompt-guard-86m

Classificação de texto

Chamada 3.1

Não

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g5.xlarge, ml.g6.12xlarge, ml.g6.24xlarge, ml.g6.2xlarge, ml.g6.48xlarge, ml.g6.4xlarge, ml.g6,8xlarge, ml.g6.xlarge, ml.p4d.24xlarge

Meta

Meta SAM 2.1 Hiera Base Plus

meta-vs-sam-2-1-hiera-base-plus

Segmentação de imagem

apache-2.0

Não

ml.g5,24 x grande, ml.g5,48 x grande, ml.g6,24 x grande, ml.g6,48 x grande, ml.p4d.24 x grande, ml.p4de.24x grande

Meta

Meta SAM 2.1 Hiera Large

meta-vs-sam-2-1-hiera-large

Segmentação de imagem

apache-2.0

Não

ml.g5,24 x grande, ml.g5,48 x grande, ml.g6,24 x grande, ml.g6,48 x grande, ml.p4d.24 x grande, ml.p4de.24x grande

Meta

Meta SAM 2.1 Hiera Small

meta-vs-sam-2-1-hiera-small

Segmentação de imagem

apache-2.0

Não

ml.g5,24 x grande, ml.g5,48 x grande, ml.g6,24 x grande, ml.g6,48 x grande, ml.p4d.24 x grande, ml.p4de.24x grande

Meta

Meta SAM 2.1 Hiera Tiny

meta-vs-sam-2-1-hiera-tiny

Segmentação de imagem

apache-2.0

Não

ml.g5,24 x grande, ml.g5,48 x grande, ml.g6,24 x grande, ml.g6,48 x grande, ml.p4d.24 x grande, ml.p4de.24x grande

Meta

Meta-Llama-3-8B

meta-textgeneration-llama-3-8b

Geração de texto

Chamada 3

Sim

Padrão: ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.xlarge, ml.p3.8xlarge, ml.p4d.24xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • generate_best_price_performance(Gerar, balancear), generate_lowest_cost (Gerar, custo otimizado): ml.g5.2xlarge, ml.g6.2xlarge, ml.g6e.xlarge

  • generate_highest_throughput(Geração, produtividade otimizada), interact_highest_throughput (Interação, taxa de transferência otimizada): ml.g6e.48xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • generate_lowest_latency(Gerado, latência otimizada): ml.g6e.16xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • interact_best_price_performance(Interact, Balanced), interact_lowest_cost (Interact, Custo otimizado): ml.g5.xlarge, ml.g6.xlarge, ml.g6e.xlarge

  • interact_lowest_latency(Interact, latência otimizada): ml.g6e.12xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • max_context_highest_throughput(Contexto máximo, taxa de transferência otimizada): ml.p3.16xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • max_context_lowest_cost(Contexto máximo, custo otimizado): ml.g4dn.12xlarge, ml.g6.12xlarge, ml.g6e.xlarge

  • max_context_lowest_latency(Contexto máximo, latência otimizada): ml.g4dn.12xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

Microsoft

Phi-2

huggingface-llm-phi-2

Geração de texto

mit

Não

ml.g5.12xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g5.xlarge, ml.p4de.24xlarge, ml.p5.48xlarge

Microsoft

Phi-3-Mini-128K-Instruct

huggingface-llm-phi-3-mini-128k-instruct

Geração de texto

mit

Não

ml.g5.12xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge

Microsoft

Phi-3-mini-4k-instruct

huggingface-llm-phi-3-mini-4k-instruct

Geração de texto

mit

Não

Padrão: ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • generate_best_price_performance(Gerar, balancear), interact_best_price_performance (interagir, balancear): ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.xlarge

  • generate_highest_throughput(Gerado, taxa de transferência otimizada): ml.g6e.12xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • generate_lowest_cost(Geração, custo otimizado), interact_lowest_cost (Interação, custo otimizado), (contexto máximo, custo otimizado): ml.g4dn.12xlarge, ml.g6.12xlarge, ml.g6e.xlarge max_context_lowest_cost

  • generate_lowest_latency(Gerado, latência otimizada): ml.g6e.8xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • interact_highest_throughput(Interact, taxa de transferência otimizada): ml.g6e.48xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • interact_lowest_latency(Interact, latência otimizada): ml.g6.48xlarge, ml.g6e.24xlarge, ml.p4d.24xlarge

  • max_context_highest_throughput(Contexto máximo, taxa de transferência otimizada): ml.g6e.24xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • max_context_lowest_latency(Contexto máximo, latência otimizada): ml.g6e.16xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

Microsoft

Phi-3.5-mini-instruct

huggingface-llm-phi-3-5-mini-instruct

Geração de texto

mit

Não

ml.g5,48x grande, ml.p4d.24x grande

Microsoft

Phi-4-mini-instruct

huggingface-llm-phi-4-mini-instruct

Geração de texto

Apache-2.0

Não

Padrão: ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.12xlarge, ml.p4d.24xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • generate_best_price_performance(Gerar, balancear), generate_lowest_cost (gerar, otimizar o custo), (interagir, balancear), interact_best_price_performance (interagir, otimizar o custo), interact_lowest_cost modify_lowest_cost (modificar, otimizar o custo): ml.g5.xlarge, ml.g6.xlarge, ml.g6e.xlarge

  • generate_highest_throughput(Geração, produtividade otimizada), interact_highest_throughput (interação, taxa de transferência otimizada), (modificação, taxa de transferência otimizada), modify_highest_throughput (modificação, latência otimizada), modify_lowest_latency (resumo, taxa de transferência otimizada), summarize_highest_throughput (resumo, latência otimizada): ml.p4d.24xlarge, ml.p5.48xlarge, summarize_lowest_latency ml.p5en.48xlarge

  • generate_lowest_latency(Gerado, latência otimizada): ml.g6e.8xlarge, ml.g7e.8xlarge, ml.p5en.48xlarge

  • interact_lowest_latency(Interact, latência otimizada): ml.g6.12xlarge, ml.g6e.12xlarge

  • max_context_highest_throughput(Contexto máximo, taxa de transferência otimizada): ml.p5.48xlarge, ml.p5en.48xlarge

  • max_context_lowest_cost(Contexto máximo, custo otimizado), summarize_lowest_cost (Resumir, custo otimizado): ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.12xlarge

  • max_context_lowest_latency(Contexto máximo, latência otimizada): ml.g6e.24xlarge, ml.p4d.24xlarge

  • modify_best_price_performance(Modificar, balanceado): ml.g5.2xlarge, ml.g6.xlarge, ml.g6e.xlarge

  • summarize_best_price_performance(Resumindo, balanceado): ml.g6.12xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

Microsoft

Detecção de transformadores de mesa

huggingface-od-microsoft-table-transformer-detection

Detecção de objetos

mit

Não

ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.xlarge, ml.g6.2xlarge, ml.g6.4xlarge, ml.g6.xlarge, ml.g6e.2xlarge, ml.g6e.4xlarge, ml.g6e.xlarge

Minimaxai

MiniMax-M2

huggingface-llm-minimax-m2

Geração de texto

outro

Não

ml.p4de.24xlarge

Minimaxai

MiniMax-M2.1

huggingface-llm-minimax-m2-1

Geração de texto

outro

Não

ml.p4de.24x grande, ml.p5.48x grande

Minimaxai

MiniMax-M2.5

huggingface-llm-minimax-m2-5

Geração de texto

outro

Não

ml.p5.48xlarge

Minimaxai

MiniMax-M2.7

huggingface-llm-minimax-m2-7

Geração de texto

outro

Não

Padrão: ml.p5en.48xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • generate_best_price_performance(Gerar, balancear), generate_highest_throughput (gerar, otimizar a produtividade), generate_lowest_cost (gerar, otimizar o custo), generate_lowest_latency (gerar, otimizar a latência), (interagir, balancear), interact_best_price_performance (interagir, otimizar a produtividade), interact_highest_throughput (interagir, otimizar o custo), interact_lowest_cost (interagir, otimizar a latência), interact_lowest_latency (resumir, balancear), summarize_best_price_performance (resumir, otimizar a taxa de transferência), summarize_highest_throughput (resumir, otimizar a latência): ml.g7e. 48x grande, ml.p5 summarize_lowest_latency en.48x grande summarize_lowest_cost

  • modify_best_price_performance(Modificar, balancear), modify_highest_throughput (Modificar, produtividade otimizada), (Modificar, custo otimizado), modify_lowest_cost (Modificar, latência otimizada): modify_lowest_latency ml.g7e.48xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

Mistralai

Ministral-3-14B-Instruct-2512

huggingface-llm-ministral-3-14b-instruct-2512

Geração de texto

Apache-2.0

Não

Padrão: ml.p5.48xlarge, ml.p5en.48xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • generate_best_price_performance(Gerar, Balancear), generate_lowest_cost (Gerar, Custo otimizado), (Interagir, Balancear), interact_best_price_performance (Interagir, Custo otimizado): ml.g5.12xlarge, ml.g6e.48xlarge, ml.p5.4xlarge interact_lowest_cost

  • generate_highest_throughput(Geração, produtividade otimizada), (Geração, latência otimizada), generate_lowest_latency interact_highest_throughput (interação, taxa de transferência otimizada): ml.g6e.48xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • interact_lowest_latency(Interact, latência otimizada): ml.g5.12xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • modify_best_price_performance(Modificar, balancear), modify_highest_throughput (Modificar, produtividade otimizada), (Modificar, custo otimizado), modify_lowest_cost (Modificar, latência otimizada): modify_lowest_latency ml.p5.48xlarge, ml.p5.4xlarge, ml.p5en.48xlarge

Mistralai

Mistral 7B Instruct Neuron

huggingface-llmneuron-mistral-7b-instruct

Geração de texto

apache-2.0

Não

ml.inf2.8xlarge, ml.inf2.xlarge

Mistralai

Mistral 7B Neuron

huggingface-llmneuron-mistral-7b

Geração de texto

apache-2.0

Não

ml.inf2.8xlarge, ml.inf2.xlarge

Mistralai

Mistral Nemo Base 2407

huggingface-llm-mistral-nemo-base-2407

Geração de texto

apache-2.0

Não

ml.g5,12x grande, ml.g5,24x grande, ml.g5,48x grande, ml.g6,12x grande, ml.g6,24x grande, ml.g6,48x grande, ml.p4d.24x grande

Mistralai

Mistral Nemo Instruct 2407

huggingface-llm-mistral-nemo-instruct-2407

Geração de texto

apache-2.0

Não

ml.g5,12x grande, ml.g5,24x grande, ml.g5,48x grande, ml.g6,12x grande, ml.g6,24x grande, ml.g6,48x grande, ml.p4d.24x grande

Mistralai

Mistral Pixtral-12B-2409

huggingface-vlm-mistral-pixtral-12b-2409

Image-Text-to-Text

apache-2.0

Não

ml.g6,12 x grande, ml.g6,24 x grande, ml.g6,48 x grande, ml.p4d.24x grande, ml.p4de.24x grande, ml.p5,48 x grande

Mistralai

Mistral-7B-Instruct-v0.2

huggingface-llm-mistral-7b-instruct

Geração de texto

apache-2.0

Não

Padrão: ml.g5.12xlarge, ml.g6.24xlarge, ml.g6e.2xlarge, ml.p3.16xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • generate_best_price_performance(Gerar, Balancear), generate_lowest_cost (Gerar, Custo otimizado), (Interagir, Balancear), interact_best_price_performance (Interagir, Custo otimizado): ml.g5.4xlarge, ml.g6.xlarge, ml.g6e.xlarge interact_lowest_cost

  • generate_highest_throughput(Gerado, taxa de transferência otimizada): ml.g6e.48xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • generate_lowest_latency(Gerado, latência otimizada): ml.g6e.12xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • interact_highest_throughput(Interact, taxa de transferência otimizada): ml.g6e.48xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • interact_lowest_latency(Interact, latência otimizada): ml.g6.48xlarge, ml.g6e.48xlarge, ml.p5en.48xlarge

  • max_context_highest_throughput(Contexto máximo, taxa de transferência otimizada), (contexto máximo, latência otimizada), max_context_lowest_latency (resumo, taxa de transferência otimizada), summarize_highest_throughput (resumo, latência otimizada): ml.p4d.24xlarge, summarize_lowest_latency ml.p5.48xlarge, ml.p5en.48xlarge

  • max_context_lowest_cost(Contexto máximo, custo otimizado), (Modificar, balancear), modify_best_price_performance (Modificar, custo otimizado): ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g6e.xlarge modify_lowest_cost

  • modify_highest_throughput(Modificar, taxa de transferência otimizada): ml.g6e.12xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • modify_lowest_latency(Modificar, latência otimizada): ml.g6e.8xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • summarize_best_price_performance(Resumindo, balanceado): ml.g6.12xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

  • summarize_lowest_cost(Resumindo, custo otimizado): ml.g5.24xlarge, ml.g6.12xlarge, ml.p4d.24xlarge

Mistralai

Mistral-7B-Instruct-v0.3

huggingface-llm-mistral-7b-instruct-v3

Geração de texto

apache-2.0

Não

Padrão: ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.2xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • generate_best_price_performance(Gerado, balanceado): ml.g5.4xlarge, ml.g6.xlarge, ml.g6e.2xlarge

  • generate_highest_throughput(Gerado, taxa de transferência otimizada): ml.g6e.48xlarge, ml.p3.16xlarge, ml.p5.48xlarge

  • generate_lowest_cost(Gerar, custo otimizado), (Interagir, balancear), interact_best_price_performance (Interagir, custo otimizado): ml.g5.4xlarge, ml.g6.xlarge, ml.g6e.xlarge interact_lowest_cost

  • generate_lowest_latency(Gerado, latência otimizada): ml.g6e.2xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

  • interact_highest_throughput(Interact, taxa de transferência otimizada): ml.g6e.48xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • interact_lowest_latency(Interact, latência otimizada): ml.g6.48xlarge, ml.g6e.24xlarge, ml.p4d.24xlarge

  • max_context_highest_throughput(Contexto máximo, taxa de transferência otimizada), max_context_lowest_latency (contexto máximo, latência otimizada), (modificação, taxa de transferência otimizada), modify_highest_throughput (modificação, latência otimizada), (resumo, taxa de transferência otimizada), modify_lowest_latency summarize_highest_throughput (resumo, latência otimizada): ml.p4d.24xlarge, ml.p5.48xlarge, summarize_lowest_latency ml.p5en.48xlarge

  • max_context_lowest_cost(Contexto máximo, custo otimizado), modify_lowest_cost (Modificar, custo otimizado): ml.g4dn.12xlarge, ml.g6.12xlarge, ml.g6e.xlarge

  • modify_best_price_performance(Modificar, balanceado): ml.g6.12xlarge, ml.g6e.xlarge, ml.p4d.24xlarge

  • summarize_best_price_performance(Resumindo, balanceado): ml.g6.12xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

  • summarize_lowest_cost(Resumindo, custo otimizado): ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.12xlarge

Mistralai

Mistral-7B-Instruct-v0.3

huggingface-llm-mistral-7b-v3

Geração de texto

apache-2.0

Não

Padrão: ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.2xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • generate_best_price_performance(Gerado, balanceado): ml.g5.xlarge, ml.g6.2xlarge, ml.g6e.2xlarge

  • generate_highest_throughput(Gerado, taxa de transferência otimizada): ml.p3.16xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • generate_lowest_cost(Gerar, custo otimizado), (Interagir, balancear), interact_best_price_performance (Interagir, custo otimizado): ml.g5.xlarge, ml.g6.xlarge, ml.g6e.xlarge interact_lowest_cost

  • generate_lowest_latency(Geração, latência otimizada), (Resumir, produtividade otimizada), summarize_highest_throughput (Resumir, latência otimizada): ml.g6e.24xlarge, summarize_lowest_latency ml.p4d.24xlarge, ml.p5en.48xlarge

  • interact_highest_throughput(Interact, taxa de transferência otimizada), max_context_highest_throughput (contexto máximo, taxa de transferência otimizada), (contexto máximo, latência otimizada), max_context_lowest_latency (modificação, taxa de transferência otimizada), modify_highest_throughput (modificação, latência otimizada): ml.p4d.24xlarge, modify_lowest_latency ml.p5.48xlarge, ml.p5en.48xlarge

  • interact_lowest_latency(Interact, latência otimizada): ml.g6e.8xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • max_context_lowest_cost(Contexto máximo, custo otimizado), modify_lowest_cost (Modificar, custo otimizado): ml.g4dn.12xlarge, ml.g6.12xlarge, ml.g6e.xlarge

  • modify_best_price_performance(Modificar, balanceado): ml.g6.12xlarge, ml.g6e.xlarge, ml.p4d.24xlarge

  • summarize_best_price_performance(Resumindo, balanceado): ml.g6.12xlarge, ml.g6e.12xlarge, ml.p4d.24xlarge

  • summarize_lowest_cost(Resumindo, custo otimizado): ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.12xlarge

Mistralai

Mistral-7B-v0.1

huggingface-llm-mistral-7b

Geração de texto

apache-2.0

Sim

Padrão: ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.12xlarge, ml.p3.16xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • generate_best_price_performance(Gerar, balancear), generate_lowest_cost (Gerar, custo otimizado), (Interação, custo otimizado), interact_lowest_cost (contexto máximo, custo otimizado): ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g6.12xlarge max_context_lowest_cost

  • generate_highest_throughput(Gerado, taxa de transferência otimizada): ml.g6e.48xlarge, ml.p3.16xlarge, ml.p5en.48xlarge

  • generate_lowest_latency(Gerado, latência otimizada): ml.g6.12xlarge, ml.g6e.24xlarge, ml.p5en.48xlarge

  • interact_best_price_performance(Interact, Balanceado), modify_lowest_cost (Modificar, Custo otimizado): ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.12xlarge

  • interact_highest_throughput(Interact, taxa de transferência otimizada): ml.g5.48xlarge, ml.g6e.48xlarge, ml.p3.16xlarge

  • interact_lowest_latency(Interact, latência otimizada): ml.g6.48xlarge, ml.g6e.24xlarge, ml.p5en.48xlarge

  • max_context_highest_throughput(Contexto máximo, taxa de transferência otimizada), (contexto máximo, latência otimizada), max_context_lowest_latency (Modificar, taxa de transferência otimizada), modify_highest_throughput (Modificar, latência otimizada): ml.p4d.24xlarge, modify_lowest_latency ml.p5.48xlarge, ml.p5en.48xlarge

  • modify_best_price_performance(Modificar, balanceado): ml.g5.12xlarge, ml.g6.12xlarge, ml.p5.48xlarge

  • summarize_best_price_performance(Resumir, balanceado), (Resumir, produtividade otimizada), summarize_highest_throughput (Resumir, otimizar custos), summarize_lowest_cost (Resumir, otimizar latência): ml.g6e.24xlarge, summarize_lowest_latency ml.p5.48xlarge, ml.p5en.48xlarge

Mistralai

Mistral-Small-24B-Instruct-2501

huggingface-llm-mistral-small-24B-Instruct-2501

Geração de texto

apache-2.0

Não

Padrão: ml.g5.48xlarge, ml.g6.48xlarge, ml.g6e.12xlarge, ml.g6e.24xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • generate_best_price_performance(Gerar, Balancear), interact_best_price_performance (Interagir, Balancear): ml.g5.48xlarge, ml.g6e.12xlarge, ml.p4d.24xlarge

  • generate_highest_throughput(Geração, produtividade otimizada), (interação, taxa de transferência otimizada), interact_highest_throughput (interação, latência otimizada), interact_lowest_latency (contexto máximo, taxa de transferência otimizada), max_context_highest_throughput modify_highest_throughput (modificação, taxa de transferência otimizada): ml.g6e.48xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • generate_lowest_cost(Geração, custo otimizado), interact_lowest_cost (interação, custo otimizado), (contexto máximo, custo otimizado), max_context_lowest_cost modify_lowest_cost (modificação, custo otimizado): ml.g5.48xlarge, ml.g6.48xlarge, ml.g6e.12xlarge

  • generate_lowest_latency(Gerar, latência otimizada), modify_lowest_latency (Modificar, latência otimizada): ml.g6e.24xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • max_context_lowest_latency(Contexto máximo, latência otimizada): ml.g6.48xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • modify_best_price_performance(Modificar, balanceado): ml.g6.48xlarge, ml.g6e.12xlarge, ml.p4d.24xlarge

  • summarize_best_price_performance(Resumir, balanceado), (Resumir, produtividade otimizada), summarize_highest_throughput (Resumir, otimizar custos), summarize_lowest_cost (Resumir, otimizar latência): ml.g6e.12xlarge, summarize_lowest_latency ml.p4d.24xlarge, ml.p5en.48xlarge

Mistralai

Mistral-Small-3.1-24B-Base-2503

huggingface-vlm-mistral-small-3-1-24b-base-2503

Image-Text-to-Text

apache-2.0

Não

ml.g6,12x grande, ml.g6,16x grande, ml.g6,24x grande, ml.g6,48x grande, ml.g6e.12x grande

Mistralai

Mistral-Small-3.2-24B-Instruct-2506

huggingface-vlm-mistral-small-3-2-24b-instruct-2506

Image-Text-to-Text

apache-2.0

Não

ml.g6,12x grande, ml.g6,16x grande, ml.g6,24x grande, ml.g6,48x grande, ml.g6e.12x grande

Mistralai

Mixtral 8x7B

huggingface-llm-mixtral-8x7b

Geração de texto

apache-2.0

Sim

ml.g5,48x grande, ml.g6,48x grande, ml.p4d.24x grande, ml.p5,48x grande

Mistralai

Mixtral-8x22B V1

huggingface-llm-mixtral-8x22B

Geração de texto

apache-2.0

Não

ml.p4d.24x grande, ml.p4de.24x grande

Mistralai

Mixtral-8x22B-Instruct-v0.1

huggingface-llm-mistralai-mixtral-8x22B-instruct-v0-1

Geração de texto

apache-2.0

Não

Padrão: ml.p4de.24xlarge, ml.p5.48xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • tgi(Contêiner de inferência de geração de texto): ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge

Mistralai

Mixtral-8x7B-Instruct-v0.1

huggingface-llm-mixtral-8x7b-instruct

Geração de texto

apache-2.0

Sim

Padrão: ml.g5.48xlarge, ml.g6.48xlarge, ml.g6e.12xlarge, ml.p4d.24xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • generate_best_price_performance(Gerar, Balancear), interact_best_price_performance (Interagir, Balancear): ml.g5.48xlarge, ml.g6e.12xlarge, ml.p4d.24xlarge

  • generate_highest_throughput(Geração, produtividade otimizada), (Interação, taxa de transferência otimizada), interact_highest_throughput modify_highest_throughput (Modificar, taxa de transferência otimizada): ml.g6e.48xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • generate_lowest_cost(Geração, custo otimizado), interact_lowest_cost (interação, custo otimizado), (contexto máximo, custo otimizado), max_context_lowest_cost modify_lowest_cost (modificação, custo otimizado): ml.g5.48xlarge, ml.g6.48xlarge, ml.g6e.12xlarge

  • generate_lowest_latency(Gerado, latência otimizada): ml.g6.48xlarge, ml.g6e.48xlarge, ml.p5en.48xlarge

  • interact_lowest_latency(Interact, latência otimizada), modify_lowest_latency (Modificar, latência otimizada): ml.g6e.12xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • max_context_highest_throughput(Contexto máximo, taxa de transferência otimizada), (contexto máximo, latência otimizada), max_context_lowest_latency (resumo, taxa de transferência otimizada), summarize_highest_throughput (resumo, latência otimizada): ml.p4d.24xlarge, summarize_lowest_latency ml.p5.48xlarge, ml.p5en.48xlarge

  • modify_best_price_performance(Modificar, balanceado): ml.g6.48xlarge, ml.g6e.12xlarge, ml.p4d.24xlarge

  • summarize_best_price_performance(Resumir, balanceado), summarize_lowest_cost (Resumir, custo otimizado): ml.g6e.12xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

Mistralai

Voxtral-Mini-4B-Realtime-2602

huggingface-asr-voxtral-mini-4b-realtime-2602

Geração de texto

Apache-2.0

Não

ml.g6.12xlarge, ml.g6,16xlarge, ml.g6.24xlarge, ml.g6.2xlarge, ml.g6.48xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.g6.xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.ge.24xlarge, ml.g6.6xlarge 2xlarge, ml.g6e.48xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.g6e.xlarge, ml.g7e.2xlarge, ml.g7e.4xlarge

Moonshotai

Kimi-K2.5

huggingface-llm-kimi-k2-5

Geração de texto

outro

Não

ml.p5en.48xlarge

Moritzlaurer

MoritzLaurer MDeBERTa V3 Base Xnli Multilíngue Nli 2mil7

huggingface-zstc-moritzlaurer-mdeberta3base-xnli-mling-nli-2m7

Zero-Shot Classificação

mit

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mosaico ml

MPT 7B BF16

huggingface-textgeneration1-mpt-7b-bf16

Geração de texto

Apache-2.0

Não

ml.g5,16 x grande, ml.g5,2 x grande, ml.g5,4 x grande, ml.g5,8 x grande

Mosaico ml

MPT 7B Instruct BF16

huggingface-textgeneration1-mpt-7b-instruct-bf16

Geração de texto

CC-BY-SA-3.0

Não

ml.g5,16 x grande, ml.g5,2 x grande, ml.g5,4 x grande, ml.g5,8 x grande

Mrm8488

Bert Small2bert

huggingface-summarization-bert-small2bert-cnn-dailymail-summ

Resumo de texto

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

Incorporação de texto financeiro

mxnet-tcembedding-robertafin-base-uncased

Incorporação de texto

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

RoBERTa-SEC-Large

mxnet-tcembedding-robertafin-large-uncased

Incorporação de texto

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

RoBERTa-SEC-WIKI-Base

mxnet-tcembedding-robertafin-base-wiki-uncased

Incorporação de texto

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

RoBERTa-SEC-WIKI-Large

mxnet-tcembedding-robertafin-large-wiki-uncased

Incorporação de texto

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Naclbit

Difusão estável Naclbit Trinart V2

huggingface-txt2img-naclbit-trinart-stable-diffusion-v2

Text-to-Image

creativml-openrail-m

Não

ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Narsil

Narsil Deberta Large Manli Zero Cls

huggingface-zstc-narsil-deberta-large-mnli-zero-cls

Zero-Shot Classificação

mit

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Nexaia

Nexa AI Octopus-v2

huggingface-llm-nexaaidev-octopus-v2

Geração de texto

cc-by-nc-4.0

Não

ml.g5,16 x grande, ml.g5,2 x grande, ml.g5,4 x grande, ml.g5,8 x grande

Fluxo do nexo

Fluxo do nexo Starling-LM-7B-beta

huggingface-llm-nexusflow-starling-lm-7b-beta

Geração de texto

apache-2.0

Não

ml.g5,16 x grande, ml.g5,2 x grande, ml.g5,4 x grande, ml.g5,8 x grande

Nossa pesquisa

Hermes 2 8B Pro-Llama-3

huggingface-llm-nousresearch-hermes-2-pro-llama-3-8B

Geração de texto

Lhama3

Não

ml.g5.12xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge

Nossa pesquisa

Nous Hermes 2 SOLAR 10.7B

huggingface-llm-nousresearch-nous-hermes-2-solar-10-7b

Geração de texto

apache-2.0

Não

ml.g 5,12 x grande, ml.g 5,24 x grande, ml.g 5,48 x grande

Nova

Nova 2.0 Lite

nova-textgeneration-lite-v2

Geração de texto

AWS Termos de serviço

Sim

Não aplicável

Nova

Nova 2.0 Micro

nova-textgeneration-micro-v2

Geração de texto

Não aplicável

Sim

Não aplicável

Nova

Nova Lite

nova-textgeneration-lite

Geração de texto

AWS Termos de serviço

Sim

Não aplicável

Nova

Nova Micro

nova-textgeneration-micro

Geração de texto

AWS Termos de serviço

Sim

Não aplicável

Nova

Nova Pro

nova-textgeneration-pro

Geração de texto

AWS Termos de serviço

Sim

Não aplicável

Nvidia

Nvidia 8B Llama3-ChatQA-1.5

huggingface-llm-nvidia-llama3-chatqa-1-5-8B

Geração de texto

Lhama3

Não

ml.g5.12xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge

Nvidia

Nvidia Nemotron 3 Ultra

huggingface-reasoning-nvidia-nemotron-3-ultra-550b-a55b-nvfp4

Reasoning

Apache-2.0

Não

Padrão: ml.g7e.48xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • modify_best_price_performance(Modificar, balancear), modify_highest_throughput (Modificar, produtividade otimizada), (Modificar, custo otimizado), modify_lowest_cost (Modificar, latência otimizada): ml.g7e.48xlarge, ml.p5.48xlarge modify_lowest_latency

  • summarize_best_price_performance(Resumir, balanceado), summarize_highest_throughput (Resumir, produtividade otimizada), (Resumir, otimizar custos), summarize_lowest_cost (Resumir, latência otimizada): ml.g7e.48xlarge, summarize_lowest_latency ml.p5en.48xlarge

Nvidia

Nvidia Nemotron 3 Nano Omni

huggingface-vlm-nvidia-nemotron3-nano-omni-30ba3b-reasoning-fp8

Image-Text-to-Text

outro

Não

Padrão: ml.g6.12xlarge, ml.g6.24xlarge, ml.g6e.12xlarge, ml.g6e.24xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • generate_best_price_performance(Gerar, Balancear), generate_lowest_cost (Gerar, Custo otimizado), interact_lowest_cost (Interagir, Custo otimizado), (Modificar, Balancear), modify_best_price_performance (Modificar, modify_lowest_cost Custo otimizado): ml.g6.12xlarge, ml.g6e.xlarge

  • generate_highest_throughput(Gerado, taxa de transferência otimizada): ml.g6.48xlarge, ml.g6e.12xlarge, ml.g6e.24xlarge

  • generate_lowest_latency(Gerado, latência otimizada), interact_lowest_latency (Interação, latência otimizada): ml.g6.12xlarge, ml.g6e.16xlarge, ml.g6e.8xlarge

  • interact_best_price_performance(Interact, Balanceado): ml.g6.12xlarge, ml.g6e.4xlarge, ml.g6e.xlarge

  • interact_highest_throughput(Interact, taxa de transferência otimizada): ml.g6.12xlarge, ml.g6e.12xlarge, ml.g6e.48xlarge

  • max_context_highest_throughput(Contexto máximo, taxa de transferência otimizada), modify_highest_throughput (Modificar, taxa de transferência otimizada), summarize_highest_throughput (resumo, taxa de transferência otimizada): ml.g6.12xlarge, ml.g6e.12xlarge, ml.g6e.24xlarge

  • max_context_lowest_cost(Contexto máximo, custo otimizado), (Resumir, balancear), summarize_best_price_performance (Resumir, custo otimizado): summarize_lowest_cost ml.g6.12xlarge, ml.g6.24xlarge, ml.g6e.12xlarge

  • max_context_lowest_latency(Contexto máximo, latência otimizada): ml.g6.24xlarge, ml.g6e.12xlarge, ml.g6e.24xlarge

  • modify_lowest_latency(Modificar, latência otimizada): ml.g6.12xlarge, ml.g6e.16xlarge, ml.g6e.4xlarge

  • summarize_lowest_latency(Resumindo, latência otimizada): ml.g6.24xlarge, ml.g6e.24xlarge, ml.g6e.48xlarge

Nvidia

NVIDIA-Nemotron-3-Nano-30B-A3B-BF16

huggingface-reasoning-nvidia-nemotron-3-nano-30b-a3b-bf16

Reasoning

outro

Sim

Padrão: ml.g6e.24xlarge, ml.g7e.12xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • generate_best_price_performance(Gerado, balanceado), generate_highest_throughput (Geração, produtividade otimizada), (Geração, custo otimizado), generate_lowest_cost (Geração, latência otimizada): generate_lowest_latency ml.g6.24xlarge, ml.g6e.24xlarge, ml.g7e.12xlarge

  • interact_best_price_performance(Interact, Balanced), interact_highest_throughput (Interact, Throughput otimizado), (Interact, Custo otimizado), interact_lowest_cost (Interact, latência otimizada): interact_lowest_latency ml.g6.12xlarge, ml.g6e.24xlarge, ml.g7e.4xlarge

  • modify_best_price_performance(Modificar, balancear), modify_lowest_cost (Modificar, custo otimizado): ml.g6.24xlarge, ml.g6.48xlarge, ml.g7e.24xlarge

  • modify_highest_throughput(Modificar, taxa de transferência otimizada): ml.g6.48xlarge, ml.g7e.12xlarge, ml.g7e.24xlarge

  • modify_lowest_latency(Modificar, latência otimizada): ml.g6.12xlarge, ml.g6.24xlarge, ml.g7e.4xlarge

  • summarize_best_price_performance(Resumir, balanceado), (Resumir, produtividade otimizada), summarize_highest_throughput (Resumir, custo otimizado): summarize_lowest_cost ml.g6e.12xlarge, ml.g7e.24xlarge, ml.g7e.48xlarge

  • summarize_lowest_latency(Resumindo, latência otimizada): ml.g6e.12xlarge, ml.g7e.12xlarge, ml.g7e.24xlarge

Nvidia

NVIDIA-Nemotron-3-Super-120B-A12B-BF16

huggingface-llm-nvidia-nemotron-3-super-120b-a12b-bf16

Geração de texto

Apache-2.0

Sim

Padrão: ml.p5en.48xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • generate_best_price_performance(Gerar, balancear), generate_lowest_cost (Gerar, custo otimizado): ml.g6e.48xlarge, ml.g7e.48xlarge, ml.p5.48xlarge

  • generate_highest_throughput(Gerar, Rendimento otimizado), modify_highest_throughput (Modificar, Rendimento otimizado): ml.g7e.48xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • generate_lowest_latency(Gerado, latência otimizada): ml.g6e.48xlarge, ml.g7e.24xlarge, ml.p5en.48xlarge

  • interact_best_price_performance(Interact, Balanced), interact_highest_throughput (Interact, Throughput otimizado), (Interact, Custo otimizado), interact_lowest_cost (Interact, latência otimizada): interact_lowest_latency ml.g6e.48xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • modify_best_price_performance(Modificar, balancear), modify_lowest_cost (Modificar, custo otimizado): ml.g6e.48xlarge, ml.g7e.24xlarge, ml.p5.48xlarge

  • modify_lowest_latency(Modificar, latência otimizada): ml.g7e.24xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • summarize_best_price_performance(Resumir, balanceado), (Resumir, produtividade otimizada), summarize_highest_throughput (Resumir, otimizar custos), summarize_lowest_cost (Resumir, otimizar latência): ml.g7e.24xlarge, summarize_lowest_latency ml.g7e.48xlarge, ml.p5.48xlarge

Nvidia

NVIDIA-Nemotron-3-Super-120B-A12B-FP8

huggingface-reasoning-nvidia-nemotron-3-super-120b-a12b-fp8

Reasoning

outro

Não

Padrão: ml.g7e.24xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • generate_best_price_performance(Gerar, balancear), generate_highest_throughput (Gerar, otimizar a produtividade), (Gerar, otimizar o custo), generate_lowest_cost (Gerar, otimizar a latência): generate_lowest_latency ml.g6e.48xlarge, ml.g7e.24xlarge, ml.g7e.48xlarge

  • interact_best_price_performance(Interação, balanceado), interact_highest_throughput (Interação, produtividade otimizada), interact_lowest_cost (interação, custo otimizado), (interação, latência otimizada), interact_lowest_latency (resumo, balanceado), summarize_best_price_performance (resumo, produtividade otimizada), summarize_highest_throughput (resumo, custo otimizado), summarize_lowest_cost (resumo, latência otimizada): ml.g7e.24xlarge, summarize_lowest_latency ml.g7e.48xlarge

Nvidia

NVIDIA-Nemotron-Nano-12B-v2

huggingface-reasoning-nvidia-nemotron-nano-12b-v2

Reasoning

Apache-2.0

Não

Padrão: ml.g6e.48xlarge, ml.g7e.12xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • generate_best_price_performance(Gerar, balancear), generate_lowest_cost (Gerar, custo otimizado): ml.g6.12xlarge, ml.g6e.xlarge, ml.g7e.2xlarge

  • generate_highest_throughput(Gerado, taxa de transferência otimizada): ml.g6.48xlarge, ml.g6e.48xlarge, ml.g7e.12xlarge

  • generate_lowest_latency(Gerado, latência otimizada): ml.g6.24xlarge, ml.g6e.2xlarge, ml.g7e.2xlarge

  • modify_best_price_performance(Modificar, balancear), modify_lowest_cost (Modificar, custo otimizado): ml.g6.12xlarge, ml.g6e.12xlarge, ml.g7e.2xlarge

  • modify_highest_throughput(Modificar, taxa de transferência otimizada), summarize_best_price_performance (Resumir, balancear), (Resumir, taxa de transferência otimizada), summarize_highest_throughput (Resumir, otimizar custo), summarize_lowest_cost (Resumir, latência otimizada): ml.g6.48xlarge, summarize_lowest_latency ml.g6e.12xlarge, ml.g7e.12xlarge

  • modify_lowest_latency(Modificar, latência otimizada): ml.g6.24xlarge, ml.g6e.24xlarge, ml.g7e.12xlarge

Openai

gpt-oss-120b

openai-reasoning-gpt-oss-120b

Reasoning

apache-2.0

Sim

Padrão: ml.g6e.48xlarge, ml.g7e.2xlarge, ml.p5.48xlarge, ml.p5e.48xlarge, ml.p5en.48xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • lmi(Contêiner de inferência de modelo grande): ml.g6e.48xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge, ml.p5e.48xlarge, ml.p5en.48xlarge

Openai

gpt-oss-20b

openai-reasoning-gpt-oss-20b

Reasoning

apache-2.0

Sim

ml.g5.12xlarge, ml.g5.24xlarge, ml.g6.12xlarge, ml.g6.24xlarge, ml.g7e.2xlarge, ml.p5.48xlarge, ml.p5e.48xlarge, ml.p5en.48xlarge

Openai

filtro de privacidade

openai-tokenclassification-privacy-filter

Classificação de tokens

Apache-2.0

Não

ml.m5.2xlarge, ml.m5.4xlarge, ml.m5.xlarge

Openai

Base do Whisper

huggingface-asr-whisper-base

Reconhecimento automático de fala

apache-2.0

Não

ml.g4dn.2xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Openai

Whisper Large

huggingface-asr-whisper-large

Reconhecimento automático de fala

apache-2.0

Não

ml.g4dn.2xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Openai

Whisper Large Versão 2

huggingface-asr-whisper-large-v2

Reconhecimento automático de fala

apache-2.0

Não

ml.g4dn.2xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Openai

Whisper Large V3

huggingface-asr-whisper-large-v3

Reconhecimento automático de fala

apache-2.0

Não

ml.g4dn.2xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Openai

Whisper Large V3 Turbo

huggingface-asr-whisper-large-v3-turbo

Reconhecimento automático de fala

mit

Não

ml.g4dn.2xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Openai

Whisper Medium

huggingface-asr-whisper-medium

Reconhecimento automático de fala

apache-2.0

Não

ml.g4dn.2xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Openai

Whisper Small

huggingface-asr-whisper-small

Reconhecimento automático de fala

apache-2.0

Não

ml.g4dn.2xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Openai

Whisper Tiny

huggingface-asr-whisper-tiny

Reconhecimento automático de fala

apache-2.0

Não

ml.g4dn.2xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Openai-Community

GPT 2

huggingface-textgeneration-gpt2

Geração de texto

mit

Não

ml.g5,16 x grande, ml.g5,2 x grande, ml.g5,4 x grande, ml.g5,8 x grande

Openai-Community

GPT-2 XL

huggingface-textgeneration1-gpt-2-xl

Geração de texto

mit

Sim

ml.g5,16 x grande, ml.g5,2 x grande, ml.g5,4 x grande, ml.g5,8 x grande

Openai-Community

Detector OpenAI RobertA Base

huggingface-eqa-roberta-base-openai-detector

Perguntas e respostas

mit

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Openai-Community

Detector OpenAI RobertA Base

huggingface-spc-roberta-base-openai-detector

Fill-Mask

mit

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Openai-Community

Detector OpenAI RobertA Base

huggingface-tc-roberta-base-openai-detector

Classificação de texto

mit

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Openai-Community

Detector grande de OpenAI RobertA

huggingface-spc-roberta-large-openai-detector

Fill-Mask

mit

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Openai-Community

Detector grande de OpenAI RobertA

huggingface-tc-roberta-large-openai-detector

Classificação de texto

mit

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Openlm-Research

Open Llama 7B V2

huggingface-llm-openlm-research-open-llama-7b-v2

Geração de texto

apache-2.0

Não

ml.g 5,12 x grande, ml.g 5,24 x grande, ml.g 5,2 x grande, ml.g 5,48 x grande

Philschmid

Bart Large CNN samsum

huggingface-summarization-bart-large-cnn-samsum

Resumo de texto

mit

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Philschmid

Flan-T5 Modelo básico Fine-tuned no conjunto de dados Samsum

huggingface-text2text-flan-t5-base-samsum

Geração de texto Text2Text

apache-2.0

Não

ml.g5,16 x grande, ml.g5,2 x grande, ml.g5,4 x grande, ml.g5,8 x grande

Pytorch

Alexa TM 20B

pytorch-textgeneration1-alexa20b

Geração de texto

licença de software da amazon

Não

ml.g4dn.12xlarge, ml.g5,16xlarge, ml.p3,16xlarge, ml.p3.8xlarge

Qwen

Pré-visualização do QVQ 72B

huggingface-vlm-qvq-72b-preview

Image-Text-to-Text

outro

Não

ml.g5,48x grande, ml.g6,48x grande, ml.p4d.24x grande

Qwen

Qwen2 0,5B

huggingface-llm-qwen2-0-5b

Geração de texto

apache-2.0

Não

ml.g5,12 x grande, ml.g5,16 x grande, ml.g5,24 x grande, ml.g5,2 x grande, ml.g5,48 x grande, ml.g5,4 x grande, ml.g5,8 x grande, ml.p4d.24x grande

Qwen

Instrução Qwen2 0.5B

huggingface-llm-qwen2-0-5b-instruct

Geração de texto

apache-2.0

Não

ml.g5,12 x grande, ml.g5,16 x grande, ml.g5,24 x grande, ml.g5,2 x grande, ml.g5,48 x grande, ml.g5,4 x grande, ml.g5,8 x grande, ml.p4d.24x grande

Qwen

Qwen2-1.5B

huggingface-llm-qwen2-1-5b

Geração de texto

apache-2.0

Não

Padrão: ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.2xlarge, ml.g6e.4xlarge, ml.g6e.xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • generate_best_price_performance(Gerado, balanceado): ml.g4dn.xlarge, ml.g5.xlarge, ml.g6e.xlarge

  • generate_highest_throughput(Gerado, taxa de transferência otimizada): ml.g5.24xlarge, ml.g6.24xlarge, ml.g6e.24xlarge

  • generate_lowest_cost(Gerar, otimizar o custo), interact_best_price_performance (interagir, balancear), (interagir, otimizar o custo), interact_lowest_cost modify_lowest_cost (modificar, otimizar o custo): ml.g4dn.xlarge, ml.g5.xlarge, ml.g6.xlarge

  • generate_lowest_latency(Gerado, latência otimizada): ml.g5.4xlarge, ml.g6.4xlarge, ml.g6e.2xlarge

  • interact_highest_throughput(Interact, taxa de transferência otimizada): ml.g5.12xlarge, ml.g6.24xlarge, ml.g6e.12xlarge

  • interact_lowest_latency(Interact, latência otimizada): ml.g5.24xlarge, ml.g6.24xlarge, ml.g6e.2xlarge

  • max_context_highest_throughput(Contexto máximo, taxa de transferência otimizada): ml.g5.24xlarge, ml.g6.12xlarge, ml.g6e.24xlarge

  • max_context_lowest_cost(Contexto máximo, custo otimizado): ml.g4dn.12xlarge, ml.g6.12xlarge, ml.g6e.xlarge

  • max_context_lowest_latency(Contexto máximo, latência otimizada): ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g6.24xlarge

  • modify_best_price_performance(Modificar, balanceado): ml.g4dn.xlarge, ml.g5.2xlarge, ml.g6e.xlarge

  • modify_highest_throughput(Modificar, taxa de transferência otimizada): ml.g5.12xlarge, ml.g6.24xlarge, ml.g6e.24xlarge

  • modify_lowest_latency(Modificar, latência otimizada): ml.g5.4xlarge, ml.g6.12xlarge, ml.g6e.4xlarge

  • summarize_best_price_performance(Resumindo, balanceado): ml.g5.xlarge, ml.g6.2xlarge, ml.g6e.2xlarge

  • summarize_highest_throughput(Resumindo, produtividade otimizada): ml.g5.16xlarge, ml.g6.24xlarge, ml.g6e.2xlarge

  • summarize_lowest_cost(Resumindo, custo otimizado): ml.g5.xlarge, ml.g6.xlarge, ml.g6e.xlarge

  • summarize_lowest_latency(Resumindo, latência otimizada): ml.g5.4xlarge, ml.g6.24xlarge, ml.g6e.8xlarge

Qwen

Qwen2-1.5B-Instruct

huggingface-llm-qwen2-1-5b-instruct

Geração de texto

apache-2.0

Não

Padrão: ml.g4dn.xlarge, ml.g5.2xlarge, ml.g5.xlarge, ml.g6.2xlarge, ml.g6e.xlarge, ml.p3.2xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • generate_best_price_performance(Gerar, Balancear), interact_best_price_performance (Interagir, Balancear), modify_best_price_performance (Modificar, Balancear): ml.g4dn.xlarge, ml.g5.xlarge, ml.g6e.xlarge

  • generate_highest_throughput(Gerado, taxa de transferência otimizada): ml.g5.12xlarge, ml.g6.24xlarge, ml.g6e.24xlarge

  • generate_lowest_cost(Geração, custo otimizado), interact_lowest_cost (interação, custo otimizado), (contexto máximo, custo otimizado), max_context_lowest_cost modify_lowest_cost (modificação, custo otimizado): ml.g4dn.xlarge, ml.g5.xlarge, ml.g6.xlarge

  • generate_lowest_latency(Gerado, latência otimizada): ml.g5.8xlarge, ml.g6.24xlarge, ml.g6e.24xlarge

  • interact_highest_throughput(Interact, taxa de transferência otimizada): ml.g5.24xlarge, ml.g6.12xlarge, ml.g6e.12xlarge

  • interact_lowest_latency(Interact, latência otimizada): ml.g4dn.8xlarge, ml.g6.12xlarge, ml.g6e.4xlarge

  • max_context_highest_throughput(Contexto máximo, taxa de transferência otimizada): ml.g5.24xlarge, ml.g6.24xlarge, ml.g6e.12xlarge

  • max_context_lowest_latency(Contexto máximo, latência otimizada): ml.g4dn.12xlarge, ml.g6.12xlarge, ml.g6e.4xlarge

  • modify_highest_throughput(Modificar, taxa de transferência otimizada): ml.g5.24xlarge, ml.g6.24xlarge, ml.g6e.24xlarge

  • modify_lowest_latency(Modificar, latência otimizada): ml.g5.2xlarge, ml.g6.12xlarge, ml.g6e.2xlarge

  • summarize_best_price_performance(Resumir, balanceado), summarize_lowest_cost (Resumir, custo otimizado): ml.g5.xlarge, ml.g6.xlarge, ml.g6e.xlarge

  • summarize_highest_throughput(Resumindo, produtividade otimizada): ml.g5.4xlarge, ml.g6.12xlarge, ml.g6e.24xlarge

  • summarize_lowest_latency(Resumindo, latência otimizada): ml.g5.8xlarge, ml.g6.8xlarge, ml.g6e.16xlarge

Qwen

Qwen2-7B

huggingface-llm-qwen2-7b

Geração de texto

apache-2.0

Não

ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g5.24xlarge, ml.g6.12xlarge, ml.g6.24xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.g6e.2xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.g6e.xlarge

Qwen

Qwen2-7B-Instruct

huggingface-llm-qwen2-7b-instruct

Geração de texto

apache-2.0

Não

ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g5.24xlarge, ml.g6.12xlarge, ml.g6.24xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge

Qwen

Qwen2-VL-7B-Instruct

huggingface-vlm-qwen2-vl-7b-instruct

Geração de texto

apache-2.0

Não

Padrão: ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.12xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.g6e.xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • generate_best_price_performance(Gerado, balanceado): ml.g5.xlarge, ml.g6.2xlarge, ml.g6e.xlarge

  • generate_highest_throughput(Gerado, taxa de transferência otimizada): ml.g5.24xlarge, ml.g6.12xlarge, ml.g6e.24xlarge

  • generate_lowest_cost(Gerado, custo otimizado), interact_lowest_cost (Interação, custo otimizado): ml.g5.xlarge, ml.g6.xlarge, ml.g6e.xlarge

  • generate_lowest_latency(Gerado, latência otimizada): ml.g5.8xlarge, ml.g6.12xlarge, ml.g6e.8xlarge

  • interact_best_price_performance(Interact, Balanceado): ml.g5.2xlarge, ml.g6.xlarge, ml.g6e.xlarge

  • interact_highest_throughput(Interact, Rendimento otimizado), modify_highest_throughput (Modificar, Rendimento otimizado): ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.24xlarge

  • interact_lowest_latency(Interact, latência otimizada): ml.g5.12xlarge, ml.g6.24xlarge, ml.g6e.4xlarge

  • max_context_highest_throughput(Contexto máximo, taxa de transferência otimizada): ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.12xlarge

  • max_context_lowest_cost(Contexto máximo, custo otimizado): ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.xlarge

  • max_context_lowest_latency(Contexto máximo, latência otimizada): ml.g5.24xlarge, ml.g6.24xlarge, ml.g6e.xlarge

  • modify_best_price_performance(Modificar, balancear), modify_lowest_cost (Modificar, custo otimizado): ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.2xlarge

  • modify_lowest_latency(Modificar, latência otimizada): ml.g5.12xlarge, ml.g6.24xlarge, ml.g6e.16xlarge

  • summarize_best_price_performance(Resumir, balanceado), summarize_highest_throughput (Resumir, produtividade otimizada), (Resumir, custo otimizado), summarize_lowest_cost (Resumir, latência otimizada): summarize_lowest_latency ml.g6e.12xlarge

Qwen

Qwen2.5 14B Instrução

huggingface-llm-qwen2-5-14b-instruct

Geração de texto

apache-2.0

Sim

ml.g5,24x grande, ml.g5,48x grande, ml.g6,24x grande, ml.g6,48x grande, ml.p4d.24x grande

Qwen

Qwen2.5 32B Instrut

huggingface-llm-qwen2-5-32b-instruct

Geração de texto

apache-2.0

Sim

ml.g5,48x grande, ml.g6,48x grande, ml.p4d.24x grande

Qwen

Qwen2.5 Codificador 32B Instruct

huggingface-llm-qwen2-5-coder-32b-instruct

Geração de texto

apache-2.0

Não

ml.g5,24x grande, ml.g5,48x grande, ml.g6,24x grande, ml.g6,48x grande, ml.p4d.24x grande

Qwen

Qwen2.5 Codificador 7B Instruct

huggingface-llm-qwen2-5-coder-7b-instruct

Geração de texto

apache-2.0

Não

ml.g5.16xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g6.16xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.p4d.24xlarge

Qwen

Qwen2.5-72B-Instruct

huggingface-llm-qwen2-5-72b-instruct

Geração de texto

outro

Sim

Padrão: ml.g6e.48xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • generate_best_price_performance(Gerado, balanceado): ml.g5.48xlarge, ml.g6e.12xlarge, ml.p4d.24xlarge

  • generate_lowest_cost(Gerado, custo otimizado), interact_lowest_cost (Interação, custo otimizado): ml.g5.48xlarge, ml.g6.48xlarge, ml.g6e.12xlarge

  • generate_lowest_latency(Gerado, latência otimizada): ml.g6e.12xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • interact_best_price_performance(Interact, Balanceado): ml.g6.48xlarge, ml.g6e.12xlarge, ml.p4d.24xlarge

  • summarize_best_price_performance(Resumir, balanceado), summarize_highest_throughput (Resumir, produtividade otimizada), (Resumir, otimizar custos), summarize_lowest_cost (Resumir, otimizar latência): summarize_lowest_latency ml.p5en.48xlarge

Qwen

Qwen2.5-7B-Instruct

huggingface-llm-qwen2-5-7b-instruct

Geração de texto

apache-2.0

Sim

Padrão: ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.2xlarge, ml.g6e.4xlarge, ml.g6e.xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • generate_best_price_performance(Gerado, balanceado): ml.g5.xlarge, ml.g6.2xlarge, ml.g6e.xlarge

  • generate_highest_throughput(Geração, produtividade otimizada), interact_lowest_latency (interação, latência otimizada), summarize_lowest_latency (resumo, latência otimizada): ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.24xlarge

  • generate_lowest_cost(Gerar, custo otimizado), (Interagir, balancear), interact_best_price_performance (Interagir, custo otimizado): ml.g5.xlarge, ml.g6.xlarge, ml.g6e.xlarge interact_lowest_cost

  • generate_lowest_latency(Gerado, latência otimizada): ml.g4dn.12xlarge, ml.g6.12xlarge, ml.g6e.16xlarge

  • interact_highest_throughput(Interact, Rendimento otimizado), summarize_highest_throughput (Resumir, Rendimento otimizado): ml.g5.12xlarge, ml.g6.24xlarge, ml.g6e.24xlarge

  • max_context_highest_throughput(Contexto máximo, taxa de transferência otimizada): ml.g5.12xlarge, ml.g6.24xlarge, ml.g6e.12xlarge

  • max_context_lowest_cost(Contexto máximo, custo otimizado), (Modificar, balancear), modify_best_price_performance (Modificar, custo otimizado): ml.g4dn.12xlarge, ml.g6.12xlarge, ml.g6e.xlarge modify_lowest_cost

  • max_context_lowest_latency(Contexto máximo, latência otimizada): ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g6.12xlarge

  • modify_highest_throughput(Modificar, taxa de transferência otimizada): ml.g5.24xlarge, ml.g6.12xlarge, ml.g6e.24xlarge

  • modify_lowest_latency(Modificar, latência otimizada): ml.g4dn.12xlarge, ml.g6.24xlarge, ml.g6e.2xlarge

  • summarize_best_price_performance(Resumir, balanceado), summarize_lowest_cost (Resumir, custo otimizado): ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.12xlarge

Qwen

Qwen 3 14B

huggingface-reasoning-qwen3-14b

Reasoning

apache-2.0

Sim

ml.g5,12x grande, ml.g5,24x grande, ml.g5,48x grande, ml.g6,12x grande, ml.g6,24x grande, ml.g6,48x grande, ml.p4d.24x grande

Qwen

Qwen3-0.6B

huggingface-reasoning-qwen3-06b

Reasoning

apache-2.0

Sim

Padrão: ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.2xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • generate_best_price_performance(Gerar, balancear), generate_lowest_cost (gerar, otimizar o custo), (interagir, balancear), interact_best_price_performance (interagir, otimizar o custo), interact_lowest_cost modify_lowest_cost (modificar, otimizar o custo): ml.g4dn.xlarge, ml.g5.xlarge, ml.g6.xlarge

  • generate_highest_throughput(Geração, produtividade otimizada), (Interação, taxa de transferência otimizada), interact_highest_throughput modify_highest_throughput (Modificar, taxa de transferência otimizada): ml.g6e.24xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • generate_lowest_latency(Gerado, latência otimizada): ml.g5.8xlarge, ml.g6.12xlarge, ml.p5en.48xlarge

  • interact_lowest_latency(Interact, latência otimizada): ml.g4dn.16xlarge, ml.g6e.48xlarge, ml.p5en.48xlarge

  • max_context_highest_throughput(Contexto máximo, taxa de transferência otimizada): ml.g6e.48xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • max_context_lowest_cost(Contexto máximo, custo otimizado), summarize_lowest_cost (Resumir, custo otimizado): ml.g4dn.12xlarge, ml.g6.12xlarge, ml.g6e.xlarge

  • max_context_lowest_latency(Contexto máximo, latência otimizada): ml.g4dn.12xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • modify_best_price_performance(Modificar, balanceado): ml.g5.xlarge, ml.g6.xlarge, ml.g6e.xlarge

  • modify_lowest_latency(Modificar, latência otimizada): ml.g6e.2xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • summarize_best_price_performance(Resumindo, balanceado): ml.g6.12xlarge, ml.g6e.xlarge, ml.p4d.24xlarge

  • summarize_highest_throughput(Resumindo, produtividade otimizada): ml.g6e.12xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • summarize_lowest_latency(Resumindo, latência otimizada): ml.g6e.8xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

Qwen

Qwen3-1.7B

huggingface-reasoning-qwen3-1-7b

Reasoning

apache-2.0

Sim

ml.g4dn.12xlarge, ml.g4dn.16xlarge, ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g6.12xlarge, ml.g6.24xlarge xlarge, ml.g6.48xlarge, ml.g6.8xlarge, ml.g6.xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.g6e.2xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.g6e.xlarge, ml.p3.2xlarge, ml.p4d.24xlarge

Qwen

Qwen3-30B-A3B

huggingface-reasoning-qwen3-30b-a3b

Reasoning

apache-2.0

Não

ml.g5.24xlarge

Qwen

Qwen3-30B-A3B-Instruct-2507

huggingface-reasoning-qwen3-30b-a3b-instruct-2507

Geração de texto

apache-2.0

Não

ml.g5,48x grande, ml.g6,48x grande, ml.g6e.12x grande, ml.p4de.24x grande

Qwen

Qwen3-30B-A3B-Thinking-2507

huggingface-reasoning-qwen3-30b-a3b-thinking-2507

Reasoning

apache-2.0

Não

ml.g6e.12xlarge

Qwen

Qwen3-32B

huggingface-reasoning-qwen3-32b

Reasoning

apache-2.0

Sim

Padrão: ml.g5.48xlarge, ml.g6.48xlarge, ml.g6e.12xlarge, ml.p4d.24xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • generate_best_price_performance(Gerar, balancear), interact_best_price_performance (interagir, balancear), (resumir, balancear), summarize_best_price_performance (resumir, otimizar o custo): summarize_lowest_cost ml.g6e.12xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

  • generate_highest_throughput(Geração, produtividade otimizada), (geração, latência otimizada), generate_lowest_latency (interação, taxa de transferência otimizada), interact_highest_throughput (contexto máximo, taxa de transferência otimizada), max_context_highest_throughput (contexto máximo, latência otimizada), (resumo, taxa de transferência otimizada), max_context_lowest_latency summarize_highest_throughput (resumo, latência otimizada): ml.p4d.24xlarge, ml.p5.48xlarge, summarize_lowest_latency ml.p5en.48xlarge

  • generate_lowest_cost(Gerado, custo otimizado), max_context_lowest_cost (contexto máximo, custo otimizado): ml.g5.48xlarge, ml.g6.48xlarge, ml.g6e.12xlarge

  • interact_lowest_cost(Interact, custo otimizado): ml.g5.48xlarge, ml.g6.24xlarge, ml.g6e.12xlarge

  • interact_lowest_latency(Interact, latência otimizada): ml.g6e.24xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • modify_best_price_performance(Modificar, balancear), modify_lowest_cost (Modificar, custo otimizado): ml.g6.48xlarge, ml.g6e.12xlarge, ml.p4d.24xlarge

  • modify_highest_throughput(Modificar, taxa de transferência otimizada): ml.g6e.48xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • modify_lowest_latency(Modificar, latência otimizada): ml.g6e.12xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

Qwen

Qwen3-4B

huggingface-reasoning-qwen3-4b

Reasoning

apache-2.0

Sim

ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g5.xlarge, ml.g6.12xlarge, ml.g6.16xlarge, ml.g6.24xlarge grande, ml.g6.2xlarge, ml.g6.48xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.g6.xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.g6e.2xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.g6e.xlarge, ml.p4d.24xlarge

Qwen

Qwen3-4B-Instruct-2507

huggingface-reasoning-qwen3-4b-instruct-2507

Reasoning

apache-2.0

Não

ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.48xlarge, ml.g6.12xlarge, ml.g6.24xlarge, ml.g6.48xlarge, ml.g6e.12xlarge, ml.g6e.24xlarge, ml.p4d.24xlarge

Qwen

Qwen3-8B

huggingface-reasoning-qwen3-8b

Reasoning

apache-2.0

Sim

Padrão: ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.12xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • generate_best_price_performance(Gerar, Balancear), generate_lowest_cost (Gerar, Custo otimizado), (Interagir, Balancear), interact_best_price_performance (Interagir, Custo otimizado): ml.g5.2xlarge, ml.g6.xlarge, ml.g6e.xlarge interact_lowest_cost

  • generate_highest_throughput(Gerado, taxa de transferência otimizada): ml.g6e.48xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • generate_lowest_latency(Gerar, latência otimizada), (Modificar, taxa de transferência otimizada), modify_highest_throughput (Modificar, latência otimizada), modify_lowest_latency (Resumir, taxa de transferência otimizada), summarize_highest_throughput (Resumir, latência otimizada): ml.g6e.24xlarge, summarize_lowest_latency ml.p5.48xlarge, ml.p5en.48xlarge

  • interact_highest_throughput(Interact, taxa de transferência otimizada), (contexto máximo, taxa de transferência otimizada), max_context_highest_throughput (contexto máximo, latência otimizada): max_context_lowest_latency ml.p4d.24xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • interact_lowest_latency(Interact, latência otimizada): ml.g6.48xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • max_context_lowest_cost(Contexto máximo, custo otimizado): ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g6.12xlarge

  • modify_best_price_performance(Modificar, balanceado): ml.g5.12xlarge, ml.g6e.xlarge, ml.p5.48xlarge

  • modify_lowest_cost(Modificar, custo otimizado): ml.g5.12xlarge, ml.g6.24xlarge, ml.g6e.xlarge

  • summarize_best_price_performance(Resumir, balanceado), summarize_lowest_cost (Resumir, custo otimizado): ml.g5.24xlarge, ml.g6e.12xlarge, ml.p5.48xlarge

Qwen

Qwen3-ASR-1.7B

huggingface-asr-qwen3-asr-1-7b

Reconhecimento automático de fala

Apache-2.0

Não

ml.g6.2xlarge, ml.g6.xlarge

Qwen

Qwen3-Coder-30B-A3B-Instruct

huggingface-reasoning-qwen3-coder-30b-a3b-instruct

Reasoning

apache-2.0

Não

ml.g6e.24xlarge, ml.g7e.2xlarge

Qwen

Qwen3-Coder-Next

huggingface-reasoning-qwen3-coder-next

Reasoning

apache-2.0

Não

ml.g7e.24xlarge, ml.g7e.48xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

Qwen

Qwen3-Embedding-0.6B

huggingface-textembedding-qwen3-embedding-0-6b

Incorporação de texto

Apache-2.0

Não

ml.g6.12xlarge, ml.g6.16xlarge, ml.g6.24xlarge, ml.g6.2xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.g6.xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.g6e.2xlarge, ml.g6e.2xlarge e.4xlarge, ml.g6e.8xlarge, ml.g6e.xlarge, ml.g7e.24xlarge, ml.g7e.2xlarge, ml.g7e.48xlarge, ml.g7e.4xlarge, ml.g7e.8xlarge

Qwen

Qwen3-Next-80B-A3B-Instruct

huggingface-reasoning-qwen3-next-80b-a3b-instruct

Geração de texto

apache-2.0

Não

ml.g6e.48x grande, ml.p4de.24x grande

Qwen

Qwen3-Reranker-4B

huggingface-textembedding-qwen3-reranker-4b

Incorporação de texto

Apache-2.0

Não

ml.g6.12xlarge, ml.g6,16xlarge, ml.g6.24xlarge, ml.g6.2xlarge, ml.g6.48xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.g6.xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.ge.24xlarge, ml.g6.6xlarge 2xlarge, ml.g6e.48xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.g6e.xlarge, ml.g7e.24xlarge, ml.g7e.2xlarge, ml.g7e.48xlarge, ml.g7e.4xlarge, ml.g7e.8xlarge

Qwen

Qwen3-TTS-12Hz-1.7B-Base

huggingface-ttsvoiceclone-qwen3-tts-12hz-1-7b-base

Text-to-Speech

Apache-2.0

Não

ml.g6.16xlarge, ml.g6.2xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.g6.xlarge, ml.g6e.16xlarge, ml.g6e.2xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.g6e.xlarge, ml.g7e.2xlarge, ml.g7e.2xlarge, ml.g6e.xlarge 7e.4x grande, ml.g7e.8x grande

Qwen

Qwen3-TTS-12Hz-1.7B-CustomVoice

huggingface-tts-qwen3-tts-customvoice

Text-to-Speech

Apache-2.0

Não

ml.g6.16xlarge, ml.g6.2xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.g6.xlarge, ml.g6e.16xlarge, ml.g6e.2xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.g6e.xlarge, ml.g7e.2xlarge, ml.g7e.2xlarge, ml.g6e.xlarge 7e.4x grande, ml.g7e.8x grande

Qwen

Qwen3-VL-8B-Instruct

huggingface-vlm-qwen3-vl-8b-instruct

Geração de texto

apache-2.0

Não

ml.g6e.24xlarge, ml.g6e.48xlarge, ml.p4d.24xlarge

Qwen

Qwen3-VL-Embedding-2B

huggingface-textembedding-qwen3-vl-embedding-2b

Incorporação de texto

Apache-2.0

Não

ml.g6.12xlarge, ml.g6,16xlarge, ml.g6.24xlarge, ml.g6.2xlarge, ml.g6.48xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.g6.xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.ge.24xlarge, ml.g6.6xlarge 2xlarge, ml.g6e.48xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.g6e.xlarge, ml.g7e.24xlarge, ml.g7e.2xlarge, ml.g7e.4xlarge, ml.g7e.8xlarge

Qwen

Qwen3.5-0.8B

huggingface-vlm-qwen3-5-0-8b

Geração de texto

apache-2.0

Não

Padrão: ml.g6.4xlarge, ml.g6e.12xlarge, ml.g6e.2xlarge, ml.g6e.4xlarge, ml.g6e.xlarge, ml.g7e.4xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • generate_best_price_performance(Gerado, balanceado): ml.g6.xlarge, ml.g6e.2xlarge

  • generate_highest_throughput(Gerado, taxa de transferência otimizada): ml.g6.24xlarge, ml.g6e.24xlarge

  • generate_lowest_cost(Gerado, custo otimizado): ml.g6.xlarge, ml.g6e.xlarge

  • generate_lowest_latency(Gerado, latência otimizada): ml.g6.4xlarge, ml.g6e.4xlarge

  • interact_best_price_performance(Interact, Balanceado), interact_lowest_latency (Interact, Latência otimizada): ml.g6.2xlarge, ml.g6.xlarge, ml.g6e.2xlarge

  • interact_highest_throughput(Interact, taxa de transferência otimizada): ml.g6.24xlarge, ml.g6e.16xlarge, ml.g6e.2xlarge

  • interact_lowest_cost(Interact, custo otimizado), (Modificar, balancear), modify_best_price_performance (Modificar, modify_lowest_cost custo otimizado): ml.g6.2xlarge, ml.g6.xlarge, ml.g6e.xlarge

  • max_context_highest_throughput(Contexto máximo, taxa de transferência otimizada): ml.g6.24xlarge, ml.g6e.12xlarge, ml.g7e.4xlarge

  • max_context_lowest_cost(Contexto máximo, custo otimizado): ml.g6.2xlarge, ml.g6e.xlarge, ml.g7e.4xlarge

  • max_context_lowest_latency(Contexto máximo, latência otimizada): ml.g6.16xlarge, ml.g6e.4xlarge, ml.g7e.4xlarge

  • modify_highest_throughput(Modificar, taxa de transferência otimizada): ml.g6.24xlarge, ml.g6e.12xlarge, ml.g6e.24xlarge

  • modify_lowest_latency(Modificar, latência otimizada): ml.g6.8xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge

  • summarize_best_price_performance(Resumindo, balanceado): ml.g6.xlarge, ml.g6e.2xlarge, ml.g7e.8xlarge

  • summarize_highest_throughput(Resumindo, produtividade otimizada): ml.g6.12xlarge, ml.g6e.2xlarge, ml.g7e.8xlarge

  • summarize_lowest_cost(Resumindo, custo otimizado): ml.g6.xlarge, ml.g6e.xlarge, ml.g7e.8xlarge

  • summarize_lowest_latency(Resumindo, latência otimizada): ml.g6.24xlarge, ml.g6e.16xlarge, ml.g7e.8xlarge

Qwen

Qwen3.5-27b

huggingface-vlm-qwen3-5-27b

Geração de texto

apache-2.0

Sim

ml.g6.48xlarge

Qwen

Qwen3.5-27B-FP8

huggingface-vlm-qwen3-5-27b-fp8

Image-Text-to-Text

apache-2.0

Não

ml.g6.24xlarge

Qwen

Qwen3.5-2B

huggingface-vlm-qwen3-5-2b

Geração de texto

apache-2.0

Não

Padrão: ml.g6.12xlarge, ml.g6e.12xlarge, ml.g6e.2xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.g6e.xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • generate_best_price_performance(Gerar, Balanceado), modify_best_price_performance (Modificar, Balanceado): ml.g6.xlarge, ml.g6e.2xlarge, ml.g6e.xlarge

  • generate_highest_throughput(Gerado, taxa de transferência otimizada): ml.g6.48xlarge, ml.g6e.12xlarge, ml.g6e.24xlarge

  • generate_lowest_cost(Gerar, custo otimizado), modify_lowest_cost (Modificar, custo otimizado): ml.g6.2xlarge, ml.g6.xlarge, ml.g6e.xlarge

  • generate_lowest_latency(Gerado, latência otimizada): ml.g6.16xlarge, ml.g6.xlarge, ml.g6e.16xlarge

  • interact_best_price_performance(Interact, Balanceado): ml.g6.xlarge, ml.g6e.2xlarge

  • interact_highest_throughput(Interact, taxa de transferência otimizada): ml.g6.24xlarge, ml.g6e.48xlarge

  • interact_lowest_cost(Interact, custo otimizado): ml.g6.xlarge, ml.g6e.xlarge

  • interact_lowest_latency(Interact, latência otimizada): ml.g6.4xlarge, ml.g6e.4xlarge

  • max_context_highest_throughput(Contexto máximo, taxa de transferência otimizada), modify_highest_throughput (Modificar, taxa de transferência otimizada): ml.g6.12xlarge, ml.g6e.12xlarge, ml.g6e.24xlarge

  • max_context_lowest_cost(Contexto máximo, custo otimizado): ml.g6.12xlarge, ml.g6e.2xlarge, ml.g6e.xlarge

  • max_context_lowest_latency(Contexto máximo, latência otimizada): ml.g6.48xlarge, ml.g6e.16xlarge, ml.g6e.48xlarge

  • modify_lowest_latency(Modificar, latência otimizada): ml.g6.8xlarge, ml.g6e.2xlarge, ml.g6e.8xlarge

  • summarize_best_price_performance(Resumir, balanceado), summarize_lowest_cost (Resumir, custo otimizado): ml.g6.xlarge, ml.g6e.xlarge, ml.g7e.4xlarge

  • summarize_highest_throughput(Resumindo, produtividade otimizada): ml.g6.12xlarge, ml.g6e.2xlarge, ml.g7e.4xlarge

  • summarize_lowest_latency(Resumindo, latência otimizada): ml.g6.2xlarge, ml.g6e.2xlarge, ml.g7e.4xlarge

Qwen

Qwen3.5-4B

huggingface-vlm-qwen3-5-4b

Geração de texto

apache-2.0

Sim

Padrão: ml.g6.12xlarge, ml.g6e.24xlarge, ml.g7e.12xlarge, ml.g7e.2xlarge, ml.g7e.4xlarge, ml.g7e.8xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • generate_best_price_performance(Gerar, balancear), generate_highest_throughput (Gerar, otimizar a produtividade), (Gerar, otimizar o custo), generate_lowest_cost (Gerar, otimizar a latência): generate_lowest_latency ml.g6.8xlarge, ml.g6e.8xlarge, ml.g7e.4xlarge

  • interact_best_price_performance(Interact, Balanced), interact_highest_throughput (Interact, Throughput otimizado), (Interact, Custo otimizado), interact_lowest_cost (Interact, latência otimizada): interact_lowest_latency ml.g6.2xlarge, ml.g6e.xlarge, ml.g7e.2xlarge

  • max_context_highest_throughput(Contexto máximo, taxa de transferência otimizada), (contexto máximo, custo otimizado), max_context_lowest_cost (contexto máximo, latência otimizada): max_context_lowest_latency ml.g6.12xlarge, ml.g6e.24xlarge, ml.g7e.2xlarge

  • modify_best_price_performance(Modificar, balancear), modify_lowest_cost (Modificar, custo otimizado), (Modificar, modify_lowest_latency latência otimizada): ml.g6.2xlarge, ml.g6e.8xlarge, ml.g7e.2xlarge

  • modify_highest_throughput(Modificar, taxa de transferência otimizada): ml.g6.2xlarge, ml.g6e.8xlarge, ml.g7e.4xlarge

  • summarize_best_price_performance(Resumir, balanceado), summarize_lowest_cost (Resumir, custo otimizado): ml.g6.12xlarge, ml.g6e.24xlarge, ml.g7e.12xlarge

  • summarize_highest_throughput(Resumindo, produtividade otimizada): ml.g6.12xlarge, ml.g6e.24xlarge, ml.g7e.24xlarge

  • summarize_lowest_latency(Resumindo, latência otimizada): ml.g6.24xlarge, ml.g6e.16xlarge, ml.g7e.2xlarge

Qwen

Qwen3.5-9b

huggingface-vlm-qwen3-5-9b

Geração de texto

apache-2.0

Sim

ml.g6,24x grande, ml.g6,48x grande

Qwen

Qwen3.6-27B

huggingface-vlm-qwen3-6-27b

Image-Text-to-Text

apache-2.0

Sim

Padrão: ml.g7e.12xlarge, ml.g7e.24xlarge, ml.g7e.48xlarge, ml.p5en.48xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • generate_best_price_performance(Gerar, balancear), generate_lowest_cost (gerar, otimizar o custo), (modificar, balancear), modify_best_price_performance (modificar, otimizar o custo), modify_lowest_cost (resumir, balancear), summarize_best_price_performance (resumir, otimizar o custo): ml.g6.12xlarge, summarize_lowest_cost ml.g6e.12xlarge, ml.p5en.48xlarge

  • generate_highest_throughput(Gerar, taxa de transferência otimizada), (Modificar, taxa de transferência otimizada), modify_highest_throughput (Modificar, latência otimizada): modify_lowest_latency ml.g7e.48xlarge, ml.p5.4xlarge, ml.p5en.48xlarge

  • generate_lowest_latency(Gerado, latência otimizada): ml.g6e.12xlarge, ml.p5.4xlarge, ml.p5en.48xlarge

  • interact_best_price_performance(Interact, Balanced), interact_lowest_cost (Interact, Custo otimizado): ml.g6.12xlarge, ml.g6e.12xlarge, ml.p5.48xlarge

  • interact_highest_throughput(Interact, taxa de transferência otimizada), interact_lowest_latency (Interact, latência otimizada): ml.g6e.48xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • max_context_highest_throughput(Contexto máximo, taxa de transferência otimizada): ml.g7e.24xlarge, ml.g7e.48xlarge, ml.p5en.48xlarge

  • max_context_lowest_cost(Contexto máximo, custo otimizado), max_context_lowest_latency (contexto máximo, latência otimizada): ml.g7e.12xlarge, ml.g7e.48xlarge, ml.p5en.48xlarge

  • summarize_highest_throughput(Resumindo, produtividade otimizada): ml.g6e.24xlarge, ml.g7e.48xlarge, ml.p5en.48xlarge

  • summarize_lowest_latency(Resumindo, latência otimizada): ml.g6.48xlarge, ml.g6e.48xlarge, ml.p5en.48xlarge

Qwen

Qwen3.6-35B-A3B

huggingface-vlm-qwen3-6-35b-a3b

Geração de texto

apache-2.0

Não

Padrão: ml.g6e.24xlarge, ml.g6e.48xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • generate_best_price_performance(Gerar, balancear), generate_lowest_cost (Gerar, custo otimizado): ml.g6.12xlarge, ml.g6e.12xlarge, ml.p5.48xlarge

  • generate_highest_throughput(Geração, taxa de transferência otimizada), max_context_highest_throughput (contexto máximo, taxa de transferência otimizada): ml.g6e.48xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • generate_lowest_latency(Geração, latência otimizada), max_context_lowest_cost (contexto máximo, custo otimizado), (contexto máximo, latência otimizada), max_context_lowest_latency (modificação, taxa de transferência otimizada), modify_highest_throughput (modificação, latência otimizada), summarize_highest_throughput (resumo, taxa de transferência otimizada): modify_lowest_latency ml.g6e.24xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • interact_best_price_performance(Interact, Balanced), interact_lowest_cost (Interact, Custo otimizado): ml.g6.12xlarge, ml.g6e.12xlarge, ml.p5en.48xlarge

  • interact_highest_throughput(Interact, taxa de transferência otimizada), interact_lowest_latency (Interact, latência otimizada): ml.g6.48xlarge, ml.g6e.48xlarge, ml.p5en.48xlarge

  • modify_best_price_performance(Modificar, balancear), modify_lowest_cost (Modificar, otimizar o custo), (Resumir, balancear), summarize_best_price_performance (Resumir, otimizar o custo): summarize_lowest_cost ml.g6.48xlarge, ml.g6e.12xlarge, ml.p5.48xlarge

  • summarize_lowest_latency(Resumindo, latência otimizada): ml.g6e.12xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

Qwen

QW 32B

huggingface-llm-qwq-32b

Geração de texto

apache-2.0

Não

ml.g5,24x grande, ml.g5,48x grande, ml.g6,24x grande, ml.g6,48x grande, ml.p4d.24x grande

Reconhecer

Reconheça Bert Base Spanish Wam Cases Xnli

huggingface-zstc-recognai-bert-base-spanish-wwm-cased-xnli

Zero-Shot Classificação

mit

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Reconhecer

Reconheça o Zeroshot Selectra Medium

huggingface-zstc-recognai-zeroshot-selectra-medium

Zero-Shot Classificação

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Rinna

Rinna Japanese GPT NeoX 3.6B Instruction PPO

huggingface-llm-rinna-3-6b-instruction-ppo-bf16

Geração de texto

mit

Não

ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.xlarge

Salesforce

Salesforce _R SFR-Embedding-2

huggingface-textembedding-sfr-embedding-2-r

Incorporação de texto

CC-BY-NC-4.0

Não

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g5.xlarge, ml.g6.12xlarge, ml.g6.24xlarge, ml.g6.2xlarge, ml.g6.48xlarge, ml.g6.4xlarge, ml.g6.4xlarge, ml.g6,8xlarge, ml.g6.xlarge, ml.p4d.24xlarge

Salesforce

Salesforce SFR-Embedding-Mistral

huggingface-textembedding-sfr-embedding-mistral

Incorporação de texto

CC-BY-NC-4.0

Não

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g5.xlarge, ml.g6.12xlarge, ml.g6.24xlarge, ml.g6.2xlarge, ml.g6.48xlarge, ml.g6.4xlarge, ml.g6.4xlarge, ml.g6,8xlarge, ml.g6.xlarge, ml.p4d.24xlarge

Sentence-Transformers

Todos os miniLM L6 v2

huggingface-sentencesimilarity-all-MiniLM-L6-v2

Similaridade de frases

apache-2.0

Sim

ml.c6i.xlarge, ml.g4dn.2xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Sentence-Transformers

Todos os miniLM L6 v2

huggingface-textembedding-all-MiniLM-L6-v2

Incorporação de texto

Apache-2.0

Não

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g5.xlarge, ml.g6.12xlarge, ml.g6.24xlarge, ml.g6.2xlarge, ml.g6.48xlarge, ml.g6.4xlarge, ml.g6.4xlarge, ml.g6,8xlarge, ml.g6.xlarge, ml.p4d.24xlarge

Sentence-Transformers

tudo- MiniLM-L12-v2

huggingface-textembedding-all-MiniLM-L12-v2

Incorporação de texto

Apache-2.0

Não

ml.g5.xlarge, ml.g6.xlarge, ml.g6e.xlarge

Sentence-Transformers

Parafraseie miniLM L12 v2 multilíngue

huggingface-textembedding-paraphrase-multilingual-MiniLM-L12-v2

Incorporação de texto

Apache-2.0

Não

ml.g5.xlarge, ml.g6.xlarge, ml.g6e.xlarge

Shenzhi-Wang

Bate-papo chinês Llama3 8B

huggingface-llm-shenzhi-wang-llama3-8B-chinese-chat

Geração de texto

Chamada 3

Não

ml.g5,16 x grande, ml.g5,2 x grande, ml.g5,4 x grande, ml.g5,8 x grande

Snowflake

Snowflake Arctic Instruct Vllm

huggingface-llm-snowflake-arctic-instruct-vllm

Geração de texto

apache-2.0

Não

ml.p5.48xlarge

Speakleash

Bielik-11B-v3.0-Instruct

huggingface-llm-bielik-11b-v3-0-instruct

Geração de texto

apache-2.0

Não

Padrão: ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.12xlarge, ml.g7e.2xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • generate_best_price_performance(Gerar, Balancear), generate_lowest_cost (Gerar, Custo otimizado), (Interagir, Custo otimizado), interact_lowest_cost modify_lowest_cost (Modificar, Custo otimizado): ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.xlarge

  • generate_highest_throughput(Geração, produtividade otimizada), interact_highest_throughput (interação, taxa de transferência otimizada), (modificação, taxa de transferência otimizada), modify_highest_throughput (modificação, latência otimizada), modify_lowest_latency (resumo, taxa de transferência otimizada), summarize_highest_throughput (resumo, latência otimizada): ml.p4d.24xlarge, ml.p5.48xlarge, summarize_lowest_latency ml.p5en.48xlarge

  • generate_lowest_latency(Gerado, latência otimizada): ml.g6e.16xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • interact_best_price_performance(Interact, Balanceado): ml.g5.12xlarge, ml.g6e.xlarge, ml.p4d.24xlarge

  • interact_lowest_latency(Interact, latência otimizada): ml.g5.48xlarge, ml.g6.24xlarge, ml.g6e.24xlarge

  • max_context_highest_throughput(Contexto máximo, taxa de transferência otimizada): ml.g6e.12xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • max_context_lowest_cost(Contexto máximo, custo otimizado): ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.12xlarge

  • max_context_lowest_latency(Contexto máximo, latência otimizada): ml.g5.24xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • modify_best_price_performance(Modificar, balanceado): ml.g6.12xlarge, ml.g6e.xlarge, ml.p4d.24xlarge

  • summarize_best_price_performance(Resumir, balanceado): ml.g6e.12xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

  • summarize_lowest_cost(Resumindo, custo otimizado): ml.g5.48xlarge, ml.g6.48xlarge, ml.g6e.12xlarge

Schleifer

Distilbart CNN 12-6

huggingface-summarization-distilbart-cnn-12-6

Resumo de texto

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Schleifer

Distilbart CNN 6-6

huggingface-summarization-distilbart-cnn-6-6

Resumo de texto

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Schleifer

Resumo de texto

huggingface-summarization-distilbart-xsum-1-1

Resumo de texto

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Stabilityai

Japanese StableLM Instruct Alpha 7B v2

model-textgenerationjp-japanese-stablelm-instruct-alpha-7b-v2

Geração de texto

Apache-2.0

Não

ml.g5.12xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge

Stabilityai

Difusão estável 2

model-txt2img-stabilityai-stable-diffusion-v2

Text-to-Image

creativml-openrail++-m

Não

ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Stabilityai

Difusão estável de 2 profundidades FP16

model-depth2img-stable-diffusion-2-depth-fp16

Image-to-Image

creativml-openrail++-m

Não

ml.g4dn.16xlarge, ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g4dn.xlarge, ml.g5.16xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g5.xlarge, ml.p3.2xlarge

Stabilityai

Difusão estável 2 FP16

model-txt2img-stabilityai-stable-diffusion-v2-fp16

Text-to-Image

creativml-openrail++-m

Não

ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Stabilityai

Difusão estável 2 na pintura

model-inpainting-stabilityai-stable-diffusion-2-inpainting

Image-to-Image

creativml-openrail++-m

Não

ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Stabilityai

Difusão estável 2 na pintura FP16

model-inpainting-stabilityai-stable-diffusion-2-inpainting-fp16

Image-to-Image

creativml-openrail++-m

Não

ml.g4dn.xlarge, ml.g5.2xlarge, ml.p3.2xlarge

Stabilityai

Difusão estável 2 na pintura FP16

model-inpainting-stabilityai-stable-diffusion2-inpainting-fp16

Image-to-Image

creativml-openrail++-m

Não

ml.g4dn.xlarge, ml.g5.2xlarge, ml.p3.2xlarge

Stabilityai

Stable Diffusion 2.1

model-txt2img-stabilityai-stable-diffusion-v2-1-base

Text-to-Image

creativml-openrail++-m

Sim

ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Stabilityai

Difusão estável 2.1 Neurônio

huggingface-txt2imgneuron-stabilityai-stable-diffusion-v2-1

Text-to-Image

creativml-openrail++-m

Não

ml.inf2.24xlarge, ml.inf2.48xlarge, ml.inf2.8xlarge, ml.inf2.xlarge

Stabilityai

Amplificador de difusão estável x4 FP16

model-upscaling-stabilityai-stable-diffusion-x4-upscaler-fp16

Image-to-Image

openrail++

Não

ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Stabilityai

Difusão estável XL 1.0 (código aberto)

model-imagegeneration-stabilityai-stable-diffusion-xl-base-1-0

Text-to-Image

openrail++

Não

ml.g 5,16 x grande, ml.g 5,4 x grande, ml.g 5,8 x grande

Stabilityai

Neurônio de difusão estável XL Base 1.0

huggingface-txt2imgneuron-stabilityai-stable-diffusion-xlbase1

Text-to-Image

openrail++

Não

ml.inf2.24xlarge, ml.inf2.48xlarge, ml.inf2.8xlarge, ml.inf2.xlarge

Swiss-Ai

Apertus 70B 2509

huggingface-llm-apertus-70b-2509

Geração de texto

apache-2.0

Não

ml.g5,48xlarge, ml.g6.48xlarge, ml.g6e.48xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge, ml.p5e.48xlarge, ml.p5en.48xlarge

Swiss-Ai

Apertus 70B Instruct 2509

huggingface-llm-apertus-70b-instruct-2509

Geração de texto

apache-2.0

Não

ml.g5,48xlarge, ml.g6.48xlarge, ml.g6e.48xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge, ml.p5e.48xlarge, ml.p5en.48xlarge

Swiss-Ai

Apertus 8B Instruct 2509

huggingface-llm-apertus-8b-instruct-2509

Geração de texto

apache-2.0

Não

ml.g5.12xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g5.xlarge, ml.g6.12xlarge, ml.g6.16xlarge, ml.g6.24xlarge, ml.g6.2xlarge, ml.g6.48xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.g6.xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.g6e.2xlarge, ml.g6e.48xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge .g6e.xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge, ml.p5e.48xlarge, ml.p5en.48xlarge

O cara

Perguntas frequentes do Mistral 7B OpenOrca

huggingface-llm-thebloke-mistral-7b-openorca-awq

Geração de texto

apache-2.0

Não

ml.g 5,12 x grande, ml.g 5,24 x grande, ml.g 5,2 x grande, ml.g 5,48 x grande

O cara

Mistral 7G GPTA OpenOrca

huggingface-llm-mistral-7b-openorca-gptq

Geração de texto

apache-2.0

Não

ml.g5.12xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g5.xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge

O cara

Mixtral 8x7B Instruct GPTQ

huggingface-llm-mixtral-8x7b-instruct-gptq

Geração de texto

apache-2.0

Não

ml.g5,12x grande, ml.g5,24x grande, ml.g5,48x grande, ml.p4d.24x grande

Então nlper

GTE grande

huggingface-sentencesimilarity-gte-large

Similaridade de frases

mit

Sim

ml.c6i.xlarge, ml.g4dn.2xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Então nlper

GTE pequeno

huggingface-sentencesimilarity-gte-small

Similaridade de frases

mit

Sim

ml.c6i.xlarge, ml.g4dn.2xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Tiiuae

Falcon 180B BF16

huggingface-llm-falcon-180b-bf16

Geração de texto

Não aplicável

Não

ml.p4de.24x grande, ml.p5.48x grande

Tiiuae

Falcon 180B Chat BF16

huggingface-llm-falcon-180b-chat-bf16

Geração de texto

Não aplicável

Não

ml.p4de.24x grande, ml.p5.48x grande

Tiiuae

Falcon 40B BF16

huggingface-llm-falcon-40b-bf16

Geração de texto

apache-2.0

Sim

ml.g5,12x grande, ml.g5,24x grande, ml.g5,48x grande, ml.p4d.24x grande

Tiiuae

Falcon 40B Instruct BF16

huggingface-llm-falcon-40b-instruct-bf16

Geração de texto

apache-2.0

Sim

ml.g5,12x grande, ml.g5,24x grande, ml.g5,48x grande, ml.p4d.24x grande

Tiiuae

Falcon 7B BF16

huggingface-llm-falcon-7b-bf16

Geração de texto

apache-2.0

Sim

ml.g5,16 x grande, ml.g5,2 x grande, ml.g5,4 x grande, ml.g5,8 x grande

Tiiuae

Falcon 7B Instruct BF16

huggingface-llm-falcon-7b-instruct-bf16

Geração de texto

apache-2.0

Sim

ml.g5,16 x grande, ml.g5,2 x grande, ml.g5,4 x grande, ml.g5,8 x grande

Tiiuae

Falcon RW 1B

huggingface-llm-tiiuae-falcon-rw-1b

Geração de texto

apache-2.0

Não

ml.g5.2xlarge

Tiiuae

Falcon-H1-0.5B-Instruct

huggingface-llm-falcon-h1-0-5b-instruct

Geração de texto

outro

Não

ml.g4dn.12xlarge, ml.g4dn.16xlarge, ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g4dn.xlarge, ml.g5.12xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.2xlarge, ml.g5.2xlarge, ml.g5.2xlarge 48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g5.xlarge, ml.g6.12xlarge, ml.g6.16xlarge, ml.g6.24xlarge, ml.g6.2xlarge, ml.g6.48xlarge, ml.g6.4xlarge, ml.g6.xlarge, ml.g6.xlarge, ml.g6.xlarge, ml.ge.6xlarge 12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.g6e.2xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.g6e.xlarge, ml.p3.2xlarge, ml.p4d.24xlarge

Tiiuae

Falcon-H1-1.5B-Deep-Instruct

huggingface-llm-falcon-h1-1-5b-deep-instruct

Geração de texto

outro

Não

ml.g5.16xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g6.16xlarge, ml.g6.2xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.g6.xlarge, ml.g6e.16xlarge, ml.g6e.2xlarge, ml.g6e.4xlarge, ml.ge.6xlarge 8xlarge, ml.g6e.xlarge

Tiiuae

Falcon-H1-1.5B-Instruct

huggingface-llm-falcon-h1-1-5b-instruct

Geração de texto

outro

Não

ml.g6.12xlarge, ml.g6.16xlarge, ml.g6.24xlarge, ml.g6.2xlarge, ml.g6.48xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.g6.xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.ge.24xlarge, ml.g6.6xlarge 2x grande, ml.g6e.48xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.g6e.xlarge

Tiiuae

Falcon-H1-34B-Instruct

huggingface-llm-falcon-h1-34b-instruct

Geração de texto

outro

Não

ml.g6e.12xlarge, ml.g6e.24xlarge, ml.g6e.48xlarge

Tiiuae

Falcon-H1-3B-Instruct

huggingface-llm-falcon-h1-3b-instruct

Geração de texto

outro

Não

ml.g6e.16xlarge, ml.g6e.2xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.g6e.xlarge

Tiiuae

Falcon-H1-7B-Instruct

huggingface-llm-falcon-h1-7b-instruct

Geração de texto

outro

Não

ml.g6e.12xlarge, ml.g6e.24xlarge

Tiiuae

Falcon2-11B

huggingface-llm-falcon2-11b

Geração de texto

Não aplicável

Não

ml.g5,12x grande, ml.g5,24x grande, ml.g5,48x grande, ml.p4d.24x grande

Tiiuae

Falcon3-10B-Base

huggingface-llm-falcon-3-10B-base

Geração de texto

outro

Não

ml.g5,12 x grande, ml.g 5,24 x grande, ml.g5,48 x grande, ml.g6,12 x grande, ml.g6,24 x grande, ml.g6,48 x grande, ml.p4d.24x grande, ml.p5,48 x grande

Tiiuae

Falcon3-10B-Instruct

huggingface-llm-falcon-3-10B-Instruct

Geração de texto

outro

Não

ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g5.24xlarge, ml.g6.12xlarge, ml.g6.24xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.g6e.2xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.g6e.xlarge

Tiiuae

Falcon3-1B-Instruct

huggingface-llm-falcon-3-1B-Instruct

Geração de texto

outro

Não

Padrão: ml.g4dn.xlarge, ml.g5.xlarge, ml.g6.xlarge, ml.g6e.xlarge, ml.p3.2xlarge, ml.p4d.24xlarge

Tipos de instância adicionais estão disponíveis por meio dessas configurações de implantação de hospedagem:

  • generate_best_price_performance(Gerado, balanceado): ml.g4dn.xlarge, ml.g5.xlarge, ml.g6e.2xlarge

  • generate_highest_throughput(Gerado, taxa de transferência otimizada): ml.g6e.12xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • generate_lowest_cost(Geração, custo otimizado), interact_lowest_cost (Interação, custo otimizado), (contexto máximo, max_context_lowest_cost custo otimizado): ml.g4dn.xlarge, ml.g5.xlarge, ml.g6.xlarge

  • generate_lowest_latency(Gerado, latência otimizada): ml.g6.12xlarge, ml.g6e.12xlarge, ml.p4d.24xlarge

  • interact_best_price_performance(Interact, Balanceado): ml.g4dn.xlarge, ml.g5.xlarge, ml.g6e.xlarge

  • interact_highest_throughput(Interact, taxa de transferência otimizada): ml.g6e.48xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • interact_lowest_latency(Interact, latência otimizada): ml.g5.2xlarge, ml.g6.48xlarge, ml.g6e.48xlarge

  • max_context_highest_throughput(Contexto máximo, taxa de transferência otimizada): ml.g6e.24xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • max_context_lowest_latency(Contexto máximo, latência otimizada): ml.g6e.4xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

Tiiuae

Falcon3-3B-Base

huggingface-llm-falcon-3-3B-base

Geração de texto

outro

Não

ml.g5.12xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g5.xlarge, ml.g6.12xlarge, ml.g6.16xlarge, ml.g6.24xlarge, ml.g6.2xlarge, ml.g6.2xlarge, ml.g6,48 x grande, ml.g6,4 x grande, ml.g6,8 x grande, ml.g6.x grande, ml.p4d. 24 x grande, ml.p5,48 x grande

Tiiuae

Falcon3-3B-Instruct

huggingface-llm-falcon-3-3B-Instruct

Geração de texto

outro

Não

ml.g4dn.12xlarge, ml.g4dn.16xlarge, ml.g4dn.4xlarge, ml.g5.12xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.xlarge, ml.g6.12xlarge, ml.g6,16xlarge, ml.g6,16xlarge, ml.g6.16xlarge, ml.g6.16xlarge, ml.g6.16xlarge, ml.g6.16xlarge, ml.g6.16xlarge, ml.g6.16xlarge, ml.g6.16xlarge, ml.g6.16xlarge, ml.g6.16xlarge, ml.g6.16xlarge, ml.g6.16xlarge, g6,24xlarge, ml.g6.2xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.g6e.2xlarge, ml.g6e.8xlarge, ml.g6e.xlarge, ml.p3.2xlarge

Tiiuae

Falcon3-7B-Base

huggingface-llm-falcon-3-7B-base

Geração de texto

outro

Não

ml.g5,12 x grande, ml.g 5,24 x grande, ml.g5,48 x grande, ml.g6,12 x grande, ml.g6,24 x grande, ml.g6,48 x grande, ml.p4d.24x grande, ml.p5,48 x grande

Tiiuae

Falcon3-7B-Instruct

huggingface-llm-falcon-3-7B-Instruct

Geração de texto

outro

Não

ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g5.24xlarge, ml.g6.12xlarge, ml.g6.24xlarge, ml.g6e.12xlarge, ml.g6e.24xlarge, ml.g6e.2xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.g6e.xlarge

Tinillama

Tiny Llama 1.1B

huggingface-llm-tinyllama-1-1b-intermediate-step-1431k-3

Geração de texto

apache-2.0

Não

ml.g5,12x grande, ml.g5,24x grande, ml.g5,2x grande

Tinillama

Chat do Tiny Llama 1.1B V0.6

huggingface-llm-tinyllama-tinyllama-1-1b-chat-v0-6

Geração de texto

apache-2.0

Não

ml.g5,12x grande, ml.g5,24x grande, ml.g5,2x grande

Tinillama

Tiny Llama 1.1B Chat V1

huggingface-llm-tinyllama-tinyllama-1-1b-chat-v1-0

Geração de texto

apache-2.0

Não

ml.g5,12x grande, ml.g5,24x grande, ml.g5,2x grande

Computador em conjunto

RedPajama INCITE Chat 3B V1

huggingface-textgeneration1-redpajama-incite-chat-3B-v1-fp16

Geração de texto

apache-2.0

Sim

ml.g5,16 x grande, ml.g5,2 x grande, ml.g5,4 x grande, ml.g5,8 x grande

Computador em conjunto

RedPajama BATE-PAPO INCITE 7B V1

huggingface-textgeneration1-redpajama-incite-chat-7B-v1-fp16

Geração de texto

apache-2.0

Sim

ml.g5,16 x grande, ml.g5,2 x grande, ml.g5,4 x grande, ml.g5,8 x grande

Computador em conjunto

RedPajama INCITE Instruct 3B V1

huggingface-textgeneration1-redpajama-incite-instruct-3Bv1fp16

Geração de texto

apache-2.0

Sim

ml.g5,16 x grande, ml.g5,2 x grande, ml.g5,4 x grande, ml.g5,8 x grande

Computador em conjunto

RedPajama INCITE Instruct 7B V1

huggingface-textgeneration1-redpajama-incite-instruct-7B1fp16

Geração de texto

apache-2.0

Sim

ml.g5,16 x grande, ml.g5,2 x grande, ml.g5,4 x grande, ml.g5,8 x grande

Tokyotech-Llm

Swallow-7b-instruct-hf

huggingface-llm-swallow-7b-instruct-hf

Geração de texto

lhama2

Não

ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g5.xlarge, ml.g6.12xlarge, ml.g6.16xlarge, ml.g6.24xlarge grande, ml.g6.2xlarge, ml.g6.48xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.g6.xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge

Volrath50

difusão de cartas de fantasia volrath50

huggingface-txt2img-volrath50-fantasy-card-diffusion

Text-to-Image

creativml-openrail-m

Não

ml.g4dn.2xlarge, ml.g4dn.xlarge, ml.p3.2xlarge

Gravador

Writer Palmyra Small

huggingface-llm-writer-palmyra-small

Geração de texto

apache-2.0

Não

ml.g5.2xlarge

Zai-Org

GLM-5.1-FP8

huggingface-llm-glm-5-1-fp8

Geração de texto

Apache-2.0

Não

ml.p5en.48xlarge

Proprietary Models (121)

Modelos de fundação proprietários são oferecidos por fornecedores terceirizados por meio da Amazon SageMaker JumpStart. Para usar um modelo de fundação proprietário, você deve primeiro assinar o modelo no AWS Marketplace. Depois de assinar, você pode localizar e implantar o modelo básico no Amazon SageMaker Studio.

Nome do modelo ID do modelo Tarefa Fine-tunable Tipos de instância de inferência compatíveis

A.X 4.0 Luz

sk-telecom-ax4-light

Geração de texto

Não

ml.g5.2xlarge

Respostas contextuais do AI21

ai21-contextual-answers

Geração de texto

Não

ml.g4dn.12x grande, ml.g5,12x grande, ml.g5,48x grande, ml.p4d.24x grande

Luz AI21 Jurassic-2

ai21-jurassic-2-light

Geração de texto

Não

ml.g4dn.12x grande, ml.g5,12x grande, ml.g5,48x grande, ml.p4d.24x grande

AI21 Jurassic-2 Mid

ai21-jurassic-2-grande-instruct

Geração de texto

Não

ml.g4dn.12x grande, ml.g5,12x grande, ml.g5,48x grande, ml.p4d.24x grande

AI21 Ultra Jurassic-2

ai21-jurassic-2-jumbo-instruct

Geração de texto

Não

ml.g5,48x grande, ml.p4d.24x grande, ml.p4de.24x grande

Paráfrase AI21

ai21-paraphrase

Geração de texto

Não

ml.g4dn.2xlarge

Resumo do AI21

ai21-summarization

Geração de texto

Não

ml.g4dn.12xlarge, ml.g4dn.4xlarge, ml.g5.xlarge

Arcee Lite

arcee-lite

Geração de texto

Não

ml.g5.16xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g5.xlarge, ml.g6.16xlarge, ml.g6.2xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.g6.xlarge

Arcee SuperNova

arcee-supernova

Geração de texto

Não

ml.p4d.24x grande, ml.p4de.24x grande, ml.p5,48x grande

Arcee Virtuoso Small

arcee-virtuoso-small

Geração de texto

Não

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.48xlarge, ml.g6.12xlarge, ml.g6.24xlarge, ml.g6.48xlarge, ml.g6e.12xlarge, ml.g6e.24xlarge, ml.g6e.48xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p4de.24xlarge .p5,48 x grande

Bria 2.2HD Comercial Text-to-image

bria-ai-2-2-hd-commercial

ReRank

Não

ml.g5.12xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge

Bria 2.3 Comercial Text-to-image

bria-ai-2-3-commercial

ReRank

Não

ml.g5.12xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge

Bria 2.3 Fast Commercial Text-to-image

bria-ai-2-3-fast-commercial

ReRank

Não

ml.g5.12xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge

Comando coerente (RA100)

cohere-command-r-a100

Geração de texto

Não

ml.p4de.24xlarge

Comando coerente (RH100)

cohere-command-r-h100

Geração de texto

Não

ml.p5.48xlarge

Comando coerente R+ (A100)

cohere-command-r-plus-a100

Geração de texto

Não

ml.p4de.24xlarge

Comando coerente R+ (H100)

cohere-command-r-plus-h100

Geração de texto

Não

ml.p5.48xlarge

Incorporação coerente 4

cohere-embed-v4-0

Incorporação de texto

Não

ml.g5.2xlarge, ml.g5.xlarge, ml.g6.2xlarge, ml.g6.xlarge

Cohere Embed Light Model v3 - Inglês

cohere-embed-light-english

Incorporação de texto

Não

ml.g4dn.2xlarge, ml.g4dn.xlarge, ml.g5.2xlarge, ml.g5.xlarge, ml.p3.2xlarge

Cohere Embed Light v3 - Multilíngue

cohere-embed-light-multilingual

Incorporação de texto

Não

ml.g4dn.2xlarge, ml.g4dn.xlarge, ml.g5.2xlarge, ml.g5.xlarge, ml.p3.2xlarge

Cohere Embed Model 3 - Multilíngue

cohere-embed-multilingual

Incorporação de texto

Não

ml.g4dn.2xlarge, ml.g4dn.xlarge, ml.g5.2xlarge, ml.g5.xlarge, ml.p3.2xlarge

Cohere Embed Model v3 - Inglês

cohere-embed-english

Incorporação de texto

Não

ml.g4dn.2xlarge, ml.g4dn.xlarge, ml.g5.2xlarge, ml.g5.xlarge, ml.p3.2xlarge

Modelo Cohere Rerank 2 - Inglês

cohere-rerank-english-v2

ReRank

Não

ml.g4dn.2xlarge, ml.g4dn.xlarge, ml.g5.2xlarge, ml.g5.xlarge, ml.p3.2xlarge

Modelo Cohere Rerank 2 - Multilíngue

cohere-rerank-multilingual-v2

ReRank

Não

ml.g4dn.2xlarge, ml.g4dn.xlarge, ml.g5.2xlarge, ml.g5.xlarge, ml.p3.2xlarge

Modelo Cohere Rerank 3 - Inglês

cohere-rerank-v3-english

ReRank

Não

ml.g5.2xlarge, ml.g5.xlarge

Modelo Cohere Rerank 3 - Multilíngue

cohere-rerank-v3-multilingual

ReRank

Não

ml.g5.2xlarge, ml.g5.xlarge

Modelo Cohere Rerank 3 Nimble - Inglês

cohere-rerank-nimble-english

ReRank

Não

ml.g5.2xlarge, ml.g5.xlarge

Modelo Cohere Rerank 3 Nimble - Multi

cohere-rerank-nimble-multi

ReRank

Não

ml.g5.2xlarge, ml.g5.xlarge

Classificação coerente v3.5

cohere-rerank-v3-5

Incorporação de texto

Não

ml.g5.2xlarge, ml.g5.xlarge, ml.g6.2xlarge, ml.g6.xlarge

Cohere Rerank v4.0 Fast

cohere-rerank-v4-0-fast

Incorporação de texto

Não

ml.g5.2xlarge, ml.g5.xlarge, ml.p5.4xlarge

Coherme Rank v4.0 Pro

cohere-rerank-v4-0-pro

Incorporação de texto

Não

ml.g5.2xlarge, ml.g5.xlarge, ml.p5.4xlarge

Comando A (A100)

cohere-command-a-a100

Geração de texto

Não

ml.p4de.24xlarge

Comando A (H100)

cohere-command-a-h100

Geração de texto

Não

ml.p5.48xlarge

Comando R 08-2024 (H100)

cohere-command-r-08-2024-h100

Geração de texto

Não

ml.p5.48xlarge

Comando R+ 08-2024 (H100)

cohere-command-r-plus-08-2024-h100

Geração de texto

Não

ml.p5.48xlarge

OCR de documentos

upstage-document-ocr

Reconhecimento óptico de caracteres

Não

ml.g5.2xlarge

Análise de documentos

upstage-document-layout-analysis

Reconhecimento óptico de caracteres

Não

ml.g5,2 x grande, ml.g 6,2 x grande, ml.p3,2 x grande

Embutir

upstage-solar-embedding-large

Incorporação de texto

Não

ml.g6.12xlarge, ml.g6,16xlarge, ml.g6.24xlarge, ml.g6.2xlarge, ml.g6.48xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.g6e.2xlarge, ml.g6e.2xlarge, ml.g6e.2xlarge, ml.g6e.2xlarge, ml.g6e.2xlarge, ml.g6e.2xlarge, ml.g6e.2xlarge, ml.g6e.2xlarge, ml.g6e.2xlarge, ml.g6e.2xlarge, ml.g6e.2xlarge, ml.g6e.2xlarge 6e.48x grande, ml.g6e.4x grande, ml.g6e.8x grande

ESM3-open

evolutionary-scale-esm3

Geração multimodal

Não

ml.g5,4x grande, ml.g5,8x grande

Evo2-NIM

nvidia-evo2-nim

Geração de texto

Não

ml.g6e.12xlarge, ml.g6e.24xlarge, ml.g6e.48xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge, ml.p5e.48xlarge, ml.p5en.48xlarge

EXAONE Atelier - Imagem para texto

lgresearch-exaone

Geração de texto Image2Text

Não

ml.g5.12xlarge, ml.g5.48xlarge, ml.g5.xlarge, ml.p4d.24xlarge

Gretel Navigator Tabular

gretel-navigator-tabular

Geração de texto

Não

ml.g5.2xlarge, ml.g5.xlarge

H-Optimus-0

bioptimus-h-optimus-0

Extração de características

Não

ml.g5.xlarge

IBM Granite 20B Code Instruct – 8K

ibm-granite-20b-code-instruct-8k

Geração de texto

Não

ml.g 5,12 x grande, ml.g 5,24 x grande, ml.g 5,48 x grande

Instrução IBM Granite 3.0 2B

granite-3-0-2b-instruct

Geração de texto

Não

ml.p4d.24x grande, ml.p5,48x grande

Instrução IBM Granite 3.0 8B

granite-3-0-8b-instruct

Geração de texto

Não

ml.p4d.24x grande, ml.p5,48x grande

IBM Granite 3.2 Instruct 2B

ibm-granite-3-2-2b-instruct

Geração de texto

Não

ml.g6.12xlarge, ml.g6,16xlarge, ml.g6.24xlarge, ml.g6.48xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.g6e.2xlarge, ml.g6e.48xlarge, ml.g6e.4xlarge, ml.p4d.24xlarge, ml.p 5,48 x grande

IBM Granite 3.2 Instruct 8B

ibm-granite-3-2-8b-instruct

Geração de texto

Não

ml.g6.12xlarge, ml.g6,16xlarge, ml.g6.24xlarge, ml.g6.48xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.g6e.2xlarge, ml.g6e.48xlarge, ml.g6e.4xlarge, ml.p4d.24xlarge, ml.p 5,48 x grande

IBM Granite 34B Code Instruct – 8K

ibm-granite-34b-code-instruct-8k

Geração de texto

Não

ml.g 5,12 x grande, ml.g 5,24 x grande, ml.g 5,48 x grande

IBM Granite 3B Code Instruct – 128K

ibm-granite-3b-code-instruct-128k

Geração de texto

Não

ml.g 5,12 x grande, ml.g 5,16 x grande, ml.g 5,24 x grande, ml.g 5,48 x grande, ml.g 5,4 x grande, ml.g 5,8 x grande

IBM Granite 4.0 h-micro

ibm-granite-4-0-h-micro

Geração de texto

Não

ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.g6e.2xlarge, ml.g6e.48xlarge, ml.g6e.4xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

IBM Granite 4.0 h-small

ibm-granite-4-0-h-small

Geração de texto

Não

ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.g6e.2xlarge, ml.g6e.48xlarge, ml.g6e.4xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

IBM Granite 4.0 h-tiny

ibm-granite-4-0-h-tiny

Geração de texto

Não

ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.g6e.2xlarge, ml.g6e.48xlarge, ml.g6e.4xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

IBM Granite 8B Code Instruct – 128K

ibm-granite-8b-code-instruct-128k

Geração de texto

Não

ml.g 5,12 x grande, ml.g 5,16 x grande, ml.g 5,24 x grande, ml.g 5,48 x grande, ml.g 5,4 x grande, ml.g 5,8 x grande

ixi- GEN-Fin-7.8B

lg-ixi-gen

Geração de texto

Não

ml.g5.4xlarge

JetBrains AI Mellum All

jbai-mellum-all

text2geração de texto

Não

ml.g5.2xlarge, ml.g6.2xlarge, ml.g6e.xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge, ml.p5e.48xlarge

JetBrains AI Mellum Kotlin

jbai-mellum-kotlin

text2geração de texto

Não

ml.g5.2xlarge, ml.g6.2xlarge, ml.g6e.xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge, ml.p5e.48xlarge

JetBrains AI entre Python

jbai-mellum-python

text2geração de texto

Não

ml.g5.2xlarge, ml.g6.2xlarge, ml.g6e.xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge, ml.p5e.48xlarge

Jina Embeddings v2 Base - pt

jinaai-embeddings-v2-base-en

Incorporação de texto

Não

ml.g4dn.12xlarge, ml.g4dn.16xlarge, ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g4dn.xlarge, ml.g5.12xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.2xlarge, ml.g5.2xlarge, ml.g5.2xlarge 48x grande, ml.g5,4x grande, ml.g5,8x grande, ml.g5.xlarge, ml.p2.16xlarge, ml.p2.8xlarge, ml.p2.xlarge, ml.p3.16xlarge, ml.p3.2xlarge, ml.p3.8xlarge

KARAKURI LM 8x7b instruct

karakuri-lm-8x7b-instruct

Geração de texto

Não

ml.g5,48x grande, ml.g6,48x grande

LightOn Lyra-Fr 10B

lighton-lyra-fr

Geração de texto

Não

ml.p4d.24xlarge

LightOn Mini-instruct 40B

lighton-mini-instruct40b

Geração de texto

Não

ml.p4d.24xlarge

Líquido LFM 40B (A100)

liquid-lfm-40b-a100

Geração de texto

Não

ml.p4d.24xlarge

Líquido LFM 40B (H100)

liquid-lfm-40b-h100

Geração de texto

Não

ml.p5.48xlarge

Líquido LFM 40B (L40S)

liquid-lfm-40b-l40s

Geração de texto

Não

ml.g6e.12xlarge

Líquido LFM 7B (L40S)

liquid-lfm-7b-l40s

Geração de texto

Não

ml.g6e.16xlarge, ml.g6e.2xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.g6e.xlarge

Llama 3.1 Nemotron Nano 8B V1

nvidia-nemotron-nano-8b-nim

Geração de texto

Não

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.48xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.g6e.2xlarge, ml.g6e.48xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.p4d.24xlarge, ml.p4de.24x grande, ml.p5.48x grande, ml.p5e.48x grande, ml.p5en.48x grande

Lhama 3.1 SuperNova Lite

arcee-llama-3-1-supernova-lite

Geração de texto

Não

ml.g5,16 x grande, ml.g5,2 x grande, ml.g5,4 x grande, ml.g5,8 x grande, ml.g6,16 x grande, ml.g6,2 x grande, ml.g6,4 x grande, ml.g6,8 x grande

Microserviço NIM Llama 3.2 NVreRankQA1B

nvidia-llama3-2-nv-rerankqa-1b-v2-nim

Geração de texto

Não

ml.g5.12xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g5.xlarge, ml.g6.12xlarge, ml.g6.16xlarge, ml.g6.24xlarge, ml.g6.2xlarge, ml.g6.2xlarge, ml.g6.48xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.g6.xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.g6e.2xlarge, ml.g6e.48xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.g6e.8xlarge .g6e.xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge

Llama 3.3 Nemotron Super 49B V1

nvidia-nemotron-super-49b-nim

Geração de texto

Não

ml.g5,48xlarge, ml.g6e.12xlarge, ml.g6e.24xlarge, ml.g6e.48xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge, ml.p5e.48xlarge, ml.p5en.48xlarge

Llama 3.3 Nemotron Super 49B V1.5

nvidia-nemotron-super-49b-nim-1-5

Geração de texto

Não

ml.g5,48xlarge, ml.g6e.12xlarge, ml.g6e.24xlarge, ml.g6e.48xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge, ml.p5e.48xlarge, ml.p5en.48xlarge

Llama Spark

arcee-llama-spark

Geração de texto

Não

ml.g5,16 x grande, ml.g5,2 x grande, ml.g5,4 x grande, ml.g5,8 x grande, ml.g6,16 x grande, ml.g6,2 x grande, ml.g6,4 x grande, ml.g6,8 x grande

Llama-3-Varco-Offsetbias-8B

ncsoft-llama-3-varco-offsetbias-8b

Geração de texto

Não

ml.g5.12xlarge

Llama-3.1-8B-Instruct com suporte de transformação de vitrais

protopia-llama-3-1-8b-instruct

Geração de texto

Não

ml.g4dn.12x grande, ml.g5,16x grande, ml.g5,4x grande

Llama-3.2-NV-EmbedQA-1B-v2

nvidia-llama3-2-nv-embedqa-1b-v2-nim

Incorporação de texto

Não

ml.g5.12xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g5.xlarge, ml.g6.12xlarge, ml.g6.16xlarge, ml.g6.24xlarge, ml.g6.2xlarge, ml.g6.2xlarge, ml.g6.48xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.g6.xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.g6e.2xlarge, ml.g6e.48xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.g6e.8xlarge .g6e.xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge

MARS6

cambai-mars6

Texto para áudio

Não

ml.g4dn.2xlarge, ml.g6.2xlarge

Medical LLM – Medium

john-snow-labs-medical-summarization-qa-8b

Resumo de texto

Não

ml.g4dn.12x grande, ml.g5.2x grande

Medical LLM – Small

john-snow-labs-summarization-qa

Resumo de texto

Não

ml.g5.12xlarge

Tradução de textos médicos (EN-ES)

john-snow-labs-medical-translation-en-es

Tradução

Não

ml.g5.2xlarge

Mercúrio

inception-mercury

Geração de texto

Não

ml.p5.48xlarge

Codificador de mercúrio

inception-mercury-coder

Geração de texto

Não

ml.p5.48xlarge

pesquisa msa

nvidia-nim-msa-search-v2-1

Geração de texto

Não

ml.g6e.12xlarge, ml.g6e.24xlarge, ml.g6e.48xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge, ml.p5e.48xlarge, ml.p5en.48xlarge

Nemotron nano 9b v2

nvidia-nemotron-nano-9b-v2

Geração de texto

Não

ml.g5.12xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.g6e.2xlarge, ml.g6e.2xlarge, ml.g6e.2xlarge, ml.g6e.2xlarge, ml.g6e.2xlarge 6e.48xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.g6e.xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge, ml.p5.4xlarge, ml.p5e.48xlarge, ml.p5en.48xlarge

análise de nemotrons

nvidia-nemotron-parse

Geração de texto

Não

ml.g5.12xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g5.xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.ge.24xlarge, ml.ge.6e.24xlarge 2xlarge, ml.g6e.48xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.g6e.xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge, ml.p5.4xlarge, ml.p5e.48xlarge, ml.p5en.48xlarge

NEXUS da Fundamental

fundamental-technologies-nexus

Classificação

Não

ml.g4dn.8x grande, ml.p5en.48x grande

Nomic Embed Text v1.5

nomic-embed-text

Incorporação de texto

Não

ml.g4dn.12xlarge, ml.g4dn.16xlarge, ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g4dn.xlarge, ml.g5.12xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.2xlarge, ml.g5.2xlarge, ml.g5.2xlarge 48 x grande, ml.g5,4 x grande, ml.g5,8 x grande, ml.g5.x grande, ml.p3,16 x grande, ml.p3,2 x grande, ml.p3,8 x grande

Nomic Embed Vision v1.5

nomic-embed-image

Incorporação de texto

Não

ml.g4dn.12xlarge, ml.g4dn.16xlarge, ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g4dn.xlarge, ml.g5.12xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.2xlarge, ml.g5.2xlarge, ml.g5.2xlarge 48 x grande, ml.g5,4 x grande, ml.g5,8 x grande, ml.g5.x grande, ml.p3,16 x grande, ml.p3,2 x grande, ml.p3,8 x grande

NVIDIA Cosmos Reason-1-7B

nvidia-nim-cosmos-reason1-7b

Geração de texto

Não

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.48xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.g6e.2xlarge, ml.g6e.48xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.g6e.xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5en.48xlarge, ml.p5.4xlarge, ml.p5e.48xlarge, ml.p5en.48xlarge

Microserviço NVIDIA Nemotron-4 15B NIM

nvidia-nemotron-4-15b-nim

Geração de texto

Não

ml.g 5,12 x grande, ml.g 5,24 x grande

NVIDIA ParakeetVTDT 0,6 B v2

nvidia-parakeetvtdt-0-6b-v2

Geração de Audio2Text

Não

ml.g6.12xlarge, ml.g6,16xlarge, ml.g6.24xlarge, ml.g6.2xlarge, ml.g6.48xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.g6e.2xlarge, ml.g6e.2xlarge, ml.g6e.2xlarge, ml.g6e.2xlarge, ml.g6e.2xlarge, ml.g6e.2xlarge, ml.g6e.2xlarge, ml.g6e.2xlarge, ml.g6e.2xlarge, ml.g6e.2xlarge, ml.g6e.2xlarge, ml.g6e.2xlarge 6e.48x grande, ml.g6e.4x grande, ml.g6e.8x grande

NVIDIA-Parakeet-1-1b-CTC-EN-US-ASR

nvidia-parakeet-1-1b-ctc-en-us-asr

Geração de Audio2Text

Não

ml.g5,12 x grande, ml.g5,16 x grande, ml.g5,24 x grande, ml.g5,2 x grande, ml.g5,48 x grande, ml.g5,4 x grande, ml.g5,8 x grande, ml.g6,12 x grande, ml.g6,16 x grande, ml.g6,24 x grande, ml.g6,2 x grande, ml.g6,48 x grande, ml.g6.4xlarge, ml.g6.8xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.g6e.2xlarge, ml.g6e.48xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.p4d.24xlarge, ml.p4de.24 x grande

Orbe

orbital-materials-orb

Modelagem científica

Não

ml.g4dn.12xlarge, ml.g4dn.16xlarge, ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g4dn.xlarge, ml.p3.16xlarge, ml.p3.2xlarge, ml.p3.8xlarge, ml.p4d.24xlarge

PLaMo Implantação privada

preferred-networks-plamo-api

Geração de texto

Não

ml.g5,12x grande, ml.g5,24x grande, ml.g5,48x grande, ml.p4d.24x grande

ProteinMPNN-NIM

nvidia-nim-proteinmpnn-v1-0-2

Geração de texto

Não

ml.g6e.12xlarge, ml.g6e.24xlarge, ml.g6e.48xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge, ml.p5e.48xlarge, ml.p5en.48xlarge

rerank-lite-1 Reranker

voyage-rerank-lite-1-reranker

ReRank

Não

ml.g5.16xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g5.xlarge

Solar Mini - Quant

upstage-solar-mini-chat-quant

Geração de texto

Não

ml.g5.2xlarge

Solar Pro - Quant

upstage-solar-pro-quantized

Geração de texto

Não

ml.g5.12xlarge

Solar Pro 2

upstage-solar-pro

Geração de texto

Não

ml.p4d.24x grande, ml.p5,48x grande

Sonic 3 SageMaker

cartesia-sonic-3-sagemaker

Texto para áudio

Não

ml.g6e.xlarge

Stable Diffusion 3.5 Large

stabilityai-stable-diffusion-3-5-large

Texto para imagem

Não

ml.p5.48xlarge

Stable Diffusion XL 1.0

stabilityai-sdxl-1-0

Texto para imagem

Não

ml.g5.2xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge

Difusão estável XL Beta 0.8

stabilityai-sdxl-beta-0-8

Texto para imagem

Não

ml.g5.xlarge

Stockmark-LLM-13b

stockmark-llm-13b

Geração de texto

Não

ml.g5.2xlarge

VARCO LLM KO-1.3B-IST

ncsoft-ko-1-3b-ist

Geração de texto

Não

ml.g4dn.2xlarge, ml.g5.2xlarge, ml.g5.4xlarge

VARCO LLM KO-6.4B-IST

ncsoft-ko-6-4b-ist

Geração de texto

Não

ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g5,12xlarge, ml.g5.4xlarge, ml.g5.8xlarge

VARCO LLM KO/EN-13B-IST

ncsoft-ko-13b-ist

Geração de texto

Não

ml.g4dn.12x grande, ml.g5,12x grande

Modelo de incorporação voyage-2

voyage-2-embedding

Incorporação de texto

Não

ml.g5.16xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g5.xlarge

Modelo de incorporação voyage-3

voyage-3-embedding

Incorporação de texto

Não

ml.g5.16xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g5.xlarge, ml.g6.16xlarge, ml.g6.2xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.g6.xlarge

modelo de incorporação grande voyage-3

voyage-3-large-embedding

Incorporação de texto

Não

ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g5.xlarge, ml.g6.2xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.g6.xlarge

Modelo de incorporação voyage-3.5

voyage-3-5-embedding

Incorporação de texto

Não

ml.g5.16xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g5.xlarge, ml.g6.16xlarge, ml.g6.2xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.g6.xlarge

Modelo de incorporação voyage-3.5-lite

voyage-3-5-lite-embedding

Incorporação de texto

Não

ml.g5.16xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g5.xlarge, ml.g6.16xlarge, ml.g6.2xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.g6.xlarge

Modelo de incorporação voyage-code-2

voyage-code-2-embedding

Incorporação de texto

Não

ml.g5.16xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g5.xlarge, ml.g6.16xlarge, ml.g6.2xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.g6.xlarge

Modelo de incorporação voyage-code-3

voyage-code-3-embedding

Incorporação de texto

Não

ml.g5.16xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g5.xlarge, ml.g6.16xlarge, ml.g6.2xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.g6.xlarge

Modelo de incorporação voyage-large-2

voyage-large-2-embedding

Incorporação de texto

Não

ml.g5.16xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g5.xlarge, ml.g6.16xlarge, ml.g6.2xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.g6.xlarge

Widn Tower Anthill

widn-tower-anthill

Tradução

Não

ml.g5.xlarge

Widn Tower Sugarloaf

widn-tower-sugarloaf

Tradução

Não

ml.g5.12xlarge

Torre do Vento Vesúvio

widn-llama3-tower-vesuvius

Tradução

Não

ml.g5,48x grande, ml.p4d.24x grande, ml.p4de.24x grande

Motor de visão Woven City AI

wovenbytoyota-woven-city-ai-vision-engine

Geração multimodal

Não

ml.g 5,12 x grande, ml.g 5,24 x grande, ml.g 5,48 x grande, ml.g 5,8 x grande

Escritor Palmyra-Fin-70B-32K

writer-palmyra-fin-70b-32k

Geração de texto

Não

ml.p4d.24xlarge

Escritor Palmyra-Med-70B-32K

writer-palmyra-med-70b-32k

Geração de texto

Não

ml.p4d.24xlarge

Escritor Palmyra-X-004

writer-palmyra-x-004

Geração de texto

Não

ml.p5.48xlarge

Built-in Algorithms (135)

SageMaker JumpStart A Amazon fornece modelos pré-treinados e específicos de tarefas para tarefas comuns de visão computacional, como classificação de imagens, detecção de objetos e segmentação de imagens. Esses modelos são baseados em estruturas estabelecidas de aprendizado profundo (PyTorch,TensorFlow,MXNet) e estão prontos para implantar ou ajustar seus próprios dados.

Fornecedor Nome do modelo ID do modelo Tarefa Licença Fine-tunable Tipos de instância de inferência compatíveis

Mxnet

RCNN 101 V1d ResNet mais rápido

mxnet-od-faster-rcnn-fpn-resnet101-v1d-coco

Detecção de objetos

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

RCNN 101 V1d ResNet mais rápido

mxnet-od-faster-rcnn-resnet101-v1d-coco

Detecção de objetos

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

RCNN 5.0 V1b ResNet mais rápido

mxnet-od-faster-rcnn-fpn-resnet50-v1b-coco

Detecção de objetos

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

RCNN 5.0 V1b ResNet mais rápido

mxnet-od-faster-rcnn-resnet50-v1b-coco

Detecção de objetos

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

RCNN 5.0 V1b ResNet mais rápido

mxnet-od-faster-rcnn-resnet50-v1b-voc

Detecção de objetos

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

FCN ResNet 101 ADE20K

mxnet-semseg-fcn-resnet101-ade

Segmentação de imagem

apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

FCN ResNet 101 Pascal VOC

mxnet-semseg-fcn-resnet101-voc

Segmentação de imagem

apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

FCN ResNet 50 ADE20K

mxnet-semseg-fcn-resnet50-ade

Segmentação de imagem

apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

Segmentação de instância

mxnet-is-mask-rcnn-fpn-resnet101-v1d-coco

Segmentação de imagem

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

MÁSCARA RCNN FPN RESNET18 COCO

mxnet-is-mask-rcnn-fpn-resnet18-v1b-coco

Segmentação de imagem

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

MÁSCARA RCNN FPN RESNET50 COCO

mxnet-is-mask-rcnn-fpn-resnet50-v1b-coco

Segmentação de imagem

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

MÁSCARA RCNN RESNET18 COCO

mxnet-is-mask-rcnn-resnet18-v1b-coco

Segmentação de imagem

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

Detecção de objetos

mxnet-od-ssd-512-mobilenet1-0-coco

Detecção de objetos

apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

Segmentação semântica

mxnet-semseg-fcn-resnet101-coco

Segmentação de imagem

apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

SSD 512 5.0 ResNet V1

mxnet-od-ssd-512-resnet50-v1-coco

Detecção de objetos

apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

SSD 1.0 MobileNet

mxnet-od-ssd-512-mobilenet1-0-voc

Detecção de objetos

apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

SSD ResNet 5.0 V1

mxnet-od-ssd-512-resnet50-v1-voc

Detecção de objetos

apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

SSD VG 16 Atrous 300

mxnet-od-ssd-300-vgg16-atrous-voc

Detecção de objetos

apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

SSD VGG 16 Atrous 512

mxnet-od-ssd-512-vgg16-atrous-coco

Detecção de objetos

apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

SSD VG16 Atrous 300

mxnet-od-ssd-300-vgg16-atrous-coco

Detecção de objetos

apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

SSD VG16 Atrous 512

mxnet-od-ssd-512-vgg16-atrous-voc

Detecção de objetos

apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

YOLO VERSÃO 3 53 DarkNet

mxnet-od-yolo3-darknet53-coco

Detecção de objetos

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

YOLO VERSÃO 3 53 DarkNet

mxnet-od-yolo3-darknet53-voc

Detecção de objetos

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

YOLO VERSÃO 3 1.0 MobileNet

mxnet-od-yolo3-mobilenet1-0-coco

Detecção de objetos

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

YOLO VERSÃO 3 1.0 MobileNet

mxnet-od-yolo3-mobilenet1-0-voc

Detecção de objetos

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Pytorch

SqueezeNet 1

pytorch-ic-squeezenet1-1

Classificação de imagens

cláusula bsd-3

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge

Pytorch

AlexNet

pytorch-ic-alexnet

Classificação de imagens

cláusula bsd-3

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge

Pytorch

DenseNet 121

pytorch-ic-densenet121

Classificação de imagens

cláusula bsd-3

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge

Pytorch

DenseNet 169

pytorch-ic-densenet169

Classificação de imagens

cláusula bsd-3

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge

Pytorch

FRCNN MobileNet V3 grande 320 FPN

pytorch-od1-fasterrcnn-mobilenet-v3-large-320-fpn

Detecção de objetos

cláusula bsd-3

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Pytorch

VPN grande FRCNN MobileNet V3

pytorch-od1-fasterrcnn-mobilenet-v3-large-fpn

Detecção de objetos

cláusula bsd-3

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Pytorch

GoogLeNet

pytorch-ic-googlenet

Classificação de imagens

cláusula bsd-3

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge

Pytorch

Classificação de imagens

pytorch-ic-mobilenet-v2

Classificação de imagens

cláusula bsd-3

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge

Pytorch

Detecção de objetos

pytorch-od1-fasterrcnn-resnet50-fpn

Detecção de objetos

cláusula bsd-3

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Pytorch

ResNet 101

pytorch-ic-resnet101

Classificação de imagens

cláusula bsd-3

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge

Pytorch

ResNet 152

pytorch-ic-resnet152

Classificação de imagens

cláusula bsd-3

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge

Pytorch

ResNet 18

pytorch-ic-resnet18

Classificação de imagens

cláusula bsd-3

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge

Pytorch

ResNet 34

pytorch-ic-resnet34

Classificação de imagens

cláusula bsd-3

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge

Pytorch

ResNet 50

pytorch-ic-resnet50

Classificação de imagens

cláusula bsd-3

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge

Pytorch

Resnext 50

pytorch-ic-resnext50-32x4d

Classificação de imagens

cláusula bsd-3

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge

Pytorch

ShuffleNet V2

pytorch-ic-shufflenet-v2-x1-0

Classificação de imagens

cláusula bsd-3

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge

Pytorch

SSD

pytorch-od-nvidia-ssd

Detecção de objetos

cláusula bsd-3

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Pytorch

OVO 1

pytorch-ic-vgg11

Classificação de imagens

cláusula bsd-3

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge

Pytorch

OVOS DE 11 BILHÕES

pytorch-ic-vgg11-bn

Classificação de imagens

cláusula bsd-3

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge

Pytorch

OVOS DE 13 BILHÕES

pytorch-ic-vgg13-bn

Classificação de imagens

cláusula bsd-3

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge

Pytorch

OVO 16

pytorch-ic-vgg16

Classificação de imagens

cláusula bsd-3

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge

Pytorch

OVOS DE 16 BILHÕES

pytorch-ic-vgg16-bn

Classificação de imagens

cláusula bsd-3

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge

Pytorch

OVO 19

pytorch-ic-vgg19

Classificação de imagens

cláusula bsd-3

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge

Pytorch

VGG-13

pytorch-ic-vgg13

Classificação de imagens

cláusula bsd-3

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge

Pytorch

Amplo ResNet 101

pytorch-ic-wide-resnet101-2

Classificação de imagens

cláusula bsd-3

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge

Tensorflow

Base ALBERT

tensorflow-tc-albert-en-base

Classificação de texto

apache-2.0

Sim

ml.c5.18xlarge, ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.9xlarge, ml.g4dn.16xlarge, ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.12xlarge, ml.m5,24 x grande, ml.m5,2 x grande, ml.m5,4 x grande, ml.m5.x grande, ml.p3,16 x grande, ml.p3,2 x grande, ml.p3,8 x grande

Tensorflow

Base BERT cased

tensorflow-tc-bert-en-cased-L-12-H-768-A-12-2

Classificação de texto

apache-2.0

Sim

ml.c5.18xlarge, ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.9xlarge, ml.g4dn.16xlarge, ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.12xlarge, ml.m5,24 x grande, ml.m5,2 x grande, ml.m5,4 x grande, ml.m5.x grande, ml.p3,16 x grande, ml.p3,2 x grande, ml.p3,8 x grande

Tensorflow

Base BERT MEDLINE/PubMed

tensorflow-tc-experts-bert-pubmed-1

Classificação de texto

apache-2.0

Sim

ml.c5.18xlarge, ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.9xlarge, ml.g4dn.16xlarge, ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.12xlarge, ml.m5,24 x grande, ml.m5,2 x grande, ml.m5,4 x grande, ml.m5.x grande, ml.p3,16 x grande, ml.p3,2 x grande, ml.p3,8 x grande

Tensorflow

Estojo multilíngue Base BERT

tensorflow-tc-bert-multi-cased-L-12-H-768-A-12-2

Classificação de texto

apache-2.0

Sim

ml.c5.18xlarge, ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.9xlarge, ml.g4dn.16xlarge, ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.12xlarge, ml.m5,24 x grande, ml.m5,2 x grande, ml.m5,4 x grande, ml.m5.x grande, ml.p3,16 x grande, ml.p3,2 x grande, ml.p3,8 x grande

Tensorflow

BERT grande uncased

tensorflow-tc-bert-en-uncased-L-24-H-1024-A-16-2

Classificação de texto

apache-2.0

Sim

ml.c5.18xlarge, ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.9xlarge, ml.g4dn.16xlarge, ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.12xlarge, ml.m5,24 x grande, ml.m5,2 x grande, ml.m5,4 x grande, ml.m5.x grande, ml.p3,16 x grande, ml.p3,2 x grande, ml.p3,8 x grande

Tensorflow

BERT Small, sem embalagem L-10 H-128

tensorflow-tcembedding-bert-en-uncased-L-10-H-128-A-2-2

Incorporação de texto

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

BERT Small, sem embalagem L-12 H-256

tensorflow-tcembedding-bert-en-uncased-L-12-H-256-A-4

Incorporação de texto

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

BERT Small, sem embalagem L-12 H-768

tensorflow-tcembedding-bert-en-uncased-L-12-H-768-A-12-2

Incorporação de texto

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

BERT Small, sem embalagem L-4 H-768

tensorflow-tcembedding-bert-en-uncased-L-4-H-768-A-12-2

Incorporação de texto

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

BiT-M R101x1

tensorflow-ic-bit-m-r101x1-ilsvrc2012-classification-1

Classificação de imagens

Apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.c6i.large, ml.c6i.xlarge, ml.g4dn.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge, ml.r5.large, ml.r5.xlarge

Tensorflow

BiT-M Vetor de características R101x1

tensorflow-icembedding-bit-m-r101x1-ilsvrc2012-featurevector-1

Classificação de imagens

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

BiT-M R50x1 ImageNet-21k

tensorflow-ic-bit-m-r50x1-imagenet21k-classification-1

Classificação de imagens

Apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.c6i.large, ml.c6i.xlarge, ml.g4dn.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge, ml.r5.large, ml.r5.xlarge

Tensorflow

Cait S 24 224

tensorflow-ic-cait-s24-224

Classificação de imagens

mit

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.c6i.large, ml.c6i.xlarge, ml.g4dn.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge, ml.r5.large, ml.r5.xlarge

Tensorflow

CenterNet ResNet-v1-101

tensorflow-od-centernet-resnet101v1-fpn-512x512-1

Detecção de objetos

apache-2.0

Não

ml.g4dn.xlarge, ml.g5.xlarge, ml.p3.2xlarge

Tensorflow

CenterNet ResNet-v1-50

tensorflow-od-centernet-resnet50v1-fpn-512x512-1

Detecção de objetos

apache-2.0

Não

ml.g4dn.xlarge, ml.g5.xlarge, ml.p3.2xlarge

Tensorflow

Editar Tiny Distilled Patch 16 224

tensorflow-ic-deit-tiny-distilled-patch16-224

Classificação de imagens

mit

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.c6i.large, ml.c6i.xlarge, ml.g4dn.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge, ml.r5.large, ml.r5.xlarge

Tensorflow

EfficientNet B0

tensorflow-ic-efficientnet-b0-classification-1

Classificação de imagens

Apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.c6i.large, ml.c6i.xlarge, ml.g4dn.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge, ml.r5.large, ml.r5.xlarge

Tensorflow

EfficientNet B1

tensorflow-ic-efficientnet-b1-classification-1

Classificação de imagens

Apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.c6i.large, ml.c6i.xlarge, ml.g4dn.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge, ml.r5.large, ml.r5.xlarge

Tensorflow

EfficientNet Vetor de características B1

tensorflow-icembedding-efficientnet-b1-featurevector-1

Classificação de imagens

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

EfficientNet B3

tensorflow-ic-efficientnet-b3-classification-1

Classificação de imagens

Apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.c6i.large, ml.c6i.xlarge, ml.g4dn.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge, ml.r5.large, ml.r5.xlarge

Tensorflow

EfficientNet B7

tensorflow-ic-efficientnet-b7-classification-1

Classificação de imagens

Apache-2.0

Sim

ml.c5.9xlarge, ml.g4dn.8xlarge, ml.p3.8xlarge

Tensorflow

EfficientNet V2 pequeno ImageNet-1k

tensorflow-ic-efficientnet-v2-imagenet1k-s

Classificação de imagens

Apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.c6i.large, ml.c6i.xlarge, ml.g4dn.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge, ml.r5.large, ml.r5.xlarge

Tensorflow

EfficientNet V2 ImageNet-21k Ft1k M

tensorflow-ic-efficientnet-v2-imagenet21k-ft1k-m

Classificação de imagens

Apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.c6i.large, ml.c6i.xlarge, ml.g4dn.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge, ml.r5.large, ml.r5.xlarge

Tensorflow

R-CNN Resnet V2 mais rápido (1024x1024)

tensorflow-od-faster-rcnn-inception-resnet-v2-1024x1024-1

Detecção de objetos

apache-2.0

Não

ml.g4dn.xlarge, ml.g5.xlarge, ml.p3.2xlarge

Tensorflow

Faster R-CNN Resnet-101 V1 640x640

tensorflow-od-faster-rcnn-resnet101-v1-640x640-1

Detecção de objetos

apache-2.0

Não

ml.g4dn.xlarge, ml.g5.xlarge, ml.p3.2xlarge

Tensorflow

Faster R-CNN Resnet-50 V1 1024x1024

tensorflow-od-faster-rcnn-resnet50-v1-1024x1024-1

Detecção de objetos

apache-2.0

Não

ml.g4dn.xlarge, ml.g5.xlarge, ml.p3.2xlarge

Tensorflow

Faster R-CNN Resnet-50 V1 640x640

tensorflow-od-faster-rcnn-resnet50-v1-640x640-1

Detecção de objetos

apache-2.0

Não

ml.g4dn.xlarge, ml.g5.xlarge, ml.p3.2xlarge

Tensorflow

R-CNN Resnet-50 V1 mais rápido 800x1333

tensorflow-od-faster-rcnn-resnet50-v1-800x1333-1

Detecção de objetos

apache-2.0

Não

ml.g4dn.xlarge, ml.g5.xlarge, ml.p3.2xlarge

Tensorflow

BABADO

tensorflow-audioembedding-frill-1

Classificação de áudio

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

Classificação de imagens

tensorflow-ic-swin-base-patch4-window7-224

Classificação de imagens

mit

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.c6i.large, ml.c6i.xlarge, ml.g4dn.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge, ml.r5.large, ml.r5.xlarge

Tensorflow

Incorporação de imagens

tensorflow-icembedding-imagenet-mobilenet-v2-100-224-fv-4

Classificação de imagens

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

Inception V3

tensorflow-ic-imagenet-inception-v3-classification-4

Classificação de imagens

Apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.c6i.large, ml.c6i.xlarge, ml.g4dn.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge, ml.r5.large, ml.r5.xlarge

Tensorflow

Vetor de recursos de pré-visualização do Inception V3

tensorflow-icembedding-tf2-preview-inception-v3-fv-4

Classificação de imagens

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

MobileNet V2

tensorflow-ic-tf2-preview-mobilenet-v2-classification-4

Classificação de imagens

Apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.c6i.large, ml.c6i.xlarge, ml.g4dn.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge, ml.r5.large, ml.r5.xlarge

Tensorflow

MobileNet V2 0,35 128

tensorflow-ic-imagenet-mobilenet-v2-035-128

Classificação de imagens

Apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.c6i.large, ml.c6i.xlarge, ml.g4dn.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge, ml.r5.large, ml.r5.xlarge

Tensorflow

MobileNet V2 0,50 224

tensorflow-icembedding-imagenet-mobilenet-v2-050-224-fv-4

Classificação de imagens

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

MobileNet V2 1,00 224

tensorflow-ic-imagenet-mobilenet-v2-100-224-classification-4

Classificação de imagens

Apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.c6i.large, ml.c6i.xlarge, ml.g4dn.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge, ml.r5.large, ml.r5.xlarge

Tensorflow

MobileNet V2 1.40 224

tensorflow-ic-imagenet-mobilenet-v2-140-224-classification-4

Classificação de imagens

Apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.c6i.large, ml.c6i.xlarge, ml.g4dn.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge, ml.r5.large, ml.r5.xlarge

Tensorflow

MobileNet Vetor de características V2

tensorflow-icembedding-tf2-preview-mobilenet-v2-featurevector-4

Classificação de imagens

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

MobileNet Vetor de características V2

tensorflow-icembedding-tf2-preview-mobilenet-v2-fv-4

Classificação de imagens

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

MobileNet V3 Grande 1.00 224

tensorflow-ic-imagenet-mobilenet-v3-large-100-224

Classificação de imagens

Apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.c6i.large, ml.c6i.xlarge, ml.g4dn.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge, ml.r5.large, ml.r5.xlarge

Tensorflow

MobileNet V3 Pequeno 0,75 224

tensorflow-ic-imagenet-mobilenet-v3-small-075-224

Classificação de imagens

Apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.c6i.large, ml.c6i.xlarge, ml.g4dn.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge, ml.r5.large, ml.r5.xlarge

Tensorflow

MobileNet V3 Pequeno 1.00 224

tensorflow-ic-imagenet-mobilenet-v3-small-100-224

Classificação de imagens

Apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.c6i.large, ml.c6i.xlarge, ml.g4dn.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge, ml.r5.large, ml.r5.xlarge

Tensorflow

Detecção de objetos

tensorflow-od1-ssd-resnet50-v1-fpn-640x640-coco17-tpu-8

Detecção de objetos

apache-2.0

Sim

ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

ResNet 50

tensorflow-ic-resnet-50-classification-1

Classificação de imagens

Apache-2.0

Sim

ml.c5.9xlarge, ml.g4dn.8xlarge, ml.p3.8xlarge

Tensorflow

ResNet Vetor de 50 características

tensorflow-icembedding-resnet-50-featurevector-1

Classificação de imagens

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

ResNet V1 5.0

tensorflow-ic-imagenet-resnet-v1-50-classification-4

Classificação de imagens

Apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.c6i.large, ml.c6i.xlarge, ml.g4dn.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge, ml.r5.large, ml.r5.xlarge

Tensorflow

ResNet Vetor de características V2 152

tensorflow-icembedding-imagenet-resnet-v2-152-featurevector-4

Classificação de imagens

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

ResNet V2 5.0

tensorflow-ic-imagenet-resnet-v2-50-classification-4

Classificação de imagens

Apache-2.0

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.c6i.large, ml.c6i.xlarge, ml.g4dn.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge, ml.r5.large, ml.r5.xlarge

Tensorflow

ResNet Vetor de características V2 50

tensorflow-icembedding-imagenet-resnet-v2-50-featurevector-4

Classificação de imagens

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

SSD Retinanet 640x640 Resnet-101

tensorflow-od-retinanet-resnet101-v1-fpn-640x640-1

Detecção de objetos

apache-2.0

Não

ml.g4dn.xlarge, ml.g5.xlarge, ml.p3.2xlarge

Tensorflow

BERT pequeno L-10 _ H-512 _ A-8

tensorflow-tc-small-bert-bert-en-uncased-L-10-H-512-A-8

Classificação de texto

apache-2.0

Sim

ml.c5.18xlarge, ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.9xlarge, ml.g4dn.16xlarge, ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.12xlarge, ml.m5,24 x grande, ml.m5,2 x grande, ml.m5,4 x grande, ml.m5.x grande, ml.p3,16 x grande, ml.p3,2 x grande, ml.p3,8 x grande

Tensorflow

BERT pequeno L-12 _ H-256 _ A-4

tensorflow-tc-small-bert-bert-en-uncased-L-12-H-256-A-4

Classificação de texto

apache-2.0

Sim

ml.c5.18xlarge, ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.9xlarge, ml.g4dn.16xlarge, ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.12xlarge, ml.m5,24 x grande, ml.m5,2 x grande, ml.m5,4 x grande, ml.m5.x grande, ml.p3,16 x grande, ml.p3,2 x grande, ml.p3,8 x grande

Tensorflow

BERT pequeno L-12 _ H-768 _ A-12

tensorflow-tc-small-bert-bert-en-uncased-L-12-H-768-A-12

Classificação de texto

apache-2.0

Sim

ml.c5.18xlarge, ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.9xlarge, ml.g4dn.16xlarge, ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.12xlarge, ml.m5,24 x grande, ml.m5,2 x grande, ml.m5,4 x grande, ml.m5.x grande, ml.p3,16 x grande, ml.p3,2 x grande, ml.p3,8 x grande

Tensorflow

BERT pequeno L-2 _ H-128 _ A-2

tensorflow-tc-small-bert-bert-en-uncased-L-2-H-128-A-2

Classificação de texto

apache-2.0

Sim

ml.c5.18xlarge, ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.9xlarge, ml.g4dn.16xlarge, ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.12xlarge, ml.m5,24 x grande, ml.m5,2 x grande, ml.m5,4 x grande, ml.m5.x grande, ml.p3,16 x grande, ml.p3,2 x grande, ml.p3,8 x grande

Tensorflow

BERT pequeno L-4 _ H-512 _ A-8

tensorflow-tc-small-bert-bert-en-uncased-L-4-H-512-A-8

Classificação de texto

apache-2.0

Sim

ml.c5.18xlarge, ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.9xlarge, ml.g4dn.16xlarge, ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.12xlarge, ml.m5,24 x grande, ml.m5,2 x grande, ml.m5,4 x grande, ml.m5.x grande, ml.p3,16 x grande, ml.p3,2 x grande, ml.p3,8 x grande

Tensorflow

BERT pequeno L-6 _ H-768 _ A-12

tensorflow-tc-small-bert-bert-en-uncased-L-6-H-768-A-12

Classificação de texto

apache-2.0

Sim

ml.c5.18xlarge, ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.9xlarge, ml.g4dn.16xlarge, ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.12xlarge, ml.m5,24 x grande, ml.m5,2 x grande, ml.m5,4 x grande, ml.m5.x grande, ml.p3,16 x grande, ml.p3,2 x grande, ml.p3,8 x grande

Tensorflow

BERT pequeno L-8 _ H-768 _ A-12

tensorflow-tc-small-bert-bert-en-uncased-L-8-H-768-A-12

Classificação de texto

apache-2.0

Sim

ml.c5.18xlarge, ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.9xlarge, ml.g4dn.16xlarge, ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.12xlarge, ml.m5,24 x grande, ml.m5,2 x grande, ml.m5,4 x grande, ml.m5.x grande, ml.p3,16 x grande, ml.p3,2 x grande, ml.p3,8 x grande

Tensorflow

SSD ResNet 152 V1 FPN 1024x1024 COCO '17

tensorflow-od1-ssd-resnet152-v1-fpn-1024x1024-coco17-tpu-8

Detecção de objetos

apache-2.0

Sim

ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

SSD D0 EfficientDet

tensorflow-od-efficientdet-d0-1

Detecção de objetos

apache-2.0

Não

ml.g4dn.xlarge, ml.g5.xlarge, ml.p3.2xlarge

Tensorflow

SSD Efficientet D0 512x512 COCO '17

tensorflow-od1-ssd-efficientdet-d0-512x512-coco17-tpu-8

Detecção de objetos

apache-2.0

Sim

ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

SSD Efficientet E1 640x640 COCO '17

tensorflow-od1-ssd-efficientdet-d1-640x640-coco17-tpu-8

Detecção de objetos

apache-2.0

Sim

ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

SSD D2 EfficientDet

tensorflow-od-efficientdet-d2-1

Detecção de objetos

apache-2.0

Não

ml.g4dn.xlarge, ml.g5.xlarge, ml.p3.2xlarge

Tensorflow

SSD Efficientet D2 768x768 COPO '17

tensorflow-od1-ssd-efficientdet-d2-768x768-coco17-tpu-8

Detecção de objetos

apache-2.0

Sim

ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

SSD D3 EfficientDet

tensorflow-od-efficientdet-d3-1

Detecção de objetos

apache-2.0

Não

ml.g4dn.xlarge, ml.g5.xlarge, ml.p3.2xlarge

Tensorflow

SSD Efficientet D3 896x896 COPO '17

tensorflow-od1-ssd-efficientdet-d3-896x896-coco17-tpu-32

Detecção de objetos

apache-2.0

Sim

ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

SSD D5 EfficientDet

tensorflow-od-efficientdet-d5-1

Detecção de objetos

apache-2.0

Não

ml.g4dn.xlarge, ml.g5.xlarge, ml.p3.2xlarge

Tensorflow

SSD Mobilenet V1 VPN 640x640 COCO '17

tensorflow-od1-ssd-mobilenet-v1-fpn-640x640-coco17-tpu-8

Detecção de objetos

apache-2.0

Sim

ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

SSD Mobilenet V2

tensorflow-od-ssd-mobilenet-v2-2

Detecção de objetos

apache-2.0

Não

ml.g4dn.xlarge, ml.g5.xlarge, ml.p3.2xlarge

Tensorflow

Unidade de estado sólido Mobilenet V2 640x640

tensorflow-od-ssd-mobilenet-v2-fpnlite-640x640-1

Detecção de objetos

apache-2.0

Não

ml.g4dn.xlarge, ml.g5.xlarge, ml.p3.2xlarge

Tensorflow

Unidade de estado sólido Mobilenet FPN-Lite V2 320x320 COCO '17

tensorflow-od1-ssd-mobilenet-v2-fpnlite-320x320-coco17-tpu-8

Detecção de objetos

apache-2.0

Sim

ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

Unidade de estado sólido Mobilenet FPN-lite V2 640x640 COCO '17

tensorflow-od1-ssd-mobilenet-v2-fpnlite-640x640-coco17-tpu-8

Detecção de objetos

apache-2.0

Sim

ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

SSD ResNet 10.1 V1 FPN 1024x1024 COCO '17

tensorflow-od1-ssd-resnet101-v1-fpn-1024x1024-coco17-tpu-8

Detecção de objetos

apache-2.0

Sim

ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

SSD ResNet 101 V1 VPN 640x640 COCO '17

tensorflow-od1-ssd-resnet101-v1-fpn-640x640-coco17-tpu-8

Detecção de objetos

apache-2.0

Sim

ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

SSD ResNet 152 V1 VPN 640x640 COCO '17

tensorflow-od1-ssd-resnet152-v1-fpn-640x640-coco17-tpu-8

Detecção de objetos

apache-2.0

Sim

ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

SSD ResNet 5.0 V1 VPN 1024x1024 COCO '17

tensorflow-od1-ssd-resnet50-v1-fpn-1024x1024-coco17-tpu-8

Detecção de objetos

apache-2.0

Sim

ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

Base suína 4 12 384

tensorflow-ic-swin-base-patch4-window12-384

Classificação de imagens

mit

Sim

ml.c5.2xlarge, ml.c5.xlarge, ml.c6i.large, ml.c6i.xlarge, ml.g4dn.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge, ml.r5.large, ml.r5.xlarge

Tensorflow

Base Talking Heads

tensorflow-tc-talking-heads-large

Classificação de texto

apache-2.0

Sim

ml.c5.18xlarge, ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.9xlarge, ml.g4dn.16xlarge, ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.12xlarge, ml.m5,24 x grande, ml.m5,2 x grande, ml.m5,4 x grande, ml.m5.x grande, ml.p3,16 x grande, ml.p3,2 x grande, ml.p3,8 x grande

Tensorflow

Classificação de texto

tensorflow-tc-bert-en-uncased-L-12-H-768-A-12-2

Classificação de texto

apache-2.0

Sim

ml.c5.18xlarge, ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.9xlarge, ml.g4dn.16xlarge, ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.12xlarge, ml.m5,24 x grande, ml.m5,2 x grande, ml.m5,4 x grande, ml.m5.x grande, ml.p3,16 x grande, ml.p3,2 x grande, ml.p3,8 x grande

Tensorflow

Incorporação de texto

tensorflow-tcembedding-universal-sentc-encoder-cmlm-en-large-1

Incorporação de texto

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

TRILL destilado

tensorflow-audioembedding-trill-distilled-3

Classificação de áudio

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

Trillsson 1

tensorflow-audioembedding-trillsson1-1

Classificação de áudio

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

Trillsson 2

tensorflow-audioembedding-trillsson2-1

Classificação de áudio

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

Trillsson 3

tensorflow-audioembedding-trillsson3-1

Classificação de áudio

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

Codificador de frases universal (base CMLM)

tensorflow-tcembedding-universal-sentc-encoder-cmlm-en-base-1

Incorporação de texto

apache-2.0

Não

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Classic ML Algorithms (11)

SageMaker JumpStart A Amazon fornece implementações prontas para uso de algoritmos clássicos de aprendizado de máquina para tarefas de dados tabulares, como classificação, regressão e previsão de séries temporais. Esses algoritmos (XGBoost,LightGBM,CatBoost,scikit-learn,AutoGluon) são otimizados para dados estruturados e podem ser treinados do zero em seus próprios conjuntos de dados.

Fornecedor Nome do modelo ID do modelo Tarefa Licença Fine-tunable Tipos de instância de inferência compatíveis

Autóglúon

AutoGluon Classificação tabular

autogluon-classification-ensemble

Classificação tabular

apache-2.0

Sim

ml.c5.18xlarge, ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.9xlarge, ml.g4dn.xlarge, ml.m5.12xlarge, ml.m5.24xlarge, ml.m5.2xlarge, ml.m5.4xlarge, ml.p3.2xlarge

Autóglúon

AutoGluon Regressão tabular

autogluon-regression-ensemble

Regressão tabular

apache-2.0

Sim

ml.c5.18xlarge, ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.9xlarge, ml.g4dn.xlarge, ml.m5.12xlarge, ml.m5.24xlarge, ml.m5.2xlarge, ml.m5.4xlarge, ml.p3.2xlarge

Catboost

CatBoost Classificação

catboost-classification-model

Classificação tabular

apache-2.0

Sim

ml.c5.18xlarge, ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.9xlarge, ml.m4xlarge, ml.m5.12xlarge, ml.m5.24xlarge, ml.m5.2xlarge, ml.m5.4xlarge

Catboost

CatBoost Regressão

catboost-regression-model

Regressão tabular

apache-2.0

Sim

ml.c4.8xlarge, ml.c5.18xlarge, ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.9xlarge, ml.m5.12xlarge, ml.m5.24xlarge, ml.m5.2xlarge, ml.m5.4xlarge

Lightgbm

Classificação LightGBM

lightgbm-classification-model

Classificação tabular

mit

Sim

ml.c5.18xlarge, ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.9xlarge, ml.m4xlarge, ml.m5.12xlarge, ml.m5.24xlarge, ml.m5.2xlarge, ml.m5.4xlarge

Lightgbm

Regressão LightGBM

lightgbm-regression-model

Regressão tabular

mit

Sim

ml.c4.8xlarge, ml.c5.18xlarge, ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.9xlarge, ml.m5.12xlarge, ml.m5.24xlarge, ml.m5.2xlarge, ml.m5.4xlarge

Pytorch

TabTransformer Classificação

pytorch-tabtransformerclassification-model

Classificação tabular

apache-2.0

Sim

ml.c5.18xlarge, ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.9xlarge, ml.g4dn.xlarge, ml.m5.12xlarge, ml.m5.24xlarge, ml.m5.2xlarge, ml.m5.4xlarge, ml.p3.2xlarge

Pytorch

TabTransformer Regressão

pytorch-tabtransformerregression-model

Regressão tabular

apache-2.0

Sim

ml.c5.18xlarge, ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.9xlarge, ml.g4dn.xlarge, ml.m5.12xlarge, ml.m5.24xlarge, ml.m5.2xlarge, ml.m5.4xlarge, ml.p3.2xlarge

Sklearn

Classificação linear

sklearn-classification-linear

Classificação tabular

cláusula bsd-3

Sim

ml.c4.8xlarge, ml.c5.18xlarge, ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.9xlarge, ml.m5.12xlarge, ml.m5.24xlarge, ml.m5.2xlarge, ml.m5.4xlarge, ml.m5.xlarge

Xgboost

Classificação XGBoost

xgboost-classification-model

Classificação tabular

apache-2.0

Sim

ml.c4.8xlarge, ml.c5.18xlarge, ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.9xlarge, ml.m5.12xlarge, ml.m5.24xlarge, ml.m5.2xlarge, ml.m5.4xlarge, ml.m5.xlarge

Xgboost

Regressão XGBoost

xgboost-regression-model

Regressão tabular

apache-2.0

Sim

ml.c4.8xlarge, ml.c5.18xlarge, ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.9xlarge, ml.m5.12xlarge, ml.m5.24xlarge, ml.m5.2xlarge, ml.m5.4xlarge, ml.m5.xlarge

nota

Para obter as informações de licenciamento mais precisas e atualizadas, consulte a página de detalhes do modelo no SageMaker Studio ou a página do Hugging Face modelo.