View a markdown version of this page

Modelli di fondazione disponibili - Amazon SageMaker AI

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

Modelli di fondazione disponibili

Amazon SageMaker JumpStart offre modelli di base proprietari e all'avanguardia, integrati, disponibili al pubblico, da personalizzare e integrare nei flussi di lavoro di intelligenza artificiale generativa.

Le prime due schede elencano i modelli di base. Le ultime due schede elencano gli algoritmi integrati e gli algoritmi classici di apprendimento automatico forniti, che non JumpStart sono modelli di base.

Per elencare tutti i modelli di base disponibili JumpStart :

import boto3 sagemaker_client = boto3.client("sagemaker", region_name="us-west-2") # List all available models in the SageMakerPublicHub all_models = [] next_token = None while True: params = {"HubName": "SageMakerPublicHub", "HubContentType": "Model"} if next_token: params["NextToken"] = next_token response = sagemaker_client.list_hub_contents(**params) all_models.extend(response["HubContentSummaries"]) next_token = response.get("NextToken") if not next_token: break print(f"Total models available: {len(all_models)}") for model in all_models[:5]: print(model["HubContentName"], model["HubContentVersion"])

Per ottenere i tipi di istanza supportati e altri metadati per un modello specifico:

import json import boto3 sagemaker_client = boto3.client("sagemaker", region_name="us-west-2") model_id = "meta-textgeneration-llama-3-3-70b-instruct" response = sagemaker_client.describe_hub_content( HubName="SageMakerPublicHub", HubContentType="Model", HubContentName=model_id ) # Parse the model metadata model_doc = json.loads(response["HubContentDocument"]) print(f"Supported instances: {model_doc['SupportedInferenceInstanceTypes']}") print(f"Default instance: {model_doc['DefaultInferenceInstanceType']}")

Le tabelle seguenti elencano i modelli disponibili con la relativa licenza e i tipi di istanze di inferenza supportati al 29 luglio 2026. Per le informazioni più aggiornate, utilizzate gli esempi di API riportati sopra o consultate l'hub dei modelli in SageMaker Studio.

Una cella di licenza indica «Non applicabile» quando il Model Hub non pubblica alcuna licenza per quel modello. Verifica i termini della licenza con il fornitore del modello prima di utilizzare tale modello. Un valore vuoto o segnaposto nella tabella non conferisce alcun diritto.

Alcuni modelli offrono configurazioni di distribuzione dell'hosting alternative oltre a quelle predefinite. Ogni configurazione ottimizza il modello per un caso d'uso e un obiettivo prestazionale e ciascuna supporta il proprio set di tipi di istanza. Una configurazione spesso supporta un'istanza più piccola o meno costosa rispetto a quella predefinita, quindi controllate le configurazioni prima di concludere che un modello richiede un'istanza di grandi dimensioni.

Il nome di configurazione associa un caso d'uso a un obiettivo prestazionale. Questi sono gli stessi casi d'uso e obiettivi prestazionali offerti da SageMaker Studio nella pagina Performance on the Deploy model to endpoint, quindi un nome qui e una scelta lì descrivono la stessa distribuzione. Il caso d'uso descrive il carico di lavoro:

  • generate(Genera): crea contenuti di lunga durata come articoli, report o codice da un prompt.

  • interact(Interagisci): potenzia conversazioni in tempo reale come chatbot o assistenti virtuali.

  • summarize(Riassumi): condensa documenti, articoli o dati lunghi in riassunti concisi.

  • modify(Modifica): trasforma o modifica i contenuti esistenti, inclusa la riscrittura, la traduzione o la riformattazione.

  • max_context(Max Context): elabora input di grandi dimensioni che richiedono l'intera finestra di contesto del modello.

L'obiettivo prestazionale descrive ciò per cui la configurazione ottimizza:

  • best_price_performance(Equilibrato): un compromesso uniforme tra costo, latenza e velocità effettiva. Ideale per carichi di lavoro generici o quando non sei sicuro di quale sia la metrica più importante.

  • lowest_cost(Ottimizzato in termini di costi): costo di infrastruttura più basso per richiesta. Accetta una latenza più elevata e un throughput inferiore per ridurre al minimo le spese.

  • highest_throughput(Velocità effettiva ottimizzata): numero massimo di token al secondo per carichi di lavoro ad alto volume. Utilizza la decodifica speculativa per aumentare la produttività.

  • lowest_latency(Latenza ottimizzata): Lowest Time to First Token (TTFT). Dà priorità alla velocità rispetto alla produttività e ai costi.

Alcuni modelli chiamano invece un contenitore di distribuzione, ad esempio lmi otgi, oppure lo usano all_purpose per servire senza presupporre un carico di lavoro.

Elenca le configurazioni di un modello, insieme alle relative metriche di riferimento, quindi implementane una con l'SDK Python: SageMaker

from sagemaker.jumpstart.model import JumpStartModel model = JumpStartModel(model_id="meta-textgeneration-llama-3-1-8b-instruct") # Print every configuration with its instance types and benchmark metrics. model.list_deployment_configs() # Select a configuration and one of the instance types it supports. model.set_deployment_config( config_name="generate_lowest_cost", instance_type="ml.g6e.xlarge", ) predictor = model.deploy()

La distribuzione senza chiamata set_deployment_config utilizza la configurazione e il tipo di istanza predefiniti.

Open-Weight Models (436)

Open-weight i modelli di base sono modelli disponibili al pubblico di fornitori come Meta, Google, Mistral AI e altri. Puoi implementare, mettere a punto e personalizzare questi modelli in base al tuo caso d'uso.

Per iniziare con uno di questi modelli, guarda JumpStart utilizzo del modello base o esplora uno dei modelli disponibili. Notebook di esempio In un determinato notebook di esempio, provate a cambiare l'ID del modello per sperimentare modelli diversi all'interno della stessa famiglia di modelli.

Per ulteriori informazioni sugli ID dei modelli e sulle risorse sull'implementazione di modelli di JumpStart base disponibili al pubblico con l' SageMaker PythonSDK, consulta. Usa i modelli di base con SageMaker Python SDK

Provider Nome modello ID modello Operazione Licenza Fine-tunable Tipi di istanze di inferenza supportati

01-Ai

Yi-1.5-34B

huggingface-llm-yi-1-5-34b

Generazione di testo

apache-2.0

No

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.48xlarge, ml.p4d.24xlarge

01 - Aiuto

Yi-1.5-9B

huggingface-llm-yi-1-5-9b

Generazione di testo

apache-2.0

No

ml.g5.12xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge

Ahst

Lite Llama 460M 1T

huggingface-llm-ahxt-litellama-460m-1t

Generazione di testo

mit

No

ml.g5.2xlarge

Ai-Forever

Multilingual GPT

huggingface-llm-ai-forever-mgpt

Generazione di testo

apache-2.0

No

ml.g5.2xlarge

A Singapore

Istruzioni Llama3 8B v2.1 SEA-Lion

huggingface-llm-llama3-8b-sealionv21-instruct

Generazione di testo

lama3

No

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g6.12xlarge, ml.g6.24xlarge, ml.g6.48xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.p4d.24xlarge, ml.p5.48xlarge grande

A Singapore

SEA-LION 3B

huggingface-llm-sealion-3b

Generazione di testo

mit

No

ml.g4dn.2xlarge, ml.g4dn.xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.xlarge, ml.p3.8xlarge

A Singapore

SEA-LION 7B

huggingface-llm-sealion-7b

Generazione di testo

mit

No

ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.48xlarge, ml.p4d.24xlarge

A Singapore

SEA-LION 7B Istruire

huggingface-llm-sealion-7b-instruct

Generazione di testo

mit

No

ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.48xlarge, ml.p4d.24xlarge

Alibaba-Nlp

Alibaba-NLP ottieni- Qwen2-7B-instruct

huggingface-textembedding-gte-qwen2-7b-instruct

Incorporamento del testo

Apache-2.0

No

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g6.12xlarge, ml.g6.24xlarge, ml.g6.24xlarge, ml.g6.2xlarge, ml.g6.48xlarge, ml.g6.4xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.g6.xlarge, ml.p4d.24xlarge

Allenai

Olmo-3-7B-Instruct

huggingface-textgeneration-olmo-3-7b-instruct

Generazione di testo

apache-2.0

No

ml.g6e.24xlarge

Amazon

Chronos 2

pytorch-forecasting-chronos-2

Previsione delle serie temporali

apache-2.0

No

ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.xlarge, ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.xlarge, ml.g5.xlarge, ml.g5.xlarge, ml.g6.2xlarge, ml.g6.xlarge, ml.g6e.2xlarge, ml.g6e.2xlarge max.xlarge, ml.m5.2xlarge, ml.m5.4xlarge, ml.m5.xlarge

Amazon

Falcon Lite

huggingface-llm-amazon-falconlite

Generazione di testo

apache-2.0

No

ml.g5.12x grande, ml.g5.24x grande, ml.g5.48x grande

Amazon

Falcon Lite 2

huggingface-llm-amazon-falconlite2

Generazione di testo

apache-2.0

No

ml.g5.12x grande, ml.g5.24x grande, ml.g5.48x grande

Amazon

Mistral Lite

huggingface-llm-amazon-mistrallite

Generazione di testo

apache-2.0

No

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.p4d.24xlarge

Gluon automatico

Chronos-Bolt (Base)

autogluon-forecasting-chronos-bolt-base

Previsione delle serie temporali

apache-2.0

No

ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.xlarge, ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.xlarge, ml.g5.2xlarge, ml.g5.xlarge, ml.g5.xlarge, ml.m5.2xlarge, ml.m5.4xlarge, ml.m5.4xlarge, ml.m5.4xlarge xlarge, ml.p 3.2xlarge

Autogluon

Chronos-Bolt (Piccolo)

autogluon-forecasting-chronos-bolt-small

Previsione delle serie temporali

apache-2.0

No

ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.xlarge, ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.xlarge, ml.g5.2xlarge, ml.g5.xlarge, ml.g5.xlarge, ml.m5.2xlarge, ml.m5.4xlarge, ml.m5.4xlarge, ml.m5.4xlarge xlarge, ml.p 3.2xlarge

Autogluon

Chronos-T5 (Base)

autogluon-forecasting-chronos-t5-base

Previsione delle serie temporali

apache-2.0

No

ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.xlarge, ml.p3.2xlarge

Autogluon

Chronos-T5 (Grande)

autogluon-forecasting-chronos-t5-large

Previsione delle serie temporali

apache-2.0

No

ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.xlarge, ml.p3.2xlarge

Autogluon

Chronos-T5 (Piccolo)

autogluon-forecasting-chronos-t5-small

Previsione delle serie temporali

apache-2.0

No

ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.xlarge, ml.p3.2xlarge

Baai

BAAI bge-base-en-v1.5

huggingface-textembedding-bge-base-en-v1-5

Incorporamento del testo

ZECCA

No

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g6.12xlarge, ml.g6.24xlarge, ml.g6.24xlarge, ml.g6.2xlarge, ml.g6.48xlarge, ml.g6.4xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.g6.xlarge, ml.p4d.24xlarge

Baai

BGE Base Fine

huggingface-sentencesimilarity-bge-base-en

Somiglianza delle frasi

mit

ml.c6i.xlarge, ml.g4dn.2xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Baai

BGE Base Fine V1.5

huggingface-sentencesimilarity-bge-base-en-v1-5

Somiglianza delle frasi

mit

ml.c6i.xlarge, ml.g4dn.2xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Baai

BGE Large En

huggingface-sentencesimilarity-bge-large-en

Somiglianza delle frasi

mit

ml.c6i.xlarge, ml.g4dn.2xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Baai

BGE Large End V1.5

huggingface-sentencesimilarity-bge-large-en-v1-5

Somiglianza delle frasi

mit

ml.c6i.xlarge, ml.g4dn.2xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Baai

GRANDE M3

huggingface-sentencesimilarity-bge-m3

Somiglianza delle frasi

mit

ml.c6i.xlarge, ml.g4dn.2xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Baai

BGE Small En

huggingface-sentencesimilarity-bge-small-en

Somiglianza delle frasi

mit

ml.c6i.xlarge, ml.g4dn.2xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Baai

BGE Small End V1.5

huggingface-sentencesimilarity-bge-small-en-v1-5

Somiglianza delle frasi

mit

ml.c6i.xlarge, ml.g4dn.2xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Berkeley-Nest

Starling LM 7B alfa

huggingface-llm-berkeley-nest-starling-lm-7b-alpha

Generazione di testo

apache-2.0

No

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge

Bharatgenai

Param2-17B-A2.4B-Thinking

huggingface-llm-param2-17b-a2-4b-thinking

Generazione di testo

Non applicabile

No

ml.g7e.2x grande, ml.g7e.4x grande, ml.g7e.8x grande

Codice grande

StarCoder

huggingface-llm-starcoder

Generazione di testo

codice grande - openrail-m

No

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.48xlarge, ml.p4d.24xlarge

Codice grande

StarCoderBase

huggingface-llm-starcoderbase

Generazione di testo

codice grande - openrail-m

No

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.48xlarge, ml.p4d.24xlarge

Grande scienza

Bloom 1b1

huggingface-textgeneration-bloom-1b1

Generazione di testo

grande scienza - bloom-rail 1.0

No

ml.g5.16x grande, ml.g5.2x grande, ml.g5.4x grande, ml.g5.8x grande

Grande scienza

Bloom 3B

huggingface-textgeneration1-bloom-3b

Generazione di testo

grande scienza - bloom-rail 1.0

ml.g5.16x grande, ml.g5.2x grande, ml.g5.4x grande, ml.g5.8x grande

Grande scienza

Bloom 7B1

huggingface-textgeneration1-bloom-7b1

Generazione di testo

grande scienza - bloom-rail 1.0

ml.g5.16x grande, ml.g5.2x grande, ml.g5.4x grande, ml.g5.8x grande

Grande scienza

Bloomz 1b7

huggingface-textgeneration-bloomz-1b7

Generazione di testo

grande scienza - bloom-rail 1.0

No

ml.g5.16x grande, ml.g5.2x grande, ml.g5.4x grande, ml.g5.8x grande

Grande scienza

BloomZ 7B1 FP16

huggingface-textgeneration1-bloomz-7b1-fp16

Generazione di testo

grande scienza - bloom-rail 1.0

ml.g5.16x grande, ml.g5.2x grande, ml.g5.4x grande, ml.g5.8x grande

Bingsu

Bingsu my korean stable diffusion v1 5

huggingface-txt2img-bingsu-my-korean-stable-diffusion-v1-5

Text-to-Image

creativeml-openrail-m

No

ml.g4dn.2xlarge, ml.g4dn.xlarge, ml.p3.2xlarge

Black-Forest-Labs

Black Forest Labs [veloce] FLUX.1

huggingface-txt2img-black-forest-labs-flux-1-schnell

Text-to-Image

apache-2.0

No

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.48xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

Black-Forest-Labs

FLUX.2-Klein-Base-4B

huggingface-img2img-flux-2-klein-base-4b

Image-Text-to-Image

Apache-2.0

No

ml.g6.12xlarge, ml.g6.16xlarge, ml.g6.24xlarge, ml.g6.2xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.g6e.2xlarge, ml.g6e.2xlarge, ml.g66xlarge e.4xlarge, ml.g6e.8xlarge, ml.g6e.xlarge, ml.g7e.12xlarge, ml.g7e.24xlarge, ml.g7e.2xlarge, ml.g7e.48xlarge, ml.g7e.4xlarge, ml.g7e.8xlarge

Calcoli cognitivi

Dolphin 2.2.1 Mistral 7B

huggingface-llm-dolphin-2-2-1-mistral-7b

Generazione di testo

apache-2.0

No

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge

Calcoli cognitivi

Dolphin 2.5 Mixtral 8 7B

huggingface-llm-dolphin-2-5-mixtral-8x7b

Generazione di testo

apache-2.0

No

ml.g5.48xlarge

Calcoli cognitivi

Dolphin 2.7 Mixtral 8 7B

huggingface-llm-dolphin-2-7-mixtral-8x7b

Generazione di testo

apache-2.0

No

ml.g5.48xlarge

Calcoli cognitivi

Dolphin 2.9 Llama 3 8b

huggingface-llm-cognitive-dolphin-29-llama3-8b

Generazione di testo

altro

No

ml.g 5.16 x grande, ml.g 5.2 x grande, ml.g 5.4 x grande, ml.g 5.8 x grande

Cohereforai

Aya 101

huggingface-llm-aya-101

Generazione di testo

apache-2.0

No

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.48xlarge, ml.p4d.24xlarge

Cross-Encoder

Cross Encoder Nli Deberta Base

huggingface-zstc-cross-encoder-nli-deberta-base

Zero-Shot Classificazione

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Cross-Encoder

Cross Encoder Nli Distilroberta Base

huggingface-zstc-cross-encoder-nli-distilroberta-base

Zero-Shot Classificazione

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Cross-Encoder

Encoder trasversale Nli MiniLM2 L6 H768

huggingface-zstc-cross-encoder-nli-minilm2-l6-h768

Zero-Shot Classificazione

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Cross-Encoder

Cross Encoder Nli Roberta Base

huggingface-zstc-cross-encoder-nli-roberta-base

Zero-Shot Classificazione

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Agente informatico

CyberAgentLM2-7B-Chat (CALM2-7B-Chat)

huggingface-llm-calm2-7b-chat-bf16

Generazione di testo

apache-2.0

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.xlarge

Databricks

DBRX Base

huggingface-llm-dbrx-base

Generazione di testo

modello databricks-open

No

ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge

Databricks

DBRX Instruct

huggingface-llm-dbrx-instruct

Generazione di testo

modello databricks-open

No

ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge

Databricks

Dolly V2 12b BF16

huggingface-textgeneration-dolly-v2-12b-bf16

Generazione di testo

apache-2.0

No

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.48xlarge, ml.p4d.24xlarge

Databricks

Dolly V2 3b BF16

huggingface-textgeneration-dolly-v2-3b-bf16

Generazione di testo

apache-2.0

No

ml.g5.16xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge

Deepseek-Ai

DeepSeek-OCR

deepseek-vlm-deepseek-ocr

Image-Text-to-Text

mit

No

ml.g4dn.16xlarge, ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g4dn.xlarge, ml.g5.16xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g5.xlarge, ml.g6.16xlarge, ml.g6.2xlarge, ml.g6.4xlarge, ml.g6.xlarge, ml.g6.xlarge, ml.g6e.16xlarge, ml.g6e.2xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.g6e.xlarge, ml.p3.2xlarge

Deepseek-Ai

DeepSeek-R1

deepseek-llm-r1

Generazione di testo

mit

No

ml.p5e.48xlarge, ml.p5en.48xlarge

Deepseek-Ai

DeepSeek-R1-0528

deepseek-llm-r1-0528

Generazione di testo

mit

No

ml.p5e.48x grande, ml.p5en.48x grande

Deepseek-Ai

DeepSeek-R1-Distill-Llama-70B

deepseek-llm-r1-distill-llama-70b

Generazione di testo

mit

Predefinito: ml.g6.48xlarge, ml.g6e.12xlarge, ml.g6e.24xlarge, ml.g6e.48xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • djl(contenitore di servizio della libreria Deep Java): ml.g5.48xlarge, ml.g6.48xlarge, ml.p4d.24xlarge

  • generate_highest_throughput(Generazione, ottimizzazione del throughput), (Interact, Throughput ottimizzato): ml.g6.48xlarge, ml.g6e.24xlarge, ml.g6e.48xlarge, ml.g6e.48xlarge interact_highest_throughput

  • generate_lowest_cost(Genera, ottimizzato per i costi), generate_lowest_latency (Genera, ottimizzato per la latenza), interact_best_price_performance (Interact, Balanced), interact_lowest_cost (Interact, ottimizzato per i costi), interact_lowest_latency (Interact, Latenza ottimizzata): ml.g6.48xlarge, ml.g6e.12xlarge, ml.g6e.24xlarge

  • modify_best_price_performance(Modifica, bilanciamento), modify_highest_throughput (modifica, velocità effettiva ottimizzata), modify_lowest_cost (modifica, ottimizzazione dei costi), modify_lowest_latency (modifica ottimizzata per la latenza), summarize_best_price_performance (riepilogo, bilanciamento), summarize_highest_throughput (riepilogo, ottimizzazione del throughput), summarize_lowest_cost (riepilogo, ottimizzazione dei costi), summarize_lowest_latency (riepilogo, latenza ottimizzata): ml.g6e.48xlarge

Deepseek-Ai

DeepSeek-R1-Distill-Llama-8B

deepseek-llm-r1-distill-llama-8b

Generazione di testo

mit

Predefinito: ml.g6.12xlarge, ml.g6e.12xlarge, ml.g7e.12xlarge, ml.g7e.2xlarge, ml.g7e.4xlarge, ml.g7e.8xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • djl(contenitore di servizio della Deep Java Library): ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.48xlarge, ml.g6.12xlarge, ml.g6.24xlarge, ml.g6.48xlarge

  • generate_best_price_performance(Genera, Bilanciatogenerate_lowest_cost), (Genera, Ottimizzato in termini di costi): ml.g6.xlarge, ml.g6e.xlarge, ml.g7e.2xlarge

  • generate_highest_throughput(Generazione, ottimizzazione del throughput), (Interact, Throughput ottimizzato), (Contesto massimo, Throughput ottimizzato): ml.g6.48xlarge, ml.g6e.48xlarge, interact_highest_throughput ml.g7e.12xlarge max_context_highest_throughput

  • generate_lowest_latency(Generazione, latenza ottimizzata): ml.g6.12xlarge, ml.g6e.4xlarge, ml.g7e.2xlarge

  • interact_best_price_performance(Interact, Balanced), (Modify, Balanced), (Modify, Ottimizzato in termini di costi): ml.g6.12xlarge, ml.g6e.xlarge, ml.g7e.2xlarge modify_best_price_performance modify_lowest_cost

  • interact_lowest_cost(Interact, ottimizzazione dei costi): ml.g6.48xlarge, ml.g6e.xlarge, ml.g7e.2xlarge

  • interact_lowest_latency(Interact, latenza ottimizzata), (Modifica, Latenza ottimizzata): ml.g6.12xlarge, ml.g6e.2xlarge, ml.g7e.12xlarge modify_lowest_latency

  • max_context_lowest_cost(Contesto massimo, ottimizzato per i costi), (Summary, Balanced), (Summary, Costo ottimizzato): ml.g6.12xlarge, ml.g6e.12xlarge, ml.g7e.2xlarge summarize_best_price_performance summarize_lowest_cost

  • max_context_lowest_latency(Contesto massimo, latenza ottimizzata): ml.g6.24xlarge, ml.g6e.24xlarge, ml.g7e.2xlarge

  • modify_highest_throughput(Modifica, velocità di trasmissione ottimizzata): ml.g6.48xlarge, ml.g6e.24xlarge, ml.g7e.12xlarge

  • summarize_highest_throughput(Riepilogo, velocità effettiva ottimizzata), (Riepilogo, latenza ottimizzata): summarize_lowest_latency ml.g6.12xlarge, ml.g6e.24xlarge, ml.g7e.12xlarge

Deepseek-Ai

DeepSeek-R1-Distill-Qwen-1.5B

deepseek-llm-r1-distill-qwen-1-5b

Generazione di testo

mit

Predefinito: ml.g6.12xlarge, ml.g6e.2xlarge, ml.g6e.4xlarge, ml.g6e.xlarge, ml.g7e.2xlarge, ml.g7e.4xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • generate_best_price_performance(Generate, Balanced), generate_lowest_cost (Generate, Cost optimized), (Interact, Balanced), interact_best_price_performance (Interact, Cost optimized), interact_lowest_cost (Summary, Balanced), summarize_best_price_performance (Summary, Costo ottimizzato): ml.g6.2xlarge, summarize_lowest_cost ml.g6e.xlarge, ml.g7e.2xlarge

  • generate_highest_throughput(Genera, throughput ottimizzato), interact_highest_throughput (Interact, Throughput ottimizzato): ml.g6.24xlarge, ml.g6e.12xlarge, ml.g7e.4xlarge

  • generate_lowest_latency(Generazione, latenza ottimizzata): ml.g6.12xlarge, ml.g6e.16xlarge, ml.g7e.2xlarge

  • interact_lowest_latency(Interact, latenza ottimizzata), (Contesto massimo, Latenza ottimizzata): max_context_lowest_latency ml.g6.24xlarge, ml.g6e.16xlarge, ml.g7e.4xlarge

  • max_context_highest_throughput(Contesto massimo, velocità effettiva ottimizzata): ml.g6.24xlarge, ml.g6e.12xlarge, ml.g7e.2xlarge

  • max_context_lowest_cost(Contesto massimo, ottimizzazione dei costi): ml.g6.12xlarge, ml.g6e.xlarge, ml.g7e.2xlarge

  • modify_best_price_performance(Modifica, bilanciatomodify_lowest_cost), (Modifica, ottimizzazione dei costi): ml.g6.4xlarge, ml.g6e.xlarge, ml.g7e.2xlarge

  • modify_highest_throughput(Modifica, velocità di trasmissione ottimizzata): ml.g6.24xlarge, ml.g6e.24xlarge, ml.g7e.4xlarge

  • modify_lowest_latency(Modifica, latenza ottimizzata): ml.g6.24xlarge, ml.g6e.4xlarge, ml.g7e.4xlarge

  • summarize_highest_throughput(Riepilogo, velocità di trasmissione ottimizzata): ml.g6.24xlarge, ml.g6e.2xlarge, ml.g7e.2xlarge

  • summarize_lowest_latency(Riepilogo, latenza ottimizzata): ml.g6.24xlarge, ml.g6e.16xlarge, ml.g7e.2xlarge

Deepseek-Ai

DeepSeek-R1-Distill-Qwen-14B

deepseek-llm-r1-distill-qwen-14b

Generazione di testo

mit

Predefinito: ml.g6.48xlarge, ml.g6e.12xlarge, ml.g6e.24xlarge, ml.g6e.48xlarge, ml.p5en.48xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • generate_best_price_performance(Genera, Bilanciato), generate_lowest_cost (Genera, Ottimizzato per i costi), (Interact, Balanced), interact_best_price_performance (Interact, Ottimizzato per i costi): interact_lowest_cost ml.g6.12xlarge, ml.g6e.xlarge, ml.g7e.2xlarge

  • generate_highest_throughput(Generazione, ottimizzazione del throughput), (Interact, Throughput ottimizzato): ml.g6.48xlarge, ml.g6e.48xlarge, ml.g7e.4xlarge interact_highest_throughput

  • generate_lowest_latency(Generazione, latenza ottimizzata): ml.g6.12xlarge, ml.g6e.4xlarge, ml.g7e.4xlarge

  • interact_lowest_latency(Interact, latenza ottimizzata): ml.g6.12xlarge, ml.g6e.2xlarge, ml.g7e.4xlarge

  • max_context_highest_throughput(Contesto massimo, velocità effettiva ottimizzata), max_context_lowest_cost (contesto massimo, ottimizzazione dei costi), max_context_lowest_latency (contesto massimo, latenza ottimizzata), (riepilogo, bilanciato), summarize_best_price_performance (riepilogo, summarize_highest_throughput velocità effettiva ottimizzata): ml.g6.48xlarge, ml.g6e.12xlarge, ml.p5en.48xlarge

  • modify_best_price_performance(Modifica, bilanciato), modify_lowest_cost (Modifica, ottimizzazione dei costi): ml.g6.12xlarge, ml.g6e.12xlarge, ml.g7e.2xlarge

  • modify_highest_throughput(Modifica, velocità di trasmissione ottimizzata): ml.g6.48xlarge, ml.g6e.24xlarge, ml.g7e.2xlarge

  • modify_lowest_latency(Modifica, latenza ottimizzata): ml.g6e.24xlarge, ml.g7e.2xlarge, ml.p5en.48xlarge

  • summarize_lowest_cost(Riepilogo, ottimizzazione dei costi): ml.g6.48xlarge, ml.g6e.12xlarge, ml.g6e.24xlarge

  • summarize_lowest_latency(Riassumi, latenza ottimizzata): ml.g6.48xlarge, ml.g6e.12xlarge, ml.g6e.48xlarge

Deepseek-Ai

DeepSeek-R1-Distill-Qwen-32B

deepseek-llm-r1-distill-qwen-32b

Generazione di testo

mit

Predefinito: ml.g6e.48xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • generate_best_price_performance(Genera, Bilanciato), generate_lowest_cost (Genera, Ottimizzato per i costi), (Interact, Balanced), interact_best_price_performance (Interact, Ottimizzato per i costi): interact_lowest_cost ml.g6.12xlarge, ml.g6e.12xlarge, ml.g7e.2xlarge

  • generate_highest_throughput(Generazione, ottimizzazione del interact_highest_throughput throughput), (Interact, Throughput ottimizzato): ml.g6.48xlarge, ml.g6e.48xlarge, ml.g7e.4xlarge

  • generate_lowest_latency(Generazione, latenza ottimizzata): ml.g6.24xlarge, ml.g6e.12xlarge, ml.g7e.4xlarge

  • interact_lowest_latency(Interact, latenza ottimizzata): ml.g6.12xlarge, ml.g6e.24xlarge, ml.g7e.4xlarge

  • modify_best_price_performance(Modifica, bilanciato), (Modifica, ottimizzazione dei costi), (Modifica, ottimizzato per la latenza): ml.g6.48xlarge, ml.g6e.12xlarge, ml.g6e.24xlarge modify_lowest_cost modify_lowest_latency

  • modify_highest_throughput(Modifica, velocità di trasmissione ottimizzata): ml.g6.48xlarge, ml.g6e.24xlarge, ml.g6e.48xlarge

Deepseek-Ai

DeepSeek-R1-Distill-Qwen-7B

deepseek-llm-r1-distill-qwen-7b

Generazione di testo

mit

Predefinito: ml.g6.12xlarge, ml.g6.24xlarge, ml.g6e.12xlarge, ml.g6e.24xlarge, ml.g7e.2xlarge, ml.g7e.4xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • generate_best_price_performance(Genera, Bilanciato), generate_lowest_cost (Genera, Ottimizzato per i costi), (Interact, Balanced), interact_best_price_performance (Interact, Ottimizzato per i costi): interact_lowest_cost ml.g6.4xlarge, ml.g6e.xlarge, ml.g7e.2xlarge

  • generate_highest_throughput(Genera, produttività ottimizzata): ml.g6.24xlarge, ml.g6e.24xlarge, ml.g7e.4xlarge

  • generate_lowest_latency(Generazione, latenza ottimizzata): ml.g6.24xlarge, ml.g6e.xlarge, ml.g7e.2xlarge

  • interact_highest_throughput(Interact, ottimizzato per il throughput), (Interact, ottimizzato per la latenza), (Max Context, Latenza ottimizzata), interact_lowest_latency (Modify, Throughput ottimizzato): ml.g6.24xlarge, ml.g6e.12xlarge, ml.g7e.2xlarge max_context_lowest_latency modify_highest_throughput

  • max_context_highest_throughput(Contesto massimo, velocità effettiva ottimizzata): ml.g6.24xlarge, ml.g6e.24xlarge, ml.g7e.2xlarge

  • max_context_lowest_cost(Contesto massimo, ottimizzazione dei costi), (Summary, Balanced), (Summary, Costo ottimizzato): ml.g6.12xlarge, ml.g6e.12xlarge, ml.g7e.2xlarge summarize_best_price_performance summarize_lowest_cost

  • modify_best_price_performance(Modifica, bilanciato), (Modifica, ottimizzazione dei costi), (Modifica, ottimizzato per la latenza): ml.g6.12xlarge, ml.g6e.xlarge, ml.g7e.2xlarge modify_lowest_cost modify_lowest_latency

  • summarize_highest_throughput(Riepilogo, throughput ottimizzato): ml.g6.24xlarge, ml.g6e.12xlarge, ml.g7e.4xlarge

  • summarize_lowest_latency(Riepilogo, latenza ottimizzata): ml.g6.12xlarge, ml.g6e.24xlarge, ml.g7e.4xlarge

Deepseek-Ai

DeepSeek-V3.1

deepseek-llm-deepseek-v3-1

Generazione di testo

mit

No

ml.p5e.48xlarge, ml.p5en.48xlarge

Deepseek-Ai

DeepSeek-V3.2

deepseek-llm-deepseek-v3-2

Generazione di testo

mit

No

ml.p5en.48xlarge

Distillbert

Distilbert Base Cased

huggingface-eqa-distilbert-base-cased

Risposta alle domande

apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Distillbert

Distilbert Base Cased

huggingface-spc-distilbert-base-cased

Fill-Mask

apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Distillbert

Distilbert Base Cased

huggingface-tc-distilbert-base-cased

Classificazione del testo

apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Distillbert

Custodia multilingue Distilbert Base

huggingface-eqa-distilbert-base-multilingual-cased

Risposta alle domande

apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Distillbert

Custodia multilingue Distilbert Base

huggingface-spc-distilbert-base-multilingual-cased

Fill-Mask

apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Distillbert

Custodia multilingue Distilbert Base

huggingface-tc-distilbert-base-multilingual-cased

Classificazione del testo

apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Distillbert

DistilGPT 2

huggingface-textgeneration-distilgpt2

Generazione di testo

apache-2.0

No

ml.g5.16xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge

Distillbert

DistilRoBERTa Base

huggingface-eqa-distilroberta-base

Risposta alle domande

apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Distillbert

DistilRoBERTa Base

huggingface-tc-distilroberta-base

Classificazione del testo

apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Distillbert

Risposta alle domande

huggingface-eqa-distilbert-base-uncased

Risposta alle domande

apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Distillbert

Classificazione delle coppie di frasi

huggingface-spc-distilbert-base-uncased

Fill-Mask

apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Distillbert

Classificazione del testo

huggingface-tc-distilbert-base-uncased

Classificazione del testo

apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Elastic

Distilbert Base non rivestita

huggingface-ner-distilbert-base-uncased-finetuned-conll03-eng

Classificazione dei token

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Elastic

Riconoscimento delle entità denominate

huggingface-ner-distilbert-base-cased-finetuned-conll03-eng

Classificazione dei token

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Elastic

Riconoscimento delle entità denominate

huggingface-ner-distilbert-base-cased-finetuned-conll03-english

Classificazione dei token

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Eleuteria

GPT-J 6B

huggingface-textgeneration1-gpt-j-6b

Generazione di testo

apache-2.0

ml.g5.12xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge

Eleuteria

GPT-Neo 125 M

huggingface-textgeneration1-gpt-neo-125m

Generazione di testo

mit

ml.g5.16x grande, ml.g5.2x grande, ml.g5.4x grande, ml.g5.8x grande

Eleuteria

gpt-neox-20b

huggingface-textgeneration2-gpt-neox-20b-fp16

Generazione di testo

Apache-2.0

No

ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.48xlarge, ml.g6.12xlarge, ml.g6.24xlarge, ml.g6.48xlarge, ml.g6e.12xlarge, ml.g6e.24xlarge, ml.p4d.24xlarge, ml.p4d.24xlarge

Eleuteria

Pythia 160m deduplicato

huggingface-llm-eleutherai-pythia-160m-deduped

Generazione di testo

apache-2.0

No

ml.g5.12x grande, ml.g5.24x grande, ml.g5.2x grande

Eleuteria

Pythia 7m deduplicato

huggingface-llm-eleutherai-pythia-70m-deduped

Generazione di testo

apache-2.0

No

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge

Elyza

ELYZA-japanese-Llama-2-13b-chat

huggingface-llm-elyza-japanese-llama-2-13b-chat

Generazione di testo

lama 2

ml.g5.12x grande, ml.g5.24x grande, ml.g5.48x grande, ml.p4d.24x grande

Elyza

ELYZA-japanese-Llama-2-13b-fast-chat

huggingface-llm-elyza-japanese-llama-2-13b-fast-chat

Generazione di testo

lama 2

ml.g5.12x grande, ml.g5.24x grande, ml.g5.48x grande, ml.p4d.24x grande

Elyza

ELYZA-japanese-Llama-2-7b-chat

huggingface-llm-elyza-japanese-llama-2-7b-chat-bf16

Generazione di testo

lama 2

ml.g5.12x grande, ml.g5.24x grande, ml.g5.2x grande, ml.g5.48x grande, ml.g5.4x grande, ml.g5.xlarge

Elyza

ELYZA-japanese-Llama-2-7b-fast-chat

huggingface-llm-elyza-japanese-llama-2-7b-fast-chat-bf16

Generazione di testo

lama 2

ml.g5.12x grande, ml.g5.24x grande, ml.g5.2x grande, ml.g5.48x grande, ml.g5.4x grande, ml.g5.xlarge

Emrecan

Emrecan Bert Base Turca Cased Allnli Tr

huggingface-zstc-emrecan-bert-base-turkish-cased-allnli-tr

Zero-Shot Classificazione

mit

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Facebook

Zero-Shot Classificazione del testo

huggingface-zstc-facebook-bart-large-mnli

Zero-Shot Classificazione

mit

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Facebook ai

Base Roberta

huggingface-eqa-roberta-base

Risposta alle domande

mit

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Facebook ai

Base Roberta

huggingface-spc-roberta-base

Fill-Mask

mit

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Facebook ai

Base Roberta

huggingface-tc-roberta-base

Classificazione del testo

mit

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Facebook ai

Roberta A Large

huggingface-eqa-roberta-large

Risposta alle domande

mit

ml.c5.2x large, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Facebook ai

Roberta A Large

huggingface-spc-roberta-large

Fill-Mask

mit

ml.c5.2x large, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Facebook ai

Roberta A Large

huggingface-tc-roberta-large

Classificazione del testo

mit

ml.c5.2x large, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Facebook ai

XLM CLM English-German

huggingface-spc-xlm-clm-ende-1024

Fill-Mask

mit

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Facebook ai

XLM CLM English-German

huggingface-tc-xlm-clm-ende-1024

Classificazione del testo

mit

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.m5.xlarge, ml.p3.2xlarge

Facebook ai

XLM MLM 15 Lingue XNLI

huggingface-spc-xlm-mlm-xnli15-1024

Fill-Mask

cc-by-nc-4.0

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Facebook ai

XLM MLM English-German

huggingface-spc-xlm-mlm-ende-1024

Fill-Mask

cc-by-nc-4.0

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Facebook ai

XLM MLM English-German

huggingface-tc-xlm-mlm-ende-1024

Classificazione del testo

cc-by-nc-4.0

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Facebook ai

XLM MLM English-Romanian

huggingface-spc-xlm-mlm-enro-1024

Fill-Mask

cc-by-nc-4.0

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Facebook ai

XLM MLM English-Romanian

huggingface-tc-xlm-mlm-enro-1024

Classificazione del testo

cc-by-nc-4.0

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Facebook ai

XLM MLM TLM 15 lingue XNLI

huggingface-spc-xlm-mlm-tlm-xnli15-1024

Fill-Mask

cc-by-nc-4.0

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Facebook ai

XLM MLM TLM 15 lingue XNLI

huggingface-tc-xlm-mlm-tlm-xnli15-1024

Classificazione del testo

cc-by-nc-4.0

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Fittiverso

Modello di diffusione stabile Fictiverse BalloonArt

huggingface-txt2img-fictiverse-stable-diffusion-balloonart

Text-to-Image

creativeml-openrail-m

No

ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Fittiverso

Modello microscopico a diffusione stabile Fictiverse

huggingface-txt2img-fictiverse-stable-diffusion-micro-model

Text-to-Image

rotaia aperta

No

ml.g4dn.2xlarge, ml.g4dn.xlarge, ml.p3.2xlarge

Fittiverso

Modello di diffusione stabile Fictiverse PaperCut

huggingface-txt2img-fictiverse-stable-diffusion-papercut-model

Text-to-Image

creativeml-openrail-m

No

ml.g4dn.2xlarge, ml.g4dn.xlarge, ml.p3.2xlarge

Fittiverso

Modello di diffusione stabile Fictiverse VoxelArt

huggingface-txt2img-fictiverse-stable-diffusion-voxelart-model

Text-to-Image

creativeml-openrail-m

No

ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Google

Bigbird Pegasus Large Arxiv

huggingface-summarization-bigbird-pegasus-large-arxiv

Sintesi testuale

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Google

Bigbird Pegasus Large Pubmed

huggingface-summarization-bigbird-pegasus-large-pubmed

Sintesi testuale

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Google

Flan-T5 Base

huggingface-text2text-flan-t5-base

Generazione Text2Text

apache-2.0

ml.g5.16xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge

Google

Flan-T5 Grande

huggingface-text2text-flan-t5-large

Generazione Text2Text

apache-2.0

ml.g5.16xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge

Google

Flan-T5 Piccolo

huggingface-text2text-flan-t5-small

Generazione Text2Text

apache-2.0

ml.g5.16xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge

Google

Flan-T5 XL

huggingface-text2text-flan-t5-xl

Generazione Text2Text

apache-2.0

ml.g5.16xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge

Google

Flan-T5 XXL

huggingface-text2text-flan-t5-xxl

Generazione Text2Text

apache-2.0

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.48xlarge, ml.p4d.24xlarge

Google

Gemma 2 27B

huggingface-llm-gemma-2-27b

Generazione di testo

gemma

No

ml.g 5.48x grande, ml.p4d.24x grande

Google

Gemma 2 27B Instruct

huggingface-llm-gemma-2-27b-instruct

Generazione di testo

gemma

No

ml.g 5.48x grande, ml.p4d.24x grande

Google

Gemma 2 2B

huggingface-llm-gemma-2-2b

Generazione di testo

gemma

No

ml.g5.12xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.xlarge, ml.g5.xlarge, ml.p4de.24xlarge, ml.p5.48xlarge

Google

Gemma 2 2B Instruct

huggingface-llm-gemma-2-2b-instruct

Generazione di testo

gemma

No

ml.g5.12xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.xlarge, ml.g5.xlarge, ml.p4de.24xlarge, ml.p5.48xlarge

Google

Gemma 2 9B

huggingface-llm-gemma-2-9b

Generazione di testo

gemma

No

ml.g5.12x grande, ml.g5.24x grande, ml.g5.48x grande, ml.p4d.24x grande

Google

Gemma 2 9B Instruct

huggingface-llm-gemma-2-9b-instruct

Generazione di testo

gemma

No

ml.g5.12x grande, ml.g5.24x grande, ml.g5.48x grande, ml.p4d.24x grande

Google

Gemma 3 1B Istruzioni

huggingface-llm-gemma-3-1b-instruct

Generazione di testo

gemma

No

ml.g 5.16 x grande, ml.g 5.2 x grande, ml.g 5.4 x grande, ml.g 5.8 x grande

Google

Gemma 3 27B Istruzioni

huggingface-vlm-gemma-3-27b-instruct

Image-Text-to-Text

gemma

No

ml.g5.48x grande, ml.g6.48x grande, ml.p4d.24x grande, ml.p5.48x grande

Google

Gemma 3 4B Istruzioni

huggingface-vlm-gemma-3-4b-instruct

Image-Text-to-Text

gemma

No

ml.g 5.16 x grande, ml.g 5.2 x grande, ml.g 5.4 x grande, ml.g 5.8 x grande

Google

gemma-2b

huggingface-llm-gemma-2b

Generazione di testo

gemma

Predefinito: ml.g4dn.xlarge, ml.g5.xlarge, ml.g6.xlarge, ml.g6e.xlarge, ml.p3.2xlarge, ml.p4d.24xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • generate_best_price_performance(Genera, Bilanciato): ml.g4dn.xlarge, ml.g5.2xlarge, ml.g6e.2xlarge

  • generate_highest_throughput(Generazione, velocità effettiva ottimizzata), (contesto massimo, velocità effettiva ottimizzata): ml.g6e.12xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge max_context_highest_throughput

  • generate_lowest_cost(Generazione, ottimizzazione dei costi), (Interazione, ottimizzazione dei costi), (Contesto massimo, ottimizzazione dei costi): ml.g4dn.xlarge, ml.g5.xlarge, ml.g6.xlarge interact_lowest_cost max_context_lowest_cost

  • generate_lowest_latency(Generazione, latenza ottimizzata): ml.g6.12xlarge, ml.g6e.12xlarge, ml.p5en.48xlarge

  • interact_best_price_performance(Interazione, bilanciata): ml.g4dn.xlarge, ml.g5.xlarge, ml.g6e.xlarge

  • interact_highest_throughput(Interact, throughput ottimizzato): ml.g6e.48xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • interact_lowest_latency(Interact, latenza ottimizzata): ml.g4dn.2xlarge, ml.g6e.12xlarge, ml.p5en.48xlarge

  • max_context_lowest_latency(Contesto massimo, latenza ottimizzata): ml.g6e.4xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

Google

gemma-2b-it

huggingface-llm-gemma-2b-instruct

Generazione di testo

gemma

Predefinito: ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.12xlarge, ml.p3.16xlarge, ml.p4d.24xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • generate_best_price_performance(Genera, Bilanciato), generate_lowest_cost (Genera, Ottimizzato per i costi), (Interact, Balanced), interact_best_price_performance (Interact, Ottimizzato per i costi), interact_lowest_cost (Contesto massimo, Ottimizzato per i costi): max_context_lowest_cost ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g6.12xlarge

  • generate_highest_throughput(Generazione, velocità effettiva ottimizzata), max_context_lowest_latency (contesto massimo, latenza ottimizzata): ml.g6e.12xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • generate_lowest_latency(Generazione, latenza ottimizzata), max_context_highest_throughput (Contesto massimo, Throughput ottimizzato): ml.g6e.24xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • interact_highest_throughput(Interact, throughput ottimizzato), interact_lowest_latency (Interact, latenza ottimizzata): ml.g6e.48xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

Google

gemma-4-26b-a4b-it

huggingface-vlm-gemma-4-26b-a4b-it

Generazione di testo

apache-2.0

No

Predefinito: ml.g6.12xlarge, ml.g6.24xlarge, ml.g6e.12xlarge, ml.g6e.24xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • generate_highest_throughput(Generazione, ottimizzazione del throughput), (Interact, Throughput ottimizzato), interact_highest_throughput summarize_lowest_latency (Summary, Latenza ottimizzata): ml.g6e.24xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • generate_lowest_cost(Generazione, ottimizzazione dei costi), interact_best_price_performance (Interazione, Bilanciamento), interact_lowest_cost (Interazione, ottimizzazione dei costi), modify_best_price_performance (Modifica, Bilanciamento), modify_lowest_cost (Modifica, ottimizzazione dei costi), summarize_best_price_performance (Riepiloga, Bilanciamento), summarize_lowest_cost (Riepilogo, ottimizzazione dei costi): ml.g6.12xlarge, ml.g6e.12xlarge, ml.p5.48xlarge

  • generate_lowest_latency(Genera, latenza ottimizzata): ml.g6.12xlarge, ml.g6e.24xlarge, ml.p5.48xlarge

  • interact_lowest_latency(Interact, latenza ottimizzata): ml.g6.24xlarge, ml.g6e.24xlarge, ml.p5en.48xlarge

  • modify_highest_throughput(Modifica, velocità effettiva ottimizzata), (Modifica, latenza ottimizzata), (Riepilogo, velocità effettiva ottimizzata): ml.g6e.12xlarge, ml.p5.48xlarge, ml.p5en.48xlarge modify_lowest_latency summarize_highest_throughput

Google

gemma-4-31b-it

huggingface-vlm-gemma-4-31b-it

Image-Text-to-Text

Apache-2.0

ml.g 6.24x grande, ml.g7e.2x grande

Google

gemma-4- E2B-it

huggingface-vlm-gemma-4-e2b-instruct

Image-Text-to-Text

Apache-2.0

No

Predefinito: ml.g6.12xlarge, ml.g6e.2xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.g6e.xlarge, ml.g7e.4xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • max_context_highest_throughput(Max Context, throughput ottimizzato): ml.g6.48xlarge, ml.g6e.24xlarge, ml.g7e.4xlarge

  • max_context_lowest_cost(Contesto massimo, ottimizzazione dei costi): ml.g6.4xlarge, ml.g6e.xlarge, ml.g7e.4xlarge

  • max_context_lowest_latency(Contesto massimo, latenza ottimizzata): ml.g6.8xlarge, ml.g6e.8xlarge, ml.g7e.4xlarge

  • modify_best_price_performance(Modifica, bilanciamento), (modifica, ottimizzazione dei costi), (riepilogo, bilanciamento), modify_lowest_cost (riepilogo, ottimizzazione dei costi): ml.g6.4xlarge, ml.g6e.xlarge, ml.g7e.2xlarge summarize_best_price_performance summarize_lowest_cost

  • modify_highest_throughput(Modifica, produttività ottimizzata): ml.g6.24xlarge, ml.g6e.24xlarge, ml.g7e.2xlarge

  • modify_lowest_latency(Modifica, latenza ottimizzata): ml.g6.24xlarge, ml.g6e.8xlarge, ml.g7e.4xlarge

  • summarize_highest_throughput(Riepilogo, velocità effettiva ottimizzata), (Riepilogo, Latenza ottimizzata): summarize_lowest_latency ml.g6.24xlarge, ml.g6e.xlarge, ml.g7e.2xlarge

Google

gemma-4-e4b-it

huggingface-vlm-gemma-4-e4b-it

Generazione di testo

apache-2.0

Predefinito: ml.g6.12xlarge, ml.g6e.2xlarge, ml.g6e.4xlarge, ml.g6e.xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • generate_best_price_performance(Genera, Bilanciato), generate_lowest_cost (Genera, Ottimizzato per i costi), (Interact, Balanced), interact_best_price_performance (Interact, Ottimizzato per i costi), interact_lowest_cost (Modifica, Bilanciato), modify_best_price_performance (Modifica, Ottimizzato per i costi): modify_lowest_cost ml.g6.xlarge, ml.g6e.xlarge, ml.p5.48xlarge

  • generate_highest_throughput(Genera, produttività ottimizzata): ml.g6e.24xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • generate_lowest_latency(Generazione, latenza ottimizzata): ml.g6.2xlarge, ml.g6e.2xlarge, ml.p5en.48xlarge

  • interact_highest_throughput(Interact, velocità di trasmissione ottimizzata): ml.g6.48xlarge, ml.g6e.48xlarge, ml.p5.48xlarge

  • interact_lowest_latency(Interact, latenza ottimizzata): ml.g6.16xlarge, ml.g6e.16xlarge, ml.p5.48xlarge

  • max_context_highest_throughput(Contesto massimo, velocità effettiva ottimizzata): ml.g6e.12xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • max_context_lowest_cost(Contesto massimo, ottimizzazione dei costi), (Summary, Balanced), (Summary, Costo ottimizzato): ml.g6.12xlarge, ml.g6e.xlarge, ml.p5.48xlarge summarize_best_price_performance summarize_lowest_cost

  • max_context_lowest_latency(Max Context, latenza ottimizzata): ml.g6.24xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • modify_highest_throughput(Modifica, velocità di trasmissione ottimizzata): ml.g6.24xlarge, ml.g6e.24xlarge, ml.p5.48xlarge

  • modify_lowest_latency(Modifica, latenza ottimizzata): ml.g6.12xlarge, ml.g6e.16xlarge, ml.p5.48xlarge

  • summarize_highest_throughput(Riepilogo, velocità effettiva ottimizzata), (Riepilogo, Latenza ottimizzata): summarize_lowest_latency ml.g6e.8xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

Google

gemma-7b

huggingface-llm-gemma-7b

Generazione di testo

gemma

ml.g6e.48x grande, ml.p4d.24x grande, ml.p5en.48x grande

Google

gemma-7b-it

huggingface-llm-gemma-7b-instruct

Generazione di testo

gemma

Predefinito: ml.g5.48xlarge, ml.g6.48xlarge, ml.g6e.12xlarge, ml.g6e.24xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • generate_best_price_performance(Genera, Bilanciato): ml.g6.48xlarge, ml.g6e.12xlarge, ml.p4d.24xlarge

  • generate_highest_throughput(Generazione, ottimizzazione del throughput), (Interactinteract_highest_throughput, Throughput ottimizzato): ml.g6e.48xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • generate_lowest_cost(Generazione, ottimizzazione dei costi), (Interazione, ottimizzazione dei costi), (Contesto massimo, ottimizzazione dei costi): ml.g5.48xlarge, ml.g6.48xlarge, ml.g6e.12xlarge interact_lowest_cost max_context_lowest_cost

  • generate_lowest_latency(Genera, ottimizzato per la latenza), (Max Context, Throughput ottimizzato): ml.g6e.12xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge max_context_highest_throughput

  • interact_best_price_performance(Interact, bilanciato): ml.g5.48xlarge, ml.g6e.12xlarge, ml.p4d.24xlarge

  • interact_lowest_latency(Interact, latenza ottimizzata): ml.g5.48xlarge, ml.g6e.24xlarge, ml.p5en.48xlarge

  • max_context_lowest_latency(Contesto massimo, latenza ottimizzata): ml.g6e.24xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

Google-Bert

BERT Base Cased

huggingface-eqa-bert-base-cased

Risposta alle domande

apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Google-Bert

BERT Base Cased

huggingface-spc-bert-base-cased

Fill-Mask

apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Google-Bert

BERT Base Cased

huggingface-tc-bert-base-cased

Classificazione del testo

apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Google-Bert

BERT Base Multilingual Cased

huggingface-eqa-bert-base-multilingual-cased

Risposta alle domande

apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Google-Bert

BERT Base Multilingual Cased

huggingface-spc-bert-base-multilingual-cased

Fill-Mask

apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Google-Bert

BERT Base Multilingual Cased

huggingface-tc-bert-base-multilingual-cased

Classificazione del testo

apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Google-Bert

BERT Base multilingue senza custodia

huggingface-eqa-bert-base-multilingual-uncased

Risposta alle domande

apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Google-Bert

BERT Base multilingue senza custodia

huggingface-spc-bert-base-multilingual-uncased

Fill-Mask

apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Google-Bert

BERT Base multilingue senza custodia

huggingface-tc-bert-base-multilingual-uncased

Classificazione del testo

apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Google-Bert

BERT Base Uncased

huggingface-eqa-bert-base-uncased

Risposta alle domande

apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Google-Bert

BERT Base Uncased

huggingface-spc-bert-base-uncased

Fill-Mask

apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Google-Bert

BERT Base Uncased

huggingface-tc-bert-base-uncased

Classificazione del testo

apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Google-Bert

BERT Large Cased

huggingface-eqa-bert-large-cased

Risposta alle domande

apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Google-Bert

BERT Large Cased

huggingface-spc-bert-large-cased

Fill-Mask

apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Google-Bert

BERT Large Cased

huggingface-tc-bert-large-cased

Classificazione del testo

apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Google-Bert

BERT Large Cased Whole Word Masking

huggingface-eqa-bert-large-cased-whole-word-masking

Risposta alle domande

apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Google-Bert

BERT Large Cased Whole Word Masking

huggingface-spc-bert-large-cased-whole-word-masking

Fill-Mask

apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Google-Bert

BERT Large Uncased

huggingface-spc-bert-large-uncased

Fill-Mask

apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.m5.xlarge, ml.p3.2xlarge

Google-Bert

BERT Large Uncased

huggingface-tc-bert-large-uncased

Classificazione del testo

apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Google-Bert

BERT Large Uncased Whole Word Masking

huggingface-spc-bert-large-uncased-whole-word-masking

Fill-Mask

apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Google-Bert

Maschera di riempimento

huggingface-fillmask-bert-base-uncased

Fill-Mask

apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Google-T5

Traduzione automatica

huggingface-translation-t5-small

Traduzione

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Google-T5

t5 Base en de

huggingface-translation-t5-base

Traduzione

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Google-T5

t5 Large en de

huggingface-translation-t5-large

Traduzione

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Gradiente I

Llama-3 Istruzione Gradient 8B 1048k

huggingface-llm-llama-3-8b-instruct-gradient

Generazione di testo

lama 3

No

ml.g5.12xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge

Gradiente ai

Llama-3 Istruzione Gradient 8B 262k

huggingface-llm-gradientai-llama-3-8B-instruct-262k

Generazione di testo

lama 3

No

ml.g5.12xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge

Helsinki-Nlp

Helsinki opus en es

huggingface-translation-opus-mt-en-es

Traduzione

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Helsinki-Nlp

Helsinki opus e vi

huggingface-translation-opus-mt-en-vi

Traduzione

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Helsinki-Nlp

Helsinki opus mul en

huggingface-translation-opus-mt-mul-en

Traduzione

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Faccia che si abbraccia h4

HuggingFaceH4 zephyr-orpo-141b- A35b-v0.1

huggingface-llm-huggingfaceh4-zephyr-orpo-141b-a35b-v01

Generazione di testo

apache-2.0

No

ml.g5.48xlarge, ml.p4d.24xlarge

Faccia abbracciata h4

Star Chat Alpha

huggingface-llm-huggingfaceh4-starchat-alpha

Generazione di testo

bigcode-openrail-m

No

ml.g5.12x grande, ml.g5.24x grande, ml.g5.48x grande

Faccia abbracciata h4

Inizia la versione beta di Star Chat

huggingface-llm-huggingfaceh4-starchat-beta

Generazione di testo

bigcode-openrail-m

No

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.48xlarge, ml.p4d.24xlarge

Faccia abbracciata h4

Zephyr 7B Beta

huggingface-llm-huggingfaceh4-zephyr-7b-beta

Generazione di testo

mit

No

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.p4d.24xlarge

Ibm

Generazione di parafrasi a qualità controllata

huggingface-text2text-qcpg-sentences

Generazione Text2Text

apache-2.0

No

ml.g5.16xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge

Idea-Ccnl

IDEA CCNL Taiyi a diffusione stabile 1B cinese EN v0.1

huggingface-txt2img-idea-ccnl-taiyi-1b-chinese-en-v01

Text-to-Image

creativeml-openrail-m

No

ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Idea-Ccnl

IDEA CCNL Taiyi Stable Diffusion 1B cinese v0.1

huggingface-txt2img-idea-ccnl-taiyi-1b-chinese-v0-1

Text-to-Image

ml-openrail-m creativo

No

ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Infloat

Base E5

huggingface-sentencesimilarity-e5-base

Somiglianza delle frasi

mit

ml.c6i.xlarge, ml.g4dn.2xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

intfloat

Base E5 V2

huggingface-sentencesimilarity-e5-base-v2

Somiglianza delle frasi

mit

ml.c6i.xlarge, ml.g4dn.2xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

intfloat

E5 Grande V2

huggingface-sentencesimilarity-e5-large-v2

Somiglianza delle frasi

mit

ml.c6i.xlarge, ml.g4dn.2xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

intfloat

Base E5 multilingue

huggingface-sentencesimilarity-multilingual-e5-base

Somiglianza delle frasi

mit

ml.c6i.xlarge, ml.g4dn.2xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

intfloat

E5 Large multilingue

huggingface-sentencesimilarity-multilingual-e5-large

Somiglianza delle frasi

mit

ml.c6i.xlarge, ml.g4dn.2xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Langboat

Diffusione Langboat Guohua

huggingface-txt2img-langboat-guohua-diffusion

Text-to-Image

ml-openrail-m creativo

No

ml.g4dn.2xlarge, ml.g4dn.xlarge, ml.p3.2xlarge

Luce eterna

Lighteternal Nli Xlm R greco

huggingface-zstc-lighteternal-nli-xlm-r-greek

Zero-Shot Classificazione

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Lightonai

LightOnOCR-2-1B

huggingface-vlm-lightonai-lightonocr-2-1b

Image-Text-to-Text

Apache-2.0

No

ml.g6.2xlarge

Meta

Llama-2-7b-hf

meta-textgeneration-llama-2-7b

Generazione di testo

lama 2

Predefinito: ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • generate_best_price_performance(Generate, Balanced), generate_lowest_cost (Generate, Ottimizzato in termini di costi): ml.g5.4xlarge, ml.g6.4xlarge, ml.g6e.4xlarge

  • generate_highest_throughput(Generazione, velocità effettiva ottimizzata), generate_lowest_latency (generazione, latenza ottimizzata), max_context_highest_throughput (contesto massimo, velocità effettiva ottimizzata), max_context_lowest_latency (contesto massimo, latenza ottimizzata): ml.p4d.24xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • interact_best_price_performance(Interact, Balanced), interact_lowest_cost (Interact, ottimizzazione dei costi): ml.g5.24xlarge, ml.g6.12xlarge, ml.g6e.2xlarge

  • interact_highest_throughput(Interact, velocità di trasmissione ottimizzata): ml.g6e.48xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

  • interact_lowest_latency(Interact, latenza ottimizzata): ml.g6e.24xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

  • max_context_lowest_cost(Contesto massimo, ottimizzazione dei costi): ml.g4dn.12xlarge, ml.g6.12xlarge, ml.g6e.xlarge

Meta

Llama-3.1-70B-Instruct

meta-textgeneration-llama-3-1-70b-instruct

Generazione di testo

lama 3.1

Predefinito: ml.g6e.48xlarge, ml.p5en.48xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • generate_best_price_performance(Genera, Bilanciato): ml.g6e.12xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

  • generate_highest_throughput(Genera, velocità effettiva ottimizzata), (Genera, latenza ottimizzata): ml.p4d.24xlargegenerate_lowest_latency, ml.p5.48xlarge, ml.p5en.48xlarge, ml.p5en.48xlarge

  • generate_lowest_cost(Genera, ottimizzato per i costi), (Interact, Balanced), (Interact, Ottimizzato per i costi): ml.g5.48xlarge, ml.g6.48xlarge, ml.g6e.12xlarge interact_best_price_performance interact_lowest_cost

  • interact_highest_throughput(Interact, Throughput ottimizzato), (Interact, Latenza ottimizzata): ml.g5.48xlarge, ml.g6e.48xlarge, ml.p5en.48xlarge interact_lowest_latency

  • modify_best_price_performance(Modifica, bilanciamento), modify_highest_throughput (modifica, ottimizzazione del throughput), modify_lowest_cost (modifica, ottimizzazione dei costi), modify_lowest_latency (modifica ottimizzata per la latenza): ml.g6e.48xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • summarize_best_price_performance(Riepilogo, bilanciato), summarize_highest_throughput (Riepilogo, velocità effettiva ottimizzata), summarize_lowest_cost (Riepilogo, ottimizzazione dei costi), summarize_lowest_latency (Riepilogo, Latenza ottimizzata): ml.p5en.48xlarge

Meta

Llama-3.1-8B-Instruct

meta-textgeneration-llama-3-1-8b-instruct

Generazione di testo

llama 3.1

Predefinito: ml.g5.48xlarge, ml.g6.48xlarge, ml.g6e.12xlarge, ml.p3.16xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • generate_best_price_performance(Genera, Bilanciato): ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g6e.xlarge

  • generate_highest_throughput(Genera, velocità effettiva ottimizzata), interact_highest_throughput (Interazione, velocità effettiva ottimizzata), max_context_highest_throughput (Contesto massimo, velocità effettiva ottimizzata), (Contesto massimo, latenza ottimizzata), max_context_lowest_latency (Modifica, velocità effettiva ottimizzata), modify_highest_throughput (Modifica, latenza ottimizzata), (Riepilogo, velocità effettiva ottimizzata), modify_lowest_latency summarize_highest_throughput (Riepilogo, latenza ottimizzata): ml.p4d.24xlarge, summarize_lowest_latency ml.p5.48xlarge, ml.p5en.48xlarge, ml.p5en.48xlarge

  • generate_lowest_cost(Genera, ottimizzazione dei costi): ml.g4dn.12xlarge, ml.g6.12xlarge, ml.g6e.xlarge

  • generate_lowest_latency(Genera, latenza ottimizzata): ml.g6e.24xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • interact_best_price_performance(Interagisci, Bilanciato): ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g6e.2xlarge

  • interact_lowest_cost(Interact, ottimizzazione dei costi): ml.g4dn.12xlarge, ml.g6.12xlarge, ml.g6e.2xlarge

  • interact_lowest_latency(Interact, latenza ottimizzata): ml.g6e.24xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • max_context_lowest_cost(Contesto massimo, ottimizzazione dei costi): ml.g5.48xlarge, ml.g6.48xlarge, ml.g6e.12xlarge

  • modify_best_price_performance(Modifica, bilanciato): ml.g4dn.12xlarge, ml.g6.12xlarge, ml.p4d.24xlarge

  • modify_lowest_cost(Modifica, ottimizzazione dei costi): ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g6.12xlarge

  • summarize_best_price_performance(Riassumi, bilanciato): ml.g6.12xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

  • summarize_lowest_cost(Riepilogo, ottimizzazione dei costi): ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.12xlarge

Meta

Llama-3.2-1B

meta-textgeneration-llama-3-2-1b

Generazione di testo

llama 3.2

Predefinito: ml.g4dn.12xlarge, ml.g5.48xlarge, ml.g6.12xlarge, ml.g6e.2xlarge, ml.p3.16xlarge, ml.p4d.24xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • generate_best_price_performance(Genera, Bilanciato): ml.g4dn.xlarge, ml.g6.2xlarge, ml.g6e.2xlarge

  • generate_highest_throughput(Generazione, ottimizzazione del throughput), (Interactinteract_highest_throughput, Throughput ottimizzato): ml.g6e.48xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • generate_lowest_cost(Genera, ottimizzazione dei costi): ml.g4dn.xlarge, ml.g6.2xlarge, ml.g6e.xlarge

  • generate_lowest_latency(Genera, latenza ottimizzata): ml.g6e.16xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • interact_best_price_performance(Interact, Balanced), (Interact, Ottimizzato in termini di costi)interact_lowest_cost: ml.g4dn.xlarge, ml.g5.2xlarge, ml.g6.xlarge

  • interact_lowest_latency(Interact, latenza ottimizzata): ml.g5.16xlarge, ml.g6e.48xlarge, ml.p5en.48xlarge

  • max_context_highest_throughput(Contesto massimo, velocità effettiva ottimizzata): ml.g6e.24xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • max_context_lowest_cost(Contesto massimo, ottimizzazione dei costi): ml.g4dn.12xlarge, ml.g6.8xlarge, ml.g6e.2xlarge

  • max_context_lowest_latency(Contesto massimo, latenza ottimizzata): ml.g6.12xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • modify_best_price_performance(Modifica, bilanciatomodify_lowest_cost), (Modifica, ottimizzazione dei costi): ml.g4dn.xlarge, ml.g5.xlarge, ml.g6.xlarge

  • modify_highest_throughput(Modifica, velocità di trasmissione ottimizzata): ml.g6e.48xlarge, ml.p3.16xlarge, ml.p5en.48xlarge

  • modify_lowest_latency(Modifica, latenza ottimizzata): ml.g5.2xlarge, ml.g6e.8xlarge, ml.p5en.48xlarge

  • summarize_best_price_performance(Riepilogo, bilanciato), (Riepilogo, ottimizzazione dei costi)summarize_lowest_cost: ml.g5.xlarge, ml.g6.24xlarge, ml.g6e.xlarge

  • summarize_highest_throughput(Riepilogo, throughput ottimizzato): ml.g6e.12xlarge, ml.p3.16xlarge, ml.p5en.48xlarge

  • summarize_lowest_latency(Riepilogo, latenza ottimizzata): ml.g6e.4xlarge, ml.p3.16xlarge, ml.p5en.48xlarge

Meta

Llama-3.2-1B-Instruct

meta-textgeneration-llama-3-2-1b-instruct

Generazione di testo

llama 3.2

Predefinito: ml.g4dn.12xlarge, ml.g5.24xlarge, ml.g6.48xlarge, ml.g6e.12xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • generate_best_price_performance(Genera, Bilanciato): ml.g4dn.xlarge, ml.g5.xlarge, ml.g6e.xlarge

  • generate_highest_throughput(Genera, velocità effettiva ottimizzata), (contesto massimo, velocità effettiva ottimizzata), (contesto massimo, latenza ottimizzata): ml.p4d.24xlarge, ml.p5.48xlarge, max_context_highest_throughput ml.p5en.48xlarge, ml.p5en.48xlarge max_context_lowest_latency

  • generate_lowest_cost(Generazione, ottimizzazione dei costi), (Modifica, Bilanciamento), (Modifica, ottimizzazione dei costi): ml.g4dn.xlarge, ml.g5.xlarge, ml.g6.2xlarge modify_best_price_performance modify_lowest_cost

  • generate_lowest_latency(Genera, latenza ottimizzata): ml.g6.12xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • interact_best_price_performance(Interagisci, Bilanciato): ml.g4dn.xlarge, ml.g5.2xlarge, ml.g6e.2xlarge

  • interact_highest_throughput(Interact, velocità di trasmissione ottimizzata): ml.g5.48xlarge, ml.g6e.12xlarge, ml.p5en.48xlarge

  • interact_lowest_cost(Interact, ottimizzazione dei costi): ml.g4dn.xlarge, ml.g5.xlarge, ml.g6.8xlarge

  • interact_lowest_latency(Interact, latenza ottimizzata): ml.g6.8xlarge, ml.g6e.24xlarge, ml.p5en.48xlarge

  • max_context_lowest_cost(Contesto massimo, ottimizzazione dei costi): ml.g4dn.12xlarge, ml.g5.24xlarge, ml.g6e.xlarge

  • modify_highest_throughput(Modifica, velocità di trasmissione ottimizzata): ml.g6e.12xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • modify_lowest_latency(Modifica, latenza ottimizzata): ml.g6e.4xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • summarize_best_price_performance(Riassumi, Bilanciato): ml.g5.xlarge, ml.g6.xlarge, ml.g6e.8xlarge

  • summarize_highest_throughput(Riepilogo, throughput ottimizzato): ml.g6e.24xlarge, ml.p3.16xlarge, ml.p5en.48xlarge

  • summarize_lowest_cost(Riepilogo, ottimizzazione dei costi): ml.g4dn.12xlarge, ml.g5.xlarge, ml.g6.xlarge

  • summarize_lowest_latency(Riassumi, latenza ottimizzata): ml.g6e.8xlarge, ml.p3.16xlarge, ml.p5en.48xlarge

Meta

Llama-3.2-3B

meta-textgeneration-llama-3-2-3b

Generazione di testo

llama 3.2

Predefinito: ml.g5.48xlarge, ml.g6.48xlarge, ml.g6e.24xlarge, ml.g6e.48xlarge, ml.p3.16xlarge, ml.p5en.48xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • generate_best_price_performance(Genera, Bilanciato): ml.g4dn.xlarge, ml.g5.xlarge, ml.g6e.2xlarge

  • generate_highest_throughput(Genera, velocità di trasmissione ottimizzata): ml.g6e.24xlarge, ml.p3.8xlarge, ml.p5en.48xlarge

  • generate_lowest_cost(Generazione, ottimizzazione dei costi), (Interazione, ottimizzazione dei interact_lowest_cost costi): ml.g4dn.xlarge, ml.g5.xlarge, ml.g6.xlarge

  • generate_lowest_latency(Generazione, latenza ottimizzata): ml.g5.8xlarge, ml.g6e.8xlarge, ml.p5en.48xlarge

  • interact_best_price_performance(Interagisci, Bilanciato): ml.g4dn.xlarge, ml.g5.xlarge, ml.g6e.xlarge

  • interact_highest_throughput(Interact, throughput ottimizzato), (Riepilogo, Latenza ottimizzata): ml.p3.16xlarge, ml.p5.48xlarge, ml.p5en.48xlarge summarize_lowest_latency

  • interact_lowest_latency(Interact, latenza ottimizzata): ml.g6.12xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • max_context_highest_throughput(Contesto massimo, velocità effettiva ottimizzata): ml.g6.48xlarge, ml.g6e.48xlarge, ml.p5en.48xlarge

  • max_context_lowest_cost(Contesto massimo, ottimizzazione dei costi): ml.g5.24xlarge, ml.g6.12xlarge, ml.g6e.24xlarge

  • max_context_lowest_latency(Contesto massimo, latenza ottimizzata): ml.g5.24xlarge, ml.g6.24xlarge, ml.p5en.48xlarge

  • modify_best_price_performance(Modifica, bilanciato): ml.g5.xlarge, ml.g6.4xlarge, ml.g6e.2xlarge

  • modify_highest_throughput(Modifica, velocità di trasmissione ottimizzata): ml.g6e.48xlarge, ml.p3.16xlarge, ml.p4d.24xlarge

  • modify_lowest_cost(Modifica, ottimizzazione dei costi): ml.g5.xlarge, ml.g6.4xlarge, ml.g6e.xlarge

  • modify_lowest_latency(Modifica, latenza ottimizzata): ml.g6e.8xlarge, ml.p3.16xlarge, ml.p4d.24xlarge

  • summarize_best_price_performance(Riassumi, bilanciato): ml.g4dn.12xlarge, ml.g6.12xlarge, ml.p5.48xlarge

  • summarize_highest_throughput(Riepilogo, velocità di trasmissione ottimizzata): ml.g6e.24xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • summarize_lowest_cost(Riepilogo, ottimizzazione dei costi): ml.g4dn.12xlarge, ml.g5.24xlarge, ml.g6.12xlarge

Meta

Llama-3.2-3B-Instruct

meta-textgeneration-llama-3-2-3b-instruct

Generazione di testo

llama 3.2

Predefinito: ml.g5.24xlarge, ml.g6.24xlarge, ml.g6e.48xlarge, ml.p3.16xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • generate_best_price_performance(Generate, Balanced), interact_best_price_performance (Interact, Balanced): ml.g4dn.xlarge, ml.g5.xlarge, ml.g6e.xlarge

  • generate_highest_throughput(Genera, throughput ottimizzato), interact_highest_throughput (Interact, Throughput ottimizzato), max_context_highest_throughput (Contesto massimo, Throughput ottimizzato), summarize_highest_throughput (Riepilogo, Throughput ottimizzato), summarize_lowest_latency (Riepilogo, Latenza ottimizzata): ml.p4d.24xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • generate_lowest_cost(Generazione, ottimizzazione dei costi), interact_lowest_cost (Interazione, ottimizzazione dei costi): ml.g4dn.xlarge, ml.g5.xlarge, ml.g6.xlarge

  • generate_lowest_latency(Generazione, latenza ottimizzata): ml.g6e.4xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • interact_lowest_latency(Interact, latenza ottimizzata): ml.g6e.12xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • max_context_lowest_cost(Contesto massimo, ottimizzazione dei costi): ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.12xlarge

  • max_context_lowest_latency(Contesto massimo, latenza ottimizzata): ml.g6e.24xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • modify_best_price_performance(Modifica, bilanciato): ml.g5.xlarge, ml.g6.2xlarge, ml.g6e.xlarge

  • modify_highest_throughput(Modifica, velocità di trasmissione ottimizzata): ml.g6e.12xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • modify_lowest_cost(Modifica, ottimizzazione dei costi): ml.g5.xlarge, ml.g6.xlarge, ml.g6e.xlarge

  • modify_lowest_latency(Modifica, latenza ottimizzata): ml.g6e.8xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • summarize_best_price_performance(Riassumi, bilanciato): ml.g6.12xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

  • summarize_lowest_cost(Riepilogo, ottimizzazione dei costi): ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g6.12xlarge

Meta

Llama-Guard-3-1B

meta-textgeneration-llama-guard-3-1b

Generazione di testo

llama 3.2

No

ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.48xlarge, ml.g5.8xlarge, ml.g5.xlarge, ml.g6.12xlarge, ml.g6.24xlarge, ml.g6.48xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g66xlarge, ml.g6e.16xlarge, ml.g66xlarge e.24xlarge, ml.g6e.2xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.g6e.xlarge, ml.p4d.24xlarge

Meta

Llama-Guard-3-8B

meta-textgeneration-llama-guard-3-8b

Generazione di testo

lama 3.1

No

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.48xlarge, ml.g6.12xlarge, ml.g6.24xlarge, ml.g6.48xlarge, ml.g6e.12xlarge, ml.g6e.24xlarge, ml.p4d.24xlarge

Meta

Meta Code Llama 13B

meta-textgeneration-llama-codellama-13b

Generazione di testo

lama 2

ml.g 5.12x grande, ml.g5.24x grande, ml.g5.48x grande, ml.g6.12x grande, ml.p4d.24x grande

Meta

Meta Code Llama 13B Instruct

meta-textgeneration-llama-codellama-13b-instruct

Generazione di testo

lama 2

No

ml.g 5.12x grande, ml.g5.24x grande, ml.g5.48x grande, ml.g6.12x grande, ml.p4d.24x grande

Meta

Meta Code Llama 13B Python

meta-textgeneration-llama-codellama-13b-python

Generazione di testo

lama 2

ml.g 5.12x grande, ml.g5.24x grande, ml.g5.48x grande, ml.g6.12x grande, ml.p4d.24x grande

Meta

Meta Code Llama 34B

meta-textgeneration-llama-codellama-34b

Generazione di testo

lama 2

Predefinito: ml.g5.48xlarge, ml.p4d.24xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • lmi(contenitore Large Model Inference), lmi-optimized (contenitore Large Model Inference che utilizza la decodifica speculativa): ml.g5.48xlarge, ml.g6.48xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge

Meta

Meta Code Llama 34B Instruct

meta-textgeneration-llama-codellama-34b-instruct

Generazione di testo

lama 2

No

Predefinito: ml.g5.48xlarge, ml.p4d.24xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • lmi(contenitore Large Model Inference), lmi-optimized (contenitore Large Model Inference che utilizza la decodifica speculativa): ml.g5.48xlarge, ml.g6.48xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge

Meta

Meta Code Llama 34B Python

meta-textgeneration-llama-codellama-34b-python

Generazione di testo

lama 2

Predefinito: ml.g5.48xlarge, ml.p4d.24xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • lmi(contenitore Large Model Inference), lmi-optimized (contenitore Large Model Inference che utilizza la decodifica speculativa): ml.g5.48xlarge, ml.g6.48xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge

Meta

Meta Code Llama 70B

meta-textgeneration-llama-codellama-70b

Generazione di testo

lama 2

Predefinito: ml.g5.48xlarge, ml.p4d.24xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • lmi(contenitore Large Model Inference), lmi-optimized (contenitore Large Model Inference che utilizza la decodifica speculativa): ml.g5.48xlarge, ml.g6.48xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge

Meta

Meta Code Llama 70B Instruct

meta-textgeneration-llama-codellama-70b-instruct

Generazione di testo

lama 2

No

Predefinito: ml.g5.48xlarge, ml.p4d.24xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • lmi(contenitore Large Model Inference), lmi-optimized (contenitore Large Model Inference che utilizza la decodifica speculativa): ml.g5.48xlarge, ml.g6.48xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge

Meta

Meta Code Llama 70B Neuron

meta-textgenerationneuron-llama-codellama-70b

Generazione di testo

lama 2

No

ml.inf2.48x grande

Meta

Meta Code Llama 70B Python

meta-textgeneration-llama-codellama-70b-python

Generazione di testo

lama 2

Predefinito: ml.g5.48xlarge, ml.p4d.24xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • lmi(contenitore Large Model Inference), lmi-optimized (contenitore Large Model Inference che utilizza la decodifica speculativa): ml.g5.48xlarge, ml.g6.48xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge

Meta

Meta Code Llama 7B

meta-textgeneration-llama-codellama-7b

Generazione di testo

lama 2

Predefinito: ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g6.2xlarge, ml.p4d.24xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • lmi-optimized(contenitore Large Model Inference che utilizza la decodifica speculativa): ml.g5.12xlarge, ml.g5.2xlarge, ml.g6.12xlarge, ml.g6.2xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge

Meta

Meta Code Llama 7B Instruct

meta-textgeneration-llama-codellama-7b-instruct

Generazione di testo

lama 2

No

Predefinito: ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g6.12xlarge, ml.g6.2xlarge, ml.p4d.24xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • lmi-optimized(contenitore Large Model Inference che utilizza la decodifica speculativa): ml.g5.12xlarge, ml.g5.2xlarge, ml.g6.12xlarge, ml.g6.2xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge

Meta

Meta Code Llama 7B Neuron

meta-textgenerationneuron-llama-codellama-7b

Generazione di testo

lama 2

No

ml.inf2.8xlarge, ml.inf2.xlarge

Meta

Meta Code Llama 7B Python

meta-textgeneration-llama-codellama-7b-python

Generazione di testo

lama 2

Predefinito: ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g6.12xlarge, ml.p4d.24xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • lmi-optimized(contenitore Large Model Inference che utilizza la decodifica speculativa): ml.g5.12xlarge, ml.g5.2xlarge, ml.g6.12xlarge, ml.g6.2xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge

Meta

Meta Code Llama 7B Python Neuron

meta-textgenerationneuron-llama-codellama-7b-python

Generazione di testo

lama 2

No

ml.inf2.8xlarge, ml.inf2.xlarge

Meta

Meta Llama 2 13B

meta-textgeneration-llama-2-13b

Generazione di testo

lama 2

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.48xlarge, ml.g6.12xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

Meta

Meta Llama 2 13B Chat

meta-textgeneration-llama-2-13b-f

Generazione di testo

lama 2

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.48xlarge, ml.g6.12xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

Meta

Meta Llama 2 13B Chat Neuron

meta-textgenerationneuron-llama-2-13b-f

Generazione di testo

lama 2

No

ml.inf2.24x grande, ml.inf2.48x grande, ml.inf2.8x grande

Meta

Meta Llama 2 13B Neuron

meta-textgenerationneuron-llama-2-13b

Generazione di testo

lama 2

ml.inf2.24x grande, ml.inf2.48x grande, ml.inf2.8x grande

Meta

Meta Llama 2 70B

meta-textgeneration-llama-2-70b

Generazione di testo

lama 2

Predefinito: ml.g5.48xlarge, ml.p4d.24xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • lmi(contenitore Large Model Inference), lmi-optimized (contenitore Large Model Inference che utilizza la decodifica speculativa): ml.g5.48xlarge, ml.g6.48xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge

Meta

Meta Llama 2 70B Chat

meta-textgeneration-llama-2-70b-f

Generazione di testo

lama 2

Predefinito: ml.g5.48xlarge, ml.p4d.24xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • lmi(contenitore Large Model Inference), lmi-optimized (contenitore Large Model Inference che utilizza la decodifica speculativa): ml.g5.48xlarge, ml.g6.48xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge

Meta

Meta Llama 2 70B Chat Neuron

meta-textgenerationneuron-llama-2-70b-f

Generazione di testo

lama 2

No

ml.inf2.48x grande

Meta

Meta Llama 2 70B Neuron

meta-textgenerationneuron-llama-2-70b

Generazione di testo

lama 2

No

ml.inf2.48x grande

Meta

Meta Llama 2 7B Chat

meta-textgeneration-llama-2-7b-f

Generazione di testo

lama 2

Predefinito: ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g6.12xlarge, ml.p4d.24xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • lmi-optimized(contenitore Large Model Inference che utilizza la decodifica speculativa): ml.g5.12xlarge, ml.g5.2xlarge, ml.g6.12xlarge, ml.g6.2xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge

  • neuron(Acceleratori AWS Inferentia e Trainium): ml.inf2.24xlarge, ml.inf2.48xlarge, ml.inf2.8xlarge, ml.inf2.xlarge

Meta

Meta Llama 2 7B Chat Neuron

meta-textgenerationneuron-llama-2-7b-f

Generazione di testo

lama 2

No

ml.inf2.24xlarge, ml.inf2.48xlarge, ml.inf2.8xlarge, ml.inf2.xlarge

Meta

Meta Llama 2 7B Neuron

meta-textgenerationneuron-llama-2-7b

Generazione di testo

lama 2

ml.inf2.24xlarge, ml.inf2.48xlarge, ml.inf2.8xlarge, ml.inf2.xlarge

Meta

Meta Llama 3 1 8B Neuron

meta-textgenerationneuron-llama-3-1-8b

Generazione di testo

lama 3.1

No

ml.inf2.24xlarge, ml.inf2.48xlarge, ml.inf2.8xlarge, ml.trn1.2xlarge, ml.trn1.32xlarge, ml.trn1n.32xlarge

Meta

Meta Llama 3 70B

meta-textgeneration-llama-3-70b

Generazione di testo

lama 3

ml.g5.48x grande, ml.g6.48x grande, ml.p4d.24x grande, ml.p5.48x grande

Meta

Meta Llama 3 70B Instruct

meta-textgeneration-llama-3-70b-instruct

Generazione di testo

lama 3

ml.g5.48x grande, ml.g6.48x grande, ml.p4d.24x grande, ml.p5.48x grande

Meta

Meta Llama 3 70B Instruct Neuron

meta-textgenerationneuron-llama-3-70b-instruct

Generazione di testo

lama 3

No

ml.trn1.32xlarge

Meta

Meta Llama 3 70B Neuron

meta-textgenerationneuron-llama-3-70b

Generazione di testo

lama 3

No

ml.trn1.32xlarge

Meta

Meta Llama 3 8B Instruct

meta-textgeneration-llama-3-8b-instruct

Generazione di testo

lama 3

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g6.12xlarge, ml.g6.2xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

Meta

Meta Llama 3 8B Instruct Neuron

meta-textgenerationneuron-llama-3-8b-instruct

Generazione di testo

lama 3

No

ml.inf2.24x grande, ml.inf2.48x grande, ml.inf2.8x grande

Meta

Meta Llama 3 8B Neuron

meta-textgenerationneuron-llama-3-8b

Generazione di testo

lama 3

No

ml.inf2.24x grande, ml.inf2.48x grande, ml.inf2.8x grande

Meta

Meta Llama 3.1 405B FP8

meta-textgeneration-llama-3-1-405b-fp8

Generazione di testo

lama 3.1

ml.p4de.24x grande, ml.p5.48x grande

Meta

Meta Llama 3.1 405B Instruct FP8

meta-textgeneration-llama-3-1-405b-instruct-fp8

Generazione di testo

lama 3.1

ml.p4de.24x grande, ml.p5.48x grande

Meta

Meta Llama 3.1 70B

meta-textgeneration-llama-3-1-70b

Generazione di testo

lama 3.1

ml.g5.48x grande, ml.g6.48x grande, ml.p4d.24x grande, ml.p5.48x grande

Meta

Meta Llama 3.1 70B Instruct Neuron

meta-textgenerationneuron-llama-3-1-70b-instruct

Generazione di testo

lama 3.1

No

ml.inf2.48x grande, ml.trn 1.32x grande, ml.trn1n.32x grande

Meta

Meta Llama 3.1 70B Neuron

meta-textgenerationneuron-llama-3-1-70b

Generazione di testo

lama 3.1

No

ml.inf2.48x grande, ml.trn 1.32x grande, ml.trn1n.32x grande

Meta

Meta Llama 3.1 8B

meta-textgeneration-llama-3-1-8b

Generazione di testo

lama 3.1

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g6.12xlarge, ml.g6.24xlarge, ml.g6.2xlarge, ml.g6.48xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

Meta

Meta Llama 3.1 8B Instruct Neuron

meta-textgenerationneuron-llama-3-1-8b-instruct

Generazione di testo

lama 3.1

No

ml.inf2.24xlarge, ml.inf2.48xlarge, ml.inf2.8xlarge, ml.trn1.2xlarge, ml.trn1.32xlarge, ml.trn1n.32xlarge

Meta

Meta Llama 3.2 11B Vision

meta-vlm-llama-3-2-11b-vision

Image-Text-to-Text

lama 3.2

ml.g6.12xlarge, ml.g6.24xlarge, ml.g6.48xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge

Meta

Meta Llama 3.2 11B Vision Instruct

meta-vlm-llama-3-2-11b-vision-instruct

Image-Text-to-Text

lama 3.2

ml.g6.12xlarge, ml.g6.24xlarge, ml.g6.48xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge

Meta

Meta Llama 3.2 1B Instruct Neuron

meta-textgenerationneuron-llama-3-2-1b-instruct

Generazione di testo

lama 3.2

No

ml.inf2.24xlarge, ml.inf2.48xlarge, ml.inf2.xlarge, ml.inf2.xlarge, ml.infn1.2xlarge, ml.infn1.32xlarge, ml.trn1n.32xlarge

Meta

Meta Llama 3.2 1B Neurone

meta-textgenerationneuron-llama-3-2-1b

Generazione di testo

lama 3.2

No

ml.inf2.24xlarge, ml.inf2.48xlarge, ml.inf2.xlarge, ml.inf2.xlarge, ml.infn1.2xlarge, ml.infn1.32xlarge, ml.trn1n.32xlarge

Meta

Meta Llama 3.2 3B Instruisci Neuron

meta-textgenerationneuron-llama-3-2-3b-instruct

Generazione di testo

lama 3.2

No

ml.inf2.24xlarge, ml.inf2.48xlarge, ml.inf2.xlarge, ml.inf2.xlarge, ml.infn1.2xlarge, ml.infn1.32xlarge, ml.trn1n.32xlarge

Meta

Meta Llama 3.2 Neurone 3B

meta-textgenerationneuron-llama-3-2-3b

Generazione di testo

lama 3.2

No

ml.inf2.24xlarge, ml.inf2.48xlarge, ml.inf2.xlarge, ml.inf2.xlarge, ml.infn1.2xlarge, ml.infn1.32xlarge, ml.trn1n.32xlarge

Meta

Meta Llama 3.2 90B Vision

meta-vlm-llama-3-2-90b-vision

Image-Text-to-Text

lama 3.2

ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge

Meta

Istruzioni di visione Meta Llama 3.2 90B

meta-vlm-llama-3-2-90b-vision-instruct

Image-Text-to-Text

lama 3.2

ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge

Meta

Meta Llama 3.3 70B Instruct

meta-textgeneration-llama-3-3-70b-instruct

Generazione di testo

lama 3.3

Predefinito: ml.g5.48xlarge, ml.g6.48xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • lmi-optimized(contenitore Large Model Inference che utilizza la decodifica speculativa): ml.g5.16xlarge, ml.g5.48xlarge, ml.g6.48xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

Meta

Meta Llama 4 Maverick 17B 128E FP8

meta-vlm-llama-4-maverick-17b-128e-instruct-fp8

Image-Text-to-Text

Lama 4

No

ml.p5e.48x grande, ml.p5en.48x grande

Meta

Istruzioni Meta Llama 4 Maverick 17B 128E

meta-vlm-llama-4-maverick-17b-128e-instruct

Image-Text-to-Text

lama 4

No

ml.p5e.48x grande, ml.p5en.48x grande

Meta

Istruzioni Meta Llama 4 Scout 17B 16E

meta-vlm-llama-4-scout-17b-16e-instruct

Image-Text-to-Text

Lama 4

ml.g6e.48x grande, ml.p5.48x grande, ml.p5en.48x grande

Meta

Meta Llama Guard 3 11B Vision

meta-vlm-llama-guard-3-11b-vision

Image-Text-to-Text

lama 3.2

No

ml.g6.12xlarge, ml.g6.24xlarge, ml.g6.48xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge

Meta

Meta Llama Guard 3 1B Neuron

meta-textgenerationneuron-llama-guard-3-1b

Generazione di testo

lama 3.2

No

ml.inf2.24xlarge, ml.inf2.48xlarge, ml.inf2.xlarge, ml.inf2.xlarge, ml.infn1.2xlarge, ml.infn1.32xlarge, ml.trn1n.32xlarge

Meta

Meta Llama Guard 3 8B Neuron

meta-textgenerationneuron-llama-guard-3-8b

Generazione di testo

lama 3.1

No

ml.inf2.24xlarge, ml.inf2.48xlarge, ml.inf2.8xlarge, ml.trn1.2xlarge, ml.trn1.32xlarge, ml.trn1n.32xlarge

Meta

Meta Llama Guard 7B

meta-textgeneration-llama-guard-7b

Generazione di testo

lama 2

No

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p4d.24xlarge

Meta

Meta Llama Prompt Guard 86M

meta-tc-llama-prompt-guard-86m

Classificazione del testo

lama 3.1

No

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g6.12xlarge, ml.g6.24xlarge, ml.g6.24xlarge, ml.g6.2xlarge, ml.g6.48xlarge, ml.g6.4xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.g6.xlarge, ml.p4d.24xlarge

Meta

Meta SAM 2.1 Hiera Base Plus

meta-vs-sam-2-1-hiera-base-plus

Segmentazione delle immagini

apache-2.0

No

ml.g5.24xlarge, ml.g5.48xlarge, ml.g6.24xlarge, ml.g6.48xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge

Meta

Meta SAM 2.1 Hiera Large

meta-vs-sam-2-1-hiera-large

Segmentazione delle immagini

apache-2.0

No

ml.g5.24xlarge, ml.g5.48xlarge, ml.g6.24xlarge, ml.g6.48xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge

Meta

Meta SAM 2.1 Hiera Small

meta-vs-sam-2-1-hiera-small

Segmentazione delle immagini

apache-2.0

No

ml.g5.24xlarge, ml.g5.48xlarge, ml.g6.24xlarge, ml.g6.48xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge

Meta

Meta SAM 2.1 Hiera Tiny

meta-vs-sam-2-1-hiera-tiny

Segmentazione delle immagini

apache-2.0

No

ml.g5.24xlarge, ml.g5.48xlarge, ml.g6.24xlarge, ml.g6.48xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge

Meta

Meta-Llama-3-8B

meta-textgeneration-llama-3-8b

Generazione di testo

lama 3

Predefinito: ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.xlarge, ml.p3.8xlarge, ml.p4d.24xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • generate_best_price_performance(Generate, Balanced), generate_lowest_cost (Generate, Ottimizzato in termini di costi): ml.g5.2xlarge, ml.g6.2xlarge, ml.g6e.xlarge

  • generate_highest_throughput(Generazione, ottimizzazione del throughput), (Interact, Throughput ottimizzato): ml.g6e.48xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge interact_highest_throughput

  • generate_lowest_latency(Generazione, latenza ottimizzata): ml.g6e.16xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • interact_best_price_performance(Interact, Balanced), (Interact, Ottimizzato in termini di costi)interact_lowest_cost: ml.g5.xlarge, ml.g6.xlarge, ml.g6e.xlarge

  • interact_lowest_latency(Interact, latenza ottimizzata): ml.g6e.12xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • max_context_highest_throughput(Contesto massimo, velocità effettiva ottimizzata): ml.p3.16xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • max_context_lowest_cost(Contesto massimo, ottimizzazione dei costi): ml.g4dn.12xlarge, ml.g6.12xlarge, ml.g6e.xlarge

  • max_context_lowest_latency(Contesto massimo, latenza ottimizzata): ml.g4dn.12xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

Microsoft

Phi-2

huggingface-llm-phi-2

Generazione di testo

mit

No

ml.g5.12xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.xlarge, ml.p4de.24xlarge, ml.p5.48xlarge, ml.p4de.24xlarge, ml.p5.48xlarge

Microsoft

Phi-3-Mini-128K-Instruct

huggingface-llm-phi-3-mini-128k-instruct

Generazione di testo

mit

No

ml.g5.12xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge

Microsoft

Phi-3-mini-4k-instruct

huggingface-llm-phi-3-mini-4k-instruct

Generazione di testo

mit

No

Predefinito: ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • generate_best_price_performance(Generate, Balanced), interact_best_price_performance (Interact, Balanced): ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.xlarge

  • generate_highest_throughput(Genera, velocità di trasmissione ottimizzata): ml.g6e.12xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • generate_lowest_cost(Generazione, ottimizzazione dei costi), (Interazione, ottimizzazione dei costi), (Contesto massimo, ottimizzazione dei costi): ml.g4dn.12xlarge, ml.g6.12xlarge, ml.g6e.xlarge interact_lowest_cost max_context_lowest_cost

  • generate_lowest_latency(Genera, ottimizzato per la latenza): ml.g6e.8xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • interact_highest_throughput(Interact, velocità di trasmissione ottimizzata): ml.g6e.48xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • interact_lowest_latency(Interact, latenza ottimizzata): ml.g6.48xlarge, ml.g6e.24xlarge, ml.p4d.24xlarge

  • max_context_highest_throughput(Contesto massimo, velocità effettiva ottimizzata): ml.g6e.24xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • max_context_lowest_latency(Contesto massimo, latenza ottimizzata): ml.g6e.16xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

Microsoft

Phi-3.5-mini-instruct

huggingface-llm-phi-3-5-mini-instruct

Generazione di testo

mit

No

ml.g 5.48x grande, ml.p4d.24x grande

Microsoft

Phi-4-mini-instruct

huggingface-llm-phi-4-mini-instruct

Generazione di testo

Apache-2.0

No

Predefinito: ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.12xlarge, ml.p4d.24xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • generate_best_price_performance(Genera, Bilanciato), generate_lowest_cost (Genera, Ottimizzato per i costi), (Interact, Balanced), interact_best_price_performance (Interact, Ottimizzato per i costi), interact_lowest_cost modify_lowest_cost (Modifica, Ottimizzato per i costi): ml.g5.xlarge, ml.g6.xlarge, ml.g6e.xlarge

  • generate_highest_throughput(Genera, velocità effettiva ottimizzata), interact_highest_throughput (Interazione, velocità effettiva ottimizzata), modify_highest_throughput (Modifica, velocità effettiva ottimizzata), modify_lowest_latency (Modifica, latenza ottimizzata), summarize_highest_throughput (Riepilogo, velocità effettiva ottimizzata), summarize_lowest_latency (Riepilogo, latenza ottimizzata): ml.p4d.24xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • generate_lowest_latency(Genera, latenza ottimizzata): ml.g6e.8xlarge, ml.g7e.8xlarge, ml.p5en.48xlarge

  • interact_lowest_latency(Interact, latenza ottimizzata): ml.g6.12xlarge, ml.g6e.12xlarge

  • max_context_highest_throughput(Contesto massimo, velocità effettiva ottimizzata): ml.p5.48xlarge, ml.p5en.48xlarge

  • max_context_lowest_cost(Contesto massimo, ottimizzazione dei costi), (Riepilogo, ottimizzazione dei costi): ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.12xlarge summarize_lowest_cost

  • max_context_lowest_latency(Contesto massimo, latenza ottimizzata): ml.g6e.24xlarge, ml.p4d.24xlarge

  • modify_best_price_performance(Modifica, bilanciato): ml.g5.2xlarge, ml.g6.xlarge, ml.g6e.xlarge

  • summarize_best_price_performance(Riassumi, Bilanciato): ml.g6.12xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

Microsoft

Rilevamento del trasformatore da tavolo

huggingface-od-microsoft-table-transformer-detection

Rilevamento di oggetti

mit

No

ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.xlarge, ml.g6.2xlarge, ml.g6.4xlarge, ml.g6.xlarge, ml.g6e.2xlarge, ml.g6e.4xlarge, ml.g6e.xlarge

Minimaxi

MiniMax-M2

huggingface-llm-minimax-m2

Generazione di testo

altro

No

ml.p4de.24xlarge

Minimaxia

MiniMax-M2.1

huggingface-llm-minimax-m2-1

Generazione di testo

altro

No

ml.p4de.24xlarge, ml.p5.48xlarge

Minimaxia

MiniMax-M2.5

huggingface-llm-minimax-m2-5

Generazione di testo

altro

No

ml.p5.48xlarge

Minimaxia

MiniMax-M2.7

huggingface-llm-minimax-m2-7

Generazione di testo

altro

No

Predefinito: ml.p5en.48xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • generate_best_price_performance(Generazione, bilanciamento), generate_highest_throughput (generazione, ottimizzazione del throughput), generate_lowest_cost (generazione, ottimizzazione dei costi), generate_lowest_latency (generazione ottimizzata per latenza), interact_best_price_performance (interazione, bilanciamento), interact_highest_throughput (interazione, ottimizzazione del throughput), interact_lowest_cost (interazione, ottimizzazione dei costi), interact_lowest_latency (interazione ottimizzata per latenza), summarize_best_price_performance (riepilogo, bilanciamento), summarize_highest_throughput (riepilogo, ottimizzazione del throughput), summarize_lowest_cost (riepilogo, ottimizzazione dei costi): ml.g77e.48x grande, ml.p5en.48x grande summarize_lowest_latency

  • modify_best_price_performance(Modifica, bilanciamento), modify_highest_throughput (modifica, velocità effettiva ottimizzata), modify_lowest_cost (modifica, ottimizzazione dei costi), modify_lowest_latency (modifica ottimizzata per la latenza): ml.g7e.48xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

Mistralai

Ministral-3-14B-Instruct-2512

huggingface-llm-ministral-3-14b-instruct-2512

Generazione di testo

Apache-2.0

No

Predefinito: ml.p5.48xlarge, ml.p5en.48xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • generate_best_price_performance(Genera, Bilanciato), generate_lowest_cost (Genera, Ottimizzato per i costi), (Interact, Balanced), interact_best_price_performance (Interact, Ottimizzato per i costi): interact_lowest_cost ml.g5.12xlarge, ml.g6e.48xlarge, ml.p5.4xlarge

  • generate_highest_throughput(Generazione, velocità effettiva ottimizzata), generate_lowest_latency (generazione, latenza ottimizzata), interact_highest_throughput (interazione, velocità effettiva ottimizzata): ml.g6e.48xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • interact_lowest_latency(Interact, latenza ottimizzata): ml.g5.12xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • modify_best_price_performance(Modifica, bilanciamento), (modifica, ottimizzazione del throughput), (modifica, ottimizzazione dei costi), modify_highest_throughput (modifica ottimizzata per la latenza): ml.p5.48xlarge, ml.p5.4xlarge, ml.p5en.48xlarge, ml.p5en.48xlarge modify_lowest_cost modify_lowest_latency

Mistralai

Mistral 7B Instruct Neuron

huggingface-llmneuron-mistral-7b-instruct

Generazione di testo

apache-2.0

No

ml.inf2.8xlarge, ml.inf2.xlarge

Mistralia

Mistral 7B Neuron

huggingface-llmneuron-mistral-7b

Generazione di testo

apache-2.0

No

ml.inf2.8xlarge, ml.inf2.xlarge

Mistralia

Mistral Nemo Base 2407

huggingface-llm-mistral-nemo-base-2407

Generazione di testo

apache-2.0

No

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.48xlarge, ml.g6.12xlarge, ml.g6.24xlarge, ml.g6.48xlarge, ml.p4d.24xlarge

Mistralai

Mistral Nemo Instruct 2407

huggingface-llm-mistral-nemo-instruct-2407

Generazione di testo

apache-2.0

No

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.48xlarge, ml.g6.12xlarge, ml.g6.24xlarge, ml.g6.48xlarge, ml.p4d.24xlarge

Mistralai

Mistral Pixtral-12B-2409

huggingface-vlm-mistral-pixtral-12b-2409

Image-Text-to-Text

apache-2.0

No

ml.g6.12xlarge, ml.g6.24xlarge, ml.g6.48xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge

Mistralai

Mistral-7B-Instruct-v0.2

huggingface-llm-mistral-7b-instruct

Generazione di testo

apache-2.0

No

Predefinito: ml.g5.12xlarge, ml.g6.24xlarge, ml.g6e.2xlarge, ml.p3.16xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • generate_best_price_performance(Genera, Bilanciato), generate_lowest_cost (Genera, Ottimizzato per i costi), (Interact, Balanced), interact_best_price_performance (Interact, Ottimizzato per i costi): interact_lowest_cost ml.g5.4xlarge, ml.g6.xlarge, ml.g6e.xlarge

  • generate_highest_throughput(Generazione, ottimizzazione del throughput): ml.g6e.48xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • generate_lowest_latency(Generazione, latenza ottimizzata): ml.g6e.12xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • interact_highest_throughput(Interact, velocità di trasmissione ottimizzata): ml.g6e.48xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • interact_lowest_latency(Interact, latenza ottimizzata): ml.g6.48xlarge, ml.g6e.48xlarge, ml.p5en.48xlarge

  • max_context_highest_throughput(Contesto massimo, velocità effettiva ottimizzata), (Contesto massimo, latenza ottimizzata), (Riepilogo, velocità effettiva ottimizzata), max_context_lowest_latency (Riepilogo, Latenza ottimizzata): ml.p4d.24xlarge, ml.p5.48xlarge, ml.p5en.48xlarge summarize_highest_throughput summarize_lowest_latency

  • max_context_lowest_cost(Contesto massimo, ottimizzazione dei costi), modify_best_price_performance (Modifica, bilanciamento), modify_lowest_cost (Modifica, ottimizzazione dei costi): ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g6e.xlarge

  • modify_highest_throughput(Modifica, velocità di trasmissione ottimizzata): ml.g6e.12xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • modify_lowest_latency(Modifica, latenza ottimizzata): ml.g6e.8xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • summarize_best_price_performance(Riassumi, bilanciato): ml.g6.12xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

  • summarize_lowest_cost(Riepilogo, ottimizzazione dei costi): ml.g5.24xlarge, ml.g6.12xlarge, ml.p4d.24xlarge

Mistralai

Mistral-7B-Instruct-v0.3

huggingface-llm-mistral-7b-instruct-v3

Generazione di testo

apache-2.0

No

Predefinito: ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.2xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • generate_best_price_performance(Genera, Bilanciato): ml.g5.4xlarge, ml.g6.xlarge, ml.g6e.2xlarge

  • generate_highest_throughput(Genera, produttività ottimizzata): ml.g6e.48xlarge, ml.p3.16xlarge, ml.p5.48xlarge

  • generate_lowest_cost(Generazione, ottimizzazione dei costi), (Interact, Balanced), (Interact, ottimizzazione dei costi): ml.g5.4xlarge, ml.g6.xlarge, ml.g6e.xlarge interact_best_price_performance interact_lowest_cost

  • generate_lowest_latency(Genera, latenza ottimizzata): ml.g6e.2xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

  • interact_highest_throughput(Interact, velocità di trasmissione ottimizzata): ml.g6e.48xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • interact_lowest_latency(Interact, latenza ottimizzata): ml.g6.48xlarge, ml.g6e.24xlarge, ml.p4d.24xlarge

  • max_context_highest_throughput(Contesto massimo, velocità effettiva ottimizzata), max_context_lowest_latency (contesto massimo, latenza ottimizzata), modify_highest_throughput (modifica, velocità effettiva ottimizzata), (modifica, latenza ottimizzata), modify_lowest_latency (riepilogo, velocità effettiva ottimizzata), summarize_highest_throughput (riepilogo, latenza ottimizzata): ml.p4d.24xlarge, ml.p5.48xlarge, ml.p5en.48xlarge summarize_lowest_latency

  • max_context_lowest_cost(Contesto massimo, ottimizzazione dei costi), modify_lowest_cost (Modifica, ottimizzazione dei costi): ml.g4dn.12xlarge, ml.g6.12xlarge, ml.g6e.xlarge

  • modify_best_price_performance(Modifica, bilanciato): ml.g6.12xlarge, ml.g6e.xlarge, ml.p4d.24xlarge

  • summarize_best_price_performance(Riassumi, Bilanciato): ml.g6.12xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

  • summarize_lowest_cost(Riepilogo, ottimizzazione dei costi): ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.12xlarge

Mistralai

Mistral-7B-Instruct-v0.3

huggingface-llm-mistral-7b-v3

Generazione di testo

apache-2.0

No

Predefinito: ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.2xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • generate_best_price_performance(Genera, Bilanciato): ml.g5.xlarge, ml.g6.2xlarge, ml.g6e.2xlarge

  • generate_highest_throughput(Genera, produttività ottimizzata): ml.p3.16xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • generate_lowest_cost(Generazione, ottimizzazione dei costi), (Interact, Balanced), (Interact, ottimizzazione dei costi): ml.g5.xlarge, ml.g6.xlarge, ml.g6e.xlarge interact_best_price_performance interact_lowest_cost

  • generate_lowest_latency(Generazione, latenza ottimizzata), (Riepilogo, velocità effettiva ottimizzata), summarize_highest_throughput (Riepilogo, latenza ottimizzata): ml.g6e.24xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge summarize_lowest_latency

  • interact_highest_throughput(Interact, Throughput ottimizzato), max_context_highest_throughput (Contesto massimo, Throughput ottimizzato), max_context_lowest_latency (Contesto massimo, Latenza ottimizzata), modify_highest_throughput (Modifica, Throughput ottimizzato), modify_lowest_latency (Modifica, Latenza ottimizzata): ml.p4d.24xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • interact_lowest_latency(Interact, latenza ottimizzata): ml.g6e.8xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • max_context_lowest_cost(Contesto massimo, ottimizzazione dei costi), (Modifica, ottimizzazione dei costi): ml.g4dn.12xlargemodify_lowest_cost, ml.g6.12xlarge, ml.g6e.xlarge

  • modify_best_price_performance(Modifica, bilanciato): ml.g6.12xlarge, ml.g6e.xlarge, ml.p4d.24xlarge

  • summarize_best_price_performance(Riassumi, Bilanciato): ml.g6.12xlarge, ml.g6e.12xlarge, ml.p4d.24xlarge

  • summarize_lowest_cost(Riepilogo, ottimizzazione dei costi): ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.12xlarge

Mistralai

Mistral-7B-v0.1

huggingface-llm-mistral-7b

Generazione di testo

apache-2.0

Predefinito: ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.12xlarge, ml.p3.16xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • generate_best_price_performance(Genera, Bilanciato), generate_lowest_cost (Genera, Ottimizzato per i costi), (Interact, Ottimizzato per i costi), interact_lowest_cost (Contesto massimo, Ottimizzato per i costi): max_context_lowest_cost ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g6.12xlarge

  • generate_highest_throughput(Genera, produttività ottimizzata): ml.g6e.48xlarge, ml.p3.16xlarge, ml.p5en.48xlarge

  • generate_lowest_latency(Generazione, latenza ottimizzata): ml.g6.12xlarge, ml.g6e.24xlarge, ml.p5en.48xlarge

  • interact_best_price_performance(Interact, Balanced), (Modify, ottimizzazione dei costi)modify_lowest_cost: ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.12xlarge

  • interact_highest_throughput(Interact, velocità di trasmissione ottimizzata): ml.g5.48xlarge, ml.g6e.48xlarge, ml.p3.16xlarge

  • interact_lowest_latency(Interact, latenza ottimizzata): ml.g6.48xlarge, ml.g6e.24xlarge, ml.p5en.48xlarge

  • max_context_highest_throughput(Contesto massimo, velocità effettiva ottimizzata), (Contesto massimo, latenza ottimizzata), (Modifica, velocità effettiva ottimizzata), max_context_lowest_latency (Modifica, latenza ottimizzata): ml.p4d.24xlarge, ml.p5.48xlarge, ml.p5en.48xlarge modify_highest_throughput modify_lowest_latency

  • modify_best_price_performance(Modifica, bilanciato): ml.g5.12xlarge, ml.g6.12xlarge, ml.p5.48xlarge

  • summarize_best_price_performance(Riepilogo, bilanciato), (Riepilogo, ottimizzazione del throughput), (Riepilogo, ottimizzazione dei costi), summarize_highest_throughput (Riepilogo, ottimizzazione della latenza): ml.g6e.24xlarge, ml.p5.48xlarge, ml.p5en.48xlarge summarize_lowest_cost summarize_lowest_latency

Mistralai

Mistral-Small-24B-Instruct-2501

huggingface-llm-mistral-small-24B-Instruct-2501

Generazione di testo

apache-2.0

No

Predefinito: ml.g5.48xlarge, ml.g6.48xlarge, ml.g6e.12xlarge, ml.g6e.24xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • generate_best_price_performance(Generate, Balanced), interact_best_price_performance (Interact, Balanced): ml.g5.48xlarge, ml.g6e.12xlarge, ml.p4d.24xlarge

  • generate_highest_throughput(Generazione, velocità effettiva ottimizzata), interact_highest_throughput (interazione, velocità effettiva ottimizzata), interact_lowest_latency (interazione, latenza ottimizzata), max_context_highest_throughput (contesto massimo, velocità effettiva ottimizzata), modify_highest_throughput (modifica, velocità effettiva ottimizzata): ml.g6e.48xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • generate_lowest_cost(Generazione, ottimizzazione dei costi), interact_lowest_cost (Interazione, ottimizzazione dei costi), max_context_lowest_cost (Contesto massimo, ottimizzazione dei costi), modify_lowest_cost (Modifica, ottimizzazione dei costi): ml.g5.48xlarge, ml.g6.48xlarge, ml.g6e.12xlarge

  • generate_lowest_latency(Genera, latenza ottimizzata), modify_lowest_latency (Modifica, Latenza ottimizzata): ml.g6e.24xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • max_context_lowest_latency(Contesto massimo, latenza ottimizzata): ml.g6.48xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • modify_best_price_performance(Modifica, bilanciato): ml.g6.48xlarge, ml.g6e.12xlarge, ml.p4d.24xlarge

  • summarize_best_price_performance(Riepilogo, bilanciato), (Riepilogo, ottimizzazione del throughput), (Riepilogo, ottimizzazione dei costi), summarize_highest_throughput (Riepilogo, ottimizzato per la latenza): ml.g6e.12xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge summarize_lowest_cost summarize_lowest_latency

Mistralai

Mistral-Small-3.1-24B-Base-2503

huggingface-vlm-mistral-small-3-1-24b-base-2503

Image-Text-to-Text

apache-2.0

No

ml.g6.12xlarge, ml.g6.16xlarge, ml.g6.24xlarge, ml.g6.48xlarge, ml.g6e.12xlarge

Mistralai

Mistral-Small-3.2-24B-Instruct-2506

huggingface-vlm-mistral-small-3-2-24b-instruct-2506

Image-Text-to-Text

apache-2.0

No

ml.g6.12xlarge, ml.g6.16xlarge, ml.g6.24xlarge, ml.g6.48xlarge, ml.g6e.12xlarge

Mistralai

Mixtral 8x7B

huggingface-llm-mixtral-8x7b

Generazione di testo

apache-2.0

ml.g5.48xlarge, ml.g6.48xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

Mistralai

Mixtral-8x22B V1

huggingface-llm-mixtral-8x22B

Generazione di testo

apache-2.0

No

ml.p4d.24xlarge, ml.p4de.24xlarge

Mistralia

Mixtral-8x22B-Instruct-v0.1

huggingface-llm-mistralai-mixtral-8x22B-instruct-v0-1

Generazione di testo

apache-2.0

No

Predefinito: ml.p4de.24xlarge, ml.p5.48xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • tgi(contenitore Text Generation Inference): ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge

Mistralai

Mixtral-8x7B-Instruct-v0.1

huggingface-llm-mixtral-8x7b-instruct

Generazione di testo

apache-2.0

Predefinito: ml.g5.48xlarge, ml.g6.48xlarge, ml.g6e.12xlarge, ml.p4d.24xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • generate_best_price_performance(Generate, Balanced), interact_best_price_performance (Interact, Balanced): ml.g5.48xlarge, ml.g6e.12xlarge, ml.p4d.24xlarge

  • generate_highest_throughput(Generazione, ottimizzazione del throughput), (Interact, Throughput ottimizzato), (Modifica, Throughput ottimizzato): ml.g6e.48xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge interact_highest_throughput modify_highest_throughput

  • generate_lowest_cost(Generazione, ottimizzazione dei costi), interact_lowest_cost (Interazione, ottimizzazione dei costi), max_context_lowest_cost (Contesto massimo, ottimizzazione dei costi), modify_lowest_cost (Modifica, ottimizzazione dei costi): ml.g5.48xlarge, ml.g6.48xlarge, ml.g6e.12xlarge

  • generate_lowest_latency(Genera, latenza ottimizzata): ml.g6.48xlarge, ml.g6e.48xlarge, ml.p5en.48xlarge

  • interact_lowest_latency(Interact, latenza ottimizzata), (Modifica, Latenza ottimizzata): modify_lowest_latency ml.g6e.12xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • max_context_highest_throughput(Contesto massimo, velocità effettiva ottimizzata), max_context_lowest_latency (Contesto massimo, latenza ottimizzata), summarize_highest_throughput (Riepilogo, velocità effettiva ottimizzata), summarize_lowest_latency (Riepilogo, Latenza ottimizzata): ml.p4d.24xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • modify_best_price_performance(Modifica, bilanciato): ml.g6.48xlarge, ml.g6e.12xlarge, ml.p4d.24xlarge

  • summarize_best_price_performance(Riepilogo, bilanciato), (Riepilogo, ottimizzazione dei summarize_lowest_cost costi): ml.g6e.12xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

Mistralai

Voxtral-Mini-4B-Realtime-2602

huggingface-asr-voxtral-mini-4b-realtime-2602

Generazione di testo

Apache-2.0

No

ml.g6.12xlarge, ml.g6.16xlarge, ml.g6.24xlarge, ml.g6.2xlarge, ml.g6.48xlarge, ml.g6.4xlarge, ml.g6.xlarge, ml.g6e.12xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.g6e.24xlarge, ml.g6e.6e.large 2xlarge, ml.g6e.48xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.g6e.xlarge, ml.g7e.2xlarge, ml.g7e.4xlarge

Moonshotai

Kimi-K2.5

huggingface-llm-kimi-k2-5

Generazione di testo

altro

No

ml.p5en.48xlarge

Moritzlaurer

MoritzLaurer MDeBERTa V3 Base Xnli multilingue Nli 2mil7

huggingface-zstc-moritzlaurer-mdeberta3base-xnli-mling-nli-2m7

Zero-Shot Classificazione

mit

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mosaico ml

MPT 7B BF16

huggingface-textgeneration1-mpt-7b-bf16

Generazione di testo

Apache-2.0

No

ml.g 5.16 x grande, ml.g 5.2 x grande, ml.g 5.4 x grande, ml.g 5.8 x grande

Mosaico ml

MPT 7B Instruct BF16

huggingface-textgeneration1-mpt-7b-instruct-bf16

Generazione di testo

CC-BY-SA-3.0

No

ml.g 5.16 x grande, ml.g 5.2 x grande, ml.g 5.4 x grande, ml.g 5.8 x grande

Sig.ra 8488

Bert Small2 Bert

huggingface-summarization-bert-small2bert-cnn-dailymail-summ

Sintesi testuale

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

Incorporamento di testi finanziari

mxnet-tcembedding-robertafin-base-uncased

Incorporamento del testo

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

RoBERTa-SEC-Large

mxnet-tcembedding-robertafin-large-uncased

Incorporamento del testo

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

RoBERTa-SEC-WIKI-Base

mxnet-tcembedding-robertafin-base-wiki-uncased

Incorporamento del testo

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

RoBERTa-SEC-WIKI-Large

mxnet-tcembedding-robertafin-large-wiki-uncased

Incorporamento del testo

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Naclbit

Diffusione stabile Naclbit Trinart V2

huggingface-txt2img-naclbit-trinart-stable-diffusion-v2

Text-to-Image

creativeml-openrail-m

No

ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Narsil

Narsil Deberta Large Mnli Zero Cls

huggingface-zstc-narsil-deberta-large-mnli-zero-cls

Zero-Shot Classificazione

mit

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Nexai

Nexaai Octopus-v2

huggingface-llm-nexaaidev-octopus-v2

Generazione di testo

cc-by-nc-4.0

No

ml.g5.16x grande, ml.g5.2x grande, ml.g5.4x grande, ml.g5.8x grande

Flusso Nexus

Flusso Nexus Starling-LM-7B-beta

huggingface-llm-nexusflow-starling-lm-7b-beta

Generazione di testo

apache-2.0

No

ml.g5.16xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge

Nessuna ricerca

Hermes 2 8B Pro-Llama-3

huggingface-llm-nousresearch-hermes-2-pro-llama-3-8B

Generazione di testo

lama 3

No

ml.g5.12xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge

Nessuna ricerca

Nous Hermes 2 SOLAR 10.7B

huggingface-llm-nousresearch-nous-hermes-2-solar-10-7b

Generazione di testo

apache-2.0

No

ml.g5.12x grande, ml.g5.24x grande, ml.g5.48x grande

Nova

Nova 2.0 Lite

nova-textgeneration-lite-v2

Generazione di testo

AWS Termini del servizio

Non applicabile

Nova

Nova 2.0 Micro

nova-textgeneration-micro-v2

Generazione di testo

Non applicabile

Non applicabile

Nova

Nova Lite

nova-textgeneration-lite

Generazione di testo

AWS Termini del servizio

Non applicabile

Nova

Nova Micro

nova-textgeneration-micro

Generazione di testo

AWS Termini del servizio

Non applicabile

Nova

Nova Pro

nova-textgeneration-pro

Generazione di testo

AWS Termini del servizio

Non applicabile

Nvidia

Nvidia 8B Llama3-ChatQA-1.5

huggingface-llm-nvidia-llama3-chatqa-1-5-8B

Generazione di testo

lama 3

No

ml.g5.12xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge

Nvidia

Nvidia Nemotron 3 Ultra

huggingface-reasoning-nvidia-nemotron-3-ultra-550b-a55b-nvfp4

Ragionamento

Apache-2.0

No

Predefinito: ml.g7e.48xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • modify_best_price_performance(Modify, Balanced), modify_highest_throughput (Modify, throughput ottimizzato), (Modify, ottimizzato per i costi), modify_lowest_cost (Modify, ottimizzato per la latenza): modify_lowest_latency ml.g7e.48xlarge, ml.p5.48xlarge

  • summarize_best_price_performance(Riepilogo, bilanciato), summarize_highest_throughput (Riepilogo, velocità effettiva ottimizzata), summarize_lowest_cost (Riepilogo, ottimizzazione dei costi), summarize_lowest_latency (Riepilogo, latenza ottimizzata): ml.g7e.48xlarge, ml.p5en.48xlarge

Nvidia

Nvidia Nemotron3 Nano Omni

huggingface-vlm-nvidia-nemotron3-nano-omni-30ba3b-reasoning-fp8

Image-Text-to-Text

altro

No

Predefinito: ml.g6.12xlarge, ml.g6.24xlarge, ml.g6e.12xlarge, ml.g6e.24xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • generate_best_price_performance(Generate, Balanced), generate_lowest_cost (Genera, ottimizzato per i costi), (Interact, Cost optimized), interact_lowest_cost (Modify, Balanced), modify_best_price_performance (Modify, Ottimizzato per i costi): modify_lowest_cost ml.g6.12xlarge, ml.g6e.xlarge, ml.g6e.xlarge

  • generate_highest_throughput(Genera, produttività ottimizzata): ml.g6.48xlarge, ml.g6e.12xlarge, ml.g6e.24xlarge

  • generate_lowest_latency(Generazione, latenza ottimizzata), (Interazione, Latenza ottimizzata): interact_lowest_latency ml.g6.12xlarge, ml.g6e.16xlarge, ml.g6e.8xlarge

  • interact_best_price_performance(Interact, bilanciato): ml.g6.12xlarge, ml.g6e.4xlarge, ml.g6e.xlarge

  • interact_highest_throughput(Interact, velocità di trasmissione ottimizzata): ml.g6.12xlarge, ml.g6e.12xlarge, ml.g6e.48xlarge

  • max_context_highest_throughput(Contesto massimo, velocità effettiva ottimizzata), (modifica, velocità effettiva ottimizzata), (riepilogo, velocità effettiva ottimizzata): ml.g6.12xlarge, ml.g6e.12xlarge, ml.g6e.24xlarge modify_highest_throughput summarize_highest_throughput

  • max_context_lowest_cost(Contesto massimo, ottimizzazione dei costi), summarize_best_price_performance (Riepilogo, Bilanciato), summarize_lowest_cost (Riepilogo, ottimizzazione dei costi): ml.g6.12xlarge, ml.g6.24xlarge, ml.g6e.12xlarge

  • max_context_lowest_latency(Contesto massimo, latenza ottimizzata): ml.g6.24xlarge, ml.g6e.12xlarge, ml.g6e.24xlarge

  • modify_lowest_latency(Modifica, latenza ottimizzata): ml.g6.12xlarge, ml.g6e.16xlarge, ml.g6e.4xlarge

  • summarize_lowest_latency(Riepilogo, latenza ottimizzata): ml.g6.24xlarge, ml.g6e.24xlarge, ml.g6e.48xlarge

Nvidia

NVIDIA-Nemotron-3-Nano-30B-A3B-BF16

huggingface-reasoning-nvidia-nemotron-3-nano-30b-a3b-bf16

Ragionamento

altro

Predefinito: ml.g6e.24xlarge, ml.g7e.12xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • generate_best_price_performance(Generazione, bilanciamento), (generazione, ottimizzazione del throughput), generate_highest_throughput (generazione, ottimizzazione dei costi), generate_lowest_cost (generazione ottimizzata per la latenza): ml.g6.24xlarge, generate_lowest_latency ml.g6e.24xlarge, ml.g7e.12xlarge

  • interact_best_price_performance(Interact, Balanced), interact_highest_throughput (Interact, Throughput ottimizzato), interact_lowest_cost (Interact, ottimizzato per i costi), interact_lowest_latency (Interact, Latenza ottimizzata): ml.g6.12xlarge, ml.g6e.24xlarge, ml.g7e.4xlarge

  • modify_best_price_performance(Modifica, bilanciato), modify_lowest_cost (Modifica, ottimizzazione dei costi): ml.g6.24xlarge, ml.g6.48xlarge, ml.g7e.24xlarge

  • modify_highest_throughput(Modifica, velocità di trasmissione ottimizzata): ml.g6.48xlarge, ml.g7e.12xlarge, ml.g7e.24xlarge

  • modify_lowest_latency(Modifica, latenza ottimizzata): ml.g6.12xlarge, ml.g6.24xlarge, ml.g7e.4xlarge

  • summarize_best_price_performance(Riepilogo, bilanciato), (Riepilogo, ottimizzazione del throughput), (Riepilogo, ottimizzazione dei costi): ml.g6e.12xlarge, ml.g7e.24xlarge, ml.g7e.48xlarge summarize_highest_throughput summarize_lowest_cost

  • summarize_lowest_latency(Riepilogo, latenza ottimizzata): ml.g6e.12xlarge, ml.g7e.12xlarge, ml.g7e.24xlarge

Nvidia

NVIDIA-Nemotron-3-Super-120B-A12B-BF16

huggingface-llm-nvidia-nemotron-3-super-120b-a12b-bf16

Generazione di testo

Apache-2.0

Predefinito: ml.p5en.48xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • generate_best_price_performance(Generate, Balanced), generate_lowest_cost (Generate, Ottimizzato in termini di costi): ml.g6e.48xlarge, ml.g7e.48xlarge, ml.p5.48xlarge

  • generate_highest_throughput(Generazione, ottimizzazione del throughput), (modify_highest_throughputModifica, Throughput ottimizzato): ml.g7e.48xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • generate_lowest_latency(Generazione, latenza ottimizzata): ml.g6e.48xlarge, ml.g7e.24xlarge, ml.p5en.48xlarge

  • interact_best_price_performance(Interact, Balanced), (Interact, Throughput ottimizzato), (Interact, ottimizzato per i costi), interact_highest_throughput (Interact, ottimizzato per la latenza): ml.g6e.48xlarge, ml.p5.48xlarge, ml.p5en.48xlarge interact_lowest_cost interact_lowest_latency

  • modify_best_price_performance(Modifica, bilanciato), modify_lowest_cost (Modifica, ottimizzazione dei costi): ml.g6e.48xlarge, ml.g7e.24xlarge, ml.p5.48xlarge

  • modify_lowest_latency(Modifica, latenza ottimizzata): ml.g7e.24xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • summarize_best_price_performance(Riepilogo, bilanciato), (Riepilogo, ottimizzazione del throughput), (Riepilogo, ottimizzazione dei costi), summarize_highest_throughput (Riepilogo, latenza ottimizzata): ml.g7e.24xlarge, ml.g7e.48xlarge, ml.p5.48xlarge summarize_lowest_cost summarize_lowest_latency

Nvidia

NVIDIA-Nemotron-3-Super-120B-A12B-FP8

huggingface-reasoning-nvidia-nemotron-3-super-120b-a12b-fp8

Ragionamento

altro

No

Predefinito: ml.g7e.24xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • generate_best_price_performance(Generazione, bilanciamento), (generazione, ottimizzazione del throughput), generate_highest_throughput (generazione, ottimizzazione dei costi), generate_lowest_cost (generazione ottimizzata per la latenza): ml.g6e.48xlarge, generate_lowest_latency ml.g7e.24xlarge, ml.g7e.48xlarge

  • interact_best_price_performance(Interact, Balanced), interact_highest_throughput (Interact, throughput ottimizzato), interact_lowest_cost (Interact, ottimizzazione dei costi), interact_lowest_latency (Interact, Latenza ottimizzata), summarize_best_price_performance (Summary, Balanced), summarize_highest_throughput (Summary, Throughput ottimizzato), summarize_lowest_cost (Summary, Ottimizzato per costi), summarize_lowest_latency (Summary, Latenza ottimizzata): ml.g7e.24xlarge, ml.g7e.48xlarge

Nvidia

NVIDIA-Nemotron-Nano-12B-v2

huggingface-reasoning-nvidia-nemotron-nano-12b-v2

Ragionamento

Apache-2.0

No

Predefinito: ml.g6e.48xlarge, ml.g7e.12xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • generate_best_price_performance(Generate, Balanced), generate_lowest_cost (Generate, Ottimizzato in termini di costi): ml.g6.12xlarge, ml.g6e.xlarge, ml.g7e.2xlarge

  • generate_highest_throughput(Genera, produttività ottimizzata): ml.g6.48xlarge, ml.g6e.48xlarge, ml.g7e.12xlarge

  • generate_lowest_latency(Generazione, latenza ottimizzata): ml.g6.24xlarge, ml.g6e.2xlarge, ml.g7e.2xlarge

  • modify_best_price_performance(Modifica, bilanciato), (Modifica, ottimizzazione dei costi)modify_lowest_cost: ml.g6.12xlarge, ml.g6e.12xlarge, ml.g7e.2xlarge

  • modify_highest_throughput(Modifica, throughput ottimizzato), summarize_best_price_performance (Riepilogo, Bilanciato), summarize_highest_throughput (Riepilogo, Throughput ottimizzato), summarize_lowest_cost (Riepilogo, ottimizzazione dei costi), summarize_lowest_latency (Riepilogo, Latenza ottimizzata): ml.g6.48xlarge, ml.g6e.12xlarge, ml.g7e.12xlarge

  • modify_lowest_latency(Modifica, latenza ottimizzata): ml.g6.24xlarge, ml.g6e.24xlarge, ml.g7e.12xlarge

Openai

gpt-oss-120b

openai-reasoning-gpt-oss-120b

Ragionamento

apache-2.0

Predefinito: ml.g6e.48xlarge, ml.g7e.2xlarge, ml.p5.48xlarge, ml.p5e.48xlarge, ml.p5en.48xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • lmi(contenitore Large Model Inference): ml.g6e.48xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge, ml.p5e.48xlarge, ml.p5en.48xlarge, ml.p5en.48xlarge

Openai

gpt-oss-20b

openai-reasoning-gpt-oss-20b

Ragionamento

apache-2.0

ml.g5.12xlarge, ml.g5.24xlarge, ml.g6.12xlarge, ml.g6.24xlarge, ml.g7e.2xlarge, ml.p5.48xlarge, ml.p5e.48xlarge, ml.p5en.48xlarge

Apri ai

filtro per la privacy

openai-tokenclassification-privacy-filter

Classificazione dei token

Apache-2.0

No

ml.m5.2xlarge, ml.m5.4xlarge, ml.m5.xlarge

Openai

Base Whisper

huggingface-asr-whisper-base

Riconoscimento vocale automatico

apache-2.0

No

ml.g4dn.2xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Openai

Whisper Large

huggingface-asr-whisper-large

Riconoscimento vocale automatico

apache-2.0

No

ml.g4dn.2xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Openai

Whisper Large V2

huggingface-asr-whisper-large-v2

Riconoscimento vocale automatico

apache-2.0

No

ml.g4dn.2xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Openai

Whisper Large V3

huggingface-asr-whisper-large-v3

Riconoscimento vocale automatico

apache-2.0

No

ml.g4dn.2xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Openai

Whisper Large V3 Turbo

huggingface-asr-whisper-large-v3-turbo

Riconoscimento vocale automatico

mit

No

ml.g4dn.2xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Openai

Whisper Medium

huggingface-asr-whisper-medium

Riconoscimento vocale automatico

apache-2.0

No

ml.g4dn.2xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Openai

Whisper Small

huggingface-asr-whisper-small

Riconoscimento vocale automatico

apache-2.0

No

ml.g4dn.2xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Openai

Whisper Tiny

huggingface-asr-whisper-tiny

Riconoscimento vocale automatico

apache-2.0

No

ml.g4dn.2xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Openai-Community

GPT 2

huggingface-textgeneration-gpt2

Generazione di testo

mit

No

ml.g 5.16 x grande, ml.g 5.2 x grande, ml.g 5.4 x grande, ml.g 5.8 x grande

Openai-Community

GPT-2 XL

huggingface-textgeneration1-gpt-2-xl

Generazione di testo

mit

ml.g 5.16x grande, ml.g5.2x grande, ml.g5.4x grande, ml.g5.8x grande

Openai-Community

Rilevatore OpenAI Roberta Base

huggingface-eqa-roberta-base-openai-detector

Risposta alle domande

mit

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Openai-Community

Rilevatore OpenAI Roberta Base

huggingface-spc-roberta-base-openai-detector

Fill-Mask

mit

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Openai-Community

Rilevatore OpenAI Roberta Base

huggingface-tc-roberta-base-openai-detector

Classificazione del testo

mit

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Openai-Community

Rilevatore OpenAI Roberta Large

huggingface-spc-roberta-large-openai-detector

Fill-Mask

mit

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Openai-Community

Rilevatore OpenAI Roberta Large

huggingface-tc-roberta-large-openai-detector

Classificazione del testo

mit

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Openlm-Research

Apri Llama 7B V2

huggingface-llm-openlm-research-open-llama-7b-v2

Generazione di testo

apache-2.0

No

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge

Philschmid

Bart Large CNN samsum

huggingface-summarization-bart-large-cnn-samsum

Sintesi testuale

mit

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Philschmid

Flan-T5 Modello base Fine-tuned sul set di dati Samsum

huggingface-text2text-flan-t5-base-samsum

Generazione Text2Text

apache-2.0

No

ml.g5.16xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge

Torcia

Alexa TM20B

pytorch-textgeneration1-alexa20b

Generazione di testo

licenza software amazon

No

ml.g4dn.12xlarge, ml.g5.16xlarge, ml.p3.16xlarge, ml.p3.8xlarge

Qwen

Anteprima QVQ 72B

huggingface-vlm-qvq-72b-preview

Image-Text-to-Text

altro

No

ml.g5.48x grande, ml.g6.48x grande, ml.p4d.24x grande

Qwen

Qwen2 0,5 B

huggingface-llm-qwen2-0-5b

Generazione di testo

apache-2.0

No

ml.g5.12xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p4d.24xlarge

Qwen

Istruzioni Qwen2 0.5B

huggingface-llm-qwen2-0-5b-instruct

Generazione di testo

apache-2.0

No

ml.g5.12xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p4d.24xlarge

Qwen

Qwen2-1.5B

huggingface-llm-qwen2-1-5b

Generazione di testo

apache-2.0

No

Predefinito: ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.2xlarge, ml.g6e.4xlarge, ml.g6e.xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • generate_best_price_performance(Genera, Bilanciato): ml.g4dn.xlarge, ml.g5.xlarge, ml.g6e.xlarge

  • generate_highest_throughput(Genera, produttività ottimizzata): ml.g5.24xlarge, ml.g6.24xlarge, ml.g6e.24xlarge

  • generate_lowest_cost(Generazione, ottimizzazione dei costi), (Interact, Balanced), (Interact, ottimizzazione dei costi), interact_best_price_performance (Modifica, ottimizzazione dei costi): ml.g4dn.xlarge, ml.g5.xlarge, ml.g6.xlarge interact_lowest_cost modify_lowest_cost

  • generate_lowest_latency(Genera, latenza ottimizzata): ml.g5.4xlarge, ml.g6.4xlarge, ml.g6e.2xlarge

  • interact_highest_throughput(Interact, velocità di trasmissione ottimizzata): ml.g5.12xlarge, ml.g6.24xlarge, ml.g6e.12xlarge

  • interact_lowest_latency(Interact, latenza ottimizzata): ml.g5.24xlarge, ml.g6.24xlarge, ml.g6e.2xlarge

  • max_context_highest_throughput(Contesto massimo, velocità effettiva ottimizzata): ml.g5.24xlarge, ml.g6.12xlarge, ml.g6e.24xlarge

  • max_context_lowest_cost(Contesto massimo, ottimizzazione dei costi): ml.g4dn.12xlarge, ml.g6.12xlarge, ml.g6e.xlarge

  • max_context_lowest_latency(Contesto massimo, latenza ottimizzata): ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g6.24xlarge

  • modify_best_price_performance(Modifica, bilanciato): ml.g4dn.xlarge, ml.g5.2xlarge, ml.g6e.xlarge

  • modify_highest_throughput(Modifica, velocità di trasmissione ottimizzata): ml.g5.12xlarge, ml.g6.24xlarge, ml.g6e.24xlarge

  • modify_lowest_latency(Modifica, latenza ottimizzata): ml.g5.4xlarge, ml.g6.12xlarge, ml.g6e.4xlarge

  • summarize_best_price_performance(Riassumi, bilanciato): ml.g5.xlarge, ml.g6.2xlarge, ml.g6e.2xlarge

  • summarize_highest_throughput(Riepilogo, produttività ottimizzata): ml.g5.16xlarge, ml.g6.24xlarge, ml.g6e.2xlarge

  • summarize_lowest_cost(Riepilogo, ottimizzazione dei costi): ml.g5.xlarge, ml.g6.xlarge, ml.g6e.xlarge

  • summarize_lowest_latency(Riassumi, latenza ottimizzata): ml.g5.4xlarge, ml.g6.24xlarge, ml.g6e.8xlarge

Qwen

Qwen2-1.5B-Instruct

huggingface-llm-qwen2-1-5b-instruct

Generazione di testo

apache-2.0

No

Predefinito: ml.g4dn.xlarge, ml.g5.2xlarge, ml.g5.xlarge, ml.g6.2xlarge, ml.g6e.xlarge, ml.p3.2xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • generate_best_price_performance(Genera, Bilanciato), interact_best_price_performance (Interagisci, Bilanciato), modify_best_price_performance (Modifica, Bilanciato): ml.g4dn.xlarge, ml.g5.xlarge, ml.g6e.xlarge

  • generate_highest_throughput(Genera, velocità di trasmissione ottimizzata): ml.g5.12xlarge, ml.g6.24xlarge, ml.g6e.24xlarge

  • generate_lowest_cost(Generazione, ottimizzazione dei costi), (Interazione, ottimizzazione dei costi), (Contesto massimo, ottimizzazione dei costi), interact_lowest_cost (Modifica, ottimizzazione dei costi): ml.g4dn.xlarge, ml.g5.xlarge, ml.g6.xlarge max_context_lowest_cost modify_lowest_cost

  • generate_lowest_latency(Genera, latenza ottimizzata): ml.g5.8xlarge, ml.g6.24xlarge, ml.g6e.24xlarge

  • interact_highest_throughput(Interact, velocità di trasmissione ottimizzata): ml.g5.24xlarge, ml.g6.12xlarge, ml.g6e.12xlarge

  • interact_lowest_latency(Interact, latenza ottimizzata): ml.g4dn.8xlarge, ml.g6.12xlarge, ml.g6e.4xlarge

  • max_context_highest_throughput(Contesto massimo, velocità effettiva ottimizzata): ml.g5.24xlarge, ml.g6.24xlarge, ml.g6e.12xlarge

  • max_context_lowest_latency(Contesto massimo, latenza ottimizzata): ml.g4dn.12xlarge, ml.g6.12xlarge, ml.g6e.4xlarge

  • modify_highest_throughput(Modifica, velocità di trasmissione ottimizzata): ml.g5.24xlarge, ml.g6.24xlarge, ml.g6e.24xlarge

  • modify_lowest_latency(Modifica, latenza ottimizzata): ml.g5.2xlarge, ml.g6.12xlarge, ml.g6e.2xlarge

  • summarize_best_price_performance(Riepilogo, bilanciato), (Riepilogo, ottimizzazione dei costi)summarize_lowest_cost: ml.g5.xlarge, ml.g6.xlarge, ml.g6e.xlarge

  • summarize_highest_throughput(Riepilogo, produttività ottimizzata): ml.g5.4xlarge, ml.g6.12xlarge, ml.g6e.24xlarge

  • summarize_lowest_latency(Riassumi, latenza ottimizzata): ml.g5.8xlarge, ml.g6.8xlarge, ml.g6e.16xlarge

Qwen

Qwen2-7B

huggingface-llm-qwen2-7b

Generazione di testo

apache-2.0

No

ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g5.24xlarge, ml.g6.12xlarge, ml.g6.24xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.g6e.2xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.g6e.xlarge

Qwen

Qwen2-7B-Instruct

huggingface-llm-qwen2-7b-instruct

Generazione di testo

apache-2.0

No

ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g5.24xlarge, ml.g6.12xlarge, ml.g6.24xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge

Qwen

Qwen2-VL-7B-Instruct

huggingface-vlm-qwen2-vl-7b-instruct

Generazione di testo

apache-2.0

No

Predefinito: ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.12xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.g6e.xlarge, ml.g6e.xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • generate_best_price_performance(Genera, Bilanciato): ml.g5.xlarge, ml.g6.2xlarge, ml.g6e.xlarge

  • generate_highest_throughput(Genera, produttività ottimizzata): ml.g5.24xlarge, ml.g6.12xlarge, ml.g6e.24xlarge

  • generate_lowest_cost(Generazione, ottimizzazione dei costi), (Interazione, ottimizzazione dei interact_lowest_cost costi): ml.g5.xlarge, ml.g6.xlarge, ml.g6e.xlarge

  • generate_lowest_latency(Genera, latenza ottimizzata): ml.g5.8xlarge, ml.g6.12xlarge, ml.g6e.8xlarge

  • interact_best_price_performance(Interagisci, Bilanciato): ml.g5.2xlarge, ml.g6.xlarge, ml.g6e.xlarge

  • interact_highest_throughput(Interact, throughput ottimizzato), (Modifica, Throughput ottimizzato): ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.24xlarge modify_highest_throughput

  • interact_lowest_latency(Interact, latenza ottimizzata): ml.g5.12xlarge, ml.g6.24xlarge, ml.g6e.4xlarge

  • max_context_highest_throughput(Contesto massimo, velocità effettiva ottimizzata): ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.12xlarge

  • max_context_lowest_cost(Contesto massimo, ottimizzazione dei costi): ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.xlarge

  • max_context_lowest_latency(Contesto massimo, latenza ottimizzata): ml.g5.24xlarge, ml.g6.24xlarge, ml.g6e.xlarge

  • modify_best_price_performance(Modifica, bilanciatomodify_lowest_cost), (Modifica, ottimizzazione dei costi): ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.2xlarge

  • modify_lowest_latency(Modifica, latenza ottimizzata): ml.g5.12xlarge, ml.g6.24xlarge, ml.g6e.16xlarge

  • summarize_best_price_performance(Riepilogo, bilanciato), (Riepilogo, velocità effettiva ottimizzata), (Riepilogo, ottimizzazione dei costi), summarize_highest_throughput (Riepilogo, latenza ottimizzata): ml.g6e.12xlarge summarize_lowest_cost summarize_lowest_latency

Qwen

Qwen2.5 Istruzione 14B

huggingface-llm-qwen2-5-14b-instruct

Generazione di testo

apache-2.0

ml.g5.24xlarge, ml.g5.48xlarge, ml.g6.24xlarge, ml.g6.48xlarge, ml.p4d.24xlarge

Qwen

Qwen2.5 Istruzione 32B

huggingface-llm-qwen2-5-32b-instruct

Generazione di testo

apache-2.0

ml.g5.48xlarge, ml.g6.48xlarge, ml.p4d.24xlarge

Qwen

Qwen2.5 Coder 32B Instruct

huggingface-llm-qwen2-5-coder-32b-instruct

Generazione di testo

apache-2.0

No

ml.g5.24xlarge, ml.g5.48xlarge, ml.g6.24xlarge, ml.g6.48xlarge, ml.p4d.24xlarge

Qwen

Qwen2.5 Coder 7B Instruct

huggingface-llm-qwen2-5-coder-7b-instruct

Generazione di testo

apache-2.0

No

ml.g5.16xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g6.16xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.p4d.24xlarge

Qwen

Qwen2.5-72B-Instruct

huggingface-llm-qwen2-5-72b-instruct

Generazione di testo

altro

Predefinito: ml.g6e.48xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • generate_best_price_performance(Genera, Bilanciato): ml.g5.48xlarge, ml.g6e.12xlarge, ml.p4d.24xlarge

  • generate_lowest_cost(Genera, ottimizzazione dei costi), (Interactinteract_lowest_cost, ottimizzazione dei costi): ml.g5.48xlarge, ml.g6.48xlarge, ml.g6e.12xlarge

  • generate_lowest_latency(Generazione, latenza ottimizzata): ml.g6e.12xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • interact_best_price_performance(Interact, bilanciato): ml.g6.48xlarge, ml.g6e.12xlarge, ml.p4d.24xlarge

  • summarize_best_price_performance(Riepilogo, bilanciato), (Riepilogo, ottimizzazione del throughput), (Riepilogo, ottimizzazione dei costi), summarize_highest_throughput (Riepilogo, latenza ottimizzata): ml.p5en.48xlarge summarize_lowest_cost summarize_lowest_latency

Qwen

Qwen2.5-7B-Instruct

huggingface-llm-qwen2-5-7b-instruct

Generazione di testo

apache-2.0

Predefinito: ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.2xlarge, ml.g6e.4xlarge, ml.g6e.xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • generate_best_price_performance(Genera, Bilanciato): ml.g5.xlarge, ml.g6.2xlarge, ml.g6e.xlarge

  • generate_highest_throughput(Generazione, ottimizzazione del throughput), (Interazione, ottimizzazione della latenza), (Riepilogo, Latenza ottimizzata): ml.g5.12xlarge, ml.g6.12xlarge, interact_lowest_latency ml.g6e.24xlarge summarize_lowest_latency

  • generate_lowest_cost(Genera, ottimizzato per i costi), (Interact, Balanced), (Interact, Ottimizzato per i costi): ml.g5.xlarge, ml.g6.xlarge, ml.g6e.xlarge interact_best_price_performance interact_lowest_cost

  • generate_lowest_latency(Genera, latenza ottimizzata): ml.g4dn.12xlarge, ml.g6.12xlarge, ml.g6e.16xlarge

  • interact_highest_throughput(Interact, throughput ottimizzato), (Riepilogo, summarize_highest_throughput Throughput ottimizzato): ml.g5.12xlarge, ml.g6.24xlarge, ml.g6e.24xlarge

  • max_context_highest_throughput(Contesto massimo, velocità effettiva ottimizzata): ml.g5.12xlarge, ml.g6.24xlarge, ml.g6e.12xlarge

  • max_context_lowest_cost(Contesto massimo, ottimizzazione dei costi), (Modifica, bilanciato), (Modifica, ottimizzazione dei costi): ml.g4dn.12xlarge, ml.g6.12xlarge, ml.g6e.xlarge modify_best_price_performance modify_lowest_cost

  • max_context_lowest_latency(Contesto massimo, latenza ottimizzata): ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g6.12xlarge

  • modify_highest_throughput(Modifica, velocità di trasmissione ottimizzata): ml.g5.24xlarge, ml.g6.12xlarge, ml.g6e.24xlarge

  • modify_lowest_latency(Modifica, latenza ottimizzata): ml.g4dn.12xlarge, ml.g6.24xlarge, ml.g6e.2xlarge

  • summarize_best_price_performance(Riepilogo, bilanciato), (Riepilogo, ottimizzazione dei costi)summarize_lowest_cost: ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.12xlarge

Qwen

Qwen 3 14B

huggingface-reasoning-qwen3-14b

Ragionamento

apache-2.0

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.48xlarge, ml.g6.12xlarge, ml.g6.24xlarge, ml.g6.48xlarge, ml.p4d.24xlarge

Qwen

Qwen3-0.6B

huggingface-reasoning-qwen3-06b

Ragionamento

apache-2.0

Predefinito: ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.2xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • generate_best_price_performance(Genera, Bilanciato), generate_lowest_cost (Genera, Ottimizzato per i costi), (Interact, Balanced), interact_best_price_performance (Interact, Ottimizzato per i costi), interact_lowest_cost modify_lowest_cost (Modifica, Ottimizzato per i costi): ml.g4dn.xlarge, ml.g5.xlarge, ml.g6.xlarge

  • generate_highest_throughput(Genera, throughput ottimizzato), interact_highest_throughput (Interact, Throughput ottimizzato), modify_highest_throughput (Modifica, Throughput ottimizzato): ml.g6e.24xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • generate_lowest_latency(Generazione, latenza ottimizzata): ml.g5.8xlarge, ml.g6.12xlarge, ml.p5en.48xlarge

  • interact_lowest_latency(Interact, latenza ottimizzata): ml.g4dn.16xlarge, ml.g6e.48xlarge, ml.p5en.48xlarge

  • max_context_highest_throughput(Contesto massimo, velocità effettiva ottimizzata): ml.g6e.48xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • max_context_lowest_cost(Contesto massimo, ottimizzazione dei costi), (Riepilogo, ottimizzazione dei summarize_lowest_cost costi): ml.g4dn.12xlarge, ml.g6.12xlarge, ml.g6e.xlarge

  • max_context_lowest_latency(Contesto massimo, latenza ottimizzata): ml.g4dn.12xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • modify_best_price_performance(Modifica, bilanciato): ml.g5.xlarge, ml.g6.xlarge, ml.g6e.xlarge

  • modify_lowest_latency(Modifica, latenza ottimizzata): ml.g6e.2xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • summarize_best_price_performance(Riassumi, bilanciato): ml.g6.12xlarge, ml.g6e.xlarge, ml.p4d.24xlarge

  • summarize_highest_throughput(Riepilogo, throughput ottimizzato): ml.g6e.12xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • summarize_lowest_latency(Riepilogo, latenza ottimizzata): ml.g6e.8xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

Qwen

Qwen3-1.7B

huggingface-reasoning-qwen3-1-7b

Ragionamento

apache-2.0

ml.g4dn.12xlarge, ml.g4dn.16xlarge, ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g6.12xlarge, ml.g6.24xlarge xlarge, ml.g6.48xlarge, ml.g6.8xlarge, ml.g6.xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.g6e.2xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.g6e.xlarge, ml.p3.2xlarge, ml.p4d.24xlarge

Qwen

Qwen3-30B-A3B

huggingface-reasoning-qwen3-30b-a3b

Ragionamento

apache-2.0

No

ml.g5.24xlarge

Qwen

Qwen3-30B-A3B-Instruct-2507

huggingface-reasoning-qwen3-30b-a3b-instruct-2507

Generazione di testo

apache-2.0

No

ml.g5.48xlarge, ml.g6.48xlarge, ml.g6e.12xlarge, ml.p4de.24xlarge

Qwen

Qwen3-30B-A3B-Thinking-2507

huggingface-reasoning-qwen3-30b-a3b-thinking-2507

Ragionamento

apache-2.0

No

ml.g6e.12xlarge

Qwen

Qwen3-32B

huggingface-reasoning-qwen3-32b

Ragionamento

apache-2.0

Predefinito: ml.g5.48xlarge, ml.g6.48xlarge, ml.g6e.12xlarge, ml.p4d.24xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • generate_best_price_performance(Generate, Balanced), (Interact, Balanced), interact_best_price_performance (Summary, Balanced), (Summary, Balanced), summarize_best_price_performance (Summarize, ottimizzazione dei costi): summarize_lowest_cost ml.g6e.12xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

  • generate_highest_throughput(Generazione, velocità effettiva ottimizzata), generate_lowest_latency (generazione, latenza ottimizzata), interact_highest_throughput (interazione, velocità effettiva ottimizzata), max_context_highest_throughput (contesto massimo, velocità effettiva ottimizzata), max_context_lowest_latency (contesto massimo, latenza ottimizzata), summarize_highest_throughput (riepilogo, velocità effettiva ottimizzata), summarize_lowest_latency (riepilogo, latenza ottimizzata): ml.p4d.24xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • generate_lowest_cost(Generazione, ottimizzazione dei costi), max_context_lowest_cost (Contesto massimo, ottimizzazione dei costi): ml.g5.48xlarge, ml.g6.48xlarge, ml.g6e.12xlarge

  • interact_lowest_cost(Interact, ottimizzazione dei costi): ml.g5.48xlarge, ml.g6.24xlarge, ml.g6e.12xlarge

  • interact_lowest_latency(Interact, latenza ottimizzata): ml.g6e.24xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • modify_best_price_performance(Modifica, bilanciato), (Modifica, ottimizzazione dei costi)modify_lowest_cost: ml.g6.48xlarge, ml.g6e.12xlarge, ml.p4d.24xlarge

  • modify_highest_throughput(Modifica, velocità di trasmissione ottimizzata): ml.g6e.48xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • modify_lowest_latency(Modifica, latenza ottimizzata): ml.g6e.12xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

Qwen

Qwen3-4B

huggingface-reasoning-qwen3-4b

Ragionamento

apache-2.0

ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.xlarge, ml.g5.xlarge, ml.g6.12xlarge, ml.g6.16xlarge, ml.g6.24xlarge grande, ml.g6.2xlarge, ml.g6.48xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.g6.xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.g6e.2xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.g6e.xlarge, ml.p4d.24xlarge

Qwen

Qwen3-4B-Instruct-2507

huggingface-reasoning-qwen3-4b-instruct-2507

Ragionamento

apache-2.0

No

ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.48xlarge, ml.g6.12xlarge, ml.g6.24xlarge, ml.g6.48xlarge, ml.g6e.12xlarge, ml.g6e.24xlarge, ml.p4d.24xlarge, ml.p4d.24xlarge

Qwen

Qwen3-8B

huggingface-reasoning-qwen3-8b

Ragionamento

apache-2.0

Predefinito: ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.12xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • generate_best_price_performance(Genera, Bilanciato), generate_lowest_cost (Genera, Ottimizzato per i costi), (Interact, Balanced), interact_best_price_performance (Interact, Ottimizzato per i costi): interact_lowest_cost ml.g5.2xlarge, ml.g6.xlarge, ml.g6e.xlarge

  • generate_highest_throughput(Generazione, ottimizzazione del throughput): ml.g6e.48xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • generate_lowest_latency(Genera, latenza ottimizzata), modify_highest_throughput (Modifica, velocità effettiva ottimizzata), modify_lowest_latency (Modifica, latenza ottimizzata), (Riepilogo, velocità effettiva ottimizzata), summarize_highest_throughput (Riepilogo, summarize_lowest_latency Latenza ottimizzata): ml.g6e.24xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • interact_highest_throughput(Interact, Throughput ottimizzato), max_context_highest_throughput (Contesto massimo, Throughput ottimizzato), max_context_lowest_latency (Contesto massimo, Latenza ottimizzata): ml.p4d.24xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • interact_lowest_latency(Interact, latenza ottimizzata): ml.g6.48xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • max_context_lowest_cost(Contesto massimo, ottimizzazione dei costi): ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g6.12xlarge

  • modify_best_price_performance(Modifica, bilanciato): ml.g5.12xlarge, ml.g6e.xlarge, ml.p5.48xlarge

  • modify_lowest_cost(Modifica, ottimizzazione dei costi): ml.g5.12xlarge, ml.g6.24xlarge, ml.g6e.xlarge

  • summarize_best_price_performance(Riepilogo, bilanciato), (Riepilogo, ottimizzazione dei costi): ml.g5.24xlarge, ml.g6e.12xlarge, ml.p5.48xlarge summarize_lowest_cost

Qwen

Qwen3-ASR-1.7B

huggingface-asr-qwen3-asr-1-7b

Riconoscimento vocale automatico

Apache-2.0

No

ml.g6.2xlarge, ml.g6.xlarge

Qwen

Qwen3-Coder-30B-A3B-Instruct

huggingface-reasoning-qwen3-coder-30b-a3b-instruct

Ragionamento

apache-2.0

No

ml.g6e.24xlarge, ml.g7e.2xlarge

Qwen

Qwen3-Coder-Next

huggingface-reasoning-qwen3-coder-next

Ragionamento

apache-2.0

No

ml.g7e.24xlarge, ml.g7e.48xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

Qwen

Qwen3-Embedding-0.6B

huggingface-textembedding-qwen3-embedding-0-6b

Incorporamento del testo

Apache-2.0

No

ml.g6.12xlarge, ml.g6.16xlarge, ml.g6.24xlarge, ml.g6.2xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.g6e.2xlarge, ml.g6e.2xlarge, ml.g66xlarge e.4xlarge, ml.g6e.8xlarge, ml.g6e.xlarge, ml.g7e.24xlarge, ml.g7e.2xlarge, ml.g7e.48xlarge, ml.g7e.4xlarge, ml.g7e.8xlarge

Qwen

Qwen3-Next-80B-A3B-Instruct

huggingface-reasoning-qwen3-next-80b-a3b-instruct

Generazione di testo

apache-2.0

No

ml.g6e.48xlarge, ml.p4de.24xlarge

Qwen

Qwen3-Reranker-4B

huggingface-textembedding-qwen3-reranker-4b

Incorporamento del testo

Apache-2.0

No

ml.g6.12xlarge, ml.g6.16xlarge, ml.g6.24xlarge, ml.g6.2xlarge, ml.g6.48xlarge, ml.g6.4xlarge, ml.g6.xlarge, ml.g6e.12xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.g6e.24xlarge, ml.g6e.6e.large 2xlarge, ml.g6e.48xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.g6e.xlarge, ml.g7e.24xlarge, ml.g7e.2xlarge, ml.g7e.48xlarge, ml.g7e.4xlarge, ml.g7e.8xlarge

Qwen

Qwen3-TTS-12Hz-1.7B-Base

huggingface-ttsvoiceclone-qwen3-tts-12hz-1-7b-base

Text-to-Speech

Apache-2.0

No

ml.g6.16xlarge, ml.g6.2xlarge, ml.g6.4xlarge, ml.g6.xlarge, ml.g6.xlarge, ml.g6e.16xlarge, ml.g6e.2xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.g6e.xlarge, ml.g7e.2xlarge, ml.g7e.2xlarge, ml.g7e.2xlarge, ml.g6e.2xlarge 7e.4x grande, ml.g7e.8x grande

Qwen

Qwen3-TTS-12Hz-1.7B-CustomVoice

huggingface-tts-qwen3-tts-customvoice

Text-to-Speech

Apache-2.0

No

ml.g6.16xlarge, ml.g6.2xlarge, ml.g6.4xlarge, ml.g6.xlarge, ml.g6.xlarge, ml.g6e.16xlarge, ml.g6e.2xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.g6e.xlarge, ml.g7e.2xlarge, ml.g7e.2xlarge, ml.g7e.2xlarge, ml.g6e.2xlarge 7e.4x grande, ml.g7e.8x grande

Qwen

Qwen3-VL-8B-Instruct

huggingface-vlm-qwen3-vl-8b-instruct

Generazione di testo

apache-2.0

No

ml.g6e.24xlarge, ml.g6e.48xlarge, ml.p4d.24xlarge

Qwen

Qwen3-VL-Embedding-2B

huggingface-textembedding-qwen3-vl-embedding-2b

Incorporamento del testo

Apache-2.0

No

ml.g6.12xlarge, ml.g6.16xlarge, ml.g6.24xlarge, ml.g6.2xlarge, ml.g6.48xlarge, ml.g6.4xlarge, ml.g6.xlarge, ml.g6e.12xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.g6e.24xlarge, ml.g6e.6e.large 2xlarge, ml.g6e.48xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.g6e.xlarge, ml.g7e.24xlarge, ml.g7e.2xlarge, ml.g7e.4xlarge, ml.g7e.8xlarge

Qwen

Qwen3.5-0.8B

huggingface-vlm-qwen3-5-0-8b

Generazione di testo

apache-2.0

No

Predefinito: ml.g6.4xlarge, ml.g6e.12xlarge, ml.g6e.2xlarge, ml.g6e.4xlarge, ml.g6e.xlarge, ml.g7e.4xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • generate_best_price_performance(Genera, Bilanciato): ml.g6.xlarge, ml.g6e.2xlarge

  • generate_highest_throughput(Genera, produttività ottimizzata): ml.g6.24xlarge, ml.g6e.24xlarge

  • generate_lowest_cost(Genera, ottimizzazione dei costi): ml.g6.xlarge, ml.g6e.xlarge

  • generate_lowest_latency(Genera, latenza ottimizzata): ml.g6.4xlarge, ml.g6e.4xlarge

  • interact_best_price_performance(Interact, Balanced), (Interact, Latenza ottimizzata): ml.g6.2xlarge, ml.g6.xlarge, ml.g6e.2xlarge interact_lowest_latency

  • interact_highest_throughput(Interact, velocità di trasmissione ottimizzata): ml.g6.24xlarge, ml.g6e.16xlarge, ml.g6e.2xlarge

  • interact_lowest_cost(Interact, ottimizzazione dei costi), (Modify, Balanced), (Modifica, ottimizzazione dei costi): ml.g6.2xlarge, ml.g6.xlarge, ml.g6e.xlarge modify_best_price_performance modify_lowest_cost

  • max_context_highest_throughput(Contesto massimo, velocità effettiva ottimizzata): ml.g6.24xlarge, ml.g6e.12xlarge, ml.g7e.4xlarge

  • max_context_lowest_cost(Contesto massimo, ottimizzazione dei costi): ml.g6.2xlarge, ml.g6e.xlarge, ml.g7e.4xlarge

  • max_context_lowest_latency(Contesto massimo, latenza ottimizzata): ml.g6.16xlarge, ml.g6e.4xlarge, ml.g7e.4xlarge

  • modify_highest_throughput(Modifica, velocità di trasmissione ottimizzata): ml.g6.24xlarge, ml.g6e.12xlarge, ml.g6e.24xlarge

  • modify_lowest_latency(Modifica, latenza ottimizzata): ml.g6.8xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge

  • summarize_best_price_performance(Riassumi, Bilanciato): ml.g6.xlarge, ml.g6e.2xlarge, ml.g7e.8xlarge

  • summarize_highest_throughput(Riepilogo, throughput ottimizzato): ml.g6.12xlarge, ml.g6e.2xlarge, ml.g7e.8xlarge

  • summarize_lowest_cost(Riepilogo, ottimizzazione dei costi): ml.g6.xlarge, ml.g6e.xlarge, ml.g7e.8xlarge

  • summarize_lowest_latency(Riassumi, latenza ottimizzata): ml.g6.24xlarge, ml.g6e.16xlarge, ml.g7e.8xlarge

Qwen

Qwen3.5-27b

huggingface-vlm-qwen3-5-27b

Generazione di testo

apache-2.0

ml.g6.48xlarge

Qwen

Qwen3.5-27B-FP8

huggingface-vlm-qwen3-5-27b-fp8

Image-Text-to-Text

apache-2.0

No

ml.g6.24xlarge

Qwen

Qwen3.5-2B

huggingface-vlm-qwen3-5-2b

Generazione di testo

apache-2.0

No

Predefinito: ml.g6.12xlarge, ml.g6e.12xlarge, ml.g6e.2xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.g6e.xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • generate_best_price_performance(Genera, Bilanciato), modify_best_price_performance (Modifica, Bilanciato): ml.g6.xlarge, ml.g6e.2xlarge, ml.g6e.xlarge

  • generate_highest_throughput(Genera, velocità di trasmissione ottimizzata): ml.g6.48xlarge, ml.g6e.12xlarge, ml.g6e.24xlarge

  • generate_lowest_cost(Generazione, ottimizzazione dei costi), (Modifica, ottimizzazione dei costi): modify_lowest_cost ml.g6.2xlarge, ml.g6.xlarge, ml.g6e.xlarge

  • generate_lowest_latency(Genera, latenza ottimizzata): ml.g6.16xlarge, ml.g6.xlarge, ml.g6e.16xlarge

  • interact_best_price_performance(Interagisci, Bilanciato): ml.g6.xlarge, ml.g6e.2xlarge

  • interact_highest_throughput(Interact, velocità di trasmissione ottimizzata): ml.g6.24xlarge, ml.g6e.48xlarge

  • interact_lowest_cost(Interact, ottimizzazione dei costi): ml.g6.xlarge, ml.g6e.xlarge

  • interact_lowest_latency(Interact, latenza ottimizzata): ml.g6.4xlarge, ml.g6e.4xlarge

  • max_context_highest_throughput(Contesto massimo, velocità effettiva ottimizzata), (modifica, velocità effettiva ottimizzata): ml.g6.12xlarge, ml.g6e.12xlarge, ml.g6e.24xlarge modify_highest_throughput

  • max_context_lowest_cost(Contesto massimo, ottimizzazione dei costi): ml.g6.12xlarge, ml.g6e.2xlarge, ml.g6e.xlarge

  • max_context_lowest_latency(Contesto massimo, latenza ottimizzata): ml.g6.48xlarge, ml.g6e.16xlarge, ml.g6e.48xlarge

  • modify_lowest_latency(Modifica, latenza ottimizzata): ml.g6.8xlarge, ml.g6e.2xlarge, ml.g6e.8xlarge

  • summarize_best_price_performance(Riepilogo, bilanciato), (Riepilogo, ottimizzazione dei costi)summarize_lowest_cost: ml.g6.xlarge, ml.g6e.xlarge, ml.g7e.4xlarge

  • summarize_highest_throughput(Riepilogo, throughput ottimizzato): ml.g6.12xlarge, ml.g6e.2xlarge, ml.g7e.4xlarge

  • summarize_lowest_latency(Riepilogo, latenza ottimizzata): ml.g6.2xlarge, ml.g6e.2xlarge, ml.g7e.4xlarge

Qwen

Qwen3.5-4B

huggingface-vlm-qwen3-5-4b

Generazione di testo

apache-2.0

Predefinito: ml.g6.12xlarge, ml.g6e.24xlarge, ml.g7e.12xlarge, ml.g7e.2xlarge, ml.g7e.4xlarge, ml.g7e.8xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • generate_best_price_performance(Generazione, bilanciamento), (generazione, ottimizzazione del throughput), generate_highest_throughput (generazione, ottimizzazione dei costi), generate_lowest_cost (generazione ottimizzata per la latenza): ml.g6.8xlarge, generate_lowest_latency ml.g6e.8xlarge, ml.g7e.4xlarge

  • interact_best_price_performance(Interact, Balanced), interact_highest_throughput (Interact, Throughput ottimizzato), interact_lowest_cost (Interact, ottimizzato per i costi), interact_lowest_latency (Interact, Latenza ottimizzata): ml.g6.2xlarge, ml.g6e.xlarge, ml.g7e.2xlarge

  • max_context_highest_throughput(Contesto massimo, velocità effettiva ottimizzata), max_context_lowest_cost (Contesto massimo, ottimizzazione dei costi), max_context_lowest_latency (Contesto massimo, latenza ottimizzata): ml.g6.12xlarge, ml.g6e.24xlarge, ml.g7e.2xlarge

  • modify_best_price_performance(Modifica, bilanciato), modify_lowest_cost (Modifica, ottimizzazione dei costi), modify_lowest_latency (Modifica, ottimizzata per la latenza): ml.g6.2xlarge, ml.g6e.8xlarge, ml.g7e.2xlarge

  • modify_highest_throughput(Modifica, velocità di trasmissione ottimizzata): ml.g6.2xlarge, ml.g6e.8xlarge, ml.g7e.4xlarge

  • summarize_best_price_performance(Riepilogo, bilanciato), (Riepilogo, ottimizzazione dei costi)summarize_lowest_cost: ml.g6.12xlarge, ml.g6e.24xlarge, ml.g7e.12xlarge

  • summarize_highest_throughput(Riepilogo, produttività ottimizzata): ml.g6.12xlarge, ml.g6e.24xlarge, ml.g7e.24xlarge

  • summarize_lowest_latency(Riepilogo, latenza ottimizzata): ml.g6.24xlarge, ml.g6e.16xlarge, ml.g7e.2xlarge

Qwen

Qwen3.5-9b

huggingface-vlm-qwen3-5-9b

Generazione di testo

apache-2.0

ml.g6.24x grande, ml.g6.48x grande

Qwen

Qwen3.6-27B

huggingface-vlm-qwen3-6-27b

Image-Text-to-Text

apache-2.0

Predefinito: ml.g7e.12xlarge, ml.g7e.24xlarge, ml.g7e.48xlarge, ml.p5en.48xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • generate_best_price_performance(Generazione, Bilanciamento), generate_lowest_cost (Generazione, ottimizzazione dei costi), (Modifica, Bilanciamento), modify_best_price_performance (Modifica, ottimizzazione dei costi), modify_lowest_cost (Riepilogo, Bilanciamento), summarize_best_price_performance (Riepilogo, ottimizzazione dei costi): ml.g6.12xlarge, summarize_lowest_cost ml.g6e.12xlarge, ml.p5en.48xlarge

  • generate_highest_throughput(Genera, velocità effettiva ottimizzata), modify_highest_throughput (Modifica, velocità effettiva ottimizzata), modify_lowest_latency (Modifica, latenza ottimizzata): ml.g7e.48xlarge, ml.p5.4xlarge, ml.p5en.48xlarge

  • generate_lowest_latency(Generazione, latenza ottimizzata): ml.g6e.12xlarge, ml.p5.4xlarge, ml.p5en.48xlarge

  • interact_best_price_performance(Interact, Balanced), (Interact, ottimizzazione dei costi)interact_lowest_cost: ml.g6.12xlarge, ml.g6e.12xlarge, ml.p5.48xlarge

  • interact_highest_throughput(Interact, throughput ottimizzato), (Interact, latenza ottimizzata): ml.g6e.48xlarge, ml.p5.48xlarge, ml.p5en.48xlarge, ml.p5en.48xlarge interact_lowest_latency

  • max_context_highest_throughput(Contesto massimo, velocità effettiva ottimizzata): ml.g7e.24xlarge, ml.g7e.48xlarge, ml.p5en.48xlarge

  • max_context_lowest_cost(Contesto massimo, ottimizzazione dei costi), (Contesto massimo, latenza ottimizzata): max_context_lowest_latency ml.g7e.12xlarge, ml.g7e.48xlarge, ml.p5en.48xlarge

  • summarize_highest_throughput(Riepilogo, throughput ottimizzato): ml.g6e.24xlarge, ml.g7e.48xlarge, ml.p5en.48xlarge

  • summarize_lowest_latency(Riepilogo, latenza ottimizzata): ml.g6.48xlarge, ml.g6e.48xlarge, ml.p5en.48xlarge

Qwen

Qwen3.6-35B-A3B

huggingface-vlm-qwen3-6-35b-a3b

Generazione di testo

apache-2.0

No

Predefinito: ml.g6e.24xlarge, ml.g6e.48xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • generate_best_price_performance(Generate, Balanced), generate_lowest_cost (Generate, Ottimizzato in termini di costi): ml.g6.12xlarge, ml.g6e.12xlarge, ml.p5.48xlarge

  • generate_highest_throughput(Generazione, ottimizzazione del throughput), (Contesto massimo, Throughput ottimizzato): ml.g6e.48xlarge, ml.p5.48xlarge, ml.p5en.48xlarge max_context_highest_throughput

  • generate_lowest_latency(Generazione, latenza ottimizzata), max_context_lowest_cost (Contesto massimo, ottimizzazione dei costi), max_context_lowest_latency (Contesto massimo, latenza ottimizzata), modify_highest_throughput (Modifica, velocità effettiva ottimizzata), modify_lowest_latency (Modifica, latenza ottimizzata), summarize_highest_throughput (Riepilogo, velocità effettiva ottimizzata): ml.g6e.24xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • interact_best_price_performance(Interact, Balanced), interact_lowest_cost (Interact, ottimizzazione dei costi): ml.g6.12xlarge, ml.g6e.12xlarge, ml.p5en.48xlarge

  • interact_highest_throughput(Interact, throughput ottimizzato), (interact_lowest_latencyInteract, latenza ottimizzata): ml.g6.48xlarge, ml.g6e.48xlarge, ml.p5en.48xlarge

  • modify_best_price_performance(Modifica, bilanciamento), (modifica, ottimizzazione dei costi), (riepilogo, bilanciamento), (riepilogo, ottimizzazione dei costi): ml.g6.48xlarge, modify_lowest_cost ml.g6e.12xlarge, ml.p5.48xlarge summarize_best_price_performance summarize_lowest_cost

  • summarize_lowest_latency(Riepilogo, latenza ottimizzata): ml.g6e.12xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

Qwen

QQ 32B

huggingface-llm-qwq-32b

Generazione di testo

apache-2.0

No

ml.g5.24xlarge, ml.g5.48xlarge, ml.g6.24xlarge, ml.g6.48xlarge, ml.p4d.24xlarge

Riconosci

Riconosci Bert Base Spanish Wwm Cased Xnli

huggingface-zstc-recognai-bert-base-spanish-wwm-cased-xnli

Zero-Shot Classificazione

mit

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Riconosci

Riconosci Zeroshot Selectra Medium

huggingface-zstc-recognai-zeroshot-selectra-medium

Zero-Shot Classificazione

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Rinna

Istruzioni Rinna Japanese GPT NeoX 3.6B PPO

huggingface-llm-rinna-3-6b-instruction-ppo-bf16

Generazione di testo

mit

No

ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.xlarge

Salesforce

Salesforce SFR-Embedding-2 _R

huggingface-textembedding-sfr-embedding-2-r

Incorporamento del testo

CC-BY-NC-4.0

No

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g6.12xlarge, ml.g6.24xlarge, ml.g6.24xlarge, ml.g6.2xlarge, ml.g6.48xlarge, ml.g6.4xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.g6.xlarge, ml.p4d.24xlarge

Salesforce

Salesforce SFR-Embedding-Mistral

huggingface-textembedding-sfr-embedding-mistral

Incorporamento del testo

CC-BY-NC-4.0

No

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g6.12xlarge, ml.g6.24xlarge, ml.g6.24xlarge, ml.g6.2xlarge, ml.g6.48xlarge, ml.g6.4xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.g6.xlarge, ml.p4d.24xlarge

Sentence-Transformers

Tutti i miniLM L6 v2

huggingface-sentencesimilarity-all-MiniLM-L6-v2

Somiglianza delle frasi

apache-2.0

ml.c6i.xlarge, ml.g4dn.2xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Sentence-Transformers

Tutti i miniLM L6 v2

huggingface-textembedding-all-MiniLM-L6-v2

Incorporamento del testo

Apache-2.0

No

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g6.12xlarge, ml.g6.24xlarge, ml.g6.24xlarge, ml.g6.2xlarge, ml.g6.48xlarge, ml.g6.4xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.g6.xlarge, ml.p4d.24xlarge

Sentence-Transformers

tutti- MiniLM-L12-v2

huggingface-textembedding-all-MiniLM-L12-v2

Incorporamento del testo

Apache-2.0

No

ml.g5.xlarge, ml.g6.xlarge, ml.g6e.xlarge

Sentence-Transformers

Parafrasi miniLM L12 v2 multilingue

huggingface-textembedding-paraphrase-multilingual-MiniLM-L12-v2

Incorporamento del testo

Apache-2.0

No

ml.g5.xlarge, ml.g6.xlarge, ml.g6e.xlarge

Shenzhi-Wang

Chat cinese Llama3 8B

huggingface-llm-shenzhi-wang-llama3-8B-chinese-chat

Generazione di testo

lama3

No

ml.g 5.16x grande, ml.g5.2x grande, ml.g5.4x grande, ml.g5.8x grande

Snowflake

Snowflake Arctic Instruct Vllm

huggingface-llm-snowflake-arctic-instruct-vllm

Generazione di testo

apache-2.0

No

ml.p5.48xlarge

Speakleash

Bielik-11B-v3.0-Instruct

huggingface-llm-bielik-11b-v3-0-instruct

Generazione di testo

apache-2.0

No

Predefinito: ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.12xlarge, ml.g7e.2xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • generate_best_price_performance(Generazione, Bilanciamento), generate_lowest_cost (Generazione, ottimizzazione dei costi), (Interazione, ottimizzazione dei costi), interact_lowest_cost modify_lowest_cost (Modifica, ottimizzazione dei costi): ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.xlarge

  • generate_highest_throughput(Genera, velocità effettiva ottimizzata), interact_highest_throughput (Interazione, velocità effettiva ottimizzata), modify_highest_throughput (Modifica, velocità effettiva ottimizzata), modify_lowest_latency (Modifica, latenza ottimizzata), summarize_highest_throughput (Riepilogo, velocità effettiva ottimizzata), summarize_lowest_latency (Riepilogo, latenza ottimizzata): ml.p4d.24xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • generate_lowest_latency(Genera, latenza ottimizzata): ml.g6e.16xlarge, ml.p5.48xlarge, ml.p5en.48xlarge

  • interact_best_price_performance(Interagisci, Bilanciato): ml.g5.12xlarge, ml.g6e.xlarge, ml.p4d.24xlarge

  • interact_lowest_latency(Interact, latenza ottimizzata): ml.g5.48xlarge, ml.g6.24xlarge, ml.g6e.24xlarge

  • max_context_highest_throughput(Contesto massimo, velocità effettiva ottimizzata): ml.g6e.12xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • max_context_lowest_cost(Contesto massimo, ottimizzazione dei costi): ml.g5.12xlarge, ml.g6.12xlarge, ml.g6e.12xlarge

  • max_context_lowest_latency(Contesto massimo, latenza ottimizzata): ml.g5.24xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • modify_best_price_performance(Modifica, bilanciato): ml.g6.12xlarge, ml.g6e.xlarge, ml.p4d.24xlarge

  • summarize_best_price_performance(Riassumi, Bilanciato): ml.g6e.12xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

  • summarize_lowest_cost(Riepilogo, ottimizzazione dei costi): ml.g5.48xlarge, ml.g6.48xlarge, ml.g6e.12xlarge

Schleifer

Distilbart CNN 12-6

huggingface-summarization-distilbart-cnn-12-6

Sintesi testuale

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Schleifer

Distilbart CNN 6-6

huggingface-summarization-distilbart-cnn-6-6

Sintesi testuale

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Schleifer

Sintesi testuale

huggingface-summarization-distilbart-xsum-1-1

Sintesi testuale

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Stabilità ai

StableLM Instruct Alpha 7B v2 giapponese

model-textgenerationjp-japanese-stablelm-instruct-alpha-7b-v2

Generazione di testo

Apache-2.0

No

ml.g5.12xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge

Stabilità ai

Diffusione stabile 2

model-txt2img-stabilityai-stable-diffusion-v2

Text-to-Image

creativml-openrail++-m

No

ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Stabilità ai

Diffusione stabile a 2 profondità FP16

model-depth2img-stable-diffusion-2-depth-fp16

Image-to-Image

creativeml-openrail++-m

No

ml.g4dn.16xlarge, ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g4dn.xlarge, ml.g5.16xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g5.xlarge, ml.p3.2xlarge

Stabilità ai

Diffusione stabile 2 FP16

model-txt2img-stabilityai-stable-diffusion-v2-fp16

Text-to-Image

creativeml-openrail++-m

No

ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Stabilità ai

Diffusione stabile 2 nella verniciatura

model-inpainting-stabilityai-stable-diffusion-2-inpainting

Image-to-Image

creativml-openrail++-m

No

ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Stabilità ai

Diffusione stabile 2 Nella verniciatura FP16

model-inpainting-stabilityai-stable-diffusion-2-inpainting-fp16

Image-to-Image

creativeml-openrail++-m

No

ml.g4dn.xlarge, ml.g5.2xlarge, ml.p3.2xlarge

Stabilità ai

Diffusione stabile 2 Nella verniciatura FP16

model-inpainting-stabilityai-stable-diffusion2-inpainting-fp16

Image-to-Image

creativeml-openrail++-m

No

ml.g4dn.xlarge, ml.g5.2xlarge, ml.p3.2xlarge

Stabilità ai

Stable Diffusion 2.1

model-txt2img-stabilityai-stable-diffusion-v2-1-base

Text-to-Image

creative ml-openrail++-m

ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Stabilità ai

Diffusione stabile 2.1 Neurone

huggingface-txt2imgneuron-stabilityai-stable-diffusion-v2-1

Text-to-Image

creativeml-openrail++-m

No

ml.inf2.24xlarge, ml.inf2.48xlarge, ml.inf2.8xlarge, ml.inf2.xlarge

Stabilità ai

Upscaler FP16 a diffusione stabile x4

model-upscaling-stabilityai-stable-diffusion-x4-upscaler-fp16

Image-to-Image

openrail++

No

ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Stabilità ai

Stable Diffusion XL 1.0 (open source)

model-imagegeneration-stabilityai-stable-diffusion-xl-base-1-0

Text-to-Image

openrail++

No

ml.g5.16x grande, ml.g5.4x grande, ml.g5.8x grande

Stabilità ai

Diffusione stabile XL Base 1.0 Neuron

huggingface-txt2imgneuron-stabilityai-stable-diffusion-xlbase1

Text-to-Image

openrail++

No

ml.inf2.24xlarge, ml.inf2.48xlarge, ml.inf2.8xlarge, ml.inf2.xlarge

Swiss-Ai

Apertus 70B 2509

huggingface-llm-apertus-70b-2509

Generazione di testo

apache-2.0

No

ml.g5.48xlarge, ml.g6.48xlarge, ml.g6e.48xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge, ml.p5e.48xlarge, ml.p5en.48xlarge, ml.p5en.48xlarge

Swiss-Ai

Apertus 70B Instruct 2509

huggingface-llm-apertus-70b-instruct-2509

Generazione di testo

apache-2.0

No

ml.g5.48xlarge, ml.g6.48xlarge, ml.g6e.48xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge, ml.p5e.48xlarge, ml.p5en.48xlarge, ml.p5en.48xlarge

Swiss-Ai

Apertus 8B Instruct 2509

huggingface-llm-apertus-8b-instruct-2509

Generazione di testo

apache-2.0

No

ml.g5.12xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.xlarge, ml.g6.12xlarge, ml.g6.16xlarge, ml.g6.16xlarge, ml.g6.24xlarge, ml.g6.2xlarge, ml.g6.2xlarge, ml.g6.48xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.g6.xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.g6e.2xlarge, ml.g6e.48xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.g6e.8xlarge, ml.g6e.8xlarge, ml.g6e.8xlarge, ml.g6e.8xlarge .g6e.xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge, ml.p5e.48xlarge, ml.p5en.48xlarge

Il tipo

Mistral 7B AWQ OpenOrca

huggingface-llm-thebloke-mistral-7b-openorca-awq

Generazione di testo

apache-2.0

No

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge

Il tipo

Mistral 7B GPTA OpenOrca

huggingface-llm-mistral-7b-openorca-gptq

Generazione di testo

apache-2.0

No

ml.g5.12xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g5.xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge, ml.p5.48xlarge

Il tipo

Mixtral 8x7B Istruzioni GPTQ

huggingface-llm-mixtral-8x7b-instruct-gptq

Generazione di testo

apache-2.0

No

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.48xlarge, ml.p4d.24xlarge

Il nlper

GTE Large

huggingface-sentencesimilarity-gte-large

Somiglianza delle frasi

mit

ml.c6i.xlarge, ml.g4dn.2xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Poi per

GTE Small

huggingface-sentencesimilarity-gte-small

Somiglianza delle frasi

mit

ml.c6i.xlarge, ml.g4dn.2xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.p3.2xlarge

Emirati Arabi Uniti

Falcon 180B BF16

huggingface-llm-falcon-180b-bf16

Generazione di testo

Non applicabile

No

ml.p4de.24x grande, ml.p5.48x grande

Emirati Arabi Uniti

Chat Falcon 180B BF16

huggingface-llm-falcon-180b-chat-bf16

Generazione di testo

Non applicabile

No

ml.p4de.24xlarge, ml.p5.48xlarge

Emirati Arabi Uniti

Falcon 40B BF16

huggingface-llm-falcon-40b-bf16

Generazione di testo

apache-2.0

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.48xlarge, ml.p4d.24xlarge

Tiiuae

Falcon 40B Instruct BF16

huggingface-llm-falcon-40b-instruct-bf16

Generazione di testo

apache-2.0

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.48xlarge, ml.p4d.24xlarge

Tiiuae

Falcon 7B BF16

huggingface-llm-falcon-7b-bf16

Generazione di testo

apache-2.0

ml.g5.16xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge

Tiiuae

Falcon 7B Instruct BF16

huggingface-llm-falcon-7b-instruct-bf16

Generazione di testo

apache-2.0

ml.g5.16xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge

Tiiuae

Falcon RW 1B

huggingface-llm-tiiuae-falcon-rw-1b

Generazione di testo

apache-2.0

No

ml.g5.2xlarge

Emirati Arabi Uniti

Falcon-H1-0.5B-Instruct

huggingface-llm-falcon-h1-0-5b-instruct

Generazione di testo

altro

No

ml.g4dn.12xlarge, ml.g4dn.16xlarge, ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g4dn.xlarge, ml.g5.12xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.2xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.5xlarge 48 x grande, ml.g 5.4 x grande, ml.g 5.8 x grande, ml.g 6.12 x grande, ml.g 6.16 x grande, ml.g 6.16 x grande, ml.g 6.24 x grande, ml.g 6.48 x grande, ml.g 6.4 x grande, ml.g 6.8 x grande, ml.g6.xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.g6e.2xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.g6e.xlarge, ml.p3.2xlarge, ml.p4d.24xlarge

Tiiuae

Falcon-H1-1.5B-Deep-Instruct

huggingface-llm-falcon-h1-1-5b-deep-instruct

Generazione di testo

altro

No

ml.g5.16xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g6.16xlarge, ml.g6.2xlarge, ml.g6.4xlarge, ml.g6.xlarge, ml.g6e.16xlarge, ml.g6e.16xlarge, ml.g6e.2xlarge, ml.g6e.4xlarge, ml.g6e.4xlarge, ml.g6e.6e.large 8xlarge, ml.g6e.xlarge

Tiiuae

Falcon-H1-1.5B-Instruct

huggingface-llm-falcon-h1-1-5b-instruct

Generazione di testo

altro

No

ml.g6.12xlarge, ml.g6.16xlarge, ml.g6.24xlarge, ml.g6.2xlarge, ml.g6.48xlarge, ml.g6.4xlarge, ml.g6.xlarge, ml.g6e.12xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.g6e.24xlarge, ml.g6e.6e.large 2xlarge, ml.g6e.48xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.g6e.xlarge

Tiiuae

Falcon-H1-34B-Instruct

huggingface-llm-falcon-h1-34b-instruct

Generazione di testo

altro

No

ml.g6e.12x grande, ml.g6e.24x grande, ml.g6e.48x grande

Emirati Arabi Uniti

Falcon-H1-3B-Instruct

huggingface-llm-falcon-h1-3b-instruct

Generazione di testo

altro

No

ml.g6e.16xlarge, ml.g6e.2xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.g6e.xlarge

Emirati Arabi Uniti

Falcon-H1-7B-Instruct

huggingface-llm-falcon-h1-7b-instruct

Generazione di testo

altro

No

ml.g6e.12x grande, ml.g6e.24x grande

Emirati Arabi Uniti

Falcon2-11B

huggingface-llm-falcon2-11b

Generazione di testo

Non applicabile

No

ml.g5.12x grande, ml.g5.24x grande, ml.g5.48x grande, ml.p4d.24x grande

Tiiuae

Falcon3-10B-Base

huggingface-llm-falcon-3-10B-base

Generazione di testo

altro

No

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.48xlarge, ml.g6.12xlarge, ml.g6.24xlarge, ml.g6.48xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

Emirati Arabi Uniti

Falcon3-10B-Instruct

huggingface-llm-falcon-3-10B-Instruct

Generazione di testo

altro

No

ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g5.24xlarge, ml.g6.12xlarge, ml.g6.24xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.g6e.2xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.g6e.xlarge

Tiiuae

Falcon3-1B-Instruct

huggingface-llm-falcon-3-1B-Instruct

Generazione di testo

altro

No

Predefinito: ml.g4dn.xlarge, ml.g5.xlarge, ml.g6.xlarge, ml.g6e.xlarge, ml.p3.2xlarge, ml.p4d.24xlarge

Altri tipi di istanza sono disponibili tramite queste configurazioni di distribuzione dell'hosting:

  • generate_best_price_performance(Genera, Bilanciato): ml.g4dn.xlarge, ml.g5.xlarge, ml.g6e.2xlarge

  • generate_highest_throughput(Genera, velocità di trasmissione ottimizzata): ml.g6e.12xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • generate_lowest_cost(Generazione, ottimizzazione dei costi), (Interazione, ottimizzazione dei costi), (Contesto massimo, ottimizzazione dei costi): ml.g4dn.xlarge, ml.g5.xlarge, ml.g6.xlarge interact_lowest_cost max_context_lowest_cost

  • generate_lowest_latency(Generazione, latenza ottimizzata): ml.g6.12xlarge, ml.g6e.12xlarge, ml.p4d.24xlarge

  • interact_best_price_performance(Interagisci, Bilanciato): ml.g4dn.xlarge, ml.g5.xlarge, ml.g6e.xlarge

  • interact_highest_throughput(Interact, throughput ottimizzato): ml.g6e.48xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • interact_lowest_latency(Interact, latenza ottimizzata): ml.g5.2xlarge, ml.g6.48xlarge, ml.g6e.48xlarge

  • max_context_highest_throughput(Contesto massimo, velocità effettiva ottimizzata): ml.g6e.24xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

  • max_context_lowest_latency(Contesto massimo, latenza ottimizzata): ml.g6e.4xlarge, ml.p4d.24xlarge, ml.p5en.48xlarge

Tiiuae

Falcon3-3B-Base

huggingface-llm-falcon-3-3B-base

Generazione di testo

altro

No

ml.g5.12xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.xlarge, ml.g6.12xlarge, ml.g6.16xlarge, ml.g6.16xlarge, ml.g6.24xlarge, ml.g6.2xlarge, ml.g6.2xlarge, ml.g6.48xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.g6.xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

Tiiuae

Falcon3-3B-Instruct

huggingface-llm-falcon-3-3B-Instruct

Generazione di testo

altro

No

ml.g4dn.12xlarge, ml.g4dn.16xlarge, ml.g4dn.4xlarge, ml.g5.12xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.xlarge, ml.g5.xlarge, ml.g6.12xlarge, ml.g6.16xlarge, ml.g6.16xlarge, ml.g6.16xlarge, ml.g6.16xlarge, ml.g6.16xlarge, ml.g6.16xlarge, ml.g6.16xlarge g 6,24x grande, ml.g6,2 x grande, ml.g6,4 x grande, ml.g6e.12xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.g6e.2xlarge, ml.g6e.8xlarge, ml.p3.2xlarge, ml.p3.2xlarge

Tiiuae

Falcon3-7B-Base

huggingface-llm-falcon-3-7B-base

Generazione di testo

altro

No

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.48xlarge, ml.g6.12xlarge, ml.g6.24xlarge, ml.g6.48xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

Emirati Arabi Uniti

Falcon3-7B-Instruct

huggingface-llm-falcon-3-7B-Instruct

Generazione di testo

altro

No

ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g5.24xlarge, ml.g6.12xlarge, ml.g6.24xlarge, ml.g6e.12xlarge, ml.g6e.24xlarge, ml.g6e.2xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.g6e.xlarge

Tinyllama

Tiny Llama 1.1B

huggingface-llm-tinyllama-1-1b-intermediate-step-1431k-3

Generazione di testo

apache-2.0

No

ml.g5.12x grande, ml.g5.24x grande, ml.g5.2x grande

Piccolo lama

Tiny Llama 1.1B Chat V0.6

huggingface-llm-tinyllama-tinyllama-1-1b-chat-v0-6

Generazione di testo

apache-2.0

No

ml.g5.12x grande, ml.g5.24x grande, ml.g5.2x grande

Piccolo lama

Tiny Llama 1.1B Chat V1

huggingface-llm-tinyllama-tinyllama-1-1b-chat-v1-0

Generazione di testo

apache-2.0

No

ml.g5.12x grande, ml.g5.24x grande, ml.g5.2x grande

Computer insieme

RedPajama INCITE Chat 3B V1

huggingface-textgeneration1-redpajama-incite-chat-3B-v1-fp16

Generazione di testo

apache-2.0

ml.g5.16xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge

Computer insieme

RedPajama INCITE Chat 7B V1

huggingface-textgeneration1-redpajama-incite-chat-7B-v1-fp16

Generazione di testo

apache-2.0

ml.g5.16xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge

Computer insieme

RedPajama INCITE Instruct 3B V1

huggingface-textgeneration1-redpajama-incite-instruct-3Bv1fp16

Generazione di testo

apache-2.0

ml.g5.16xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge

Computer insieme

RedPajama INCITE Instruct 7B V1

huggingface-textgeneration1-redpajama-incite-instruct-7B1fp16

Generazione di testo

apache-2.0

ml.g5.16xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge

Tokyotech-Llm

Swallow-7b-instruct-hf

huggingface-llm-swallow-7b-instruct-hf

Generazione di testo

lama 2

No

ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.xlarge, ml.g5.xlarge, ml.g6.12xlarge, ml.g6.16xlarge, ml.g6.24xlarge grande, ml.g6.2xlarge, ml.g6.48xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.g6.xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge

Volrath 50

Diffusione di carte fantasy volrath50

huggingface-txt2img-volrath50-fantasy-card-diffusion

Text-to-Image

ml-openrail-m creativo

No

ml.g4dn.2xlarge, ml.g4dn.xlarge, ml.p3.2xlarge

Istanza di scrittura

Writer Palmyra Small

huggingface-llm-writer-palmyra-small

Generazione di testo

apache-2.0

No

ml.g5.2xlarge

Zai-Org

GLM-5.1-FP8

huggingface-llm-glm-5-1-fp8

Generazione di testo

Apache-2.0

No

ml.p5en.48xlarge

Proprietary Models (121)

I modelli di base proprietari sono offerti da fornitori terzi tramite Amazon. SageMaker JumpStart Per utilizzare un modello di base proprietario, devi prima abbonarti al modello in AWS Marketplace. Dopo la sottoscrizione, puoi individuare e distribuire il modello di base in Amazon Studio. SageMaker

Nome modello ID modello Operazione Fine-tunable Tipi di istanze di inferenza supportati

A.X 4.0 Light

sk-telecom-ax4-light

Generazione di testo

No

ml.g5.2xlarge

Risposte contestuali AI21

ai21-contextual-answers

Generazione di testo

No

ml.g4dn.12xlarge, ml.g5.12xlarge, ml.g5.48xlarge, ml.p4d.24xlarge

Luce Jurassic-2 AI21

ai21-jurassic-2-light

Generazione di testo

No

ml.g4dn.12x grande, ml.g5.12x grande, ml.g5.48x grande, ml.p4d.24x grande

AI21 Jurassic-2 Medio

ai21-jurassic-2-grande-instruct

Generazione di testo

No

ml.g4dn.12x grande, ml.g5.12x grande, ml.g5.48x grande, ml.p4d.24x grande

AI 21 Ultra Jurassic-2

ai21-jurassic-2-jumbo-instruct

Generazione di testo

No

ml.g 5.48x grande, ml.p4d.24x grande, ml.p4de.24x grande

Parafrasi AI21

ai21-paraphrase

Generazione di testo

No

ml.g4dn.2xlarge

AI21 Riassumi

ai21-summarization

Generazione di testo

No

ml.g4dn.12xlarge, ml.g4dn.4xlarge, ml.g5.xlarge

Arcee Lite

arcee-lite

Generazione di testo

No

ml.g5.16xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g5.xlarge, ml.g6.16xlarge, ml.g6.2xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.g6.xlarge

Arcee SuperNova

arcee-supernova

Generazione di testo

No

ml.p4d.24x grande, ml.p4de.24x grande, ml.p5.48x grande

Arcee Virtuoso Small

arcee-virtuoso-small

Generazione di testo

No

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.48xlarge, ml.g6.12xlarge, ml.g6.24xlarge, ml.g6.48xlarge, ml.g6e.12xlarge, ml.g6e.24xlarge, ml.g6e.48xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p4de.24xlarge, ml.p4de.24xlarge, ml.p4de.24xlarge, ml.p4de.24xlarge, ml.p4de.24xlarge, ml.p4de.24xlarge. p5.48x grande

Bria 2.2HD Spot Text-to-image

bria-ai-2-2-hd-commercial

ReRank

No

ml.g5.12xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge

Bria 2.3 Commerciale Text-to-image

bria-ai-2-3-commercial

ReRank

No

ml.g5.12xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge

Bria 2.3Fast Commercial Text-to-image

bria-ai-2-3-fast-commercial

ReRank

No

ml.g5.12xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge

Comando Cohere R (A100)

cohere-command-r-a100

Generazione di testo

No

ml.p4de.24xlarge

Comando Cohere R (H100)

cohere-command-r-h100

Generazione di testo

No

ml.p5.48xlarge

Comando Cohere R+ (A100)

cohere-command-r-plus-a100

Generazione di testo

No

ml.p4de.24xlarge

Comando Cohere R+ (H100)

cohere-command-r-plus-h100

Generazione di testo

No

ml.p5.48xlarge

Cohere Embed 4

cohere-embed-v4-0

Incorporamento del testo

No

ml.g5.2xlarge, ml.g5.xlarge, ml.g6.2xlarge, ml.g6.xlarge

Cohere Embed Light modello v3 - inglese

cohere-embed-light-english

Incorporamento del testo

No

ml.g4dn.2xlarge, ml.g4dn.xlarge, ml.g5.2xlarge, ml.g5.xlarge, ml.p3.2xlarge

Cohere Embed Light v3 - Multilingue

cohere-embed-light-multilingual

Incorporamento del testo

No

ml.g4dn.2xlarge, ml.g4dn.xlarge, ml.g5.2xlarge, ml.g5.xlarge, ml.p3.2xlarge

Cohere Embed Model 3 - Multilingue

cohere-embed-multilingual

Incorporamento del testo

No

ml.g4dn.2xlarge, ml.g4dn.xlarge, ml.g5.2xlarge, ml.g5.xlarge, ml.p3.2xlarge

Modello Cohere Embed v3 - inglese

cohere-embed-english

Incorporamento del testo

No

ml.g4dn.2xlarge, ml.g4dn.xlarge, ml.g5.2xlarge, ml.g5.xlarge, ml.p3.2xlarge

Modello Cohere Rerank 2 - inglese

cohere-rerank-english-v2

ReRank

No

ml.g4dn.2xlarge, ml.g4dn.xlarge, ml.g5.2xlarge, ml.g5.xlarge, ml.p3.2xlarge

Modello Cohere Rerank 2 - Multilingue

cohere-rerank-multilingual-v2

ReRank

No

ml.g4dn.2xlarge, ml.g4dn.xlarge, ml.g5.2xlarge, ml.g5.xlarge, ml.p3.2xlarge

Modello Cohere Rerank 3 - inglese

cohere-rerank-v3-english

ReRank

No

ml.g5.2xlarge, ml.g5.xlarge

Modello Cohere Rerank 3 - Multilingue

cohere-rerank-v3-multilingual

ReRank

No

ml.g5.2xlarge, ml.g5.xlarge

Modello Cohere Rerank 3 Nimble - inglese

cohere-rerank-nimble-english

ReRank

No

ml.g5.2xlarge, ml.g5.xlarge

Modello Cohere Rerank 3 Nimble - Multi

cohere-rerank-nimble-multi

ReRank

No

ml.g5.2xlarge, ml.g5.xlarge

Coere Rank v3.5

cohere-rerank-v3-5

Incorporamento del testo

No

ml.g5.2xlarge, ml.g5.xlarge, ml.g6.2xlarge, ml.g6.xlarge

Cohere ReRank v4.0 Veloce

cohere-rerank-v4-0-fast

Incorporamento del testo

No

ml.g5.2xlarge, ml.g5.xlarge, ml.p5.4xlarge

Coere ReRank v4.0 Pro

cohere-rerank-v4-0-pro

Incorporamento del testo

No

ml.g5.2xlarge, ml.g5.xlarge, ml.p5.4xlarge

Comando A (A100)

cohere-command-a-a100

Generazione di testo

No

ml.p4de.24xlarge

Comando A (H100)

cohere-command-a-h100

Generazione di testo

No

ml.p5.48xlarge

Comando R 08-2024 (H100)

cohere-command-r-08-2024-h100

Generazione di testo

No

ml.p5.48xlarge

Comando R+ 08-2024 (H100)

cohere-command-r-plus-08-2024-h100

Generazione di testo

No

ml.p5.48xlarge

Documento OCR

upstage-document-ocr

riconoscimento ottico dei caratteri

No

ml.g5.2xlarge

Analisi dei documenti

upstage-document-layout-analysis

Riconoscimento ottica dei caratteri

No

ml.g 5.2 x grande, ml.g 6.2 x grande, ml.p 3.2 x grande

Incastrare

upstage-solar-embedding-large

Incorporamento del testo

No

ml.g6.12xlarge, ml.g6.16xlarge, ml.g6.24xlarge, ml.g6.2xlarge, ml.g6.48xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.g6e.2xlarge, ml.g6e.2xlarge, ml.g6e.2xlarge 6e.48x grande, ml.g6e.4x grande, ml.g6e.8x grande

ESM3-open

evolutionary-scale-esm3

Generazione multimodale

No

ml.g 5.4x grande, ml.g 5.8x grande

Evo2-NIM

nvidia-evo2-nim

Generazione di testo

No

ml.g6e.12xlarge, ml.g6e.24xlarge, ml.g6e.48xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge, ml.p5e.48xlarge, ml.p5en.48xlarge

EXAONE Atelier - Da immagine a testo

lgresearch-exaone

Generazione di testo da immagine a testo

No

ml.g5.12xlarge, ml.g5.48xlarge, ml.g5.xlarge, ml.p4d.24xlarge

Gretel Navigator Tabular

gretel-navigator-tabular

Generazione di testo

No

ml.g5.2xlarge, ml.g5.xlarge

H-Optimus-0

bioptimus-h-optimus-0

Estrazione delle funzionalità

No

ml.g5.xlarge

IBM Granite 20B Code Instruct - 8K

ibm-granite-20b-code-instruct-8k

Generazione di testo

No

ml.g5.12x grande, ml.g5.24x grande, ml.g5.48x grande

Istruzioni IBM Granite 3.0 2B

granite-3-0-2b-instruct

Generazione di testo

No

ml.p4d.24xlarge, ml.p5.48xlarge

Istruzioni IBM Granite 3.0 8B

granite-3-0-8b-instruct

Generazione di testo

No

ml.p4d.24xlarge, ml.p5.48xlarge

IBM Granite 3.2 Instruct 2B

ibm-granite-3-2-2b-instruct

Generazione di testo

No

ml.g6.12xlarge, ml.g6.16xlarge, ml.g6.24xlarge, ml.g6.48xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.g6e.2xlarge, ml.g6e.48xlarge, ml.g6e.4xlarge, ml.p4d.24xlarge, ml.p 5,48 x grande

IBM Granite 3.2 Instruct 8B

ibm-granite-3-2-8b-instruct

Generazione di testo

No

ml.g6.12xlarge, ml.g6.16xlarge, ml.g6.24xlarge, ml.g6.48xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.g6e.2xlarge, ml.g6e.48xlarge, ml.g6e.4xlarge, ml.p4d.24xlarge, ml.p 5,48 x grande

IBM Granite 34B Code Instruct - 8K

ibm-granite-34b-code-instruct-8k

Generazione di testo

No

ml.g 5.12 x grande, ml.g 5.24 x grande, ml.g 5.48 x grande

IBM Granite 3B Code Instruct - 128K

ibm-granite-3b-code-instruct-128k

Generazione di testo

No

ml.g 5.12x grande, ml.g5.16x grande, ml.g5.24x grande, ml.g5.48x grande, ml.g5.4x grande, ml.g5.8x grande

IBM Granite 4.0 h-micro

ibm-granite-4-0-h-micro

Generazione di testo

No

ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.g6e.2xlarge, ml.g6e.48xlarge, ml.g6e.4xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

IBM Granite 4.0 h-small

ibm-granite-4-0-h-small

Generazione di testo

No

ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.g6e.2xlarge, ml.g6e.48xlarge, ml.g6e.4xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

IBM Granite 4.0 h-tiny

ibm-granite-4-0-h-tiny

Generazione di testo

No

ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.g6e.2xlarge, ml.g6e.48xlarge, ml.g6e.4xlarge, ml.p4d.24xlarge, ml.p5.48xlarge

IBM Granite 8B Code Instruct - 128K

ibm-granite-8b-code-instruct-128k

Generazione di testo

No

ml.g 5.12 x grande, ml.g 5.16 x grande, ml.g 5.24 x grande, ml.g 5.48 x grande, ml.g 5.4 x grande, ml.g 5.8 x grande

ixi- GEN-Fin-7.8B

lg-ixi-gen

Generazione di testo

No

ml.g5.4xlarge

JetBrains AI Mellum Tutti

jbai-mellum-all

generazione text2text

No

ml.g5.2xlarge, ml.g6.2xlarge, ml.g6e.xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge, ml.p5e.48xlarge

JetBrains AI Mellum Kotlin

jbai-mellum-kotlin

text2text (generazione di testo)

No

ml.g5.2xlarge, ml.g6.2xlarge, ml.g6e.xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge, ml.p5e.48xlarge

JetBrains AI Mellum Python

jbai-mellum-python

generazione text2text

No

ml.g5.2xlarge, ml.g6.2xlarge, ml.g6e.xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge, ml.p5e.48xlarge

Jina Embeddings v2 Base - it

jinaai-embeddings-v2-base-en

Incorporamento del testo

No

ml.g4dn.12xlarge, ml.g4dn.16xlarge, ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g4dn.xlarge, ml.g5.12xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.2xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge 48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g5.xlarge, ml.p2.16xlarge, ml.p2.8xlarge, ml.p2.xlarge, ml.p3.16xlarge, ml.p3.2xlarge, ml.p3.8xlarge

KARAKURI LM 8x7b instruct

karakuri-lm-8x7b-instruct

Generazione di testo

No

ml.g 5.48x grande, ml.g 6.48x grande

LightOn Lyra-Fr 10 B

lighton-lyra-fr

Generazione di testo

No

ml.p4d.24xlarge

LightOn Mini-instruct 40B

lighton-mini-instruct40b

Generazione di testo

No

ml.p4d.24xlarge

LFM 40B liquido (A100)

liquid-lfm-40b-a100

Generazione di testo

No

ml.p4d.24xlarge

LFM 40B liquido (H100)

liquid-lfm-40b-h100

Generazione di testo

No

ml.p5.48xlarge

LFM 40B liquido (L40S)

liquid-lfm-40b-l40s

Generazione di testo

No

ml.g6e.12xlarge

LFM 7B liquido (L40S)

liquid-lfm-7b-l40s

Generazione di testo

No

ml.g6e.16xlarge, ml.g6e.2xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.g6e.xlarge

Lama 3.1 Nemotron Nano 8B V1

nvidia-nemotron-nano-8b-nim

Generazione di testo

No

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.48xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.g6e.2xlarge, ml.g6e.48xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge, ml.p5e.48xlarge, ml.p5en.48xlarge

Lama 3.1 SuperNova Lite

arcee-llama-3-1-supernova-lite

Generazione di testo

No

ml.g 5.16 x grande, ml.g 5.2 x grande, ml.g 5.8 x grande, ml.g 6.16 x grande, ml.g 6.2 x grande, ml.g 6.2 x grande, ml.g 6.4 x grande, ml.g 6.8 x grande

Microservizio NIM Llama 3.2 NVRErankQA1b

nvidia-llama3-2-nv-rerankqa-1b-v2-nim

Generazione di testo

No

ml.g5.12xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.xlarge, ml.g6.12xlarge, ml.g6.16xlarge, ml.g6.16xlarge, ml.g6.24xlarge, ml.g6.2xlarge, ml.g6.48xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.g6.xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.g6e.2xlarge, ml.g6e.48xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.g6e.8xlarge, ml.g6e.8xlarge, ml.g6e.8xlarge, ml.g6e.8xlarge .g6e.xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge

Lama 3.3 Nemotron Super 49B V1

nvidia-nemotron-super-49b-nim

Generazione di testo

No

ml.g5.48xlarge, ml.g6e.12xlarge, ml.g6e.24xlarge, ml.g6e.48xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge, ml.p5e.48xlarge, ml.p5en.48xlarge

Lama 3.3 Nemotron Super 49B V1.5

nvidia-nemotron-super-49b-nim-1-5

Generazione di testo

No

ml.g5.48xlarge, ml.g6e.12xlarge, ml.g6e.24xlarge, ml.g6e.48xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge, ml.p5e.48xlarge, ml.p5en.48xlarge

Llama Spark

arcee-llama-spark

Generazione di testo

No

ml.g 5.16 x grande, ml.g 5.2 x grande, ml.g 5.4 x grande, ml.g 5.8 x grande, ml.g 6.16 x grande, ml.g 6.2 x grande, ml.g 6.4 x grande, ml.g 6.8 x grande

Llama-3-Varco-Offsetbias-8B

ncsoft-llama-3-varco-offsetbias-8b

Generazione di testo

No

ml.g5.12xlarge

Llama-3.1-8B-Instruct con supporto Stained Glass Transform

protopia-llama-3-1-8b-instruct

Generazione di testo

No

ml.g4dn.12xlarge, ml.g5.16xlarge, ml.g5.4xlarge

Llama-3.2-NV-EmbedQA-1B-v2

nvidia-llama3-2-nv-embedqa-1b-v2-nim

Incorporamento del testo

No

ml.g5.12xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.xlarge, ml.g6.12xlarge, ml.g6.16xlarge, ml.g6.16xlarge, ml.g6.24xlarge, ml.g6.2xlarge, ml.g6.48xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.g6.xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.g6e.2xlarge, ml.g6e.48xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.g6e.8xlarge, ml.g6e.8xlarge, ml.g6e.8xlarge, ml.g6e.8xlarge .g6e.xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge

MARS6

cambai-mars6

Da testo a audio

No

ml.g4dn.2xlarge, ml.g6.2x large

Medical LLM - Medium

john-snow-labs-medical-summarization-qa-8b

Sintesi testuale

No

ml.g4dn.12x grande, ml.g5.2x grande

Medical LLM - Small

john-snow-labs-summarization-qa

Sintesi testuale

No

ml.g5.12xlarge

Traduzione di testi medici () EN-ES

john-snow-labs-medical-translation-en-es

Traduzione

No

ml.g5.2xlarge

Mercurio

inception-mercury

Generazione di testo

No

ml.p5.48xlarge

Mercury Coder

inception-mercury-coder

Generazione di testo

No

ml.p5.48xlarge

msa-search

nvidia-nim-msa-search-v2-1

Generazione di testo

No

ml.g6e.12xlarge, ml.g6e.24xlarge, ml.g6e.48xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge, ml.p5e.48xlarge, ml.p5en.48xlarge

Nemotron nano 9b v2

nvidia-nemotron-nano-9b-v2

Generazione di testo

No

ml.g5.12xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.g6e.2xlarge, ml.g6e.2xlarge, ml.g6e.2xlarge, ml.g6e.2xlarge 6e.48xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.g6e.xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge, ml.p5.4xlarge, ml.p5e.48xlarge, ml.p5en.48xlarge

nemotron-parse

nvidia-nemotron-parse

Generazione di testo

No

ml.g5.12xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.g6e.24xlarge, ml.g6e.6e.24xlarge 2xlarge, ml.g6e.48xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.g6e.xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge, ml.p5.4xlarge, ml.p5e.48xlarge, ml.p5en.48xlarge

NEXUS di Fundamental

fundamental-technologies-nexus

Classificazione

No

ml.g4dn.8xlarge, ml.p5en.48xlarge

Nomic Embed Text v1.5

nomic-embed-text

Incorporamento del testo

No

ml.g4dn.12xlarge, ml.g4dn.16xlarge, ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g4dn.xlarge, ml.g5.12xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.2xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge 48 x grande, ml.g 5.4 x grande, ml.g 5.8 x grande, ml.g 5.x grande, ml.p 3.16 x grande, ml.p 3.2 x grande, ml.p 3.8 x grande

Nomic Embed Vision v1.5

nomic-embed-image

Incorporamento del testo

No

ml.g4dn.12xlarge, ml.g4dn.16xlarge, ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g4dn.xlarge, ml.g5.12xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.2xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge 48 x grande, ml.g 5.4 x grande, ml.g 5.8 x grande, ml.g 5.x grande, ml.p 3.16 x grande, ml.p 3.2 x grande, ml.p 3.8 x grande

NVIDIA Cosmos Reason-1-7B

nvidia-nim-cosmos-reason1-7b

Generazione di testo

No

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.48xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.g6e.2xlarge, ml.g6e.48xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.g6e.xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge, ml.p5.4xlarge, ml.p5e.48xlarge, ml.p5en.48xlarge

Microservizio NIM NVIDIA Nemotron-4 15B

nvidia-nemotron-4-15b-nim

Generazione di testo

No

ml.g5.12xlarge, ml.g5.24xlarge

NVIDIA Parakeet VTDT 0.6B v2

nvidia-parakeetvtdt-0-6b-v2

Generazione di testo Audio2

No

ml.g6.12xlarge, ml.g6.16xlarge, ml.g6.24xlarge, ml.g6.2xlarge, ml.g6.48xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.g6e.2xlarge, ml.g6e.2xlarge, ml.g6e.2xlarge, ml.g6e.2xlarge 6e.48x grande, ml.g6e.4x grande, ml.g6e.8x grande

NVIDIA-Parakeet-1-1b-CTC-EN-US-ASR

nvidia-parakeet-1-1b-ctc-en-us-asr

Generazione Audio2Text

No

ml.g 5.12xlarge, ml.g5.16xlarge, ml.g5.24xlarge, ml.g5.2xlarge, ml.g5.48xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g6.12xlarge, ml.g6.16xlarge, ml.g6.24xlarge, ml.g6.2xlarge, ml.g6.48xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.g6e.12xlarge, ml.g6e.16xlarge, ml.g6e.24xlarge, ml.g6e.2xlarge, ml.g6e.48xlarge, ml.g6e.4xlarge, ml.g6e.8xlarge, ml.p4d.24xlarge, ml.p4de.24 x grande

Globo

orbital-materials-orb

Modellazione scientifica

No

ml.g4dn.12xlarge, ml.g4dn.16xlarge, ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g4dn.xlarge, ml.p3.16xlarge, ml.p3.2xlarge, ml.p3.8xlarge, ml.p4d.24xlarge

PLaMo Distribuzione privata

preferred-networks-plamo-api

Generazione di testo

No

ml.g5.12xlarge, ml.g5.24xlarge, ml.g5.48xlarge, ml.p4d.24xlarge

ProteinMPNN-NIM

nvidia-nim-proteinmpnn-v1-0-2

Generazione di testo

No

ml.g6e.12xlarge, ml.g6e.24xlarge, ml.g6e.48xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge, ml.p5.48xlarge, ml.p5e.48xlarge, ml.p5en.48xlarge

rerank-lite-1 Ranker

voyage-rerank-lite-1-reranker

ReRank

No

ml.g5.16x grande, ml.g5.2x grande, ml.g5.4x grande, ml.g5.8x grande, ml.g5.xlarge

Mini solare - Quant

upstage-solar-mini-chat-quant

Generazione di testo

No

ml.g5.2xlarge

Solar Pro - Quante

upstage-solar-pro-quantized

Generazione di testo

No

ml.g5.12xlarge

Solar Pro 2

upstage-solar-pro

Generazione di testo

No

ml.p4d.24x grande, ml.p5.48x grande

Sonic 3 SageMaker

cartesia-sonic-3-sagemaker

Da testo a audio

No

ml.g6e.xlarge

Stable Diffusion 3.5 Large

stabilityai-stable-diffusion-3-5-large

Da testo a immagine

No

ml.p5.48xlarge

Stable Diffusion XL 1.0

stabilityai-sdxl-1-0

Da testo a immagine

No

ml.g5.2xlarge, ml.p4d.24xlarge, ml.p4de.24xlarge

Diffusione stabile XL Beta 0.8

stabilityai-sdxl-beta-0-8

Da testo a immagine

No

ml.g5.xlarge

Stockmark-LLM-13b

stockmark-llm-13b

Generazione di testo

No

ml.g5.2xlarge

VARCO LLM KO-1.3B-IST

ncsoft-ko-1-3b-ist

Generazione di testo

No

ml.g4dn.2x grande, ml.g5.2x grande, ml.g5.4x grande

MARCO LLM KO-6.4B-IST

ncsoft-ko-6-4b-ist

Generazione di testo

No

ml.g4dn.4x grande, ml.g4dn.8x grande, ml.g5.12x grande, ml.g5.4x grande, ml.g5.8x grande

MARCO LLM KO/EN-13B-IST

ncsoft-ko-13b-ist

Generazione di testo

No

ml.g4dn.12x grande, ml.g5.12x grande

Modello di incorporamento voyage-2

voyage-2-embedding

Incorporamento del testo

No

ml.g5.16xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.8xlarge, ml.g5.xlarge

Modello di incorporamento voyage-3

voyage-3-embedding

Incorporamento del testo

No

ml.g5.16xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.xlarge, ml.g5.xlarge, ml.g6.16xlarge, ml.g6.2xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.g6.xlarge

Modello voyage-3 Large Embedding

voyage-3-large-embedding

Incorporamento del testo

No

ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.xlarge, ml.g5.xlarge, ml.g6.2xlarge, ml.g6.4xlarge, ml.g6.xlarge, ml.g6.xlarge

Modello di incorporamento voyage-3.5

voyage-3-5-embedding

Incorporamento del testo

No

ml.g5.16xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.xlarge, ml.g5.xlarge, ml.g6.16xlarge, ml.g6.2xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.g6.xlarge

Modello di incorporamento voyage-3.5-lite

voyage-3-5-lite-embedding

Incorporamento del testo

No

ml.g5.16xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.xlarge, ml.g5.xlarge, ml.g6.16xlarge, ml.g6.2xlarge, ml.g6.4xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.g6.xlarge

Modello di incorporamento voyage-code-2

voyage-code-2-embedding

Incorporamento del testo

No

ml.g5.16xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.xlarge, ml.g5.xlarge, ml.g6.16xlarge, ml.g6.2xlarge, ml.g6.4xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.g6.xlarge

Modello di incorporamento voyage-code-3

voyage-code-3-embedding

Incorporamento del testo

No

ml.g5.16xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.xlarge, ml.g5.xlarge, ml.g6.16xlarge, ml.g6.2xlarge, ml.g6.4xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.g6.xlarge

Modello di incorporamento voyage-large 2

voyage-large-2-embedding

Incorporamento del testo

No

ml.g5.16xlarge, ml.g5.2xlarge, ml.g5.4xlarge, ml.g5.xlarge, ml.g5.xlarge, ml.g6.16xlarge, ml.g6.2xlarge, ml.g6.4xlarge, ml.g6.4xlarge, ml.g6.8xlarge, ml.g6.xlarge

Widn Tower Anthill

widn-tower-anthill

Traduzione

No

ml.g5.xlarge

Widn Tower Sugarloaf

widn-tower-sugarloaf

Traduzione

No

ml.g5.12xlarge

Torre del Vesuvio

widn-llama3-tower-vesuvius

Traduzione

No

ml.g 5.48x large, ml.p4d.24x large, ml.p4de.24x large

Motore di visione AI Woven City

wovenbytoyota-woven-city-ai-vision-engine

Generazione multimodale

No

ml.g5.12x grande, ml.g5.24x grande, ml.g5.48x grande, ml.g5.8x grande

Scrittore Palmyra-Fin-70B-32K

writer-palmyra-fin-70b-32k

Generazione di testo

No

ml.p4d.24xlarge

Scrittore Palmyra-Med-70B-32K

writer-palmyra-med-70b-32k

Generazione di testo

No

ml.p4d.24xlarge

Scrittore Palmyra-X-004

writer-palmyra-x-004

Generazione di testo

No

ml.p5.48xlarge

Built-in Algorithms (135)

Amazon SageMaker JumpStart fornisce modelli preformati e specifici per attività comuni di visione artificiale come la classificazione delle immagini, il rilevamento di oggetti e la segmentazione delle immagini. Questi modelli sono basati su framework di deep learning consolidati (PyTorch,TensorFlow,MXNet) e sono pronti per essere implementati o ottimizzati sui tuoi dati.

Provider Nome modello ID modello Operazione Licenza Fine-tunable Tipi di istanze di inferenza supportati

Mxnet

RCNN 101 V1d ResNet più veloce

mxnet-od-faster-rcnn-fpn-resnet101-v1d-coco

Rilevamento di oggetti

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

RCNN 101 V1d ResNet più veloce

mxnet-od-faster-rcnn-resnet101-v1d-coco

Rilevamento di oggetti

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

RCNN 50 V1b ResNet più veloce

mxnet-od-faster-rcnn-fpn-resnet50-v1b-coco

Rilevamento di oggetti

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

RCNN 50 V1b ResNet più veloce

mxnet-od-faster-rcnn-resnet50-v1b-coco

Rilevamento di oggetti

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

RCNN 50 V1b ResNet più veloce

mxnet-od-faster-rcnn-resnet50-v1b-voc

Rilevamento di oggetti

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

FCN 101 ADE20K ResNet

mxnet-semseg-fcn-resnet101-ade

Segmentazione delle immagini

apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

FCN ResNet 101 Pascal VOC

mxnet-semseg-fcn-resnet101-voc

Segmentazione delle immagini

apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

FCN 50 ADE20K ResNet

mxnet-semseg-fcn-resnet50-ade

Segmentazione delle immagini

apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

Segmentazione delle istanze

mxnet-is-mask-rcnn-fpn-resnet101-v1d-coco

Segmentazione delle immagini

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

MASCHERA RCNN FPN RESNET18 COCO

mxnet-is-mask-rcnn-fpn-resnet18-v1b-coco

Segmentazione delle immagini

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

MASCHERA RCNN FPN RESNET50 COCO

mxnet-is-mask-rcnn-fpn-resnet50-v1b-coco

Segmentazione delle immagini

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

MASCHERA RCNN RESNET18 COCO

mxnet-is-mask-rcnn-resnet18-v1b-coco

Segmentazione delle immagini

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

Rilevamento di oggetti

mxnet-od-ssd-512-mobilenet1-0-coco

Rilevamento di oggetti

apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

Segmentazione semantica

mxnet-semseg-fcn-resnet101-coco

Segmentazione delle immagini

apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

SSD 512 50 V1 ResNet

mxnet-od-ssd-512-resnet50-v1-coco

Rilevamento di oggetti

apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

SSD 1.0 MobileNet

mxnet-od-ssd-512-mobilenet1-0-voc

Rilevamento di oggetti

apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

SSD 5.0 V1 ResNet

mxnet-od-ssd-512-resnet50-v1-voc

Rilevamento di oggetti

apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

SSD VGG 16 Atrous 300

mxnet-od-ssd-300-vgg16-atrous-voc

Rilevamento di oggetti

apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

SSD VGG 16 Atrous 512

mxnet-od-ssd-512-vgg16-atrous-coco

Rilevamento di oggetti

apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

SSD VGG16 Atrous 300

mxnet-od-ssd-300-vgg16-atrous-coco

Rilevamento di oggetti

apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

SSD VGG16 Atrous 512

mxnet-od-ssd-512-vgg16-atrous-voc

Rilevamento di oggetti

apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

YOLO V3 53 DarkNet

mxnet-od-yolo3-darknet53-coco

Rilevamento di oggetti

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

YOLO V3 53 DarkNet

mxnet-od-yolo3-darknet53-voc

Rilevamento di oggetti

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

YOLO V3 1.0 MobileNet

mxnet-od-yolo3-mobilenet1-0-coco

Rilevamento di oggetti

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Mxnet

YOLO V3 1.0 MobileNet

mxnet-od-yolo3-mobilenet1-0-voc

Rilevamento di oggetti

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Torcia

SqueezeNet 1

pytorch-ic-squeezenet1-1

Classificazione delle immagini

clausola bsd-3

ml.c5.2xlarge, ml.c5.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge

Pytorch

AlexNet

pytorch-ic-alexnet

Classificazione delle immagini

clausola bsd-3

ml.c5.2xlarge, ml.c5.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge

Pytorch

DenseNet 121

pytorch-ic-densenet121

Classificazione delle immagini

clausola bsd-3

ml.c5.2xlarge, ml.c5.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge

Pytorch

DenseNet 169

pytorch-ic-densenet169

Classificazione delle immagini

clausola bsd-3

ml.c5.2xlarge, ml.c5.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge

Pytorch

FRCNN V3 grande 320 FPN MobileNet

pytorch-od1-fasterrcnn-mobilenet-v3-large-320-fpn

Rilevamento di oggetti

clausola bsd-3

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Torcia

FPN FRCNN MobileNet V3 grande

pytorch-od1-fasterrcnn-mobilenet-v3-large-fpn

Rilevamento di oggetti

clausola bsd-3

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Torcia

GoogLeNet

pytorch-ic-googlenet

Classificazione delle immagini

clausola bsd-3

ml.c5.2xlarge, ml.c5.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge

Pytorch

Classificazione delle immagini

pytorch-ic-mobilenet-v2

Classificazione delle immagini

clausola bsd-3

ml.c5.2xlarge, ml.c5.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge

Pytorch

Rilevamento di oggetti

pytorch-od1-fasterrcnn-resnet50-fpn

Rilevamento di oggetti

clausola bsd-3

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Torcia

ResNet 101

pytorch-ic-resnet101

Classificazione delle immagini

clausola bsd-3

ml.c5.2xlarge, ml.c5.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge

Pytorch

ResNet 152

pytorch-ic-resnet152

Classificazione delle immagini

clausola bsd-3

ml.c5.2xlarge, ml.c5.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge

Pytorch

ResNet 18

pytorch-ic-resnet18

Classificazione delle immagini

clausola bsd-3

ml.c5.2xlarge, ml.c5.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge

Pytorch

ResNet 34

pytorch-ic-resnet34

Classificazione delle immagini

clausola bsd-3

ml.c5.2xlarge, ml.c5.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge

Pytorch

ResNet 50

pytorch-ic-resnet50

Classificazione delle immagini

clausola bsd-3

ml.c5.2xlarge, ml.c5.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge

Pytorch

Resnext 50

pytorch-ic-resnext50-32x4d

Classificazione delle immagini

clausola bsd-3

ml.c5.2xlarge, ml.c5.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge

Pytorch

ShuffleNet V2

pytorch-ic-shufflenet-v2-x1-0

Classificazione delle immagini

clausola bsd-3

ml.c5.2xlarge, ml.c5.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge

Pytorch

SSD

pytorch-od-nvidia-ssd

Rilevamento di oggetti

clausola bsd-3

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Torcia

UOVO 1

pytorch-ic-vgg11

Classificazione delle immagini

clausola bsd-3

ml.c5.2xlarge, ml.c5.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge

Pytorch

UOVO 11-B

pytorch-ic-vgg11-bn

Classificazione delle immagini

clausola bsd-3

ml.c5.2xlarge, ml.c5.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge

Pytorch

UOVO 13-B

pytorch-ic-vgg13-bn

Classificazione delle immagini

clausola bsd-3

ml.c5.2xlarge, ml.c5.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge

Pytorch

UOVO 16

pytorch-ic-vgg16

Classificazione delle immagini

clausola bsd-3

ml.c5.2xlarge, ml.c5.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge

Pytorch

UOVO 16-B

pytorch-ic-vgg16-bn

Classificazione delle immagini

clausola bsd-3

ml.c5.2xlarge, ml.c5.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge

Pytorch

UOVO 19

pytorch-ic-vgg19

Classificazione delle immagini

clausola bsd-3

ml.c5.2xlarge, ml.c5.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge

Pytorch

VGG-13

pytorch-ic-vgg13

Classificazione delle immagini

clausola bsd-3

ml.c5.2xlarge, ml.c5.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge

Pytorch

Largo 101 ResNet

pytorch-ic-wide-resnet101-2

Classificazione delle immagini

clausola bsd-3

ml.c5.2xlarge, ml.c5.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge

Tensorflow

ALBERT Base

tensorflow-tc-albert-en-base

Classificazione del testo

apache-2.0

ml.c5.18xlarge, ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.9xlarge, ml.g4dn.16xlarge, ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.12xlarge, ml.m5.24xlarge, ml.m5.2xlarge, ml.m5.4xlarge, ml.m5.xlarge, ml.p3.16xlarge, ml.p3.2xlarge, ml.p3.8xlarge

Tensorflow

BERT Base Cased

tensorflow-tc-bert-en-cased-L-12-H-768-A-12-2

Classificazione del testo

apache-2.0

ml.c5.18xlarge, ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.9xlarge, ml.g4dn.16xlarge, ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.12xlarge, ml.m5.24xlarge, ml.m5.2xlarge, ml.m5.4xlarge, ml.m5.xlarge, ml.p3.16xlarge, ml.p3.2xlarge, ml.p3.8xlarge

Tensorflow

Base BERT MEDLINE/PubMed

tensorflow-tc-experts-bert-pubmed-1

Classificazione del testo

apache-2.0

ml.c5.18xlarge, ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.9xlarge, ml.g4dn.16xlarge, ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.12xlarge, ml.m5.24xlarge, ml.m5.2xlarge, ml.m5.4xlarge, ml.m5.xlarge, ml.p3.16xlarge, ml.p3.2xlarge, ml.p3.8xlarge

Tensorflow

BERT Base Multilingual Cased

tensorflow-tc-bert-multi-cased-L-12-H-768-A-12-2

Classificazione del testo

apache-2.0

ml.c5.18xlarge, ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.9xlarge, ml.g4dn.16xlarge, ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.12xlarge, ml.m5.24xlarge, ml.m5.2xlarge, ml.m5.4xlarge, ml.m5.xlarge, ml.p3.16xlarge, ml.p3.2xlarge, ml.p3.8xlarge

Tensorflow

BERT Large Uncased

tensorflow-tc-bert-en-uncased-L-24-H-1024-A-16-2

Classificazione del testo

apache-2.0

ml.c5.18xlarge, ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.9xlarge, ml.g4dn.16xlarge, ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.12xlarge, ml.m5.24xlarge, ml.m5.2xlarge, ml.m5.4xlarge, ml.m5.xlarge, ml.p3.16xlarge, ml.p3.2xlarge, ml.p3.8xlarge

Tensorflow

BERT Small Senza custodia L-10 H-128

tensorflow-tcembedding-bert-en-uncased-L-10-H-128-A-2-2

Incorporamento del testo

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

BERT Small Senza custodia L-12 H-256

tensorflow-tcembedding-bert-en-uncased-L-12-H-256-A-4

Incorporamento del testo

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

BERT Small Senza custodia L-12 H-768

tensorflow-tcembedding-bert-en-uncased-L-12-H-768-A-12-2

Incorporamento del testo

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

BERT Small Senza custodia L-4 H-768

tensorflow-tcembedding-bert-en-uncased-L-4-H-768-A-12-2

Incorporamento del testo

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

BiT-M R101x1

tensorflow-ic-bit-m-r101x1-ilsvrc2012-classification-1

Classificazione delle immagini

Apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.c6i.large, ml.c6i.xlarge, ml.g4dn.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge, ml.r5.large, ml.r5.large, ml.r5.xlarge

Tensorflow

BiT-M Vettore di funzionalità R101x1

tensorflow-icembedding-bit-m-r101x1-ilsvrc2012-featurevector-1

Classificazione delle immagini

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

BiT-M R50x1 ImageNet-21k

tensorflow-ic-bit-m-r50x1-imagenet21k-classification-1

Classificazione delle immagini

Apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.c6i.large, ml.c6i.xlarge, ml.g4dn.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge, ml.r5.large, ml.r5.large, ml.r5.xlarge

Tensorflow

ACIT S 42 224

tensorflow-ic-cait-s24-224

Classificazione delle immagini

AMICIZIA

ml.c5.2xlarge, ml.c5.xlarge, ml.c6i.xlarge, ml.c6i.xlarge, ml.g4dn.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge, ml.r5.large, ml.r5.xlarge

Tensorflow

CenterNet ResNet-v1-101

tensorflow-od-centernet-resnet101v1-fpn-512x512-1

Rilevamento di oggetti

apache-2.0

No

ml.g4dn.xlarge, ml.g5.xlarge, ml.p3.2xlarge

Tensorflow

CenterNet ResNet-v1-50

tensorflow-od-centernet-resnet50v1-fpn-512x512-1

Rilevamento di oggetti

apache-2.0

No

ml.g4dn.xlarge, ml.g5.xlarge, ml.p3.2xlarge

Tensorflow

Modificare la patch Tiny Distilled 16 224

tensorflow-ic-deit-tiny-distilled-patch16-224

Classificazione delle immagini

MENTA

ml.c5.2xlarge, ml.c5.xlarge, ml.c6i.xlarge, ml.c6i.xlarge, ml.g4dn.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge, ml.r5.large, ml.r5.xlarge

Tensorflow

EfficientNet B0

tensorflow-ic-efficientnet-b0-classification-1

Classificazione delle immagini

Apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.c6i.large, ml.c6i.xlarge, ml.g4dn.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge, ml.r5.large, ml.r5.large, ml.r5.xlarge

Tensorflow

EfficientNet B1

tensorflow-ic-efficientnet-b1-classification-1

Classificazione delle immagini

Apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.c6i.large, ml.c6i.xlarge, ml.g4dn.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge, ml.r5.large, ml.r5.large, ml.r5.xlarge

Tensorflow

EfficientNet Vettore di funzionalità B1

tensorflow-icembedding-efficientnet-b1-featurevector-1

Classificazione delle immagini

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

EfficientNet B3

tensorflow-ic-efficientnet-b3-classification-1

Classificazione delle immagini

Apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.c6i.large, ml.c6i.xlarge, ml.g4dn.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge, ml.r5.large, ml.r5.large, ml.r5.xlarge

Tensorflow

EfficientNet B7

tensorflow-ic-efficientnet-b7-classification-1

Classificazione delle immagini

Apache-2.0

ml.c5.9x grande, ml.g4dn.8x grande, ml.p3.8x grande

Tensorflow

EfficientNet V2 ImageNet-1k Piccolo

tensorflow-ic-efficientnet-v2-imagenet1k-s

Classificazione delle immagini

Apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.c6i.large, ml.c6i.xlarge, ml.g4dn.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge, ml.r5.large, ml.r5.large, ml.r5.xlarge

Tensorflow

EfficientNet V2 ImageNet-21k FT1k M

tensorflow-ic-efficientnet-v2-imagenet21k-ft1k-m

Classificazione delle immagini

Apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.c6i.large, ml.c6i.xlarge, ml.g4dn.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge, ml.r5.large, ml.r5.xlarge

Tensorflow

Resnet V2 R-CNN più veloce 1024x1024

tensorflow-od-faster-rcnn-inception-resnet-v2-1024x1024-1

Rilevamento di oggetti

apache-2.0

No

ml.g4dn.xlarge, ml.g5.xlarge, ml.p3.2xlarge

Tensorflow

V1 più veloce R-CNN Resnet-101 640x640

tensorflow-od-faster-rcnn-resnet101-v1-640x640-1

Rilevamento di oggetti

apache-2.0

No

ml.g4dn.xlarge, ml.g5.xlarge, ml.p3.2xlarge

Tensorflow

V1 più veloce R-CNN Resnet-50 1024x1024

tensorflow-od-faster-rcnn-resnet50-v1-1024x1024-1

Rilevamento di oggetti

apache-2.0

No

ml.g4dn.xlarge, ml.g5.xlarge, ml.p3.2xlarge

Tensorflow

V1 più veloce R-CNN Resnet-50 640x640

tensorflow-od-faster-rcnn-resnet50-v1-640x640-1

Rilevamento di oggetti

apache-2.0

No

ml.g4dn.xlarge, ml.g5.xlarge, ml.p3.2xlarge

Tensorflow

V1 più veloce R-CNN Resnet-50 800x1333

tensorflow-od-faster-rcnn-resnet50-v1-800x1333-1

Rilevamento di oggetti

apache-2.0

No

ml.g4dn.xlarge, ml.g5.xlarge, ml.p3.2xlarge

Tensorflow

VOLANT

tensorflow-audioembedding-frill-1

Classificazione audio

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

Classificazione delle immagini

tensorflow-ic-swin-base-patch4-window7-224

Classificazione delle immagini

MENTA

ml.c5.2xlarge, ml.c5.xlarge, ml.c6i.xlarge, ml.c6i.xlarge, ml.g4dn.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge, ml.r5.large, ml.r5.xlarge

Tensorflow

Incorporamento di immagini

tensorflow-icembedding-imagenet-mobilenet-v2-100-224-fv-4

Classificazione delle immagini

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

Inception V3

tensorflow-ic-imagenet-inception-v3-classification-4

Classificazione delle immagini

Apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.c6i.large, ml.c6i.xlarge, ml.g4dn.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge, ml.r5.large, ml.r5.xlarge

Tensorflow

Vettore della funzione di anteprima di Inception V3

tensorflow-icembedding-tf2-preview-inception-v3-fv-4

Classificazione delle immagini

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

MobileNet V2

tensorflow-ic-tf2-preview-mobilenet-v2-classification-4

Classificazione delle immagini

Apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.c6i.large, ml.c6i.xlarge, ml.g4dn.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge, ml.r5.large, ml.r5.large, ml.r5.xlarge

Tensorflow

MobileNet V2 0,35 128

tensorflow-ic-imagenet-mobilenet-v2-035-128

Classificazione delle immagini

Apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.c6i.large, ml.c6i.xlarge, ml.g4dn.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge, ml.r5.large, ml.r5.large, ml.r5.xlarge

Tensorflow

MobileNet V2 0,50 224

tensorflow-icembedding-imagenet-mobilenet-v2-050-224-fv-4

Classificazione delle immagini

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

MobileNet V2 1.00 224

tensorflow-ic-imagenet-mobilenet-v2-100-224-classification-4

Classificazione delle immagini

Apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.c6i.large, ml.c6i.xlarge, ml.g4dn.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge, ml.r5.large, ml.r5.large, ml.r5.xlarge

Tensorflow

MobileNet V2 1.40 224

tensorflow-ic-imagenet-mobilenet-v2-140-224-classification-4

Classificazione delle immagini

Apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.c6i.large, ml.c6i.xlarge, ml.g4dn.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge, ml.r5.large, ml.r5.large, ml.r5.xlarge

Tensorflow

MobileNet Vettore di funzionalità V2

tensorflow-icembedding-tf2-preview-mobilenet-v2-featurevector-4

Classificazione delle immagini

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

MobileNet Vettore di funzionalità V2

tensorflow-icembedding-tf2-preview-mobilenet-v2-fv-4

Classificazione delle immagini

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

MobileNet V3 Large 1.00 224

tensorflow-ic-imagenet-mobilenet-v3-large-100-224

Classificazione delle immagini

Apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.c6i.large, ml.c6i.xlarge, ml.g4dn.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge, ml.r5.large, ml.r5.large, ml.r5.xlarge

Tensorflow

MobileNet V3 Small 0.75 224

tensorflow-ic-imagenet-mobilenet-v3-small-075-224

Classificazione delle immagini

Apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.c6i.large, ml.c6i.xlarge, ml.g4dn.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge, ml.r5.large, ml.r5.xlarge

Tensorflow

MobileNet V3 Small 1.00 224

tensorflow-ic-imagenet-mobilenet-v3-small-100-224

Classificazione delle immagini

Apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.c6i.large, ml.c6i.xlarge, ml.g4dn.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge, ml.r5.large, ml.r5.xlarge

Tensorflow

Rilevamento di oggetti

tensorflow-od1-ssd-resnet50-v1-fpn-640x640-coco17-tpu-8

Rilevamento di oggetti

apache-2.0

ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

ResNet 50

tensorflow-ic-resnet-50-classification-1

Classificazione delle immagini

Apache-2.0

ml.c5.9x grande, ml.g4dn.8x grande, ml.p3.8x grande

Tensorflow

ResNet 50 Feature Vector

tensorflow-icembedding-resnet-50-featurevector-1

Classificazione delle immagini

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

ResNet V1 50

tensorflow-ic-imagenet-resnet-v1-50-classification-4

Classificazione delle immagini

Apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.c6i.large, ml.c6i.xlarge, ml.g4dn.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge, ml.r5.large, ml.r5.large, ml.r5.xlarge

Tensorflow

ResNet Vettore di funzionalità V2 152

tensorflow-icembedding-imagenet-resnet-v2-152-featurevector-4

Classificazione delle immagini

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

ResNet V2 50

tensorflow-ic-imagenet-resnet-v2-50-classification-4

Classificazione delle immagini

Apache-2.0

ml.c5.2xlarge, ml.c5.xlarge, ml.c6i.large, ml.c6i.xlarge, ml.g4dn.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge, ml.r5.large, ml.r5.large, ml.r5.xlarge

Tensorflow

ResNet Vettore di funzionalità V2 5.0

tensorflow-icembedding-imagenet-resnet-v2-50-featurevector-4

Classificazione delle immagini

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

Unità SSD Resnet-101 Retinanet 640x640

tensorflow-od-retinanet-resnet101-v1-fpn-640x640-1

Rilevamento di oggetti

apache-2.0

No

ml.g4dn.xlarge, ml.g5.xlarge, ml.p3.2xlarge

Tensorflow

BERT piccolo _ L-10 _ H-512 A-8

tensorflow-tc-small-bert-bert-en-uncased-L-10-H-512-A-8

Classificazione del testo

apache-2.0

ml.c5.18xlarge, ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.9xlarge, ml.g4dn.16xlarge, ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.12xlarge, ml.m5.24xlarge, ml.m5.2xlarge, ml.m5.4xlarge, ml.m5.xlarge, ml.p3.16xlarge, ml.p3.2xlarge, ml.p3.8xlarge

Tensorflow

BERT piccolo L-12 _ H-256 _ A-4

tensorflow-tc-small-bert-bert-en-uncased-L-12-H-256-A-4

Classificazione del testo

apache-2.0

ml.c5.18xlarge, ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.9xlarge, ml.g4dn.16xlarge, ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.12xlarge, ml.m5.24xlarge, ml.m5.2xlarge, ml.m5.4xlarge, ml.m5.xlarge, ml.p3.16xlarge, ml.p3.2xlarge, ml.p3.8xlarge

Tensorflow

BERT piccolo L-12 _ H-768 _ A-12

tensorflow-tc-small-bert-bert-en-uncased-L-12-H-768-A-12

Classificazione del testo

apache-2.0

ml.c5.18xlarge, ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.9xlarge, ml.g4dn.16xlarge, ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.12xlarge, ml.m5.24xlarge, ml.m5.2xlarge, ml.m5.4xlarge, ml.m5.xlarge, ml.p3.16xlarge, ml.p3.2xlarge, ml.p3.8xlarge

Tensorflow

BERT piccolo L-2 _ H-128 _ A-2

tensorflow-tc-small-bert-bert-en-uncased-L-2-H-128-A-2

Classificazione del testo

apache-2.0

ml.c5.18xlarge, ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.9xlarge, ml.g4dn.16xlarge, ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.12xlarge, ml.m5.24xlarge, ml.m5.2xlarge, ml.m5.4xlarge, ml.m5.xlarge, ml.p3.16xlarge, ml.p3.2xlarge, ml.p3.8xlarge

Tensorflow

BERT piccolo L-4 _ H-512 _ A-8

tensorflow-tc-small-bert-bert-en-uncased-L-4-H-512-A-8

Classificazione del testo

apache-2.0

ml.c5.18xlarge, ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.9xlarge, ml.g4dn.16xlarge, ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.12xlarge, ml.m5.24xlarge, ml.m5.2xlarge, ml.m5.4xlarge, ml.m5.xlarge, ml.p3.16xlarge, ml.p3.2xlarge, ml.p3.8xlarge

Tensorflow

BERT piccolo L-6 _ H-768 _ A-12

tensorflow-tc-small-bert-bert-en-uncased-L-6-H-768-A-12

Classificazione del testo

apache-2.0

ml.c5.18xlarge, ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.9xlarge, ml.g4dn.16xlarge, ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.12xlarge, ml.m5.24xlarge, ml.m5.2xlarge, ml.m5.4xlarge, ml.m5.xlarge, ml.p3.16xlarge, ml.p3.2xlarge, ml.p3.8xlarge

Tensorflow

BERT piccolo L-8 _ H-768 _ A-12

tensorflow-tc-small-bert-bert-en-uncased-L-8-H-768-A-12

Classificazione del testo

apache-2.0

ml.c5.18xlarge, ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.9xlarge, ml.g4dn.16xlarge, ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.12xlarge, ml.m5.24xlarge, ml.m5.2xlarge, ml.m5.4xlarge, ml.m5.xlarge, ml.p3.16xlarge, ml.p3.2xlarge, ml.p3.8xlarge

Tensorflow

SSD ResNet 152 V1 FPN 1024x1024 COCO '17

tensorflow-od1-ssd-resnet152-v1-fpn-1024x1024-coco17-tpu-8

Rilevamento di oggetti

apache-2.0

ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

SSD EfficientDet D0

tensorflow-od-efficientdet-d0-1

Rilevamento di oggetti

apache-2.0

No

ml.g4dn.xlarge, ml.g5.xlarge, ml.p3.2xlarge

Tensorflow

SSD Efficientset X0 512x512 COCO '17

tensorflow-od1-ssd-efficientdet-d0-512x512-coco17-tpu-8

Rilevamento di oggetti

apache-2.0

ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

SSD Efficientset X1 640x640 COCO '17

tensorflow-od1-ssd-efficientdet-d1-640x640-coco17-tpu-8

Rilevamento di oggetti

apache-2.0

ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

SSD EfficientDet D2

tensorflow-od-efficientdet-d2-1

Rilevamento di oggetti

apache-2.0

No

ml.g4dn.xlarge, ml.g5.xlarge, ml.p3.2xlarge

Tensorflow

SSD Efficientset X2 768x768 COCO '17

tensorflow-od1-ssd-efficientdet-d2-768x768-coco17-tpu-8

Rilevamento di oggetti

apache-2.0

ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

SSD EfficientDet D3

tensorflow-od-efficientdet-d3-1

Rilevamento di oggetti

apache-2.0

No

ml.g4dn.xlarge, ml.g5.xlarge, ml.p3.2xlarge

Tensorflow

SSD Efficientset S3 896x896 COCO '17

tensorflow-od1-ssd-efficientdet-d3-896x896-coco17-tpu-32

Rilevamento di oggetti

apache-2.0

ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

SSD EfficientDet D5

tensorflow-od-efficientdet-d5-1

Rilevamento di oggetti

apache-2.0

No

ml.g4dn.xlarge, ml.g5.xlarge, ml.p3.2xlarge

Tensorflow

Unità SSD Mobilenet V1 FPN 640x640 COCO '17

tensorflow-od1-ssd-mobilenet-v1-fpn-640x640-coco17-tpu-8

Rilevamento di oggetti

apache-2.0

ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

SSD Mobilenet V2

tensorflow-od-ssd-mobilenet-v2-2

Rilevamento di oggetti

apache-2.0

No

ml.g4dn.xlarge, ml.g5.xlarge, ml.p3.2xlarge

Tensorflow

Unità SSD Mobilenet V2 640x640

tensorflow-od-ssd-mobilenet-v2-fpnlite-640x640-1

Rilevamento di oggetti

apache-2.0

No

ml.g4dn.xlarge, ml.g5.xlarge, ml.p3.2xlarge

Tensorflow

Unità SSD Mobilenet V2 320x320 COCO '17 FPN-Lite

tensorflow-od1-ssd-mobilenet-v2-fpnlite-320x320-coco17-tpu-8

Rilevamento di oggetti

apache-2.0

ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

Unità SSD Mobilenet V2 640x640 COCO FPN-lite '17

tensorflow-od1-ssd-mobilenet-v2-fpnlite-640x640-coco17-tpu-8

Rilevamento di oggetti

apache-2.0

ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

SSD 101 V1 RPN ResNet 1024x1024 COCO '17

tensorflow-od1-ssd-resnet101-v1-fpn-1024x1024-coco17-tpu-8

Rilevamento di oggetti

apache-2.0

ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

SSD 101 V1 RPN ResNet 640x640 COCO '17

tensorflow-od1-ssd-resnet101-v1-fpn-640x640-coco17-tpu-8

Rilevamento di oggetti

apache-2.0

ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

SSD 152 V1 RPN ResNet 640x640 COCO '17

tensorflow-od1-ssd-resnet152-v1-fpn-640x640-coco17-tpu-8

Rilevamento di oggetti

apache-2.0

ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

SSD 50 V1 RPN ResNet 1024x1024 COCO '17

tensorflow-od1-ssd-resnet50-v1-fpn-1024x1024-coco17-tpu-8

Rilevamento di oggetti

apache-2.0

ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

Base Swin 4 12 384

tensorflow-ic-swin-base-patch4-window12-384

Classificazione delle immagini

MENTA

ml.c5.2xlarge, ml.c5.xlarge, ml.c6i.xlarge, ml.c6i.xlarge, ml.g4dn.xlarge, ml.m4.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge, ml.r5.large, ml.r5.xlarge

Tensorflow

Talking Heads Large

tensorflow-tc-talking-heads-large

Classificazione del testo

apache-2.0

ml.c5.18xlarge, ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.9xlarge, ml.g4dn.16xlarge, ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.12xlarge, ml.m5.24xlarge, ml.m5.2xlarge, ml.m5.4xlarge, ml.m5.xlarge, ml.p3.16xlarge, ml.p3.2xlarge, ml.p3.8xlarge

Tensorflow

Classificazione del testo

tensorflow-tc-bert-en-uncased-L-12-H-768-A-12-2

Classificazione del testo

apache-2.0

ml.c5.18xlarge, ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.9xlarge, ml.g4dn.16xlarge, ml.g4dn.2xlarge, ml.g4dn.4xlarge, ml.g4dn.8xlarge, ml.g4dn.xlarge, ml.g5.xlarge, ml.m5.12xlarge, ml.m5.24xlarge, ml.m5.2xlarge, ml.m5.4xlarge, ml.m5.xlarge, ml.p3.16xlarge, ml.p3.2xlarge, ml.p3.8xlarge

Tensorflow

Incorporamento del testo

tensorflow-tcembedding-universal-sentc-encoder-cmlm-en-large-1

Incorporamento del testo

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

TRILL DISTILLATO

tensorflow-audioembedding-trill-distilled-3

Classificazione audio

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

Trillson 1

tensorflow-audioembedding-trillsson1-1

Classificazione audio

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

Tri Lsson 2

tensorflow-audioembedding-trillsson2-1

Classificazione audio

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

Tri Lsson 3

tensorflow-audioembedding-trillsson3-1

Classificazione audio

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Tensorflow

Universal Sentence Encoder CMLM Base

tensorflow-tcembedding-universal-sentc-encoder-cmlm-en-base-1

Incorporamento del testo

apache-2.0

No

ml.c5.2xlarge, ml.c5.xlarge, ml.g4dn.xlarge, ml.m5.large, ml.m5.xlarge, ml.p3.2xlarge

Classic ML Algorithms (11)

Amazon fornisce implementazioni pronte all'uso SageMaker JumpStart di algoritmi di apprendimento automatico classici per attività relative ai dati tabulari come classificazione, regressione e previsione di serie temporali. Questi algoritmi (XGBoost,,, LightGBM CatBoostscikit-learn,AutoGluon) sono ottimizzati per i dati strutturati e possono essere addestrati da zero sui tuoi set di dati.

Provider Nome modello ID modello Operazione Licenza Fine-tunable Tipi di istanze di inferenza supportati

Autogluon

AutoGluon Classificazione tabulare

autogluon-classification-ensemble

Classificazione tabulare

apache-2.0

ml.c5.18xlarge, ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.9xlarge, ml.g4dn.xlarge, ml.m5.12xlarge, ml.m5.24xlarge, ml.m5.2xlarge, ml.m5.4xlarge, ml.p3.2xlarge

Autogluon

AutoGluon Regressione tabulare

autogluon-regression-ensemble

Regressione tabulare

apache-2.0

ml.c5.18xlarge, ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.9xlarge, ml.g4dn.xlarge, ml.m5.12xlarge, ml.m5.24xlarge, ml.m5.2xlarge, ml.m5.4xlarge, ml.p3.2xlarge

Catboost

CatBoost Classificazione

catboost-classification-model

Classificazione tabulare

apache-2.0

ml.c5.18xlarge, ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.9xlarge, ml.m4.16xlarge, ml.m5.12xlarge, ml.m5.24xlarge, ml.m5.2xlarge, ml.m5.4xlarge

Cat Boost

CatBoost Regressione

catboost-regression-model

Regressione tabulare

apache-2.0

ml.c4.8xlarge, ml.c5.18xlarge, ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.9xlarge, ml.m5.12xlarge, ml.m5.24xlarge, ml.m5.2xlarge, ml.m5.4xlarge

Gbm leggero

Classificazione LightGBM

lightgbm-classification-model

Classificazione tabulare

mit

ml.c5.18xlarge, ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.9xlarge, ml.m4.16xlarge, ml.m5.12xlarge, ml.m5.24xlarge, ml.m5.2xlarge, ml.m5.4xlarge

Gbm leggero

Regressione LightGBM

lightgbm-regression-model

Regressione tabulare

mit

ml.c4.8xlarge, ml.c5.18xlarge, ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.9xlarge, ml.m5.12xlarge, ml.m5.24xlarge, ml.m5.2xlarge, ml.m5.4xlarge

Torcia

TabTransformer Classificazione

pytorch-tabtransformerclassification-model

Classificazione tabulare

apache-2.0

ml.c5.18xlarge, ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.9xlarge, ml.g4dn.xlarge, ml.m5.12xlarge, ml.m5.24xlarge, ml.m5.2xlarge, ml.m5.4xlarge, ml.p3.2xlarge

Pitorch

TabTransformer Regressione

pytorch-tabtransformerregression-model

Regressione tabulare

apache-2.0

ml.c5.18xlarge, ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.9xlarge, ml.g4dn.xlarge, ml.m5.12xlarge, ml.m5.24xlarge, ml.m5.2xlarge, ml.m5.4xlarge, ml.p3.2xlarge

Sklearn

Classificazione lineare

sklearn-classification-linear

Classificazione tabulare

clausola bsd-3

ml.c4.8xlarge, ml.c5.18xlarge, ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.9xlarge, ml.m5.12xlarge, ml.m5.24xlarge, ml.m5.2xlarge, ml.m5.4xlarge, ml.m5.xlarge

Xgboost

Classificazione XGBoost

xgboost-classification-model

Classificazione tabulare

apache-2.0

ml.c4.8xlarge, ml.c5.18xlarge, ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.9xlarge, ml.m5.12xlarge, ml.m5.24xlarge, ml.m5.2xlarge, ml.m5.4xlarge, ml.m5.xlarge

Xgboost

Regressione XGBoost

xgboost-regression-model

Regressione tabulare

apache-2.0

ml.c4.8xlarge, ml.c5.18xlarge, ml.c5.2xlarge, ml.c5.4xlarge, ml.c5.9xlarge, ml.m5.12xlarge, ml.m5.24xlarge, ml.m5.2xlarge, ml.m5.4xlarge, ml.m5.xlarge

Nota

Per informazioni sulle licenze più accurate e aggiornate, consulta la pagina dei dettagli del modello in SageMaker Studio o la Hugging Face pagina del modello.