Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Distribuisci modelli utilizzando Amazon Studio JumpStart SageMaker
I passaggi seguenti mostrano come distribuire modelli JumpStart utilizzando Amazon SageMaker Studio.
Prerequisiti
Verifica di aver impostato le funzionalità di inferenza sui tuoi cluster Amazon SageMaker HyperPod. Per ulteriori informazioni, consulta Configurazione dei HyperPod cluster per la distribuzione dei modelli.
Crea una distribuzione HyperPod
-
In Amazon SageMaker Studio, apri la pagina di JumpStart destinazione dal riquadro di navigazione a sinistra.
-
In Tutti i modelli pubblici, scegli un modello da implementare.
Nota
Se hai selezionato un modello gated, dovrai accettare il Contratto di licenza con l’utente finale (EULA).
-
Scegli SageMaker HyperPod.
-
In Impostazioni di distribuzione, JumpStart consiglierò un'istanza per la distribuzione. Se necessario, puoi modificare queste impostazioni.
-
Se modifichi il tipo di istanza, assicurati che sia compatibile con il cluster scelto HyperPod . Se non ci sono istanze compatibili, dovrai selezionare un nuovo HyperPod cluster o contattare l'amministratore per aggiungere istanze compatibili al cluster.
-
Per dare priorità all’implementazione del modello, installa il componente aggiuntivo per la governance delle attività, crea allocazioni delle risorse di calcolo e imposta le classificazioni delle attività per la policy del cluster. Una volta completata questa operazione, dovrebbe apparire un’opzione per selezionare una priorità per l’implementazione del modello, che può essere utilizzata per la prelazione di altre implementazioni e attività nel cluster.
-
Inserisci il namespace al quale l’amministratore ti ha fornito l’accesso. Potrebbe essere necessario contattare direttamente l’amministratore per ottenere il namespace esatto. Una volta fornito un namespace valido, il pulsante Implementa dovrebbe diventare attivo per implementare il modello.
-
Se il tipo di istanza è partizionato (MIG abilitato), seleziona un tipo di partizione GPU.
-
Se desideri abilitare L2 KVcache o Intelligent routing per velocizzare l'inferenza LLM, abilitali. Per impostazione predefinita, è abilitata solo la cache L1 KV. Per maggiori dettagli su KVCache e Intelligent routing, vedi Model Deployment. SageMaker HyperPod
-
-
Scegli Implementa e attendi la creazione dell’endpoint.
-
Dopo aver creato l’endpoint, seleziona Testa inferenza.
Modifica una distribuzione HyperPod
-
In Amazon SageMaker Studio, seleziona Compute e poi HyperPod Clusters dal riquadro di navigazione a sinistra.
-
In Deployments, scegli la distribuzione del HyperPod cluster che desideri modificare.
-
Dall’icona con tre puntini verticali (⋮), scegli Modifica.
-
In Impostazioni di distribuzione, puoi abilitare o disabilitare Auto-scaling e modificare il numero di repliche Max.
-
Seleziona Salva.
-
Lo stato diventa Aggiornamento in corso. Quando viene visualizzato di nuovo lo stato In servizio, le modifiche sono complete e viene visualizzato un messaggio di conferma.
Eliminare una distribuzione HyperPod
-
In Amazon SageMaker Studio, seleziona Compute e quindi HyperPod Clusters dal riquadro di navigazione a sinistra.
-
In Deployments, scegli la distribuzione del HyperPod cluster che desideri modificare.
-
Dall’icona con tre puntini verticali (⋮), scegli Elimina.
-
Nella finestra Elimina HyperPod distribuzione, seleziona la casella di controllo.
-
Scegli Elimina.
-
Lo stato diventa Eliminazione in corso. Una volta eliminata la HyperPod distribuzione, verrà visualizzato un messaggio di conferma.