Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Ressources relatives à l'utilisation du serveur d'inférence Triton avec Amazon AI SageMaker
SageMaker L'IA permet aux clients de déployer un modèle à l'aide d'un code personnalisé avec NVIDIA Triton Inference Server. Consultez les ressources suivantes pour apprendre à utiliser Triton Inference Server avec SageMaker l'IA.
Pour accéder à cette fonctionnalité, développez Triton Inference Server Containers (Conteneurs de serveur d’inférence Triton). Ces conteneurs incluent le serveur d'inférence NVIDIA Triton, la prise en charge des frameworks ML courants et des variables d'environnement utiles qui vous permettent d'optimiser les performances en matière SageMaker d'IA. Pour obtenir la liste des images Deep Learning Containers disponibles, consultez Images Deep Learning Containers disponibles
Vous pouvez utiliser le conteneur Triton Inference Server avec le SDK SageMaker Python comme vous le feriez pour n'importe quel autre conteneur dans vos SageMaker modèles d'IA. Toutefois, l'utilisation du SDK SageMaker Python est facultative. Vous pouvez utiliser les conteneurs du serveur d'inférence Triton avec le AWS CLI et. AWS SDK for Python (Boto3)
Pour plus d’informations sur le serveur d’inférence NVIDIA Triton, consultez la documentation Triton
Inférence
Note
Le backend Triton Python utilise la mémoire partagée (SHMEM) pour connecter votre code à Triton. SageMaker AI Inference fournit jusqu'à la moitié de la mémoire de l'instance sous forme de SHMEM. Vous pouvez donc utiliser une instance avec plus de mémoire pour une taille SHMEM plus importante.
À des fins d'inférence, vous pouvez utiliser vos modèles de machine learning entraînés avec Triton Inference Server pour déployer une tâche d'inférence avec l'IA. SageMaker
Voici quelques fonctions clés du conteneur de serveur d’inférence Triton :
-
Prise en charge de plusieurs cadres : Triton peut être utilisé pour déployer des modèles à partir de tous les principaux frameworks de ML. Triton prend en charge les TensorFlow GraphDef formats de SavedModel modèle et, ONNX PyTorch TorchScript, TensorRT et les formats de modèle ++ personnalisés Python/C.
-
Pipelines de modèles : l'ensemble de modèles Triton représente un pipeline d'un modèle avec une logique de pre/post traitement et la connexion de tenseurs d'entrée et de sortie entre eux. Une seule demande d'inférence à un ensemble déclenche l'exécution du pipeline entier.
-
Exécution simultanée du modèle : plusieurs instances du même modèle peuvent s'exécuter simultanément sur le même GPU ou sur plusieurs GPU.
-
Traitement par lots dynamique : pour les modèles qui prennent en charge le traitement par lots, Triton dispose de plusieurs algorithmes de planification et de traitement par lots intégrés qui combinent des demandes d'inférence individuelles pour améliorer le débit d'inférence. Ces décisions de planification et de traitement par lots sont transparentes pour le client qui demande l'inférence.
-
Prise en charge de divers CPU et GPU : les modèles peuvent être exécutés sur des CPU ou des GPU pour une flexibilité maximale et pour prendre en charge des exigences informatiques hétérogènes.
Que souhaitez-vous faire ?
- Je souhaite déployer mon PyTorch modèle entraîné en SageMaker IA.
-
Pour un exemple de Jupyter Notebook, consultez l'exemple Déployez votre modèle PyTorch Resnet50 avec Triton Inference Server.
- Je souhaite déployer mon modèle Hugging Face entraîné dans l' SageMaker IA.
-
Pour un exemple de Jupyter Notebook, consultez l'exemple Déployez votre modèle PyTorch BERT avec Triton Inference Server.