Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
SageMaker HyperPod L'observabilité d'Amazon avec Amazon Managed Grafana et Amazon Managed Service pour Prometheus
Amazon SageMaker HyperPod (SageMaker HyperPod) fournit un tableau de bord complet et prêt à l'emploi qui vous donne des informations sur les tâches de développement du modèle de base (FM) et les ressources du cluster. Cette solution d’observabilité unifiée publie automatiquement les métriques clés sur le service géré Amazon pour Prometheus et les affiche dans les tableaux de bord Amazon Managed Grafana. Les tableaux de bord sont optimisés spécifiquement pour le développement d’un modèle de fondation avec une couverture approfondie de l’état du matériel, de l’utilisation des ressources et des performances au niveau des tâches. Grâce à ce module complémentaire, vous pouvez consolider les données de santé et de performances provenant de NVIDIA DCGM, des exportateurs de nœuds Kubernetes au niveau de l'instance, d'Elastic Fabric Adapter, des systèmes de fichiers intégrés, des API Kubernetes, de Kueue et des opérateurs de tâches. SageMaker HyperPod
Prise en charge des groupes d'instances restreints (RIG)
Le module complémentaire d'observabilité prend également en charge les clusters contenant des groupes d'instances restreints. Dans les clusters RIG, le module complémentaire adapte automatiquement sa stratégie de déploiement pour se conformer aux contraintes d'isolation du réseau et de sécurité des nœuds restreints. DaemonSet les composants (exportateur de nœuds, exportateur DCGM, exportateur EFA, moniteur Neuron et collecteur de nœuds) s'exécutent à la fois sur des nœuds standard et restreints. Les composants de déploiement (collecteur central, Kube State Metrics et Training Metrics Agent) sont planifiés selon une logique tenant compte des limites afin de respecter l'isolation réseau entre les groupes d'instances. La collecte de journaux de conteneurs avec Fluent Bit n'est pas disponible sur les nœuds restreints.
Pour plus d'informations sur la configuration du module complémentaire sur les clusters dotés de groupes d'instances restreints, consultezConfiguration du module complémentaire d' SageMaker HyperPod observabilité.
Rubriques
Configuration du module complémentaire d' SageMaker HyperPod observabilité
Exploration des métriques de SageMaker HyperPod cluster dans Amazon Managed Grafana
Personnalisation des métriques, des tableaux de bord et des alertes des SageMaker HyperPod clusters
Création de métriques SageMaker HyperPod de cluster personnalisées
Résolution des problèmes liés au module complémentaire Amazon SageMaker HyperPod Observability