View a markdown version of this page

CloudWatch SageMaker Informations sur l'IA - Amazon CloudWatch

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

CloudWatch SageMaker Informations sur l'IA

Utilisez CloudWatch SageMaker AI Insights pour surveiller et dépanner les terminaux d'inférence d' SageMaker IA à grande échelle. Le tableau de bord affiche des mesures et des visualisations organisées selon trois vues (performances , capacité et fiabilité) afin que vous puissiez identifier rapidement les problèmes, optimiser l'utilisation des ressources et garantir une haute disponibilité sur vos terminaux.

SageMaker AI Insights prend en charge la surveillance de tous les types de terminaux (points de terminaison à modèle unique et points de terminaison basés sur des composants d'inférence (IC)) et des cadres d'inférence (vLLM, sgLang, Tensorrt‐LLM).

Pour commencer à utiliser SageMaker AI Insights, consultez les rubriques suivantes.

Capacités clés

  • OpenTelemetry‐collection native. Les métriques sont collectées à l'aide d'un collecteur OTel qui extrait les points de terminaison Prometheus du DCGM (métriques GPU), des exportateurs de nœuds (CPU, mémoire, disque) et des conteneurs du framework d'inférence (vLLm, SGlang).

  • Étiquettes dimensionnelles riches. Chaque métrique inclut des libellés tels que aws.sagemaker.endpoint.name aws.sagemaker.inference_component.name@resource.host.id,@resource.cloud.availability_zone, et@resource.host.type.

  • Attribution par processeur graphique. Les métriques GPU (DCGM) incluent l'attribution par composant par inférence pour les instances multi-locataires.

  • Métriques du cadre d'inférence. Métriques vLLM et SGlang natives (jetons par seconde, délai jusqu'au premier jeton (TTFT), latence entre jetons, utilisation du cache KV, profondeur de file d'attente, taille des lots, sans instrumentation personnalisée.

  • Prise en charge des requêtes ProMQL. Query in CloudWatch, CloudWatch Query Studio ou Amazon Managed Grafana.

  • Fréquence de raclage configurable. Définissez sur MetricPublishFrequencyInSeconds (10, 30, 60, 120, 180, 240 ou 300 secondes ; 60 par défaut). Les métriques du plan de contrôle sont pilotées par les événements.

Architecture et flux de données

  1. Le conteneur de modèle, l'exportateur DCGM et l'exportateur de nœuds exposent des métriques compatibles avec Prometheus sur l'instance.

  2. L'oTel Collector extrait ces points de terminaison et enrichit chaque métrique avec des étiquettes (nom du point de terminaison, nom du circuit intégré, ID de l'instance, AZ).

  3. Les métriques enrichies sont exportées via OTLP vers. CloudWatch

  4. Les métriques peuvent être interrogées via ProMQL dans. CloudWatch

┌─────────────────────────────────────────────────────────────────┐ │ SageMaker Endpoint Instance │ │ │ │ ┌──────────────┐ ┌──────────────┐ ┌──────────────────────┐ │ │ │ Model │ │ DCGM │ │ Node Exporter │ │ │ │ Container │ │ Exporter │ │ (CPU/Mem/Disk) │ │ │ │ (vLLM/SGLang)│ │ (GPU) │ │ │ │ │ └──────┬───────┘ └──────┬───────┘ └──────────┬───────────┘ │ │ │ │ │ │ │ └─────────────────┼─────────────────────┘ │ │ ▼ │ │ ┌─────────────────────────┐ │ │ │ OTel Collector │ │ │ │ (scrape + enrich) │ │ │ └────────────┬────────────┘ │ └───────────────────────────┼───────────────────────────────────────┘ │ OTLP ▼ ┌─────────────────────────┐ │ Amazon CloudWatch │ │ (PromQL-queryable) │ └─────────────────────────┘

Comment accéder

Vous pouvez ouvrir SageMaker AI Insights depuis la console SageMaker AI en utilisant l'un des chemins suivants.

Source Action Destination
SageMaker Console IA → Liste des points de terminaison Choisissez Open SageMaker AI Insights Tableau de bord au niveau de la flotte (sans filtre)
SageMaker Console IA → page détaillée des terminaux Choisissez Afficher dans SageMaker AI Insights Tableau de bord filtré vers ce point de terminaison
SageMaker Console AI → onglet IC → ligne par IC Choisissez des mesures Tableau de bord filtré par point de terminaison et composant d'inférence

Vous pouvez également naviguer directement dans la CloudWatch console en choisissant Surveillance de l'infrastructure SageMaker AI Insights.

Conditions préalables

  • Au moins un point de terminaison d'inférence d' SageMaker IA dans le statut InService

  • EnableDetailedObservabilitydéfini true sur la configuration du terminal (par défaut pour les nouveaux terminaux)

  • Enrichissement OTel activé sur votre compte

  • Les cloudwatch:GetMetricData autorisations et cloudwatch:ListMetrics IAM

Pour de plus amples informations, veuillez consulter Commencez avec CloudWatch SageMaker AI Insights.

Tarification

CloudWatch OpenTelemetry l'ingestion métrique s'applique. Pour plus d'informations, consultez la page CloudWatch Tarification Amazon.