View a markdown version of this page

SageMaker Référence des OpenTelemetry métriques AI Insights - Amazon CloudWatch

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

SageMaker Référence des OpenTelemetry métriques AI Insights

Cette section fournit une liste complète des OpenTelemetry métriques émises par l'observabilité détaillée de l' SageMaker IA. L'observabilité détaillée repose sur OpenTelemetry (OTel) et collecte des mesures opérationnelles précises à partir des couches du GPU, des nœuds et du framework d'inférence, pour les publier avec des étiquettes enrichies. CloudWatch

Note

L'observabilité détaillée publie des métriques OpenTelemetry (OTel) CloudWatch via OTLP. Ce ne sont pas des métriques de Prometheus. Les métriques sont stockées de manière native sous forme de données métriques CloudWatch OTel et peuvent être interrogées à l'aide de la syntaxe ProMQL.

Account-level mesures agrégées

MétriqueTypeDescription
TotalEndpointsRegrouperNombre de tous les points de terminaison du compte
TotalICsRegrouperNombre de tous les composants d'inférence
TotalGPUsRegrouperNombre de tous les GPU (dérivé deDCGM_FI_DEV_GPU_UTIL)

Endpoint-level métriques

MétriqueTypeDescription
InstanceCountPerEndpointRegrouperNombre d'instances desservant le trafic
InstancesPerAZRegrouperInstances par zone de disponibilité
EmptyInstanceCountRegrouperInstances sur lesquelles aucun circuit intégré n'a été placé
ScalingActionRawÉvénement de dimensionnement (in/out)
ICECountRawNombre d'erreurs de capacité insuffisant
CPUUtilization(Parlement européen)RegrouperEndpoint-level Utilisation du processeur
MemoryUtilization(Parlement européen)RegrouperEndpoint-level utilisation de la mémoire
DiskUtilization(Parlement européen)RegrouperEndpoint-level utilisation du disque
E2EScalingLatencyRawEnd-to-end durée d'échelle
RebalancingTypeRawType d'événement de rééquilibrage
RebalancingDurationRawDurée du rééquilibrage (secondes)
RebalancingCopiesMovedRawCopies du circuit intégré déplacées lors du rééquilibrage
AZSkewDeltaRawDéséquilibre de distribution AZ
InstancesReleasedRawInstances libérées grâce au rééquilibrage

Métriques du cadre d'inférence (VLLm/SGlang)

MétriqueTypeDescription
InputTokensPerSecondRegrouperTaux de jetons d'entrée
OutputTokensPerSecondRegrouperTaux de jetons de sortie
TotalTPSRegrouperNombre total de jetons par seconde
TPSUtilizationRegrouperPourcentage d'utilisation du TPS
TTFTRawTemps écoulé avant le premier jeton (histogramme)
InterTokenLatencyRawInter-Token Latence (histogramme)
KVCacheUtilizationRawPourcentage d'utilisation du cache KV
QueueDepthRawDemandes en attente (file d'attente)
BatchSizeRawDemandes en cours (en vol)
TPSPerInstanceRegrouperTPS agrégé par instance
ConcurrentReqsPerCopyRawPer-copy demandes en vol
FirstChunkLatencyPerICRawTTFT pour IC
4XXErrorRatePerICRegrouperErreurs client par circuit intégré
5XXErrorRatePerICRegrouperErreurs de serveur par circuit intégré
TTFTPerICRawTTFT filtré par IC
ITLPerICRawITL filtré par IC
InputTPSPerICRegrouperEntrée TPS par circuit intégré
OutputTPSPerICRegrouperSortie TPS par IC
KVCachePerICRawKV de cache par circuit intégré
ModelErrorBreakdownRegrouperRépartition des erreurs par type
Note

TTFTet dépendent du framework et ne InterTokenLatency sont pris en charge que pour vLLM et sgLang.

Métriques du GPU (DCGM)

Ces métriques sont collectées à partir de l'exportateur NVIDIA Data Center GPU Manager (DCGM). Ils sont disponibles sur tous les terminaux GPU, quel que soit le cadre d'inférence.

MétriqueTypeDescription
DCGM_FI_DEV_GPU_UTILRawUtilisation du processeur graphique (%)
DCGM_FI_DEV_MEM_COPY_UTILRawUtilisation de la copie de la mémoire (%)
DCGM_FI_DEV_GPU_TEMPRawTempérature du GPU (°C)
DCGM_FI_DEV_MEMORY_TEMPRawTempérature de la mémoire (°C)
DCGM_FI_DEV_FB_FREERawMémoire Framebuffer libre (octets)
DCGM_FI_DEV_FB_USEDRawMémoire Framebuffer utilisée (octets)
DCGM_FI_DEV_SM_ACTIVERawMultiprocesseur de streaming actif (%)

Métriques des nœuds (instances)

Ces métriques sont collectées auprès de l'exportateur de nœuds. Ils fournissent une visibilité au niveau de l'instance sur l'utilisation du processeur, de la mémoire et du disque.

MétriqueTypeDescription
node_cpu_seconds_totalRawDurée du processeur par mode et par cœur (secondes)
node_memory_MemTotal_bytesRawMémoire totale (octets)
node_memory_MemAvailable_bytesRawMémoire disponible (octets)
node_filesystem_size_bytesRawTaille totale du système de fichiers (octets)
node_filesystem_avail_bytesRawEspace disponible du système de fichiers (octets)

Métriques de placement HA et IC

MétriqueTypeDescription
ICCopyCountPerAZRegrouperCopies IC par AZ
ICCopiesPerAZRegrouperCopies IC par AZ (vue alternative)
AZSkewScoreRegrouperScore de déséquilibre AZ
AZBalanceScoreRegrouperEndpoint-level équilibre
ICDensityPerAZRegrouperDensité IC par AZ
ICCopiesPerInstanceRegrouperCopies de circuits intégrés par instance
ICListPerInstanceRegrouperQuels circuits intégrés sur quelle instance

Métriques de cycle de vie et de provisionnement

MétriqueTypeDescription
ModelDownloadTimeRawIl est temps pour Amazon S3 de télécharger l'instance
GPULoadTimeRawTemps de pondération dans la mémoire du GPU
ContainerStartDurationRawDébut du contrôle de santé du conteneur
ColdStartDurationRawEnd-to-end: de la création à la première invocation

Métriques disponibles uniquement en tant que métriques CloudWatch classiques

Les métriques suivantes sont disponibles uniquement en tant que métriques CloudWatch classiques (espace de noms et modèle dimensionnel) et nécessitent un enrichissement OTel pour apparaître en tant que OpenTelemetry métriques.

MétriqueRemarques
InvocationsPerICBloqué contre l' OpenTelemetry émission directe
InvocationsPerCopyBloqué
ModelLatencyPerICBloqué : utilisation vllm:e2e_request_latency_seconds comme alternative à l'Otel
OverheadLatencyPerICBloqué
MidStreamErrorsPerICBloqué (diffusion bidirectionnelle uniquement)