Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
SageMaker Référence des OpenTelemetry métriques AI Insights
Cette section fournit une liste complète des OpenTelemetry métriques émises par l'observabilité détaillée de l' SageMaker IA. L'observabilité détaillée repose sur OpenTelemetry (OTel) et collecte des mesures opérationnelles précises à partir des couches du GPU, des nœuds et du framework d'inférence, pour les publier avec des étiquettes enrichies. CloudWatch
L'observabilité détaillée publie des métriques OpenTelemetry (OTel) CloudWatch via OTLP. Ce ne sont pas des métriques de Prometheus. Les métriques sont stockées de manière native sous forme de données métriques CloudWatch OTel et peuvent être interrogées à l'aide de la syntaxe ProMQL.
Account-level mesures agrégées
| Métrique | Type | Description |
TotalEndpoints | Regrouper | Nombre de tous les points de terminaison du compte |
TotalICs | Regrouper | Nombre de tous les composants d'inférence |
TotalGPUs | Regrouper | Nombre de tous les GPU (dérivé deDCGM_FI_DEV_GPU_UTIL) |
Endpoint-level métriques
| Métrique | Type | Description |
InstanceCountPerEndpoint | Regrouper | Nombre d'instances desservant le trafic |
InstancesPerAZ | Regrouper | Instances par zone de disponibilité |
EmptyInstanceCount | Regrouper | Instances sur lesquelles aucun circuit intégré n'a été placé |
ScalingAction | Raw | Événement de dimensionnement (in/out) |
ICECount | Raw | Nombre d'erreurs de capacité insuffisant |
CPUUtilization(Parlement européen) | Regrouper | Endpoint-level Utilisation du processeur |
MemoryUtilization(Parlement européen) | Regrouper | Endpoint-level utilisation de la mémoire |
DiskUtilization(Parlement européen) | Regrouper | Endpoint-level utilisation du disque |
E2EScalingLatency | Raw | End-to-end durée d'échelle |
RebalancingType | Raw | Type d'événement de rééquilibrage |
RebalancingDuration | Raw | Durée du rééquilibrage (secondes) |
RebalancingCopiesMoved | Raw | Copies du circuit intégré déplacées lors du rééquilibrage |
AZSkewDelta | Raw | Déséquilibre de distribution AZ |
InstancesReleased | Raw | Instances libérées grâce au rééquilibrage |
Métriques du cadre d'inférence (VLLm/SGlang)
| Métrique | Type | Description |
InputTokensPerSecond | Regrouper | Taux de jetons d'entrée |
OutputTokensPerSecond | Regrouper | Taux de jetons de sortie |
TotalTPS | Regrouper | Nombre total de jetons par seconde |
TPSUtilization | Regrouper | Pourcentage d'utilisation du TPS |
TTFT | Raw | Temps écoulé avant le premier jeton (histogramme) |
InterTokenLatency | Raw | Inter-Token Latence (histogramme) |
KVCacheUtilization | Raw | Pourcentage d'utilisation du cache KV |
QueueDepth | Raw | Demandes en attente (file d'attente) |
BatchSize | Raw | Demandes en cours (en vol) |
TPSPerInstance | Regrouper | TPS agrégé par instance |
ConcurrentReqsPerCopy | Raw | Per-copy demandes en vol |
FirstChunkLatencyPerIC | Raw | TTFT pour IC |
4XXErrorRatePerIC | Regrouper | Erreurs client par circuit intégré |
5XXErrorRatePerIC | Regrouper | Erreurs de serveur par circuit intégré |
TTFTPerIC | Raw | TTFT filtré par IC |
ITLPerIC | Raw | ITL filtré par IC |
InputTPSPerIC | Regrouper | Entrée TPS par circuit intégré |
OutputTPSPerIC | Regrouper | Sortie TPS par IC |
KVCachePerIC | Raw | KV de cache par circuit intégré |
ModelErrorBreakdown | Regrouper | Répartition des erreurs par type |
TTFTet dépendent du framework et ne InterTokenLatency sont pris en charge que pour vLLM et sgLang.
Métriques du GPU (DCGM)
Ces métriques sont collectées à partir de l'exportateur NVIDIA Data Center GPU Manager (DCGM). Ils sont disponibles sur tous les terminaux GPU, quel que soit le cadre d'inférence.
| Métrique | Type | Description |
DCGM_FI_DEV_GPU_UTIL | Raw | Utilisation du processeur graphique (%) |
DCGM_FI_DEV_MEM_COPY_UTIL | Raw | Utilisation de la copie de la mémoire (%) |
DCGM_FI_DEV_GPU_TEMP | Raw | Température du GPU (°C) |
DCGM_FI_DEV_MEMORY_TEMP | Raw | Température de la mémoire (°C) |
DCGM_FI_DEV_FB_FREE | Raw | Mémoire Framebuffer libre (octets) |
DCGM_FI_DEV_FB_USED | Raw | Mémoire Framebuffer utilisée (octets) |
DCGM_FI_DEV_SM_ACTIVE | Raw | Multiprocesseur de streaming actif (%) |
Métriques des nœuds (instances)
Ces métriques sont collectées auprès de l'exportateur de nœuds. Ils fournissent une visibilité au niveau de l'instance sur l'utilisation du processeur, de la mémoire et du disque.
| Métrique | Type | Description |
node_cpu_seconds_total | Raw | Durée du processeur par mode et par cœur (secondes) |
node_memory_MemTotal_bytes | Raw | Mémoire totale (octets) |
node_memory_MemAvailable_bytes | Raw | Mémoire disponible (octets) |
node_filesystem_size_bytes | Raw | Taille totale du système de fichiers (octets) |
node_filesystem_avail_bytes | Raw | Espace disponible du système de fichiers (octets) |
Métriques de placement HA et IC
| Métrique | Type | Description |
ICCopyCountPerAZ | Regrouper | Copies IC par AZ |
ICCopiesPerAZ | Regrouper | Copies IC par AZ (vue alternative) |
AZSkewScore | Regrouper | Score de déséquilibre AZ |
AZBalanceScore | Regrouper | Endpoint-level équilibre |
ICDensityPerAZ | Regrouper | Densité IC par AZ |
ICCopiesPerInstance | Regrouper | Copies de circuits intégrés par instance |
ICListPerInstance | Regrouper | Quels circuits intégrés sur quelle instance |
Métriques de cycle de vie et de provisionnement
| Métrique | Type | Description |
ModelDownloadTime | Raw | Il est temps pour Amazon S3 de télécharger l'instance |
GPULoadTime | Raw | Temps de pondération dans la mémoire du GPU |
ContainerStartDuration | Raw | Début du contrôle de santé du conteneur |
ColdStartDuration | Raw | End-to-end: de la création à la première invocation |
Métriques disponibles uniquement en tant que métriques CloudWatch classiques
Les métriques suivantes sont disponibles uniquement en tant que métriques CloudWatch classiques (espace de noms et modèle dimensionnel) et nécessitent un enrichissement OTel pour apparaître en tant que OpenTelemetry métriques.
| Métrique | Remarques |
InvocationsPerIC | Bloqué contre l' OpenTelemetry émission directe |
InvocationsPerCopy | Bloqué |
ModelLatencyPerIC | Bloqué : utilisation vllm:e2e_request_latency_seconds comme alternative à l'Otel |
OverheadLatencyPerIC | Bloqué |
MidStreamErrorsPerIC | Bloqué (diffusion bidirectionnelle uniquement) |