

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

# SageMaker Referenz zu AI OpenTelemetry Insights-Metriken
<a name="SageMaker-AI-Insights-Metrics"></a>

Dieser Abschnitt enthält eine umfassende Liste der von SageMaker KI ausgegebenen OpenTelemetry Metriken zur detaillierten Beobachtbarkeit. Detailed Observability basiert auf OpenTelemetry (OTel) und erfasst feinkörnige Betriebsmetriken aus den GPU-, Knoten- und Inferenz-Framework-Ebenen und veröffentlicht sie mit Rich Labels. CloudWatch 

**Anmerkung**  
Detailed Observability veröffentlicht Metriken OpenTelemetry (OTel) über OTLP. CloudWatch Dies sind keine Prometheus-Metriken. Die Metriken werden nativ CloudWatch als OTel-Metrikdaten gespeichert und können mithilfe der PromQL-Syntax abgefragt werden.

## Account-level aggregierte Metriken
<a name="SageMaker-AI-Insights-Metrics-account"></a>


| Metrik | Typ | Description | 
| --- | --- | --- | 
| TotalEndpoints | Aggregate | Anzahl aller Endpunkte im Konto | 
| TotalICs | Aggregate | Anzahl aller Inferenzkomponenten | 
| TotalGPUs | Aggregate | Anzahl aller GPUs (abgeleitet von) DCGM\_FI\_DEV\_GPU\_UTIL | 

## Endpoint-level Metriken
<a name="SageMaker-AI-Insights-Metrics-endpoint"></a>


| Metrik | Typ | Description | 
| --- | --- | --- | 
| InstanceCountPerEndpoint | Aggregate | Anzahl der Instanzen, die den Traffic bedienen | 
| InstancesPerAZ | Aggregate | Instanzen pro Verfügbarkeitszone | 
| EmptyInstanceCount | Aggregate | Instanzen ohne platzierte ICs | 
| ScalingAction | Raw | Skalierungsereignis (in/out) | 
| ICECount | Raw | Fehleranzahl bei unzureichender Kapazität | 
| CPUUtilization(EP) | Aggregate | Endpoint-level CPU-Auslastung | 
| MemoryUtilization(EP) | Aggregate | Endpoint-level Speicherauslastung | 
| DiskUtilization(EP) | Aggregate | Endpoint-level Festplattenauslastung | 
| E2EScalingLatency | Raw | End-to-end Dauer der Skalierung | 
| RebalancingType | Raw | Art des Rebalancing-Ereignisses | 
| RebalancingDuration | Raw | Dauer des Rebalancings (Sekunden) | 
| RebalancingCopiesMoved | Raw | IC-Kopien wurden beim Rebalancing verschoben | 
| AZSkewDelta | Raw | AZ-Verteilungsungleichgewicht | 
| InstancesReleased | Raw | Durch das Rebalancing freigesetzte Instanzen | 

## Metriken des Inferenz-Frameworks (vLLM/sGLang)
<a name="SageMaker-AI-Insights-Metrics-framework"></a>


| Metrik | Typ | Description | 
| --- | --- | --- | 
| InputTokensPerSecond | Aggregate | Rate des Eingabe-Tokens | 
| OutputTokensPerSecond | Aggregate | Rate des Ausgabe-Tokens | 
| TotalTPS | Aggregate | Gesamtzahl der Token pro Sekunde | 
| TPSUtilization | Aggregate | Prozentsatz der TPS-Auslastung | 
| TTFT | Raw | Zeit bis zum ersten Token (Histogramm) | 
| InterTokenLatency | Raw | Inter-Token Latenz (Histogramm) | 
| KVCacheUtilization | Raw | Prozentsatz der KV-Cache-Nutzung | 
| QueueDepth | Raw | Wartende Anfragen (Warteschlange) | 
| BatchSize | Raw | Anfragen werden ausgeführt (während des Fluges) | 
| TPSPerInstance | Aggregate | TPS, aggregiert pro Instanz | 
| ConcurrentReqsPerCopy | Raw | Per-copy Anfragen während des Fluges | 
| FirstChunkLatencyPerIC | Raw | TTFT pro IC | 
| 4XXErrorRatePerIC | Aggregate | Client-Fehler pro IC | 
| 5XXErrorRatePerIC | Aggregate | Serverfehler pro IC | 
| TTFTPerIC | Raw | TTFT nach IC gefiltert | 
| ITLPerIC | Raw | ITL gefiltert nach IC | 
| InputTPSPerIC | Aggregate | Geben Sie TPS pro IC ein | 
| OutputTPSPerIC | Aggregate | Ausgangs-TPS pro IC | 
| KVCachePerIC | Raw | KV-Cache pro IC | 
| ModelErrorBreakdown | Aggregate | Aufschlüsselung des Fehlers nach Typ | 

**Anmerkung**  
`TTFT`und `InterTokenLatency` sind Framework-abhängig und werden nur für vLLM und sGLang unterstützt.

## GPU-Metriken (DCGM)
<a name="SageMaker-AI-Insights-Metrics-gpu"></a>

Diese Metriken werden vom NVIDIA Data Center GPU Manager (DCGM) -Exporter erfasst. Sie sind auf allen GPU-Endpunkten verfügbar, unabhängig vom Inferenz-Framework.


| Metrik | Typ | Description | 
| --- | --- | --- | 
| DCGM\_FI\_DEV\_GPU\_UTIL | Raw | GPU-Auslastung (%) | 
| DCGM\_FI\_DEV\_MEM\_COPY\_UTIL | Raw | Auslastung des Speichers beim Kopieren (%) | 
| DCGM\_FI\_DEV\_GPU\_TEMP | Raw | GPU-Temperatur (°C) | 
| DCGM\_FI\_DEV\_MEMORY\_TEMP | Raw | Speichertemperatur (°C) | 
| DCGM\_FI\_DEV\_FB\_FREE | Raw | Freier Framebuffer-Speicher (Byte) | 
| DCGM\_FI\_DEV\_FB\_USED | Raw | Verwendeter Framebuffer-Speicher (Byte) | 
| DCGM\_FI\_DEV\_SM\_ACTIVE | Raw | Streaming-Multiprozessor aktiv (%) | 

## Metriken für Knoten (Instanz)
<a name="SageMaker-AI-Insights-Metrics-node"></a>

Diese Metriken werden vom Node-Exporter erfasst. Sie bieten Einblick in die CPU-, Arbeitsspeicher- und Festplattenauslastung auf Instanzebene.


| Metrik | Typ | Description | 
| --- | --- | --- | 
| node\_cpu\_seconds\_total | Raw | CPU-Zeit pro Modus pro Kern (Sekunden) | 
| node\_memory\_MemTotal\_bytes | Raw | Gesamtspeicher (Byte) | 
| node\_memory\_MemAvailable\_bytes | Raw | Verfügbarer Speicher (Byte) | 
| node\_filesystem\_size\_bytes | Raw | Gesamtgröße des Dateisystems (Byte) | 
| node\_filesystem\_avail\_bytes | Raw | Verfügbarer Speicherplatz im Dateisystem (Byte) | 

## Metriken zur HA- und IC-Platzierung
<a name="SageMaker-AI-Insights-Metrics-ha"></a>


| Metrik | Typ | Description | 
| --- | --- | --- | 
| ICCopyCountPerAZ | Aggregate | IC-Kopien pro AZ | 
| ICCopiesPerAZ | Aggregate | IC-Kopien pro AZ (alternative Ansicht) | 
| AZSkewScore | Aggregate | Bewertung des AZ-Ungleichgewichts | 
| AZBalanceScore | Aggregate | Endpoint-level Gleichgewicht | 
| ICDensityPerAZ | Aggregate | IC-Dichte pro AZ | 
| ICCopiesPerInstance | Aggregate | IC-Kopien pro Instanz | 
| ICListPerInstance | Aggregate | Welche ICs auf welcher Instanz | 

## Lebenszyklus- und Bereitstellungsmetriken
<a name="SageMaker-AI-Insights-Metrics-lifecycle"></a>


| Metrik | Typ | Description | 
| --- | --- | --- | 
| ModelDownloadTime | Raw | Zeit, bis Amazon S3 die Instanz heruntergeladen hat | 
| GPULoadTime | Raw | Zeit, bis Gewichte im GPU-Speicher landen | 
| ContainerStartDuration | Raw | Starten Sie den Systemzustand des Containers | 
| ColdStartDuration | Raw | End-to-end: von der Erstellung bis zum ersten Aufruf | 

## Metriken sind nur als CloudWatch klassische Metriken verfügbar
<a name="SageMaker-AI-Insights-Metrics-classic"></a>

Die folgenden Metriken sind nur als CloudWatch klassische Metriken (Namespace und Dimensionsmodell) verfügbar und erfordern eine OTel-Anreicherung, um als OpenTelemetry Metriken angezeigt zu werden.


| Metrik | Hinweise | 
| --- | --- | 
| InvocationsPerIC | Direkte Emission gesperrt OpenTelemetry  | 
| InvocationsPerCopy | Blocked | 
| ModelLatencyPerIC | Blockiert — vllm:e2e\_request\_latency\_seconds als OtEL-Alternative verwenden | 
| OverheadLatencyPerIC | Blocked | 
| MidStreamErrorsPerIC | Blockiert (nur bidirektionales Streaming) | 