View a markdown version of this page

SageMaker Referenz zu AI OpenTelemetry Insights-Metriken - Amazon CloudWatch

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

SageMaker Referenz zu AI OpenTelemetry Insights-Metriken

Dieser Abschnitt enthält eine umfassende Liste der von SageMaker KI ausgegebenen OpenTelemetry Metriken zur detaillierten Beobachtbarkeit. Detailed Observability basiert auf OpenTelemetry (OTel) und erfasst feinkörnige Betriebsmetriken aus den GPU-, Knoten- und Inferenz-Framework-Ebenen und veröffentlicht sie mit Rich Labels. CloudWatch

Anmerkung

Detailed Observability veröffentlicht Metriken OpenTelemetry (OTel) über OTLP. CloudWatch Dies sind keine Prometheus-Metriken. Die Metriken werden nativ CloudWatch als OTel-Metrikdaten gespeichert und können mithilfe der PromQL-Syntax abgefragt werden.

Account-level aggregierte Metriken

MetrikTypDescription
TotalEndpointsAggregateAnzahl aller Endpunkte im Konto
TotalICsAggregateAnzahl aller Inferenzkomponenten
TotalGPUsAggregateAnzahl aller GPUs (abgeleitet von) DCGM_FI_DEV_GPU_UTIL

Endpoint-level Metriken

MetrikTypDescription
InstanceCountPerEndpointAggregateAnzahl der Instanzen, die den Traffic bedienen
InstancesPerAZAggregateInstanzen pro Verfügbarkeitszone
EmptyInstanceCountAggregateInstanzen ohne platzierte ICs
ScalingActionRawSkalierungsereignis (in/out)
ICECountRawFehleranzahl bei unzureichender Kapazität
CPUUtilization(EP)AggregateEndpoint-level CPU-Auslastung
MemoryUtilization(EP)AggregateEndpoint-level Speicherauslastung
DiskUtilization(EP)AggregateEndpoint-level Festplattenauslastung
E2EScalingLatencyRawEnd-to-end Dauer der Skalierung
RebalancingTypeRawArt des Rebalancing-Ereignisses
RebalancingDurationRawDauer des Rebalancings (Sekunden)
RebalancingCopiesMovedRawIC-Kopien wurden beim Rebalancing verschoben
AZSkewDeltaRawAZ-Verteilungsungleichgewicht
InstancesReleasedRawDurch das Rebalancing freigesetzte Instanzen

Metriken des Inferenz-Frameworks (vLLM/sGLang)

MetrikTypDescription
InputTokensPerSecondAggregateRate des Eingabe-Tokens
OutputTokensPerSecondAggregateRate des Ausgabe-Tokens
TotalTPSAggregateGesamtzahl der Token pro Sekunde
TPSUtilizationAggregateProzentsatz der TPS-Auslastung
TTFTRawZeit bis zum ersten Token (Histogramm)
InterTokenLatencyRawInter-Token Latenz (Histogramm)
KVCacheUtilizationRawProzentsatz der KV-Cache-Nutzung
QueueDepthRawWartende Anfragen (Warteschlange)
BatchSizeRawAnfragen werden ausgeführt (während des Fluges)
TPSPerInstanceAggregateTPS, aggregiert pro Instanz
ConcurrentReqsPerCopyRawPer-copy Anfragen während des Fluges
FirstChunkLatencyPerICRawTTFT pro IC
4XXErrorRatePerICAggregateClient-Fehler pro IC
5XXErrorRatePerICAggregateServerfehler pro IC
TTFTPerICRawTTFT nach IC gefiltert
ITLPerICRawITL gefiltert nach IC
InputTPSPerICAggregateGeben Sie TPS pro IC ein
OutputTPSPerICAggregateAusgangs-TPS pro IC
KVCachePerICRawKV-Cache pro IC
ModelErrorBreakdownAggregateAufschlüsselung des Fehlers nach Typ
Anmerkung

TTFTund InterTokenLatency sind Framework-abhängig und werden nur für vLLM und sGLang unterstützt.

GPU-Metriken (DCGM)

Diese Metriken werden vom NVIDIA Data Center GPU Manager (DCGM) -Exporter erfasst. Sie sind auf allen GPU-Endpunkten verfügbar, unabhängig vom Inferenz-Framework.

MetrikTypDescription
DCGM_FI_DEV_GPU_UTILRawGPU-Auslastung (%)
DCGM_FI_DEV_MEM_COPY_UTILRawAuslastung des Speichers beim Kopieren (%)
DCGM_FI_DEV_GPU_TEMPRawGPU-Temperatur (°C)
DCGM_FI_DEV_MEMORY_TEMPRawSpeichertemperatur (°C)
DCGM_FI_DEV_FB_FREERawFreier Framebuffer-Speicher (Byte)
DCGM_FI_DEV_FB_USEDRawVerwendeter Framebuffer-Speicher (Byte)
DCGM_FI_DEV_SM_ACTIVERawStreaming-Multiprozessor aktiv (%)

Metriken für Knoten (Instanz)

Diese Metriken werden vom Node-Exporter erfasst. Sie bieten Einblick in die CPU-, Arbeitsspeicher- und Festplattenauslastung auf Instanzebene.

MetrikTypDescription
node_cpu_seconds_totalRawCPU-Zeit pro Modus pro Kern (Sekunden)
node_memory_MemTotal_bytesRawGesamtspeicher (Byte)
node_memory_MemAvailable_bytesRawVerfügbarer Speicher (Byte)
node_filesystem_size_bytesRawGesamtgröße des Dateisystems (Byte)
node_filesystem_avail_bytesRawVerfügbarer Speicherplatz im Dateisystem (Byte)

Metriken zur HA- und IC-Platzierung

MetrikTypDescription
ICCopyCountPerAZAggregateIC-Kopien pro AZ
ICCopiesPerAZAggregateIC-Kopien pro AZ (alternative Ansicht)
AZSkewScoreAggregateBewertung des AZ-Ungleichgewichts
AZBalanceScoreAggregateEndpoint-level Gleichgewicht
ICDensityPerAZAggregateIC-Dichte pro AZ
ICCopiesPerInstanceAggregateIC-Kopien pro Instanz
ICListPerInstanceAggregateWelche ICs auf welcher Instanz

Lebenszyklus- und Bereitstellungsmetriken

MetrikTypDescription
ModelDownloadTimeRawZeit, bis Amazon S3 die Instanz heruntergeladen hat
GPULoadTimeRawZeit, bis Gewichte im GPU-Speicher landen
ContainerStartDurationRawStarten Sie den Systemzustand des Containers
ColdStartDurationRawEnd-to-end: von der Erstellung bis zum ersten Aufruf

Metriken sind nur als CloudWatch klassische Metriken verfügbar

Die folgenden Metriken sind nur als CloudWatch klassische Metriken (Namespace und Dimensionsmodell) verfügbar und erfordern eine OTel-Anreicherung, um als OpenTelemetry Metriken angezeigt zu werden.

MetrikHinweise
InvocationsPerICDirekte Emission gesperrt OpenTelemetry
InvocationsPerCopyBlocked
ModelLatencyPerICBlockiert — vllm:e2e_request_latency_seconds als OtEL-Alternative verwenden
OverheadLatencyPerICBlocked
MidStreamErrorsPerICBlockiert (nur bidirektionales Streaming)