View a markdown version of this page

SageMaker Riferimento alle OpenTelemetry metriche di AI Insights - Amazon CloudWatch

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

SageMaker Riferimento alle OpenTelemetry metriche di AI Insights

Questa sezione fornisce un elenco completo delle OpenTelemetry metriche emesse dall'osservabilità dettagliata dell'IA. SageMaker L'osservabilità dettagliata è basata su OpenTelemetry (Otel) e raccoglie metriche operative granulari dai livelli di GPU, nodo e framework di inferenza, pubblicandole con etichette dettagliate. CloudWatch

Nota

Le metriche dettagliate relative all'osservabilità (Otel) vengono pubblicate tramite OTLP. OpenTelemetry CloudWatch Queste non sono metriche di Prometheus. Le metriche sono archiviate in modo nativo CloudWatch come dati di metrica OtEL e possono essere interrogate utilizzando la sintassi ProMQL.

Account-level metriche aggregate

MetricaTipoDescription
TotalEndpointsAggregazioneNumero di tutti gli endpoint nell'account
TotalICsAggregazioneConteggio di tutti i componenti di inferenza
TotalGPUsAggregazioneNumero di tutte le GPU (derivate da) DCGM_FI_DEV_GPU_UTIL

Endpoint-level metriche

MetricaTipoDescription
InstanceCountPerEndpointAggregazioneNumero di istanze che servono il traffico
InstancesPerAZAggregazioneIstanze per zona di disponibilità
EmptyInstanceCountAggregazioneIstanze senza circuiti integrati inseriti
ScalingActionRawEvento di ridimensionamento () in/out
ICECountRawNumero di errori di capacità insufficiente
CPUUtilization(EP)AggregazioneEndpoint-level utilizzo della CPU
MemoryUtilization(EP)AggregazioneEndpoint-level utilizzo della memoria
DiskUtilization(EP)AggregazioneEndpoint-level utilizzo del disco
E2EScalingLatencyRawEnd-to-end durata del ridimensionamento
RebalancingTypeRawTipo di evento di riequilibrio
RebalancingDurationRawDurata del ribilanciamento (secondi)
RebalancingCopiesMovedRawCopie IC spostate durante il ribilanciamento
AZSkewDeltaRawSquilibrio nella distribuzione AZ
InstancesReleasedRawIstanze liberate mediante ribilanciamento

Metriche del framework di inferenza (vLLM/SGlang)

MetricaTipoDescription
InputTokensPerSecondAggregazioneFrequenza dei token di input
OutputTokensPerSecondAggregazioneFrequenza del token di uscita
TotalTPSAggregazioneToken totali al secondo
TPSUtilizationAggregazionePercentuale di utilizzo del TPS
TTFTRawTime to First Token (istogramma)
InterTokenLatencyRawInter-Token Latenza (istogramma)
KVCacheUtilizationRawPercentuale di utilizzo della cache KV
QueueDepthRawRichieste in attesa (coda)
BatchSizeRawRichieste in corso (in volo)
TPSPerInstanceAggregazioneTPS aggregato per istanza
ConcurrentReqsPerCopyRawPer-copy richieste in volo
FirstChunkLatencyPerICRawTTFT per IC
4XXErrorRatePerICAggregazioneErrori del client per IC
5XXErrorRatePerICAggregazioneErrori del server per IC
TTFTPerICRawTTFT filtrato per IC
ITLPerICRawITL filtrato da IC
InputTPSPerICAggregazioneIngresso TPS per IC
OutputTPSPerICAggregazioneTPS di uscita per IC
KVCachePerICRawcache KV per IC
ModelErrorBreakdownAggregazioneSuddivisione degli errori per tipo
Nota

TTFTe dipendono dal framework e InterTokenLatency sono supportati solo per vLLM e SGlang.

Metriche GPU (DCGM)

Queste metriche vengono raccolte dall'esportatore NVIDIA Data Center GPU Manager (DCGM). Sono disponibili su tutti gli endpoint GPU indipendentemente dal framework di inferenza.

MetricaTipoDescription
DCGM_FI_DEV_GPU_UTILRawUtilizzo della GPU (%)
DCGM_FI_DEV_MEM_COPY_UTILRawUtilizzo delle copie in memoria (%)
DCGM_FI_DEV_GPU_TEMPRawTemperatura della GPU (°C)
DCGM_FI_DEV_MEMORY_TEMPRawTemperatura della memoria (°C)
DCGM_FI_DEV_FB_FREERawMemoria framebuffer libera (byte)
DCGM_FI_DEV_FB_USEDRawMemoria framebuffer utilizzata (byte)
DCGM_FI_DEV_SM_ACTIVERawMultiprocessore di streaming attivo (%)

Metriche relative ai nodi (istanze)

Queste metriche vengono raccolte dall'esportatore dei nodi. Forniscono visibilità a livello di istanza sull'utilizzo di CPU, memoria e disco.

MetricaTipoDescription
node_cpu_seconds_totalRawTempo di CPU per modalità per core (secondi)
node_memory_MemTotal_bytesRawMemoria totale (byte)
node_memory_MemAvailable_bytesRawMemoria disponibile (byte)
node_filesystem_size_bytesRawDimensione totale del file system (byte)
node_filesystem_avail_bytesRawSpazio disponibile nel file system (byte)

Metriche di posizionamento di HA e IC

MetricaTipoDescription
ICCopyCountPerAZAggregazioneCopie IC per AZ
ICCopiesPerAZAggregazioneCopie IC per AZ (visualizzazione alternativa)
AZSkewScoreAggregazionePunteggio di squilibrio AZ
AZBalanceScoreAggregazioneEndpoint-level equilibrio
ICDensityPerAZAggregazionedensità IC per AZ
ICCopiesPerInstanceAggregazioneCopie IC per istanza
ICListPerInstanceAggregazioneQuali circuiti integrati su quale istanza

Metriche relative al ciclo di vita e al provisioning

MetricaTipoDescription
ModelDownloadTimeRawÈ ora di scaricare l'istanza da Amazon S3
GPULoadTimeRawÈ ora di passare i pesi alla memoria della GPU
ContainerStartDurationRawAvvio del controllo dello stato del container
ColdStartDurationRawEnd-to-end: dalla creazione alla prima chiamata

Metriche disponibili solo come metriche classiche CloudWatch

Le seguenti metriche sono disponibili solo come metriche CloudWatch classiche (namespace e modello dimensionale) e richiedono l'arricchimento OTel per apparire come metriche. OpenTelemetry

MetricaNote
InvocationsPerICBloccato dall'emissione diretta OpenTelemetry
InvocationsPerCopyBloccato
ModelLatencyPerICBloccato: utilizzalo vllm:e2e_request_latency_seconds come alternativa a OtEL
OverheadLatencyPerICBloccato
MidStreamErrorsPerICBloccato (solo streaming bidirezionale)