View a markdown version of this page

Esegui metriche per flussi di lavoro privati - AWS HealthOmics

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

Esegui metriche per flussi di lavoro privati

HealthOmics pubblica metriche sull'utilizzo delle risorse quasi in tempo reale per le tue esecuzioni e attività su Amazon. CloudWatch Queste metriche ti offrono visibilità sull'avanzamento delle tue corse durante l'esecuzione. Puoi utilizzare queste metriche per:

  • Identifica i colli di bottiglia della Central Processing Unit (CPU) o della Graphics Processing Unit (GPU) mentre le attività sono ancora in esecuzione.

  • Rileva la pressione della memoria o l'esaurimento dello spazio di archiviazione antigraffio prima che un'attività fallisca.

  • Right-size le configurazioni di elaborazione e archiviazione per i tuoi flussi di lavoro.

  • Crea CloudWatch dashboard e allarmi o esegui l'integrazione con strumenti di osservabilità di terze parti.

Le metriche di esecuzione sono disponibili per flussi di lavoro privati e condivisi.

HealthOmics Fornisce queste metriche nell'cloudwatch.aws/omicsambito del tuo account. CloudWatch

Queste metriche vengono emesse utilizzando lo standard di metriche compatibile con CloudWatch OpenTelemetry (Otel). Ciò significa che puoi integrarli con strumenti di OTel-compatible osservabilità insieme a dashboard e allarmi nativi. CloudWatch Interroga le metriche Otel con Prometheus Query Language (ProMQL) per visualizzare e analizzare i dati. Per ulteriori informazioni, consulta le metriche. CloudWatch OpenTelemetry

Disponibilità nelle regioni

Le metriche relative alla corsa sono disponibili in tutte le HealthOmics regioni supportate, ad eccezione della regione Israele (Tel Aviv) (). il-central-1

Abilitare le metriche per una corsa

Per pubblicare queste metriche, il ruolo AWS Identity and Access Management (IAM) utilizzato per l'esecuzione deve disporre dell'autorizzazione per scrivere le metriche. CloudWatch Aggiungi la seguente autorizzazione al ruolo di esecuzione del flusso di lavoro:

{ "Version": "2012-10-17", "Statement": [ { "Effect": "Allow", "Action": "cloudwatch:PutMetricData", "Resource": "*" } ] }

Per ulteriori informazioni sulle autorizzazioni, consultare Ruoli di servizio per AWS HealthOmics. Per ulteriori informazioni sull'avvio di una corsa, consultaInizia un run in HealthOmics.

CloudWatch PutMetricDataquota

CloudWatch ha una PutMetricData quota predefinita di 500 richieste al secondo (transazioni al secondo). Questa quota predefinita è sufficiente per visualizzare le metriche relative a un massimo di 15.000 attività HealthOmics simultanee. Per visualizzare le metriche relative a più di 15.000 HealthOmics attività simultanee, richiedi un aumento del limite per la quota. CloudWatch PutMetricData Per ulteriori informazioni, consulta CloudWatch service quotas.

Metriche disponibili

Disponibilità delle metriche

HealthOmics emette metriche in base al tipo di flusso di lavoro. Non tutte le metriche vengono emesse per ogni flusso di lavoro.

La tabella seguente elenca le metriche che vengono fornite per HealthOmics ogni esecuzione. Le metriche sono disponibili in CloudWatch Query Studio. Le unità seguono la OpenTelemetry convenzione: By sono byte, {cpu} sono vCPU, {operation} sono operazioni e % sono una percentuale.

HealthOmics metriche di esecuzione
Nome parametro Description Unità Tipo Frequenza Disponibilità
aws.omics.run.filesystem.usage Archiviazione in uso sul filesystem condiviso dell'esecuzione. By gauge 30 secondi Per ogni corsa.
aws.omics.run.filesystem.limit Capacità totale del file system condiviso dell'esecuzione. By gauge 30 secondi Solo per le esecuzioni che utilizzano il tipo di archiviazione STATIC run.
aws.omics.task.cpu.usage vCPU utilizzate dal task del workflow. {cpu} gauge 30 secondi Per ogni attività in esecuzione.
aws.omics.task.cpu.limit vCPU riservate all'attività del flusso di lavoro in base alla definizione del flusso di lavoro o ai valori predefiniti. {cpu} gauge 30 secondi Per ogni attività in esecuzione.
aws.omics.task.memory.usage Memoria utilizzata dall'attività del flusso di lavoro. By gauge 30 secondi Per ogni attività in esecuzione.
aws.omics.task.memory.limit Memoria riservata per l'attività del flusso di lavoro. By gauge 30 secondi Per ogni attività in esecuzione.
aws.omics.task.network.io Il numero di byte trasmessi e ricevuti dall'attività del flusso di lavoro. Diviso per network.io.direction (receive,transmit). By sum 30 secondi Per ogni attività in corso.
aws.omics.task.filesystem.io Il numero di byte del file system trasferiti dal task del workflow. Diviso per (,). filesystem.io.direction read write By sum 30 secondi Per ogni attività in corso.
aws.omics.task.filesystem.operations Il numero di operazioni sul file system eseguite dal task del workflow. Diviso per filesystem.io.direction (,)read. write {operation} sum 30 secondi Per ogni attività in corso.
aws.omics.task.filesystem.scratch.storage.usage Archiviazione scratch utilizzata dall'attività del flusso di lavoro. By gauge 30 secondi (LOCALmodalità) o 20 minuti (SHAREDmodalità) Per ogni attività in esecuzione.
aws.omics.task.filesystem.scratch.storage.limit Capacità totale di storage scratch disponibile per l'attività del flusso di lavoro. By gauge 30 secondi Per ogni attività in un'esecuzione impostata scratchStorageMode suLOCAL.
aws.omics.task.gpu.utilization Utilizzo della GPU per l'attività del flusso di lavoro. Un punto dati per GPU, identificato da. gpu.id % gauge 30 secondi Solo per attività che utilizzano acceleratori.
aws.omics.task.gpu.memory.usage Memoria GPU utilizzata dall'attività del flusso di lavoro. Un punto dati per GPU, identificato da. gpu.id By gauge 30 secondi Solo per attività che utilizzano acceleratori.
aws.omics.task.gpu.memory.limit Memoria GPU disponibile per l'attività del flusso di lavoro. Un punto dati per GPU, identificato da. gpu.id By gauge 30 secondi Solo per attività che utilizzano acceleratori.

Per ulteriori informazioni sugli acceleratori, vedere. Risorse delle attività in una definizione del flusso di lavoro HealthOmics

Per ulteriori informazioni sullo storage temporaneo, vedere. Archiviazione temporanea per le attività del flusso di lavoro HealthOmics

Attributi comuni

Ogni metrica di HealthOmics esecuzione contiene un set comune di etichette di risorse che identificano l'origine del punto dati.

Etichette delle risorse
Etichetta Description Valore di esempio
Etichette di risorse comuni
@resource.cloud.provider Il provider cloud che ha pubblicato la metrica. aws
@resource.cloud.account.id L' AWS account a cui appartiene la corsa. 123456789012
@resource.cloud.region La AWS regione in cui è stata eseguita la corsa. us-west-2
@resource.cloud.resource_id L'ARN della corsa. arn:aws:omics:us-west-2:123456789012:run/1234567
@resource.service.name Il servizio che ha pubblicato la metrica. omics
@resource.aws.omics.workflow.id L'ID del flusso di lavoro utilizzato dall'esecuzione. 1122334
@resource.aws.omics.run.id L'ID della corsa. 1234567
@resource.aws.omics.storage.type Il tipo di archiviazione dell'esecuzione. DYNAMIC
Etichette delle risorse delle attività
@resource.aws.omics.task.id L'ID dell'attività a cui è destinato il punto dati. Solo le aws.omics.task.* metriche sono contrassegnate da questa etichetta. 1245938

Attributi aggiuntivi

Alcune metriche di esecuzione includono attributi di punti dati aggiuntivi che suddividono la metrica in serie temporali separate. Puoi utilizzare questi attributi per filtrare una query ProMQL.

Attributi metrici aggiuntivi
Attributo aggiuntivo Metriche Description Valori
gpu.id aws.omics.task.gpu.utilization, aws.omics.task.gpu.memory.usage, aws.omics.task.gpu.memory.limit L'indice a base zero della GPU sull'istanza. 0,,, o 1 2 3
scratch.storage.mode aws.omics.task.filesystem.scratch.storage.usage, aws.omics.task.filesystem.scratch.storage.limit Dove l'attività scrive i propri dati scratch, in base all'effettivoscratchStorageMode. LOCAL o SHARED
network.io.direction aws.omics.task.network.io La direzione del trasferimento di rete. receive o transmit
filesystem.io.direction aws.omics.task.filesystem.io, aws.omics.task.filesystem.operations La direzione del funzionamento del file system. read o write

Interrogazione delle metriche di HealthOmics esecuzione

È possibile visualizzare le metriche di esecuzione nella CloudWatch console HealthOmics eseguendo una query ProMQL in Query Studio.

Per visualizzare le metriche di HealthOmics esecuzione (console) CloudWatch
  1. Conferma che la corsa è iniziata con l'cloudwatch:PutMetricDataautorizzazione.

  2. Accedi alla console di gestione AWS e apri la console CloudWatch .

  3. Nel riquadro di navigazione, scegli Query Studio.

  4. Nell'editor di query, scegli PromQL dall'elenco a discesa.

  5. In modalità Builder, sfoglia e seleziona il nome di una metrica e le relative etichette. Oppure, in modalità Editor, inserisci una query ProMQL.

  6. Scegli un intervallo di tempo con il selettore dell'intervallo di tempo.

  7. Scegliete Esegui per visualizzare i risultati come grafico di serie temporali. Per modificare la modalità di visualizzazione del grafico, scegliete Personalizza.

Ad esempio, la seguente query restituisce le vCPU utilizzate da ogni attività in esecuzione. Sostituisci runID con l'ID dell'esecuzione che desideri ispezionare.

{"aws.omics.task.cpu.usage", "@resource.aws.omics.run.id"="runID"}

Per etichettare ogni serie temporale con l'ID di esecuzione e l'ID dell'attività, puoi scegliere Etichetta personalizzata e inserire quanto segue.

{@resource.aws.omics.run.id="${@resource.aws.omics.run.id}",@resource.aws.omics.task.id="${@resource.aws.omics.task.id}"}
Per interrogare le metriche di HealthOmics esecuzione (API)

CloudWatch fornisce Prometheus-compatible API ed endpoint per l'interrogazione dei dati delle metriche. Per ulteriori informazioni sull'interrogazione delle metriche con queste API, consulta API. Prometheus-compatible

Creazione di un allarme utilizzando CloudWatch

Puoi creare un CloudWatch allarme da una query ProMQL in modo che ti CloudWatch avvisi quando una metrica supera una soglia. L'allarme può inviare una notifica a un argomento di Amazon Simple Notification Service (Amazon SNS) oppure può avviare un'altra azione quando l'allarme cambia stato.

Per creare un allarme da una query ProMQL (console) CloudWatch
  1. Accedi alla console di gestione AWS e apri la console CloudWatch .

  2. Nel riquadro di navigazione, scegli Query Studio.

  3. Scegli PromQL, inserisci la tua query, verifica il grafico, quindi scegli il pulsante Crea allarme.

Aggiungere metriche di HealthOmics esecuzione a una dashboard CloudWatch

Puoi aggiungere una query ProMQL a una CloudWatch dashboard come widget in modo da poter monitorare l'utilizzo HealthOmics delle risorse insieme alle altre metriche.

Per aggiungere metriche di HealthOmics esecuzione a una CloudWatch dashboard (console) CloudWatch
  1. Accedi alla console di gestione AWS e apri la console CloudWatch .

  2. Nel riquadro di navigazione, scegli Query Studio.

  3. Scegli ProMQL, inserisci la tua query, quindi verifica il grafico.

  4. Scegli Azione, quindi scegli Aggiungi alla dashboard.

  5. Scegli una dashboard esistente o creane una nuova, quindi salva il widget.

Analisi delle metriche di esecuzione con il server MCP HealthOmics

È possibile utilizzare il server HealthOmics Model Context Protocol (MCP) per recuperare le metriche di esecuzione e analizzare gli errori di esecuzione su più dimensioni dei dati con l'aiuto di un modello AI. Puoi utilizzare il server MCP tramite Kiro CLI, Claude Code o qualsiasi altro client agentico. MCP-compatible Per ulteriori informazioni, consulta AWS HealthOmics MCP Server e gli strumenti agentic supportati. https://github.com/aws-samples/sample-healthomics-agentic-setup

Callout

  • HealthOmics inizia a emettere metriche di esecuzione dopo che un'attività ha raggiunto lo RUNNING stato e smette di emetterle quando l'attività ha raggiunto lo stato. COMPLETED Per ulteriori informazioni sullo stato delle attività, vedere. Valori dello stato dell'attività

  • I primi punti dati vengono visualizzati dopo un breve ritardo di circa 30 secondi.

  • Le attività eseguite per meno di 30 secondi potrebbero non avere metriche.

  • Se il tipo di archiviazione dell'esecuzione è DYNAMIC impostato, aws.omics.run.filesystem.usage potrebbe verificarsi un ritardo superiore a 30 minuti, pertanto potrebbe non essere disponibile per le esecuzioni che richiedono meno di 30 minuti.

  • Quando lo scratchStorageMode èSHARED, aws.omics.task.filesystem.scratch.storage.usage potrebbe non essere disponibile per le attività che creano un numero elevato di file temporanei. HealthOmics misura l'utilizzo in questa modalità con una scansione ricorsiva della directory temporanea dell'attività e la scansione non viene sempre completata entro il limite di tempo stabilito quando il numero di file è elevato.

  • Le metriche della CPU e della memoria potrebbero differire dai valori del manifesto di esecuzione perché le due misurazioni utilizzano un ambito diverso. Le metriche di esecuzione riflettono più da vicino il consumo effettivo dell'attività.

  • Le metriche di esecuzione sono disponibili solo nell' AWS account che possiede il ruolo di servizio e avvia l'esecuzione.

Fatturazione

AWS HealthOmics non ti addebita alcun costo per le metriche di esecuzione. Le metriche vengono pubblicate su Amazon CloudWatch nel tuo account e ti CloudWatch fatturano direttamente l'attività associata. Gli addebiti si basano sul volume di dati metrici inseriti. Per i prezzi in una AWS regione specifica, consulta i prezzi di Amazon. CloudWatch La tabella seguente descrive i CloudWatch costi delle metriche di esecuzione.

Come vengono addebitati i CloudWatch costi per le metriche di esecuzione
Attività Come ti vengono addebitati
OpenTelemetry Metriche di pubblicazione Per GB di dati inseriti. Include 15 mesi di archiviazione, senza costi separati per l'archiviazione o per il numero di serie metriche uniche.
Esecuzione di query ProMQL nella CloudWatch console, inclusi Query Studio e dashboard Nessun costo.
Esecuzione di query ProMQL con le API CloudWatch Per milione di campioni scansionati.
Allarmi che valutano una query ProMQL Un costo di allarme standard, più i costi di interrogazione per i campioni scansionati ad ogni valutazione.

Impostazioni di opt-out

Per impostazione predefinita, HealthOmics pubblica le metriche di esecuzione ogni volta che il ruolo di servizio per un'esecuzione dispone dell'autorizzazione. cloudwatch:PutMetricData Per disattivare e bloccare gli addebiti futuri, puoi omettere questa autorizzazione dal ruolo di servizio a ogni livello di esecuzione. Per interrompere la pubblicazione anche quando un'altra politica concede l'autorizzazione, aggiungi un rifiuto esplicito al ruolo:

{ "Version": "2012-10-17", "Statement": [ { "Effect": "Deny", "Action": "cloudwatch:PutMetricData", "Resource": "*" } ] }

Un altro modo per disattivare la registrazione è disattivare la registrazione per una corsa LogLevel = OFF impostando la richiesta. StartRun Se impostato su LogLevelOFF, HealthOmics non pubblica le metriche di esecuzione.