As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.
Execute métricas para fluxos de trabalho privados
HealthOmics publica métricas de utilização de recursos quase em tempo real para suas execuções e tarefas na Amazon. CloudWatch Essas métricas oferecem visibilidade de como suas corridas estão progredindo enquanto são executadas. Você pode usar essas métricas para:
Identifique gargalos da Unidade Central de Processamento (CPU) ou da Unidade de Processamento Gráfico (GPU) enquanto as tarefas ainda estão em execução.
Detecte a pressão da memória ou o esgotamento do armazenamento antes que uma tarefa falhe.
Right-size as configurações de computação e armazenamento para seus fluxos de trabalho.
Crie CloudWatch painéis e alarmes ou integre-se a ferramentas de observabilidade de terceiros.
As métricas de execução estão disponíveis para fluxos de trabalho privados e compartilhados.
HealthOmics vende essas métricas de acordo com o cloudwatch.aws/omics escopo de sua própria CloudWatch conta.
Essas métricas são emitidas usando o padrão de métricas compatível com CloudWatch OpenTelemetry (Otel). Isso significa que você pode integrá-los às ferramentas de OTel-compatible observabilidade, além de CloudWatch painéis e alarmes nativos. Consulte as métricas do Otel com a Prometheus Query Language (ProMQL) para visualizar e analisar os dados. Para acessar mais informações, consulte Métricas do CloudWatch OpenTelemetry.
Disponibilidade de regiões
As métricas de execução estão disponíveis em todas as HealthOmics regiões suportadas, exceto na região de Israel (Tel Aviv) (il-central-1).
Habilitando métricas para uma corrida
Para publicar essas métricas, a função AWS Identity and Access Management (IAM) que você usa para sua execução deve ter permissão para gravar métricas CloudWatch. Adicione a seguinte permissão à sua função de execução de fluxo de trabalho:
{ "Version": "2012-10-17", "Statement": [ { "Effect": "Allow", "Action": "cloudwatch:PutMetricData", "Resource": "*" } ] }
Para obter mais informações sobre permissões, consulte Funções de serviço para AWS HealthOmics. Para obter mais informações sobre como iniciar uma corrida, consulteComece uma corrida em HealthOmics.
CloudWatch PutMetricDatacota
CloudWatch tem uma PutMetricData cota padrão de 500 solicitações por segundo (transações por segundo). Essa cota padrão é suficiente para visualizar métricas de até 15.000 tarefas simultâneas HealthOmics . Para visualizar as métricas de mais de 15.000 HealthOmics tarefas simultâneas, solicite um aumento de limite para a CloudWatch PutMetricData cota. Para obter mais informações, consulte as Service Quotas do CloudWatch .
Métricas disponíveis
Disponibilidade métrica
HealthOmics emite métricas com base no tipo de fluxo de trabalho. Nem todas as métricas são emitidas para cada fluxo de trabalho.
A tabela a seguir lista as métricas que são HealthOmics vendidas para cada execução. As métricas estão disponíveis no CloudWatch Query Studio. As unidades seguem a OpenTelemetry convenção: By são bytes, {cpu} são vCPUs, {operation} são operações e % são uma porcentagem.
| Nome da métrica | Description | Unidade | Tipo | Frequência | Disponibilidade |
|---|---|---|---|---|---|
aws.omics.run.filesystem.usage |
Armazenamento em uso no sistema de arquivos compartilhado da execução. | By |
gauge |
30 segundos | Para cada corrida. |
aws.omics.run.filesystem.limit |
Capacidade total do sistema de arquivos compartilhado da execução. | By |
gauge |
30 segundos | Somente para execuções que usam o tipo de armazenamento de STATIC execução. |
aws.omics.task.cpu.usage |
vCPUs em uso pela tarefa de fluxo de trabalho. | {cpu} |
gauge |
30 segundos | Para cada tarefa em execução. |
aws.omics.task.cpu.limit |
vCPUs reservadas para a tarefa de fluxo de trabalho com base na definição do fluxo de trabalho ou nos valores padrão. | {cpu} |
gauge |
30 segundos | Para cada tarefa em execução. |
aws.omics.task.memory.usage |
Memória em uso pela tarefa do fluxo de trabalho. | By |
gauge |
30 segundos | Para cada tarefa em execução. |
aws.omics.task.memory.limit |
Memória reservada para a tarefa do fluxo de trabalho. | By |
gauge |
30 segundos | Para cada tarefa em execução. |
aws.omics.task.network.io |
O número de bytes transmitidos e recebidos pela tarefa do fluxo de trabalho. Dividido por network.io.direction (receive,transmit). |
By |
sum |
30 segundos | Para cada tarefa em execução. |
aws.omics.task.filesystem.io |
O número de bytes do sistema de arquivos transferidos pela tarefa do fluxo de trabalho. Dividido por filesystem.io.direction (read,write). |
By |
sum |
30 segundos | Para cada tarefa em execução. |
aws.omics.task.filesystem.operations |
O número de operações do sistema de arquivos realizadas pela tarefa do fluxo de trabalho. Dividido por filesystem.io.direction (read,write). |
{operation} |
sum |
30 segundos | Para cada tarefa em execução. |
aws.omics.task.filesystem.scratch.storage.usage |
Armazenamento de rascunhos em uso pela tarefa de fluxo de trabalho. | By |
gauge |
30 segundos (LOCALmodo) ou 20 minutos (SHAREDmodo) |
Para cada tarefa em execução. |
aws.omics.task.filesystem.scratch.storage.limit |
Capacidade total de armazenamento de rascunhos disponível para a tarefa de fluxo de trabalho. | By |
gauge |
30 segundos | Para cada tarefa em uma execução definida scratchStorageMode comoLOCAL. |
aws.omics.task.gpu.utilization |
Utilização da GPU para a tarefa de fluxo de trabalho. Um ponto de dados por GPU, identificado porgpu.id. |
% |
gauge |
30 segundos | Somente para tarefas que usam aceleradores. |
aws.omics.task.gpu.memory.usage |
Memória de GPU em uso pela tarefa de fluxo de trabalho. Um ponto de dados por GPU, identificado porgpu.id. |
By |
gauge |
30 segundos | Somente para tarefas que usam aceleradores. |
aws.omics.task.gpu.memory.limit |
Memória de GPU disponível para a tarefa de fluxo de trabalho. Um ponto de dados por GPU, identificado porgpu.id. |
By |
gauge |
30 segundos | Somente para tarefas que usam aceleradores. |
Para obter mais informações sobre aceleradores, consulteRecursos de tarefas em uma definição de HealthOmics fluxo de trabalho.
Para obter mais informações sobre armazenamento efêmero, consulte. Armazenamento temporário para tarefas de fluxo de trabalho HealthOmics
Atributos comuns do
Cada métrica de HealthOmics execução carrega um conjunto comum de rótulos de recursos que identificam a origem do ponto de dados.
| Rótulo | Description | Valor de exemplo |
|---|---|---|
| Rótulos de recursos comuns | ||
@resource.cloud.provider |
O provedor de nuvem que publicou a métrica. | aws |
@resource.cloud.account.id |
A AWS conta à qual a corrida pertence. | 123456789012 |
@resource.cloud.region |
A AWS região em que a corrida ocorreu. | us-west-2 |
@resource.cloud.resource_id |
O ARN da corrida. | arn:aws:omics:us-west-2:123456789012:run/1234567 |
@resource.service.name |
O serviço que publicou a métrica. | omics |
@resource.aws.omics.workflow.id |
O ID do fluxo de trabalho usado pela execução. | 1122334 |
@resource.aws.omics.run.id |
O ID da corrida. | 1234567 |
@resource.aws.omics.storage.type |
O tipo de armazenamento de execução. | DYNAMIC |
| Rótulos de recursos de tarefas | ||
@resource.aws.omics.task.id |
O ID da tarefa para a qual o ponto de dados se destina. Somente as aws.omics.task.* métricas têm esse rótulo. |
1245938 |
Atributos adicionais.
Algumas métricas de execução contêm atributos adicionais de pontos de dados que dividem a métrica em séries temporais separadas. Você pode usar esses atributos para filtrar uma consulta ProMQL.
| Atributo adicional | Metrics | Description | Valores |
|---|---|---|---|
gpu.id |
aws.omics.task.gpu.utilization, aws.omics.task.gpu.memory.usage, aws.omics.task.gpu.memory.limit |
O índice baseado em zero da GPU na instância. | 0, 1, 2 ou 3 |
scratch.storage.mode |
aws.omics.task.filesystem.scratch.storage.usage, aws.omics.task.filesystem.scratch.storage.limit |
Onde a tarefa grava seus dados preliminares, com base no efetivoscratchStorageMode. |
LOCAL ou SHARED |
network.io.direction |
aws.omics.task.network.io |
A direção da transferência de rede. | receive ou transmit |
filesystem.io.direction |
aws.omics.task.filesystem.io, aws.omics.task.filesystem.operations |
A direção da operação do sistema de arquivos. | read ou write |
Consultando métricas de HealthOmics execução
Você pode visualizar as métricas de HealthOmics execução no CloudWatch console executando uma consulta ProMQL no Query Studio.
Para visualizar as métricas de HealthOmics execução (CloudWatch console)
-
Confirme se sua corrida começou com a
cloudwatch:PutMetricDatapermissão. -
Faça login no Console de Gerenciamento da AWS e abra o console do CloudWatch
. -
No painel de navegação, escolha Query Studio.
-
No editor de consultas, escolha ProMQL na lista suspensa.
-
No modo Builder, navegue e selecione um nome de métrica e seus rótulos. Ou, no modo Editor, insira uma consulta ProMQL.
-
Escolha um intervalo de tempo com o seletor de intervalo de tempo.
-
Escolha Executar para exibir os resultados como um gráfico de séries temporais. Para alterar a forma como o gráfico é exibido, escolha Personalizar.
Por exemplo, a consulta a seguir retorna as vCPUs em uso por cada tarefa em uma execução. runIDSubstitua pelo ID da execução que você deseja inspecionar.
{"aws.omics.task.cpu.usage", "@resource.aws.omics.run.id"="runID"}
Para rotular cada série temporal com seu ID de execução e ID de tarefa, você pode escolher Rótulo personalizado e inserir o seguinte.
{@resource.aws.omics.run.id="${@resource.aws.omics.run.id}",@resource.aws.omics.task.id="${@resource.aws.omics.task.id}"}
Para consultar métricas de HealthOmics execução (API)
CloudWatch fornece Prometheus-compatible APIs e endpoints para consultar dados métricos. Para obter mais informações sobre como consultar métricas com essas APIs, consulte Prometheus-compatible APIs.
Criando um alarme usando CloudWatch
Você pode criar um CloudWatch alarme a partir de uma consulta ProMQL para CloudWatch notificá-lo quando uma métrica ultrapassa um limite. O alarme pode enviar uma notificação para um tópico do Amazon Simple Notification Service (Amazon SNS) ou pode iniciar outra ação quando o alarme muda de estado.
Para criar um alarme a partir de uma consulta ProMQL (CloudWatch console)
-
Faça login no Console de Gerenciamento da AWS e abra o console do CloudWatch
. -
No painel de navegação, escolha Query Studio.
-
Escolha PromQL, insira sua consulta, verifique o gráfico e escolha o botão Criar alarme.
Adicionar métricas de HealthOmics execução a um CloudWatch painel
Você pode adicionar uma consulta ProMQL a um CloudWatch painel como um widget para monitorar a utilização de HealthOmics recursos junto com suas outras métricas.
Para adicionar métricas de HealthOmics execução a um CloudWatch painel (CloudWatch console)
-
Faça login no Console de Gerenciamento da AWS e abra o console do CloudWatch
. -
No painel de navegação, escolha Query Studio.
-
Escolha PromQL, insira sua consulta e, em seguida, verifique o gráfico.
-
Escolha Ação e, em seguida, escolha Adicionar ao painel.
-
Escolha um painel existente ou crie um novo e salve o widget.
Analisando métricas de execução com o HealthOmics servidor MCP
Você pode usar o servidor HealthOmics Model Context Protocol (MCP) para recuperar métricas de execução e investigar falhas de execução em várias dimensões de dados com a ajuda de um modelo de IA. Você pode usar o servidor MCP por meio do Kiro CLI, do Claude Code ou de qualquer outro cliente agente. MCP-compatible Para obter mais informações, consulte Servidor AWS HealthOmics MCP
Chamadas
HealthOmics começa a emitir métricas de execução depois que uma tarefa atinge o
RUNNINGstatus e para de emiti-las depois que a tarefa atinge oCOMPLETEDstatus. Para obter mais informações sobre status de tarefas, consulteValores de status da tarefa.Os primeiros pontos de dados aparecem após um pequeno atraso de cerca de 30 segundos.
As tarefas executadas por menos de 30 segundos podem não ter métricas.
Quando o tipo de armazenamento da execução é
DYNAMIC,aws.omics.run.filesystem.usagepode haver um atraso de mais de 30 minutos, portanto, pode não estar disponível para execuções que levam menos de 30 minutos.Quando
scratchStorageModeéSHARED,aws.omics.task.filesystem.scratch.storage.usagetalvez não esteja disponível para tarefas que criam um grande número de arquivos temporários. HealthOmics mede o uso nesse modo com uma verificação recursiva do diretório temporário da tarefa, e a verificação nem sempre é concluída dentro do limite de tempo quando a contagem de arquivos é alta.As métricas de CPU e memória podem diferir dos valores do manifesto de execução porque as duas medidas usam um escopo diferente. As métricas de execução refletem mais de perto o que sua tarefa realmente consome.
As métricas de execução estão disponíveis somente na AWS conta que possui a função de serviço e inicia a execução.
Faturamento
AWS HealthOmics não cobra pelas métricas de execução. As métricas são publicadas CloudWatch na Amazon em sua conta e CloudWatch cobram diretamente pela atividade associada. As cobranças são baseadas no volume de dados métricos ingeridos. Para preços em uma AWS região específica, consulte os CloudWatch preços da Amazon
| Atividade | Como você é cobrado |
|---|---|
| OpenTelemetry Métricas de publicação | Por GB de dados ingeridos. Inclui 15 meses de armazenamento, sem cobrança separada pelo armazenamento ou pelo número de séries métricas exclusivas. |
| Executando consultas ProMQL no CloudWatch console, incluindo Query Studio e painéis | Sem cobrança. |
| Executando consultas ProMQL com as APIs CloudWatch | Por milhão de amostras digitalizadas. |
| Alarmes que avaliam uma consulta ProMQL | Uma taxa de alarme padrão, além de taxas de consulta para as amostras digitalizadas em cada avaliação. |
Optar por não participar
Por padrão, HealthOmics publica métricas de execução sempre que a função de serviço de uma execução tem a cloudwatch:PutMetricData permissão. Para cancelar e interromper futuras cobranças, você pode omitir essa permissão da função de serviço em cada nível de execução. Para interromper a publicação mesmo quando outra política conceder a permissão, adicione uma negação explícita à função:
{ "Version": "2012-10-17", "Statement": [ { "Effect": "Deny", "Action": "cloudwatch:PutMetricData", "Resource": "*" } ] }
Outra forma de optar por não participar é desativar o registro de uma execução definindo LogLevel
= OFF na StartRun solicitação. Quando você define como LogLevelOFF, HealthOmics não publica métricas de execução.