View a markdown version of this page

Exécutez des métriques pour les flux de travail privés - AWS HealthOmics

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Exécutez des métriques pour les flux de travail privés

HealthOmics publie des mesures d'utilisation des ressources en temps quasi réel pour vos exécutions et vos tâches sur Amazon. CloudWatch Ces statistiques vous donnent une visibilité sur la progression de vos courses au fur et à mesure de leur exécution. Vous pouvez utiliser ces indicateurs pour :

  • Identifiez les goulots d'étranglement de l'unité centrale (CPU) ou de l'unité de traitement graphique (GPU) alors que les tâches sont toujours en cours d'exécution.

  • Détectez la pression de la mémoire ou l'épuisement de l'espace de stockage avant qu'une tâche n'échoue.

  • Right-size les configurations de calcul et de stockage pour vos flux de travail.

  • Créez des CloudWatch tableaux de bord et des alarmes, ou intégrez-les à des outils d'observabilité tiers.

Les métriques d'exécution sont disponibles pour les flux de travail privés et partagés.

HealthOmics vend ces statistiques dans le cloudwatch.aws/omics cadre de votre propre CloudWatch compte.

Ces métriques sont émises à l'aide de la norme de métriques compatible CloudWatch OpenTelemetry (Otel). Cela signifie que vous pouvez les intégrer à des outils d' OTel-compatible observabilité ainsi qu'à des CloudWatch tableaux de bord et des alarmes natifs. Interrogez les métriques OTel avec le langage de requête Prometheus (ProMQL) pour afficher et analyser les données. Pour plus d'informations, consultez la section CloudWatch OpenTelemetry Statistiques.

Disponibilité dans les Régions

Les statistiques d'exécution sont disponibles dans toutes les HealthOmics régions prises en charge, à l'exception de la région Israël (Tel Aviv) (il-central-1).

Activation des métriques pour une course

Pour publier ces métriques, le rôle Gestion des identités et des accès AWS (IAM) que vous utilisez pour votre exécution doit être autorisé à écrire des métriques. CloudWatch Ajoutez l'autorisation suivante à votre rôle d'exécution du flux de travail :

{ "Version": "2012-10-17", "Statement": [ { "Effect": "Allow", "Action": "cloudwatch:PutMetricData", "Resource": "*" } ] }

Pour en savoir plus sur les autorisations, consultez Rôles de service pour AWS HealthOmics. Pour plus d'informations sur le démarrage d'une course, consultezCommencez une course HealthOmics.

CloudWatch PutMetricDataquota

CloudWatch a un PutMetricData quota par défaut de 500 demandes par seconde (transactions par seconde). Ce quota par défaut est suffisant pour afficher les statistiques relatives à un maximum de 15 000 HealthOmics tâches simultanées. Pour consulter les statistiques de plus de 15 000 HealthOmics tâches simultanées, demandez une augmentation de la limite du CloudWatch PutMetricData quota. Pour plus d’informations, consultez Quotas de service CloudWatch .

Métriques disponibles

Disponibilité des métriques

HealthOmics émet des mesures en fonction du type de flux de travail. Toutes les métriques ne sont pas émises pour chaque flux de travail.

Le tableau suivant répertorie les statistiques relatives HealthOmics aux ventes pour chaque course. Les métriques sont disponibles dans CloudWatch Query Studio. Les unités suivent la OpenTelemetry convention : elles By correspondent à des octets, {cpu} à des processeurs virtuels, {operation} à des opérations et à % un pourcentage.

HealthOmics exécuter des métriques
Nom des métriques Description Unit Type Frequency (Fréquence) Disponibilité
aws.omics.run.filesystem.usage Stockage utilisé sur le système de fichiers partagé de l'exécution. By gauge 30 secondes Pour chaque course.
aws.omics.run.filesystem.limit Capacité totale du système de fichiers partagé de l'exécution. By gauge 30 secondes Uniquement pour les exécutions qui utilisent le type de stockage STATIC run.
aws.omics.task.cpu.usage vCPU utilisés par la tâche de flux de travail. {cpu} gauge 30 secondes Pour chaque tâche en cours d'exécution.
aws.omics.task.cpu.limit vCPU réservés à la tâche du flux de travail en fonction de la définition du flux de travail ou des valeurs par défaut. {cpu} gauge 30 secondes Pour chaque tâche en cours.
aws.omics.task.memory.usage Mémoire utilisée par la tâche du flux de travail. By gauge 30 secondes Pour chaque tâche en cours.
aws.omics.task.memory.limit Mémoire réservée à la tâche du flux de travail. By gauge 30 secondes Pour chaque tâche en cours.
aws.omics.task.network.io Nombre d'octets transmis et reçus par la tâche de flux de travail. Divisé par network.io.direction (receive,transmit). By sum 30 secondes Pour chaque tâche en cours.
aws.omics.task.filesystem.io Nombre d'octets du système de fichiers transférés par la tâche du flux de travail. Divisé par filesystem.io.direction (read,write). By sum 30 secondes Pour chaque tâche en cours.
aws.omics.task.filesystem.operations Le nombre d'opérations sur le système de fichiers effectuées par la tâche de flux de travail. Divisé par filesystem.io.direction (read,write). {operation} sum 30 secondes Pour chaque tâche en cours.
aws.omics.task.filesystem.scratch.storage.usage Stockage Scratch utilisé par la tâche de flux de travail. By gauge 30 secondes (LOCALmode) ou 20 minutes (SHAREDmode) Pour chaque tâche en cours.
aws.omics.task.filesystem.scratch.storage.limit Capacité totale de stockage temporaire disponible pour la tâche de flux de travail. By gauge 30 secondes Pour chaque tâche d'une course définie scratchStorageMode surLOCAL.
aws.omics.task.gpu.utilization Utilisation du processeur graphique pour la tâche de flux de travail. Un point de données par GPU, identifié pargpu.id. % gauge 30 secondes Uniquement pour les tâches utilisant des accélérateurs.
aws.omics.task.gpu.memory.usage Mémoire GPU utilisée par la tâche du flux de travail. Un point de données par GPU, identifié pargpu.id. By gauge 30 secondes Uniquement pour les tâches utilisant des accélérateurs.
aws.omics.task.gpu.memory.limit Mémoire GPU disponible pour la tâche du flux de travail. Un point de données par GPU, identifié pargpu.id. By gauge 30 secondes Uniquement pour les tâches utilisant des accélérateurs.

Pour plus d'informations sur les accélérateurs, consultezRessources de tâches dans une définition HealthOmics de flux de travail.

Pour plus d'informations sur le stockage éphémère, consultez. Stockage éphémère pour HealthOmics les tâches de flux de travail

Attributs communs

Chaque métrique d' HealthOmics exécution comporte un ensemble commun d'étiquettes de ressources qui identifient la source du point de données.

Étiquettes de ressources
Étiquette Description Exemple de valeur
Étiquettes de ressources communes
@resource.cloud.provider Le fournisseur de cloud qui a publié la métrique. aws
@resource.cloud.account.id Le AWS compte auquel appartient la course. 123456789012
@resource.cloud.region La AWS région dans laquelle la course s'est déroulée. us-west-2
@resource.cloud.resource_id L'ARN de la course. arn:aws:omics:us-west-2:123456789012:run/1234567
@resource.service.name Le service qui a publié la métrique. omics
@resource.aws.omics.workflow.id L'ID du flux de travail utilisé par l'exécution. 1122334
@resource.aws.omics.run.id L'identifiant de la course. 1234567
@resource.aws.omics.storage.type Type de stockage en cours d'exécution. DYNAMIC
Étiquettes de ressources de tâches
@resource.aws.omics.task.id ID de la tâche à laquelle le point de données est destiné. Seules les aws.omics.task.* métriques portent cette étiquette. 1245938

Attributs supplémentaires

Certaines métriques d'exécution comportent des attributs de point de données supplémentaires qui divisent la métrique en séries chronologiques distinctes. Vous pouvez utiliser ces attributs pour filtrer une requête ProMQL.

Attributs de mesure supplémentaires
Attribut supplémentaire Métriques Description Valeurs
gpu.id aws.omics.task.gpu.utilization, aws.omics.task.gpu.memory.usage, aws.omics.task.gpu.memory.limit L'indice de base zéro du GPU sur l'instance. 0, 12, ou 3
scratch.storage.mode aws.omics.task.filesystem.scratch.storage.usage, aws.omics.task.filesystem.scratch.storage.limit Où la tâche écrit ses données scratch, en fonction de l'effectifscratchStorageMode. LOCAL ou SHARED
network.io.direction aws.omics.task.network.io Direction du transfert réseau. receive ou transmit
filesystem.io.direction aws.omics.task.filesystem.io, aws.omics.task.filesystem.operations Direction du fonctionnement du système de fichiers. read ou write

Interroger les métriques d' HealthOmics exécution

Vous pouvez consulter les métriques d' HealthOmics exécution dans la CloudWatch console en exécutant une requête ProMQL dans Query Studio.

Pour afficher les statistiques d' HealthOmics exécution (CloudWatch console)
  1. Vérifiez que votre course a commencé avec l'cloudwatch:PutMetricDataautorisation.

  2. Connectez-vous à AWS Management Console et ouvrez la console CloudWatch .

  3. Dans le volet de navigation, choisissez Query Studio.

  4. Dans l'éditeur de requêtes, choisissez ProMQL dans la liste déroulante.

  5. En mode Builder, parcourez et sélectionnez le nom d'une métrique et ses libellés. Ou, en mode éditeur, entrez une requête ProMQL.

  6. Choisissez une plage de temps à l'aide du sélecteur de plage de temps.

  7. Choisissez Exécuter pour afficher les résultats sous forme de graphique chronologique. Pour modifier la façon dont le graphique s'affiche, choisissez Personnaliser.

Par exemple, la requête suivante renvoie les processeurs virtuels utilisés par chaque tâche au cours d'une exécution. runIDRemplacez-le par l'ID de la piste que vous souhaitez inspecter.

{"aws.omics.task.cpu.usage", "@resource.aws.omics.run.id"="runID"}

Pour étiqueter chaque série chronologique avec son identifiant d'exécution et son identifiant de tâche, vous pouvez choisir Libellé personnalisé et saisir les informations suivantes.

{@resource.aws.omics.run.id="${@resource.aws.omics.run.id}",@resource.aws.omics.task.id="${@resource.aws.omics.task.id}"}
Pour interroger les métriques d' HealthOmics exécution (API)

CloudWatch fournit des Prometheus-compatible API et des points de terminaison pour interroger les données métriques. Pour plus d'informations sur l'interrogation de métriques à l'aide de ces API, consultez la section Prometheus-compatible API.

Création d'une alarme à l'aide de CloudWatch

Vous pouvez créer une CloudWatch alarme à partir d'une requête ProMQL afin de vous CloudWatch avertir lorsqu'une métrique dépasse un seuil. L'alarme peut envoyer une notification à une rubrique Amazon Simple Notification Service (Amazon SNS) ou déclencher une autre action lorsque l'alarme change d'état.

Pour créer une alarme à partir d'une requête ProMQL (console) CloudWatch
  1. Connectez-vous à AWS Management Console et ouvrez la console CloudWatch .

  2. Dans le volet de navigation, choisissez Query Studio.

  3. Choisissez ProMQL, saisissez votre requête, vérifiez le graphique, puis choisissez le bouton Créer une alarme.

Ajouter des métriques d' HealthOmics exécution à un CloudWatch tableau de bord

Vous pouvez ajouter une requête ProMQL à un CloudWatch tableau de bord sous forme de widget afin de pouvoir surveiller l'utilisation HealthOmics des ressources parallèlement à vos autres indicateurs.

Pour ajouter des mesures d' HealthOmics exécution à un CloudWatch tableau de bord (CloudWatch console)
  1. Connectez-vous à AWS Management Console et ouvrez la console CloudWatch .

  2. Dans le volet de navigation, choisissez Query Studio.

  3. Choisissez ProMQL, entrez votre requête, puis vérifiez le graphique.

  4. Choisissez Action, puis choisissez Ajouter au tableau de bord.

  5. Choisissez un tableau de bord existant ou créez-en un nouveau, puis enregistrez le widget.

Analyse des métriques d'exécution avec le HealthOmics serveur MCP

Vous pouvez utiliser le serveur MCP ( HealthOmics Model Context Protocol) pour récupérer les métriques d'exécution et étudier les échecs d'exécution sur plusieurs dimensions de données à l'aide d'un modèle d'IA. Vous pouvez utiliser le serveur MCP via Kiro CLI, Claude Code ou tout autre client d' MCP-compatible agence. Pour plus d'informations, consultez la section Serveur AWS HealthOmics MCP et outils d'agence pris en charge.

Alertes

  • HealthOmics commence à émettre des métriques d'exécution lorsqu'une tâche atteint le RUNNING statut, et arrête de les émettre une fois que la tâche atteint ce COMPLETED statut. Pour plus d'informations sur les statuts des tâches, consultezValeurs d'état des tâches.

  • Les premiers points de données apparaissent après un court délai d'environ 30 secondes.

  • Les tâches exécutées pendant moins de 30 secondes peuvent ne pas comporter de métriques.

  • Lorsque le type de stockage de l'exécution estDYNAMIC, il aws.omics.run.filesystem.usage peut y avoir un retard de plus de 30 minutes. Il se peut donc qu'il ne soit pas disponible pour les exécutions qui durent moins de 30 minutes.

  • When scratchStorageMode isSHARED, aws.omics.task.filesystem.scratch.storage.usage peut ne pas être disponible pour les tâches qui créent un grand nombre de fichiers temporaires. HealthOmics mesure l'utilisation dans ce mode à l'aide d'une analyse récursive du répertoire temporaire de la tâche, et l'analyse ne se termine pas toujours dans les délais impartis lorsque le nombre de fichiers est élevé.

  • Les mesures du processeur et de la mémoire peuvent différer des valeurs du manifeste d'exécution car les deux mesures utilisent une portée différente. Les métriques d'exécution reflètent plus fidèlement la consommation réelle de votre tâche.

  • Les métriques d'exécution ne sont disponibles que dans le AWS compte qui possède le rôle de service et qui démarre l'exécution.

Facturation

AWS HealthOmics ne vous facture pas les métriques d'exécution. Les statistiques sont publiées sur Amazon CloudWatch dans votre compte et vous CloudWatch facturent directement pour l'activité associée. Les frais sont calculés en fonction du volume de données métriques ingérées. Pour connaître les prix dans une AWS région spécifique, consultez la section CloudWatch Tarification Amazon. Le tableau suivant décrit la manière dont les CloudWatch frais d'exécution des métriques sont facturés.

Comment CloudWatch sont facturés les métriques d'exécution
Activité Comment vous êtes facturé
Statistiques de OpenTelemetry publication Par Go de données ingérées. Comprend 15 mois de stockage, sans frais distincts pour le stockage ou pour le nombre de séries métriques uniques.
Exécution de requêtes ProMQL dans la CloudWatch console, y compris Query Studio et des tableaux de bord Aucuns frais.
Exécution de requêtes ProMQL avec les API CloudWatch Par million d'échantillons scannés.
Alarmes qui évaluent une requête ProMQL Des frais d'alarme standard, auxquels s'ajoutent des frais de requête pour les échantillons scannés à chaque évaluation.

Désabonnement

Par défaut, HealthOmics publie les métriques d'exécution chaque fois que le rôle de service pour une exécution dispose de l'cloudwatch:PutMetricDataautorisation requise. Pour vous désinscrire et arrêter les frais futurs, vous pouvez omettre cette autorisation dans le rôle de service à chaque niveau d'exécution. Pour arrêter la publication même lorsqu'une autre politique accorde l'autorisation, ajoutez un refus explicite au rôle :

{ "Version": "2012-10-17", "Statement": [ { "Effect": "Deny", "Action": "cloudwatch:PutMetricData", "Resource": "*" } ] }

Une autre méthode de désinscription consiste à désactiver la journalisation d'une exécution LogLevel = OFF en configurant la StartRun demande. Lorsque vous définissez sur LogLevelOFF, HealthOmics ne publie pas les métriques d'exécution.