View a markdown version of this page

Metriken für private Workflows ausführen - AWS HealthOmics

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Metriken für private Workflows ausführen

HealthOmics veröffentlicht Kennzahlen zur Ressourcenauslastung für Ihre Läufe und Aufgaben nahezu in Echtzeit bei Amazon. CloudWatch Diese Metriken geben Ihnen einen Überblick darüber, wie sich Ihre Läufe entwickeln, während sie ausgeführt werden. Du kannst diese Metriken verwenden, um:

  • Identifizieren Sie Engpässe in der Central Processing Unit (CPU) oder der Graphics Processing Unit (GPU), während Aufgaben noch ausgeführt werden.

  • Erkennen Sie Speicherauslastung oder die Erschöpfung des Scratch-Speichers, bevor eine Aufgabe fehlschlägt.

  • Right-size die Rechen- und Speicherkonfigurationen für Ihre Workflows.

  • Erstellen Sie CloudWatch Dashboards und Alarme oder integrieren Sie sie in Observability-Tools von Drittanbietern.

Run-Metriken sind für private und gemeinsame Workflows verfügbar.

HealthOmics verkauft diese Metriken im Rahmen des cloudwatch.aws/omics Geltungsbereichs in Ihrem eigenen CloudWatch Konto.

Diese Metriken werden unter Verwendung des CloudWatch OpenTelemetry (OTel) -kompatiblen Metrikstandards ausgegeben. Das bedeutet, dass Sie sie zusammen mit nativen CloudWatch Dashboards und Alarmen in OTel-compatible Observability-Tools integrieren können. Fragen Sie die OTel-Metriken mit Prometheus Query Language (PromQL) ab, um die Daten anzuzeigen und zu analysieren. Weitere Informationen finden Sie unter Metriken. CloudWatch OpenTelemetry

Verfügbarkeit in Regionen

Run-Metriken sind in allen unterstützten HealthOmics Regionen verfügbar, mit Ausnahme der Region Israel (Tel Aviv) (il-central-1).

Metriken für einen Lauf aktivieren

Um diese Metriken zu veröffentlichen, muss die AWS Identity and Access Management (IAM) -Rolle, die Sie für Ihren Lauf verwenden, die Berechtigung zum Schreiben von Metriken haben. CloudWatch Fügen Sie Ihrer Workflow-Run-Rolle die folgende Berechtigung hinzu:

{ "Version": "2012-10-17", "Statement": [ { "Effect": "Allow", "Action": "cloudwatch:PutMetricData", "Resource": "*" } ] }

Weitere Informationen zu Berechtigungen finden Sie unter Servicerollen für AWS HealthOmics. Weitere Informationen zum Starten eines Laufs finden Sie unterStarte einen Lauf in HealthOmics.

CloudWatch PutMetricDataKontingent

CloudWatch hat ein PutMetricData Standardkontingent von 500 Anfragen pro Sekunde (Transaktionen pro Sekunde). Dieses Standardkontingent reicht aus, um Kennzahlen für bis zu 15.000 gleichzeitige HealthOmics Aufgaben anzuzeigen. Um Metriken für mehr als 15.000 gleichzeitige HealthOmics Aufgaben anzuzeigen, fordern Sie eine Erhöhung des CloudWatch PutMetricData Kontingents an. Weitere Informationen finden Sie unter CloudWatch -Servicekontingente.

Verfügbare Metriken

Verfügbarkeit von Metriken

HealthOmics gibt Metriken basierend auf dem Workflow-Typ aus. Nicht jede Metrik wird für jeden Workflow ausgegeben.

In der folgenden Tabelle sind die Metriken aufgeführt, HealthOmics die für jeden Lauf verkauft werden. Die Metriken sind in CloudWatch Query Studio verfügbar. Einheiten folgen der OpenTelemetry Konvention: By sind Byte, {cpu} sind vCPUs, {operation} sind Operationen und % sind ein Prozentsatz.

HealthOmics Metriken ausführen
Metrikname Description Einheit Typ Frequency (Frequenz) Verfügbarkeit
aws.omics.run.filesystem.usage Speicher, der auf dem gemeinsam genutzten Dateisystem des Laufs verwendet wird. By gauge 30 Sekunden Für jeden Lauf.
aws.omics.run.filesystem.limit Gesamtkapazität des gemeinsam genutzten Dateisystems des Laufs. By gauge 30 Sekunden Nur für Läufe, die den STATIC Run-Speichertyp verwenden.
aws.omics.task.cpu.usage vCPUs, die von der Workflow-Aufgabe verwendet werden. {cpu} gauge 30 Sekunden Für jede Aufgabe im Lauf.
aws.omics.task.cpu.limit vCPUs, die für die Workflow-Aufgabe reserviert sind, basierend auf der Workflow-Definition oder den Standardwerten. {cpu} gauge 30 Sekunden Für jede Aufgabe im Lauf.
aws.omics.task.memory.usage Speicher, der von der Workflow-Aufgabe verwendet wird. By gauge 30 Sekunden Für jede Aufgabe in der Ausführung.
aws.omics.task.memory.limit Für die Workflow-Aufgabe reservierter Speicher. By gauge 30 Sekunden Für jede Aufgabe in der Ausführung.
aws.omics.task.network.io Die Anzahl der Byte, die von der Workflow-Aufgabe übertragen und empfangen wurden. Geteilt durch network.io.direction (receive,transmit). By sum 30 Sekunden Für jede Aufgabe im Lauf.
aws.omics.task.filesystem.io Die Anzahl der Dateisystem-Bytes, die von der Workflow-Aufgabe übertragen wurden. Geteilt durch filesystem.io.direction (read,write). By sum 30 Sekunden Für jede Aufgabe im Lauf.
aws.omics.task.filesystem.operations Die Anzahl der Dateisystemoperationen, die von der Workflow-Aufgabe ausgeführt wurden. Geteilt durch filesystem.io.direction (read,write). {operation} sum 30 Sekunden Für jede Aufgabe im Lauf.
aws.omics.task.filesystem.scratch.storage.usage Scratch-Speicher, der von der Workflow-Aufgabe verwendet wird. By gauge 30 Sekunden (LOCALModus) oder 20 Minuten (SHAREDModus) Für jede Aufgabe im Lauf.
aws.omics.task.filesystem.scratch.storage.limit Die gesamte Scratch-Speicherkapazität, die für die Workflow-Aufgabe verfügbar ist. By gauge 30 Sekunden Für jede Aufgabe in einem Lauf, der scratchStorageMode auf festgelegt istLOCAL.
aws.omics.task.gpu.utilization GPU-Auslastung für die Workflow-Aufgabe. Ein Datenpunkt pro GPU, identifiziert durchgpu.id. % gauge 30 Sekunden Nur für Aufgaben, die Beschleuniger verwenden.
aws.omics.task.gpu.memory.usage GPU-Speicher, der von der Workflow-Aufgabe verwendet wird. Ein Datenpunkt pro GPU, identifiziert durchgpu.id. By gauge 30 Sekunden Nur für Aufgaben, die Beschleuniger verwenden.
aws.omics.task.gpu.memory.limit GPU-Speicher, der für die Workflow-Aufgabe verfügbar ist. Ein Datenpunkt pro GPU, identifiziert durchgpu.id. By gauge 30 Sekunden Nur für Aufgaben, die Beschleuniger verwenden.

Weitere Informationen zu Beschleunigern finden Sie unter. Aufgabenressourcen in einer Workflow-Definition HealthOmics

Weitere Hinweise zur kurzlebigen Speicherung finden Sie unter. Kurzlebiger Speicher für Workflow-Aufgaben HealthOmics

Gängige -Attribute

Jede HealthOmics Ausführungsmetrik enthält einen gemeinsamen Satz von Ressourcenbeschriftungen, die die Quelle des Datenpunkts identifizieren.

Beschriftungen für Ressourcen
Label (Bezeichnung) Description Beispielwert
Allgemeine Ressourcenbezeichnungen
@resource.cloud.provider Der Cloud-Anbieter, der die Metrik veröffentlicht hat. aws
@resource.cloud.account.id Das AWS Konto, zu dem der Lauf gehört. 123456789012
@resource.cloud.region Die AWS Region, in der der Lauf lief. us-west-2
@resource.cloud.resource_id Der ARN des Laufs. arn:aws:omics:us-west-2:123456789012:run/1234567
@resource.service.name Der Dienst, der die Metrik veröffentlicht hat. omics
@resource.aws.omics.workflow.id Die ID des Workflows, den der Lauf verwendet hat. 1122334
@resource.aws.omics.run.id Die ID des Laufs. 1234567
@resource.aws.omics.storage.type Der Laufspeichertyp. DYNAMIC
Bezeichnungen der Ressourcen für Aufgaben
@resource.aws.omics.task.id Die ID der Aufgabe, für die der Datenpunkt bestimmt ist. Nur die aws.omics.task.* Metriken tragen dieses Label. 1245938

Zusätzliche Attribute

Einige Laufmetriken enthalten zusätzliche Datenpunktattribute, die die Metrik in separate Zeitreihen aufteilen. Sie können diese Attribute verwenden, um eine PromQL-Abfrage zu filtern.

Zusätzliche Metrikattribute
Zusätzliches Attribut Metriken Description Werte
gpu.id aws.omics.task.gpu.utilization, aws.omics.task.gpu.memory.usage, aws.omics.task.gpu.memory.limit Der auf Null basierende Index der GPU auf der Instance. 0,1, oder 2 3
scratch.storage.mode aws.omics.task.filesystem.scratch.storage.usage, aws.omics.task.filesystem.scratch.storage.limit Wo die Aufgabe ihre Scratch-Daten schreibt, basierend auf den effektivenscratchStorageMode. LOCAL oder SHARED
network.io.direction aws.omics.task.network.io Die Richtung der Netzwerkübertragung. receive oder transmit
filesystem.io.direction aws.omics.task.filesystem.io, aws.omics.task.filesystem.operations Die Richtung des Dateisystembetriebs. read oder write

HealthOmics Laufmetriken werden abgefragt

Sie können die HealthOmics Ausführungsmetriken in der CloudWatch Konsole anzeigen, indem Sie eine PromQL-Abfrage in Query Studio ausführen.

Um HealthOmics Laufmetriken anzuzeigen (Konsole) CloudWatch
  1. Vergewissern Sie sich, dass Ihr Lauf mit der cloudwatch:PutMetricData Genehmigung gestartet wurde.

  2. Melden Sie sich bei der AWS-Managementkonsole an und öffnen Sie die CloudWatch -Konsole.

  3. Wählen Sie im Navigationsbereich Query Studio aus.

  4. Wählen Sie im Abfrage-Editor PromQL aus der Dropdownliste aus.

  5. Suchen Sie im Builder-Modus nach einem Metriknamen und seinen Bezeichnungen und wählen Sie ihn aus. Oder geben Sie im Editor-Modus eine PromQL-Abfrage ein.

  6. Wählen Sie mit der Zeitbereichsauswahl einen Zeitraum aus.

  7. Wählen Sie Ausführen, um die Ergebnisse als Zeitreihendiagramm anzuzeigen. Um zu ändern, wie das Diagramm angezeigt wird, wählen Sie Anpassen.

Die folgende Abfrage gibt beispielsweise die vCPUs zurück, die von jeder Aufgabe in einem Lauf verwendet werden. runIDErsetzen Sie durch die ID des Laufs, den Sie überprüfen möchten.

{"aws.omics.task.cpu.usage", "@resource.aws.omics.run.id"="runID"}

Um jede Zeitreihe mit ihrer Lauf-ID und Task-ID zu kennzeichnen, können Sie Benutzerdefiniertes Label wählen und Folgendes eingeben.

{@resource.aws.omics.run.id="${@resource.aws.omics.run.id}",@resource.aws.omics.task.id="${@resource.aws.omics.task.id}"}
Um HealthOmics Laufmetriken (API) abzufragen

CloudWatch bietet Prometheus-compatible APIs und Endpunkte für die Abfrage von Metrikdaten. Weitere Informationen zum Abfragen von Metriken mit diesen APIs finden Sie unter APIs. Prometheus-compatible

Einen Alarm erstellen mit CloudWatch

Sie können einen CloudWatch Alarm aus einer PromQL-Abfrage erstellen, sodass Sie CloudWatch benachrichtigt werden, wenn eine Metrik einen Schwellenwert überschreitet. Der Alarm kann eine Benachrichtigung an ein Amazon Simple Notification Service (Amazon SNS) -Thema senden oder eine weitere Aktion starten, wenn sich der Status des Alarms ändert.

Um einen Alarm aus einer PromQL-Abfrage heraus zu erstellen (Konsole) CloudWatch
  1. Melden Sie sich bei der AWS-Managementkonsole an und öffnen Sie die CloudWatch -Konsole.

  2. Wählen Sie im Navigationsbereich Query Studio aus.

  3. Wählen Sie PromQL, geben Sie Ihre Abfrage ein, überprüfen Sie das Diagramm und wählen Sie dann die Schaltfläche Alarm erstellen.

Hinzufügen von HealthOmics Run-Metriken zu einem Dashboard CloudWatch

Sie können eine PromQL-Abfrage als Widget zu einem CloudWatch Dashboard hinzufügen, sodass Sie die HealthOmics Ressourcenauslastung zusammen mit Ihren anderen Metriken überwachen können.

Um HealthOmics Run-Metriken zu einem CloudWatch Dashboard (Konsole) CloudWatch hinzuzufügen
  1. Melden Sie sich bei der AWS-Managementkonsole an und öffnen Sie die CloudWatch -Konsole.

  2. Wählen Sie im Navigationsbereich Query Studio aus.

  3. Wählen Sie PromQL, geben Sie Ihre Abfrage ein und überprüfen Sie dann das Diagramm.

  4. Wählen Sie Aktion und dann Zum Dashboard hinzufügen aus.

  5. Wählen Sie ein vorhandenes Dashboard aus oder erstellen Sie ein neues und speichern Sie dann das Widget.

Analysieren der Laufmetriken mit dem HealthOmics MCP-Server

Sie können den HealthOmics Model Context Protocol (MCP) -Server verwenden, um Laufmesswerte abzurufen und Lauffehler in mehreren Datendimensionen mithilfe eines KI-Modells zu untersuchen. Sie können den MCP-Server über Kiro CLI, Claude Code oder einen anderen MCP-compatible agentischen Client verwenden. Weitere Informationen finden Sie unter AWS HealthOmics MCP Server und unterstützte agentische Tools. https://github.com/aws-samples/sample-healthomics-agentic-setup

Callouts

  • HealthOmics beginnt mit der Ausgabe von Run-Metriken, nachdem eine Aufgabe den RUNNING Status erreicht hat, und stoppt die Ausgabe, wenn die Aufgabe den Status erreicht hat. COMPLETED Weitere Informationen zum Aufgabenstatus finden Sie unterWerte für den Aufgabenstatus.

  • Die ersten Datenpunkte erscheinen nach einer kurzen Verzögerung von etwa 30 Sekunden.

  • Für Aufgaben, die weniger als 30 Sekunden ausgeführt werden, gibt es möglicherweise keine Messwerte.

  • Wenn der Lauf den Speichertyp aws.omics.run.filesystem.usage hatDYNAMIC, kann es zu einer Verzögerung von mehr als 30 Minuten kommen, sodass er für Läufe, die weniger als 30 Minuten dauern, möglicherweise nicht verfügbar ist.

  • Wenn dies der SHARED Fall scratchStorageMode ist, ist aws.omics.task.filesystem.scratch.storage.usage möglicherweise nicht für Aufgaben verfügbar, die eine große Anzahl temporärer Dateien erstellen. HealthOmics misst die Nutzung in diesem Modus mit einem rekursiven Scan des temporären Verzeichnisses der Aufgabe, und der Scan wird nicht immer innerhalb des Zeitlimits abgeschlossen, wenn die Anzahl der Dateien hoch ist.

  • Die CPU- und Speichermesswerte können von den Ausführungsmanifestwerten abweichen, da die beiden Messungen einen anderen Bereich verwenden. Die Ausführungsmetriken geben besser wieder, was Ihre Aufgabe tatsächlich verbraucht.

  • Ausführungsmetriken sind nur in dem AWS Konto verfügbar, dem die Servicerolle gehört und das den Lauf startet.

Fakturierung

AWS HealthOmics berechnet Ihnen keine Run-Metriken. Die Kennzahlen werden auf Amazon CloudWatch in Ihrem Konto veröffentlicht und die damit verbundenen Aktivitäten werden Ihnen direkt in CloudWatch Rechnung gestellt. Die Gebühren richten sich nach dem Umfang der aufgenommenen Metrikdaten. Preise in einer bestimmten AWS Region finden Sie unter CloudWatch Amazon-Preise. In der folgenden Tabelle wird beschrieben, wie die CloudWatch Gebühren für laufende Messwerte berechnet werden.

Wie hoch sind die CloudWatch Gebühren für Laufmetriken
Aktivität Wie werden dir Gebühren berechnet
Veröffentlichung von OpenTelemetry Kennzahlen Pro GB aufgenommener Daten. Beinhaltet 15 Monate Speicherplatz, ohne dass für die Speicherung oder die Anzahl der einzelnen metrischen Reihen eine gesonderte Gebühr anfällt.
Ausführen von PromQL-Abfragen in der CloudWatch Konsole, einschließlich Query Studio und Dashboards Keine Gebühren.
Ausführen von PromQL-Abfragen mit den APIs CloudWatch Pro Million gescannter Proben.
Alarme, die eine PromQL-Abfrage auswerten Eine Standardalarmgebühr zuzüglich Abfragegebühren für die bei jeder Auswertung gescannten Proben.

Abmeldung

Standardmäßig HealthOmics veröffentlicht Laufmetriken immer dann, wenn die Servicerolle für einen Lauf über die cloudwatch:PutMetricData entsprechende Berechtigung verfügt. Um sich abzumelden und zukünftige Gebühren zu stoppen, können Sie diese Berechtigung für die Servicerolle auf jeder Ausführungsebene weglassen. Um die Veröffentlichung auch dann zu beenden, wenn eine andere Richtlinie die Erlaubnis erteilt, fügen Sie der Rolle eine ausdrückliche Ablehnung hinzu:

{ "Version": "2012-10-17", "Statement": [ { "Effect": "Deny", "Action": "cloudwatch:PutMetricData", "Resource": "*" } ] }

Eine andere Möglichkeit, sich abzumelden, besteht darin, die Protokollierung für einen Lauf zu deaktivieren, indem Sie LogLevel = OFF dies in der StartRun Anfrage angeben. Wenn Sie LogLevel diese Option festlegenOFF, werden HealthOmics keine Laufmetriken veröffentlicht.