Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Metriken für private Workflows ausführen
HealthOmics veröffentlicht Kennzahlen zur Ressourcenauslastung für Ihre Läufe und Aufgaben nahezu in Echtzeit bei Amazon. CloudWatch Diese Metriken geben Ihnen einen Überblick darüber, wie sich Ihre Läufe entwickeln, während sie ausgeführt werden. Du kannst diese Metriken verwenden, um:
Identifizieren Sie Engpässe in der Central Processing Unit (CPU) oder der Graphics Processing Unit (GPU), während Aufgaben noch ausgeführt werden.
Erkennen Sie Speicherauslastung oder die Erschöpfung des Scratch-Speichers, bevor eine Aufgabe fehlschlägt.
Right-size die Rechen- und Speicherkonfigurationen für Ihre Workflows.
Erstellen Sie CloudWatch Dashboards und Alarme oder integrieren Sie sie in Observability-Tools von Drittanbietern.
Run-Metriken sind für private und gemeinsame Workflows verfügbar.
HealthOmics verkauft diese Metriken im Rahmen des cloudwatch.aws/omics Geltungsbereichs in Ihrem eigenen CloudWatch Konto.
Diese Metriken werden unter Verwendung des CloudWatch OpenTelemetry (OTel) -kompatiblen Metrikstandards ausgegeben. Das bedeutet, dass Sie sie zusammen mit nativen CloudWatch Dashboards und Alarmen in OTel-compatible Observability-Tools integrieren können. Fragen Sie die OTel-Metriken mit Prometheus Query Language (PromQL) ab, um die Daten anzuzeigen und zu analysieren. Weitere Informationen finden Sie unter Metriken. CloudWatch OpenTelemetry
Verfügbarkeit in Regionen
Run-Metriken sind in allen unterstützten HealthOmics Regionen verfügbar, mit Ausnahme der Region Israel (Tel Aviv) (il-central-1).
Metriken für einen Lauf aktivieren
Um diese Metriken zu veröffentlichen, muss die AWS Identity and Access Management (IAM) -Rolle, die Sie für Ihren Lauf verwenden, die Berechtigung zum Schreiben von Metriken haben. CloudWatch Fügen Sie Ihrer Workflow-Run-Rolle die folgende Berechtigung hinzu:
{ "Version": "2012-10-17", "Statement": [ { "Effect": "Allow", "Action": "cloudwatch:PutMetricData", "Resource": "*" } ] }
Weitere Informationen zu Berechtigungen finden Sie unter Servicerollen für AWS HealthOmics. Weitere Informationen zum Starten eines Laufs finden Sie unterStarte einen Lauf in HealthOmics.
CloudWatch PutMetricDataKontingent
CloudWatch hat ein PutMetricData Standardkontingent von 500 Anfragen pro Sekunde (Transaktionen pro Sekunde). Dieses Standardkontingent reicht aus, um Kennzahlen für bis zu 15.000 gleichzeitige HealthOmics Aufgaben anzuzeigen. Um Metriken für mehr als 15.000 gleichzeitige HealthOmics Aufgaben anzuzeigen, fordern Sie eine Erhöhung des CloudWatch PutMetricData Kontingents an. Weitere Informationen finden Sie unter CloudWatch -Servicekontingente.
Verfügbare Metriken
Verfügbarkeit von Metriken
HealthOmics gibt Metriken basierend auf dem Workflow-Typ aus. Nicht jede Metrik wird für jeden Workflow ausgegeben.
In der folgenden Tabelle sind die Metriken aufgeführt, HealthOmics die für jeden Lauf verkauft werden. Die Metriken sind in CloudWatch Query Studio verfügbar. Einheiten folgen der OpenTelemetry Konvention: By sind Byte, {cpu} sind vCPUs, {operation} sind Operationen und % sind ein Prozentsatz.
| Metrikname | Description | Einheit | Typ | Frequency (Frequenz) | Verfügbarkeit |
|---|---|---|---|---|---|
aws.omics.run.filesystem.usage |
Speicher, der auf dem gemeinsam genutzten Dateisystem des Laufs verwendet wird. | By |
gauge |
30 Sekunden | Für jeden Lauf. |
aws.omics.run.filesystem.limit |
Gesamtkapazität des gemeinsam genutzten Dateisystems des Laufs. | By |
gauge |
30 Sekunden | Nur für Läufe, die den STATIC Run-Speichertyp verwenden. |
aws.omics.task.cpu.usage |
vCPUs, die von der Workflow-Aufgabe verwendet werden. | {cpu} |
gauge |
30 Sekunden | Für jede Aufgabe im Lauf. |
aws.omics.task.cpu.limit |
vCPUs, die für die Workflow-Aufgabe reserviert sind, basierend auf der Workflow-Definition oder den Standardwerten. | {cpu} |
gauge |
30 Sekunden | Für jede Aufgabe im Lauf. |
aws.omics.task.memory.usage |
Speicher, der von der Workflow-Aufgabe verwendet wird. | By |
gauge |
30 Sekunden | Für jede Aufgabe in der Ausführung. |
aws.omics.task.memory.limit |
Für die Workflow-Aufgabe reservierter Speicher. | By |
gauge |
30 Sekunden | Für jede Aufgabe in der Ausführung. |
aws.omics.task.network.io |
Die Anzahl der Byte, die von der Workflow-Aufgabe übertragen und empfangen wurden. Geteilt durch network.io.direction (receive,transmit). |
By |
sum |
30 Sekunden | Für jede Aufgabe im Lauf. |
aws.omics.task.filesystem.io |
Die Anzahl der Dateisystem-Bytes, die von der Workflow-Aufgabe übertragen wurden. Geteilt durch filesystem.io.direction (read,write). |
By |
sum |
30 Sekunden | Für jede Aufgabe im Lauf. |
aws.omics.task.filesystem.operations |
Die Anzahl der Dateisystemoperationen, die von der Workflow-Aufgabe ausgeführt wurden. Geteilt durch filesystem.io.direction (read,write). |
{operation} |
sum |
30 Sekunden | Für jede Aufgabe im Lauf. |
aws.omics.task.filesystem.scratch.storage.usage |
Scratch-Speicher, der von der Workflow-Aufgabe verwendet wird. | By |
gauge |
30 Sekunden (LOCALModus) oder 20 Minuten (SHAREDModus) |
Für jede Aufgabe im Lauf. |
aws.omics.task.filesystem.scratch.storage.limit |
Die gesamte Scratch-Speicherkapazität, die für die Workflow-Aufgabe verfügbar ist. | By |
gauge |
30 Sekunden | Für jede Aufgabe in einem Lauf, der scratchStorageMode auf festgelegt istLOCAL. |
aws.omics.task.gpu.utilization |
GPU-Auslastung für die Workflow-Aufgabe. Ein Datenpunkt pro GPU, identifiziert durchgpu.id. |
% |
gauge |
30 Sekunden | Nur für Aufgaben, die Beschleuniger verwenden. |
aws.omics.task.gpu.memory.usage |
GPU-Speicher, der von der Workflow-Aufgabe verwendet wird. Ein Datenpunkt pro GPU, identifiziert durchgpu.id. |
By |
gauge |
30 Sekunden | Nur für Aufgaben, die Beschleuniger verwenden. |
aws.omics.task.gpu.memory.limit |
GPU-Speicher, der für die Workflow-Aufgabe verfügbar ist. Ein Datenpunkt pro GPU, identifiziert durchgpu.id. |
By |
gauge |
30 Sekunden | Nur für Aufgaben, die Beschleuniger verwenden. |
Weitere Informationen zu Beschleunigern finden Sie unter. Aufgabenressourcen in einer Workflow-Definition HealthOmics
Weitere Hinweise zur kurzlebigen Speicherung finden Sie unter. Kurzlebiger Speicher für Workflow-Aufgaben HealthOmics
Gängige -Attribute
Jede HealthOmics Ausführungsmetrik enthält einen gemeinsamen Satz von Ressourcenbeschriftungen, die die Quelle des Datenpunkts identifizieren.
| Label (Bezeichnung) | Description | Beispielwert |
|---|---|---|
| Allgemeine Ressourcenbezeichnungen | ||
@resource.cloud.provider |
Der Cloud-Anbieter, der die Metrik veröffentlicht hat. | aws |
@resource.cloud.account.id |
Das AWS Konto, zu dem der Lauf gehört. | 123456789012 |
@resource.cloud.region |
Die AWS Region, in der der Lauf lief. | us-west-2 |
@resource.cloud.resource_id |
Der ARN des Laufs. | arn:aws:omics:us-west-2:123456789012:run/1234567 |
@resource.service.name |
Der Dienst, der die Metrik veröffentlicht hat. | omics |
@resource.aws.omics.workflow.id |
Die ID des Workflows, den der Lauf verwendet hat. | 1122334 |
@resource.aws.omics.run.id |
Die ID des Laufs. | 1234567 |
@resource.aws.omics.storage.type |
Der Laufspeichertyp. | DYNAMIC |
| Bezeichnungen der Ressourcen für Aufgaben | ||
@resource.aws.omics.task.id |
Die ID der Aufgabe, für die der Datenpunkt bestimmt ist. Nur die aws.omics.task.* Metriken tragen dieses Label. |
1245938 |
Zusätzliche Attribute
Einige Laufmetriken enthalten zusätzliche Datenpunktattribute, die die Metrik in separate Zeitreihen aufteilen. Sie können diese Attribute verwenden, um eine PromQL-Abfrage zu filtern.
| Zusätzliches Attribut | Metriken | Description | Werte |
|---|---|---|---|
gpu.id |
aws.omics.task.gpu.utilization, aws.omics.task.gpu.memory.usage, aws.omics.task.gpu.memory.limit |
Der auf Null basierende Index der GPU auf der Instance. | 0,1, oder 2 3 |
scratch.storage.mode |
aws.omics.task.filesystem.scratch.storage.usage, aws.omics.task.filesystem.scratch.storage.limit |
Wo die Aufgabe ihre Scratch-Daten schreibt, basierend auf den effektivenscratchStorageMode. |
LOCAL oder SHARED |
network.io.direction |
aws.omics.task.network.io |
Die Richtung der Netzwerkübertragung. | receive oder transmit |
filesystem.io.direction |
aws.omics.task.filesystem.io, aws.omics.task.filesystem.operations |
Die Richtung des Dateisystembetriebs. | read oder write |
HealthOmics Laufmetriken werden abgefragt
Sie können die HealthOmics Ausführungsmetriken in der CloudWatch Konsole anzeigen, indem Sie eine PromQL-Abfrage in Query Studio ausführen.
Um HealthOmics Laufmetriken anzuzeigen (Konsole) CloudWatch
-
Vergewissern Sie sich, dass Ihr Lauf mit der
cloudwatch:PutMetricDataGenehmigung gestartet wurde. -
Melden Sie sich bei der AWS-Managementkonsole an und öffnen Sie die CloudWatch -Konsole
. -
Wählen Sie im Navigationsbereich Query Studio aus.
-
Wählen Sie im Abfrage-Editor PromQL aus der Dropdownliste aus.
-
Suchen Sie im Builder-Modus nach einem Metriknamen und seinen Bezeichnungen und wählen Sie ihn aus. Oder geben Sie im Editor-Modus eine PromQL-Abfrage ein.
-
Wählen Sie mit der Zeitbereichsauswahl einen Zeitraum aus.
-
Wählen Sie Ausführen, um die Ergebnisse als Zeitreihendiagramm anzuzeigen. Um zu ändern, wie das Diagramm angezeigt wird, wählen Sie Anpassen.
Die folgende Abfrage gibt beispielsweise die vCPUs zurück, die von jeder Aufgabe in einem Lauf verwendet werden. runIDErsetzen Sie durch die ID des Laufs, den Sie überprüfen möchten.
{"aws.omics.task.cpu.usage", "@resource.aws.omics.run.id"="runID"}
Um jede Zeitreihe mit ihrer Lauf-ID und Task-ID zu kennzeichnen, können Sie Benutzerdefiniertes Label wählen und Folgendes eingeben.
{@resource.aws.omics.run.id="${@resource.aws.omics.run.id}",@resource.aws.omics.task.id="${@resource.aws.omics.task.id}"}
Um HealthOmics Laufmetriken (API) abzufragen
CloudWatch bietet Prometheus-compatible APIs und Endpunkte für die Abfrage von Metrikdaten. Weitere Informationen zum Abfragen von Metriken mit diesen APIs finden Sie unter APIs. Prometheus-compatible
Einen Alarm erstellen mit CloudWatch
Sie können einen CloudWatch Alarm aus einer PromQL-Abfrage erstellen, sodass Sie CloudWatch benachrichtigt werden, wenn eine Metrik einen Schwellenwert überschreitet. Der Alarm kann eine Benachrichtigung an ein Amazon Simple Notification Service (Amazon SNS) -Thema senden oder eine weitere Aktion starten, wenn sich der Status des Alarms ändert.
Um einen Alarm aus einer PromQL-Abfrage heraus zu erstellen (Konsole) CloudWatch
-
Melden Sie sich bei der AWS-Managementkonsole an und öffnen Sie die CloudWatch -Konsole
. -
Wählen Sie im Navigationsbereich Query Studio aus.
-
Wählen Sie PromQL, geben Sie Ihre Abfrage ein, überprüfen Sie das Diagramm und wählen Sie dann die Schaltfläche Alarm erstellen.
Hinzufügen von HealthOmics Run-Metriken zu einem Dashboard CloudWatch
Sie können eine PromQL-Abfrage als Widget zu einem CloudWatch Dashboard hinzufügen, sodass Sie die HealthOmics Ressourcenauslastung zusammen mit Ihren anderen Metriken überwachen können.
Um HealthOmics Run-Metriken zu einem CloudWatch Dashboard (Konsole) CloudWatch hinzuzufügen
-
Melden Sie sich bei der AWS-Managementkonsole an und öffnen Sie die CloudWatch -Konsole
. -
Wählen Sie im Navigationsbereich Query Studio aus.
-
Wählen Sie PromQL, geben Sie Ihre Abfrage ein und überprüfen Sie dann das Diagramm.
-
Wählen Sie Aktion und dann Zum Dashboard hinzufügen aus.
-
Wählen Sie ein vorhandenes Dashboard aus oder erstellen Sie ein neues und speichern Sie dann das Widget.
Analysieren der Laufmetriken mit dem HealthOmics MCP-Server
Sie können den HealthOmics Model Context Protocol (MCP) -Server verwenden, um Laufmesswerte abzurufen und Lauffehler in mehreren Datendimensionen mithilfe eines KI-Modells zu untersuchen. Sie können den MCP-Server über Kiro CLI, Claude Code oder einen anderen MCP-compatible agentischen Client verwenden. Weitere Informationen finden Sie unter AWS HealthOmics MCP Server
Callouts
HealthOmics beginnt mit der Ausgabe von Run-Metriken, nachdem eine Aufgabe den
RUNNINGStatus erreicht hat, und stoppt die Ausgabe, wenn die Aufgabe den Status erreicht hat.COMPLETEDWeitere Informationen zum Aufgabenstatus finden Sie unterWerte für den Aufgabenstatus.Die ersten Datenpunkte erscheinen nach einer kurzen Verzögerung von etwa 30 Sekunden.
Für Aufgaben, die weniger als 30 Sekunden ausgeführt werden, gibt es möglicherweise keine Messwerte.
Wenn der Lauf den Speichertyp
aws.omics.run.filesystem.usagehatDYNAMIC, kann es zu einer Verzögerung von mehr als 30 Minuten kommen, sodass er für Läufe, die weniger als 30 Minuten dauern, möglicherweise nicht verfügbar ist.Wenn dies der
SHAREDFallscratchStorageModeist, istaws.omics.task.filesystem.scratch.storage.usagemöglicherweise nicht für Aufgaben verfügbar, die eine große Anzahl temporärer Dateien erstellen. HealthOmics misst die Nutzung in diesem Modus mit einem rekursiven Scan des temporären Verzeichnisses der Aufgabe, und der Scan wird nicht immer innerhalb des Zeitlimits abgeschlossen, wenn die Anzahl der Dateien hoch ist.Die CPU- und Speichermesswerte können von den Ausführungsmanifestwerten abweichen, da die beiden Messungen einen anderen Bereich verwenden. Die Ausführungsmetriken geben besser wieder, was Ihre Aufgabe tatsächlich verbraucht.
Ausführungsmetriken sind nur in dem AWS Konto verfügbar, dem die Servicerolle gehört und das den Lauf startet.
Fakturierung
AWS HealthOmics berechnet Ihnen keine Run-Metriken. Die Kennzahlen werden auf Amazon CloudWatch in Ihrem Konto veröffentlicht und die damit verbundenen Aktivitäten werden Ihnen direkt in CloudWatch Rechnung gestellt. Die Gebühren richten sich nach dem Umfang der aufgenommenen Metrikdaten. Preise in einer bestimmten AWS Region finden Sie unter CloudWatch Amazon-Preise
| Aktivität | Wie werden dir Gebühren berechnet |
|---|---|
| Veröffentlichung von OpenTelemetry Kennzahlen | Pro GB aufgenommener Daten. Beinhaltet 15 Monate Speicherplatz, ohne dass für die Speicherung oder die Anzahl der einzelnen metrischen Reihen eine gesonderte Gebühr anfällt. |
| Ausführen von PromQL-Abfragen in der CloudWatch Konsole, einschließlich Query Studio und Dashboards | Keine Gebühren. |
| Ausführen von PromQL-Abfragen mit den APIs CloudWatch | Pro Million gescannter Proben. |
| Alarme, die eine PromQL-Abfrage auswerten | Eine Standardalarmgebühr zuzüglich Abfragegebühren für die bei jeder Auswertung gescannten Proben. |
Abmeldung
Standardmäßig HealthOmics veröffentlicht Laufmetriken immer dann, wenn die Servicerolle für einen Lauf über die cloudwatch:PutMetricData entsprechende Berechtigung verfügt. Um sich abzumelden und zukünftige Gebühren zu stoppen, können Sie diese Berechtigung für die Servicerolle auf jeder Ausführungsebene weglassen. Um die Veröffentlichung auch dann zu beenden, wenn eine andere Richtlinie die Erlaubnis erteilt, fügen Sie der Rolle eine ausdrückliche Ablehnung hinzu:
{ "Version": "2012-10-17", "Statement": [ { "Effect": "Deny", "Action": "cloudwatch:PutMetricData", "Resource": "*" } ] }
Eine andere Möglichkeit, sich abzumelden, besteht darin, die Protokollierung für einen Lauf zu deaktivieren, indem Sie LogLevel
= OFF dies in der StartRun Anfrage angeben. Wenn Sie LogLevel diese Option festlegenOFF, werden HealthOmics keine Laufmetriken veröffentlicht.