本文為英文版的機器翻譯版本,如內容有任何歧義或不一致之處,概以英文版為準。
執行私有工作流程的指標
HealthOmics 會將您的執行和任務近乎即時的資源使用指標發佈至 Amazon CloudWatch。這些指標可讓您了解執行時執行的進度。您可以使用這些指標來:
在任務仍在執行時識別中央處理器 (CPU) 或圖形處理器 (GPU) 瓶頸。
在任務失敗之前偵測記憶體壓力或暫存儲存空間耗盡。
為您的工作流程調整適當大小的運算和儲存組態。
建置 CloudWatch 儀表板和警示,或與第三方可觀測性工具整合。
執行指標適用於私有和共用工作流程。
HealthOmics cloudwatch.aws/omics會在您自己的 CloudWatch 帳戶中的範圍下提供這些指標。
這些指標是使用 CloudWatch OpenTelemetry (OTel) 相容指標標準發出。這表示您可以將它們與 OTel 相容可觀測性工具以及原生 CloudWatch 儀表板和警示整合。使用 Prometheus 查詢語言 (PromQL) 查詢 OTel 指標,以檢視和分析資料。如需詳細資訊,請參閱 CloudWatch OpenTelemetry 指標。
區域可用性
執行指標適用於所有支援的 HealthOmics 區域,以色列 (特拉維夫) 區域 () 除外il-central-1。
啟用執行的指標
若要發佈這些指標,您用於執行的 AWS Identity and Access Management (IAM) 角色必須具有將指標寫入 CloudWatch 的許可。將下列許可新增至工作流程執行角色:
{ "Version": "2012-10-17", "Statement": [ { "Effect": "Allow", "Action": "cloudwatch:PutMetricData", "Resource": "*" } ] }
如需許可的詳細資訊,請參閱「的服務角色 AWS HealthOmics」。如需啟動執行的詳細資訊,請參閱 在 HealthOmics 中開始執行。
CloudWatch PutMetricData 配額
CloudWatch PutMetricData 預設配額為每秒 500 個請求 (每秒交易數)。此預設配額足以檢視最多 15,000 個並行 HealthOmics 任務的指標。若要檢視超過 15,000 個並行 HealthOmics 任務的指標,請請求提高 CloudWatch PutMetricData 配額的限制。如需詳細資訊,請參閱 CloudWatch 服務配額。
可用的指標
指標可用性
HealthOmics 會根據工作流程類型發出指標。不是每個工作流程都會發出每個指標。
下表列出 HealthOmics 為每次執行提供的指標。這些指標可在 CloudWatch Query Studio 中使用。單位遵循 OpenTelemetry 慣例: By 是位元組, {cpu} 是 vCPUs, {operation}是操作, % 是百分比。
| 指標名稱 | 說明 | 單位 | Type | Frequency (頻率) | 可用性 |
|---|---|---|---|---|---|
aws.omics.run.filesystem.usage |
在執行的共用檔案系統上使用的儲存體。 | By |
gauge |
30 秒 | 每次執行時。 |
aws.omics.run.filesystem.limit |
執行共用檔案系統的總容量。 | By |
gauge |
30 秒 | 僅適用於使用 執行儲存類型的STATIC執行。 |
aws.omics.task.cpu.usage |
工作流程任務使用的 vCPUs。 | {cpu} |
gauge |
30 秒 | 針對執行中的每個任務。 |
aws.omics.task.cpu.limit |
根據工作流程定義或預設值為工作流程任務保留的 vCPUs。 | {cpu} |
gauge |
30 秒 | 針對執行中的每個任務。 |
aws.omics.task.memory.usage |
工作流程任務使用的記憶體。 | By |
gauge |
30 秒 | 針對執行中的每個任務。 |
aws.omics.task.memory.limit |
為工作流程任務預留的記憶體。 | By |
gauge |
30 秒 | 針對執行中的每個任務。 |
aws.omics.task.network.io |
工作流程任務傳輸和接收的位元組數。依 network.io.direction(receive、) 分割transmit。 |
By |
sum |
30 秒 | 針對執行中的每個任務。 |
aws.omics.task.filesystem.io |
工作流程任務傳輸的檔案系統位元組數。依 filesystem.io.direction(read、) 分割write。 |
By |
sum |
30 秒 | 針對執行中的每個任務。 |
aws.omics.task.filesystem.operations |
工作流程任務執行的檔案系統操作數目。依 filesystem.io.direction(read、) 分割write。 |
{operation} |
sum |
30 秒 | 針對執行中的每個任務。 |
aws.omics.task.filesystem.scratch.storage.usage |
工作流程任務使用的抓取儲存體。 | By |
gauge |
30 秒 (LOCAL 模式) 或 20 分鐘 (SHARED 模式) |
針對執行中的每個任務。 |
aws.omics.task.filesystem.scratch.storage.limit |
工作流程任務可用的暫存儲存容量總計。 | By |
gauge |
30 秒 | 對於將 scratchStorageMode設定為 的執行中的每個任務LOCAL。 |
aws.omics.task.gpu.utilization |
工作流程任務的 GPU 使用率。每個 GPU 一個資料點,由 識別gpu.id。 |
% |
gauge |
30 秒 | 僅適用於使用 加速器的任務。 |
aws.omics.task.gpu.memory.usage |
工作流程任務使用的 GPU 記憶體。每個 GPU 一個資料點,由 識別gpu.id。 |
By |
gauge |
30 秒 | 僅適用於使用 加速器的任務。 |
aws.omics.task.gpu.memory.limit |
工作流程任務可用的 GPU 記憶體。每個 GPU 一個資料點,由 識別gpu.id。 |
By |
gauge |
30 秒 | 僅適用於使用 加速器的任務。 |
如需加速器的詳細資訊,請參閱 HealthOmics 工作流程定義中的任務資源。
如需暫時性儲存體的詳細資訊,請參閱 HealthOmics 工作流程任務的暫時性儲存。
共同 屬性
每個 HealthOmics 執行指標都有一組通用的資源標籤,用於識別資料點的來源。
| 標籤 | 說明 | 範例值 |
|---|---|---|
| 常見資源標籤 | ||
@resource.cloud.provider |
發佈指標的雲端提供者。 | aws |
@resource.cloud.account.id |
執行所屬 AWS 的帳戶。 | 123456789012 |
@resource.cloud.region |
執行所在的 AWS 區域。 | us-west-2 |
@resource.cloud.resource_id |
執行的 ARN。 | arn:aws:omics:us-west-2:123456789012:run/1234567 |
@resource.service.name |
發佈指標的服務。 | omics |
@resource.aws.omics.workflow.id |
執行所使用的工作流程 ID。 | 1122334 |
@resource.aws.omics.run.id |
執行的 ID。 | 1234567 |
@resource.aws.omics.storage.type |
執行儲存體類型。 | DYNAMIC |
| 任務資源標籤 | ||
@resource.aws.omics.task.id |
資料點的目標任務 ID。只有aws.omics.task.*指標具有此標籤。 |
1245938 |
其他屬性
有些執行指標會攜帶額外的資料點屬性,將指標分割成不同的時間序列。您可以使用這些屬性來篩選 PromQL 查詢。
| 其他屬性 | 指標 | 說明 | 值 |
|---|---|---|---|
gpu.id |
aws.omics.task.gpu.utilization, aws.omics.task.gpu.memory.usage, aws.omics.task.gpu.memory.limit |
執行個體上 GPU 的零類型索引。 | 0、2、 1或 3 |
scratch.storage.mode |
aws.omics.task.filesystem.scratch.storage.usage, aws.omics.task.filesystem.scratch.storage.limit |
根據有效的 ,任務寫入其暫存資料的位置scratchStorageMode。 |
LOCAL 或 SHARED |
network.io.direction |
aws.omics.task.network.io |
網路傳輸的方向。 | receive 或 transmit |
filesystem.io.direction |
aws.omics.task.filesystem.io, aws.omics.task.filesystem.operations |
檔案系統操作的方向。 | read 或 write |
查詢 HealthOmics 執行指標
您可以在查詢 Studio 中執行 PromQL 查詢,以在 CloudWatch 主控台中檢視 HealthOmics 執行指標。
檢視 HealthOmics 執行指標 (CloudWatch 主控台)
-
確認您的執行從
cloudwatch:PutMetricData許可開始。 -
登入 AWS 管理主控台並開啟 CloudWatch 主控台
。 -
在導覽窗格中,選擇查詢 Studio。
-
在查詢編輯器中,從下拉式清單中選擇 PromQL。
-
在建置器模式中,瀏覽並選取指標名稱及其標籤。或者,在編輯器模式中,輸入 PromQL 查詢。
-
使用時間範圍選擇器選擇時間範圍。
-
選擇執行,將結果顯示為時間序列圖表。若要變更圖形的顯示方式,請選擇自訂。
例如,下列查詢會傳回執行中每個任務正在使用的 vCPUs。以您要檢查的執行 ID 取代 runID。
{"aws.omics.task.cpu.usage", "@resource.aws.omics.run.id"="runID"}
若要使用其執行 ID 和任務 ID 標記每個時間序列,您可以選擇自訂標籤並輸入以下內容。
{@resource.aws.omics.run.id="${@resource.aws.omics.run.id}",@resource.aws.omics.task.id="${@resource.aws.omics.task.id}"}
查詢 HealthOmics 執行指標 (API)
CloudWatch 提供 Prometheus 相容 APIs 和端點,用於查詢指標資料。如需使用這些 APIs 查詢指標的詳細資訊,請參閱 Prometheus 相容 APIs。
使用 CloudWatch 建立警示
您可以從 PromQL 查詢建立 CloudWatch 警示,以便 CloudWatch 在指標超過閾值時通知您。警示可以傳送通知至 Amazon Simple Notification Service (Amazon SNS) 主題,也可以在警示變更狀態時啟動另一個動作。
從 PromQL 查詢建立警示 (CloudWatch 主控台)
-
登入 AWS 管理主控台並開啟 CloudWatch 主控台
。 -
在導覽窗格中,選擇查詢 Studio。
-
選擇 PromQL,輸入您的查詢,驗證圖形,然後選擇建立警示按鈕。
將 HealthOmics 執行指標新增至 CloudWatch 儀表板
您可以將 PromQL 查詢新增至 CloudWatch 儀表板做為小工具,以便與其他指標一起監控 HealthOmics 資源使用率。
將 HealthOmics 執行指標新增至 CloudWatch 儀表板 (CloudWatch 主控台)
-
登入 AWS 管理主控台並開啟 CloudWatch 主控台
。 -
在導覽窗格中,選擇查詢 Studio。
-
選擇 PromQL,輸入您的查詢,然後驗證圖形。
-
選擇動作,然後選擇新增至儀表板。
-
選擇現有的儀表板或建立新的儀表板,然後儲存小工具。
使用 HealthOmics MCP 伺服器分析執行指標
您可以使用 HealthOmics Model Context Protocol (MCP) 伺服器來擷取執行指標,並在 AI 模型的協助下調查跨多個資料維度的執行失敗。您可以透過 Kiro CLI、Claude Code 或任何其他 MCP 相容代理用戶端使用 MCP 伺服器。如需詳細資訊,請參閱 AWS HealthOmics MCP Server
標註
HealthOmics 會在任務達到
RUNNING狀態後開始發出執行指標,並在任務達到COMPLETED狀態後停止發出它們。如需任務狀態的詳細資訊,請參閱 任務狀態值。第一個資料點會在短暫延遲約 30 秒後出現。
執行時間少於 30 秒的任務可能沒有指標。
當執行的儲存類型為
DYNAMIC時,aws.omics.run.filesystem.usage可能會遇到超過 30 分鐘的延遲,因此可能無法用於花費不到 30 分鐘的執行。當
scratchStorageMode為 時SHARED,aws.omics.task.filesystem.scratch.storage.usage可能無法用於建立大量暫存檔案的任務。HealthOmics 會使用任務暫存目錄的遞迴掃描來測量此模式中的使用情況,而且當檔案計數很高時,掃描不一定會在其時間限制內完成。CPU 和記憶體指標可能與執行資訊清單值不同,因為兩個測量使用不同的範圍。執行指標更緊密地反映您的任務實際使用的內容。
執行指標僅適用於擁有服務角色並開始執行的 AWS 帳戶。
帳單
AWS HealthOmics 不會向您收取執行指標的費用。指標會發佈至您帳戶中的 Amazon CloudWatch,CloudWatch 會直接向您收取相關活動的費用。費用是根據擷取的指標資料量而定。如需特定 AWS 區域中的價格,請參閱 Amazon CloudWatch 定價
| 活動 | 如何向您收取費用 |
|---|---|
| 發佈 OpenTelemetry 指標 | 擷取的資料每 GB。包含 15 個月的儲存,不另外收取儲存或唯一指標序列數量的費用。 |
| 在 CloudWatch 主控台中執行 PromQL 查詢,包括 Query Studio 和儀表板 | 免費。 |
| 使用 CloudWatch APIs執行 PromQL 查詢 | 掃描的每百萬個樣本。 |
| 評估 PromQL 查詢的警示 | 標準警示費用,加上每次評估時掃描之範例的查詢費用。 |
選擇不接收
根據預設,只要執行的服務角色具有 cloudwatch:PutMetricData許可,HealthOmics 就會發佈執行指標。若要選擇退出並停止未來費用,您可以在每個執行層級從服務角色省略此許可。若要在另一個政策授予許可時停止發佈,請將明確拒絕新增至角色:
{ "Version": "2012-10-17", "Statement": [ { "Effect": "Deny", "Action": "cloudwatch:PutMetricData", "Resource": "*" } ] }
選擇退出的另一種方法是透過在StartRun請求LogLevel = OFF中設定 關閉執行的記錄。當您將 LogLevel設定為 時OFF,HealthOmics 不會發佈執行指標。