翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。
Ray メトリクスリファレンス
SageMaker HyperPod Observability アドオンは、Ray がエクスポートするメトリクスを収集します。Ray メトリクスは追加、名前変更、削除されないため、メトリクス名とラベルはオープンソース Ray と一致します。
以下のセクションでは、プロビジョニングされた各ダッシュボードがカバーするメトリクスグループを一覧表示します。個々のメトリクス名、定義、タイプについては、Ray ドキュメントの「Ray システムメトリクス
Ray Core メトリクス
Ray Core ダッシュボードは、システムレベルの Ray 状態と、クラスターが実行されるハードウェアを、これらのグループ全体でカバーします。
タスク、アクター、プレイスメントグループ
クラスターリソースとオブジェクトストア
ノードハードウェアと OS
コンポーネントあたりの使用量
Autoscaler の状態
Ray Data メトリクス
Ray Data ダッシュボードは、データセットのスループット、タスクのライフサイクル、反復、メモリ負荷をこれらのグループ全体でカバーします。
行、バイト、ブロック
タスク数とライフサイクル
その他の演算子カウンター
イテレーション
オブジェクトストアとメモリの予算
クラスターの使用率と予算
Ray Train メトリクス
Ray Train ダッシュボードは、トレーニングの実行とワーカーの状態、チェックポイント、ノードハードウェアをこれらのグループ全体でカバーします。
実行とワーカーの状態
チェックポイントとレポート
ノードハードウェアと OS
Ray Serve メトリクス
Ray Serve ダッシュボードは、これらのグループ全体のリクエストレート、レイテンシー、エラー、レプリカの状態をカバーします。
リクエストとレイテンシー
エラーとキューイング
レプリカとコントローラーのヘルス
ノードハードウェアとクラスターの状態
クエリ用のラベル
メトリクスは Amazon Managed Service for Prometheus にあるため、Grafana の外部でクエリを実行できます。コレクターは cluster_name、cluster_id、および を追加しますnamespace。Ray は、Ray クラスターを識別しray_io_cluster、ダッシュボードがピボットするラベルである を追加します。
これらのメトリクスの視覚化の詳細については、「」を参照してくださいRay Grafana ダッシュボード。