View a markdown version of this page

Ray メトリクスリファレンス - Amazon SageMaker AI

翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。

Ray メトリクスリファレンス

SageMaker HyperPod Observability アドオンは、Ray がエクスポートするメトリクスを収集します。Ray メトリクスは追加、名前変更、削除されないため、メトリクス名とラベルはオープンソース Ray と一致します。

以下のセクションでは、プロビジョニングされた各ダッシュボードがカバーするメトリクスグループを一覧表示します。個々のメトリクス名、定義、タイプについては、Ray ドキュメントの「Ray システムメトリクス」を参照してください。

Ray Core メトリクス

Ray Core ダッシュボードは、システムレベルの Ray 状態と、クラスターが実行されるハードウェアを、これらのグループ全体でカバーします。

  • タスク、アクター、プレイスメントグループ

  • クラスターリソースとオブジェクトストア

  • ノードハードウェアと OS

  • コンポーネントあたりの使用量

  • Autoscaler の状態

Ray Data メトリクス

Ray Data ダッシュボードは、データセットのスループット、タスクのライフサイクル、反復、メモリ負荷をこれらのグループ全体でカバーします。

  • 行、バイト、ブロック

  • タスク数とライフサイクル

  • その他の演算子カウンター

  • イテレーション

  • オブジェクトストアとメモリの予算

  • クラスターの使用率と予算

Ray Train メトリクス

Ray Train ダッシュボードは、トレーニングの実行とワーカーの状態、チェックポイント、ノードハードウェアをこれらのグループ全体でカバーします。

  • 実行とワーカーの状態

  • チェックポイントとレポート

  • ノードハードウェアと OS

Ray Serve メトリクス

Ray Serve ダッシュボードは、これらのグループ全体のリクエストレート、レイテンシー、エラー、レプリカの状態をカバーします。

  • リクエストとレイテンシー

  • エラーとキューイング

  • レプリカとコントローラーのヘルス

  • ノードハードウェアとクラスターの状態

クエリ用のラベル

メトリクスは Amazon Managed Service for Prometheus にあるため、Grafana の外部でクエリを実行できます。コレクターは cluster_name、cluster_id、および を追加しますnamespace。Ray は、Ray クラスターを識別しray_io_cluster、ダッシュボードがピボットするラベルである を追加します。

これらのメトリクスの視覚化の詳細については、「」を参照してくださいRay Grafana ダッシュボード。