View a markdown version of this page

Referenz zu Ray-Metriken - Amazon SageMaker KI

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Referenz zu Ray-Metriken

Das SageMaker HyperPod Observability-Add-on sammelt die Metriken, die Ray exportiert. Wir fügen Ray-Metriken nicht hinzu, benennen sie nicht um oder entfernen sie nicht, daher entsprechen die Namen und Bezeichnungen der Metriken dem Open-Source-Programm Ray.

In den folgenden Abschnitten sind die Metrikgruppen aufgeführt, die jedes bereitgestellte Dashboard abdeckt. Die Namen, Definitionen und Typen der einzelnen Metriken finden Sie unter Ray-Systemmetriken in der Ray-Dokumentation.

Ray Core-Metriken

Das Ray Core-Dashboard deckt den Ray-Status auf Systemebene und die Hardware, auf der der Cluster läuft, in den folgenden Gruppen ab:

  • Aufgaben, Akteure und Vermittlungsgruppen

  • Cluster-Ressourcen und Objektspeicher

  • Knotenhardware und Betriebssystem

  • Per-component Nutzung

  • Autoscaler-Status

Ray Data-Metriken

Das Ray Data-Dashboard deckt den Datendurchsatz, den Aufgabenlebenszyklus, die Iteration und den Speicherbedarf in den folgenden Gruppen ab:

  • Zeilen, Bytes und Blöcke

  • Anzahl und Lebenszyklus der Aufgaben

  • Zähler für andere Operatoren

  • Iteration

  • Objektspeicher und Speicherbudget

  • Cluster-Auslastung und Budgets

Ray Train-Metriken

Das Ray Train-Dashboard deckt die folgenden Gruppen ab: Trainingslauf und Worker-Status, Checkpoints und Node-Hardware:

  • Run- und Worker-Status

  • Checkpoints und Berichterstattung

  • Node-Hardware und Betriebssystem

Ray Server-Metriken

Das Ray Serve-Dashboard deckt Anforderungsrate, Latenz, Fehler und den Zustand der Replikate in den folgenden Gruppen ab:

  • Anfragen und Latenz

  • Fehler und Warteschlangen

  • Zustand von Replikat und Controller

  • Knotenhardware und Clusterstatus

Beschriftungen für Abfragen

Metriken landen in Amazon Managed Service für Prometheus, sodass Sie sie außerhalb von Grafana abfragen können. Der Collector fügtcluster_name, und cluster_id hinzu. namespace Ray fügt hinzuray_io_cluster, was den Ray-Cluster identifiziert und die Bezeichnung ist, auf der die Dashboards gedreht werden.

Weitere Informationen zur Visualisierung dieser Metriken finden Sie unter. Ray Grafana-Dashboards