Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
SageMaker HyperPod Cluster-Metriken
Amazon SageMaker HyperPod (SageMaker HyperPod) veröffentlicht verschiedene Metriken in 9 verschiedenen Kategorien in Ihrem Amazon Managed Service for Prometheus-Workspace. Nicht alle Metriken sind standardmäßig aktiviert oder werden in Ihrem Workspace in Amazon Managed Grafana angezeigt. Die folgende Tabelle zeigt, welche Metriken standardmäßig aktiviert sind, wenn Sie das Observability-Add-on installieren, welche Kategorien zusätzliche Metriken haben, die für detailliertere Clusterinformationen aktiviert werden können, und wo sie im Amazon Managed Grafana-Arbeitsbereich angezeigt werden.
| Metrik-Kategorie | Standardmäßig aktiviert? | Zusätzliche erweiterte Metriken verfügbar? | Verfügbar unter welchen Grafana-Dashboards? |
|---|---|---|---|
| Trainingsmetriken | Ja | Ja | Training |
| Inferenzmetriken | Ja | Nein | Inferenz |
| Kennzahlen zur Aufgaben-Governance | Nein | Ja | Keine. Fragen Sie Ihren Workspace in Amazon Managed Service für Prometheus ab, um Ihr eigenes Dashboard zu erstellen. |
| Skalierungsmetriken | Nein | Ja | Keine. Fragen Sie Ihren Workspace in Amazon Managed Service für Prometheus ab, um Ihr eigenes Dashboard zu erstellen. |
| Cluster-Metriken | Ja | Ja | Cluster |
| Instance-Metriken | Ja | Ja | Cluster |
| Beschleunigte Rechenmetriken | Ja | Ja | Aufgabe, Cluster |
| Netzwerkmetriken | Nein | Ja | Cluster |
| Dateisystem | Ja | Nein | Dateisystem |
In den folgenden Tabellen werden die für die Überwachung Ihres SageMaker HyperPod Clusters verfügbaren Metriken beschrieben, sortiert nach Kategorien.
Verfügbarkeit von Metriken in eingeschränkten Instanzgruppen
Wenn Ihr Cluster eingeschränkte Instanzgruppen enthält, sind die meisten Metrikkategorien auf eingeschränkten Knoten verfügbar, mit den folgenden Ausnahmen und Überlegungen. Sie können auch Warnmeldungen für jede Metrik Ihrer Wahl einrichten.
| Metrik-Kategorie | Verfügbar auf RIG-Knoten? | Hinweise |
|---|---|---|
| Trainingsmetriken | Ja | Kubeflow- und Kubernetes-Pod-Metriken werden erfasst. KPI-Metriken für Fortgeschrittene (vom Training Metrics Agent) sind auf den RIG-Knoten nicht verfügbar. |
| Inferenzmetriken | Nein | Inferenz-Workloads werden in eingeschränkten Instanzgruppen nicht unterstützt. |
| Kennzahlen zur Aufgaben-Governance | Nein | Warteschlangen-Metriken werden nur von den Standardknoten erfasst, sofern vorhanden. |
| Skalierungsmetriken | Nein | KEDA-Metriken werden nur von den Standardknoten erfasst, sofern vorhanden. |
| Cluster-Metriken | Ja | Kube State Metrics und API-Server-Metriken sind verfügbar. Kube State Metrics wird bevorzugt auf Standardknoten geplant, kann aber auf eingeschränkten Knoten in Clustern ausgeführt werden. RIG-only |
| Instance-Metriken | Ja | Node Exporter- und CAdvisor-Metriken werden auf allen Knoten erfasst, einschließlich eingeschränkter Knoten. |
| Beschleunigte Rechenmetriken | Ja | DCGM Exporter läuft auf eingeschränkten Knoten. GPU-enabled Neuron Monitor läuft auf Neuron-enabled eingeschränkten Knoten, wenn der erweiterte Modus aktiviert ist. |
| Netzwerkmetriken | Ja | EFA Exporter läuft auf EFA-enabled eingeschränkten Knoten, wenn der erweiterte Modus aktiviert ist. |
| Metriken für das Dateisystem | Ja | Die Nutzungsmetriken für FSx for Lustre-Cluster werden in eingeschränkten Instanzgruppen unterstützt. |
Anmerkung
Die Erfassung von Container-Protokollen mit Fluent Bit wird auf eingeschränkten Knoten nicht bereitgestellt. Cluster-Logs von eingeschränkten Knoten sind unabhängig vom SageMaker HyperPod Observability-Add-on über die Plattform verfügbar. Sie können diese Protokolle im Cluster Logs-Dashboard einsehen.
Trainingsmetriken
Verwenden Sie diese Metriken, um die Leistung der auf dem SageMaker HyperPod Cluster ausgeführten Trainingsaufgaben zu verfolgen.
| Metrikname oder -typ | Description | Standardmäßig aktiviert? | Quelle der Metrik |
|---|---|---|---|
| Kubeflow-Metriken | https://github.com/kubeflow/trainer |
Ja | Kubeflow |
| Kubernetes-Pod-Metriken | https://github.com/kubernetes/kube-state-metrics |
Ja | Kubernetes |
training_uptime_percentage |
Prozentualer Anteil der Trainingszeit an der Gesamtfenstergröße | Nein | SageMaker HyperPod Bediener schulen |
training_manual_recovery_count |
Gesamtzahl der während des Jobs durchgeführten manuellen Neustarts | Nein | SageMaker HyperPod Bedienungspersonal schulen |
training_manual_downtime_ms |
Gesamtzeit in Millisekunden, in der der Job aufgrund manueller Eingriffe ausgefallen war | Nein | SageMaker HyperPod Bedienungspersonal schulen |
training_auto_recovery_count |
Gesamtzahl der automatischen Wiederherstellungen | Nein | SageMaker HyperPod Bedienungspersonal schulen |
training_auto_recovery_downtime |
Gesamter Infrastruktur-Overhead in Millisekunden während der Fehlerbehebung | Nein | SageMaker HyperPod Bedienungspersonal schulen |
training_fault_count |
Gesamtzahl der während des Trainings aufgetretenen Fehler | Nein | SageMaker HyperPod Bedienungspersonal schulen |
training_fault_type_count |
Verteilung der Fehler nach Typ | Nein | SageMaker HyperPod Bedienungspersonal schulen |
training_fault_recovery_time_ms |
Wiederherstellungszeit in Millisekunden für jeden Fehlertyp | Nein | SageMaker HyperPod Schulung des Bedieners |
training_time_ms |
Gesamtzeit in Millisekunden, die für das tatsächliche Training aufgewendet wurde | Nein | SageMaker HyperPod Bedienungspersonal schulen |
Inferenzmetriken
Verwenden Sie diese Metriken, um die Leistung von Inferenzaufgaben auf dem SageMaker HyperPod Cluster zu verfolgen.
| Metrikname oder -typ | Description | Standardmäßig aktiviert? | Quelle der Metrik |
|---|---|---|---|
model_invocations_total |
Gesamtzahl der Aufruf-Anforderungen an das Modell | Ja | SageMaker HyperPod Inferenzoperator |
model_errors_total |
Gesamtzahl der Fehler beim Modellaufruf | Ja | SageMaker HyperPod Inferenzoperator |
model_concurrent_requests |
Aktive gleichzeitige Modellanfragen | Ja | SageMaker HyperPod Inferenzoperator |
model_latency_milliseconds |
Modellieren einer Latenz für Aufrufe in Millisekunden | Ja | SageMaker HyperPod Inferenzoperator |
model_ttfb_milliseconds |
Modellieren Sie die Latenz von der Zeit bis zum ersten Byte in Millisekunden | Ja | SageMaker HyperPod Inferenzoperator |
| TGI | Diese Metriken können verwendet werden, um die Leistung von TGI zu überwachen, die Bereitstellung automatisch zu skalieren und um Engpässe zu identifizieren. Eine ausführliche Liste der Metriken finden Sie unter https://github.com/deepjavalibrary/djl-serving/blob/master/prometheus/README.md |
Ja | Modellcontainer |
| LMI | Diese Metriken können verwendet werden, um die Leistung von LMI zu überwachen und Engpässe zu identifizieren. Eine ausführliche Liste der Metriken finden Sie unter https://github.com/deepjavalibrary/djl-serving/blob/master/prometheus/README.md |
Ja | Modellcontainer |
Kennzahlen zur Aufgaben-Governance
Verwenden Sie diese Metriken, um die Aufgabensteuerung und die Ressourcenzuweisung im SageMaker HyperPod Cluster zu überwachen.
| Metrikname oder -typ | Description | Standardmäßig aktiviert? | Quelle der Metrik |
|---|---|---|---|
| Warteschlange | Siehe https://kueue.sigs.k8s.io/docs/reference/metrics/ |
Nein | Warteschlange |
Skalierungsmetriken
Verwenden Sie diese Metriken, um das Verhalten und die Leistung der automatischen Skalierung auf dem SageMaker HyperPod Cluster zu überwachen.
| Metrikname oder -typ | Description | Standardmäßig aktiviert? | Quelle der Metrik |
|---|---|---|---|
| KEDA-Operator-Metriken | Siehe https://keda.sh/docs/2.17/integrations/prometheus/ #operator |
Nein | Kubernetes Event-driven Autoscaler (KEDA) |
| KEDA-Webhook-Metriken | Siehe https://keda.sh/docs/2.17/integrations/prometheus/ #admission |
Nein | Kubernetes Event-driven Autoscaler (KEDA) |
| KEDA-Metrik-Server Metriken | Siehe https://keda.sh/docs/2.17/integrations/prometheus/ #metrics |
Nein | Kubernetes Event-driven Autoscaler (KEDA) |
Cluster-Metriken
Verwenden Sie diese Metriken, um den Gesamtzustand des Clusters und die Ressourcenzuweisung zu überwachen.
| Metrikname oder -typ | Description | Standardmäßig aktiviert? | Quelle der Metrik |
|---|---|---|---|
| Cluster-Zustand | Metriken für Kubernetes-API-Server. Siehe https://kubernetes.io/docs/reference/instrumentation/metrics/ |
Ja | Kubernetes |
| Kubestate | Siehe https://github.com/kubernetes/kube-state-metrics/tree/main/docs #default -resources. |
Begrenzt | Kubernetes |
| KubeState Fortgeschritten | Siehe https://github.com/kubernetes/kube-state-metrics/tree/main/docs #optional -resources |
Nein | Kubernetes |
Instance-Metriken
Verwenden Sie diese Metriken, um die Leistung und den Zustand einzelner Instances zu überwachen.
| Metrikname oder -typ | Description | Standardmäßig aktiviert? | Quelle der Metrik |
|---|---|---|---|
| Knoten-Metriken | Siehst du? https://github.com/prometheus/node_exporter tab=readme-ov-file #enabled -standardmäßig. |
Ja | Kubernetes |
| Containermetriken | Von Cadvisor veröffentlichte Container-Metriken. Siehe https://github.com/google/cadvisor |
Ja | Kubernetes |
Beschleunigte Rechenmetriken
Verwenden Sie diese Metriken, um die Leistung, den Zustand und die Auslastung einzelner Accelerated Computing-Geräte in Ihrem Cluster zu überwachen.
Anmerkung
Wenn die GPU-Partitionierung mit MIG (Multi-Instance GPU) in Ihrem Cluster aktiviert ist, bieten DCGM-Metriken automatisch Granularität auf Partitionsebene für die Überwachung einzelner MIG-Instances. Jede MIG-Partition wird als separates GPU-Gerät mit eigenen Messwerten für Temperatur, Leistung, Speicherauslastung und Rechenaktivität bereitgestellt. Auf diese Weise können Sie die Ressourcennutzung und den Zustand jeder GPU-Partition unabhängig verfolgen und so eine präzise Überwachung der Workloads ermöglichen, die auf Bruchteilen der GPU-Ressourcen ausgeführt werden. Weitere Informationen zur Konfiguration der GPU-Partitionierung finden Sie unter. Verwendung von GPU-Partitionen in Amazon SageMaker HyperPod
| Metrikname oder -typ | Description | Standardmäßig aktiviert? | Quelle der Metrik |
|---|---|---|---|
| NVIDIA-GPU | DCGM-Metriken. Siehe https://github.com/NVIDIA/dcgm-exporter/blob/main/etc/dcp-metrics-included.csv |
Begrenzt |
NVIDIA-GPU-Manager für Rechenzentren (DCGM) |
|
NVIDIA-GPU (fortgeschritten) |
DCGM-Metriken, die in der folgenden CSV-Datei auskommentiert sind: https://github.com/NVIDIA/dcgm-exporter/blob/main/etc/dcp-metrics-included.csv |
Nein |
NVIDIA-GPU-Manager für Rechenzentren (DCGM) |
| AWS Trainium | Neuronenmetriken. Siehe https://awsdocs-neuron.readthedocs-hosted.com/en/latest/tools/neuron-sys-tools/neuron-monitor-user-guide.html #neuron -monitor-nc-counters. |
Nein | AWS Neuronen-Monitor |
Netzwerkmetriken
Verwenden Sie diese Metriken für die Überwachung der Leistung und des Zustands der Elastic Fabric Adapter (EFA) in Ihrem Cluster.
| Metrikname oder -typ | Description | Standardmäßig aktiviert? | Quelle der Metrik |
|---|---|---|---|
| EFA | Siehe https://github.com/aws-samples/awsome-distributed-training/blob/main/4.validation_and_observability/3.efa-node-exporter/README.md |
Nein | Elastic Fabric Adapter |
Metriken für das Dateisystem
| Metrikname oder -typ | Description | Standardmäßig aktiviert? | Quelle der Metrik |
|---|---|---|---|
| Dateisystem | Amazon FSx for Lustre-Metriken von Amazon: CloudWatch | Ja | Amazon FSx für Lustre |