View a markdown version of this page

CloudWatch SageMaker KI-Einblicke - Amazon CloudWatch

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

CloudWatch SageMaker KI-Einblicke

Verwenden Sie CloudWatch SageMaker AI Insights, um KI-Inferenzendpunkte im großen Maßstab zu überwachen und Fehler zu beheben SageMaker . Das Dashboard zeigt kuratierte Metriken und Visualisierungen in drei Ansichten — Leistung, Kapazität und Zuverlässigkeit — an, sodass Sie Probleme schnell identifizieren, die Ressourcenauslastung optimieren und eine hohe Verfügbarkeit auf allen Ihren Endpunkten sicherstellen können.

SageMaker AI Insights unterstützt die Überwachung aller Endpunkttypen (Einzelmodell-Endpunkte und auf Inferenzkomponenten (IC) basierende Endpunkte) und Inferenz-Frameworks (vLLM, sGLang, TensorRT‐LLM).

Informationen SageMaker zu den ersten Schritten mit AI Insights finden Sie in den folgenden Themen.

Die wichtigsten Funktionen

  • OpenTelemetry‐native Sammlung. Metriken werden mit einem OTel Collector erfasst, der Prometheus-Endpunkte aus DCGM (GPU-Metriken), Node-Exportern (CPU, Speicher, Festplatte) und Inferenz-Framework-Containern (vLLM, sGLang) entfernt.

  • Umfangreiche dimensionale Beschriftungen. Jede Metrik enthält Beschriftungen wie aws.sagemaker.endpoint.name aws.sagemaker.inference_component.name@resource.host.id,@resource.cloud.availability_zone, und@resource.host.type.

  • Zuordnung pro GPU. GPU-Metriken (DCGM) beinhalten die Attribution pro Inferenzkomponente für Instanzen mit mehreren Mandanten.

  • Metriken des Inferenz-Frameworks. Native vLLM- und sLang-Metriken — Tokens pro Sekunde, Time to First Token (TTFT), Inter-Token-Latenz, KV-Cache-Auslastung, Warteschlangentiefe, Batchgröße — ohne benutzerdefinierte Instrumentierung.

  • Unterstützung für PromQL-Abfragen. Fragen Sie in CloudWatch, CloudWatch Query Studio oder Amazon Managed Grafana ab.

  • Konfigurierbare Scrape-Frequenz. Bis MetricPublishFrequencyInSeconds (10, 30, 60, 120, 180, 240 oder 300 Sekunden; Standard 60). Die Metriken der Kontrollebene sind ereignisgesteuert.

Architektur und Datenfluss

  1. Der Modellcontainer, der DCGM-Exporter und der Node-Exporter stellen Prometheus kompatible Metriken auf der Instance zur Verfügung.

  2. Der OTel Collector scannt diese Endpunkte und reichert jede Metrik mit Labels an (Endpunktname, IC-Name, Instanz-ID, AZ).

  3. Angereicherte Metriken werden über OTLP nach exportiert. CloudWatch

  4. Metriken können über PromQL in abgefragt werden. CloudWatch

┌─────────────────────────────────────────────────────────────────┐ │ SageMaker Endpoint Instance │ │ │ │ ┌──────────────┐ ┌──────────────┐ ┌──────────────────────┐ │ │ │ Model │ │ DCGM │ │ Node Exporter │ │ │ │ Container │ │ Exporter │ │ (CPU/Mem/Disk) │ │ │ │ (vLLM/SGLang)│ │ (GPU) │ │ │ │ │ └──────┬───────┘ └──────┬───────┘ └──────────┬───────────┘ │ │ │ │ │ │ │ └─────────────────┼─────────────────────┘ │ │ ▼ │ │ ┌─────────────────────────┐ │ │ │ OTel Collector │ │ │ │ (scrape + enrich) │ │ │ └────────────┬────────────┘ │ └───────────────────────────┼───────────────────────────────────────┘ │ OTLP ▼ ┌─────────────────────────┐ │ Amazon CloudWatch │ │ (PromQL-queryable) │ └─────────────────────────┘

So greift man zu

Sie können SageMaker AI Insights von der SageMaker AI-Konsole aus öffnen, indem Sie einen der folgenden Pfade verwenden.

Quelle Action Ziel
SageMaker KI-Konsole → Liste der Endpunkte Wählen Sie „ SageMaker AI Insights öffnen“ Dashboard auf Flottenebene (kein Filter)
SageMaker AI-Konsole → Endpunkt-Detailseite Wählen Sie In SageMaker AI Insights anzeigen Das Dashboard wurde auf diesen Endpunkt gefiltert
SageMaker AI-Konsole → Registerkarte IC → Per‐IC-Reihe Wählen Sie Metriken Das Dashboard wurde nach Endpunkt und Inferenzkomponente gefiltert

Sie können auch direkt durch die CloudWatch Konsole navigieren, indem Sie Infrastrukturüberwachung SageMaker AI Insights wählen.

Voraussetzungen

  • Mindestens ein SageMaker KI-Inferenzendpunkt im Status InService

  • EnableDetailedObservabilityin der Endpunktkonfiguration true auf gesetzt (Standard für neue Endpunkte)

  • Die OTel-Anreicherung ist in Ihrem Konto aktiviert

  • Die cloudwatch:GetMetricData und cloudwatch:ListMetrics IAM-Berechtigungen

Weitere Informationen finden Sie unter Erste Schritte mit CloudWatch SageMaker AI Insights.

Preisgestaltung

CloudWatch OpenTelemetry Es gilt die Erfassung von Metriken. Weitere Informationen finden Sie unter CloudWatch Amazon-Preise.