Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Profilieren und optimieren Sie die Rechenleistung
Anmerkung
Hinweis zum Ende des Supports: Am 30. Juni 2027 AWS wird der Support für Amazon Profiler eingestellt. SageMaker Nach dem 30. Juni 2027 können Sie nicht mehr auf die Profiler-Konsole oder die Profiler-Ressourcen zugreifen. Weitere Informationen finden Sie unter Änderung der Profiler-Verfügbarkeit.
Beim Trainieren hochmoderner Deep-Learning-Modelle, die schnell an Größe zunehmen, wird es zu einer Herausforderung, den Trainingsauftrag solcher Modelle auf einen großen GPU-Cluster zu skalieren und Probleme mit der Rechenleistung bei Milliarden und Billionen von Vorgängen und Kommunikationsvorgängen in jeder Iteration des Gradientenabstiegs zu identifizieren.
SageMaker KI bietet Profiling-Tools zur Visualisierung und Diagnose solch komplexer Rechenprobleme, die sich aus der Ausführung von Trainingsjobs auf Cloud-Computing-Ressourcen ergeben. AWS SageMaker KI bietet zwei Profilerstellungsoptionen: Amazon SageMaker Profiler und einen Monitor für die Ressourcennutzung in Amazon Studio Classic. SageMaker Sehen Sie sich die folgenden Einführungen der beiden Funktionen an, um einen schnellen Einblick zu erhalten und zu erfahren, welche Sie je nach Ihren Bedürfnissen verwenden sollten.
Amazon Profiler SageMaker
Amazon SageMaker Profiler ist eine SageMaker KI-Profilierungsfunktion, mit der Sie tief in die Rechenressourcen eintauchen können, die Ihnen beim Training von Deep-Learning-Modellen zur Verfügung gestellt wurden, und Einblicke in Details auf Betriebsebene erhalten. SageMaker Profiler stellt Python-Module bereit, mit denen Sie Anmerkungen zu allen PyTorch Trainings-Skripten hinzufügen und den Profiler aktivieren können. TensorFlow SageMaker Sie können über das SageMaker Python-SDK und die AWS Deep Learning-Container auf die Module zugreifen.
Mit SageMaker Profiler können Sie alle Aktivitäten auf CPUs und GPUs verfolgen, z. B. die CPU- und GPU-Auslastung, Kernelausführungen auf GPUs, Kernelstarts auf CPUs, Synchronisierungsvorgänge, Speicheroperationen zwischen CPUs und GPUs, Latenzen zwischen Kernelstarts und entsprechenden Ausführungen sowie die Datenübertragung zwischen CPUs und GPUs.
SageMaker Profiler bietet auch eine Benutzeroberfläche (UI), die das Profil visualisiert, eine statistische Zusammenfassung der profilierten Ereignisse und den Zeitplan eines Trainingsauftrags, um das Zeitverhältnis der Ereignisse zwischen GPUs und CPUs zu verfolgen und zu verstehen.
Weitere Informationen zu Profiler finden Sie unter. SageMaker SageMaker Amazon-Profiler
Überwachung der AWS Rechenressourcen in Amazon SageMaker Studio Classic
SageMaker AI bietet in Studio Classic auch eine Benutzeroberfläche für die Überwachung der Ressourcenauslastung auf hoher Ebene, allerdings mit größerer Granularität als die von SageMaker KI gesammelten Standardnutzungsmetriken. CloudWatch
Für jeden Trainingsjob, den Sie mithilfe des SageMaker Python-SDK in SageMaker KI ausführen, beginnt die SageMaker KI mit der Profilerstellung grundlegender Kennzahlen zur Ressourcennutzung, wie CPU-Auslastung, GPU-Speicherauslastung, Netzwerk und I/O Wartezeit. Es erfasst diese Kennzahlen zur Ressourcennutzung alle 500 Millisekunden.
Im Vergleich zu CloudWatch Amazon-Metriken, die Kennzahlen in Intervallen von 1 Sekunde erfassen, bietet die Überwachungsfunktion von SageMaker KI eine feinere Granularität der Metriken zur Ressourcenauslastung in Intervallen von bis zu 100 Millisekunden (0,1 Sekunden), sodass Sie die Metriken auf der Ebene eines Vorgangs oder eines Schritts eingehend untersuchen können.
Informationen zum Dashboard zur Überwachung der Ressourcenauslastungsmetriken eines Trainingsjobs finden Sie in der SageMaker AI Debugger-Benutzeroberfläche in Studio Experiments. SageMaker