Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Feature-Verarbeitung mit Spark ML und Scikit-learn
Bevor Sie ein Modell entweder mit in Amazon SageMaker AI integrierten Algorithmen oder mit benutzerdefinierten Algorithmen trainieren, können Sie Spark- und Scikit-Learn-Präprozessoren verwenden, um Ihre Daten zu transformieren und Funktionen zu entwickeln.
Feature-Verarbeitung mit Spark ML
Sie können Spark-ML-Jobs mit AWS Glue, einem serverlosen ETL-Dienst (Extrahieren, Transformieren, Laden), von Ihrem KI-Notebook aus ausführen. SageMaker Sie können auch eine Verbindung mit vorhandenen EMR-Clustern zum Ausführen von Spark ML-Aufträgen mit Amazon EMR herstellen. Dazu benötigen Sie eine AWS Identity and Access Management (IAM-) Rolle, die die Erlaubnis erteilt, Anrufe von Ihrem SageMaker KI-Notizbuch aus an zu tätigen. AWS Glue
Anmerkung
Informationen darüber, welche Python- und Spark-Versionen AWS Glue unterstützt werden, finden Sie in den AWS Glue-Versionshinweisen.
Nach der Bearbeitung der Funktionen verpacken und serialisieren Sie Spark ML-Aufträge mit MLeap in MLeap-Container, die Sie einer Inferenz-Pipeline hinzufügen können. Sie müssen keine extern verwalteten Spark-Cluster verwenden. Diese Vorgehensweise erlaubt das nahtlose Skalieren von einigen Zeilen bis zu Datenmengen im Terabytebereich. Die gleichen Transformationen funktionieren für Training und Inferenz, Sie müssen daher die Vorverarbeitungs- und Funktionsbearbeitungslogik nicht duplizieren oder eine einmalige Lösung entwickeln, um die Modelle dauerhaft zu machen. Mit Inferenz-Pipelines müssen Sie keine externe Infrastruktur verwalten, und Sie können Prognosen direkt aus Dateneingaben erstellen.
Wenn Sie einen Spark-ML-Job auf ausführen AWS Glue, wird eine Spark-ML-Pipeline im https://github.com/combust/mleap
Ein Beispiel, das zeigt, wie ein Prozess mit Spark ML vorgestellt wird, finden Sie im Beispielnotizbuch Trainieren eines ML-Modells mit Apache Spark in Amazon EMR und Bereitstellen in SageMaker AI.
Feature-Verarbeitung mit Scikit-Learn
Sie können Scikit-Learn-Jobs direkt in Amazon AI ausführen und in Container packen. SageMaker Ein Beispiel für Python-Code zum Erstellen eines Scikit-Learn-Featureizer-Modells, das anhand von Fisher's Iris-Blütendatensatz trainiert und anhand morphologischer Messungen die Irisart vorhersagt, finden Sie unter IRIS-Training