

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

# Elaborazione delle funzionalità con Spark ML e Scikit-learn
<a name="inference-pipeline-mleap-scikit-learn-containers"></a>

Prima di addestrare un modello con algoritmi integrati di Amazon SageMaker AI o algoritmi personalizzati, puoi utilizzare i preprocessori Spark e scikit-learn per trasformare i tuoi dati e progettare le funzionalità. 

## Elaborazione di caratteristiche con Spark ML
<a name="feature-processing-spark"></a>

Puoi eseguire lavori Spark ML con [AWS Glue](https://docs.aws.amazon.com/glue/latest/dg/what-is-glue.html), un servizio ETL (extract, transform, load) senza server, dal tuo notebook AI. SageMaker Puoi inoltre eseguire la connessione a cluster EMR esistenti per eseguire processi Spark ML con [Amazon EMR](https://docs.aws.amazon.com/emr/latest/ManagementGuide/emr-what-is-emr.html). Per fare ciò, hai bisogno di un ruolo AWS Identity and Access Management (IAM) che conceda il permesso di effettuare chiamate dal tuo SageMaker notebook AI a. AWS Glue

**Nota**  
Per vedere quali versioni di Python e Spark sono AWS Glue supportate, consulta le note di rilascio di [AWS Glue. ](/glue/latest/dg/release-notes.html)

Dopo la progettazione delle caratteristiche, i processi Spark ML vengono compressi e serializzati in container MLeap che possono essere aggiunti a una pipeline di inferenza. Non è necessario utilizzare cluster Spark gestiti esternamente. Grazie a questo approccio, puoi ridimensionare senza problemi da un campione di righe a terabyte di dati. Gli stessi trasformatori funzionano per addestramento e inferenza, perciò non occorre duplicare la logica di pre-elaborazione e di progettazione caratteristiche né sviluppare una soluzione una tantum per rendere i modelli persistenti. Con pipeline di inferenza, non è necessario mantenere l'infrastruttura esterna e puoi effettuare previsioni direttamente da dati di input.

Quando esegui un job Spark ML AWS Glue, una pipeline Spark ML viene serializzata in formato mLeap. [https://github.com/combust/mleap](https://github.com/combust/mleap) Quindi, puoi utilizzare il job con lo [ SparkML Model Serving Container in una AI Inference Pipeline. ](https://github.com/aws/sagemaker-sparkml-serving-container) SageMaker *MLeap* è un formato di serializzazione e un motore di esecuzione per le pipeline di Machine Learning. Supporta Spark e TensorFlow per addestrare le Scikit-learn pipeline ed esportarle in una pipeline serializzata chiamata mLeap Bundle. Puoi deserializzare di nuovo i pacchetti in Spark per il punteggio in modalità batch o il runtime MLeap per eseguire servizi API in tempo reale. 

Per un esempio che mostra come configurare un processo con Spark ML, consulta [ Train an ML Model using Apache Spark in Amazon EMR and deploy in AI sample notebook. SageMaker ](https://github.com/aws/amazon-sagemaker-examples/tree/main/sagemaker-python-sdk/sparkml_serving_emr_mleap_abalone)

## Elaborazione delle funzionalità con Scikit-Learn
<a name="feature-processing-with-scikit"></a>

Puoi eseguire e impacchettare i lavori scikit-learn in contenitori direttamente in Amazon AI. SageMaker Per un esempio di codice Python per la creazione di un modello di feature scikit-learn che si allena sul set di dati sui fiori dell'iride di [ Fisher e prevede la specie di iris in base a misurazioni morfologiche, vedi IRIS Training ](http://archive.ics.uci.edu/ml/datasets/Iris) and Prediction with Sagemaker. [ Scikit-learn ](https://github.com/awslabs/amazon-sagemaker-examples/tree/master/sagemaker-python-sdk/scikit_learn_iris) 