View a markdown version of this page

Recomendações para escolher a ferramenta certa de preparação de dados em SageMaker IA - SageMaker IA da Amazon

As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.

Recomendações para escolher a ferramenta certa de preparação de dados em SageMaker IA

A preparação de dados em machine learning se refere ao processo de coleta, pré-processamento e organização de dados brutos para torná-los adequados para análise e modelagem. Essa etapa garante que os dados estejam em um formato a partir do qual os algoritmos de machine learning possam aprender com eficácia. As tarefas de preparação de dados podem incluir processar valores ausentes, remover valores discrepantes, escalar atributos, codificar variáveis categóricas, avaliar possíveis vieses e tomar medidas para mitigá-los, dividindo dados em conjuntos de treinamento e teste, rotulando e outras transformações necessárias para otimizar a qualidade e a usabilidade dos dados para tarefas subsequentes de machine learning.

Escolha um atributo

Há três casos de uso principais para preparação de dados com a Amazon SageMaker AI. Escolha o caso de uso que se alinha com seus requisitos e, em seguida, consulte o atributo recomendado correspondente.

Casos de uso

A seguir estão os principais casos de uso ao realizar a preparação de dados para Machine Learning.

  • Caso de uso 1: para aqueles que preferem uma interface visual, a SageMaker IA fornece maneiras de explorar, preparar e projetar recursos para o treinamento de modelos por meio de um ambiente de apontar e clicar.

  • Caso de uso 2: para usuários confortáveis com a codificação que desejam mais flexibilidade e controle sobre a preparação de dados, a SageMaker IA integra ferramentas em seus ambientes de codificação para exploração, transformações e engenharia de recursos.

  • Caso de uso 3: para usuários focados na preparação escalável de dados, a SageMaker IA oferece recursos sem servidor que aproveitam o Hadoop/Spark ecossistema para o processamento distribuído de big data.

A tabela a seguir descreve as principais considerações e vantagens e desvantagens dos recursos de SageMaker IA relacionados a cada caso de uso de preparação de dados para aprendizado de máquina. Para começar, identifique o caso de uso que se alinha aos seus requisitos e navegue até o recurso de SageMaker IA recomendado.

Descritor Caso de uso 1 Caso de uso 2 Caso de uso 3
SageMaker Recurso de IA Data Wrangler no Amazon Canvas SageMaker Preparação de dados com SQL no Studio Aplicações Preparar dados usando o EMR Sem Servidor no Studio
Description SageMaker O Canvas é um ambiente visual de baixo código para criar, treinar e implantar modelos de aprendizado de máquina em SageMaker IA. A ferramenta Data Wrangler integrada permite que os usuários combinem, transformem e limpem conjuntos de dados por meio de interações de apontar e clicar. A extensão SQL no Studio permite que os usuários se conectem ao Amazon Redshift, Snowflake, Athena e Amazon S3 para criar consultas SQL ad-hoc e visualizar os resultados em notebooks. JupyterLab A saída dessas consultas pode ser manipulada usando Python e Pandas para processamento, visualização e transformação adicionais em formatos utilizáveis para o desenvolvimento de modelos de machine learning. A integração entre o EMR Serverless e o Amazon SageMaker Studio fornece um ambiente escalável sem servidor para preparação de dados em grande escala para aprendizado de máquina usando estruturas de código aberto, como Apache Spark e Apache Hive. Os usuários podem acessar as aplicações e dados do EMR Sem Servidor diretamente de seus cadernos do Studio para realizar tarefas de preparação de dados em grande escala.
Otimizado para Usando uma interface visual na qual você pode:

Otimizado para tarefas de dados tabulares, como processar valores ausentes, codificar variáveis categóricas e aplicar transformações de dados.

Para usuários cujos dados residem no Amazon Redshift, Snowflake, Athena ou Amazon S3 e desejam combinar SQL exploratório e Python para análise e preparação de dados sem a necessidade de aprender Spark. Para usuários que preferem uma experiência sem servidor com provisionamento e encerramento automáticos de recursos para escalar cargas de trabalho interativas de curta duração ou intermitentes que giram em torno do Apache Spark, enquanto aproveitam os recursos de aprendizado de máquina da IA. SageMaker
Considerações
  • Pode não ser a melhor escolha se sua equipe já tem experiência em Python, Spark ou outras linguagens.

  • Talvez não seja o mais adequado se você precisar de flexibilidade total para personalizar as transformações para adicionar uma lógica comercial complexa ou exigir controle total sobre seu ambiente de processamento de dados.

  • Esse atributo foi projetado somente para residência de dados estruturados no Amazon Redshift, Snowflake, Athena ou Amazon S3.

  • Se o tamanho dos resultados da sua consulta exceder a memória da sua instância de SageMaker IA, o caderno a seguir pode orientá-lo sobre como começar a usar o Athena para preparar seus dados para serem ingeridos por um algoritmo de SageMaker IA.

  • A curva de aprendizado para usuários que não estão familiarizados com os aplicativos e Spark-based ferramentas do EMR Serverless pode ser desafiadora.

  • Esse recurso é mais adequado para tarefas de preparação de dados interativos e pode não ser tão eficiente quanto os clusters do Amazon EMR para requisitos de processamento de dados complexos, em grande escala ou de longa duração que envolvam grandes quantidades de dados, ampla integração com outros serviços, aplicações personalizadas ou diversos frameworks de processamento de dados distribuídas, além do Apache Spark.

  • Embora a computação com a tecnologia sem servidor possa ser econômica para tarefas de curta duração, é essencial monitorar e gerenciar os custos com cuidado, especialmente para workloads de longa duração ou que consomem muitos recursos.

Ambiente recomendado Começando a usar o SageMaker Canvas Executar o Studio Executar o Studio

Opções adicionais

SageMaker A IA oferece as seguintes opções adicionais para preparar seus dados para uso em modelos de aprendizado de máquina.

  • Preparação de dados usando o Amazon EMR: Para tarefas de processamento de dados de longa duração, com uso intensivo de computação e em grande escala, considere usar clusters do Amazon EMR do Studio. SageMaker Os clusters do Amazon EMR são projetados para lidar com paralelização massiva e podem ser escalados para centenas ou milhares de nós, o que os torna adequados para workloads de big data que exigem estruturas como Apache Spark, Hadoop, Hive e Presto. A integração do Amazon EMR com o SageMaker Studio permite que você aproveite a escalabilidade e o desempenho do Amazon EMR, mantendo sua experimentação completa de ML, treinamento e implantação de modelos centralizados e gerenciados no ambiente Studio. SageMaker

  • Prepare dados usando sessões interativas do Glue: você pode usar o mecanismo Spark-based sem servidor Apache em sessões AWS Glue interativas para agregar, transformar e preparar dados de várias fontes no Studio. SageMaker

  • Identifique preconceitos nos dados de treinamento usando os trabalhos de processamento do Amazon SageMaker SageMaker Clarify: o Clarify analisa seus dados e detecta possíveis distorções em várias facetas. Por exemplo, você pode usar a API Clarify no Studio para detectar se seus dados de treinamento contêm representações desequilibradas ou tendências de rotulagem entre grupos, como gênero, raça ou idade. A Clarify pode ajudá-lo a identificar esses preconceitos antes de treinar um modelo para evitar a propagação de preconceitos nas predição do modelo.

  • Crie, armazene e compartilhe recursos: a Amazon SageMaker Feature Store otimiza a descoberta e a reutilização de recursos selecionados para aprendizado de máquina. Ele fornece um repositório centralizado para armazenar dados de atributos que podem ser pesquisados e recuperados para treinamento de modelos. Armazenar atributos em um formato padronizado permite a reutilização em projetos de ML. O Feature Store gerencia todo o ciclo de vida dos atributos, incluindo rastreamento de linhagem, estatísticas e trilhas de auditoria para engenharia de atributos de machine learning escalável e governada.

  • Rotule os dados com um human-in-the-loop: você pode usar o SageMaker Ground Truth para gerenciar os fluxos de trabalho de rotulagem de dados dos seus conjuntos de dados de treinamento.

  • Use a API SageMaker de processamento: depois de realizar a análise exploratória de dados e criar suas etapas de transformação de dados, você pode produzir seu código de transformação usando tarefas de processamento de SageMaker IA e automatizar seu fluxo de trabalho de preparação usando Model Building Pipelines. SageMaker