

As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.

# Criando uma configuração de trabalho de perfil programaticamente no AWS Glue DataBrew
<a name="profile.configuration"></a>

Nesta seção, você pode encontrar descrições das etapas e funções do trabalho de perfil que você pode usar programaticamente. Você pode usá-los a partir do AWS Command Line Interface(AWS CLI) ou usando um dos AWS SDKs.

Em um trabalho de perfil, você pode personalizar uma configuração para controlar como DataBrew avalia seu conjunto de dados. Você pode aplicar a configuração a um conjunto de dados ou aplicá-la a colunas específicas. Você pode criar a configuração ao criar um trabalho de perfil e depois atualizá-la a qualquer momento.

Uma estrutura de configuração de perfil inclui quatro partes:
+ [ProfileColumns seção](#profile-columns.statistics)
+ [DatasetStatisticsConfiguration seção](#profile-dataset-stats-config)
+ [ColumnStatisticsConfigurations seção](#profile-column-stats-config)
+ [EntityDetectorConfiguration seção para configuração de PII](#entity-detector-configuration)

Veja um exemplo a seguir.

```
{
    "ProfileColumns": [
        {
            "Name": "example"
        },
        {
            "Regex": "example.*"
        }
    ],
    "DatasetStatisticsConfiguration": {
        "IncludedStatistics": [
            "CORRELATION"
        ],
        "Overrides": [
            {
                "Statistic": "CORRELATION",
                "Parameters": {
                    "columnSelectors": "[{\"name\":\"example\"}, {\"regex\":\"example.*\"}]"
                }
            }
        ]
    },
    "ColumnStatisticsConfigurations": [
        {
            "Selectors": [
                {
                    "Name": "example"
                }
            ],
            "Statistics": {
                "IncludedStatistics": [
                    "CORRELATION",
                    "DUPLICATE_ROWS_COUNT"
                ],
                "Overrides": [
                    {
                        "Statistic": "VALUE_DISTRIBUTION",
                        "Parameters": {
                            "binNumber": "10"
                        }
                    }
                ]
            }
        }
    ]
}
```

## ProfileColumns seção
<a name="profile-columns.statistics"></a>

Na `ProfileColumns` seção da sua estrutura, defina as colunas do seu conjunto de dados que você deseja avaliar em seu trabalho de perfil. `ProfileColumns`é uma lista de seletores de coluna (`Selectors`). Você pode especificar um nome de coluna ou uma expressão regular em um seletor de coluna. Veja a seguir um exemplo.

```
"ProfileColumns": [{"Name": "example"}, {"Regex": "example.*"}]
```

Quando `ProfileColumns` é especificado, somente colunas cujos nomes correspondem a um nome ou expressão regular em `ProfileColumns` são incluídas na tarefa de perfil. Se o trabalho de perfil não suportar o tipo de dados de uma coluna selecionada, DataBrew ignora a coluna selecionada durante a execução do trabalho.

Se ProfileColumns for indefinido, o trabalho de perfil avalia todas as colunas suportadas. As colunas suportadas são colunas que contêm dados de um tipo de dados compatível: `ByteType` `ShortType``IntegerType`,`LongType`,,`FloatType`,`DoubleType`,`String`, ou`Boolean`.

## DatasetStatisticsConfiguration seção
<a name="profile-dataset-stats-config"></a>

Na `DatasetStatisticsConfiguration` seção da sua estrutura, você pode criar uma configuração para avaliações entre colunas. A configuração inclui `IncludedStatistics` `Overrides` e. Veja a seguir um exemplo.

```
"DatasetStatisticsConfiguration": {
    "IncludedStatistics": ["CORRELATION"],
    "Overrides": [
        {
            "Statistic": "CORRELATION",
            "Parameters": {
                "columnSelectors": "[{\"name\":\"example\"}, {\"regex\":\"example.*\"}]"
            }
        }
    ]
}
```

Você pode selecionar as avaliações que deseja ter adicionando os nomes das avaliações a. `IncludedStatistics` Veja a seguir um exemplo.

```
"IncludedStatistics": ["CORRELATION", "DUPLICATE_ROWS_COUNT"]
```

Quando você especifica`IncludedStatistics`, somente as avaliações na lista são incluídas no trabalho de perfil. Se `IncludedStatistics` for indefinido, o trabalho de perfil executará todas as avaliações suportadas com configurações padrão. Você pode excluir todas as avaliações adicionando NENHUMA a. `IncludedStatistics` Veja a seguir um exemplo.

```
"IncludedStatistics": ["NONE"]
```

### Estatísticas configuráveis no nível do conjunto de dados
<a name="statistics.table01"></a>

Na `DatasetStatisticsConfiguration` seção de sua estrutura, um cargo de perfil apóia as avaliações mostradas na tabela a seguir.


| **Nome da estatística** | **Descrição** | **Tipos de dados compatíveis** | **Status padrão** | **Atributos do resultado do perfil** | **Tipo de resultado do perfil** | 
| --- | --- | --- | --- | --- | --- | 
| CONTAGEM\_LINHAS\_DUPLICADAS | Contagem de linhas duplicadas no conjunto de dados | todas | Enable (Habilitar) | duplicado RowsCount | Int | 
| CORRELAÇÃO | Coeficiente de correlação de Pearson entre duas colunas | número | Enable (Habilitar) | correlações (em cada coluna selecionada) | Objeto | 

Em`IncludedStatistics`, você pode substituir as configurações padrão de cada avaliação adicionando uma substituição. Cada substituição inclui o nome de uma avaliação específica e um mapa de parâmetros.

Em`DatasetStatisticsConfiguration`, um trabalho de perfil suporta a `CORRELATION` substituição. Essa substituição calcula o coeficiente de correlação de Pearson entre duas colunas de uma lista de colunas selecionadas. A configuração padrão é selecionar as 10 primeiras colunas numéricas. Você pode especificar um número de colunas ou uma lista de seletores de coluna para substituir a configuração padrão.

`CORRELATION`usa esses parâmetros:
+ `columnNumber`— O número de colunas numéricas. O trabalho de perfil seleciona as primeiras *n* colunas do conjunto de dados. Esse valor deve ser maior que 1. Use `"ALL"` para selecionar todas as colunas numéricas.
+ `columnSelectors:`— Lista de seletores de colunas. Cada seletor pode ter um nome de coluna ou uma expressão regular.

Veja a seguir um exemplo.

```
{
    "Statistic": "CORRELATION",
    "Parameters": {
        "columnSelectors": "[{\"name\":\"example\"}, {\"regex\":\"example.*\"}]"
    }
}
```

## ColumnStatisticsConfigurations seção
<a name="profile-column-stats-config"></a>

Na `ColumnStatisticsConfigurations` seção da sua estrutura, você pode criar configurações para colunas específicas. `ColumnStatisticsConfigurations`é uma lista de `ColumnStatisticsConfiguration` configurações. Em `ColumnStatisticsConfiguration``Selectors`, há uma lista de seletores de colunas e `Statistics` para a configuração de estatísticas. Veja a seguir um exemplo.

```
{ 
    "Selectors": [{"Name": "example"}
    ],
    "Statistics": {
       "IncludedStatistics": ["CORRELATION", "DUPLICATE_ROWS_COUNT"]
        "Overrides": [
            {
                "Statistic": "VALUE_DISTRIBUTION",
                "Parameters": {
                    "binNumber": "10"
                }
            }
        ]
    }
}
```

`Selectors`é uma lista de seletores de coluna. Da mesma forma`ProfileColumns`, você pode especificar um nome de coluna ou uma expressão regular em cada seletor de coluna. Quando você especifica`Selectors`, a configuração da coluna é aplicada às colunas que correspondem a qualquer seletor de coluna em`Selectors`. Caso contrário, a configuração será aplicada a todas as colunas suportadas.

Em`Statistics`, você pode substituir as configurações das colunas selecionadas. Tal como acontece com`DatasetStatisticsConfiguration`, `Statistics` tem `IncludedStatistics` `Overrides` e.

Para selecionar as avaliações que você deseja, adicione os nomes das avaliações a. `IncludedStatistics` 

```
"IncludedStatistics": ["CORRELATION", "DUPLICATE_ROWS_COUNT"]                    
```

Quando você especifica`IncludedStatistics`, somente as avaliações na lista são incluídas no trabalho de perfil. Caso contrário, o trabalho de perfil executará todas as avaliações suportadas com configurações padrão.

Você pode excluir todas as avaliações adicionando `NONE` a. `IncludedStatistics`

```
"IncludedStatistics": ["NONE"]                    
```

 Em alguns casos, pode haver várias configurações diferentes `ColumnStatisticsConfigurations` `IncludedStatistics` que você pode aplicar à mesma coluna. Nesses casos, a tarefa de perfil seleciona a última configuração `ColumnStatisticsConfigurations` e a aplica `IncludedStatistics` à coluna selecionada. Uma nova configuração substitui as configurações mais antigas.

### Estatísticas configuráveis no nível da coluna
<a name="statistics.table02"></a>

Em`ColumnStatisticsConfigurations`, um trabalho de perfil apóia as avaliações mostradas na tabela a seguir.

Um tipo de dados compatível `number` nesta tabela significa que o tipo de dados do atributo é um dos seguintes: `ByteType``ShortType`,`IntegerType`,`LongType`,`FloatType`, ou`DoubleType`.


| **Nome da estatística** | **Descrição** | **Tipos de dados compatíveis** | **Status padrão** | **Atributos do resultado do perfil** | **Tipo de resultado do perfil** | 
| --- | --- | --- | --- | --- | --- | 
| – | Nome da coluna. | todas | – | name | string | 
| – | Tipo de dados da coluna. | todas | – | type | string | 
| CONTAGEM\_DE\_VALORES\_DISTINTOS | Número de valores distintos. Um *valor distinto* é o valor que aparece pelo menos uma vez. | number/boolean/string | Habilitado | distinto ValuesCount | Int | 
| ENTROPIA | Entropia (teoria da informação). | number/boolean/string | Habilitado | entropia | Duplo | 
| INTERVALO INTER\_QUARTIL | Varie entre o 25º por cento e o 75º por cento dos números. | número | Habilitado | Intervalo interquartil | Duplo | 
| CURTOSE | Curtose da coluna. | número | Habilitado | curtose | Duplo | 
| MAX | Valor máximo na coluna. | number/string comprimento | Habilitado | max | Int/Double | 
| VALORES\_MÁXIMOS | Lista dos valores máximos na coluna e suas contagens. | número | Habilitado | Valores máximos | Lista | 
| MEAN | Valor médio dos valores na coluna. | number/string comprimento | Habilitado | mean | Duplo | 
| MEDIAN | Mediana dos valores na coluna. | number/string comprimento | Habilitado | mediano | Duplo | 
| DESVIO MEDIANO\_ABSOLUTO | A mediana das diferenças absolutas entre cada ponto de dados e a mediana de uma coluna numérica. | número | Habilitado | mediana AbsoluteDeviation | Duplo | 
| MIN | Valor mínimo na coluna. | number/string comprimento | Habilitado | min | Int/Double | 
| VALORES\_MÍNIMOS | Lista dos valores mínimos na coluna e suas contagens. | número | Habilitado | Valores mínimos | Lista | 
| CONTAGEM\_VALORES\_FALTANTES | Número de valores faltantes na coluna. Cadeias de caracteres nulas e vazias são consideradas ausentes. | todas | Habilitado | desaparecido ValuesCount | Int | 
| MODE | O valor que ocorre com mais frequência na coluna. Se vários valores aparecerem com tanta frequência, o modo é um desses valores. | number/string comprimento | Habilitado | modo | Int/Double | 
| VALORES MAIS COMUNS | Lista dos valores mais comuns na coluna. | number/boolean/string | Habilitado | a maioria CommonValues | Lista | 
| DETECÇÃO\_DISCREPÂNCIA | Detecte valores discrepantes na coluna pelo algoritmo z\_Score. Conte o número de valores discrepantes e extraia uma lista de amostras dos valores discrepantes detectados. | number/string comprimento | Habilitado | zScoreOutliersCount, z ScoreOutliersSample | Int/List | 
| PERCENTIS | Valores percentuais da coluna numérica (5%, 25%, 75%, 95%). | número | Habilitado | percentil 5, percentil 25, percentil 75, percentil 95 | Duplo | 
| RANGE | Intervalo de valores na coluna. | número | Habilitado | intervalo | Int/Double | 
| ASSIMETRIA | Distorção dos valores na coluna. | número | Habilitado | assimetria | Duplo | 
| DESVIO\_PADRÃO | Desvio padrão amostral imparcial dos valores na coluna. | number/string comprimento | Habilitado | Desvio padrão | Duplo | 
| SUM | Soma dos valores na coluna. | número | Habilitado | soma | Int/Double | 
| CONTAGEM\_DE\_VALORES\_ÚNICOS | Número de valores exclusivos. Um valor exclusivo significa que o valor aparece somente uma vez. | number/boolean/string | Habilitado | único ValuesCount | Int | 
| DISTRIBUIÇÃO\_DE\_VALOR | Medida da distribuição dos valores na coluna por intervalo. | number/string comprimento | Habilitado | Distribuição de valor | Lista | 
| VARIANCE | Variância dos valores na coluna. | número | Habilitado | variância | Duplo | 
| DISTRIBUIÇÃO Z\_SCORE\_ | Medida da distribuição dos valores do escore z dos pontos de dados por intervalo. | número | Habilitado | z ScoreDistribution | Lista | 
| CONTAGEM\_ZEROS | Número de zeros (0s) na coluna. | número | Habilitado | Contagem de zeros | Int | 

Em`IncludedStatistics`, você pode substituir os parâmetros padrão de cada avaliação adicionando uma substituição. Cada substituição inclui o nome de uma avaliação específica e um mapa de parâmetros.

## Parâmetros para ColumnStatisticsConfigurations colunas
<a name="profile-column-parameters"></a>

Em`ColumnStatisticsConfigurations`, um trabalho de perfil oferece suporte aos seguintes parâmetros. 

Em alguns casos, pode haver várias configurações diferentes `ColumnStatisticsConfigurations` `IncludedStatistics` que você pode aplicar à mesma coluna. Nesses casos, a tarefa de perfil seleciona a última configuração `ColumnStatisticsConfigurations` e a aplica `IncludedStatistics` à coluna selecionada. Uma nova configuração substitui as configurações mais antigas.

### VALORES\_MÁXIMOS
<a name="profile-column-parameter-MAXIMUM-VALUES"></a>

Lista os valores máximos na coluna numérica e suas contagens. O tamanho padrão da lista é 5. Você pode substituir o tamanho da lista especificando um valor para. `sampleSize`

**Configurações**

`sampleSize`— O tamanho da lista que inclui o número máximo e a contagem de valores na coluna numérica. Esse valor deve ser maior que 0. Use `"ALL"` para listar todos os valores. 

**Exemplo**

```
{ 
    "Statistic": "MAXIMUM_VALUES",
    "Parameters": {
        "sampleSize": "5"
    }
}
```

### VALORES\_MÍNIMOS
<a name="profile-column-parameter-MINIMUM-VALUES"></a>

Lista os valores mínimos na coluna numérica e suas contagens. O tamanho padrão da lista é 5. Você pode substituir o tamanho da lista especificando um valor para. `sampleSize`

**Configurações**

`sampleSize`— O tamanho da lista que inclui o número máximo e a contagem de valores na coluna numérica. Esse valor deve ser maior que 0. Use `"ALL"` para listar todos os valores. 

**Exemplo**

```
{
    "Statistic": "MINIMUM_VALUES",
    "Parameters": {
        "sampleSize": "5"
    }
}
```

### VALORES MAIS COMUNS
<a name="profile-column-parameter-MOST-COMMON-VALUES"></a>

Lista os valores mais comuns na coluna e suas contagens. O tamanho padrão da lista é 50. Você pode substituir o tamanho da lista especificando um valor para. `sampleSize`

**Configurações**

`sampleSize`— O tamanho da lista que inclui o número máximo e a contagem de valores na coluna numérica. Esse valor deve ser maior que 0. Use `"ALL"` para listar todos os valores.

**Exemplo**

```
{
    "Statistic": "MOST_COMMON_VALUES",
    "Parameters": {
        "sampleSize": "50"
    }
}
```

### DETECÇÃO\_DISCREPÂNCIA
<a name="profile-column-parameter-OUTLIER-DETECTION"></a>

Detecta valores discrepantes na coluna numérica ou na coluna de string (com base no comprimento da string) pelo algoritmo Z\_Score. 

Seu trabalho de perfil conta o número de valores discrepantes e gera uma lista de exemplos de valores discrepantes e suas pontuações z. A lista de amostras é ordenada pelo valor absoluto da pontuação z. O tamanho padrão da lista é 50.

O algoritmo Z\_Score identifica um valor como um valor atípico quando ele se desvia da média em mais do que o limite de desvio padrão. O limite padrão de valores discrepantes é 3.

Você pode fornecer mais um limite, um limite moderado, para obter mais informações. Seu limite moderado deve ser menor que seu limite. Esse recurso está desativado por padrão. Quando um limite moderado é especificado, seu trabalho de perfil retorna mais uma contagem,`zScoreMildOutliersCount`. Além disso, `zScoreOutliersSample` pode incluir uma amostra de valores discrepantes de limite moderados nesse caso.

**Configurações**
+ `threshold`— O valor limite a ser usado ao detectar valores discrepantes. Esse valor deve ser maior ou igual a 0. 
+ `mildThreshold`— O valor limite moderado a ser usado ao detectar valores discrepantes. Esse valor deve ser maior ou igual a 0 e menor que`threshold`.
+ `sampleSize`— O tamanho da lista que inclui valores discrepantes na coluna. Use `"ALL"` para listar todos os valores.

**Exemplo**

```
{
    "Statistic": "OUTLIER_DETECTION",
    "Parameters": {
        "threshold": "5",
        "mildThreshold": "3.5",
        "sampleSize": "20"
    }
}
```

### DISTRIBUIÇÃO\_DE\_VALOR
<a name="profile-column-parameter-VALUE-DISTRIBUTION"></a>

Mede a distribuição dos valores na coluna pelos intervalos dos valores. Uma tarefa de perfil agrupa valores de uma coluna numérica ou coluna de sequência de caracteres (com base no comprimento da sequência de caracteres) em compartimentos por intervalos numéricos e gera uma lista de compartimentos. Os compartimentos são consecutivos e o limite superior de um compartimento é o limite inferior do próximo compartimento.

**Configurações**

` binNumber`— Número de caixas. Esse valor deve ser maior que 0. 

**Exemplo**

```
{
    "Statistic": "VALUE_DISTRIBUTION",
    "Parameters": {
        "binNumber": "5"
    }
}
```

### DISTRIBUIÇÃO Z\_SCORE\_
<a name="profile-column-parameter-Z-SCORE-DISTRIBUTION"></a>

Mede a distribuição das pontuações z dos valores na coluna numérica. Uma tarefa de perfil agrupa pontuações z de valores em compartimentos por intervalos numéricos e gera uma lista de compartimentos. Os compartimentos são consecutivos e o limite superior de um compartimento é o limite inferior do próximo compartimento.

**Configurações**

` binNumber`— Número de caixas. Esse valor deve ser maior que 0. 

**Exemplo**

```
{
    "Statistic": "Z_SCORE_DISTRIBUTION",
    "Parameters": {
        "binNumber": "5"
    }
}
```

## EntityDetectorConfiguration seção para configuração de PII
<a name="entity-detector-configuration"></a>

Na `EntityDetectorConfiguration` seção de sua estrutura, você pode configurar os tipos de entidade em seu conjunto de dados que você DataBrew deseja detectar como **informações de identificação pessoal** (PII) para um trabalho de perfil.

### EntityTypes
<a name="w2aac19c15c13c23b5"></a>

Você configura os tipos de entidade que DataBrew deseja detectar como PII para seu trabalho de perfil. Quando `EntityDetectorConfiguration` está indefinido, a detecção de entidades é desativada. Os seguintes tipos de entidade podem ser detectados em seu conjunto de dados:
+ USA\_SSN
+ EMAIL
+ USA\_ITIN
+ USA\_PASSPORT\_NUMBER
+ PHONE\_NUMBER
+ USA\_DRIVING\_LICENSE
+ BANK\_ACCOUNT
+ CREDIT\_CARD
+ IP\_ADDRESS
+ MAC\_ADDRESS
+ USA\_DEA\_NUMBER
+ USA\_HCPCS\_CODE
+ USA\_NATIONAL\_PROVIDER\_IDENTIFIER
+ USA\_NATIONAL\_DRUG\_CODE
+ USA\_HEALTH\_INSURANCE\_CLAIM\_NUMBER
+ USA\_MEDICARE\_BENEFICIARY\_IDENTIFIER
+ USA\_CPT\_CODE
+ PERSON\_NAME
+ DATE

O grupo de tipos de entidade também `USA_ALL` é suportado e inclui todos os tipos de entidade acima, exceto `PERSON_NAME` `DATE` e.

O tipo de `EntityTypes` é uma matriz de strings.

### AllowedStatistics
<a name="w2aac19c15c13c23b7"></a>

Configure as estatísticas que podem ser executadas em colunas que contêm entidades detectadas. Se `AllowedStatistics` for indefinido, nenhuma estatística será calculada em colunas que contenham entidades detectadas. Consulte [Estatísticas configuráveis no nível da coluna](#statistics.table02) para obter uma lista de valores válidos para o `AllowedStatistics` parâmetro.

O tipo de `AllowedStatistics` é uma matriz de `AllowedStatistics` objetos.