

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

# Création d'une configuration de tâche de profil par programmation dans AWS Glue DataBrew
<a name="profile.configuration"></a>

Dans cette section, vous trouverez des descriptions des étapes et des fonctions des tâches de profilage que vous pouvez utiliser par programmation. Vous pouvez les utiliser soit à partir du AWS Command Line Interface(AWS CLI), soit à l'aide de l'un des AWS SDK.

Dans une tâche de profilage, vous pouvez personnaliser une configuration pour contrôler le mode d' DataBrew évaluation de votre ensemble de données. Vous pouvez appliquer la configuration à un ensemble de données ou à des colonnes spécifiques. Vous pouvez créer la configuration lors de la création d'une tâche de profil, puis la mettre à jour à tout moment.

Une structure de configuration de profil comprend quatre parties :
+ [ProfileColumns section](#profile-columns.statistics)
+ [DatasetStatisticsConfiguration section](#profile-dataset-stats-config)
+ [ColumnStatisticsConfigurations section](#profile-column-stats-config)
+ [EntityDetectorConfiguration section pour configurer les informations personnelles](#entity-detector-configuration)

Voici un exemple.

```
{
    "ProfileColumns": [
        {
            "Name": "example"
        },
        {
            "Regex": "example.*"
        }
    ],
    "DatasetStatisticsConfiguration": {
        "IncludedStatistics": [
            "CORRELATION"
        ],
        "Overrides": [
            {
                "Statistic": "CORRELATION",
                "Parameters": {
                    "columnSelectors": "[{\"name\":\"example\"}, {\"regex\":\"example.*\"}]"
                }
            }
        ]
    },
    "ColumnStatisticsConfigurations": [
        {
            "Selectors": [
                {
                    "Name": "example"
                }
            ],
            "Statistics": {
                "IncludedStatistics": [
                    "CORRELATION",
                    "DUPLICATE_ROWS_COUNT"
                ],
                "Overrides": [
                    {
                        "Statistic": "VALUE_DISTRIBUTION",
                        "Parameters": {
                            "binNumber": "10"
                        }
                    }
                ]
            }
        }
    ]
}
```

## ProfileColumns section
<a name="profile-columns.statistics"></a>

Dans la `ProfileColumns` section de votre structure, définissez les colonnes de votre jeu de données que vous souhaitez évaluer dans votre profil de travail. `ProfileColumns`est une liste de sélecteurs de colonnes (`Selectors`). Vous pouvez spécifier un nom de colonne ou une expression régulière dans un sélecteur de colonne. Un exemple suit.

```
"ProfileColumns": [{"Name": "example"}, {"Regex": "example.*"}]
```

Lorsque cette `ProfileColumns` option est spécifiée, seules les colonnes dont le nom correspond à un nom ou à une expression régulière `ProfileColumns` sont incluses dans la tâche de profilage. Si le travail de profil ne prend pas en charge le type de données d'une colonne sélectionnée, DataBrew ignore la colonne sélectionnée pendant l'exécution du travail.

S'il ProfileColumns n'est pas défini, la tâche de profilage évalue toutes les colonnes prises en charge. Les colonnes prises en charge sont des colonnes contenant des données d'un type de données pris en charge : `ByteType` `ShortType` `IntegerType``LongType`,`FloatType`,`DoubleType`,`String`,, ou`Boolean`.

## DatasetStatisticsConfiguration section
<a name="profile-dataset-stats-config"></a>

Dans la `DatasetStatisticsConfiguration` section de votre structure, vous pouvez créer une configuration pour les évaluations intercolonnes. La configuration inclut `IncludedStatistics` et`Overrides`. Un exemple suit.

```
"DatasetStatisticsConfiguration": {
    "IncludedStatistics": ["CORRELATION"],
    "Overrides": [
        {
            "Statistic": "CORRELATION",
            "Parameters": {
                "columnSelectors": "[{\"name\":\"example\"}, {\"regex\":\"example.*\"}]"
            }
        }
    ]
}
```

Vous pouvez sélectionner les évaluations que vous souhaitez avoir en y ajoutant des noms d'évaluation`IncludedStatistics`. Un exemple suit.

```
"IncludedStatistics": ["CORRELATION", "DUPLICATE_ROWS_COUNT"]
```

Lorsque vous le spécifiez`IncludedStatistics`, seules les évaluations de la liste sont incluses dans le profil du poste. S'il `IncludedStatistics` n'est pas défini, le job de profilage exécute toutes les évaluations prises en charge avec les paramètres par défaut. Vous pouvez exclure toutes les évaluations en ajoutant AUCUNE à`IncludedStatistics`. Un exemple suit.

```
"IncludedStatistics": ["NONE"]
```

### Statistiques configurables au niveau du jeu de données
<a name="statistics.table01"></a>

Dans la `DatasetStatisticsConfiguration` section de votre structure, un poste de profil soutient les évaluations indiquées dans le tableau suivant.


| **Nom de la statistique** | **Description** | **Types de données pris en charge** | **État par défaut** | **Attributs du résultat du profil** | **Type de résultat de profil** | 
| --- | --- | --- | --- | --- | --- | 
| NOMBRE DE LIGNES DUPLIQUÉES | Nombre de lignes dupliquées dans le jeu de données | tout | Enable | dupliquer RowsCount | Int | 
| CORRÉLATION | Coefficient de corrélation de Pearson entre deux colonnes | number | Enable | corrélations (dans chaque colonne sélectionnée) | Objet | 

Dans`IncludedStatistics`, vous pouvez remplacer les paramètres par défaut de chaque évaluation en ajoutant une dérogation. Chaque dérogation inclut le nom d'une évaluation particulière et une carte de paramètres.

Dans`DatasetStatisticsConfiguration`, une tâche de profil prend en charge la `CORRELATION` dérogation. Cette dérogation calcule le coefficient de corrélation de Pearson entre deux colonnes à partir d'une liste de colonnes sélectionnées. Le paramètre par défaut consiste à sélectionner les 10 premières colonnes numériques. Vous pouvez spécifier un certain nombre de colonnes ou une liste de sélecteurs de colonnes pour remplacer le paramètre par défaut.

`CORRELATION`prend les paramètres suivants :
+ `columnNumber`— Le nombre de colonnes numériques. La tâche de profilage sélectionne les *n* premières colonnes de l'ensemble de données. Cette valeur doit être supérieure à 1. Permet `"ALL"` de sélectionner toutes les colonnes numériques.
+ `columnSelectors:`— Liste des sélecteurs de colonnes. Chaque sélecteur peut avoir un nom de colonne ou une expression régulière.

Un exemple suit.

```
{
    "Statistic": "CORRELATION",
    "Parameters": {
        "columnSelectors": "[{\"name\":\"example\"}, {\"regex\":\"example.*\"}]"
    }
}
```

## ColumnStatisticsConfigurations section
<a name="profile-column-stats-config"></a>

Dans la `ColumnStatisticsConfigurations` section de votre structure, vous pouvez créer des configurations pour des colonnes spécifiques. `ColumnStatisticsConfigurations`est une liste de `ColumnStatisticsConfiguration` paramètres. Il y `Selectors` a une liste de sélecteurs de colonnes, et `Statistics` pour la configuration des statistiques. `ColumnStatisticsConfiguration` Un exemple suit.

```
{ 
    "Selectors": [{"Name": "example"}
    ],
    "Statistics": {
       "IncludedStatistics": ["CORRELATION", "DUPLICATE_ROWS_COUNT"]
        "Overrides": [
            {
                "Statistic": "VALUE_DISTRIBUTION",
                "Parameters": {
                    "binNumber": "10"
                }
            }
        ]
    }
}
```

`Selectors`est une liste de sélecteurs de colonnes. De même`ProfileColumns`, vous pouvez spécifier un nom de colonne ou une expression régulière dans chaque sélecteur de colonne. Lorsque vous le spécifiez`Selectors`, la configuration des colonnes est appliquée aux colonnes qui correspondent à n'importe quel sélecteur de colonne dans`Selectors`. Dans le cas contraire, la configuration est appliquée à toutes les colonnes prises en charge.

Dans`Statistics`, vous pouvez remplacer les paramètres des colonnes sélectionnées. Comme avec`DatasetStatisticsConfiguration`, `Statistics` a `IncludedStatistics` et`Overrides`.

Pour sélectionner les évaluations que vous souhaitez, ajoutez des noms d'évaluation à`IncludedStatistics`. 

```
"IncludedStatistics": ["CORRELATION", "DUPLICATE_ROWS_COUNT"]                    
```

Lorsque vous le spécifiez`IncludedStatistics`, seules les évaluations de la liste sont incluses dans le profil du poste. Dans le cas contraire, la tâche de profilage exécute toutes les évaluations prises en charge avec les paramètres par défaut.

Vous pouvez exclure toutes les évaluations en ajoutant `NONE` à`IncludedStatistics`.

```
"IncludedStatistics": ["NONE"]                    
```

 Dans certains cas, il peut y avoir plusieurs configurations différentes `IncludedStatistics` que vous pouvez appliquer à la même colonne. `ColumnStatisticsConfigurations` Dans ces cas, la tâche de profilage sélectionne la dernière configuration `ColumnStatisticsConfigurations` et l'applique `IncludedStatistics` à la colonne sélectionnée. Une nouvelle configuration remplace les anciennes.

### Statistiques configurables au niveau des colonnes
<a name="statistics.table02"></a>

En`ColumnStatisticsConfigurations`, un poste profilé soutient les évaluations présentées dans le tableau suivant.

Un type de données pris en charge `number` dans ce tableau signifie que le type de données de l'attribut est l'un des suivants : `ByteType``ShortType`,`IntegerType`,`LongType`,`FloatType`, ou`DoubleType`.


| **Nom de la statistique** | **Description** | **Types de données pris en charge** | **État par défaut** | **Attributs du résultat du profil** | **Type de résultat de profil** | 
| --- | --- | --- | --- | --- | --- | 
| – | Nom de la colonne. | tout | – | name | chaîne | 
| – | Type de données de la colonne. | tout | – | type | chaîne | 
| NOMBRE\_VALEUR\_DISTINCT | Nombre de valeurs distinctes. Une *valeur distincte* est une valeur qui apparaît au moins une fois. | number/boolean/chaîne | Activé | distinct ValuesCount | Int | 
| ENTROPIE | Entropie (théorie de l'information). | number/boolean/chaîne | Activé | entropie | Double | 
| PLAGE INTERQUARTILE | Variez entre 25 % et 75 % des chiffres. | number | Activé | Intervalle interquartile | Double | 
| KURTOSIS | Kurtosis de la colonne. | number | Activé | kurtosis | Double | 
| MAX | Valeur maximale dans la colonne. | number/string longueur | Activé | max | Int/Double | 
| VALEUR\_MAXIMALES | Liste des valeurs maximales de la colonne et de leur nombre. | number | Activé | Valeurs maximales | List | 
| MEAN | Valeur moyenne des valeurs de la colonne. | number/string longueur | Activé | mean | Double | 
| MEDIAN | Médiane des valeurs de la colonne. | number/string longueur | Activé | median | Double | 
| DÉVIATION ABSOLUE MÉDIANE | La médiane des différences absolues entre chaque point de données et la médiane d'une colonne numérique. | number | Activé | médiane AbsoluteDeviation | Double | 
| MIN | Valeur minimale dans la colonne. | number/string longueur | Activé | min | Int/Double | 
| VALEUR\_MINIMALES | Liste des valeurs minimales de la colonne et de leur nombre. | number | Activé | Valeurs minimales | List | 
| COMPTE\_VALEUR\_MANQUANTES | Nombre de valeurs manquantes dans la colonne. Les chaînes nulles et vides sont considérées comme manquantes. | tout | Activé | manquant ValuesCount | Int | 
| MODE | La valeur la plus fréquente dans la colonne. Si plusieurs valeurs apparaissent aussi souvent, le mode est l'une de ces valeurs. | number/string longueur | Activé | mode | Int/Double | 
| VALEUR\_LES PLUS COMMUNES | Liste des valeurs les plus courantes de la colonne. | number/boolean/chaîne | Activé | le plus CommonValues | List | 
| DÉTECTION DES VALEURS ABERRANTES | Détectez les valeurs aberrantes dans la colonne à l'aide de l'algorithme Z\_score. Comptez le nombre de valeurs aberrantes et extrayez une liste d'échantillons à partir des valeurs aberrantes détectées. | number/string longueur | Activé | zScoreOutliersCount, z ScoreOutliersSample | Int/List | 
| PERCENTILES | Valeurs percentiles de la colonne numérique (5 %, 25 %, 75 %, 95 %). | number | Activé | percentile 5, percentile 25, percentile 75, percentile 95 | Double | 
| RANGE | Plage de valeurs dans la colonne. | number | Activé | range | Int/Double | 
| ASYMÉTRIE | Asymétrie des valeurs dans la colonne. | number | Activé | asymétrie | Double | 
| ÉCART-TYPE | Écart type d'échantillon non biaisé des valeurs de la colonne. | number/string longueur | Activé | Écart type | Double | 
| SUM | Somme des valeurs de la colonne. | number | Activé | sum | Int/Double | 
| DÉNOMBRE\_VALEUR\_UNIQUE | Nombre de valeurs uniques. Une valeur unique signifie qu'elle n'apparaît qu'une seule fois. | number/boolean/chaîne | Activé | unique ValuesCount | Int | 
| DISTRIBUTION\_VALEUR | Mesure de la distribution des valeurs dans la colonne par plage. | number/string longueur | Activé | Répartition de la valeur | List | 
| ÉCART | Variance des valeurs de la colonne. | number | Activé | variance | Double | 
| Z\_SCORE\_DISTRIBUTION | Mesure de la distribution des valeurs du score Z des points de données par plage. | number | Activé | z ScoreDistribution | List | 
| NOMBRE DE ZÉROS | Nombre de zéros (0) dans la colonne. | number | Activé | Nombre de zéros | Int | 

Dans`IncludedStatistics`, vous pouvez remplacer les paramètres par défaut de chaque évaluation en ajoutant une dérogation. Chaque dérogation inclut le nom d'une évaluation particulière et une carte de paramètres.

## Paramètres des ColumnStatisticsConfigurations colonnes
<a name="profile-column-parameters"></a>

Dans`ColumnStatisticsConfigurations`, une tâche de profilage prend en charge les paramètres suivants. 

Dans certains cas, il peut y avoir plusieurs configurations différentes `IncludedStatistics` que vous pouvez appliquer à la même colonne. `ColumnStatisticsConfigurations` Dans ces cas, la tâche de profilage sélectionne la dernière configuration `ColumnStatisticsConfigurations` et l'applique `IncludedStatistics` à la colonne sélectionnée. Une nouvelle configuration remplace les anciennes.

### VALEUR\_MAXIMALES
<a name="profile-column-parameter-MAXIMUM-VALUES"></a>

Répertorie les valeurs maximales de la colonne numérique et leur nombre. La taille de liste par défaut est 5. Vous pouvez modifier la taille de la liste en spécifiant une valeur pour`sampleSize`.

**Paramètres**

`sampleSize`— La taille de la liste qui inclut le nombre et le nombre maximum de valeurs dans la colonne numérique. Cette valeur doit être supérieure à 0. Permet `"ALL"` de répertorier toutes les valeurs. 

**Exemple**

```
{ 
    "Statistic": "MAXIMUM_VALUES",
    "Parameters": {
        "sampleSize": "5"
    }
}
```

### VALEUR\_MINIMALES
<a name="profile-column-parameter-MINIMUM-VALUES"></a>

Répertorie les valeurs minimales de la colonne numérique et leur nombre. La taille de liste par défaut est 5. Vous pouvez modifier la taille de la liste en spécifiant une valeur pour`sampleSize`.

**Paramètres**

`sampleSize`— La taille de la liste qui inclut le nombre et le nombre maximum de valeurs dans la colonne numérique. Cette valeur doit être supérieure à 0. Permet `"ALL"` de répertorier toutes les valeurs. 

**Exemple**

```
{
    "Statistic": "MINIMUM_VALUES",
    "Parameters": {
        "sampleSize": "5"
    }
}
```

### VALEUR\_LES PLUS COMMUNES
<a name="profile-column-parameter-MOST-COMMON-VALUES"></a>

Répertorie les valeurs les plus courantes de la colonne et leur nombre. La taille de liste par défaut est 50. Vous pouvez modifier la taille de la liste en spécifiant une valeur pour`sampleSize`.

**Paramètres**

`sampleSize`— La taille de la liste qui inclut le nombre et le nombre maximum de valeurs dans la colonne numérique. Cette valeur doit être supérieure à 0. Permet `"ALL"` de répertorier toutes les valeurs.

**Exemple**

```
{
    "Statistic": "MOST_COMMON_VALUES",
    "Parameters": {
        "sampleSize": "50"
    }
}
```

### DÉTECTION DES VALEURS ABERRANTES
<a name="profile-column-parameter-OUTLIER-DETECTION"></a>

Détecte les valeurs aberrantes dans la colonne numérique ou la colonne de chaîne (en fonction de la longueur de la chaîne) par l'algorithme Z\_score. 

Votre job de profil compte le nombre de valeurs aberrantes et génère une liste d'échantillons de valeurs aberrantes et de leurs scores Z. La liste d'échantillons est ordonnée en fonction de la valeur absolue du score Z. La taille de liste par défaut est 50.

L'algorithme Z\_Score identifie une valeur comme une valeur aberrante lorsqu'elle s'écarte de la moyenne d'un écart supérieur au seuil d'écart type. Le seuil de valeur aberrante par défaut est 3.

Vous pouvez fournir un seuil supplémentaire, un seuil modéré, pour obtenir plus d'informations. Votre seuil modéré doit être inférieur à votre seuil. Cette fonctionnalité est désactivée par défaut. Lorsqu'un seuil modéré est spécifié, votre profil d'emploi renvoie un compte de plus,`zScoreMildOutliersCount`. `zScoreOutliersSample`Peut également inclure un échantillon de seuils légèrement aberrants dans ce cas.

**Paramètres**
+ `threshold`— La valeur seuil à utiliser lors de la détection des valeurs aberrantes. Cette valeur doit être supérieure ou égale à 0. 
+ `mildThreshold`— La valeur seuil modérée à utiliser lors de la détection des valeurs aberrantes. Cette valeur doit être supérieure ou égale à 0 et inférieure à`threshold`.
+ `sampleSize`— Taille de la liste qui inclut les valeurs aberrantes dans la colonne. Permet `"ALL"` de répertorier toutes les valeurs.

**Exemple**

```
{
    "Statistic": "OUTLIER_DETECTION",
    "Parameters": {
        "threshold": "5",
        "mildThreshold": "3.5",
        "sampleSize": "20"
    }
}
```

### DISTRIBUTION\_VALEUR
<a name="profile-column-parameter-VALUE-DISTRIBUTION"></a>

Mesure la distribution des valeurs dans la colonne en fonction des plages de valeurs. Une tâche de profilage regroupe les valeurs d'une colonne numérique ou d'une colonne de chaîne (en fonction de la longueur de la chaîne) dans des groupes par plages numériques et génère une liste de groupes. Les compartiments sont consécutifs, et la limite supérieure d'un compartiment est la limite inférieure du compartiment suivant.

**Paramètres**

` binNumber`— Nombre de bacs. Cette valeur doit être supérieure à 0. 

**Exemple**

```
{
    "Statistic": "VALUE_DISTRIBUTION",
    "Parameters": {
        "binNumber": "5"
    }
}
```

### Z\_SCORE\_DISTRIBUTION
<a name="profile-column-parameter-Z-SCORE-DISTRIBUTION"></a>

Mesure la distribution des scores Z des valeurs dans une colonne numérique. Une tâche de profilage regroupe les scores Z de valeurs dans des groupes par plages numériques et génère une liste de groupes. Les compartiments sont consécutifs, et la limite supérieure d'un compartiment est la limite inférieure du compartiment suivant.

**Paramètres**

` binNumber`— Nombre de bacs. Cette valeur doit être supérieure à 0. 

**Exemple**

```
{
    "Statistic": "Z_SCORE_DISTRIBUTION",
    "Parameters": {
        "binNumber": "5"
    }
}
```

## EntityDetectorConfiguration section pour configurer les informations personnelles
<a name="entity-detector-configuration"></a>

Dans la `EntityDetectorConfiguration` section de votre structure, vous pouvez configurer les types d'entités de votre ensemble de données que vous DataBrew souhaitez détecter en tant qu'**informations personnelles identifiables** (PII) pour un poste de profil.

### EntityTypes
<a name="w2aac19c15c13c23b5"></a>

Vous configurez les types d'entités que vous DataBrew souhaitez détecter en tant que PII pour votre tâche de profil. Lorsqu'elle `EntityDetectorConfiguration` n'est pas définie, la détection des entités est désactivée. Les types d'entités suivants peuvent être détectés dans votre ensemble de données :
+ USA\_SSN
+ EMAIL
+ USA\_ITIN
+ USA\_PASSPORT\_NUMBER
+ PHONE\_NUMBER
+ USA\_DRIVING\_LICENSE
+ BANK\_ACCOUNT
+ CREDIT\_CARD
+ IP\_ADDRESS
+ MAC\_ADDRESS
+ USA\_DEA\_NUMBER
+ USA\_HCPCS\_CODE
+ USA\_NATIONAL\_PROVIDER\_IDENTIFIER
+ USA\_NATIONAL\_DRUG\_CODE
+ USA\_HEALTH\_INSURANCE\_CLAIM\_NUMBER
+ USA\_MEDICARE\_BENEFICIARY\_IDENTIFIER
+ USA\_CPT\_CODE
+ PERSON\_NAME
+ DATE

Le groupe de types d'entités `USA_ALL` est également pris en charge et inclut tous les types d'entités ci-dessus, à l'exception de `PERSON_NAME` et`DATE`.

Le type de `EntityTypes` est un tableau de chaînes.

### AllowedStatistics
<a name="w2aac19c15c13c23b7"></a>

Configurez les statistiques autorisées à être exécutées sur les colonnes contenant les entités détectées. S'il n'`AllowedStatistics`est pas défini, aucune statistique ne sera calculée sur les colonnes contenant les entités détectées. Consultez [Statistiques configurables au niveau des colonnes](#statistics.table02) la liste des valeurs valides pour le `AllowedStatistics` paramètre.

Le type de `AllowedStatistics` est un tableau d'`AllowedStatistics`objets.