

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

# Creazione di una configurazione del lavoro di profilo in modo programmatico in AWS Glue DataBrew
<a name="profile.configuration"></a>

In questa sezione, puoi trovare le descrizioni delle fasi e delle funzioni del processo di profilazione che puoi utilizzare a livello di codice. Puoi usarli da AWS Command Line Interface(AWS CLI) o utilizzando uno degli AWS SDK.

In un job di profilazione, puoi personalizzare una configurazione per controllare come DataBrew valuta il tuo set di dati. Puoi applicare la configurazione a un set di dati o applicarla a colonne particolari. Puoi creare la configurazione quando crei un job di profilo e poi aggiornarla in qualsiasi momento.

Una struttura di configurazione del profilo include quattro parti:
+ [ProfileColumns sezione](#profile-columns.statistics)
+ [DatasetStatisticsConfiguration sezione](#profile-dataset-stats-config)
+ [ColumnStatisticsConfigurations sezione](#profile-column-stats-config)
+ [EntityDetectorConfiguration sezione per la configurazione delle PII](#entity-detector-configuration)

Di seguito è riportato un esempio.

```
{
    "ProfileColumns": [
        {
            "Name": "example"
        },
        {
            "Regex": "example.*"
        }
    ],
    "DatasetStatisticsConfiguration": {
        "IncludedStatistics": [
            "CORRELATION"
        ],
        "Overrides": [
            {
                "Statistic": "CORRELATION",
                "Parameters": {
                    "columnSelectors": "[{\"name\":\"example\"}, {\"regex\":\"example.*\"}]"
                }
            }
        ]
    },
    "ColumnStatisticsConfigurations": [
        {
            "Selectors": [
                {
                    "Name": "example"
                }
            ],
            "Statistics": {
                "IncludedStatistics": [
                    "CORRELATION",
                    "DUPLICATE_ROWS_COUNT"
                ],
                "Overrides": [
                    {
                        "Statistic": "VALUE_DISTRIBUTION",
                        "Parameters": {
                            "binNumber": "10"
                        }
                    }
                ]
            }
        }
    ]
}
```

## ProfileColumns sezione
<a name="profile-columns.statistics"></a>

Nella `ProfileColumns` sezione della tua struttura, imposta le colonne del tuo set di dati che desideri valutare nel tuo profilo job. `ProfileColumns`è un elenco di selettori di colonna ()`Selectors`. È possibile specificare un nome di colonna o un'espressione regolare in un selettore di colonne. Di seguito è riportato un esempio.

```
"ProfileColumns": [{"Name": "example"}, {"Regex": "example.*"}]
```

Quando `ProfileColumns` viene specificato, nel job del profilo `ProfileColumns` vengono incluse solo le colonne i cui nomi corrispondono a un nome o a un'espressione regolare in. Se il job del profilo non supporta il tipo di dati di una colonna selezionata, DataBrew salta la colonna selezionata durante l'esecuzione del lavoro.

Se non ProfileColumns è definito, il job di profilo valuta tutte le colonne supportate. Le colonne supportate sono colonne contenenti dati di un tipo di dati supportato:`ByteType`,`ShortType`,`IntegerType`,`LongType`,`FloatType`, `DoubleType``String`, o. `Boolean`

## DatasetStatisticsConfiguration sezione
<a name="profile-dataset-stats-config"></a>

Nella `DatasetStatisticsConfiguration` sezione della struttura, puoi creare una configurazione per le valutazioni tra colonne. La configurazione include `IncludedStatistics` e. `Overrides` Di seguito è riportato un esempio.

```
"DatasetStatisticsConfiguration": {
    "IncludedStatistics": ["CORRELATION"],
    "Overrides": [
        {
            "Statistic": "CORRELATION",
            "Parameters": {
                "columnSelectors": "[{\"name\":\"example\"}, {\"regex\":\"example.*\"}]"
            }
        }
    ]
}
```

È possibile selezionare le valutazioni desiderate aggiungendo i nomi delle valutazioni`IncludedStatistics`. Di seguito è riportato un esempio.

```
"IncludedStatistics": ["CORRELATION", "DUPLICATE_ROWS_COUNT"]
```

Quando si specifica`IncludedStatistics`, solo le valutazioni presenti nell'elenco vengono incluse nella mansione del profilo. Se non `IncludedStatistics` è definito, il job del profilo esegue tutte le valutazioni supportate con le impostazioni predefinite. È possibile escludere tutte le valutazioni aggiungendo NONE a`IncludedStatistics`. Di seguito è riportato un esempio.

```
"IncludedStatistics": ["NONE"]
```

### Statistiche configurabili a livello di set di dati
<a name="statistics.table01"></a>

Nella `DatasetStatisticsConfiguration` sezione della struttura, un profilo job supporta le valutazioni mostrate nella tabella seguente.


| **Nome statistico** | **Descrizione** | **Tipi di dati supportati** | **Stato predefinito** | **Attributi del risultato del profilo** | **Tipo di risultato del profilo** | 
| --- | --- | --- | --- | --- | --- | 
| DUPLICATE\_ROWS\_COUNT | Conteggio delle righe duplicate nel set di dati | tutto | Attiva | duplicato RowsCount | Int | 
| CORRELAZIONE | Coefficiente di correlazione di Pearson tra due colonne | numero | Attiva | correlazioni (in ogni colonna selezionata) | Oggetto | 

In`IncludedStatistics`, puoi sovrascrivere le impostazioni predefinite di ogni valutazione aggiungendo un'eccezione. Ogni override include il nome di una particolare valutazione e una mappa dei parametri.

In`DatasetStatisticsConfiguration`, un job di profilo supporta l'`CORRELATION`override. Questa sovrascrittura calcola il coefficiente di correlazione di Pearson tra due colonne da un elenco di colonne selezionate. L'impostazione predefinita prevede la selezione delle prime 10 colonne numeriche. È possibile specificare un numero di colonne o un elenco di selettori di colonne per sovrascrivere l'impostazione predefinita.

`CORRELATION`accetta questi parametri:
+ `columnNumber`— Il numero di colonne numeriche. Il job del profilo seleziona le prime *n* colonne dal set di dati. Questo valore deve essere maggiore di 1. Utilizzare `"ALL"` per selezionare tutte le colonne numeriche.
+ `columnSelectors:`— Elenco di selettori di colonne. Ogni selettore può avere un nome di colonna o un'espressione regolare.

Di seguito è riportato un esempio.

```
{
    "Statistic": "CORRELATION",
    "Parameters": {
        "columnSelectors": "[{\"name\":\"example\"}, {\"regex\":\"example.*\"}]"
    }
}
```

## ColumnStatisticsConfigurations sezione
<a name="profile-column-stats-config"></a>

Nella `ColumnStatisticsConfigurations` sezione della struttura, puoi creare configurazioni per colonne particolari. `ColumnStatisticsConfigurations`è un elenco di `ColumnStatisticsConfiguration` impostazioni. In`ColumnStatisticsConfiguration`, ci sono `Selectors` un elenco di selettori di colonne e `Statistics` per la configurazione delle statistiche. Di seguito è riportato un esempio.

```
{ 
    "Selectors": [{"Name": "example"}
    ],
    "Statistics": {
       "IncludedStatistics": ["CORRELATION", "DUPLICATE_ROWS_COUNT"]
        "Overrides": [
            {
                "Statistic": "VALUE_DISTRIBUTION",
                "Parameters": {
                    "binNumber": "10"
                }
            }
        ]
    }
}
```

`Selectors`è un elenco di selettori di colonna. Analogamente`ProfileColumns`, è possibile specificare un nome di colonna o un'espressione regolare in ogni selettore di colonna. Quando si specifica`Selectors`, la configurazione delle colonne viene applicata alle colonne che corrispondono a qualsiasi selettore di colonna in. `Selectors` Altrimenti, la configurazione viene applicata a tutte le colonne supportate.

In`Statistics`, puoi sovrascrivere le impostazioni delle colonne selezionate. Come con`DatasetStatisticsConfiguration`, `Statistics` ha `IncludedStatistics` e`Overrides`.

Per selezionare le valutazioni desiderate, aggiungete i nomi delle valutazioni a`IncludedStatistics`. 

```
"IncludedStatistics": ["CORRELATION", "DUPLICATE_ROWS_COUNT"]                    
```

Quando lo specificate`IncludedStatistics`, solo le valutazioni presenti nell'elenco vengono incluse nella mansione del profilo. In caso contrario, il job di profilo esegue tutte le valutazioni supportate con le impostazioni predefinite.

È possibile escludere tutte le valutazioni aggiungendole `NONE` a`IncludedStatistics`.

```
"IncludedStatistics": ["NONE"]                    
```

 In alcuni casi, potrebbero esserci più configurazioni diverse `ColumnStatisticsConfigurations` `IncludedStatistics` che possono essere applicate alla stessa colonna. In questi casi, il job del profilo seleziona l'ultima configurazione `ColumnStatisticsConfigurations` e la applica `IncludedStatistics` alla colonna selezionata. Una nuova configurazione sostituisce le configurazioni precedenti.

### Statistiche configurabili a livello di colonna
<a name="statistics.table02"></a>

In`ColumnStatisticsConfigurations`, un job di profilo supporta le valutazioni mostrate nella tabella seguente.

Un tipo di dati supportato `number` in questa tabella indica che il tipo di dati dell'attributo è uno dei seguenti: `ByteType``ShortType`,`IntegerType`,`LongType`,`FloatType`, o`DoubleType`.


| **Nome statistico** | **Descrizione** | **Tipi di dati supportati** | **Stato predefinito** | **Attributi del risultato del profilo** | **Tipo di risultato del profilo** | 
| --- | --- | --- | --- | --- | --- | 
| – | Nome della colonna. | tutto | – | nome | stringa | 
| – | Tipo di dati della colonna. | tutto | – | tipo | stringa | 
| DISTINCT\_VALUES\_COUNT | Numero di valori distinti. Un *valore distinto* è un valore che appare almeno una volta. | number/boolean/string | Abilitato | distinto ValuesCount | Int | 
| ENTROPIA | Entropia (teoria dell'informazione). | number/boolean/stringa | Abilitato | entropia | Double | 
| INTER\_QUARTILE\_RANGE | Intervallo tra il 25 percento e il 75 percento dei numeri. | numero | Abilitato | Intervallo interquartile | Double | 
| CURTOSI | Curtosi della colonna. | numero | Abilitato | curtosi | Double | 
| MAX | Valore massimo nella colonna. | number/string lunghezza | Abilitato | max | Int/Double | 
| VALORI\_MASSIMI | Elenco dei valori massimi nella colonna e dei relativi conteggi. | numero | Abilitato | Valori massimi | List | 
| MEAN | Valore medio dei valori nella colonna. | number/string lunghezza | Abilitato | mean | Double | 
| MEDIAN | Mediana dei valori nella colonna. | number/string lunghezza | Abilitato | median | Double | 
| DEVIAZIONE\_ASSOLUTA MEDIANA | La mediana delle differenze assolute tra ogni punto dati e la mediana di una colonna numerica. | numero | Abilitato | mediana AbsoluteDeviation | Double | 
| MIN | Valore minimo nella colonna. | number/string lunghezza | Abilitato | min | Int/Double | 
| VALORI MINIMI | Elenco dei valori minimi nella colonna e dei relativi conteggi. | numero | Abilitato | Valori minimi | List | 
| CONTO\_VALORI\_MANCANTI | Numero di valori mancanti nella colonna. Le stringhe nulle e vuote sono considerate mancanti. | tutto | Abilitato | mancanti ValuesCount | Int | 
| MODE | Il valore più frequente nella colonna. Se vengono visualizzati più valori con tale frequenza, la modalità è uno di quei valori. | number/string lunghezza | Abilitato | mode | Int/Double | 
| VALORI PIÙ COMUNI | Elenco dei valori più comuni nella colonna. | number/boolean/string | Abilitato | la maggior parte CommonValues | List | 
| OUTLIER\_DETECTION | Rileva i valori anomali nella colonna mediante l'algoritmo Z\_score. Conta il numero di valori anomali ed estrai un elenco di campioni dai valori anomali rilevati. | number/string lunghezza | Abilitato | zScoreOutliersCount, z ScoreOutliersSample | Int/List | 
| PERCENTILI | Valori percentili della colonna numerica (5%, 25%, 75%, 95%). | numero | Abilitato | percentile 5, percentile 25, percentile 75, percentile 95 | Double | 
| RANGE | Intervallo di valori nella colonna. | numero | Abilitato | range | Int/Double | 
| ASIMMETRIA | Asimmetria dei valori nella colonna. | numero | Abilitato | asimmetria | Double | 
| DEVIAZIONE STANDARD | Esempio imparziale di deviazione standard dei valori nella colonna. | number/string lunghezza | Abilitato | deviazione standard | Double | 
| SUM | Somma dei valori nella colonna. | numero | Abilitato | sum | Int/Double | 
| UNIQUE\_VALUES\_COUNT | Numero di valori univoci. Un valore univoco significa che il valore viene visualizzato una sola volta. | number/boolean/string | Abilitato | unico ValuesCount | Int | 
| DISTRIBUZIONE DEL VALORE | Misura della distribuzione dei valori nella colonna per intervallo. | number/string lunghezza | Abilitato | Distribuzione del valore | List | 
| VARIANCE | Varianza dei valori nella colonna. | numero | Abilitato | variance | Double | 
| Z\_SCORE\_DISTRIBUTION | Misura della distribuzione dei valori del punteggio z dei punti dati per intervallo. | numero | Abilitato | z ScoreDistribution | List | 
| CONTO\_ZERO | Numero di zeri (0) nella colonna. | numero | Abilitato | Conteggio zeri | Int | 

In`IncludedStatistics`, puoi sovrascrivere i parametri predefiniti di ogni valutazione aggiungendo un override. Ogni override include il nome di una particolare valutazione e una mappa dei parametri.

## Parametri per le colonne ColumnStatisticsConfigurations
<a name="profile-column-parameters"></a>

In`ColumnStatisticsConfigurations`, un job di profilo supporta i seguenti parametri. 

In alcuni casi, potrebbero esserci più configurazioni diverse `ColumnStatisticsConfigurations` `IncludedStatistics` che possono essere applicate alla stessa colonna. In questi casi, il job del profilo seleziona l'ultima configurazione `ColumnStatisticsConfigurations` e la applica `IncludedStatistics` alla colonna selezionata. Una nuova configurazione sostituisce le configurazioni precedenti.

### VALORI\_MASSIMI
<a name="profile-column-parameter-MAXIMUM-VALUES"></a>

Elenca i valori massimi nella colonna numerica e i relativi conteggi. La dimensione predefinita dell'elenco è 5. È possibile sovrascrivere la dimensione dell'elenco specificando un valore per. `sampleSize`

**Settings (Impostazioni)**

`sampleSize`— La dimensione dell'elenco che include il numero e il conteggio massimi di valori nella colonna numerica. Questo valore deve essere maggiore di 0. Usa `"ALL"` per elencare tutti i valori. 

**Esempio**

```
{ 
    "Statistic": "MAXIMUM_VALUES",
    "Parameters": {
        "sampleSize": "5"
    }
}
```

### VALORI\_MINIMI
<a name="profile-column-parameter-MINIMUM-VALUES"></a>

Elenca i valori minimi nella colonna numerica e i relativi conteggi. La dimensione predefinita dell'elenco è 5. È possibile sovrascrivere la dimensione dell'elenco specificando un valore per. `sampleSize`

**Settings (Impostazioni)**

`sampleSize`— La dimensione dell'elenco che include il numero e il conteggio massimi di valori nella colonna numerica. Questo valore deve essere maggiore di 0. Usa `"ALL"` per elencare tutti i valori. 

**Esempio**

```
{
    "Statistic": "MINIMUM_VALUES",
    "Parameters": {
        "sampleSize": "5"
    }
}
```

### MOST\_COMMON\_VALUES
<a name="profile-column-parameter-MOST-COMMON-VALUES"></a>

Elenca i valori più comuni nella colonna e i relativi conteggi. La dimensione predefinita dell'elenco è 50. È possibile sovrascrivere la dimensione dell'elenco specificando un valore per. `sampleSize`

**Settings (Impostazioni)**

`sampleSize`— La dimensione dell'elenco che include il numero e il conteggio massimi di valori nella colonna numerica. Questo valore deve essere maggiore di 0. Usa `"ALL"` per elencare tutti i valori.

**Esempio**

```
{
    "Statistic": "MOST_COMMON_VALUES",
    "Parameters": {
        "sampleSize": "50"
    }
}
```

### OUTLIER\_DETECTION
<a name="profile-column-parameter-OUTLIER-DETECTION"></a>

Rileva i valori anomali nella colonna numerica o nella colonna di stringhe (in base alla lunghezza della stringa) mediante l'algoritmo Z\_score. 

Il job del tuo profilo conta il numero di valori anomali e genera un elenco di esempio di valori anomali e i relativi punteggi z. L'elenco dei campioni è ordinato in base al valore assoluto dello z-score. La dimensione predefinita dell'elenco è 50.

L'algoritmo Z\_Score identifica un valore come valore anomalo quando si discosta dalla media di oltre la soglia di deviazione standard. La soglia anomala predefinita è 3.

Puoi fornire un'altra soglia, una soglia lieve, per ottenere maggiori informazioni. La soglia moderata deve essere inferiore alla soglia. Questa funzionalità è disattivata per impostazione predefinita. Quando viene specificata una soglia moderata, il lavoro del tuo profilo restituisce un altro conteggio,`zScoreMildOutliersCount`. In questo caso, `zScoreOutliersSample` è inoltre possibile includere un campione di valori anomali di soglia lieve.

**Settings (Impostazioni)**
+ `threshold`— Il valore di soglia da utilizzare per rilevare i valori anomali. Questo valore deve essere maggiore o uguale a 0. 
+ `mildThreshold`— Il valore di soglia moderato da utilizzare per rilevare valori anomali. Questo valore deve essere maggiore o uguale a 0 e minore di. `threshold`
+ `sampleSize`— La dimensione dell'elenco che include i valori anomali nella colonna. Si usa `"ALL"` per elencare tutti i valori.

**Esempio**

```
{
    "Statistic": "OUTLIER_DETECTION",
    "Parameters": {
        "threshold": "5",
        "mildThreshold": "3.5",
        "sampleSize": "20"
    }
}
```

### VALUE\_DISTRIBUTION
<a name="profile-column-parameter-VALUE-DISTRIBUTION"></a>

Misura la distribuzione dei valori nella colonna in base agli intervalli dei valori. Un job di profilo raggruppa i valori di una colonna numerica o di una colonna di stringhe (in base alla lunghezza della stringa) in contenitori per intervalli numerici e genera un elenco di contenitori. I contenitori sono consecutivi e il limite superiore di un bucket è il limite inferiore per il bucket successivo.

**Settings (Impostazioni)**

` binNumber`— Numero di contenitori. Questo valore deve essere maggiore di 0. 

**Esempio**

```
{
    "Statistic": "VALUE_DISTRIBUTION",
    "Parameters": {
        "binNumber": "5"
    }
}
```

### Z\_SCORE\_DISTRIBUTION
<a name="profile-column-parameter-Z-SCORE-DISTRIBUTION"></a>

Misura la distribuzione dei punteggi z dei valori nella colonna numerica. Un job di profilo raggruppa i punteggi z di valori in contenitori per intervalli numerici e genera un elenco di contenitori. I contenitori sono consecutivi e il limite superiore di un bucket è il limite inferiore per il bucket successivo.

**Settings (Impostazioni)**

` binNumber`— Numero di contenitori. Questo valore deve essere maggiore di 0. 

**Esempio**

```
{
    "Statistic": "Z_SCORE_DISTRIBUTION",
    "Parameters": {
        "binNumber": "5"
    }
}
```

## EntityDetectorConfiguration sezione per la configurazione delle PII
<a name="entity-detector-configuration"></a>

Nella `EntityDetectorConfiguration` sezione della struttura, puoi configurare i tipi di entità nel tuo set di dati che desideri DataBrew rilevare come **informazioni di identificazione personale** (PII) per un lavoro di profilo.

### EntityTypes
<a name="w2aac19c15c13c23b5"></a>

Puoi configurare i tipi di entità che desideri rilevare come PII DataBrew per il lavoro del tuo profilo. Quando non `EntityDetectorConfiguration` è definito, il rilevamento delle entità è disabilitato. I seguenti tipi di entità possono essere rilevati nel set di dati:
+ USA\_SSN
+ EMAIL
+ USA\_ITIN
+ USA\_PASSPORT\_NUMBER
+ PHONE\_NUMBER
+ USA\_DRIVING\_LICENSE
+ BANK\_ACCOUNT
+ CREDIT\_CARD
+ IP\_ADDRESS
+ MAC\_ADDRESS
+ USA\_DEA\_NUMBER
+ USA\_HCPCS\_CODE
+ USA\_NATIONAL\_PROVIDER\_IDENTIFIER
+ USA\_NATIONAL\_DRUG\_CODE
+ USA\_HEALTH\_INSURANCE\_CLAIM\_NUMBER
+ USA\_MEDICARE\_BENEFICIARY\_IDENTIFIER
+ USA\_CPT\_CODE
+ PERSON\_NAME
+ DATE

`USA_ALL`È supportato anche il gruppo di tipi di entità che include tutti i tipi di entità sopra indicati tranne `PERSON_NAME` e`DATE`.

Il tipo di `EntityTypes` è un array di stringhe.

### AllowedStatistics
<a name="w2aac19c15c13c23b7"></a>

Configura le statistiche che possono essere eseguite su colonne che contengono entità rilevate. Se non `AllowedStatistics` è definito, non verrà calcolata alcuna statistica sulle colonne che contengono le entità rilevate. [Statistiche configurabili a livello di colonna](#statistics.table02)Per un elenco di valori validi per il `AllowedStatistics` parametro, vedere.

Il tipo di `AllowedStatistics` è una matrice di `AllowedStatistics` oggetti.