

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

# Programmgesteuertes Erstellen einer Profiljobkonfiguration in AWS Glue DataBrew
<a name="profile.configuration"></a>

In diesem Abschnitt finden Sie Beschreibungen der Schritte und Funktionen von Profiljobs, die Sie programmgesteuert verwenden können. Sie können sie entweder über AWS Command Line Interface(AWS CLI) oder mithilfe eines der AWS SDKs verwenden.

In einem Profiljob können Sie eine Konfiguration anpassen, um zu steuern, wie Ihr DataBrew Datensatz ausgewertet wird. Sie können die Konfiguration auf einen Datensatz oder auf bestimmte Spalten anwenden. Sie können die Konfiguration erstellen, wenn Sie einen Profiljob erstellen, und sie dann jederzeit aktualisieren.

Eine Profilkonfigurationsstruktur besteht aus vier Teilen:
+ [ProfileColumns Abschnitt](#profile-columns.statistics)
+ [DatasetStatisticsConfiguration Abschnitt](#profile-dataset-stats-config)
+ [ColumnStatisticsConfigurations Abschnitt](#profile-column-stats-config)
+ [EntityDetectorConfiguration Abschnitt zur Konfiguration von PII](#entity-detector-configuration)

Im Folgenden sehen Sie ein Beispiel.

```
{
    "ProfileColumns": [
        {
            "Name": "example"
        },
        {
            "Regex": "example.*"
        }
    ],
    "DatasetStatisticsConfiguration": {
        "IncludedStatistics": [
            "CORRELATION"
        ],
        "Overrides": [
            {
                "Statistic": "CORRELATION",
                "Parameters": {
                    "columnSelectors": "[{\"name\":\"example\"}, {\"regex\":\"example.*\"}]"
                }
            }
        ]
    },
    "ColumnStatisticsConfigurations": [
        {
            "Selectors": [
                {
                    "Name": "example"
                }
            ],
            "Statistics": {
                "IncludedStatistics": [
                    "CORRELATION",
                    "DUPLICATE_ROWS_COUNT"
                ],
                "Overrides": [
                    {
                        "Statistic": "VALUE_DISTRIBUTION",
                        "Parameters": {
                            "binNumber": "10"
                        }
                    }
                ]
            }
        }
    ]
}
```

## ProfileColumns Abschnitt
<a name="profile-columns.statistics"></a>

Legen Sie im `ProfileColumns` Abschnitt Ihrer Struktur die Spalten aus Ihrem Datensatz fest, die Sie in Ihrem Profiljob auswerten möchten. `ProfileColumns`ist eine Liste von Spaltenselektoren (`Selectors`). Sie können entweder einen Spaltennamen oder einen regulären Ausdruck in einer Spaltenauswahl angeben. Ein Beispiel folgt.

```
"ProfileColumns": [{"Name": "example"}, {"Regex": "example.*"}]
```

Wenn diese `ProfileColumns` Option angegeben ist, werden nur Spalten, deren Namen mit einem Namen oder einem regulären Ausdruck in `ProfileColumns` übereinstimmen, in den Profiljob aufgenommen. Wenn der Profiljob den Datentyp einer ausgewählten Spalte nicht unterstützt, wird die ausgewählte Spalte während der Jobausführung DataBrew übersprungen.

Wenn nicht ProfileColumns definiert, wertet der Profiljob alle unterstützten Spalten aus. Unterstützte Spalten sind Spalten, die Daten eines unterstützten Datentyps enthalten:`ByteType`,`ShortType`,`IntegerType`,`LongType`,`FloatType`, `DoubleType``String`, oder. `Boolean`

## DatasetStatisticsConfiguration Abschnitt
<a name="profile-dataset-stats-config"></a>

Im `DatasetStatisticsConfiguration` Abschnitt Ihrer Struktur können Sie eine Konfiguration für Bewertungen zwischen den Spalten erstellen. Die Konfiguration umfasst `IncludedStatistics` und`Overrides`. Ein Beispiel folgt.

```
"DatasetStatisticsConfiguration": {
    "IncludedStatistics": ["CORRELATION"],
    "Overrides": [
        {
            "Statistic": "CORRELATION",
            "Parameters": {
                "columnSelectors": "[{\"name\":\"example\"}, {\"regex\":\"example.*\"}]"
            }
        }
    ]
}
```

Sie können Bewertungen auswählen, die Sie haben möchten, indem Sie Bewertungsnamen hinzufügen`IncludedStatistics`. Ein Beispiel folgt.

```
"IncludedStatistics": ["CORRELATION", "DUPLICATE_ROWS_COUNT"]
```

Wenn Sie angeben`IncludedStatistics`, dass nur Bewertungen in der Liste in der Profilaufgabe enthalten sind. Wenn `IncludedStatistics` nicht definiert, führt der Profiljob alle unterstützten Evaluierungen mit Standardeinstellungen aus. Sie können alle Bewertungen ausschließen, indem Sie NONE zu `IncludedStatistics` hinzufügen. Ein Beispiel folgt.

```
"IncludedStatistics": ["NONE"]
```

### Konfigurierbare Statistiken auf Datensatzebene
<a name="statistics.table01"></a>

In dem `DatasetStatisticsConfiguration` Abschnitt Ihrer Struktur unterstützt ein Profiljob die in der folgenden Tabelle aufgeführten Bewertungen.


| **Name der Statistik** | **Beschreibung** | **Unterstützte Datentypen** | **Standardstatus** | **Attribute des Profilergebnisses** | **Art des Profilergebnisses** | 
| --- | --- | --- | --- | --- | --- | 
| DUPLICATE\_ROWS\_COUNT | Anzahl doppelter Zeilen im Datensatz | all | Aktivieren | duplizieren RowsCount | Int | 
| KORRELATION | Korrelationskoeffizient nach Pearson zwischen zwei Spalten | number | Aktivieren | Korrelationen (in jeder ausgewählten Spalte) | Objekt | 

In `IncludedStatistics` können Sie die Standardeinstellungen jeder Auswertung überschreiben, indem Sie eine Überschreibung hinzufügen. Jede Überschreibung umfasst den Namen einer bestimmten Auswertung und eine Parameterzuordnung.

`DatasetStatisticsConfiguration`In unterstützt ein Profiljob die `CORRELATION` Überschreibung. Diese Überschreibung berechnet den Korrelationskoeffizienten nach Pearson zwischen zwei Spalten aus einer Liste ausgewählter Spalten. In der Standardeinstellung werden die ersten 10 numerischen Spalten ausgewählt. Sie können entweder eine Anzahl von Spalten oder eine Liste von Spaltenselektoren angeben, um die Standardeinstellung zu überschreiben.

`CORRELATION`verwendet diese Parameter:
+ `columnNumber`— Die Anzahl der numerischen Spalten. Der Profiljob wählt die ersten *n* Spalten aus dem Datensatz aus. Dieser Wert sollte größer als 1 sein. `"ALL"`Dient zur Auswahl aller numerischen Spalten.
+ `columnSelectors:`— Liste der Spaltenselektoren. Jeder Selektor kann entweder einen Spaltennamen oder einen regulären Ausdruck haben.

Ein Beispiel folgt.

```
{
    "Statistic": "CORRELATION",
    "Parameters": {
        "columnSelectors": "[{\"name\":\"example\"}, {\"regex\":\"example.*\"}]"
    }
}
```

## ColumnStatisticsConfigurations Abschnitt
<a name="profile-column-stats-config"></a>

Im `ColumnStatisticsConfigurations` Abschnitt Ihrer Struktur können Sie Konfigurationen für bestimmte Spalten erstellen. `ColumnStatisticsConfigurations`ist eine Liste von `ColumnStatisticsConfiguration` Einstellungen. Darin `ColumnStatisticsConfiguration` gibt `Selectors` es eine Liste von Spaltenselektoren und `Statistics` für die Konfiguration von Statistiken. Ein Beispiel folgt.

```
{ 
    "Selectors": [{"Name": "example"}
    ],
    "Statistics": {
       "IncludedStatistics": ["CORRELATION", "DUPLICATE_ROWS_COUNT"]
        "Overrides": [
            {
                "Statistic": "VALUE_DISTRIBUTION",
                "Parameters": {
                    "binNumber": "10"
                }
            }
        ]
    }
}
```

`Selectors`ist eine Liste von Spaltenselektoren. Wie bei `ProfileColumns` können Sie in jedem Spaltenselektor entweder einen Spaltennamen oder einen regulären Ausdruck angeben. Wenn Sie angeben`Selectors`, wird die Spaltenkonfiguration auf Spalten angewendet, die einem beliebigen Spaltenselektor in entsprechen. `Selectors` Andernfalls wird die Konfiguration auf alle unterstützten Spalten angewendet.

`Statistics`In können Sie die Einstellungen ausgewählter Spalten überschreiben. Wie bei`DatasetStatisticsConfiguration`, `Statistics` hat `IncludedStatistics` und`Overrides`.

Um die gewünschten Bewertungen auszuwählen, fügen Sie Bewertungsnamen zu hinzu`IncludedStatistics`. 

```
"IncludedStatistics": ["CORRELATION", "DUPLICATE_ROWS_COUNT"]                    
```

Wenn Sie angeben`IncludedStatistics`, sind nur die Bewertungen in der Liste in der Profilaufgabe enthalten. Andernfalls führt der Profiljob alle unterstützten Auswertungen mit Standardeinstellungen aus.

Sie können alle Bewertungen ausschließen, indem Sie `NONE` zu hinzufügen`IncludedStatistics`.

```
"IncludedStatistics": ["NONE"]                    
```

 In einigen Fällen gibt es möglicherweise mehrere Konfigurationen mit unterschiedlichen Konfigurationen`IncludedStatistics`, die Sie auf dieselbe Spalte anwenden können. `ColumnStatisticsConfigurations` In diesen Fällen wählt der Profiljob die letzte Konfiguration aus `ColumnStatisticsConfigurations` und wendet `IncludedStatistics` sie auf die ausgewählte Spalte an. Eine neue Konfiguration überschreibt ältere Konfigurationen.

### Konfigurierbare Statistiken auf Spaltenebene
<a name="statistics.table02"></a>

`ColumnStatisticsConfigurations`In unterstützt ein Profiljob die in der folgenden Tabelle aufgeführten Bewertungen.

Ein unterstützter Datentyp `number` in dieser Tabelle bedeutet, dass der Datentyp des Attributs einer der folgenden ist: `ByteType``ShortType`,`IntegerType`,`LongType`,`FloatType`, oder`DoubleType`.


| **Name der Statistik** | **Beschreibung** | **Unterstützte Datentypen** | **Standardstatus** | **Attribute des Profilergebnisses** | **Art des Profilergebnisses** | 
| --- | --- | --- | --- | --- | --- | 
| – | Name der Spalte. | all | – | Name | Zeichenfolge | 
| – | Datentyp der Spalte. | all | – | type | Zeichenfolge | 
| DISTINCT\_VALUES\_COUNT | Anzahl unterschiedlicher Werte. Ein *eindeutiger Wert* ist ein Wert, der mindestens einmal vorkommt. | number/boolean/string | Aktiviert | deutlich ValuesCount | Int | 
| ENTROPIE | Entropie (Informationstheorie). | number/boolean/Zeichenfolge | Aktiviert | Entropie | Double | 
| INTER\_QUARTILSINTER\_RANGE | Bereich zwischen dem 25. und dem 75. Prozent der Zahlen. | number | Aktiviert | Interquartilsbereich | Double | 
| KURTOSE | Kurtosis der Kolumne. | number | Aktiviert | Kurtose | Double | 
| MAX | Maximalwert in der Spalte. | number/string Länge | Aktiviert | max | Int/Double | 
| MAXIMALE\_WERTE | Liste der Maximalwerte in der Spalte und ihrer Anzahl. | number | Aktiviert | Höchstwerte | Auflisten | 
| MEAN | Mittelwert der Werte in der Spalte. | number/string Länge | Aktiviert | mean | Double | 
| MEDIAN | Median der Werte in der Spalte. | number/string Länge | Aktiviert | median | Double | 
| MEDIANE\_ABSOLUTE\_ABWEICHUNG | Der Median der absoluten Differenzen zwischen den einzelnen Datenpunkten und dem Median einer numerischen Spalte. | number | Aktiviert | Median AbsoluteDeviation | Double | 
| MIN | Mindestwert in der Spalte. | number/string Länge | Aktiviert | min | Int/Double | 
| MINDESTWERTE | Liste der Mindestwerte in der Spalte und ihrer Anzahl. | number | Aktiviert | Mindestwerte | Auflisten | 
| ANZAHL FEHLENDER WERTE | Anzahl der fehlenden Werte in der Spalte. Null- und Leerzeichenfolgen werden als fehlend betrachtet. | all | Aktiviert | fehlt ValuesCount | Int | 
| MODE | Der am häufigsten vorkommende Wert in der Spalte. Wenn mehrere Werte so häufig vorkommen, ist der Modus einer dieser Werte. | number/string Länge | Aktiviert | mode | Int/Double | 
| MEISTEN\_GÄNGIGSTEN\_WERTE | Liste der häufigsten Werte in der Spalte. | number/boolean/string | Aktiviert | die meisten CommonValues | Auflisten | 
| ERKENNUNG VON AUSREISSERN | Erkennt Ausreißer in der Spalte mit dem Z\_Score-Algorithmus. Zählen Sie die Anzahl der Ausreißer und extrahieren Sie eine Liste mit Stichproben aus den erkannten Ausreißern. | number/string Länge | Aktiviert | zScoreOutliersCount, z ScoreOutliersSample | Int/List | 
| PERZENTILE | Perzentilwerte der numerischen Spalte (5%, 25%, 75%, 95%). | number | Aktiviert | Perzentil 5, Perzentil 25, Perzentil 75, Perzentil 95 | Double | 
| RANGE | Wertebereich in der Spalte. | number | Aktiviert | range | Int/Double | 
| SCHIEFE | Schiefe der Werte in der Spalte. | number | Aktiviert | Schiefe | Double | 
| STANDARDABWEICHUNG | Unvoreingenommene Standardabweichung der Stichprobe der Werte in der Spalte. | number/string Länge | Aktiviert | Standardabweichung | Double | 
| SUM | Summe der Werte in der Spalte. | number | Aktiviert | sum | Int/Double | 
| UNIQUE\_VALUES\_COUNT | Anzahl der eindeutigen Werte. Ein eindeutiger Wert bedeutet, dass der Wert nur einmal vorkommt. | number/boolean/Zeichenfolge | Aktiviert | einzigartig ValuesCount | Int | 
| WERTVERTEILUNG | Maß für die Verteilung der Werte in der Spalte nach Bereichen. | number/string Länge | Aktiviert | Verteilung der Werte | Auflisten | 
| VARIANCE | Varianz der Werte in der Spalte. | number | Aktiviert | Varianz | Double | 
| Z\_SCORE\_DISTRIBUTION | Maß für die Verteilung der Z-Score-Werte von Datenpunkten nach Bereich. | number | Aktiviert | z ScoreDistribution | Auflisten | 
| ANZAHL NULLEN | Anzahl der Nullen (0s) in der Spalte. | number | Aktiviert | Anzahl Nullen | Int | 

In `IncludedStatistics` können Sie die Standardparameter jeder Auswertung überschreiben, indem Sie eine Überschreibung hinzufügen. Jede Überschreibung umfasst den Namen einer bestimmten Auswertung und eine Parameterzuordnung.

## Parameter für ColumnStatisticsConfigurations Spalten
<a name="profile-column-parameters"></a>

`ColumnStatisticsConfigurations`In unterstützt ein Profiljob die folgenden Parameter. 

In einigen Fällen gibt es möglicherweise mehrere Konfigurationen mit unterschiedlichen Konfigurationen`IncludedStatistics`, die Sie auf dieselbe Spalte anwenden können. `ColumnStatisticsConfigurations` In diesen Fällen wählt der Profiljob die letzte Konfiguration aus `ColumnStatisticsConfigurations` und wendet `IncludedStatistics` sie auf die ausgewählte Spalte an. Eine neue Konfiguration überschreibt ältere Konfigurationen.

### MAXIMUM\_VALUES
<a name="profile-column-parameter-MAXIMUM-VALUES"></a>

Listet die Maximalwerte in der numerischen Spalte und ihre Anzahl auf. Die Standardlistengröße ist 5. Sie können die Listengröße überschreiben, indem Sie einen Wert für angeben`sampleSize`.

**Einstellungen**

`sampleSize`— Die Größe der Liste, die die maximale Anzahl und Anzahl von Werten in der numerischen Spalte enthält. Dieser Wert sollte größer als 0 sein. Wird verwendet`"ALL"`, um alle Werte aufzulisten. 

**Beispiel**

```
{ 
    "Statistic": "MAXIMUM_VALUES",
    "Parameters": {
        "sampleSize": "5"
    }
}
```

### MINIMALWERTE
<a name="profile-column-parameter-MINIMUM-VALUES"></a>

Listet die Mindestwerte in der numerischen Spalte und ihre Anzahl auf. Die Standardlistengröße ist 5. Sie können die Listengröße überschreiben, indem Sie einen Wert für angeben`sampleSize`.

**Einstellungen**

`sampleSize`— Die Größe der Liste, die die maximale Anzahl und Anzahl von Werten in der numerischen Spalte enthält. Dieser Wert sollte größer als 0 sein. Wird verwendet`"ALL"`, um alle Werte aufzulisten. 

**Beispiel**

```
{
    "Statistic": "MINIMUM_VALUES",
    "Parameters": {
        "sampleSize": "5"
    }
}
```

### DIE MEISTEN GEBRÄUCHLICHSTEN WERTE
<a name="profile-column-parameter-MOST-COMMON-VALUES"></a>

Listet die häufigsten Werte in der Spalte und ihre Anzahl auf. Die Standardlistengröße ist 50. Sie können die Listengröße überschreiben, indem Sie einen Wert für angeben`sampleSize`.

**Einstellungen**

`sampleSize`— Die Größe der Liste, die die maximale Anzahl und Anzahl von Werten in der numerischen Spalte enthält. Dieser Wert sollte größer als 0 sein. Wird verwendet`"ALL"`, um alle Werte aufzulisten.

**Beispiel**

```
{
    "Statistic": "MOST_COMMON_VALUES",
    "Parameters": {
        "sampleSize": "50"
    }
}
```

### OUTLIER\_DETECTION
<a name="profile-column-parameter-OUTLIER-DETECTION"></a>

Erkennt Ausreißer in der numerischen Spalte oder Zeichenkettenspalte (basierend auf der Zeichenkettenlänge) mit dem Z\_Score-Algorithmus. 

Ihr Jobprofil zählt die Anzahl der Ausreißer und generiert eine Beispielliste mit Ausreißern und ihren Z-Werten. Die Stichprobenliste ist nach dem absoluten Wert des Z-Werts sortiert. Die Standardlistengröße ist 50.

Der Z\_Score-Algorithmus identifiziert einen Wert als Ausreißer, wenn er um mehr als den Schwellenwert für die Standardabweichung vom Mittelwert abweicht. Der Standardschwellenwert für Ausreißer ist 3.

Sie können einen weiteren Schwellenwert, einen milden Schwellenwert, angeben, um weitere Informationen zu erhalten. Ihr milder Schwellenwert sollte unter Ihrem Schwellenwert liegen. Diese Funktion ist standardmäßig ausgeschaltet. Wenn ein leichter Schwellenwert angegeben ist, gibt Ihr Profiljob eine weitere Zählung zurück`zScoreMildOutliersCount`. `zScoreOutliersSample`Kann in diesem Fall auch eine Stichprobe von Ausreißern mit leichtem Schwellenwert enthalten.

**Einstellungen**
+ `threshold`— Der Schwellenwert, der bei der Erkennung von Ausreißern verwendet werden soll. Dieser Wert sollte größer oder gleich 0 sein. 
+ `mildThreshold`— Der milde Schwellenwert, der bei der Erkennung von Ausreißern verwendet werden soll. Dieser Wert sollte größer oder gleich 0 und kleiner als `threshold` sein.
+ `sampleSize`— Die Größe der Liste, die Ausreißer in der Spalte enthält. Wird verwendet`"ALL"`, um alle Werte aufzulisten.

**Beispiel**

```
{
    "Statistic": "OUTLIER_DETECTION",
    "Parameters": {
        "threshold": "5",
        "mildThreshold": "3.5",
        "sampleSize": "20"
    }
}
```

### VALUE\_DISTRIBUTION
<a name="profile-column-parameter-VALUE-DISTRIBUTION"></a>

Misst die Verteilung der Werte in der Spalte anhand der Wertebereiche. Ein Jobprofil gruppiert Werte aus einer numerischen Spalte oder Zeichenkettenspalte (basierend auf der Länge der Zeichenfolge) in Abschnitte nach numerischen Bereichen und generiert eine Liste von Abschnitten. Abschnitte sind aufeinander folgend, und die Obergrenze für einen Bereich ist die Untergrenze für den nächsten Bereich.

**Einstellungen**

` binNumber`— Anzahl der Fächer. Dieser Wert sollte größer als 0 sein. 

**Beispiel**

```
{
    "Statistic": "VALUE_DISTRIBUTION",
    "Parameters": {
        "binNumber": "5"
    }
}
```

### Z\_SCORE\_DISTRIBUTION
<a name="profile-column-parameter-Z-SCORE-DISTRIBUTION"></a>

Misst die Verteilung der Z-Werte von Werten in einer numerischen Spalte. Ein Jobprofil gruppiert Z-Werte von Werten nach numerischen Bereichen in Abschnitte und generiert eine Liste von Abschnitten. Abschnitte sind aufeinander folgend, und die Obergrenze für einen Bereich ist die Untergrenze für den nächsten Bereich.

**Einstellungen**

` binNumber`— Anzahl der Fächer. Dieser Wert sollte größer als 0 sein. 

**Beispiel**

```
{
    "Statistic": "Z_SCORE_DISTRIBUTION",
    "Parameters": {
        "binNumber": "5"
    }
}
```

## EntityDetectorConfiguration Abschnitt zur Konfiguration von PII
<a name="entity-detector-configuration"></a>

Im `EntityDetectorConfiguration` Abschnitt Ihrer Struktur können Sie die Entitätstypen in Ihrem Datensatz konfigurieren, die Sie als **persönlich identifizierbare Informationen** (PII) für eine Profilstelle erkennen möchten DataBrew .

### EntityTypes
<a name="w2aac19c15c13c23b5"></a>

Sie konfigurieren die Entitätstypen DataBrew , die Sie als personenbezogene Daten für Ihre Profilstelle erkennen möchten. Wenn undefiniert `EntityDetectorConfiguration` ist, ist die Entitätserkennung deaktiviert. Die folgenden Entitätstypen können in Ihrem Datensatz erkannt werden:
+ USA\_SSN
+ EMAIL
+ USA\_ITIN
+ USA\_PASSPORT\_NUMBER
+ PHONE\_NUMBER
+ USA\_DRIVING\_LICENSE
+ BANK\_ACCOUNT
+ CREDIT\_CARD
+ IP\_ADDRESS
+ MAC\_ADRESS
+ USA\_DEA\_NUMBER
+ USA\_HCPCS\_CODE
+ USA\_NATIONAL\_PROVIDER\_IDENTIFIER
+ USA\_NATIONAL\_DRUG\_CODE
+ USA\_HEALTH\_INSURANCE\_CLAIM\_NUMBER
+ USA\_MEDICARE\_BENEFICIARY\_IDENTIFIER
+ USA\_CPT\_CODE
+ PERSON\_NAME
+ DATE

Die Entitätstypgruppe `USA_ALL` wird ebenfalls unterstützt und umfasst alle oben genannten Entitätstypen außer `PERSON_NAME` und`DATE`.

Der Typ von `EntityTypes` ist ein Array von Zeichenketten.

### AllowedStatistics
<a name="w2aac19c15c13c23b7"></a>

Konfigurieren Sie die Statistiken, die für Spalten ausgeführt werden dürfen, die erkannte Entitäten enthalten. Wenn `AllowedStatistics` nicht definiert, werden keine Statistiken für Spalten berechnet, die erkannte Entitäten enthalten. Eine Liste der gültigen Werte [Konfigurierbare Statistiken auf Spaltenebene](#statistics.table02) für den Parameter finden Sie unter. `AllowedStatistics`

Der Typ von `AllowedStatistics` ist ein Array von `AllowedStatistics` Objekten.