

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

# Membangun konfigurasi pekerjaan profil secara terprogram di AWS Glue DataBrew
<a name="profile.configuration"></a>

Di bagian ini, Anda dapat menemukan deskripsi langkah dan fungsi pekerjaan profil yang dapat Anda gunakan secara terprogram. Anda dapat menggunakannya baik dari AWS Command Line Interface(AWS CLI) atau dengan menggunakan salah satu AWS SDK.

Dalam pekerjaan profil, Anda dapat menyesuaikan konfigurasi untuk mengontrol cara DataBrew mengevaluasi kumpulan data Anda. Anda dapat menerapkan konfigurasi ke kumpulan data atau menerapkannya ke kolom tertentu. Anda dapat membangun konfigurasi saat membuat pekerjaan profil, dan kemudian memperbaruinya kapan saja.

Struktur konfigurasi profil mencakup empat bagian:
+ [ProfileColumns bagian](#profile-columns.statistics)
+ [DatasetStatisticsConfiguration bagian](#profile-dataset-stats-config)
+ [ColumnStatisticsConfigurations bagian](#profile-column-stats-config)
+ [EntityDetectorConfiguration bagian untuk mengkonfigurasi PII](#entity-detector-configuration)

Berikut adalah contohnya.

```
{
    "ProfileColumns": [
        {
            "Name": "example"
        },
        {
            "Regex": "example.*"
        }
    ],
    "DatasetStatisticsConfiguration": {
        "IncludedStatistics": [
            "CORRELATION"
        ],
        "Overrides": [
            {
                "Statistic": "CORRELATION",
                "Parameters": {
                    "columnSelectors": "[{\"name\":\"example\"}, {\"regex\":\"example.*\"}]"
                }
            }
        ]
    },
    "ColumnStatisticsConfigurations": [
        {
            "Selectors": [
                {
                    "Name": "example"
                }
            ],
            "Statistics": {
                "IncludedStatistics": [
                    "CORRELATION",
                    "DUPLICATE_ROWS_COUNT"
                ],
                "Overrides": [
                    {
                        "Statistic": "VALUE_DISTRIBUTION",
                        "Parameters": {
                            "binNumber": "10"
                        }
                    }
                ]
            }
        }
    ]
}
```

## ProfileColumns bagian
<a name="profile-columns.statistics"></a>

Di `ProfileColumns` bagian struktur Anda, atur kolom dari kumpulan data yang ingin Anda evaluasi dalam pekerjaan profil Anda. `ProfileColumns`adalah daftar pemilih kolom (`Selectors`). Anda dapat menentukan nama kolom atau ekspresi reguler dalam pemilih kolom. Berikut contohnya.

```
"ProfileColumns": [{"Name": "example"}, {"Regex": "example.*"}]
```

Kapan `ProfileColumns` ditentukan, hanya kolom yang namanya cocok dengan nama atau ekspresi reguler `ProfileColumns` yang disertakan dalam pekerjaan profil. Jika pekerjaan profil tidak mendukung tipe data kolom yang dipilih, DataBrew lewati kolom yang dipilih selama pekerjaan dijalankan.

Jika tidak ProfileColumns ditentukan, pekerjaan profil mengevaluasi semua kolom yang didukung. Kolom yang didukung adalah kolom yang berisi data tipe data yang didukung: `ByteType``ShortType`,`IntegerType`,`LongType`,`FloatType`,`DoubleType`,,`String`, atau`Boolean`.

## DatasetStatisticsConfiguration bagian
<a name="profile-dataset-stats-config"></a>

Di `DatasetStatisticsConfiguration` bagian struktur Anda, Anda dapat membangun konfigurasi untuk evaluasi antar kolom. Konfigurasi termasuk `IncludedStatistics` dan`Overrides`. Berikut contohnya.

```
"DatasetStatisticsConfiguration": {
    "IncludedStatistics": ["CORRELATION"],
    "Overrides": [
        {
            "Statistic": "CORRELATION",
            "Parameters": {
                "columnSelectors": "[{\"name\":\"example\"}, {\"regex\":\"example.*\"}]"
            }
        }
    ]
}
```

Anda dapat memilih evaluasi yang ingin Anda miliki dengan menambahkan nama evaluasi. `IncludedStatistics` Berikut contohnya.

```
"IncludedStatistics": ["CORRELATION", "DUPLICATE_ROWS_COUNT"]
```

Saat Anda menentukan`IncludedStatistics`, hanya evaluasi dalam daftar yang disertakan dalam pekerjaan profil. Jika tidak `IncludedStatistics` ditentukan, pekerjaan profil menjalankan semua evaluasi yang didukung dengan pengaturan default. Anda dapat mengecualikan semua evaluasi dengan menambahkan NONE ke`IncludedStatistics`. Berikut contohnya.

```
"IncludedStatistics": ["NONE"]
```

### Statistik yang dapat dikonfigurasi pada tingkat dataset
<a name="statistics.table01"></a>

Di `DatasetStatisticsConfiguration` bagian struktur Anda, pekerjaan profil mendukung evaluasi yang ditunjukkan pada tabel berikut.


| **Nama statistik** | **Deskripsi** | **Tipe data yang didukung** | **Status default** | **Atribut hasil profil** | **Jenis hasil profil** | 
| --- | --- | --- | --- | --- | --- | 
| DUPLIKATE\_ROWS\_COUNT | Hitungan baris duplikat dalam kumpulan data | all | Aktifkan | duplikat RowsCount | Int | 
| KORELASI | Koefisien Korelasi Pearson antara dua kolom | number | Aktifkan | korelasi (di setiap kolom yang dipilih) | Objek | 

Di`IncludedStatistics`, Anda dapat mengganti setelan default setiap evaluasi dengan menambahkan penggantian. Setiap penggantian mencakup nama evaluasi tertentu dan peta parameter.

Di`DatasetStatisticsConfiguration`, pekerjaan profil mendukung `CORRELATION` penggantian. Penggantian ini menghitung Koefisien Korelasi Pearson antara dua kolom dari daftar kolom yang dipilih. Pengaturan default adalah memilih 10 kolom numerik pertama. Anda dapat menentukan sejumlah kolom atau daftar pemilih kolom untuk mengganti pengaturan default.

`CORRELATION`mengambil parameter ini:
+ `columnNumber`— Jumlah kolom numerik. Pekerjaan profil memilih *n* kolom pertama dari kumpulan data. Nilai ini harus lebih besar dari 1. Gunakan `"ALL"` untuk memilih semua kolom numerik.
+ `columnSelectors:`— Daftar pemilih kolom. Setiap pemilih dapat memiliki nama kolom atau ekspresi reguler.

Berikut contohnya.

```
{
    "Statistic": "CORRELATION",
    "Parameters": {
        "columnSelectors": "[{\"name\":\"example\"}, {\"regex\":\"example.*\"}]"
    }
}
```

## ColumnStatisticsConfigurations bagian
<a name="profile-column-stats-config"></a>

Di `ColumnStatisticsConfigurations` bagian struktur Anda, Anda dapat membangun konfigurasi untuk kolom tertentu. `ColumnStatisticsConfigurations`adalah daftar `ColumnStatisticsConfiguration` pengaturan. Di`ColumnStatisticsConfiguration`, ada`Selectors`, daftar pemilih kolom, dan `Statistics` untuk konfigurasi statistik. Berikut contohnya.

```
{ 
    "Selectors": [{"Name": "example"}
    ],
    "Statistics": {
       "IncludedStatistics": ["CORRELATION", "DUPLICATE_ROWS_COUNT"]
        "Overrides": [
            {
                "Statistic": "VALUE_DISTRIBUTION",
                "Parameters": {
                    "binNumber": "10"
                }
            }
        ]
    }
}
```

`Selectors`adalah daftar pemilih kolom. Seperti halnya`ProfileColumns`, Anda dapat menentukan nama kolom atau ekspresi reguler di setiap pemilih kolom. Saat Anda menentukan`Selectors`, konfigurasi kolom diterapkan ke kolom yang cocok dengan pemilih kolom mana pun. `Selectors` Jika tidak, konfigurasi diterapkan ke semua kolom yang didukung.

Di`Statistics`, Anda dapat mengganti pengaturan kolom yang dipilih. Seperti halnya`DatasetStatisticsConfiguration`, `Statistics` memiliki `IncludedStatistics` dan`Overrides`.

Untuk memilih evaluasi yang Anda inginkan, tambahkan nama evaluasi ke`IncludedStatistics`. 

```
"IncludedStatistics": ["CORRELATION", "DUPLICATE_ROWS_COUNT"]                    
```

Saat Anda menentukan`IncludedStatistics`, hanya evaluasi dalam daftar yang disertakan dalam pekerjaan profil. Jika tidak, pekerjaan profil menjalankan semua evaluasi yang didukung dengan pengaturan default.

Anda dapat mengecualikan semua evaluasi dengan menambahkan `NONE` ke`IncludedStatistics`.

```
"IncludedStatistics": ["NONE"]                    
```

 Dalam beberapa kasus, mungkin ada beberapa konfigurasi yang berbeda `ColumnStatisticsConfigurations` `IncludedStatistics` yang dapat Anda terapkan ke kolom yang sama. Dalam kasus ini, pekerjaan profil memilih konfigurasi terakhir `ColumnStatisticsConfigurations` dan menerapkannya `IncludedStatistics` ke kolom yang dipilih. Konfigurasi baru mengesampingkan konfigurasi yang lebih lama.

### Statistik yang dapat dikonfigurasi di tingkat kolom
<a name="statistics.table02"></a>

Di`ColumnStatisticsConfigurations`, pekerjaan profil mendukung evaluasi yang ditunjukkan pada tabel berikut.

Tipe data yang didukung `number` dalam tabel ini berarti bahwa tipe data atribut adalah salah satu dari berikut:`ByteType`,`ShortType`,`IntegerType`,`LongType`,`FloatType`, atau`DoubleType`.


| **Nama statistik** | **Deskripsi** | **Tipe data yang didukung** | **Status default** | **Atribut hasil profil** | **Jenis hasil profil** | 
| --- | --- | --- | --- | --- | --- | 
| – | Nama kolomnya. | all | – | name | string | 
| – | Tipe data kolom. | all | – | jenis | string | 
| DISTINCT\_VALUES\_COUNT | Jumlah nilai yang berbeda. *Nilai yang berbeda* adalah nilai yang muncul setidaknya sekali. | number/boolean/string | Diaktifkan | berbeda ValuesCount | Int | 
| ENTROPI | Entropi (teori informasi). | number/boolean/string | Diaktifkan | entropi | Ganda | 
| INTER\_QUARTILE\_RANGE | Kisaran antara 25 persen dan 75 persen dari angka. | number | Diaktifkan | InterQuartileRange | Ganda | 
| KURTOSIS | Kurtosis kolom. | number | Diaktifkan | kurtosis | Ganda | 
| MAX | Nilai maksimum di kolom. | number/string panjang | Diaktifkan | max | Int/Double | 
| MAXIMUM\_VALUES | Daftar nilai maksimum di kolom dan hitungannya. | number | Diaktifkan | MaximumValues | Daftar | 
| MEAN | Nilai rata-rata nilai di kolom. | number/string panjang | Diaktifkan | kejam | Ganda | 
| MEDIAN | Median nilai di kolom. | number/string panjang | Diaktifkan | median | Ganda | 
| MEDIAN\_ABSOLUTE\_DEVIASI | Median perbedaan absolut antara setiap titik data dan median kolom numerik. | number | Diaktifkan | median AbsoluteDeviation | Ganda | 
| MIN | Nilai minimum di kolom. | number/string panjang | Diaktifkan | min | Int/Double | 
| MINIMUM\_VALUES | Daftar nilai minimum di kolom dan hitungannya. | number | Diaktifkan | MinimumValues | Daftar | 
| HILANG\_VALUES\_COUNT | Jumlah nilai yang hilang di kolom. String nol dan kosong dianggap hilang. | all | Diaktifkan | hilang ValuesCount | Int | 
| MODE | Nilai yang paling sering terjadi di kolom. Jika beberapa nilai sering muncul, mode adalah salah satu nilai tersebut. | number/string panjang | Diaktifkan | Mode | Int/Double | 
| MOST\_COMMON\_VALUES | Daftar nilai yang paling umum di kolom. | number/boolean/string | Diaktifkan | paling CommonValues | Daftar | 
| OUTLIER\_DETECTION | Mendeteksi outlier di kolom dengan algoritma Z\_score. Hitung jumlah outlier dan ekstrak daftar sampel dari outlier yang terdeteksi. | number/string panjang | Diaktifkan | zScoreOutliersCount, z ScoreOutliersSample | Int/List | 
| PERSENTIL | Nilai persentil kolom numerik (5%, 25%, 75%, 95%). | number | Diaktifkan | persentil5, persentil25, persentil75, persentil95 | Ganda | 
| RANGE | Rentang nilai di kolom. | number | Diaktifkan | jangkauan | Int/Double | 
| KEMIRINGAN | Kemiringan nilai di kolom. | number | Diaktifkan | kemiringan | Ganda | 
| STANDARD\_DEVIASI | Deviasi standar sampel yang tidak bias dari nilai di kolom. | number/string panjang | Diaktifkan | StandarDeviasi | Ganda | 
| JUMLAH | Jumlah nilai di kolom. | number | Diaktifkan | sum | Int/Double | 
| UNIK\_VALUES\_COUNT | Jumlah nilai unik. Nilai unik berarti bahwa nilai hanya muncul sekali. | number/boolean/string | Diaktifkan | unik ValuesCount | Int | 
| VALUE\_DISTRIBUTION | Ukur distribusi nilai dalam kolom berdasarkan rentang. | number/string panjang | Diaktifkan | Distribusi Nilai | Daftar | 
| PERBEDAAN | Varians nilai di kolom. | number | Diaktifkan | perbedaan | Ganda | 
| Z\_SCORE\_DISTRIBUTION | Ukur distribusi nilai z-skor titik data berdasarkan rentang. | number | Diaktifkan | z ScoreDistribution | Daftar | 
| ZEROS\_COUNT | Jumlah nol (0s) di kolom. | number | Diaktifkan | ZerosCount | Int | 

Di`IncludedStatistics`, Anda dapat mengganti setiap parameter default evaluasi dengan menambahkan override. Setiap penggantian mencakup nama evaluasi tertentu dan peta parameter.

## Parameter untuk ColumnStatisticsConfigurations kolom
<a name="profile-column-parameters"></a>

Di`ColumnStatisticsConfigurations`, pekerjaan profil mendukung parameter berikut. 

Dalam beberapa kasus, mungkin ada beberapa konfigurasi yang berbeda `ColumnStatisticsConfigurations` `IncludedStatistics` yang dapat Anda terapkan ke kolom yang sama. Dalam kasus ini, pekerjaan profil memilih konfigurasi terakhir `ColumnStatisticsConfigurations` dan menerapkannya `IncludedStatistics` ke kolom yang dipilih. Konfigurasi baru mengesampingkan konfigurasi yang lebih lama.

### MAXIMUM\_VALUES
<a name="profile-column-parameter-MAXIMUM-VALUES"></a>

Daftar nilai maksimum di kolom numerik dan jumlahnya. Ukuran daftar default adalah 5. Anda dapat mengganti ukuran daftar dengan menentukan nilai untuk. `sampleSize`

**Pengaturan**

`sampleSize`— Ukuran daftar yang mencakup jumlah maksimum dan jumlah nilai dalam kolom numerik. Nilai ini harus lebih besar dari 0. Gunakan `"ALL"` untuk daftar semua nilai. 

**Contoh**

```
{ 
    "Statistic": "MAXIMUM_VALUES",
    "Parameters": {
        "sampleSize": "5"
    }
}
```

### MINIMUM\_VALUES
<a name="profile-column-parameter-MINIMUM-VALUES"></a>

Daftar nilai minimum di kolom numerik dan jumlahnya. Ukuran daftar default adalah 5. Anda dapat mengganti ukuran daftar dengan menentukan nilai untuk. `sampleSize`

**Pengaturan**

`sampleSize`— Ukuran daftar yang mencakup jumlah maksimum dan jumlah nilai dalam kolom numerik. Nilai ini harus lebih besar dari 0. Gunakan `"ALL"` untuk daftar semua nilai. 

**Contoh**

```
{
    "Statistic": "MINIMUM_VALUES",
    "Parameters": {
        "sampleSize": "5"
    }
}
```

### MOST\_COMMON\_VALUES
<a name="profile-column-parameter-MOST-COMMON-VALUES"></a>

Daftar nilai yang paling umum di kolom dan jumlahnya. Ukuran daftar default adalah 50. Anda dapat mengganti ukuran daftar dengan menentukan nilai untuk. `sampleSize`

**Pengaturan**

`sampleSize`— Ukuran daftar yang mencakup jumlah maksimum dan jumlah nilai dalam kolom numerik. Nilai ini harus lebih besar dari 0. Gunakan `"ALL"` untuk daftar semua nilai.

**Contoh**

```
{
    "Statistic": "MOST_COMMON_VALUES",
    "Parameters": {
        "sampleSize": "50"
    }
}
```

### OUTLIER\_DETECTION
<a name="profile-column-parameter-OUTLIER-DETECTION"></a>

Mendeteksi outlier di kolom numerik atau kolom string (berdasarkan panjang string) dengan algoritma Z\_score. 

Pekerjaan profil Anda menghitung jumlah outlier dan menghasilkan daftar sampel outlier dan z-score mereka. Daftar sampel diurutkan berdasarkan nilai absolut skor-z. Ukuran daftar default adalah 50.

Algoritma Z\_Score mengidentifikasi nilai sebagai outlier ketika menyimpang dari rata-rata dengan lebih dari ambang standar deviasi. Ambang batas outlier default adalah 3.

Anda dapat memberikan satu ambang batas lagi, ambang batas ringan, untuk mendapatkan informasi lebih lanjut. Ambang batas ringan Anda harus kurang dari ambang batas Anda. Fitur ini dimatikan secara default. Ketika ambang batas ringan ditentukan, pekerjaan profil Anda mengembalikan satu hitungan lagi,`zScoreMildOutliersCount`. Juga, `zScoreOutliersSample` dapat mencakup sampel outlier ambang batas ringan dalam kasus ini.

**Pengaturan**
+ `threshold`— Nilai ambang yang digunakan saat mendeteksi outlier. Nilai ini harus lebih besar atau sama dengan 0. 
+ `mildThreshold`— Nilai ambang batas ringan untuk digunakan saat mendeteksi outlier. Nilai ini harus lebih besar atau sama dengan 0 dan kurang dari`threshold`.
+ `sampleSize`— Ukuran daftar yang mencakup outlier di kolom. Gunakan `"ALL"` untuk daftar semua nilai.

**Contoh**

```
{
    "Statistic": "OUTLIER_DETECTION",
    "Parameters": {
        "threshold": "5",
        "mildThreshold": "3.5",
        "sampleSize": "20"
    }
}
```

### VALUE\_DISTRIBUTION
<a name="profile-column-parameter-VALUE-DISTRIBUTION"></a>

Mengukur distribusi nilai di kolom dengan rentang nilai. Pekerjaan profil mengelompokkan nilai dari kolom numerik atau kolom string (berdasarkan panjang string) ke dalam bin berdasarkan rentang numerik, dan menghasilkan daftar bin. Tempat sampah berurutan, dan batas atas untuk ember adalah batas bawah untuk ember berikutnya.

**Pengaturan**

` binNumber`— Jumlah tempat sampah. Nilai ini harus lebih besar dari 0. 

**Contoh**

```
{
    "Statistic": "VALUE_DISTRIBUTION",
    "Parameters": {
        "binNumber": "5"
    }
}
```

### Z\_SCORE\_DISTRIBUTION
<a name="profile-column-parameter-Z-SCORE-DISTRIBUTION"></a>

Mengukur distribusi nilai z-skor di kolom numerik. Pekerjaan profil mengelompokkan z-skor nilai ke dalam bin berdasarkan rentang numerik, dan menghasilkan daftar tempat sampah. Tempat sampah berurutan, dan batas atas untuk ember adalah batas bawah untuk ember berikutnya.

**Pengaturan**

` binNumber`— Jumlah tempat sampah. Nilai ini harus lebih besar dari 0. 

**Contoh**

```
{
    "Statistic": "Z_SCORE_DISTRIBUTION",
    "Parameters": {
        "binNumber": "5"
    }
}
```

## EntityDetectorConfiguration bagian untuk mengkonfigurasi PII
<a name="entity-detector-configuration"></a>

Di `EntityDetectorConfiguration` bagian struktur Anda, Anda dapat mengonfigurasi jenis entitas dalam kumpulan data yang DataBrew ingin Anda deteksi sebagai **informasi identifikasi pribadi** (PII) untuk pekerjaan profil.

### EntityTypes
<a name="w2aac19c15c13c23b5"></a>

Anda mengonfigurasi jenis entitas yang DataBrew ingin Anda deteksi sebagai PII untuk pekerjaan profil Anda. Kapan tidak `EntityDetectorConfiguration` terdefinisi, deteksi entitas dinonaktifkan. Jenis entitas berikut dapat dideteksi dalam kumpulan data Anda:
+ USA\_SSN
+ Email
+ USA\_ITIN
+ USA\_PASSPORT\_NUMBER
+ TELEPON\_NOMOR
+ USA\_DRIVING\_LICENSE
+ BANK\_ACCOUNT
+ KARTU KREDIT
+ IP\_ALAMAT
+ ALAMAT MAC\_
+ USA\_DEA\_NUMBER
+ USA\_HCPCS\_CODE
+ USA\_NATIONAL\_PROVIDER\_IDENTIFIER
+ USA\_NATIONAL\_DRUG\_CODE
+ USA\_HEALTH\_INSURANCE\_CLAIM\_NUMBER
+ USA\_MEDICARE\_BENEFICIARY\_IDENTIFIER
+ USA\_CPT\_CODE
+ PERSON\_NAME
+ DATE

Grup tipe entitas juga `USA_ALL` didukung, dan mencakup semua jenis entitas di atas kecuali `PERSON_NAME` dan`DATE`.

Tipe `EntityTypes` adalah array string.

### AllowedStatistics
<a name="w2aac19c15c13c23b7"></a>

Konfigurasikan statistik yang diizinkan untuk dijalankan pada kolom yang berisi entitas yang terdeteksi. Jika tidak `AllowedStatistics` terdefinisi, tidak ada statistik yang akan dihitung pada kolom yang berisi entitas yang terdeteksi. Lihat [Statistik yang dapat dikonfigurasi di tingkat kolom](#statistics.table02) daftar nilai yang valid untuk `AllowedStatistics` parameter.

Tipe `AllowedStatistics` adalah array `AllowedStatistics` objek.