View a markdown version of this page

Distribusi - AWS Lem

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Distribusi

Gunakan Distribution Analyzer untuk menghitung distribusi frekuensi nilai dalam kolom. Analyzer menghasilkan output yang berbeda tergantung pada tipe data kolom:

  • Kolom numerik — Menghasilkan histogram yang dibinasikan. Histogram membagi rentang nilai kolom menjadi interval lebar yang sama (bin) dan menghitung jumlah nilai di setiap bin.

  • String, tanggal, dan kolom non-numerik lainnya - Menghasilkan distribusi nilai yang menghitung frekuensi setiap nilai yang berbeda, diurutkan dalam urutan menurun berdasarkan frekuensi. Penganalisis hanya mengembalikan 20 nilai paling sering.

catatan

Anda dapat menggunakan Distribution Analyzer hanya di Analyzers blok kumpulan aturan DQDL Anda. Itu tidak dapat digunakan sebagai aturan.

Sintaksis

Distribution <COL_NAME> Distribution <COL_NAME> with bins = <BIN_COUNT> Distribution <COL_NAME> with bins = <BIN_COUNT>, rebin = <true|false>
  • COL_NAME — Nama kolom untuk dianalisis, atau AllColumns untuk menghitung distribusi untuk semua kolom dalam dataset.

    Jenis kolom yang didukung: Setiap jenis kolom

  • tempat sampah (opsional) — Jumlah tempat sampah (interval) yang digunakan untuk histogram kolom numerik. Nilai defaultnya adalah 20. Nilai maksimumnya adalah 20. Parameter ini tidak berpengaruh pada kolom non-numerik.

  • rebin (opsional) - Mengontrol perilaku rebinning otomatis. Ketika luapan melebihi ambang batas pada proses berturut-turut, penganalisis kembali secara otomatis. Nilai default-nya adalah true. Setel false untuk menjaga tepi tempat sampah tetap beku tanpa batas terlepas dari frekuensi luapan. Untuk informasi selengkapnya, lihat Rebinning otomatis.

Contoh - Distribusi dasar untuk satu kolom

Contoh berikut menghitung distribusi frekuensi untuk Salary kolom menggunakan 20 bin default:

Analyzers = [ Distribution "Salary" ]

Contoh - Jumlah tempat sampah khusus

Contoh berikut menghitung histogram untuk Age kolom menggunakan 10 bin:

Analyzers = [ Distribution "Age" with bins = 10 ]

Contoh - Distribusi untuk semua kolom

Contoh berikut menghitung distribusi untuk semua kolom dalam dataset. Kolom numerik menghasilkan histogram dengan 20 bin, dan kolom non-numerik menghasilkan distribusi nilai:

Analyzers = [ Distribution AllColumns ]

Contoh — Menggabungkan dengan aturan dan penganalisis lainnya

Contoh berikut menunjukkan kumpulan aturan yang menggabungkan aturan, penganalisis standar, dan Analyzer: Distribution

Rules = [ RowCount > 100, Completeness "Salary" > 0.9 ] Analyzers = [ Mean "Salary", StandardDeviation "Salary", Distribution "Salary" with bins = 15, Distribution "Department" ]

Format keluaran

Ketika Anda menjalankan Distribution Analyzer, itu menghasilkan statistik bernamaDistribution. Statistik skalar (seperti Mean atauSum) mengembalikan nilai numerik tunggal. DistributionStatistik, sebaliknya, mengembalikan hasil terstruktur:

  • BinEdges- Array yang mendefinisikan batas bin (untuk kolom numerik) atau nilai yang berbeda (untuk kolom non-numerik).

  • Count— Array frekuensi untuk setiap bin atau nilai.

Anda dapat mengambil hasil distribusi menggunakan ListDataQualityStatistics API atau GetDataQualityResult API. Untuk informasi selengkapnya tentang API Kualitas Data, lihat API Kualitas Data di Referensi API AWS Glue.

Perilaku nol

Penganalisis mengecualikan baris dengan nilai NULL di kolom target dari perhitungan bin.

Untuk informasi selengkapnya tentang tepi tempat sampah beku, pengamatan luapan, dan rebinning otomatis, lihat. Penganalisis Distribusi