Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Mengoptimalkan kinerja kueri untuk tabel Iceberg
Apache Iceberg adalah format tabel terbuka berkinerja tinggi untuk kumpulan data analitik besar. AWS Glue mendukung penghitungan dan pembaruan jumlah nilai berbeda (NDV) untuk setiap kolom dalam tabel Iceberg. Statistik ini dapat memfasilitasi pengoptimalan kueri yang lebih baik, manajemen data, dan efisiensi kinerja untuk insinyur data dan ilmuwan yang bekerja dengan kumpulan data skala besar.
AWS Glue memperkirakan jumlah nilai berbeda di setiap kolom tabel Iceberg dan menyimpannya dalam file
Anda dapat mengonfigurasi untuk menjalankan tugas pembuatan statistik kolom menggunakan AWS Glue konsol atau AWS CLI. Saat Anda memulai proses, AWS Glue memulai pekerjaan Spark di latar belakang dan memperbarui metadata AWS Glue tabel di Katalog Data. Anda dapat melihat statistik kolom menggunakan AWS Glue konsol atau AWS CLI atau dengan memanggil operasi GetColumnStatisticsForTable API.
catatan
Jika Anda menggunakan AWS Lake Formation izin untuk mengontrol akses ke tabel, peran yang diasumsikan oleh tugas statistik kolom memerlukan akses tabel penuh untuk menghasilkan statistik.