View a markdown version of this page

Mengoptimalkan kinerja kueri untuk tabel Iceberg - AWS Lem

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Mengoptimalkan kinerja kueri untuk tabel Iceberg

Apache Iceberg adalah format tabel terbuka berkinerja tinggi untuk kumpulan data analitik besar. AWS Glue mendukung penghitungan dan pembaruan jumlah nilai berbeda (NDV) untuk setiap kolom dalam tabel Iceberg. Statistik ini dapat memfasilitasi pengoptimalan kueri yang lebih baik, manajemen data, dan efisiensi kinerja untuk insinyur data dan ilmuwan yang bekerja dengan kumpulan data skala besar.

AWS Glue memperkirakan jumlah nilai berbeda di setiap kolom tabel Iceberg dan menyimpannya dalam file Puffin di Amazon S3 yang terkait dengan snapshot tabel Iceberg. Puffin adalah format file Iceberg yang dirancang untuk menyimpan metadata seperti indeks, statistik, dan sketsa. Menyimpan sketsa dalam file Puffin yang terkait dengan snapshot memastikan konsistensi transaksional dan kesegaran statistik NDV. Pembuatan statistik NDV didukung untuk tabel Apache Iceberg v2 dan v3. Untuk tabel Iceberg v3, Anda dapat menghasilkan statistik NDV untuk tabel Iceberg yang menyertakan kolom stempel waktu presisi v3 nanosecond.

Anda dapat mengonfigurasi untuk menjalankan tugas pembuatan statistik kolom menggunakan AWS Glue konsol atau AWS CLI. Saat Anda memulai proses, AWS Glue memulai pekerjaan Spark di latar belakang dan memperbarui metadata AWS Glue tabel di Katalog Data. Anda dapat melihat statistik kolom menggunakan AWS Glue konsol atau AWS CLI atau dengan memanggil operasi GetColumnStatisticsForTable API.

catatan

Jika Anda menggunakan AWS Lake Formation izin untuk mengontrol akses ke tabel, peran yang diasumsikan oleh tugas statistik kolom memerlukan akses tabel penuh untuk menghasilkan statistik.

Lihat juga