Amazon Redshift tidak akan lagi mendukung penggunaan Python UDF setelah 30 Juni 2026. Kami akan mulai menegakkannya secara bertahap. Untuk informasi lebih lanjut tentang detail opsi akhir masa pakai dan migrasi Python, lihat posting blog
Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Menggunakan tabel Apache Iceberg dengan Amazon Redshift
catatan
Untuk mencapai kinerja terbaik saat menggunakan tabel Apache Iceberg dengan Amazon Redshift, Anda harus membuat statistik kolom untuk tabel yang digunakan. AWS Glue Untuk informasi selengkapnya, lihat Menghasilkan statistik kolom untuk tabel Iceberg di Panduan Peng AWS Glue embang.
Topik ini menjelaskan cara menggunakan tabel dalam format Apache Iceberg dengan Amazon Redshift. Apache Iceberg adalah format tabel sumber terbuka berkinerja tinggi untuk danau data. Untuk informasi selengkapnya, lihat Apache Iceberg
Anda dapat menanyakan tabel Apache Iceberg yang dikatalogkan AWS Glue Data Catalog dengan Amazon Redshift. Jenis instance RG dan Redshift Serverless menggunakan komputasi mereka sendiri untuk memproses kueri data lake, sedangkan tipe instance RA3 menggunakan Redshift Spectrum. Untuk informasi selengkapnya, lihat Meng kueri Danau Data Anda.
Amazon Redshift menyediakan konsistensi transaksional untuk menanyakan tabel Apache Iceberg. Anda dapat memanipulasi data dalam tabel menggunakan layanan yang sesuai dengan ACID (atomisitas, konsistensi, isolasi, ketahanan) seperti Amazon Athena dan Amazon EMR saat menjalankan kueri menggunakan Amazon Redshift. Amazon Redshift dapat menggunakan statistik tabel yang disimpan dalam metadata Apache Iceberg untuk mengoptimalkan rencana kueri dan mengurangi pemindaian file selama pemrosesan kueri. Dengan Amazon Redshift SQL, Anda dapat menggabungkan tabel Redshift dengan tabel data lake.
Untuk mulai menggunakan tabel Iceberg dengan Amazon Redshift:
Buat tabel Apache Iceberg pada AWS Glue Data Catalog database menggunakan layanan yang kompatibel seperti Amazon Athena atau Amazon EMR. Untuk membuat tabel Iceberg menggunakan Athena, lihat Menggunakan tabel Apache Iceberg di Panduan Pengguna Amazon Athena.
Buat cluster Amazon Redshift atau kelompok kerja Redshift Serverless dengan peran IAM terkait yang memungkinkan akses ke danau data Anda. Untuk informasi tentang cara membuat cluster atau grup kerja, lihat Mem ulai dengan gudang data yang disediakan Amazon Redshift dan Mem ulai dengan gudang data Redshift Serverless di Panduan Memulai Amazon Redshift.
Hubungkan ke cluster atau workgroup menggunakan query editor v2 atau klien SQL pihak ketiga. Untuk informasi tentang cara menyambung menggunakan editor kueri v2, lihat Menghubungkan ke gudang data Amazon Redshift menggunakan alat klien SQL di Panduan Manajemen Amazon Redshift.
Buat skema eksternal di database Amazon Redshift Anda untuk database Katalog Data tertentu yang menyertakan tabel Iceberg Anda. Untuk informasi tentang membuat skema eksternal, lihatSkema eksternal di Amazon Redshift Spectrum.
Jalankan kueri SQL untuk mengakses tabel Iceberg dalam skema eksternal yang Anda buat.
Pertimbangan saat menggunakan tabel Apache Iceberg dengan Amazon Redshift
Pertimbangkan hal berikut saat menggunakan Amazon Redshift dengan tabel Iceberg:
-
Dukungan versi Iceberg — Amazon Redshift mendukung menjalankan kueri terhadap versi tabel Iceberg berikut:
-
Versi 1 mendefinisikan bagaimana tabel analitik besar dikelola menggunakan file data yang tidak dapat diubah.
-
Versi 2 menambahkan kemampuan untuk mendukung pembaruan dan penghapusan tingkat baris sambil menjaga file data yang ada tidak berubah, dan menangani perubahan data tabel menggunakan file hapus.
-
Versi 3 memperkenalkan nilai kolom default, pelacakan garis keturunan baris, dan vektor penghapusan. Nilai default memungkinkan Anda menentukan nilai awal untuk kolom yang diterapkan ketika nilai tidak disediakan secara eksplisit. Garis keturunan baris menyediakan kolom semu yang melacak identitas baris dan riwayat modifikasi. Vektor penghapusan menawarkan representasi penghapusan tingkat baris yang lebih ringkas, memungkinkan pembacaan dan penulisan yang lebih cepat dibandingkan dengan file hapus Iceberg v2. Untuk informasi selengkapnya, lihat Fitur Apache Iceberg v3 di Amazon Redshift.
Untuk perbedaan antara tabel versi 1, versi 2, dan versi 3, lihat Perubahan versi format
dalam dokumentasi Apache Iceberg. Untuk informasi selengkapnya tentang fitur Iceberg v3 yang didukung Amazon Redshift, dan batasan saat ini, lihat. Fitur Apache Iceberg v3 di Amazon Redshift
-
-
Menambahkan partisi — Anda tidak perlu menambahkan partisi secara manual untuk tabel Apache Iceberg Anda. Partisi baru di tabel Apache Iceberg secara otomatis terdeteksi oleh Amazon Redshift dan tidak diperlukan operasi manual untuk memperbarui partisi dalam definisi tabel. Setiap perubahan dalam spesifikasi partisi juga secara otomatis diterapkan ke kueri Anda tanpa campur tangan pengguna.
-
Menelan data Iceberg ke Amazon Redshift — Anda dapat menggunakan perintah INSERT INTO atau CREATE TABLE AS untuk mengimpor data dari tabel Iceberg Anda ke tabel Amazon Redshift lokal. Saat ini Anda tidak dapat menggunakan perintah COPY untuk menelan konten tabel Apache Iceberg ke tabel Amazon Redshift lokal.
-
Tampilan terwu jud — Anda dapat membuat tampilan terwujud pada tabel Apache Iceberg seperti tabel eksternal lainnya di Amazon Redshift. Pertimbangan yang sama untuk format tabel danau data lainnya berlaku untuk tabel Apache Iceberg. Penulisan ulang kueri otomatis dan tampilan terwujud otomatis pada tabel data lake saat ini tidak didukung.
-
AWS Lake Formation kontrol akses berbutir halus — Amazon Redshift mendukung kontrol akses berbutir AWS Lake Formation halus pada tabel Apache Iceberg.
-
User-defined parameter penanganan data — Amazon Redshift mendukung parameter penanganan data yang ditentukan pengguna pada tabel Apache Iceberg. Anda menggunakan parameter penanganan data yang ditentukan pengguna pada file yang ada untuk menyesuaikan data yang ditanyakan dalam tabel eksternal untuk menghindari kesalahan pemindaian. Parameter ini menyediakan kemampuan untuk menangani ketidakcocokan antara skema tabel dan data aktual pada file. Anda juga dapat menggunakan parameter penanganan data yang ditentukan pengguna pada tabel Apache Iceberg.
-
Kueri perjalanan waktu — Kueri perjalanan waktu saat ini tidak didukung dengan tabel Apache Iceberg.
-
Harga — Saat Anda mengakses tabel Iceberg dari cluster RG atau kelompok kerja Redshift Serverless, kueri data lake berjalan pada sumber daya komputasi cluster atau workgroup sendiri, sehingga tidak ada biaya terpisah untuk kueri data lake. Saat Anda mengakses tabel Iceberg dari cluster DC2 atau RA3, Anda akan dikenakan harga Redshift Spectrum. Untuk informasi tentang harga, lihat harga https://aws.amazon.com/redshift/pricing/
Amazon Redshift. -
Caching metadata — Caching metadata mengasumsikan file metadata tidak dapat diubah berdasarkan spesifikasi Iceberg. https://iceberg.apache.org/spec/#file-system-operations
Kekekalan file metadata adalah persyaratan untuk integritas data di Amazon Redshift. -
Identitas federasi — Identitas federasi tidak didukung saat menulis ke tabel Apache Iceberg. Ini termasuk menggunakan kata kunci SESSION untuk parameter IAM_ROLE saat membuat skema eksternal. Untuk informasi selengkapnya tentang parameter IAM_ROLE, lihat MEMBUAT SKEMA EKSTERNAL.