View a markdown version of this page

Mengkueri danau data Anda - Amazon Redshift

Amazon Redshift tidak akan lagi mendukung penggunaan Python UDF setelah 30 Juni 2026. Kami akan mulai menegakkannya secara bertahap. Untuk informasi lebih lanjut tentang detail opsi akhir masa pakai dan migrasi Python, lihat posting blog yang diterbitkan pada 30 Juni 2025.

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Mengkueri danau data Anda

Anda dapat menggunakan Amazon Redshift untuk menanyakan data di Amazon S3 tanpa harus memuat data ke tabel Amazon Redshift. Amazon Redshift menyediakan kemampuan SQL yang dirancang untuk pemrosesan analitik online cepat (OLAP) dari kumpulan data yang sangat besar yang disimpan di cluster Amazon Redshift dan Amazon S3 data lake. Anda dapat menanyakan data dalam berbagai format, termasuk Iceberg, Parquet, ORC, RCFile,,,, OpenCSV TextFile SequenceFile RegexSerde, dan AVRO. Untuk menentukan struktur file di Amazon S3, Anda membuat skema dan tabel eksternal. Kemudian, Anda menggunakan katalog data eksternal seperti AWS Glue atau metastore Apache Hive Anda sendiri. Perubahan pada salah satu jenis katalog data segera tersedia untuk salah satu cluster Amazon Redshift Anda.

Setelah data Anda terdaftar dengan Katalog AWS Glue Data dan diaktifkan dengan AWS Lake Formation, Anda dapat mulai menanyakan data lake Anda.

Anda dapat mempartisi tabel eksternal pada satu atau lebih kolom untuk mengoptimalkan kinerja kueri melalui penghapusan partisi. Anda dapat menanyakan dan bergabung dengan tabel eksternal dengan tabel Amazon Redshift. Anda dapat mengakses tabel eksternal dari beberapa cluster Amazon Redshift dan menanyakan data Amazon S3 dari cluster mana pun di Wilayah yang sama AWS . Saat Anda memperbarui file data Amazon S3, data segera tersedia untuk kueri dari salah satu cluster Amazon Redshift Anda.

Menggunakan mesin kueri data lake terintegrasi untuk RG dan Redshift Serverless

Cluster Amazon Redshift RG dan Amazon Redshift Serverless menyertakan mesin kueri data lake terintegrasi yang berjalan pada sumber daya komputasi cluster sendiri, memberikan pengalaman terpadu untuk kasus penggunaan data lake dan data warehouse.

Mesin kueri data lake terintegrasi menghilangkan persyaratan untuk menggunakan Redshift Spectrum dan menghilangkan biaya Spektrum Pergeseran Merah terkait. Mesin kueri data lake terintegrasi juga mendukung kueri data di bucket Amazon S3 yang terletak di Wilayah yang berbeda AWS . Cross-region permintaan dikenakan biaya transfer data tambahan. Tidak diperlukan konfigurasi tambahan untuk mengaktifkan mesin kueri danau data terintegrasi karena diaktifkan secara default.

catatan

Dalam beberapa kasus, Anda mungkin mengamati kinerja yang lebih lambat pada RG dibandingkan dengan klaster RA3 yang menjalankan Redshift Spectrum, yang menskalakan secara independen menggunakan sumber daya komputasi khusus. Jika Anda mengamati kinerja kueri yang lebih lambat, pertimbangkan untuk menambahkan lebih banyak node atau meningkatkan ke ukuran instance RG yang lebih besar.

Menggunakan Redshift Spectrum untuk DC2 dan RA3

Pada cluster yang disediakan DC2 dan RA3, Redshift Spectrum berada di server khusus Amazon Redshift yang independen dari cluster Anda. Redshift Spectrum mendorong banyak tugas intensif komputasi, seperti penyaringan predikat dan agregasi, ke lapisan Redshift Spectrum. Redshift Spectrum juga menskalakan secara cerdas untuk memanfaatkan pemrosesan paralel besar-besaran.

Untuk informasi selengkapnya tentang Redshift Spectrum, termasuk cara bekerja dengan Redshift Spectrum dan data lake, lihat Memulai Amazon Redshift Spectrum di Panduan Pengembang Database Amazon Redshift.