Amazon Redshift tidak akan lagi mendukung penggunaan Python UDF setelah 30 Juni 2026. Kami akan mulai menegakkannya secara bertahap. Untuk informasi lebih lanjut tentang detail opsi akhir masa pakai dan migrasi Python, lihat posting blog
Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Memuat data di Amazon Redshift
Ada beberapa cara untuk memuat data ke database Amazon Redshift. Salah satu sumber data yang populer untuk dimuat adalah file Amazon S3. Tabel berikut merangkum beberapa metode yang digunakan dengan mulai dari sumber Amazon S3.
| Metode untuk digunakan | Deskripsi | Ketika metode dibutuhkan |
|---|---|---|
Perintah SALIN |
Menjalankan penyerapan file batch untuk memuat data dari file Amazon S3 Anda. Metode ini memanfaatkan kemampuan pemrosesan paralel Amazon Redshift. Untuk informasi selengkapnya, lihat Memuat tabel dengan perintah COPY. |
Harus digunakan ketika persyaratan pemuatan data dasar untuk memulai penyerapan file batch secara manual diperlukan. Metode ini sebagian besar digunakan dengan saluran penyerapan file kustom dan pihak ketiga atau beban kerja penyerapan file satu kali, atau ad hoc. |
MENYALIN... Perintah CREATE JOB (salin otomatis) |
Menjalankan perintah COPY Anda secara otomatis saat file baru dibuat di jalur Amazon S3 yang dilacak. Untuk informasi selengkapnya, lihat Buat integrasi acara S3 untuk menyalin file secara otomatis dari bucket Amazon S3. |
Harus digunakan saat pipeline penyerapan file perlu menelan data secara otomatis saat file baru dibuat di Amazon S3. Amazon Redshift melacak file yang dicerna untuk mencegah duplikasi data. Metode ini memerlukan konfigurasi oleh pemilik bucket Amazon S3. |
Muat dari kueri danau data |
Buat tabel eksternal untuk menjalankan kueri data lake pada file Amazon S3 Anda, lalu jalankan perintah INSERT INTO untuk memuat hasil dari kueri data lake Anda ke tabel lokal. Untuk informasi selengkapnya, lihat Tabel eksternal untuk Redshift Spectrum. |
Harus digunakan dalam salah satu skenario berikut:
|
| Metode lain yang dapat Anda pertimbangkan | ||
Konsumsi streaming |
Penyerapan streaming menyediakan penyerapan data aliran berkecepatan tinggi dengan latensi rendah dari Amazon Kinesis Data Streams dan Amazon Managed Streaming untuk Apache Kafka ke dalam tampilan terwujud Amazon Redshift atau Redshift Serverless. Untuk informasi selengkapnya, lihat Memulai dengan konsumsi streaming dari Amazon Kinesis Data Streams dan Memulai dengan konsumsi streaming dari sumber Apache Kafka. |
Harus dipertimbangkan untuk kasus penggunaan ketika data pertama kali dialirkan ke file di Amazon S3 dan kemudian dimuat dari Amazon S3. Jika menyimpan data di Amazon S3 tidak diperlukan, Anda sering dapat mempertimbangkan streaming data Anda langsung ke Amazon Redshift. |
Menjalankan kueri danau data |
Menjalankan kueri langsung dari tabel danau data alih-alih menelan konten tabel ke tabel lokal. Untuk informasi selengkapnya, lihat Spektrum Pergeseran Merah Amazon. |
Harus digunakan ketika kasus penggunaan tidak memerlukan kinerja kueri tabel lokal di Amazon Redshift. |
Pemuatan batch menggunakan editor kueri Amazon Redshift v2 |
Anda dapat menyiapkan dan menjalankan beban kerja penyerapan file batch secara visual di editor kueri Amazon Redshift v2. Untuk informasi selengkapnya, lihat Memuat data dari S3 di Panduan Manajemen Amazon Redshift. |
Harus digunakan ketika Anda ingin editor kueri v2 menyiapkan pernyataan COPY dan Anda menginginkan alat visual untuk menyederhanakan proses persiapan pernyataan COPY. |
Muat data dari file lokal menggunakan editor kueri Amazon Redshift v2 |
Anda dapat langsung mengunggah file dari desktop Anda ke tabel Amazon Redshift tanpa perlu mengunggah file Anda secara manual ke Amazon S3. Untuk informasi selengkapnya, lihat Memuat data dari pengaturan file lokal dan alur kerja di Panduan Manajemen Amazon Redshift. |
Harus digunakan ketika Anda perlu memuat file dengan cepat dari komputer lokal Anda untuk tujuan kueri satu kali. Dengan metode ini, editor kueri Amazon Redshift v2 menyimpan file sementara di bucket Amazon S3 milik pelanggan dan menjalankan perintah salin menggunakan jalur Amazon S3 ini. |
Perintah COPY adalah cara paling efisien untuk memuat tabel. Anda juga dapat menambahkan data ke tabel Anda menggunakan perintah INSERT, meskipun jauh kurang efisien daripada menggunakan COPY. Perintah COPY dapat membaca dari beberapa file data atau beberapa aliran data secara bersamaan. Amazon Redshift mengalokasikan beban kerja ke node Amazon Redshift dan melakukan operasi pemuatan secara paralel, termasuk menyortir baris dan mendistribusikan data di seluruh irisan node.
catatan
Tabel eksternal Amazon Redshift Spectrum bersifat read-only. Anda tidak dapat menyalin atau menyisipkan ke tabel eksternal.
Untuk mengakses data pada AWS sumber daya lain, Amazon Redshift harus memiliki izin untuk mengakses sumber daya tersebut dan untuk melakukan tindakan yang diperlukan untuk mengakses data. Anda dapat menggunakan AWS Identity and Access Management (IAM) untuk membatasi akses yang dimiliki pengguna ke sumber daya dan data Amazon Redshift.
Setelah data awal dimuat, jika Anda menambahkan, memodifikasi, atau menghapus sejumlah besar data, Anda harus menindaklanjuti dengan menjalankan perintah VACUUM untuk mengatur ulang data Anda dan merebut kembali ruang setelah dihapus. Anda juga harus menjalankan perintah ANALYZE untuk memperbarui statistik tabel.