Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Sumber data yang didukung untuk crawling
Crawler dapat melakukan perayapan pada penyimpanan data berbasis file dan berbasis tabel berikut.
| Jenis akses yang digunakan oleh crawler | Penyimpanan data |
|---|---|
| Klien asli |
|
| JDBC |
Amazon Redshift Kepingan salju Dalam Amazon Relational Database Service (Amazon RDS) atau eksternal ke Amazon RDS:
|
| Klien MongoDB |
|
catatan
Saat ini AWS Glue tidak mendukung crawler untuk aliran data.
Untuk penyimpanan data JDBC, MongoDB, MongoDB Atlas, dan Amazon DocumentDB (dengan kompatibilitas MongoDB), Anda harus menentukan AWS Glue koneksi yang dapat digunakan crawler untuk terhubung ke penyimpanan data. Untuk Amazon S3, Anda dapat menentukan sebuah koneksi tipe Jaringan. Sebuah koneksi adalah objek Katalog Data yang menyimpan informasi koneksi, seperti kredensial, URL, informasi Amazon Virtual Private Cloud, dan banyak lagi. Untuk informasi selengkapnya, lihat Menghubungkan ke data.
Berikut ini adalah versi driver yang didukung oleh crawler:
| Produk | Driver yang didukung perayap |
|---|---|
| PostgreSQL | 42.2.1 |
| Amazon Aurora | Sama seperti driver crawler asli |
| MariaDB | 8.0.13 |
| Microsoft SQL Server | 6.1.0 |
| MySQL | 8.0.13 |
| Oracle | 11.2.2 |
| Amazon Redshift | 4.1 |
| Kepingan salju | 3.13.20 |
| MongoDB | 4.7.2 |
| Atlas MongoDB | 4.7.2 |
Berikut ini adalah catatan tentang berbagai penyimpanan data.
- Amazon S3
-
Anda dapat memilih untuk melakukan perayapan pada sebuah path di akun Anda atau di akun lain. Jika semua file Amazon S3 dalam folder memiliki skema yang sama, maka crawler menciptakan sebuah tabel. Selain itu, jika objek Amazon S3 dipartisi, maka hanya akan ada satu tabel metadata yang dibuat dan informasi partisi ditambahkan ke Katalog Data untuk tabel tersebut.
- Amazon S3 dan Amazon DynamoDB
-
Crawler menggunakan peran AWS Identity and Access Management (IAM) untuk izin mengakses penyimpanan data Anda. Peran yang Anda berikan ke crawler harus memiliki izin untuk mengakses path Amazon S3 dan tabel Amazon DynamoDB yang di-crawl.
- Amazon DynamoDB
-
Saat menentukan crawler menggunakan konsol AWS Glue, Anda menentukan satu tabel DynamoDB. Jika Anda menggunakan API AWS Glue, Anda dapat menentukan sebuah daftar tabel. Anda dapat memilih untuk melakukan perayapan hanya pada sampel kecil data untuk mengurangi waktu aktif crawler.
- Danau Delta
-
Untuk setiap penyimpanan data Danau Delta, Anda menentukan cara membuat tabel Delta:
Buat tabel asli: Izinkan integrasi dengan mesin kueri yang mendukung kueri log transaksi Delta secara langsung. Untuk informasi selengkapnya, lihat Kueri tabel Delta Lake.
Buat tabel Symlink: Buat
_symlink_manifestfolder dengan file manifes yang dipartisi oleh kunci partisi, berdasarkan parameter konfigurasi yang ditentukan.
- Gunung es
-
Untuk setiap penyimpanan data Iceberg, Anda menentukan jalur Amazon S3 yang berisi metadata untuk tabel Iceberg Anda. Jika crawler menemukan metadata tabel Iceberg, ia mendaftarkannya di Katalog Data. Anda dapat mengatur jadwal untuk crawler agar tabel tetap diperbarui.
Hindari penulis bersamaan dengan perayap gunung es
Gunakan crawler Iceberg hanya jika itu adalah satu-satunya penulis untuk tabel Katalog Data. Jangan menggunakannya bersama penulis bersamaan seperti pengoptimal tabel, Apache Spark, atau mesin lain yang berkomitmen langsung ke tabel yang sama.
Perayap menyinkronkan metadata Iceberg dari katalog eksternal dan harus menjadi satu-satunya penulis ke tabel. Jika penulis lain memodifikasi tabel Katalog Data saat crawler sedang berjalan, crawler gagal memperbarui tabel.
Jenis data Iceberg v3 tidak didukung
AWS Glue crawler tidak mendukung tipe data Iceberg v3, termasuk VARIANT, UNKNOWN, Geography, dan Geometry. Tabel yang berisi kolom dengan tipe data ini tidak dapat di-crawl.
Anda dapat menentukan parameter ini untuk penyimpanan data:
Pengecualian: Memungkinkan Anda untuk melewati folder tertentu.
Kedalaman Penjelajahan Maksimum: Menetapkan batas kedalaman yang dapat dirayapi crawler di bucket Amazon S3 Anda. Kedalaman traversal maksimum default adalah 10 dan kedalaman maksimum yang dapat Anda tetapkan adalah 20.
- Hudi
-
Untuk setiap penyimpanan data Hudi, Anda menentukan jalur Amazon S3 yang berisi metadata untuk tabel Hudi Anda. Jika crawler menemukan metadata tabel Hudi, ia mendaftarkannya di Katalog Data. Anda dapat mengatur jadwal untuk crawler agar tabel tetap diperbarui.
Anda dapat menentukan parameter ini untuk penyimpanan data:
Pengecualian: Memungkinkan Anda untuk melewati folder tertentu.
Kedalaman Penjelajahan Maksimum: Menetapkan batas kedalaman yang dapat dirayapi crawler di bucket Amazon S3 Anda. Kedalaman traversal maksimum default adalah 10 dan kedalaman maksimum yang dapat Anda tetapkan adalah 20.
catatan
Kolom stempel waktu dengan tipe
millislogis akan ditafsirkan sebagaibigint, karena ketidakcocokan dengan Hudi 0.13.1 dan jenis stempel waktu. Resolusi dapat diberikan dalam rilis Hudi yang akan datang.Tabel Hudi dikategorikan sebagai berikut, dengan implikasi spesifik untuk masing-masing:
Salin saat menulis (CoW): Data disimpan dalam format kolom (Parquet), dan setiap pembaruan membuat versi file baru selama penulisan.
Gabungkan saat Dibaca (MoR): Data disimpan menggunakan kombinasi format kolumnar (Parquet) dan berbasis baris (Avro). Pembaruan dicatat ke file delta berbasis baris dan dipadatkan sesuai kebutuhan untuk membuat file kolumnar versi baru.
Dengan set data CoW, setiap kali ada pembaruan ke catatan, file yang berisi catatan ditulis ulang dengan nilai yang diperbarui. Dengan set data MoR, setiap kali ada pembaruan, Hudi hanya menulis baris untuk catatan yang berubah. MoR lebih cocok untuk beban kerja tulis atau perubahan berat dengan lebih sedikit pembacaan. CoW lebih cocok untuk beban kerja pembacaan berat pada data yang jarang berubah.
Hudi menyediakan tiga tipe kueri untuk mengakses data:
Kueri snapshot: Kueri yang melihat snapshot terbaru dari tabel pada tindakan komit atau pemadatan yang diberikan. Untuk tabel MoR, kueri snapshot memapar status terbaru tabel dengan menggabungkan file dasar dan delta potongan file terbaru pada pada saat kueri.
Kueri tambahan: Kueri hanya melihat data baru yang ditulis ke tabel, sejak diberikan commit/compaction. Ini secara efektif menyediakan pengaliran perubahan untuk mengaktifkan data pipeline tambahan.
Baca kueri yang dioptimalkan: Untuk tabel MoR, kueri melihat data terbaru yang dipadatkan. Untuk tabel CoW, kueri melihat data terbaru yang dikomit.
Untuk Copy-On-Write tabel, crawler membuat satu tabel di Katalog Data dengan ReadOptimized ser
org.apache.hudi.hadoop.HoodieParquetInputFormatde.Untuk Merge-On-Read tabel, crawler membuat dua tabel di Katalog Data untuk lokasi tabel yang sama:
Tabel dengan akhiran
_royang menggunakan ReadOptimized serorg.apache.hudi.hadoop.HoodieParquetInputFormatde.Tabel dengan akhiran yang menggunakan RealTime Serde
_rtyang memungkinkan untuk kueri Snapshot:.org.apache.hudi.hadoop.realtime.HoodieParquetRealtimeInputFormat
- MongoDB dan Amazon DocumentDB (dengan kompatibilitas MongoDB)
-
Mendukung MongoDB versi 3.2 dan versi setelahnya. Anda dapat memilih untuk melakukan perayapan hanya pada sampel kecil data untuk mengurangi waktu aktif crawler.
- Basis data relasional
-
Autentikasi dengan nama pengguna dan kata sandi basis data. Tergantung pada jenis mesin basis data, Anda dapat memilih objek yang di-crawl, seperti basis data, skema, dan tabel.
- Kepingan salju
-
Perayap Snowflake JDBC mendukung merayapi Tabel, Tabel Eksternal, Tampilan, dan Tampilan Terwujud. Definisi Tampilan Terwujud tidak akan diisi.
Untuk tabel eksternal Snowflake, crawler hanya akan merayapi jika menunjuk ke lokasi Amazon S3. Selain skema tabel, crawler juga akan merayapi lokasi Amazon S3, format file, dan output sebagai parameter tabel di tabel Katalog Data. Perhatikan bahwa informasi partisi dari tabel eksternal yang dipartisi tidak diisi.
ETL saat ini tidak didukung untuk tabel Katalog Data yang dibuat menggunakan perayap Snowflake.