View a markdown version of this page

Luncurkan cluster Amazon EMR dengan Trino - Amazon EMR

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Luncurkan cluster Amazon EMR dengan Trino

Berikut ini menjelaskan pilihan konfigurasi yang benar saat Anda membuat cluster dengan Trino.

Menggunakan konektor Hive untuk membuat data tersedia untuk kueri

Anda dapat mengonfigurasi konektor Trino untuk metastore Hive untuk tujuan menanyakan data metastore dari cluster Anda. Metastore adalah lapisan abstraksi yang membuat konten atau data berbasis file tersedia sebagai tabel, sehingga mudah untuk membuat kueri. Anda harus mengonfigurasi konektor di Amazon EMR untuk membuat tabel metastore Hive tersedia untuk cluster. Prosedur berikut menunjukkan cara melakukan ini:

  1. Pilih AWS Glue di konsol dan buat tabel, berdasarkan data sumber Anda di Amazon S3. Tabel di Katalog Data AWS Glue adalah definisi metadata untuk data. Masuk akal dalam konteks ini untuk membuat tabel secara manual, membuat kolom sesuka Anda, dari data sumber Anda. Untuk informasi selengkapnya tentang membuat tabel di AWS Glue dari data semi-terstruktur di Amazon S3, lihat Membuat tabel menggunakan konsol di Panduan Pengguna AWS Glue.

  2. Tetapkan konfigurasi Anda sebagai bagian dari pembuatan cluster. Pilih tab Konfigurasi. Konfigurasi adalah spesifikasi opsional untuk cluster Anda. Saat Anda memasukkan konfigurasi, tambahkan JSON seperti contoh berikut, yang menginstruksikan Trino untuk menggunakan Katalog Data AWS Glue sebagai metastore Hive eksternal untuk metadata tabel:

    { "classification": "trino-connector-hive", "properties": { "hive.metastore": "glue" } }

    Atau, Anda dapat menerapkan konfigurasi di bagian Pengaturan perangkat lunak saat Anda membuat cluster.

    Selain itu, Anda dapat mengatur jenis konektor lain, seperti untuk menghubungkan dengan Apache Iceberg. Untuk informasi selengkapnya, lihat Menggunakan cluster Gunung Es dengan Trino di Panduan Rilis Amazon EMR. Mengkonfigurasi pengaturan tambahan adalah opsional.

Untuk melanjutkan langkah memulai, lihat. Hubungkan ke node utama untuk cluster Amazon EMR dan jalankan kueri

Buat cluster dengan Trino

Berikut ini menjelaskan pilihan konfigurasi yang benar saat Anda membuat cluster yang ingin Anda gunakan dengan Trino.

penting

Sebelum Anda membuat cluster Anda, selesaikan konfigurasi Katalog Data AWS Glue sebagai metastore Hive Anda, yang kami rekomendasikan untuk memulai. Untuk informasi selengkapnya, lihat Menggunakan konektor Hive untuk membuat data tersedia untuk kueri.

  1. Di AWS konsol, pilih Amazon EMR dari layanan. Ketika Anda memilih Amazon EMR, jika Anda memiliki cluster yang ada, EMR Anda di cluster EC2 terdaftar.

  2. Pilih Buat klaster. Dari sini, Anda memulai proses untuk membangun cluster.

  3. Beri nama cluster Anda dan pilih rilis Amazon EMR. Anda dapat memilih rilis terbaru untuk tutorial.

  4. Pilih bundel Trino, yang memiliki aplikasi Trino yang telah dipilih sebelumnya. Bundel disiapkan untuk kenyamanan ketika Anda mengetahui tujuan cluster sebelumnya. Jika tidak, Anda cukup memilih kotak centang untuk Trino.

  5. Untuk konfigurasi Cluster, pilih Grup instans seragam. Lanjutkan dan hapus grup instance tambahan.

  6. Pilih jenis Instance. Umumnya kami sarankan Anda memilih jenis instance dengan setidaknya 16 GiB memori. Juga, untuk penskalaan dan penyediaan Cluster pilih Setel ukuran cluster secara manual.

  7. Pada titik ini, atur konfigurasi metastore Hive Anda untuk menunjuk ke AWS Glue. Ini dirinci di bagian iniMenggunakan konektor Hive untuk membuat data tersedia untuk kueri. Selesaikan ini sebelum Anda membangun cluster.

  8. Pilih Buat klaster. Butuh beberapa menit untuk menyelesaikannya.

    Langkah-langkah di sini tidak mencakup semua langkah konfigurasi secara rinci. Informasi selengkapnya tentang menyiapkan cluster tersedia di Mer encanakan, mengkonfigurasi, dan meluncurkan cluster Amazon EMR.

catatan

Jangan pilih Presto dan Trino untuk digunakan pada cluster yang sama. Menjalankan mereka bersama tidak didukung. Disarankan juga bahwa jika Anda menjalankan Trino, Anda tidak menjalankan aplikasi lain di cluster, seperti Spark.