View a markdown version of this page

Pertimbangan dan praktik terbaik saat Anda membuat cluster Amazon EMR dengan beberapa node utama - Amazon EMR

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Pertimbangan dan praktik terbaik saat Anda membuat cluster Amazon EMR dengan beberapa node utama

Pertimbangkan hal berikut saat Anda membuat cluster Amazon EMR dengan beberapa node utama:

penting

Untuk meluncurkan cluster EMR dengan ketersediaan tinggi dengan beberapa node utama, kami sangat menyarankan Anda menggunakan rilis Amazon EMR terbaru. Ini memastikan bahwa Anda mendapatkan tingkat ketahanan dan stabilitas tertinggi untuk cluster ketersediaan tinggi Anda.

  • Ketersediaan tinggi untuk arm ada instans didukung dengan rilis Amazon EMR 5.36.1, 5.36.2, 6.8.1, 6.9.1, 6.10.1, 6.11.1, 6.12.0, dan yang lebih tinggi. Misalnya grup, ketersediaan tinggi didukung dengan rilis Amazon EMR 5.23.0 dan lebih tinggi. Untuk mempelajari selengkapnya, lihat Tentang Rilis Amazon EMR.

  • Pada cluster dengan ketersediaan tinggi, Amazon EMR hanya mendukung peluncuran node utama dengan instans On Demand. Ini memastikan ketersediaan tertinggi untuk cluster Anda.

  • Anda masih dapat menentukan beberapa jenis instans untuk armada utama tetapi semua node utama cluster dengan ketersediaan tinggi diluncurkan dengan jenis instans yang sama, termasuk penggantian untuk node primer yang tidak sehat.

  • Untuk melanjutkan operasi, cluster dengan ketersediaan tinggi dengan beberapa node primer membutuhkan dua dari tiga node utama agar sehat. Akibatnya, jika ada dua node utama yang gagal secara bersamaan, cluster EMR Anda akan gagal.

  • Semua cluster EMR, termasuk cluster dengan ketersediaan tinggi, diluncurkan dalam satu Zona Ketersediaan. Oleh karena itu, mereka tidak dapat mentolerir kegagalan Zona Ketersediaan. Jika terjadi pemadaman Zona Ketersediaan, Anda kehilangan akses ke cluster.

  • Jika Anda menggunakan Jika Anda menggunakan peran atau kebijakan layanan khusus saat meluncurkan cluster di dalam armada instans, Anda dapat menambahkan ec2:DescribeInstanceTypeOfferings izin sehingga Amazon EMR dapat menyaring Zona Ketersediaan (AZ) yang tidak didukung. Saat Amazon EMR menyaring AZ yang tidak mendukung jenis instans node primer apa pun, Amazon EMR mencegah peluncuran cluster gagal karena jenis instans primer yang tidak didukung. Untuk informasi selengkapnya, lihat Jenis instans tidak didukung.

  • Amazon EMR tidak menjamin ketersediaan tinggi untuk aplikasi sumber terbuka selain yang ditentukan di. Aplikasi yang didukung di Amazon EMR Cluster dengan beberapa node utama

  • Di Amazon EMR rilis 5.23.0 hingga 5.36.2, hanya dua dari tiga node utama untuk cluster grup instance yang dijalankan. HDFS NameNode

  • Di Amazon EMR rilis 6.x dan yang lebih tinggi, ketiga node utama untuk grup instance berjalan. HDFS NameNode

Pertimbangan untuk mengkonfigurasi subnet:

  • Cluster Amazon EMR dengan beberapa node utama hanya dapat berada di satu Availability Zone atau subnet. Amazon EMR tidak dapat menggantikan node utama yang gagal jika subnet dimanfaatkan sepenuhnya atau kelebihan langganan jika terjadi failover. Untuk menghindari skenario ini, Anda disarankan untuk mendedikasikan seluruh subnet ke klaster Amazon EMR. Selain itu, pastikan bahwa ada cukup alamat IP pribadi yang tersedia di subnet.

Pertimbangan untuk mengonfigurasi simpul inti:

  • Untuk memastikan node inti juga sangat tersedia, kami sarankan Anda meluncurkan setidaknya empat node inti. Jika Anda memutuskan untuk meluncurkan cluster yang lebih kecil dengan tiga atau lebih sedikit node inti, setel dfs.replication parameter ke setidaknya 2 agar HDFS memiliki replikasi DFS yang cukup. Untuk informasi selengkapnya, lihat Konfigurasi HDFS.

Awas
  1. Pengaturan dfs.replication ke 1 pada cluster dengan kurang dari empat node dapat menyebabkan hilangnya data HDFS jika satu node turun. Sebaiknya gunakan cluster dengan setidaknya empat node inti untuk beban kerja produksi.

  2. Amazon EMR tidak akan mengizinkan cluster untuk menskalakan node inti di bawah inidfs.replication. Misalnya, jikadfs.replication = 2, jumlah minimum node inti adalah 2.

  3. Bila Anda menggunakan Managed Scaling Auto-scaling, atau memilih untuk mengubah ukuran cluster secara manual, sebaiknya setel dfs.replication ke 2 atau lebih tinggi.

Pertimbangan untuk Mengatur Alarm pada Metrik:

  • Amazon EMR tidak menyediakan metrik khusus aplikasi tentang HDFS atau YARN. Sebaiknya Anda mengatur alarm untuk memantau jumlah instans node utama. Konfigurasikan alarm menggunakan CloudWatch metrik Amazon berikut:MultiMasterInstanceGroupNodesRunning,MultiMasterInstanceGroupNodesRunningPercentage, atauMultiMasterInstanceGroupNodesRequested. CloudWatch akan memberi tahu Anda jika terjadi kegagalan dan penggantian node primer.

    • Jika MultiMasterInstanceGroupNodesRunningPercentage lebih rendah dari 100% dan lebih besar dari 50%, cluster mungkin telah kehilangan node utama. Dalam situasi ini, Amazon EMR mencoba mengganti node utama.

    • Jika MultiMasterInstanceGroupNodesRunningPercentage turun di bawah 50%, dua node utama mungkin gagal. Dalam situasi ini, kuorum hilang dan cluster tidak dapat dipulihkan. Anda harus memigrasikan data secara manual dari cluster ini.

    Untuk informasi selengkapnya, lihat Mengatur alarm pada metrik.