Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Akses tabel HBase dengan Hive
HBase dan Apache Hive terintegrasi erat, memungkinkan Anda menjalankan beban kerja pemrosesan paralel besar-besaran langsung pada data yang disimpan di HBase. Untuk menggunakan Hive dengan HBase, Anda dapat meluncurkannya pada klaster yang sama. Bagaimanapun juga, Anda dapat meluncurkan Hive dan HBase pada klaster terpisah. Menjalankan HBase dan Hive secara terpisah pada klaster yang berbeda dapat meningkatkan performa karena memungkinkan setiap aplikasi untuk menggunakan sumber daya klaster lebih efisien.
Prosedur berikut menunjukkan cara menghubungkan ke HBase pada klaster menggunakan Hive.
catatan
Anda hanya dapat menghubungkan klaster Hive untuk klaster HBase tunggal.
Menghubungkan Hive ke HBase
-
Buat klaster terpisah dengan Hive dan HBase yang diinstal atau buat klaster tunggal dengan kedua HBase dan Hive yang diinstal.
-
Jika Anda menggunakan cluster terpisah, ubah grup keamanan Anda sehingga port HBase dan Hive terbuka di antara dua node utama ini.
-
Gunakan SSH untuk terhubung ke node utama untuk cluster dengan Hive diinstal. Untuk informasi selengkapnya, lihat Menghubun gkan ke node utama menggunakan SSH di Panduan Manajemen Amazon EMR.
-
Luncurkan shell Hive dengan perintah berikut.
hive -
(Opsional) Anda tidak perlu melakukan hal ini jika HBase dan Hive terletak di klaster yang sama. Connect klien HBase pada cluster Hive Anda untuk klaster HBase yang berisi data Anda. Dalam contoh berikut,
public-DNS-namediganti dengan nama DNS publik dari node utama cluster HBase, misalnya:ec2-50-19-76-67.compute-1.amazonaws.com.rproxy.goskope.com.set hbase.zookeeper.quorum=public-DNS-name; -
Lanjutkan untuk menjalankan kueri Hive pada data HBase Anda seperti yang diinginkan atau lihat prosedur berikutnya.
Untuk mengakses data HBase dari Hive
-
Setelah hubungan antara klaster Hive dan HBase dibuat (seperti yang ditunjukkan dalam prosedur sebelumnya), Anda dapat mengakses data yang disimpan pada klaster HBase dengan membuat tabel eksternal di Hive.
Contoh berikut, ketika dijalankan dari prompt Hive pada node utama, membuat tabel eksternal yang mereferensikan data yang disimpan dalam tabel HBase yang disebut
inputTable. Oleh sebab itu, Anda dapat mereferensikaninputTabledalam pernyataan Hive untuk mengkueri dan memodifikasi data yang disimpan dalam klaster HBase.set hbase.zookeeper.quorum=ec2-107-21-163-157.compute-1.amazonaws.com; create external table inputTable (key string, value string) stored by 'org.apache.hadoop.hive.hbase.HBaseStorageHandler' with serdeproperties ("hbase.columns.mapping" = ":key,f1:col1") tblproperties ("hbase.table.name" = "t1"); select count(key) from inputTable ;
Untuk kasus penggunaan yang lebih maju dan contoh menggabungkan HBase dan Hive, lihat posting Blog AWS Big Data, Gab ungkan NoSQL dan analisis paralel besar-besaran menggunakan Apache HBase dan Apache Hive di Amazon EMR.