View a markdown version of this page

Apache HBase - Amazon EMR

As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.

Apache HBase

O HBase é um banco de dados distribuído, não relacional e de código aberto desenvolvido como parte do projeto Hadoop da Apache Software Foundation. O HBase é executado sobre o Hadoop Distributed File System (HDFS), para fornecer recursos de banco de dados não relacionais ao ecossistema Hadoop. O HBase é incluído com o Amazon EMR versão 4.6.0 e versões posteriores.

O HBase funciona perfeitamente com o Hadoop, compartilhando seu sistema de arquivos e servindo como entrada e saída diretas para a MapReduce estrutura e o mecanismo de execução. O HBase também se integra ao Apache Hive, permitindo SQL-like consultas em tabelas do HBase, uniões com Hive-based tabelas e suporte para Java Database Connectivity (JDBC). Para obter mais informações sobre o HBase, consulte o Apache HBase e a documentação do HBase no site do Apache. Para ver um exemplo de como usar o HBase com o Hive, consulte a postagem do blog sobre AWS Big Data Combine NoSQL e análises paralelas massivas usando o Apache HBase e o Apache Hive no Amazon EMR.

Com o HBase no Amazon EMR, você também pode fazer backup dos dados do HBase diretamente no Amazon Simple Storage Service (Amazon S3) e restaurá-los de um backup criado anteriormente ao iniciar um cluster do HBase. O Amazon EMR oferece opções de integração adicionais com o Amazon S3 para recuperação de desastres e persistência de dados.

  • HBase no Amazon S3: com o Amazon EMR versão 5.2.0 e posterior, você pode usar o HBase no Amazon S3 para armazenar o diretório raiz do HBase de um cluster e seus metadados diretamente no Amazon S3. Posteriormente, você pode iniciar um novo cluster, apontando-o para o local do diretório de raiz no Amazon S3. Apenas um cluster de cada vez pode usar o local do HBase no Amazon S3, com exceção de um cluster de réplica de leitura. Para obter mais informações, consulte HBase no Amazon S3 (modo de armazenamento do Amazon S3).

  • Réplicas de leitura do HBase: o Amazon EMR versão 5.7.0 e posterior com o HBase no Amazon S3 oferece suporte para clusters de réplica de leitura do Amazon S3. Um cluster de réplica de leitura fornece acesso somente leitura aos arquivos de armazenamento de um cluster primário e a metadados para operações somente leitura. Para obter mais informações, consulte Usar um cluster de réplica de leitura.

  • Snapshots do HBase: como alternativa ao HBase no Amazon S3, com o EMR versão 4.0 e posteriores, você pode criar snapshots de seus dados do HBase diretamente no Amazon S3 e depois recuperar dados usando esses snapshots. Para obter mais informações, consulte Usar snapshots do HBase.

Importante

Para o ajuste de escala de clusters HBase do Amazon EMR, não recomendamos usar ajuste de escala gerenciado ou ajuste de escala com políticas personalizadas com clusters HBase.

A tabela a seguir lista a versão do HBase incluída na versão mais recente da série 7.x do Amazon EMR, além dos componentes que o Amazon EMR instala com o HBase.

Para a versão dos componentes instalados com o HBase nesta versão, consulte Versões de componentes da versão 7.13.0.

Informações sobre a versão do HBase para o emr-7.13.0
Rótulo de versão do Amazon EMR Versão do HBase Componentes instalados com o HBase

emr-7.13.0

HBase 2.6.4-amzn-0

emrfs, emr-ddb, emr-goodies, emr-kinesis, emr-s3-dist-cp, emr-wal-cli, hadoop-client, hadoop-hdfs-datanode, hadoop-hdfs-library, hadoop-hdfs-namenode, hadoop-hdfs-zkfc, hadoop-httpfs-server, hadoop-kms-server, hadoop-mapred, hadoop-yarn-nodemanager, hadoop-yarn-resourcemanager, hadoop-yarn-timeline-server, hbase-hmaster, hbase-client, hbase-region-server, hbase-rest-server, hbase-thrift-server, hbase-operator-tools, zookeeper-client, zookeeper-server

A tabela a seguir lista a versão do HBase incluída na versão mais recente da série 6.x do Amazon EMR, além dos componentes que o Amazon EMR instala com o HBase.

Para obter a versão dos componentes instalados com o HBase nessa versão, consulte Release 6.15.0 Component Versions.

Informações de versão do HBase para o emr-6.15.0
Rótulo de versão do Amazon EMR Versão do HBase Componentes instalados com o HBase

emr-6.15.0

HBase 2.4.17-amzn-3

emrfs, emr-ddb, emr-goodies, emr-kinesis, emr-s3-dist-cp, emr-wal-cli, hadoop-client, hadoop-hdfs-datanode, hadoop-hdfs-library, hadoop-hdfs-namenode, hadoop-httpfs-server, hadoop-kms-server, hadoop-mapred, hadoop-yarn-nodemanager, hadoop-yarn-resourcemanager, hadoop-yarn-timeline-server, hbase-hmaster, hbase-client, hbase-region-server, hbase-rest-server, hbase-thrift-server, hbase-operator-tools, zookeeper-client, zookeeper-server

nota

O Apache HBase HBCK2 é uma ferramenta operacional separada para reparar regiões e tabelas do sistema do HBase. No Amazon EMR 6.1.0 e versões posteriores, o hbase-hbck2.jar é fornecido em /usr/lib/hbase-operator-tools/ no nó primário. Para obter mais informações sobre como criar e usar a ferramenta, consulte HBase HBCK2.

A tabela a seguir lista a versão do HBase incluída na versão mais recente da série 5.x do Amazon EMR, além dos componentes que o Amazon EMR instala com o HBase.

Para obter a versão dos componentes instalados com o HBase nesse lançamento, consulte Release 5.36.2 Component Versions.

Informações de versão do HBase para o emr-5.36.2
Rótulo de versão do Amazon EMR Versão do HBase Componentes instalados com o HBase

emr-5.36.2

HBase 1.4.13

emrfs, emr-ddb, emr-goodies, emr-kinesis, emr-s3-dist-cp, hadoop-client, hadoop-hdfs-datanode, hadoop-hdfs-library, hadoop-hdfs-namenode, hadoop-httpfs-server, hadoop-kms-server, hadoop-mapred, hadoop-yarn-nodemanager, hadoop-yarn-resourcemanager, hadoop-yarn-timeline-server, hbase-hmaster, hbase-client, hbase-region-server, hbase-rest-server, hbase-thrift-server, zookeeper-client, zookeeper-server