Amazon EMR 5.19.0 版 - Amazon EMR

本文為英文版的機器翻譯版本,如內容有任何歧義或不一致之處,概以英文版為準。

Amazon EMR 5.19.0 版

5.19.0 應用程式版本

此版本支援下列應用程式:FlinkGangliaHBaseHCatalogHadoopHiveHueJupyterHubLivyMXNetMahoutOoziePhoenixPigPrestoSparkSqoopTensorFlowTezZeppelinZooKeeper

下表列出此 Amazon EMR 版本中提供的應用程式版本,以及前三個 Amazon EMR 版本 (如果適用) 中的應用程式版本。

如需完整了解各 Amazon EMR 版之應用程式版本的完整歷史記錄,請參閱以下主題:

應用程式版本資訊
emr-5.19.0 emr-5.18.1 emr-5.18.0 emr-5.17.2
AWS 適用於 Java 的 SDK 1.11.4331.11.3931.11.3931.11.336
Python 2.7、3.42.7、3.42.7、3.42.7、3.4
Scala 2.11.82.11.82.11.82.11.8
AmazonCloudWatchAgent - - - -
Delta - - - -
Flink1.6.11.6.01.6.01.5.2
Ganglia3.7.23.7.23.7.23.7.2
HBase1.4.71.4.71.4.71.4.6
HCatalog2.3.32.3.32.3.32.3.3
Hadoop2.8.52.8.42.8.42.8.4
Hive2.3.32.3.32.3.32.3.3
Hudi - - - -
Hue4.2.04.2.04.2.04.2.0
Iceberg - - - -
JupyterEnterpriseGateway - - - -
JupyterHub0.9.40.8.10.8.10.8.1
Livy0.5.00.5.00.5.00.5.0
MXNet1.3.01.2.01.2.01.2.0
Mahout0.13.00.13.00.13.00.13.0
Oozie5.0.05.0.05.0.05.0.0
Phoenix4.14.04.14.04.14.04.14.0
Pig0.17.00.17.00.17.00.17.0
Presto0.2120.2100.2100.206
Spark2.3.22.3.22.3.22.3.1
Sqoop1.4.71.4.71.4.71.4.7
TensorFlow1.11.01.9.01.9.01.9.0
Tez0.8.40.8.40.8.40.8.4
Trino (PrestoSQL) - - - -
Zeppelin0.8.00.8.00.8.00.7.3
ZooKeeper3.4.133.4.123.4.123.4.12

5.19.0 版本備註

以下版本備註包含 Amazon EMR 5.19.0 版的資訊。變更是相對於 5.18.0 版而言。

初始版本日期:2018 年 11 月 7 日

上次更新日期:2018 年 11 月 19 日

升級
  • Hadoop 2.8.5

  • Flink 1.6.1

  • JupyterHub 0.9.4

  • MXNet 1.3.0

  • Presto 0.212

  • TensorFlow 1.11.0

  • Zookeeper 3.4.13

  • AWS SDK for Java 1.11.433

新功能
  • (2018 年 11 月 19 日) EMR Notebooks 是以 Jupyter 筆記本為基礎的受管環境。它支援 PySpark、Spark SQL、Spark R 和 Scala 的 Spark magic 核心。EMR Notebooks 可以與使用 Amazon EMR 5.18.0 版及更高版本建立的叢集搭配使用。如需詳細資訊,請參閱《Amazon EMR 管理指南》中的使用 EMR Notebooks

  • EMRFS S3 優化遞交者可用於使用 Spark 和 EMRFS 寫入 Parquet 檔案。此遞交者可改進寫入效能。如需詳細資訊,請參閱使用 EMRFS S3 優化遞交者

變更、強化功能和已解決的問題
已知問題
  • EMR Notebooks - 在某些情況下,若開啟多個筆記本編輯器,筆記本編輯器可能無法連線至叢集。如果發生此情況,請清除瀏覽器 Cookie,然後重新打開筆記本編輯器。

  • CloudWatch ContainerPending 指標和自動擴展 - (在 5.20.0 中修正) Amazon EMR 可能發出 ContainerPending 的負值。若在自動擴展規則中使用 ContainerPending,自動擴展不會如預期運作。避免搭配使用 ContainerPending 和自動擴展。

  • 在 Amazon EMR 版本 5.19.0、5.20.0 和 5.21.0 中,YARN 節點標籤儲存於 HDFS 目錄。在某些情況下,這會導致核心節點啟動延遲,然後造成叢集逾時與啟動失敗。從 Amazon EMR 5.22.0 開始,此問題已解決。YARN 節點標籤儲存在每個叢集節點的本機磁碟上,以避免 HDFS 上的相依性。

5.19.0 元件版本

Amazon EMR 在此版本安裝的元件列出如下。其中有一些屬於大數據應用程式套件。其他的則為 Amazon EMR 獨有,並安裝為系統程序和功能。這些通常會以 emraws 開頭。在最新 Amazon EMR 版本中的大數據應用程式套件,通常也是社群中可找到的最新版本。我們致力盡快提供 Amazon EMR 的社群版本。

Amazon EMR 中的某些元件與社群版本不同。這些元件具有版本標籤,格式為 CommunityVersion-amzn-EmrVersionEmrVersion 從 0 開始。例如,假設有一個名為 myapp-component 的開放原始碼社群元件 2.2 版為了包含在不同 Amazon EMR 發行版本中而修改過三次,則其發行版本會列為 2.2-amzn-2

元件 版本 描述
aws-sagemaker-spark-sdk1.2.0Amazon SageMaker Spark SDK
emr-ddb4.7.0適用於 Hadoop 生態系統應用程式的 Amazon DynamoDB 連接器。
emr-goodies2.5.1適用 Hadoop 生態系統的超便利程式庫。
emr-kinesis3.4.0適用於 Hadoop 生態系統應用程式的 Amazon Kinesis 連接器。
emr-s3-dist-cp2.10.0針對 Amazon S3 最佳化的分散式複製應用程式。
emr-s3-select1.1.0EMR S3Select Connector
emrfs2.28.0適用於 Hadoop 生態系統應用程式的 Amazon S3 連接器。
flink-client1.6.1Apache Flink 命令列用戶端指令碼和應用程式。
ganglia-monitor3.7.2Hadoop 生態系統應用程式內嵌 Ganglia 代理程式以及 Ganglia 監控代理程式。
ganglia-metadata-collector3.7.2Ganglia 監控代理程式的彙總指標 Ganglia 中繼資料收集器。
ganglia-web3.7.1由 Ganglia 中繼資料收集器收集,以檢視指標的 Web 應用程式。
hadoop-client2.8.5-amzn-0Hadoop 命令列用戶端,例如「hdfs」、「Hadoop」或「yarn」。
hadoop-hdfs-datanode2.8.5-amzn-0用於存放區塊的 HDFS 節點層級服務。
hadoop-hdfs-library2.8.5-amzn-0HDFS 命令列用戶端和程式庫
hadoop-hdfs-namenode2.8.5-amzn-0用於追蹤檔案名稱和區塊位置的 HDFS 服務。
hadoop-httpfs-server2.8.5-amzn-0HDFS 操作的 HTTP 端點。
hadoop-kms-server2.8.5-amzn-0以 Hadoop 金鑰供應商 API 為基礎的加密金鑰管理伺服器。
hadoop-mapred2.8.5-amzn-0執行 MapReduce 應用程式的 MapReduce 執行引擎程式庫。
hadoop-yarn-nodemanager2.8.5-amzn-0在個別節點用於管理容器的 YARN 服務。
hadoop-yarn-resourcemanager2.8.5-amzn-0用於分配和管理叢集資源,以及分散式應用程式的 YARN 服務。
hadoop-yarn-timeline-server2.8.5-amzn-0為 YARN 應用程式擷取目前和歷史資訊的服務。
hbase-hmaster1.4.7負責區域協調和執行管理命令的 HBase 叢集服務。
hbase-region-server1.4.7提供一或多個 HBase 區域的服務。
hbase-client1.4.7HBase 命令列用戶端。
hbase-rest-server1.4.7為 HBase 提供 RESTful HTTP 端點的服務。
hbase-thrift-server1.4.7提供 Thrift 端點到 HBase 的服務。
hcatalog-client2.3.3-amzn-2操作 hcatalog-server 的「hcat」命令列用戶端。
hcatalog-server2.3.3-amzn-2服務為分散式應用程式提供 HCatalog、表格和儲存管理層。
hcatalog-webhcat-server2.3.3-amzn-2HTTP 端點提供了 REST 介面至 HCatalog。
hive-client2.3.3-amzn-2Hive 命令列用戶端。
hive-hbase2.3.3-amzn-2Hive-hbase 用戶端。
hive-metastore-server2.3.3-amzn-2為 Hadoop 操作的 SQL 提供存取 Hive 中繼儲存、存放中繼資料語意儲存庫的服務。
hive-server22.3.3-amzn-2依 Web 請求接受 Hive 查詢的服務。
hue-server4.2.0使用 Hadoop 生態系統應用程式分析資料的 Web 應用程式
jupyterhub0.9.4適用於 Jupyter 筆記本的多使用者伺服器
livy-server0.5.0-incubating與 Apache Spark 互動的 REST 介面
nginx1.12.1nginx [engine x] 是 HTTP 和反向代理伺服器
mahout-client0.13.0機器學習程式庫。
mxnet1.3.0靈活有效率的程式庫,具可擴展性,適用於深度學習。
mysql-server5.5.54+MySQL 資料庫伺服器。
nvidia-cuda9.2.88Nvidia 驅動程式和 Cuda 工具組
oozie-client5.0.0Oozie 命令列用戶端。
oozie-server5.0.0接受 Oozie 工作流程要求的服務。
opencv3.4.0開放原始碼電腦 Vision 程式庫。
phoenix-library4.14.0-HBase-1.4適用於伺服器和用戶端的 phoenix 程式庫
phoenix-query-server4.14.0-HBase-1.4此為一輕量伺服器,可提供對 Avatica API 的 JDBC 存取以及通訊協定緩衝區和 JSON 格式存取
presto-coordinator0.212在 presto-workers 之間接受查詢和執行管理查詢的服務。
presto-worker0.212執行查詢各部分的服務。
pig-client0.17.0Pig 命令列用戶端。
r3.4.1統計運算 R 專案
spark-client2.3.2Spark 命令列用戶端。
spark-history-server2.3.2用於檢視完整 Spark 應用程式生命週期記錄事件的 Web 使用者介面。
spark-on-yarn2.3.2適用於 YARN 的記憶體內執行引擎。
spark-yarn-slave2.3.2YARN 從屬所需的 Apache Spark 程式庫。
sqoop-client1.4.7Apache Sqoop 命令列用戶端。
tensorflow1.11.0適用於高效能數值運算的 TensorFlow 開放原始碼軟體程式庫。
tez-on-yarn0.8.4tez YARN 應用程式和程式庫。
webserver2.4.25+Apache HTTP 伺服器。
zeppelin-server0.8.0能進行互動式資料分析,以 Web 為基礎的筆記型電腦。
zookeeper-server3.4.13用於維護組態資訊、命名、提供分散式同步,並提供群組服務的集中化服務。
zookeeper-client3.4.13ZooKeeper 命令列用戶端。

5.19.0 組態類別

組態分類可讓您自訂應用程式。這些檔案通常對應於應用程式的組態 XML 檔案,例如 hive-site.xml。如需詳細資訊,請參閱設定應用程式

emr-5.19.0 分類
分類 描述

capacity-scheduler

變更 Hadoop 中 capacity-scheduler.xml 檔案的值。

container-log4j

變更 Hadoop YARN 的 container-log4j.properties 檔案中的值。

core-site

變更 Hadoop 中 core-site.xml 檔案的值。

emrfs-site

變更 EMRFS 設定。

flink-conf

變更 flink-conf.yaml 設定。

flink-log4j

變更 Flink log4j.properties 設定。

flink-log4j-yarn-session

變更 Flink log4j-yarn-session.properties 設定。

flink-log4j-cli

變更 Flink log4j-cli.properties 設定。

hadoop-env

在 Hadoop 環境中變更所有 Hadoop 元件的值。

hadoop-log4j

變更 Hadoop 中 log4j.properties 檔案的值。

hadoop-ssl-server

變更 hadoop ssl 伺服器組態

hadoop-ssl-client

變更 hadoop ssl 用戶端組態

hbase

Apache HBase 的 Amazon EMR 彙整設定。

hbase-env

變更 HBase 環境中的值。

hbase-log4j

變更 HBase 的 hbase-log4j.properties 檔案中的值。

hbase-metrics

變更 HBase 的 hadoop-metrics2-hbase.properties 檔案中的值。

hbase-policy

變更 HBase 的 hbase-policy.xml 檔案中的值。

hbase-site

變更 HBase 的 hbase-site.xml 檔案中的值。

hdfs-encryption-zones

設定 HDFS 加密區域。

hdfs-site

變更 HDFS 的 hdfs-site.xml 中的值。

hcatalog-env

變更 HCatalog 環境中的值。

hcatalog-server-jndi

變更 HCatalog 的 jndi.properties 中的值。

hcatalog-server-proto-hive-site

變更 HCatalog 的 proto-hive-site.xml 中的值。

hcatalog-webhcat-env

變更 HCatalog WebHCat 環境中的值。

hcatalog-webhcat-log4j2

變更 HCatalog WebHCat 的 log4j2.properties 中的值。

hcatalog-webhcat-site

變更 HCatalog WebHCat 的 webhcat-site.xml 檔案中的值。

hive-beeline-log4j2

變更 Hive 的 beeline-log4j2.properties 檔案中的值。

hive-parquet-logging

變更 Hive 的 parquet-logging.properties 檔案中的值。

hive-env

變更 Hive 環境中的值。

hive-exec-log4j2

變更 Hive 的 hive-exec-log4j2.properties 檔案中的值。

hive-llap-daemon-log4j2

變更 Hive 的 llap-daemon-log4j2.properties 檔案中的值。

hive-log4j2

變更 Hive 的 hive-log4j2.properties 檔案中的值。

hive-site

變更 Hive 的 hive-site.xml 檔案中的值

hiveserver2-site

變更 Hive Server2 的 hiveserver2-site.xml 檔案中的值

hue-ini

變更 Hue 的 ini 檔案中的值

httpfs-env

變更 HTTPFS 環境中的值。

httpfs-site

變更 Hadoop 中 httpfs-site.xml 檔案的值。

hadoop-kms-acls

變更 Hadoop 中 kms-acls.xml 檔案的值。

hadoop-kms-env

變更 Hadoop KMS 環境中的值。

hadoop-kms-log4j

變更 Hadoop 的 kms-log4j.properties 檔案中的值。

hadoop-kms-site

變更 Hadoop 中 kms-site.xml 檔案的值。

jupyter-notebook-conf

變更 Jupyter 筆記本中 jupyter_notebook_config.py 檔案的值。

jupyter-hub-conf

變更 JupyterHubs 中 jupyterhub_config.py 檔案的值。

jupyter-s3-conf

設定 Jupyter 筆記本 S3 持久性。

jupyter-sparkmagic-conf

變更 Sparkmagic 中 config.json 檔案的值。

livy-conf

變更 Livy 的 livy.conf 檔案中的值。

livy-env

變更 Livy 環境中的值。

livy-log4j

變更 Livy log4j.properties 設定。

mapred-env

變更 MapReduce 應用程式環境中的值。

mapred-site

變更 MapReduce 應用程式 mapred-site.xml 檔案中的值。

oozie-env

變更 Oozie 環境中的值。

oozie-log4j

變更 Oozie 的 oozie-log4j.properties 檔案中的值。

oozie-site

變更 Oozie 的 oozie-site.xml 檔案中的值。

phoenix-hbase-metrics

變更 Phoenix 的 hadoop-metrics2-hbase.properties 檔案中的值。

phoenix-hbase-site

變更 Phoenix 的 hbase-site.xml 檔案中的值。

phoenix-log4j

變更 Phoenix 中 log4j.properties 檔案的值。

phoenix-metrics

變更 Phoenix 的 hadoop-metrics2-phoenix.properties 檔案中的值。

pig-env

在 Pig 環境中變更值。

pig-properties

變更 Pig 的 pig.properties 檔案中的值。

pig-log4j

變更 Pig 的 log4j.properties 檔案中的值。

presto-log

變更 Presto 的 log.properties 檔案中的值。

presto-config

變更 Presto 的 config.properties 檔案中的值。

presto-password-authenticator

變更 Presto 的 password-authenticator.properties 檔案中的值。

presto-env

變更 Presto 的 presto-env.sh 檔案中的值。

presto-node

變更 Presto 的 node.properties 檔案中的值。

presto-connector-blackhole

變更 Presto 的 blackhole.properties 檔案中的值。

presto-connector-cassandra

變更 Presto 的 cassandra.properties 檔案中的值。

presto-connector-hive

變更 Presto 的 hive.properties 檔案中的值。

presto-connector-jmx

變更 Presto 的 jmx.properties 檔案中的值。

presto-connector-kafka

變更 Presto 的 kafka.properties 檔案中的值。

presto-connector-localfile

變更 Presto 的 localfile.properties 檔案中的值。

presto-connector-memory

變更 Presto 的 memory.properties 檔案中的值。

presto-connector-mongodb

變更 Presto 的 mongodb.properties 檔案中的值。

presto-connector-mysql

變更 Presto 的 mysql.properties 檔案中的值。

presto-connector-postgresql

變更 Presto 的 postgresql.properties 檔案中的值。

presto-connector-raptor

變更 Presto 的 raptor.properties 檔案中的值。

presto-connector-redis

變更 Presto 的 redis.properties 檔案中的值。

presto-connector-redshift

變更 Presto 的 redshift.properties 檔案中的值。

presto-connector-tpch

變更 Presto 的 tpch.properties 檔案中的值。

presto-connector-tpcds

變更 Presto 的 tpcds.properties 檔案中的值。

spark

Apache Spark 的 Amazon EMR 彙整設定。

spark-defaults

變更 Spark 的 spark-defaults.conf 檔案中的值。

spark-env

變更 Spark 環境中的值。

spark-hive-site

變更 Spark 的 hive-site.xml 檔案中的值

spark-log4j

變更 Spark 中 log4j.properties 檔案的值。

spark-metrics

變更 Spark 中 metrics.properties 檔案的值。

sqoop-env

變更 Sqoop 環境中的值。

sqoop-oraoop-site

變更 Sqoop OraOop 的 oraoop-site.xml 檔案中的值。

sqoop-site

變更 Sqoop 的 sqoop-site.xml 檔案中的值。

tez-site

變更 Tez 的 tez-site.xml 檔案中的值。

yarn-env

變更 YARN 環境中的值。

yarn-site

變更 YARN 的 yarn-site.xml 檔案中的值。

zeppelin-env

變更 Zeppelin 環境中的值。

zookeeper-config

變更 ZooKeeper 的 zoo.cfg 檔案中的值。

zookeeper-log4j

變更 ZooKeeper 中 log4j.properties 檔案的值。