本文属于机器翻译版本。若本译文内容与英语原文存在差异,则一律以英文原文为准。
管理无服务器数据湖中的插入和更新插入
发布日期:2021 年 6 月 15 日 (图表历史)
该架构展示了如何使用在 Amazon EMR 上Apache Hudi运行来处理亚马逊简单存储服务中数据集的插入和更新。您可以构建一个经济实惠且可扩展的数据湖,以提供按需分析并创建持久的数据集市。
管理无服务器数据湖中的插入和向上插入
以下步骤描述了架构:
-
在 Amazon S3 中使用批处理、变更数据捕获 (CDC) 或流式传输到原始层,从源系统提取数据。
-
数据保留在 Amazon S3 的原始数据湖中后,抓取数据并使用爬虫将其填充到 AWS Glue 数据目录中。
-
将原始数据提取到亚马逊 EMR 集群中,并使用 Hive 和 Spark 读取这些数据进行清理和转换。
-
Apache Hudi在 Amazon EMR 上运行,使用 Spark API 读取数据,并对所需的数据集执行插入和更新插入。
-
将清理和转换后的数据保存回 Amazon S3 已处理且可报告的存储桶中。
-
使用 Athena 按需使用可报告的数据,或将其加载到亚马逊 Redshift 中。不同的用户、工具和资源可以使用这些数据。
-
处理完整的数据移动,按需运行 Amazon EMR 集群以获取批量数据,并使用亚马逊托管工作流程 Apache Airflow (MWAA) 的工作流程编排加载数据。
延伸阅读
有关其他信息,请参阅以下资源:
图表历史
要获得有关此参考架构图更新的通知,请订阅 RSS 提要。
| 变更 | 说明 | 日期 |
|---|---|---|
初次发布 | 参考架构图首次发布。 | 2021 年 6 月 15 日 |
注意
要订阅 RSS 更新,必须为正在使用的浏览器启用 RSS 插件。