View a markdown version of this page

管理无服务器数据湖中的插入和更新插入 - 管理无服务器数据湖中的插入和更新插入

本文属于机器翻译版本。若本译文内容与英语原文存在差异,则一律以英文原文为准。

管理无服务器数据湖中的插入和更新插入

发布日期:2021 年 6 月 15 日 (图表历史)

该架构展示了如何使用在 Amazon EMR 上Apache Hudi运行来处理亚马逊简单存储服务中数据集的插入和更新。您可以构建一个经济实惠且可扩展的数据湖,以提供按需分析并创建持久的数据集市。

管理无服务器数据湖中的插入和向上插入

架构图显示了如何使用亚马逊 EMR、亚马逊 S3 和 AWS Glue 在无服务器数据湖中管理插入和更新插入。

以下步骤描述了架构:

  1. 在 Amazon S3 中使用批处理、变更数据捕获 (CDC) 或流式传输到原始层,从源系统提取数据。

  2. 数据保留在 Amazon S3 的原始数据湖中后,抓取数据并使用爬虫将其填充到 AWS Glue 数据目录中。

  3. 将原始数据提取到亚马逊 EMR 集群中,并使用 Hive 和 Spark 读取这些数据进行清理和转换。

  4. Apache Hudi在 Amazon EMR 上运行,使用 Spark API 读取数据,并对所需的数据集执行插入和更新插入。

  5. 将清理和转换后的数据保存回 Amazon S3 已处理且可报告的存储桶中。

  6. 使用 Athena 按需使用可报告的数据,或将其加载到亚马逊 Redshift 中。不同的用户、工具和资源可以使用这些数据。

  7. 处理完整的数据移动,按需运行 Amazon EMR 集群以获取批量数据,并使用亚马逊托管工作流程 Apache Airflow (MWAA) 的工作流程编排加载数据。

延伸阅读

有关其他信息,请参阅以下资源:

图表历史

要获得有关此参考架构图更新的通知,请订阅 RSS 提要。

变更说明日期

初次发布

参考架构图首次发布。

2021 年 6 月 15 日

注意

要订阅 RSS 更新,必须为正在使用的浏览器启用 RSS 插件。