View a markdown version of this page

在無伺服器資料湖中管理插入和更新 - 在無伺服器資料湖中管理插入和更新

本文為英文版的機器翻譯版本,如內容有任何歧義或不一致之處,概以英文版為準。

在無伺服器資料湖中管理插入和更新

發佈日期:2021 年 6 月 15 日 (圖表歷史記錄)

此架構示範如何使用在 Amazon EMR Apache Hudi上執行 ,來處理 Amazon Simple Storage Service 中資料集的插入和更新。您可以建置經濟實惠且可擴展的資料湖,以佈建隨需分析並建立持久性的資料栩栩如生。

在無伺服器資料湖中管理插入和更新

架構圖顯示如何使用 Amazon EMR、Amazon S3 和 AWS Glue 管理無伺服器資料湖中的插入和 upsert。

下列步驟說明 架構:

  1. 使用批次、變更資料擷取 (CDC) 或串流至 Amazon S3 中的原始層,從來源系統擷取資料。

  2. 在資料保留在 Amazon S3 的原始資料湖中後,爬取資料並使用爬蟲程式將其填入 AWS Glue Data Catalog。

  3. 將原始資料提取至 Amazon EMR 叢集,並使用 Hive 和 Spark 進行清理和轉換。

  4. Apache Hudi 在 Amazon EMR 上執行 會使用 Spark APIs 讀取資料,並在所需的資料集上執行插入和 upsert。

  5. 將已清除和轉換的資料保留回 Amazon S3 已處理和可報告的儲存貯體。

  6. 使用 Athena 隨需取用可報告的資料,或將其載入 Amazon Redshift。不同的使用者、工具和資源可以使用此資料。

  7. 處理完整的資料移動、針對批次資料旋轉隨需 Amazon EMR 叢集,以及使用 Amazon Managed Workflows for Apache Airflow(MWAA) 的工作流程協同運作來載入資料。

深入閱讀

如需詳細資訊,請參閱下列資源:

圖表歷史記錄

若要收到此參考架構圖的更新通知,請訂閱 RSS 摘要。

變更描述日期

初次出版

首先發佈參考架構圖。

2021 年 6 月 15 日

注意

若要訂閱 RSS 更新,您必須為正在使用的瀏覽器啟用 RSS 外掛程式。