本文為英文版的機器翻譯版本,如內容有任何歧義或不一致之處,概以英文版為準。
在無伺服器資料湖中管理插入和更新
發佈日期:2021 年 6 月 15 日 (圖表歷史記錄)
此架構示範如何使用在 Amazon EMR Apache Hudi上執行 ,來處理 Amazon Simple Storage Service 中資料集的插入和更新。您可以建置經濟實惠且可擴展的資料湖,以佈建隨需分析並建立持久性的資料栩栩如生。
在無伺服器資料湖中管理插入和更新
下列步驟說明 架構:
-
使用批次、變更資料擷取 (CDC) 或串流至 Amazon S3 中的原始層,從來源系統擷取資料。
-
在資料保留在 Amazon S3 的原始資料湖中後,爬取資料並使用爬蟲程式將其填入 AWS Glue Data Catalog。
-
將原始資料提取至 Amazon EMR 叢集,並使用 Hive 和 Spark 進行清理和轉換。
-
Apache Hudi 在 Amazon EMR 上執行 會使用 Spark APIs 讀取資料,並在所需的資料集上執行插入和 upsert。
-
將已清除和轉換的資料保留回 Amazon S3 已處理和可報告的儲存貯體。
-
使用 Athena 隨需取用可報告的資料,或將其載入 Amazon Redshift。不同的使用者、工具和資源可以使用此資料。
-
處理完整的資料移動、針對批次資料旋轉隨需 Amazon EMR 叢集,以及使用 Amazon Managed Workflows for Apache Airflow(MWAA) 的工作流程協同運作來載入資料。
深入閱讀
如需詳細資訊,請參閱下列資源:
圖表歷史記錄
若要收到此參考架構圖的更新通知,請訂閱 RSS 摘要。
| 變更 | 描述 | 日期 |
|---|---|---|
初次出版 | 首先發佈參考架構圖。 | 2021 年 6 月 15 日 |
注意
若要訂閱 RSS 更新,您必須為正在使用的瀏覽器啟用 RSS 外掛程式。