View a markdown version of this page

追踪数据湖采集和处理 - 通过无服务器分析实现可追溯性

本文属于机器翻译版本。若本译文内容与英语原文存在差异,则一律以英文原文为准。

追踪数据湖采集和处理

发布日期:2021 年 7 月 15 日 (图表历史)

该架构展示了如何使用 AWS X-Ray 跟踪您的数据湖摄取和处理。您可以从流程中的关键检查点发出跟踪,以诊断数据湖处理生命周期问题并确定性能瓶颈。

使用 AWS 跟踪数据湖采集和处理 X-Ray

架构图显示了使用 AWS X-Ray、 AWS Step Functions AWS Lambda、和亚马逊简单存储服务提取和处理数据湖的可追溯性。

以下步骤描述了架构:

  1. 不同的生产者将数据传输到基于亚马逊简单存储服务的数据湖中

  2. 数据首先存放在 Amazon S3 存储桶中存放原始数据。这是自 AWS 为 Amazon S3 事件通知 X-Ray 启用跟踪消息以来的首次跟踪。

  3. 数据湖管理区块为分析准备数据。AWS Step Functions触发这些处理块。AWS X-Ray 与 Step Functions 集成,可帮助您识别性能瓶颈并对导致错误的请求进行故障排除。

  4. AWS X-Ray 可以跟踪AWS Lambda函数。Lambda 运行 X-Ray 守护程序并记录一个包含函数调用和结果详细信息的分段。如需进一步检测,请将 X-Ray SDK 与用于记录拨出呼叫并添加注释和元数据的功能捆绑在一起。

  5. 数据管理继续进行,Step Functions 状态机将触发下一个管理区块。像第一个区块一样, X-Ray 可以捕获步进函数和 Lambda 函数。

  6. 数据存放在聚合存储桶中,可供分析。这是数据湖摄取流程中的最后一条跟踪。通过从所有关键检查点发出的跟踪,您可以诊断数据湖处理生命周期问题。

  7. 亚马逊 Quick Sight 、Amazon Redshift 和 Amazon Athena 等多种分析工具使您能够可视化来自基于亚马逊 S3 的数据湖的数据。

延伸阅读

有关其他信息,请参阅以下资源:

图表历史

要获得有关此参考架构图更新的通知,请订阅 RSS 提要。

变更说明日期

初次发布

参考架构图首次发布。

2021 年 7 月 15 日

初次发布

参考架构图首次发布。

2021 年 7 月 15 日

注意

要订阅 RSS 更新,必须为正在使用的浏览器启用 RSS 插件。