기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.
다운스트림 분석을 사용한 Data Lake 수집 및 처리
이 아키텍처는 다운스트림 분석을 사용하여 데이터 레이크 내의 데이터 처리 파이프라인을 모니터링하는 방법을 보여줍니다. 관련 로그, 지표 및 이벤트를 게시하여 비정상적인 동작을 감지하고 추세를 거의 실시간으로 시각화할 수 있습니다.
다운스트림 분석을 사용한 Data Lake 수집 및 처리
다음 단계에서는 아키텍처를 설명합니다.
-
데이터 레이크 내의 데이터 처리 파이프라인은 데이터를 생성합니다. 이 단계에서는 원하는 수의 소스 파이프라인을 생성할 수 있습니다.
-
데이터 파이프라인 구성 요소는 관련 로그, 지표 또는 이벤트를 Amazon CloudWatch에 게시합니다.
-
AWS Lambda 함수는 CloudWatch에서 데이터를 가져오고 사전 처리된 데이터를 Amazon Kinesis Data Streams로 푸시합니다.
-
Kinesis 데이터 스트림은 거의 실시간에 가까운 스트리밍 데이터를 위한 중앙 스토리지입니다.
-
Amazon Kinesis Data Analytics는 거의 실시간으로 데이터를 분석하고 추가 분석을 위해 집계된 지표를 Amazon Timestream 데이터베이스에 저장합니다. Kinesis Data Analytics 쿼리는 파이프라인에서 비정상적인 데이터 동작을 감지할 수도 있습니다.
-
Amazon Timestream은 시계열 분석을 지원하고 시계열을 기본 데이터 유형으로 정의합니다. 고급 집계, 창 함수, 배열 및 행과 같은 복잡한 데이터 유형을 지원합니다.
-
Amazon Kinesis Data Analytics 임계값 쿼리는 Lambda에 실시간에 가까운 분석을 전송합니다.
-
Lambda 함수는 Kinesis Data Analytics에서 처리된 데이터를 기반으로 Amazon Simple Notification Service를 사용하여 실시간 알림을 보낼 수 있습니다.
-
Amazon Quick Sight 대시보드는 성공한 파이프라인 수, 오류율, 오류 유형 분포 등과 같은 추세를 시각화합니다.
참조 자료
자세한 내용은 다음 리소스를 참조하세요.
다이어그램 기록
이 참조 아키텍처 다이어그램의 업데이트에 대한 알림을 받으려면 RSS 피드를 구독하세요.
| 변경 사항 | 설명 | 날짜 |
|---|---|---|
참조 아키텍처 다이어그램이 처음 게시되었습니다. | 2021년 7월 15일 | |
최초 게시 | 참조 아키텍처 다이어그램이 처음 게시되었습니다. | 2021년 7월 15일 |
참고
RSS 업데이트를 구독하려면 사용 중인 브라우저에 대해 RSS 플러그인이 활성화되어 있어야 합니다.