기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.
서버리스 데이터 레이크에서 삽입 및 업서트 관리
게시일: 2021년 6월 15일(다이어그램 기록)
이 아키텍처는 Amazon EMR에서 Apache Hudi 실행 중인를 사용하여 Amazon Simple Storage Service의 데이터 세트에 대한 삽입 및 업데이트를 처리하는 방법을 보여줍니다. 온디맨드 분석을 프로비저닝하고 영구 데이터 마트를 생성하는 비용 효율적이고 확장 가능한 데이터 레이크를 구축할 수 있습니다.
서버리스 데이터 레이크에서 삽입 및 업서트 관리
다음 단계에서는 아키텍처를 설명합니다.
-
배치, 변경 데이터 캡처(CDC) 또는 Amazon S3의 원시 계층으로 스트리밍을 사용하여 소스 시스템에서 데이터를 수집합니다.
-
데이터가 Amazon S3의 원시 데이터 레이크에 지속되면 크롤러를 사용하여 데이터를 크롤링하고 AWS Glue 데이터 카탈로그에 채웁니다.
-
원시 데이터를 Amazon EMR 클러스터로 가져와 정리 및 변환을 위해 Hive 및 Spark를 사용하여 읽습니다.
-
Apache Hudi Amazon EMR에서 실행되는는 Spark APIs를 사용하여 데이터를 읽고 필요한 데이터 세트에 대한 삽입 및 업서트를 수행합니다.
-
정리 및 변환된 데이터를 Amazon S3 처리 및 보고 가능한 버킷으로 다시 유지합니다.
-
Athena를 사용하여 보고 가능한 데이터를 온디맨드로 사용하거나 Amazon Redshift에 로드합니다. 사용자, 도구 및 리소스마다이 데이터를 사용할 수 있습니다.
-
Amazon Managed Workflows for Apache Airflow (MWAA)를 사용한 워크플로 오케스트레이션을 사용하여 전체 데이터 이동을 처리하고, 배치 데이터에 대해 온디맨드 Amazon EMR 클러스터를 실행하고, 데이터를 로드합니다.
참조 자료
자세한 내용은 다음 리소스를 참조하세요.
다이어그램 기록
이 참조 아키텍처 다이어그램의 업데이트에 대한 알림을 받으려면 RSS 피드를 구독하세요.
| 변경 사항 | 설명 | 날짜 |
|---|---|---|
최초 게시 | 참조 아키텍처 다이어그램이 처음 게시되었습니다. | 2021년 6월 15일 |
참고
RSS 업데이트를 구독하려면 사용 중인 브라우저에 대해 RSS 플러그인이 활성화되어 있어야 합니다.