View a markdown version of this page

AWS Apache Spark의 런타임(emr-spark-8.1.0) - Amazon EMR

기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.

AWS Apache Spark의 런타임(emr-spark-8.1.0)

emr-spark-8.1.0 지원 수명 주기

이 릴리스는 장기 지원(LTS) 릴리스로 지정됩니다. 다음 표에서는 Amazon EMR Spark 8.1.0에 지원되는 수명 주기 날짜를 설명합니다.

지원 단계 Date
초기 릴리스 날짜 2026년 9월 8일
표준 지원 종료 시점 2029년 9월 7일
수명 종료 2029년 9월 8일

emr-spark-8.1.0 애플리케이션 버전

이 릴리스에는 AmazonCloudWatchAgent, , Delta, Hudi, Iceberg, JupyterEnterpriseGateway및 애플리케이션이 포함되어 Livy있습니다Spark.

아래 테이블에는 이번 Amazon EMR 릴리스에서 사용할 수 있는 애플리케이션 버전과 이전 세 가지 Amazon EMR 릴리스(해당하는 경우)의 애플리케이션 버전이 나와 있습니다.

각 Amazon EMR 릴리스에서 애플리케이션 버전의 전체 기록은 다음 주제를 참조하세요.

애플리케이션 버전 정보
emr-spark-8.1.0 emr-spark-8.0.0
AWS Java용 SDK 2.44.52.41.32
Python 3.11, 3.133.11, 3.13
Scala 2.13.172.13.16
AmazonCloudWatchAgent1.300034.0-amzn-01.300032.2-amzn-0
Delta4.2.0-amzn-04.0.0-amzn-1-spark
Hudi1.1.1-amzn-01.1.0-amzn-0
Iceberg1.11.0-amzn-01.10.1-amzn-0
JupyterEnterpriseGateway2.6.02.6.0
Livy0.9.0-인큐베이팅0.8.0-incubating
Spark4.1.1-amzn-04.0.2-amzn-0

emr-spark-8.1.0 릴리스 정보

다음 릴리스 정보에는 Apache Spark 4.1.1이 탑재된 Amazon EMR 릴리스 8.1.0(emr-spark-8.1.0)에 대한 정보가 포함되어 있습니다.

새로운 기능

  • Apache Spark 4.1.1 - Amazon EMR Spark 8.1.0에는 Apache Spark 4.1.1이 포함되어 있습니다. 업데이트된 종속성에는 새로운 Spark 기능, 성능 개선 및 버그 수정과 함께 Scala 2.13.17, Jackson 2.20.0 및 Parquet-MR 1.16.0이 포함됩니다.

  • Spark 워크로드에 대한 Iceberg v3 사양 지원 - Amazon EMR Spark 8.1.0은 Spark 워크로드에 대한 Iceberg v3 사양 지원을 확장합니다. 이 릴리스에는 다음과 같은 v3 기능이 추가되었습니다.

    • 지리 공간 데이터 형식 - Iceberg v3 테이블은 GEOMETRY 및 GEOGRAPHY 데이터 형식을 지원합니다.

    • 지리 공간 SQL 함수 - Amazon EMR Spark 8.1.0은 기본적으로 Iceberg 워크로드에 대한 지리 공간 함수를 지원합니다. 지리 공간 함수spark.sql.geospatial.enabled를 활성화하려면 Spark 구성true에서를 로 설정합니다. Apache Spark 4.1은 SRID 0, 3857 및 4326만 지원합니다. 지원되는 함수는 다음과 같습니다.

      • st_area(geom)

      • st_asbinary(geo[, endianness])

      • st_collect(geoArray)

      • st_convexhull(geom)

      • st_distance(geom1, geom2)

      • st_dwithin(geom1, geom2, distance)

      • st_geogfromwkb(wkb)

      • st_geomfromwkb(wkb[, srid])

      • st_geomfromwkt(wkt[, srid])

      • st_intersection(geom1, geom2)

      • st_intersects(geom1, geom2)

      • st_length(geom)

      • st_makeline(geomArray)

      • st_setsrid(geo, srid)

      • st_srid(geo)

      • st_within(geom1, geom2)

      • st_x(point)

      • st_y(point)

    • 나노초 정밀도 타임스탬프 - Iceberg v3 테이블은 나노초 정밀도 타임스탬프 열(TIMESTAMP(9) 및 )을 지원합니다TIMESTAMP_NTZ(9).

    • 변형 파쇄 - Iceberg v3 테이블은 변형 파쇄를 지원합니다.

    • UNKNOWN 데이터 유형 - Iceberg v3 테이블은 유형이 아직 정의되지 않은 열의 UNKNOWN 데이터 유형을 지원합니다. 이 유형의 열은 선택 사항이며 기본값은 null이고 데이터 파일에 저장되지 않습니다.

    • 기본값 - Iceberg v3 열은 선언된 기본값을 지원하며, 이는 라이터가 열을 생략할 때 적용됩니다.

  • 개방형 테이블 형식에 대한 세분화된 액세스 제어 지원 확장 - Amazon EMR Spark 8.1.0은 개방형 테이블 형식(OTFs. Iceberg는 이제 DESCRIBE TABLE, , SHOW TBLPROPERTIES, 및 추가 작업에 대해 FGACSHOW CREATE TABLE를 지원합니다ALTER TABLE table_name WRITE ORDERED BYALTER TABLE table_name WRITE DISTRIBUTED BY. Delta Lake는 이제 VACUUM 작업에 대해 FGAC를 지원합니다.

  • Iceberg 구체화된 뷰의 증분 새로 고침 개선 - 증분 새로 고침은 이제 변경 데이터 캡처를 통해 Merge-on-Read 테이블을 지원합니다. 이렇게 하면 업데이트 및 삭제를 사용하는 워크로드를 빠르게 새로 고칠 수 있습니다. 새로 고침은 파일별 및 매니페스트 수준 열 통계를 사용하여 변경의 영향을 받는 데이터 파일만 읽습니다.

  • 자동 검색을 통한 다중 형식 다중 카탈로그 지원 - 이제 Spark SQL 쿼리는 Spark 구성에 사전 등록하지 않고도 카탈로그를 이름으로 참조할 수 있습니다. 지원되는 카탈로그 유형에는 Iceberg, Delta 및 Hudi 테이블 형식을 자동으로 감지하는 교차 계정 카탈로그 및 S3 Tables 페더레이션 카탈로그가 포함됩니다. 이 기능을 활성화하려면 다음 Spark 구성을 추가합니다. "spark.sql.catalog.spark_catalog": "org.apache.spark.sql.connector.catalog.redirecting.RedirectingSessionCatalog", "spark.sql.catalogResolver": "com.amazonaws.glue.catalog.redirecting.GlueCatalogResolver"

변경 사항, 향상된 기능 및 해결된 문제

  • 이 릴리스에는 Iceberg, Hudi 및 Delta에 대한 버그 수정 및 기능 개선이 포함되어 있습니다. 자세한 내용은 새로운 기능 섹션을 참조하세요.

  • 클러스터 시작 중 디스크 암호화 확인 허용 오차 개선 - 이제 보안 구성에서 로컬 디스크 암호화가 활성화된 클러스터는 인스턴스 부팅 중 일시적인 네트워크 연결 지연을 더 잘 견딜 수 있습니다. 이렇게 변경하면 간헐적인 클러스터 시작 실패가 줄어듭니다.

  • Amazon EMR 구성의 UTF-8 멀티바이트 문자 처리 수정 - Amazon EMR 구성은 이제 UTF-8 멀티바이트 문자를 올바르게 지원합니다. 여기에는 강조 표시된 문자 또는 비 라틴어 스크립트가 있는 값이 포함됩니다. 자세한 내용은 애플리케이션 구성을 참조하세요.

  • Secret Agent 시작 안정성 개선 - Secret Agent 보안 서비스와 관련된 Amazon EMR 클러스터 프로비저닝 실패를 일으킬 수 있는 두 가지 문제를 해결합니다. 인증서 생성은 이제 진행하기 전에 HDFS 준비를 기다리고 시작 스크립트는 Secret Agent Java 프로세스의 감지를 재시도합니다. 이러한 변경 사항을 함께 적용하면 스토리지 초기화 속도가 느리거나 인스턴스 로드가 많은 클러스터에서 시작 실패가 줄어듭니다.

알려진 문제 및 제한

  • 네이티브 Apache Iceberg 테이블 암호화는 Hive 메타스토어 또는 Iceberg REST 카탈로그를 사용하는 경우에만 적용됩니다. AWS Glue 데이터 카탈로그( Iceberg REST 엔드포인트 포함) 및 Hadoop 카탈로그를 사용하면 이러한 속성이 수락되지만 적용되지 않습니다. 따라서 데이터는 일반 텍스트로 작성됩니다. 이러한 카탈로그로 저장된 Iceberg 테이블 데이터를 암호화하려면 테이블의 Amazon S3 위치에서 AWS KMS 키를 사용한 Amazon S3 서버 측 암호화(SSE-KMS)를 활성화합니다.

  • Iceberg v3 테이블에는 두 개 이상의 인수를 사용하는 변환이 지원되지 않습니다.

emr-spark-8.1.0 기본 Java 버전

애플리케이션Java 및 Amazon Corretto 버전(기본값은 굵은체로 표시)
Spark17, 21
Livy17, 11, 8
Hadoop17, 11, 8

emr-spark-8.1.0 구성 요소 버전

이 릴리스를 통해 Amazon EMR이 설치하는 구성 요소는 다음과 같습니다. 일부는 빅 데이터 애플리케이션 패키지의 일부로 설치됩니다. 나머지는 Amazon EMR에 고유하며 시스템 프로세스 및 기능을 위해 설치됩니다. 이는 일반적으로 emr 또는 aws로 시작됩니다. 최근 Amazon EMR 릴리스의 빅 데이터 애플리케이션 패키지는 일반적으로 커뮤니티에서 발견된 최신 버전입니다. 가능한 한 빨리 Amazon EMR에서 커뮤니티 릴리스를 제공합니다.

Amazon EMR의 일부 구성 요소는 커뮤니티 버전과 다릅니다. 이러한 구성 요소에는 CommunityVersion-amzn-EmrVersion 양식의 버전 레이블이 있습니다. EmrVersion은 0에서 시작합니다. 예를 들어, 버전 2.2의 myapp-component라는 오픈 소스 커뮤니티 구성 요소가 다른 Amazon EMR 릴리스에 포함되도록 세 번 수정된 경우 해당 릴리스 버전은 2.2-amzn-2로 나열됩니다.

구성 요소 버전 설명
adot-java-agent1.31.0애플리케이션 대몬(daemon)에서 지표를 수집하는 Java 에이전트입니다.
delta4.2.0-amzn-0Delta Lake는 방대한 분석 데이터 세트를 위한 오픈 테이블 형식입니다.
emr-amazon-cloudwatch-agent1.300034.0-amzn-0Amazon EC2 인스턴스에서 내부 시스템 수준 지표와 사용자 지정 애플리케이션 지표를 수집하는 애플리케이션입니다.
emr-ddb6.1.0하둡 에코시스템 애플리케이션용 Amazon DynamoDB 커넥터
emr-goodies3.23.0-spark편리한 하둡 에코시스템용 추가 라이브러리
emr-notebook-env1.18.0Jupyter Enterprise Gateway가 포함된 EMR 노트북용 Conda 환경
emr-s3-dist-cp2.46.0Amazon S3용으로 최적화된 분사 복사 애플리케이션.
hadoop-client3.4.2-amzn-3'hdfs', 'hadoop', 'yarn' 등과 같은 하둡 명령줄 클라이언트
hadoop-hdfs-datanode3.4.2-amzn-3블록을 저장하는 HDFS 노드 수준 서비스
hadoop-hdfs-library3.4.2-amzn-3HDFS 명령줄 클라이언트 및 라이브러리
hadoop-hdfs-namenode3.4.2-amzn-3파일 이름 및 블록 위치를 추적하는 HDFS 서비스
hadoop-hdfs-zkfc3.4.2-amzn-3HA 모드의 네임노드를 추적하기 위한 ZKFC 서비스입니다.
hadoop-hdfs-journalnode3.4.2-amzn-3HA 클러스터에서 하둡 파일 시스템 저널을 관리하기 위한 HDFS 서비스
hadoop-httpfs-server3.4.2-amzn-3HDFS 작업에 대한 HTTP 엔드포인트
hadoop-kms-server3.4.2-amzn-3하둡의 KeyProvider API를 기반으로 하는 암호화 키 관리 서버
hadoop-mapred3.4.2-amzn-3MapReduce 애플리케이션을 실행하는 MapReduce 실행 엔진 라이브러리
hadoop-yarn-nodemanager3.4.2-amzn-3개별 노드의 컨테이너를 관리하는 YARN 서비스
hadoop-yarn-resourcemanager3.4.2-amzn-3클러스터 리소스 및 분산 애플리케이션을 할당 및 관리하는 YARN 서비스
hadoop-yarn-timeline-server3.4.2-amzn-3YARN 애플리케이션의 현재 및 기록 정보를 가져오는 서비스
hudi1.1.1-amzn-0짧은 지연 시간 및 높은 효율성으로 데이터 파이프라인을 구동하는 증분 처리 프레임워크.
hudi-spark1.1.1-amzn-0Hudi와 함께 Spark를 실행하기 위한 번들 라이브러리.
iceberg1.11.0-amzn-0Apache Iceberg는 방대한 분석 데이터 세트를 위한 오픈 테이블 형식입니다.
livy-server0.9.0-인큐베이팅Apache Spark와 상호작용하기 위한 REST 인터페이스
nginx1.12.1HTTP인 nginx [engine x] 및 역방향 프록시 서버
mariadb-server5.5.68 이상MariaDB 데이터베이스 서버.
nvidia-cuda12.5.0Nvidia 드라이버와 Cuda 도구 키트
r4.3.2통계 컴퓨팅용 R 프로젝트
spark-client4.1.1-amzn-0Spark 명령줄 클라이언트.
spark-history-server4.1.1-amzn-0완료된 Spark 애플리케이션의 수명에 대해 기록된 이벤트를 조회하는 웹 UI.
spark-on-yarn4.1.1-amzn-0YARN용 인 메모리 실행 엔진.
spark-yarn-slave4.1.1-amzn-0YARN 슬레이브에서 필요한 Apache Spark 라이브러리.
spark-rapids26.04.2-amzn-0GPU로 Apache Spark를 가속화하는 Nvidia Spark RAPIDS 플러그인.
zookeeper-server3.9.3-amzn-8구성 정보 유지 관리, 이름 지정, 분산 동기화 제공 및 그룹 서비스 제공을 위한 중앙 집중식 서비스.
zookeeper-client3.9.3-amzn-8ZooKeeper 명령줄 클라이언트.

emr-spark-8.1.0 구성 분류

구성 분류를 사용하면 애플리케이션을 사용자 지정할 수 있습니다. 이는 종종 hive-site.xml과 같이 애플리케이션의 구성 XML 파일에 해당합니다. 자세한 내용은 애플리케이션 구성 섹션을 참조하세요.

재구성 작업은 실행 중인 클러스터의 인스턴스 그룹에 대한 구성을 지정할 때 수행됩니다. Amazon EMR은 사용자가 수정한 분류에 대한 재구성 작업만 시작합니다. 자세한 내용은 실행 중인 클러스터에서 인스턴스 그룹 재구성 섹션을 참조하세요.

emr-spark-8.1.0 분류
분류 설명 재구성 작업

capacity-scheduler

Hadoop capacity-scheduler.xml 파일에서 값을 변경합니다.

Restarts the ResourceManager service.

container-executor

Hadoop YARN container-executor.cfg 파일에서 값을 변경합니다.

Not available.

container-log4j

Hadoop YARN container-log4j.properties 파일에서 값을 변경합니다.

Not available.

core-site

Hadoop core-site.xml 파일에서 값을 변경합니다.

Restarts the Hadoop HDFS services Namenode, SecondaryNamenode, Datanode, ZKFC, and Journalnode. Restarts the Hadoop YARN services ResourceManager, NodeManager, ProxyServer, and TimelineServer. Additionally restarts Hadoop KMS, Hadoop Httpfs, and MapReduce-HistoryServer.

docker-conf

Docker 관련 설정을 변경합니다.

Not available.

hadoop-env

모든 Hadoop 구성 요소에 대한 Hadoop 환경에서 값을 변경합니다.

Restarts the Hadoop HDFS services Namenode, SecondaryNamenode, Datanode, ZKFC, and Journalnode. Restarts the Hadoop YARN services ResourceManager, NodeManager, ProxyServer, and TimelineServer. Additionally restarts MapReduce-HistoryServer.

hadoop-log4j

Hadoop log4j.properties 파일에서 값을 변경합니다.

Restarts the Hadoop HDFS services SecondaryNamenode, Datanode, and Journalnode. Restarts the Hadoop YARN services ResourceManager, NodeManager, ProxyServer, and TimelineServer. Additionally restarts Hadoop KMS, Hadoop Httpfs, and MapReduce-HistoryServer.

hadoop-ssl-server

hadoop ssl 서버 구성을 변경합니다.

Not available.

hadoop-ssl-client

hadoop ssl 클라이언트 구성을 변경합니다.

Not available.

hdfs-encryption-zones

HDFS 암호화 영역을 구성합니다.

This classification should not be reconfigured.

hdfs-env

HDFS 환경에서 값을 변경합니다.

Restarts Hadoop HDFS services Namenode, Datanode, and ZKFC.

hdfs-site

HDFS hdfs-site.xml에서 값을 변경합니다.

Restarts the Hadoop HDFS services Namenode, SecondaryNamenode, Datanode, ZKFC, and Journalnode. Additionally restarts Hadoop Httpfs.

httpfs-env

HTTPFS 환경에서 값을 변경합니다.

Restarts Hadoop Httpfs service.

httpfs-site

Hadoop httpfs-site.xml 파일에서 값을 변경합니다.

Restarts Hadoop Httpfs service.

hadoop-kms-acls

Hadoop kms-acls.xml 파일에서 값을 변경합니다.

Not available.

hadoop-kms-env

Hadoop KMS 환경에서 값을 변경합니다.

Restarts Hadoop-KMS service.

hadoop-kms-java-home

Hadoop의 KMS java 홈 변경

Not available.

hadoop-kms-log4j

Hadoop kms-log4j.properties 파일에서 값을 변경합니다.

Not available.

hadoop-kms-site

Hadoop kms-site.xml 파일에서 값을 변경합니다.

Restarts Hadoop-KMS.

hudi-env

Hudi 환경에서 값을 변경합니다.

Not available.

hudi-defaults

Hudi hudi-defaults.conf 파일에서 값을 변경합니다.

Not available.

iceberg-defaults

Iceberg iceberg-defaults.conf 파일에서 값을 변경합니다.

Not available.

delta-defaults

Delta delta-defaults.conf 파일에서 값을 변경합니다.

Not available.

jupyter-notebook-conf

Jupyter Notebook jupyter_notebook_config.py 파일에서 값을 변경합니다.

Not available.

jupyter-s3-conf

Jupyter Notebook S3 지속성 구성

Not available.

jupyter-sparkmagic-conf

Sparkmagic config.json 파일에서 값을 변경합니다.

Not available.

livy-conf

Livy livy.conf 파일에서 값을 변경합니다.

Restarts Livy Server.

livy-env

Livy 환경에서 값을 변경합니다.

Restarts Livy Server.

livy-log4j2

Livy log4j2.properties 설정을 변경합니다.

Restarts Livy Server.

mapred-env

MapReduce 애플리케이션 환경에서 값을 변경합니다.

Restarts Hadoop MapReduce-HistoryServer.

mapred-site

MapReduce 애플리케이션 mapred-site.xml 파일에서 값을 변경합니다.

Restarts Hadoop MapReduce-HistoryServer.

spark

Apache Spark에 대한 Amazon EMR 큐레이트 설정입니다.

This property modifies spark-defaults. See actions there.

spark-defaults

Spark spark-defaults.conf 파일에서 값을 변경합니다.

Restarts Spark history server and Spark thrift server.

spark-env

Spark 환경에서 값을 변경합니다.

Restarts Spark history server and Spark thrift server.

spark-hive-site

Spark hive-site.xml 파일에서 값을 변경합니다.

Not available.

spark-log4j2

Spark log4j2.properties 파일에서 값을 변경합니다.

Restarts Spark history server and Spark thrift server.

spark-metrics

Spark metrics.properties 파일에서 값을 변경합니다.

Restarts Spark history server and Spark thrift server.

yarn-env

YARN 환경에서 값을 변경합니다.

Restarts the Hadoop YARN services ResourceManager, NodeManager, ProxyServer, and TimelineServer. Additionally restarts MapReduce-HistoryServer.

yarn-site

YARN yarn-site.xml 파일에서 값을 변경합니다.

Restarts the Hadoop YARN services ResourceManager, NodeManager, ProxyServer, and TimelineServer. Additionally restarts Livy Server and MapReduce-HistoryServer.

zookeeper-config

ZooKeeper zoo.cfg 파일에서 값을 변경합니다.

Restarts Zookeeper server.

zookeeper-logback

ZooKeeper logback.xml 파일에서 값을 변경합니다.

Restarts Zookeeper server.

cloudwatch-logs

EMR 클러스터 노드에 대한 CloudWatch Logs 통합을 구성합니다.

Not available.

emr-metrics

이 노드에 대한 emr 지표 설정을 변경합니다.

Restarts the CloudWatchAgent service.

Amazon EMR Spark 8.1.0 변경 로그

Amazon EMR Spark 8.1.0에 대한 변경 로그
Date이벤트설명
2026-09-08문서 게시Amazon EMR Spark 8.1.0(emr-spark-8.1.0) 릴리스 정보가 처음 게시됨