기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.
AWS Apache Spark의 런타임(emr-spark-8.1.0)
emr-spark-8.1.0 지원 수명 주기
이 릴리스는 장기 지원(LTS) 릴리스로 지정됩니다. 다음 표에서는 Amazon EMR Spark 8.1.0에 지원되는 수명 주기 날짜를 설명합니다.
| 지원 단계 | Date |
|---|---|
| 초기 릴리스 날짜 | 2026년 9월 8일 |
| 표준 지원 종료 시점 | 2029년 9월 7일 |
| 수명 종료 | 2029년 9월 8일 |
emr-spark-8.1.0 애플리케이션 버전
이 릴리스에는 AmazonCloudWatchAgent, , Delta
아래 테이블에는 이번 Amazon EMR 릴리스에서 사용할 수 있는 애플리케이션 버전과 이전 세 가지 Amazon EMR 릴리스(해당하는 경우)의 애플리케이션 버전이 나와 있습니다.
각 Amazon EMR 릴리스에서 애플리케이션 버전의 전체 기록은 다음 주제를 참조하세요.
| emr-spark-8.1.0 | emr-spark-8.0.0 | |
|---|---|---|
| AWS Java용 SDK | 2.44.5 | 2.41.32 |
| Python | 3.11, 3.13 | 3.11, 3.13 |
| Scala | 2.13.17 | 2.13.16 |
| AmazonCloudWatchAgent | 1.300034.0-amzn-0 | 1.300032.2-amzn-0 |
| Delta | 4.2.0-amzn-0 | 4.0.0-amzn-1-spark |
| Hudi | 1.1.1-amzn-0 | 1.1.0-amzn-0 |
| Iceberg | 1.11.0-amzn-0 | 1.10.1-amzn-0 |
| JupyterEnterpriseGateway | 2.6.0 | 2.6.0 |
| Livy | 0.9.0-인큐베이팅 | 0.8.0-incubating |
| Spark | 4.1.1-amzn-0 | 4.0.2-amzn-0 |
emr-spark-8.1.0 릴리스 정보
다음 릴리스 정보에는 Apache Spark 4.1.1이 탑재된 Amazon EMR 릴리스 8.1.0(emr-spark-8.1.0)에 대한 정보가 포함되어 있습니다.
새로운 기능
Apache Spark 4.1.1 - Amazon EMR Spark 8.1.0에는 Apache Spark 4.1.1이 포함되어 있습니다. 업데이트된 종속성에는 새로운 Spark 기능, 성능 개선 및 버그 수정과 함께 Scala 2.13.17, Jackson 2.20.0 및 Parquet-MR 1.16.0이 포함됩니다.
Spark 워크로드에 대한 Iceberg v3 사양 지원 - Amazon EMR Spark 8.1.0은 Spark 워크로드에 대한 Iceberg v3 사양 지원을 확장합니다. 이 릴리스에는 다음과 같은 v3 기능이 추가되었습니다.
지리 공간 데이터 형식 - Iceberg v3 테이블은
GEOMETRY및GEOGRAPHY데이터 형식을 지원합니다.지리 공간 SQL 함수 - Amazon EMR Spark 8.1.0은 기본적으로 Iceberg 워크로드에 대한 지리 공간 함수를 지원합니다. 지리 공간 함수
spark.sql.geospatial.enabled를 활성화하려면 Spark 구성true에서를 로 설정합니다. Apache Spark 4.1은 SRID 0, 3857 및 4326만 지원합니다. 지원되는 함수는 다음과 같습니다.st_area(geom)st_asbinary(geo[, endianness])st_collect(geoArray)st_convexhull(geom)st_distance(geom1, geom2)st_dwithin(geom1, geom2, distance)st_geogfromwkb(wkb)st_geomfromwkb(wkb[, srid])st_geomfromwkt(wkt[, srid])st_intersection(geom1, geom2)st_intersects(geom1, geom2)st_length(geom)st_makeline(geomArray)st_setsrid(geo, srid)st_srid(geo)st_within(geom1, geom2)st_x(point)st_y(point)
나노초 정밀도 타임스탬프 - Iceberg v3 테이블은 나노초 정밀도 타임스탬프 열(
TIMESTAMP(9)및 )을 지원합니다TIMESTAMP_NTZ(9).변형 파쇄 - Iceberg v3 테이블은 변형 파쇄를 지원합니다.
UNKNOWN데이터 유형 - Iceberg v3 테이블은 유형이 아직 정의되지 않은 열의UNKNOWN데이터 유형을 지원합니다. 이 유형의 열은 선택 사항이며 기본값은 null이고 데이터 파일에 저장되지 않습니다.기본값 - Iceberg v3 열은 선언된 기본값을 지원하며, 이는 라이터가 열을 생략할 때 적용됩니다.
개방형 테이블 형식에 대한 세분화된 액세스 제어 지원 확장 - Amazon EMR Spark 8.1.0은 개방형 테이블 형식(OTFs. Iceberg는 이제
DESCRIBE TABLE, ,SHOW TBLPROPERTIES, 및 추가 작업에 대해 FGACSHOW CREATE TABLE를 지원합니다ALTER TABLE table_name WRITE ORDERED BYALTER TABLE table_name WRITE DISTRIBUTED BY. Delta Lake는 이제VACUUM작업에 대해 FGAC를 지원합니다.Iceberg 구체화된 뷰의 증분 새로 고침 개선 - 증분 새로 고침은 이제 변경 데이터 캡처를 통해 Merge-on-Read 테이블을 지원합니다. 이렇게 하면 업데이트 및 삭제를 사용하는 워크로드를 빠르게 새로 고칠 수 있습니다. 새로 고침은 파일별 및 매니페스트 수준 열 통계를 사용하여 변경의 영향을 받는 데이터 파일만 읽습니다.
자동 검색을 통한 다중 형식 다중 카탈로그 지원 - 이제 Spark SQL 쿼리는 Spark 구성에 사전 등록하지 않고도 카탈로그를 이름으로 참조할 수 있습니다. 지원되는 카탈로그 유형에는 Iceberg, Delta 및 Hudi 테이블 형식을 자동으로 감지하는 교차 계정 카탈로그 및 S3 Tables 페더레이션 카탈로그가 포함됩니다. 이 기능을 활성화하려면 다음 Spark 구성을 추가합니다.
"spark.sql.catalog.spark_catalog": "org.apache.spark.sql.connector.catalog.redirecting.RedirectingSessionCatalog", "spark.sql.catalogResolver": "com.amazonaws.glue.catalog.redirecting.GlueCatalogResolver"
변경 사항, 향상된 기능 및 해결된 문제
이 릴리스에는 Iceberg, Hudi 및 Delta에 대한 버그 수정 및 기능 개선이 포함되어 있습니다. 자세한 내용은 새로운 기능 섹션을 참조하세요.
클러스터 시작 중 디스크 암호화 확인 허용 오차 개선 - 이제 보안 구성에서 로컬 디스크 암호화가 활성화된 클러스터는 인스턴스 부팅 중 일시적인 네트워크 연결 지연을 더 잘 견딜 수 있습니다. 이렇게 변경하면 간헐적인 클러스터 시작 실패가 줄어듭니다.
Amazon EMR 구성의 UTF-8 멀티바이트 문자 처리 수정 - Amazon EMR 구성은 이제 UTF-8 멀티바이트 문자를 올바르게 지원합니다. 여기에는 강조 표시된 문자 또는 비 라틴어 스크립트가 있는 값이 포함됩니다. 자세한 내용은 애플리케이션 구성을 참조하세요.
Secret Agent 시작 안정성 개선 - Secret Agent 보안 서비스와 관련된 Amazon EMR 클러스터 프로비저닝 실패를 일으킬 수 있는 두 가지 문제를 해결합니다. 인증서 생성은 이제 진행하기 전에 HDFS 준비를 기다리고 시작 스크립트는 Secret Agent Java 프로세스의 감지를 재시도합니다. 이러한 변경 사항을 함께 적용하면 스토리지 초기화 속도가 느리거나 인스턴스 로드가 많은 클러스터에서 시작 실패가 줄어듭니다.
알려진 문제 및 제한
네이티브 Apache Iceberg 테이블 암호화는 Hive 메타스토어 또는 Iceberg REST 카탈로그를 사용하는 경우에만 적용됩니다. AWS Glue 데이터 카탈로그( Iceberg REST 엔드포인트 포함) 및 Hadoop 카탈로그를 사용하면 이러한 속성이 수락되지만 적용되지 않습니다. 따라서 데이터는 일반 텍스트로 작성됩니다. 이러한 카탈로그로 저장된 Iceberg 테이블 데이터를 암호화하려면 테이블의 Amazon S3 위치에서 AWS KMS 키를 사용한 Amazon S3 서버 측 암호화(SSE-KMS)를 활성화합니다.
Iceberg v3 테이블에는 두 개 이상의 인수를 사용하는 변환이 지원되지 않습니다.
emr-spark-8.1.0 기본 Java 버전
| 애플리케이션 | Java 및 Amazon Corretto 버전(기본값은 굵은체로 표시) |
|---|---|
| Spark | 17, 21 |
| Livy | 17, 11, 8 |
| Hadoop | 17, 11, 8 |
emr-spark-8.1.0 구성 요소 버전
이 릴리스를 통해 Amazon EMR이 설치하는 구성 요소는 다음과 같습니다. 일부는 빅 데이터 애플리케이션 패키지의 일부로 설치됩니다. 나머지는 Amazon EMR에 고유하며 시스템 프로세스 및 기능을 위해 설치됩니다. 이는 일반적으로 emr 또는 aws로 시작됩니다. 최근 Amazon EMR 릴리스의 빅 데이터 애플리케이션 패키지는 일반적으로 커뮤니티에서 발견된 최신 버전입니다. 가능한 한 빨리 Amazon EMR에서 커뮤니티 릴리스를 제공합니다.
Amazon EMR의 일부 구성 요소는 커뮤니티 버전과 다릅니다. 이러한 구성 요소에는 양식의 버전 레이블이 있습니다. CommunityVersion-amzn-EmrVersion은 0에서 시작합니다. 예를 들어, 버전 2.2의 EmrVersionmyapp-component라는 오픈 소스 커뮤니티 구성 요소가 다른 Amazon EMR 릴리스에 포함되도록 세 번 수정된 경우 해당 릴리스 버전은 2.2-amzn-2로 나열됩니다.
| 구성 요소 | 버전 | 설명 |
|---|---|---|
| adot-java-agent | 1.31.0 | 애플리케이션 대몬(daemon)에서 지표를 수집하는 Java 에이전트입니다. |
| delta | 4.2.0-amzn-0 | Delta Lake는 방대한 분석 데이터 세트를 위한 오픈 테이블 형식입니다. |
| emr-amazon-cloudwatch-agent | 1.300034.0-amzn-0 | Amazon EC2 인스턴스에서 내부 시스템 수준 지표와 사용자 지정 애플리케이션 지표를 수집하는 애플리케이션입니다. |
| emr-ddb | 6.1.0 | 하둡 에코시스템 애플리케이션용 Amazon DynamoDB 커넥터 |
| emr-goodies | 3.23.0-spark | 편리한 하둡 에코시스템용 추가 라이브러리 |
| emr-notebook-env | 1.18.0 | Jupyter Enterprise Gateway가 포함된 EMR 노트북용 Conda 환경 |
| emr-s3-dist-cp | 2.46.0 | Amazon S3용으로 최적화된 분사 복사 애플리케이션. |
| hadoop-client | 3.4.2-amzn-3 | 'hdfs', 'hadoop', 'yarn' 등과 같은 하둡 명령줄 클라이언트 |
| hadoop-hdfs-datanode | 3.4.2-amzn-3 | 블록을 저장하는 HDFS 노드 수준 서비스 |
| hadoop-hdfs-library | 3.4.2-amzn-3 | HDFS 명령줄 클라이언트 및 라이브러리 |
| hadoop-hdfs-namenode | 3.4.2-amzn-3 | 파일 이름 및 블록 위치를 추적하는 HDFS 서비스 |
| hadoop-hdfs-zkfc | 3.4.2-amzn-3 | HA 모드의 네임노드를 추적하기 위한 ZKFC 서비스입니다. |
| hadoop-hdfs-journalnode | 3.4.2-amzn-3 | HA 클러스터에서 하둡 파일 시스템 저널을 관리하기 위한 HDFS 서비스 |
| hadoop-httpfs-server | 3.4.2-amzn-3 | HDFS 작업에 대한 HTTP 엔드포인트 |
| hadoop-kms-server | 3.4.2-amzn-3 | 하둡의 KeyProvider API를 기반으로 하는 암호화 키 관리 서버 |
| hadoop-mapred | 3.4.2-amzn-3 | MapReduce 애플리케이션을 실행하는 MapReduce 실행 엔진 라이브러리 |
| hadoop-yarn-nodemanager | 3.4.2-amzn-3 | 개별 노드의 컨테이너를 관리하는 YARN 서비스 |
| hadoop-yarn-resourcemanager | 3.4.2-amzn-3 | 클러스터 리소스 및 분산 애플리케이션을 할당 및 관리하는 YARN 서비스 |
| hadoop-yarn-timeline-server | 3.4.2-amzn-3 | YARN 애플리케이션의 현재 및 기록 정보를 가져오는 서비스 |
| hudi | 1.1.1-amzn-0 | 짧은 지연 시간 및 높은 효율성으로 데이터 파이프라인을 구동하는 증분 처리 프레임워크. |
| hudi-spark | 1.1.1-amzn-0 | Hudi와 함께 Spark를 실행하기 위한 번들 라이브러리. |
| iceberg | 1.11.0-amzn-0 | Apache Iceberg는 방대한 분석 데이터 세트를 위한 오픈 테이블 형식입니다. |
| livy-server | 0.9.0-인큐베이팅 | Apache Spark와 상호작용하기 위한 REST 인터페이스 |
| nginx | 1.12.1 | HTTP인 nginx [engine x] 및 역방향 프록시 서버 |
| mariadb-server | 5.5.68 이상 | MariaDB 데이터베이스 서버. |
| nvidia-cuda | 12.5.0 | Nvidia 드라이버와 Cuda 도구 키트 |
| r | 4.3.2 | 통계 컴퓨팅용 R 프로젝트 |
| spark-client | 4.1.1-amzn-0 | Spark 명령줄 클라이언트. |
| spark-history-server | 4.1.1-amzn-0 | 완료된 Spark 애플리케이션의 수명에 대해 기록된 이벤트를 조회하는 웹 UI. |
| spark-on-yarn | 4.1.1-amzn-0 | YARN용 인 메모리 실행 엔진. |
| spark-yarn-slave | 4.1.1-amzn-0 | YARN 슬레이브에서 필요한 Apache Spark 라이브러리. |
| spark-rapids | 26.04.2-amzn-0 | GPU로 Apache Spark를 가속화하는 Nvidia Spark RAPIDS 플러그인. |
| zookeeper-server | 3.9.3-amzn-8 | 구성 정보 유지 관리, 이름 지정, 분산 동기화 제공 및 그룹 서비스 제공을 위한 중앙 집중식 서비스. |
| zookeeper-client | 3.9.3-amzn-8 | ZooKeeper 명령줄 클라이언트. |
emr-spark-8.1.0 구성 분류
구성 분류를 사용하면 애플리케이션을 사용자 지정할 수 있습니다. 이는 종종 hive-site.xml과 같이 애플리케이션의 구성 XML 파일에 해당합니다. 자세한 내용은 애플리케이션 구성 섹션을 참조하세요.
재구성 작업은 실행 중인 클러스터의 인스턴스 그룹에 대한 구성을 지정할 때 수행됩니다. Amazon EMR은 사용자가 수정한 분류에 대한 재구성 작업만 시작합니다. 자세한 내용은 실행 중인 클러스터에서 인스턴스 그룹 재구성 섹션을 참조하세요.
| 분류 | 설명 | 재구성 작업 |
|---|---|---|
capacity-scheduler | Hadoop capacity-scheduler.xml 파일에서 값을 변경합니다. | Restarts the ResourceManager service. |
container-executor | Hadoop YARN container-executor.cfg 파일에서 값을 변경합니다. | Not available. |
container-log4j | Hadoop YARN container-log4j.properties 파일에서 값을 변경합니다. | Not available. |
core-site | Hadoop core-site.xml 파일에서 값을 변경합니다. | Restarts the Hadoop HDFS services Namenode, SecondaryNamenode, Datanode, ZKFC, and Journalnode. Restarts the Hadoop YARN services ResourceManager, NodeManager, ProxyServer, and TimelineServer. Additionally restarts Hadoop KMS, Hadoop Httpfs, and MapReduce-HistoryServer. |
docker-conf | Docker 관련 설정을 변경합니다. | Not available. |
hadoop-env | 모든 Hadoop 구성 요소에 대한 Hadoop 환경에서 값을 변경합니다. | Restarts the Hadoop HDFS services Namenode, SecondaryNamenode, Datanode, ZKFC, and Journalnode. Restarts the Hadoop YARN services ResourceManager, NodeManager, ProxyServer, and TimelineServer. Additionally restarts MapReduce-HistoryServer. |
hadoop-log4j | Hadoop log4j.properties 파일에서 값을 변경합니다. | Restarts the Hadoop HDFS services SecondaryNamenode, Datanode, and Journalnode. Restarts the Hadoop YARN services ResourceManager, NodeManager, ProxyServer, and TimelineServer. Additionally restarts Hadoop KMS, Hadoop Httpfs, and MapReduce-HistoryServer. |
hadoop-ssl-server | hadoop ssl 서버 구성을 변경합니다. | Not available. |
hadoop-ssl-client | hadoop ssl 클라이언트 구성을 변경합니다. | Not available. |
hdfs-encryption-zones | HDFS 암호화 영역을 구성합니다. | This classification should not be reconfigured. |
hdfs-env | HDFS 환경에서 값을 변경합니다. | Restarts Hadoop HDFS services Namenode, Datanode, and ZKFC. |
hdfs-site | HDFS hdfs-site.xml에서 값을 변경합니다. | Restarts the Hadoop HDFS services Namenode, SecondaryNamenode, Datanode, ZKFC, and Journalnode. Additionally restarts Hadoop Httpfs. |
httpfs-env | HTTPFS 환경에서 값을 변경합니다. | Restarts Hadoop Httpfs service. |
httpfs-site | Hadoop httpfs-site.xml 파일에서 값을 변경합니다. | Restarts Hadoop Httpfs service. |
hadoop-kms-acls | Hadoop kms-acls.xml 파일에서 값을 변경합니다. | Not available. |
hadoop-kms-env | Hadoop KMS 환경에서 값을 변경합니다. | Restarts Hadoop-KMS service. |
hadoop-kms-java-home | Hadoop의 KMS java 홈 변경 | Not available. |
hadoop-kms-log4j | Hadoop kms-log4j.properties 파일에서 값을 변경합니다. | Not available. |
hadoop-kms-site | Hadoop kms-site.xml 파일에서 값을 변경합니다. | Restarts Hadoop-KMS. |
hudi-env | Hudi 환경에서 값을 변경합니다. | Not available. |
hudi-defaults | Hudi hudi-defaults.conf 파일에서 값을 변경합니다. | Not available. |
iceberg-defaults | Iceberg iceberg-defaults.conf 파일에서 값을 변경합니다. | Not available. |
delta-defaults | Delta delta-defaults.conf 파일에서 값을 변경합니다. | Not available. |
jupyter-notebook-conf | Jupyter Notebook jupyter_notebook_config.py 파일에서 값을 변경합니다. | Not available. |
jupyter-s3-conf | Jupyter Notebook S3 지속성 구성 | Not available. |
jupyter-sparkmagic-conf | Sparkmagic config.json 파일에서 값을 변경합니다. | Not available. |
livy-conf | Livy livy.conf 파일에서 값을 변경합니다. | Restarts Livy Server. |
livy-env | Livy 환경에서 값을 변경합니다. | Restarts Livy Server. |
livy-log4j2 | Livy log4j2.properties 설정을 변경합니다. | Restarts Livy Server. |
mapred-env | MapReduce 애플리케이션 환경에서 값을 변경합니다. | Restarts Hadoop MapReduce-HistoryServer. |
mapred-site | MapReduce 애플리케이션 mapred-site.xml 파일에서 값을 변경합니다. | Restarts Hadoop MapReduce-HistoryServer. |
spark | Apache Spark에 대한 Amazon EMR 큐레이트 설정입니다. | This property modifies spark-defaults. See actions there. |
spark-defaults | Spark spark-defaults.conf 파일에서 값을 변경합니다. | Restarts Spark history server and Spark thrift server. |
spark-env | Spark 환경에서 값을 변경합니다. | Restarts Spark history server and Spark thrift server. |
spark-hive-site | Spark hive-site.xml 파일에서 값을 변경합니다. | Not available. |
spark-log4j2 | Spark log4j2.properties 파일에서 값을 변경합니다. | Restarts Spark history server and Spark thrift server. |
spark-metrics | Spark metrics.properties 파일에서 값을 변경합니다. | Restarts Spark history server and Spark thrift server. |
yarn-env | YARN 환경에서 값을 변경합니다. | Restarts the Hadoop YARN services ResourceManager, NodeManager, ProxyServer, and TimelineServer. Additionally restarts MapReduce-HistoryServer. |
yarn-site | YARN yarn-site.xml 파일에서 값을 변경합니다. | Restarts the Hadoop YARN services ResourceManager, NodeManager, ProxyServer, and TimelineServer. Additionally restarts Livy Server and MapReduce-HistoryServer. |
zookeeper-config | ZooKeeper zoo.cfg 파일에서 값을 변경합니다. | Restarts Zookeeper server. |
zookeeper-logback | ZooKeeper logback.xml 파일에서 값을 변경합니다. | Restarts Zookeeper server. |
cloudwatch-logs | EMR 클러스터 노드에 대한 CloudWatch Logs 통합을 구성합니다. | Not available. |
emr-metrics | 이 노드에 대한 emr 지표 설정을 변경합니다. | Restarts the CloudWatchAgent service. |
Amazon EMR Spark 8.1.0 변경 로그
| Date | 이벤트 | 설명 |
|---|---|---|
| 2026-09-08 | 문서 게시 | Amazon EMR Spark 8.1.0(emr-spark-8.1.0) 릴리스 정보가 처음 게시됨 |