기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.
SageMaker HyperPod 클러스터 이벤트 참조
이 페이지에서는 Amazon SageMaker HyperPod 클러스터에서 발생하는 모든 구조화된 이벤트에 대한 전체 참조를 제공합니다. 이벤트는 프로비저닝, 조정, 패치 적용 및 오케스트레이터별 수명 주기 변경을 포함하여 클러스터, 인스턴스 그룹 및 인스턴스 수준 작업에 대한 가시성을 제공합니다.
클러스터 이벤트는가 로 NodeProvisioningMode 설정된 HyperPod 클러스터에 사용할 수 있습니다Continuous. 이벤트는 ListClusterEvents 및 DescribeClusterEvent APIs, SageMaker AI 콘솔 이벤트 탭 및 Amazon EventBridge를 통해 액세스할 수 있습니다.
클러스터 이벤트 레코드
각 클러스터 이벤트는 식별, 타이밍, 범위, 심각도 및 작업별 메타데이터가 포함된 구조화된 레코드로 표시됩니다. 다음 예제는 DescribeClusterEvent API 및 Amazon EventBridge를 통해 전달된 전체 이벤트 레코드를 보여줍니다.
{ "version": "0", "id": "0bd4a141-0a02-9d8a-f977-3924c3fb259c", "detail-type": "SageMaker HyperPod Cluster Event", "source": "aws.sagemaker", "account": "111122223333", "time": "2026-06-01T17:20:25Z", "region": "us-west-2", "resources": [ "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster" ], "detail": { "EventDetails": { "EventId": "83ea0bb5-be77-45e8-a458-0a87f778a205", "ClusterArn": "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster", "ClusterName": "sample-cluster", "InstanceGroupName": "p5Inst", "InstanceId": "i-0391f86fa0fe0d465", "ResourceType": "Instance", "EventTime": 1748794825350, "EventLevel": "Error", "Description": "Instance creation in Cluster sample-cluster and InstanceGroup p5Inst failed", "EventDetails": { "EventMetadata": { "Instance": { "FailureMessage": "We currently do not have sufficient capacity to launch new ml.p5.48xlarge instances. Please try again.", "NodeLogicalId": "df268d19-f035-4f28-9b80-b956b92ae21e" } } } } } }
이벤트 레코드 필드
detail.EventDetails 객체는 다음 필드를 포함합니다.
| Field | 유형 | 필수 | 설명 |
|---|---|---|---|
EventId |
문자열(UUID) | 예 | 이벤트의 고유 식별자입니다. |
ClusterArn |
문자열 | 예 | HyperPod 클러스터의 ARN입니다. |
ClusterName |
문자열 | 예 | HyperPod 클러스터의 이름입니다. |
EventTime |
타임스탬프 | 예 | 이벤트가 발생한 시간(에포크 밀리초). |
ResourceType |
문자열 | 예 | 이벤트 범위: Cluster, InstanceGroup또는 Instance. |
EventLevel |
문자열 | 예 | 심각도 분류: Info, Warn또는 Error. |
Description |
문자열 | No | 사람이 읽을 수 있는 이벤트 요약입니다. |
InstanceGroupName |
문자열 | No | 인스턴스 그룹 이름(ResourceType가 InstanceGroup 또는 일 때 존재Instance). |
InstanceId |
문자열 | No | EC2 인스턴스 ID(ResourceType가 일 때 존재Instance). |
EventDetails |
객체 | 아니요 | 리소스 유형 및 작업과 관련된 추가 메타데이터입니다. |
이벤트 수준
| 수준 | 의미 |
|---|---|
Info |
작업이 성공적으로 완료되었거나 정상적으로 진행 중입니다. |
Warn |
중요하지 않은 문제 또는 향후 주의가 필요할 수 있는 조건으로 작업이 완료되었습니다. |
Error |
작업이 실패했거나 즉각적인 주의가 필요합니다. |
조건 키
| ResourceType | Scope | 이벤트 예제 |
|---|---|---|
Cluster |
클러스터 전체 작업 | 클러스터 생성/업데이트 시작됨, 클러스터 작업 실패 |
InstanceGroup |
인스턴스 그룹 작업 | 조정 시작/완료, 패치 예약, FSx 수명 주기 |
Instance |
개별 인스턴스 작업 | EC2 프로비저닝, 수명 주기 스크립트 실행, ENI 관리, 종료 |
EventDetails 메타데이터
클러스터 이벤트에는 이벤트 설명에서 전달하는 것 이상의 작업별 컨텍스트를 제공하는 EventDetails 필드 내 EventMetadata 객체가 포함됩니다. 의 내용은 리소스 유형 및 이벤트 유형에 따라 EventMetadata 다릅니다. 전체 스키마 및 지원되는 필드는 Amazon SageMaker AI API 참조의 EventMetadata를 참조하세요.
EventBridge 봉투 필드
Amazon EventBridge를 통해 전달되면 이벤트 레코드가 표준 EventBridge 봉투에 래핑됩니다.
| 필드 | 설명 |
|---|---|
version |
EventBridge 스키마 버전(항상 "0"). |
id |
고유 EventBridge 이벤트 ID입니다. |
detail-type |
SageMaker HyperPod Cluster Event |
source |
aws.sagemaker |
account |
AWS 클러스터를 소유한 계정 ID입니다. |
time |
이벤트의 ISO 8601 타임스탬프입니다. |
region |
AWS 클러스터가 있는 리전입니다. |
resources |
클러스터 ARN이 포함된 배열입니다. |
detail |
위에서 설명한 EventDetails 객체를 포함합니다. |
일반적인 이벤트(EKS 및 Slurm)
오케스트레이터에 관계없이 모든 HyperPod 클러스터에 대해 다음 이벤트가 발생합니다. 설명 열에는 API 응답 및 콘솔 이벤트 탭에 표시되는 이벤트 레코드의 Description 필드 값이 표시됩니다.
클러스터 수명 주기
| 이벤트 | 설명 |
|---|---|
| 클러스터 작업 시작됨 | 클러스터 <cluster-name> <operation>이 성공적으로 시작되었습니다. |
| 클러스터 작업 시작 실패 | 클러스터 <cluster-name> <operation>을 시작하지 못했습니다. |
| 클러스터 작업 완료 | 클러스터 <cluster-name> <operation>이 성공적으로 완료되었습니다. |
| 클러스터 작업 실패 | 클러스터 <cluster-name> <operation> 실패 |
인스턴스 그룹 수명 주기
| 이벤트 | 설명 |
|---|---|
| 인스턴스 그룹 작업이 시작됨 | 클러스터 <cluster-name>에서 InstanceGroup <instance-group-name> <operation>이 성공적으로 시작되었습니다.instance-group-name |
| 인스턴스 그룹 작업 시작 실패 | 클러스터 <cluster-name>에서 InstanceGroup <instance-group-name> <operation>을 시작하지 못했습니다.instance-group-name |
| 인스턴스 그룹 작업 완료 | 클러스터 <cluster-name>의 인스턴스 그룹 <instance-group-name> <operation>이 성공적으로 완료되었습니다. |
| 인스턴스 그룹 작업 실패 | 클러스터 <cluster-name>의 인스턴스 그룹 <instance-group-name> <operation> 실패 |
인스턴스 그룹 네트워크 구성
| 이벤트 | 설명 |
|---|---|
| 네트워크 구성을 찾았습니다. | 클러스터 <cluster-name>의 IG <instance-group-name>에 대한 SecurityGroupIds <security-group-ids>가 있는 AZ <availability-zone>에서 서브넷 <subnet-id>를 찾았습니다.instance-group-name |
| 네트워크 구성 실패 | 클러스터 <cluster-name>에서 IG <instance-group-name>에 대한 인스턴스 그룹 네트워크 구성 세부 정보를 처리하지 못했습니다. |
| 사용자 지정 AMI 재정의가 발견됨 | 클러스터 <cluster-name>에서 IG <instance-group-name>에 대한 사용자 지정 AMI 재정의 <ami-id>를 찾았습니다. |
| 사용자 지정 AMI 재정의 실패 | 클러스터 <cluster-name>에서 IG <instance-group-name>에 대한 사용자 지정 AMI 재정의 세부 정보를 처리하지 못했습니다. |
| 사용된 플랫폼 네트워크 구성 | 클러스터 <cluster-name>의 IG <instance-group-name>에 HyperPod 플랫폼 제공 네트워크 구성 사용 |
| 네트워크 구성 결정됨 | 클러스터 <cluster-name>의 IG <instance-group-name>에 대한 인스턴스 그룹 네트워크 구성이 성공적으로 결정되었습니다. |
인스턴스 생성
| 이벤트 | 설명 |
|---|---|
| 인스턴스 작업이 시작됨 | 클러스터 <cluster-name> 및 IG <instance-group-name>에서 인스턴스 <operation>이 성공적으로 시작되었습니다. |
| 인스턴스 작업 시작 실패 | 클러스터 <cluster-name> 및 IG <instance-group-name>에서 인스턴스 <operation>을 시작하지 못함 |
| 용량 예약 찾음 | 예약된 용량을 사용하여 클러스터 <cluster-name> 및 IG <instance-group-name>에 대한 CapacityReservation ID <reservation-id>를 찾았습니다. |
| 용량 예약을 찾을 수 없음 | 온디맨드 풀을 사용하는 클러스터 <cluster-name> 및 IG <instance-group-name>에 대한 CapacityReservation을 찾을 수 없음 |
| 인스턴스 페이로드 설정 실패 | 클러스터 <cluster-name> 및 IG <instance-group-name>에 대한 CapacityReservationDetails를 처리하지 못했습니다. |
| 고객 ENI 생성됨 | 클러스터 <cluster-name> 및 IG <instance-group-name>에서 인스턴스에 대한 고객 ENI를 성공적으로 생성했습니다. |
| 고객 ENI 생성 실패 | 클러스터 <cluster-name> 및 IG <instance-group-name>의 인스턴스에 대한 고객 ENI를 생성하지 못했습니다. |
| EC2 인스턴스 프로비저닝됨 | 클러스터 <cluster-name> 및 IG <instance-group-name>에 성공적으로 프로비저닝된 EC2 인스턴스 <instance-id>instance-group-name |
| EC2 인스턴스 생성 실패 | 클러스터 <cluster-name> 및 IG <instance-group-name>에서 EC2 인스턴스를 프로비저닝하지 못함 |
| 수명 주기 스크립트 상태 업데이트됨 | EC2 인스턴스 <instance-id>에 대한 인스턴스 수명 주기 스크립트 실행에는 <status>가 있습니다. |
| 수명 주기 스크립트 상태 업데이트 실패 | EC2InstanceId <instance-id>에 대한 인스턴스 수명 주기 스크립트 실행 상태를 업데이트하지 못했습니다. |
| 수명 주기 로그로 인스턴스 생성 실패 | EC2 인스턴스 <instance-id>에 대한 인스턴스 수명 주기 스크립트 실행이 실패했습니다. 수명 주기 스크립트 로그를 보려면 로그 그룹을 방문하세요. |
| 미사용 ENI 정리 성공 | 클러스터 <cluster-name> 및 IG <instance-group-name>에서 EC2 인스턴스 <instance-id>에 대한 미사용 고객 ENIs를 성공적으로 삭제했습니다.instance-group-name |
| 미사용 ENI 정리 실패 | 클러스터 <cluster-name> 및 IG <instance-group-name>에서 EC2 인스턴스 <instance-id>에 대한 미사용 고객 ENIs를 삭제하지 못함 instance-group-name |
인스턴스 삭제
| 이벤트 | 설명 |
|---|---|
| EC2 인스턴스 종료 진행 중 | EC2 인스턴스 <instance-id>의 종료는 현재 클러스터 <cluster-name> 및 IG <instance-group-name>에서 진행 중입니다. |
| EC2 인스턴스 종료 실패 | 클러스터 <cluster-name> 및 IG <instance-group-name>에서 EC2 인스턴스 <instance-id>를 종료하지 못함 instance-group-name |
| 고객 ENI 삭제됨 | 클러스터 <cluster-name> 및 IG <instance-group-name>의 EC2 인스턴스 <instance-id>에 대한 고객 ENI가 성공적으로 삭제되었습니다.instance-group-name |
| 고객 ENI 삭제 실패 | 클러스터 <cluster-name> 및 IG <instance-group-name>에서 EC2 인스턴스 <instance-id>에 대한 고객 ENI를 삭제하지 못했습니다.instance-group-name |
인스턴스 재부팅
| 이벤트 | 설명 |
|---|---|
| EC2 인스턴스 재부팅 진행 중 | EC2 인스턴스 <instance-id>의 재부팅은 현재 클러스터 <cluster-name> 및 IG <instance-group-name>에서 진행 중입니다. |
| EC2 인스턴스 재부팅 요청 실패 | 클러스터 <cluster-name> 및 IG <instance-group-name>에서 EC2 인스턴스 <instance-id>에 대한 재부팅 요청을 제출하지 못했습니다.instance-group-name |
인스턴스 작업(일반)
| 이벤트 | 설명 |
|---|---|
| 인스턴스 작업 완료 | 클러스터 <cluster-name> 및 IG <instance-group-name>의 인스턴스 <operation> <instance-id>가 성공적으로 완료되었습니다. |
| 인스턴스 작업 실패 | 클러스터 <cluster-name> 및 IG <instance-group-name>의 인스턴스 <operation> <instance-id> 실패 |
인스턴스 교체
| 이벤트 | 설명 |
|---|---|
| 인스턴스 교체 시작됨 | 인스턴스 <instance-id>는 클러스터 <cluster-name> 및 IG <instance-group-name>에서 인스턴스 교체의 일부로 시작됩니다. |
| 인스턴스 교체 시작 실패 | 클러스터 <cluster-name> 및 IG <instance-group-name>에서 인스턴스 교체의 일부로 인스턴스 <instance-id>를 시작하지 못했습니다. |
| 인스턴스 교체 완료 | 클러스터 <cluster-name> 및 IG <instance-group-name>에서 인스턴스 교체의 일부로 인스턴스 <instance-id> <operation>이 성공적으로 완료되었습니다. |
| 인스턴스 교체 실패 | 인스턴스 <instance-id> <operation>이 클러스터 <cluster-name> 및 IG <instance-group-name>에서 인스턴스 교체의 일부로 실패했습니다. |
FSx 파일 시스템 수명 주기
| 이벤트 | 설명 |
|---|---|
| FSx 생성 시작됨 | 클러스터 <cluster-name>에서 IG <instance-group-name>에 대한 FSx 생성 시작 |
| FSx 생성 실패 | 클러스터 <cluster-name>에서 IG <instance-group-name>용 FSx를 생성하지 못했습니다. |
| FSx 생성 완료 | 클러스터 <cluster-name>의 IG <instance-group-name>에 대한 FSx 생성이 성공적으로 완료되었습니다. |
| FSx 삭제 시작됨 | 클러스터 <cluster-name>의 IG <instance-group-name>에 대해 FSx 삭제가 시작됨 |
| FSx 삭제 실패 | 클러스터 <cluster-name>에서 FSx for IG <instance-group-name>을 삭제하지 못했습니다.instance-group-name |
| FSx 삭제 완료 | 클러스터 <cluster-name>의 IG <instance-group-name>에 대한 FSx 삭제가 성공적으로 완료되었습니다. |
| FSx 업데이트 시작됨 | 클러스터 <cluster-name>에서 IG <instance-group-name>에 대한 FSx 업데이트가 시작됨 |
| FSx 업데이트 실패 | 클러스터 <cluster-name>에서 FSx for IG <instance-group-name>을 업데이트하지 못했습니다.instance-group-name |
| FSx 업데이트 완료 | 클러스터 <cluster-name>의 IG <instance-group-name>에 대한 FSx 업데이트가 성공적으로 완료되었습니다. |
패치 적용(일반 단계)
이러한 패치 이벤트는 UpdateClusterSoftware 작업 중에 EKS 및 Slurm 클러스터 모두에 대해 내보내집니다.
| 이벤트 | 설명 |
|---|---|
| 예약된 인스턴스 그룹 패치 적용 | 클러스터 <cluster-name>의 InstanceGroup <instance-group-name>이 UpdateClusterSoftware를 최신으로 예약했습니다.instance-group-name |
| 인스턴스 그룹 패치 적용 일정 실패 | 클러스터 <cluster-name>에서 IG <instance-group-name>용 UpdateClusterSoftware를 예약하지 못했습니다.instance-group-name |
| 인스턴스 그룹 패치 시작됨 | UpdateClusterSoftware 시작된 소프트웨어입니다.instance-group-name |
| 인스턴스 그룹 패치 적용 시작 실패 | 클러스터 <cluster-name>에서 IG <instance-group-name>용 UpdateClusterSoftware를 시작하지 못했습니다.instance-group-name |
| 다음 패치 배치 선택됨 | 클러스터 <cluster-name>에서 IG <instance-group-name>에 대해 선택한 다음 업데이트 배치입니다. |
| 다음 패치 배치 선택 실패 | 클러스터 <cluster-name>에서 IG <instance-group-name>에 대한 다음 업데이트 배치를 선택하지 못했습니다. |
| 대체 대기 중인 실패한 인스턴스 | 노드 교체를 위해 대기 중인 클러스터 <cluster-name>의 IG <instance-group-name>에서 실패한 인스턴스. |
| 실패한 인스턴스 교체 대기열 지정 실패 | 클러스터 <cluster-name>의 IG <instance-group-name>에서 노드 교체를 위해 인스턴스를 대기열에 추가하지 못했습니다. |
| 인스턴스 그룹 패치 적용 완료 | 클러스터 <cluster-name>의 IG <instance-group-name>에 대해 UpdateClusterSoftware가 성공적으로 완료되었습니다.instance-group-name |
| 인스턴스 그룹 패치 적용 완료 실패 | 클러스터 <cluster-name>에서 IG <instance-group-name>용 UpdateClusterSoftware를 완료하지 못했습니다.instance-group-name |
| 루트 볼륨 교체 시작됨 | IG <instance-group-name>의 인스턴스 <instance-id>에 대한 루트 볼륨 교체가 시작되었습니다. |
| 루트 볼륨 교체 실패 | IG <instance-group-name>에서 인스턴스 <instance-id>에 대한 루트 볼륨 교체를 시작하지 못했습니다. |
| 인스턴스 패치 적용 성공 | IG <instance-group-name>의 인스턴스 <instance-id>가 성공적으로 업데이트되었습니다. |
EKS 관련 이벤트
다음 이벤트는 Amazon EKS로 오케스트레이션된 HyperPod 클러스터에만 내보내집니다.
액세스 항목 관리
| 이벤트 | 설명 |
|---|---|
| SLR 액세스 항목 작업 성공 | 클러스터 <cluster-name>에 대한 SLR 액세스 항목 <operation> 성공 |
| SLR 액세스 항목 작업 실패 | 클러스터 <cluster-name>에 대한 SLR 액세스 항목 <operation> 실패 |
| EKS 액세스 항목 작업 성공 | 클러스터 <cluster-name>에 대한 EKS 액세스 항목 <operation> 성공 |
| EKS 액세스 항목 작업 실패 | 클러스터 <cluster-name>에 대한 EKS 액세스 항목 <operation> 실패 |
Kubernetes 구성 업데이트
| 이벤트 | 설명 |
|---|---|
| Kubernetes 구성 업데이트 성공 | 클러스터 <cluster-name> 및 IG <instance-group-name>의 인스턴스 <instance-id>에 대한 Kubernetes 구성을 성공적으로 업데이트했습니다. |
| Kubernetes 구성 업데이트 실패 | 클러스터 <cluster-name> 및 IG <instance-group-name>에서 인스턴스 <instance-id>에 대한 Kubernetes 구성을 업데이트하지 못함 |
Karpenter Auto Scaling
| 이벤트 | 설명 |
|---|---|
| Autoscaling 작업 성공 | 클러스터 <cluster-name>에서 <operation> <status> AutoScaling 성공 |
| Autoscaling 작업 실패 | 클러스터 <cluster-name>에서 <operation> AutoScaling 실패 |
| Karpenter CRD 설치 성공 | EKS 클러스터 <cluster-name>에서 CustomResourceDefinition 설치가 성공적으로 완료되었습니다. |
| Karpenter CRD 설치 실패 | EKS 클러스터 <cluster-name>에 대한 CustomResourceDefinition 설치 실패 |
| Karpenter SLR 액세스 정책 업데이트 성공 | EKS 클러스터 <cluster-name>의 AmazonSageMakerHyperPodServiceRole 액세스 항목을 사용한 <operation> 액세스 정책 성공 |
| Karpenter SLR 액세스 정책 업데이트 실패 | EKS 클러스터 <cluster-name>에서 AmazonSageMakerHyperPodServiceRole 액세스 항목이 있는 <operation> 액세스 정책에 실패했습니다. |
패치 적용 - EKS 인스턴스 수준
| 이벤트 | 설명 |
|---|---|
| 인스턴스 패치 적용 준비 성공 | IG <instance-group-name> 코드 및 제거된 포드의 인스턴스 <instance-id> |
| 인스턴스 패치 적용 건너뛰기(PDB 위반) | PodDisruptionBudget 제약으로 인해 IG <instance-group-name>의 인스턴스 <instance-id>용 UpdateClusterSoftware를 건너뛰었습니다. |
| 인스턴스 패치 적용 준비 실패 | UpdateClusterSoftware용 IG <instance-group-name>에서 인스턴스 <instance-id>를 준비하지 못했습니다. |
| 예약 가능 상태로 복원된 인스턴스 | IG <instance-group-name>의 인스턴스 <instance-id>가 예약 가능 상태로 복원되었습니다. |
| 예약 가능한 인스턴스 복원 실패 | IG <instance-group-name>의 인스턴스 <instance-id>를 예약 가능한 상태로 복원하지 못했습니다. |
패치 적용 - EKS 롤백
| 이벤트 | 설명 |
|---|---|
| 베이크 시간 시작 | 클러스터 <cluster-name>에서 IG <instance-group-name>에 대한 베이킹 기간이 시작되었습니다. <duration>초 동안 경보 [<alarm-names>]를 모니터링합니다. |
| 베이크 시간 완료 | 클러스터 <cluster-name>의 IG <instance-group-name>에 대한 베이킹 기간이 완료되었습니다. <duration>초 베이킹 기간 동안 경보가 트리거되지 않습니다. |
| 베이크 시간 경보가 트리거됨 | 클러스터 <cluster-name>의 IG <instance-group-name>에 대한 베이킹 기간이 실패했습니다. 경보 [<alarm-names>]가 ALARM 상태로 전환되었습니다. 자동 롤백을 시작합니다. |
| 베이크 시간 평가 실패 | 클러스터 <cluster-name>에서 IG <instance-group-name>에 대한 베이킹 기간 동안 경보를 평가하지 못했습니다. |
| 인스턴스 그룹 패치 롤백이 시작됨 | 클러스터 <cluster-name>의 IG <instance-group-name>에 대해 UpdateClusterSoftware가 실패했습니다.instance-group-name 롤백을 시작합니다. |
| 인스턴스 그룹 패치 롤백 실패 | 클러스터 <cluster-name>의 IG <instance-group-name>에 대한 롤백이 실패했습니다. 일부 인스턴스는 FailedMaintenance 상태일 수 있습니다. |
| 인스턴스 패치 롤백이 시작됨 | IG <instance-group-name>의 인스턴스 <instance-id>를 업데이트하지 못했습니다. 롤백이 시작되었습니다. |
| 인스턴스 패치 롤백 성공 | IG <instance-group-name>의 인스턴스 <instance-id>가 이전 AMI로 성공적으로 롤백되었습니다. |
| 인스턴스 패치 롤백 실패 | IG <instance-group-name>의 인스턴스 <instance-id>에 대한 UpdateClusterSoftware 롤백이 실패했습니다. |
Slurm 관련 이벤트
다음 이벤트는 Slurm으로 오케스트레이션된 HyperPod 클러스터에만 내보내집니다.
| 이벤트 | 설명 |
|---|---|
| 찾은 프로비저닝 파라미터 | 컨트롤러 그룹 <instance-group-name>에 대한 LifeCycleScript S3 경로에서 provisioning_parameters.json을 찾았습니다. |
| 프로비저닝 파라미터를 찾을 수 없음 | 컨트롤러 그룹 <instance-group-name>에 대한 LifeCycleScript S3 경로에서 provisioning_parameters.json을 찾을 수 없음 |
| 생성된 Slurm munge 키 | 성공적으로 생성 및 저장된 munge 키 |
| Slurm 드리프트 검증 통과 | Slurm 구성 드리프트 검증 통과 |
| Slurm 드리프트 감지됨 | Slurm 구성 드리프트 감지됨: <drift-details> |
| Slurm 클러스터 롤백 완료 | 클러스터 생성 실패: 컨트롤러 및 로그인 노드가 예상 시간 내에 준비되지 않음 |
| Slurm 재구성 성공 | Slurm이 성공적으로 재구성되었습니다. 원하는 상태와 일치하도록 Slurm 구성 업데이트 |
EventBridge 통합
HyperPod는 세 가지 세부 정보 유형을 사용하여 클러스터 이벤트를 Amazon EventBridge로 전송합니다.
| 세부 정보 유형 | 설명 |
|---|---|
SageMaker HyperPod Cluster Event |
프로비저닝, 조정, 패치 적용 및 오케스트레이터별 작업에 대한 운영 이벤트입니다. 심각도 필터링을 EventLevel 위한를 포함합니다. |
SageMaker HyperPod Cluster State Change |
클러스터 수준 상태 전환(예: Creating to InService). 전체 클러스터 구성을 포함합니다. |
SageMaker HyperPod Cluster Node Health
Event |
HyperPod Health Monitoring Agent(HMA)의 상태 모니터링 이벤트입니다. 상태, 이유, 복구 작업 및 권장 사항을 포함합니다. |
이벤트 패턴 예제
모든 HyperPod 클러스터 이벤트:
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"] }
오류 이벤트만 해당(알림용):
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"], "detail": { "EventDetails": { "EventLevel": ["Error"] } } }
특정 클러스터에 대한 이벤트:
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"], "resources": ["arn:aws:sagemaker:us-west-2:111122223333:cluster/my-cluster-id"] }
노드 상태 이벤트:
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Node Health Event"] }
API 참조
-
ListClusterEvents - 필터링, 정렬 및 페이지 매김이 포함된 이벤트 나열
-
DescribeClusterEvent - 특정 이벤트에 대한 전체 세부 정보 가져오기
-
ClusterEventSummary — 이벤트 요약 데이터 형식
-
ClusterEventDetail - 이벤트 세부 정보 데이터 유형
다음 사항도 참조하세요.
-
SageMaker HyperPod Slurm 클러스터 이벤트 - CLI 사용 및 일반적인 시나리오가 포함된 Slurm 클러스터 이벤트
-
SageMaker HyperPod EKS 클러스터 이벤트 - CLI 사용 및 일반적인 시나리오가 포함된 EKS 클러스터 이벤트