기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.
Ray 지표 참조
SageMaker HyperPod Observability 추가 기능은 Ray가 내보내는 지표를 수집합니다. Ray 지표를 추가, 이름 바꾸기 또는 제거하지 않으므로 지표 이름과 레이블이 오픈 소스 Ray와 일치합니다.
다음 섹션에서는 프로비저닝된 각 대시보드가 다루는 지표 그룹을 나열합니다. 개별 지표 이름, 정의 및 유형은 Ray 설명서의 Ray 시스템 지표
Ray Core 지표
Ray Core 대시보드는 다음 그룹에서 시스템 수준 Ray 상태와 클러스터가 실행되는 하드웨어를 다룹니다.
작업, 액터 및 배치 그룹
클러스터 리소스 및 객체 스토어
노드 하드웨어 및 OS
구성 요소별 사용량
Autoscaler 상태
Ray 데이터 지표
Ray Data 대시보드는 다음 그룹의 데이터 세트 처리량, 작업 수명 주기, 반복 및 메모리 압력을 다룹니다.
행, 바이트 및 블록
작업 수 및 수명 주기
기타 연산자 카운터
반복
객체 스토어 및 메모리 예산
클러스터 사용률 및 예산
Ray Train 지표
Ray Train 대시보드는 다음 그룹의 훈련 실행 및 작업자 상태, 체크포인트 및 노드 하드웨어를 다룹니다.
실행 및 작업자 상태
체크포인트 지정 및 보고
노드 하드웨어 및 OS
Ray Serve 지표
Ray Serve 대시보드는 다음 그룹의 요청 속도, 지연 시간, 오류 및 복제본 상태를 다룹니다.
요청 및 지연 시간
오류 및 대기열
복제본 및 컨트롤러 상태
노드 하드웨어 및 클러스터 상태
쿼리를 위한 레이블
지표는 Amazon Managed Service for Prometheus에 있으므로 Grafana 외부에서 쿼리할 수 있습니다. 수집기는 cluster_name, cluster_id및를 추가합니다namespace. Ray는 Ray 클러스터를 식별하고 대시보드가 피벗ray_io_cluster되는 레이블인를 추가합니다.
이러한 지표 시각화에 대한 자세한 내용은 섹션을 참조하세요Ray Grafana 대시보드.