View a markdown version of this page

Studio를 사용하여 Ray 워크로드 관리 - Amazon SageMaker AI

기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.

Studio를 사용하여 Ray 워크로드 관리

Amazon SageMaker Studio는 웹 인터페이스에서 Ray 워크로드를 관리합니다. HyperPod 콘솔에서 클러스터를 연 다음 작업 탭을 선택합니다. 탭에는 액세스 권한이 있는 네임스페이스의 Ray 리소스가 나열되고 작업 유형 필터는 , RayCluster, RayJob RayCronJob및 간에 전환됩니다RayService.

Studio는 연산자가 조정하는 것과 동일한 KubeRay 사용자 지정 리소스를 읽고 씁니다. Studio에서 생성하는 리소스는에 적용하는 리소스와 동일합니다kubectl. 동일한 워크로드에서 두 표면 사이를 이동할 수 있습니다.

누구나 작업 탭을 사용하기 전에 SageMaker AI 도메인을 구성하고 클러스터에 대한 액세스 권한을 부여합니다. 자세한 내용은 Studio for Ray 설정 단원을 참조하십시오.

클러스터 생성

Ray 클러스터 생성을 선택하고 양식을 작성하거나 매RayCluster니페스트를 YAML 뷰에 붙여넣습니다. 양식에는 공통 필드가 포함됩니다. YAML 보기는 KubeRay 연산자가 지원하는 모든 필드를 허용합니다. 양식에서 노출되지 않는 필드가 필요할 때 사용합니다.

양식의 네임스페이스 선택기에는 액세스 권한이 있는 각 네임스페이스에 대한 컴퓨팅 할당 및 현재 사용률이 표시됩니다. 클러스터가 할당량을 기다리고 있음을 나중에 확인하는 대신 제출하기 전에 실제로 무료인 용량을 기준으로 클러스터의 크기를 조정하는 데 사용합니다. 이는 HyperPod 태스크 거버넌스가 관리하는 네임스페이스에서 가장 중요하며, 선언된 전체 크기에 대한 할당량이 존재할 때까지 클러스터가 허용되지 않습니다. 자세한 내용은 Ray 워크로드에 대한 할당량 및 일정 동작 단원을 참조하십시오.

대화식으로 개발하려는 경우 클러스터에 공간을 연결합니다. 스페이스는 Amazon SageMaker Studio의 JupyterLab 또는 코드 편집기 환경입니다. 노트북 또는 터미널에서 실행하는 코드는를 통해 클러스터에 도달합니다ray.init().

공간은 실행하는 SageMaker AI 배포 이미지에서 자체 Ray 버전을 포함합니다. 해당 버전을 클러스터의 Ray 버전과 일치시킵니다. 일치하지 않으면 진단하기 어려운 런타임 오류가 발생합니다. 자세한 내용은 스페이스에 Ray 클러스터 연결 단원을 참조하십시오.

클러스터에 대한 작업

Studio를 벗어나지 않고 해당 리소스에 대해 작업하려면 행에서 작업을 선택합니다.

작업 하는 일
대화형 개발 클러스터에 연결된 JupyterLab 또는 코드 편집기 공간을 열어 해당 공간이 클러스터ray.init()에 연결됩니다. SageMaker AI Spaces 추가 기능이 필요합니다. 자세한 내용은 스페이스에 Ray 클러스터 연결 단원을 참조하십시오.
작업 제출 실행 중인 클러스터에 작업을 제출합니다.
Ray 대시보드 열기 클러스터의 Ray 대시보드를 엽니다. Ray 엔드포인트 연산자가 필요합니다. 자세한 내용은 HyperPod Ray 엔드포인트 운영자 설치 단원을 참조하십시오.
Grafana 열기 클러스터에 대한 Grafana 대시보드를 엽니다. 관찰성 추가 기능이 필요합니다. 자세한 내용은 Ray 지표 수집 설정 단원을 참조하십시오.
Ray 클러스터 편집 작업자 복제본 수를 포함하여 클러스터를 변경합니다.
Ray 클러스터 일시 중지 클러스터의 포드를 중지하고 리소스를 유지합니다. 컴퓨팅을 해제합니다.
Ray 클러스터 재개 기존 구성으로 일시 중지된 클러스터의 포드를 다시 시작합니다. 클러스터가 일시 중지된 경우 사용할 수 있습니다.
Ray 클러스터 삭제 클러스터와 해당 포드를 삭제합니다.

세부 정보 및 이벤트 보기

리소스 이름을 선택하여 엽니다. 이벤트 탭에는 Kubernetes 이벤트와 함께 Ray 클러스터의 포드가 나열됩니다. 클러스터가 실행 중 상태에 도달하지 않으면 여기에서 시작합니다. 또한 포드가 예기치 않게 다시 시작되거나 로그가 설명하지 않는 이유로 작업이 실패할 때도 도움이 됩니다. 이벤트는 실패한 포드의 이름과 이미지 가져오기 실패 또는 할당 가능한 용량 부족과 같은 이유입니다. 자세한 내용은 HyperPod의 Ray 문제 해결 단원을 참조하십시오.

클러스터의 사용률을 보려면 작업을 선택한 다음 Grafana를 엽니다. HyperPod 태스크 거버넌스가 관리하는 네임스페이스의 할당량, 우선 순위 및 선점 동작은 섹션을 참조하세요Ray 워크로드에 대한 할당량 및 일정 동작.