View a markdown version of this page

가속화된 추론 - Amazon SageMaker AI

기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.

가속화된 추론

Ray Serve는 Ray용 오픈 소스 모델 서비스 라이브러리입니다. 모델을 Serve 애플리케이션으로 배포하면 Ray Serve가 요청 라우팅, 일괄 처리 및 복제본 크기 조정을 처리합니다. HyperPod에서 Ray Serve는 RayService 리소스를 통해 KubeRay에서 실행되므로 Serve 코드와 배포 그래프는 변경되지 않습니다.

요구 사항

HyperPod의 Ray Serve에는 KubeRay 연산자만 필요합니다. KubeRay는 RayService 리소스를 조정하고, 리소스를 지원하는 Ray 클러스터를 생성하고, 해당 클러스터에서 Serve 애플리케이션을 관리합니다. 자세한 내용은 HyperPod Amazon EKS에 KubeRay 설치 단원을 참조하십시오.

Ray Serve로 모델을 제공하기 위해 별도의 추론 연산자를 설치하지 않습니다. JumpStart 배포 경로는 로 설치하는 toolkit-for-ray-on-sagemaker-ai 라이브러리를 추가로 사용합니다pip.

할 수 있는 작업

  • 자체 코드에서 모델을 로 배포RayService하고 HTTP를 통해 연결합니다.

  • JumpStart 모델을 Ray Serve 배포에 배포합니다.

  • 관리형 계층형 KV 캐시 및 접두사 인식 라우팅을 사용하여 긴 컨텍스트 및 멀티턴 워크로드를 위한 첫 번째 토큰 생성 시간을 단축합니다.

  • 클러스터 내에서 서비스 복제본을 확장하고 관리형 Karpenter를 사용하여 클러스터 용량을 확장합니다.

Ray Serve API 및 배포 개념은 Ray 설명서의 Ray Serve: Scalable and Programmable Serving을 참조하세요.