View a markdown version of this page

Inferência acelerada - SageMaker IA da Amazon

As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.

Inferência acelerada

Ray Serve é a biblioteca de código aberto que serve modelos para Ray. Você implanta um modelo como um aplicativo Serve, e o Ray Serve gerencia o roteamento de solicitações, o agrupamento em lotes e o dimensionamento de réplicas. Ativado HyperPod, o Ray Serve é executado KubeRay por meio de um RayService recurso, portanto, o código do Serve e o gráfico de implantação permanecem inalterados.

Requisitos

O Ray Serve on HyperPod requer apenas o KubeRay operador. KubeRay reconcilia o RayService recurso, cria o cluster Ray que o respalda e gerencia os aplicativos Serve nele. Para obter mais informações, consulte Instalação KubeRay no HyperPod Amazon EKS.

Você não instala um operador de inferência separado para servir modelos com o Ray Serve. Além disso, o caminho de JumpStart implantação usa a toolkit-for-ray-on-sagemaker-ai biblioteca com a qual você instalapip.

O que é possível fazer

  • Implante um modelo a partir do seu próprio código como a RayService e acesse-o por HTTP.

  • Implante um JumpStart modelo em uma implantação do Ray Serve.

  • Reduza o tempo até o primeiro token para cargas de trabalho de longo contexto e várias voltas com um cache KV hierárquico gerenciado e roteamento com reconhecimento de prefixo.

  • Dimensione as réplicas de serviço dentro do cluster e amplie a capacidade do cluster com o Karpenter gerenciado.

Para a API do Ray Serve e os conceitos de implantação, consulte Ray Serve: serviço escalável e programável na documentação do Ray.