As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.
Inferência acelerada
Ray Serve é a biblioteca de código aberto que serve modelos para Ray. Você implanta um modelo como um aplicativo Serve, e o Ray Serve gerencia o roteamento de solicitações, o agrupamento em lotes e o dimensionamento de réplicas. Ativado HyperPod, o Ray Serve é executado KubeRay por meio de um RayService recurso, portanto, o código do Serve e o gráfico de implantação permanecem inalterados.
Requisitos
O Ray Serve on HyperPod requer apenas o KubeRay operador. KubeRay reconcilia o RayService recurso, cria o cluster Ray que o respalda e gerencia os aplicativos Serve nele. Para obter mais informações, consulte Instalação KubeRay no HyperPod Amazon EKS.
Você não instala um operador de inferência separado para servir modelos com o Ray Serve. Além disso, o caminho de JumpStart implantação usa a toolkit-for-ray-on-sagemaker-ai biblioteca com a qual você instalapip.
O que é possível fazer
-
Implante um modelo a partir do seu próprio código como a
RayServicee acesse-o por HTTP. -
Implante um JumpStart modelo em uma implantação do Ray Serve.
-
Reduza o tempo até o primeiro token para cargas de trabalho de longo contexto e várias voltas com um cache KV hierárquico gerenciado e roteamento com reconhecimento de prefixo.
-
Dimensione as réplicas de serviço dentro do cluster e amplie a capacidade do cluster com o Karpenter gerenciado.
Para a API do Ray Serve e os conceitos de implantação, consulte Ray Serve: serviço escalável e programável