翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。
高速推論
Ray Serve は、Ray のオープンソースのモデル提供ライブラリです。モデルを Serve アプリケーションとしてデプロイすると、Ray Serve はリクエストルーティング、バッチ処理、レプリカスケーリングを処理します。HyperPod では、Ray Serve はRayServiceリソースを介して KubeRay で実行されるため、Serve コードとデプロイグラフは変更されません。
要件
HyperPod での Ray Serve には、KubeRay 演算子のみが必要です。KubeRay はRayServiceリソースを照合し、それをバックアップする Ray クラスターを作成し、その上で Serve アプリケーションを管理します。詳細については、「HyperPod Amazon EKS への KubeRay のインストール」を参照してください。
Ray Serve でモデルを提供するために、別の推論演算子をインストールしません。JumpStart デプロイパスは、 と共にインストールする toolkit-for-ray-on-sagemaker-aiライブラリも使用しますpip。
できること
-
独自のコードからモデルを としてデプロイ
RayServiceし、HTTP 経由で到達します。 -
JumpStart モデルを Ray Serve デプロイにデプロイします。
-
マネージド階層型 KV キャッシュとプレフィックス対応ルーティングにより、ロングコンテキストおよびマルチターンワークロードの最初のトークンまでの時間が短縮されます。
-
クラスター内のサービングレプリカをスケールし、マネージド Karpenter を使用してクラスター容量をスケールします。
Ray Serve API とデプロイの概念については、Ray ドキュメントの「Ray Serve: Scalable and Programmable Serving