Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Inferensi yang dipercepat
Ray Serve adalah pustaka penyajian model open source untuk Ray. Anda menerapkan model sebagai aplikasi Serve, dan Ray Serve menangani perutean permintaan, pengelompokan, dan penskalaan replika. HyperPodAktif, Ray Serve berjalan KubeRay melalui RayService sumber daya, sehingga kode Serve dan grafik penerapan Anda tidak berubah.
Persyaratan
Ray Serve on hanya HyperPod membutuhkan KubeRay operator. KubeRay merekonsiliasi RayService sumber daya, membuat cluster Ray yang mendukungnya, dan mengelola aplikasi Serve di dalamnya. Untuk informasi selengkapnya, lihat Menginstal KubeRay di HyperPod Amazon EKS.
Anda tidak menginstal operator inferensi terpisah untuk melayani model dengan Ray Serve. Jalur JumpStart penyebaran juga menggunakan toolkit-for-ray-on-sagemaker-ai pustaka, yang Anda instal denganpip.
Yang dapat Anda lakukan
-
Menyebarkan model dari kode Anda sendiri sebagai
RayServicedan mencapainya melalui HTTP. -
Menyebarkan JumpStart model ke dalam penyebaran Ray Serve.
-
Turunkan waktu ke token pertama untuk beban kerja konteks panjang dan multi-putaran dengan cache KV berjenjang terkelola dan perutean yang sadar awalan.
-
Skala replika yang melayani di dalam cluster, dan skala kapasitas cluster dengan Karpenter terkelola.
Untuk konsep Ray Serve API dan penerapan, lihat Ray Serve: Scalable and Programmable Serving