View a markdown version of this page

Menerapkan model dengan Ray Serve - Amazon SageMaker AI

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Menerapkan model dengan Ray Serve

Anda menerapkan model dengan RayService sumber daya. serveConfigV2Bidang ini menyimpan aplikasi Serve Anda dan penerapannya, dan KubeRay membuat cluster Ray yang menjalankannya. HyperPod tidak memodifikasi KubeRay, jadi RayService Anda sudah menjalankan terus bekerja.

Sebuah RayService manifes

Manifes berikut menjalankan satu aplikasi Serve dengan satu GPU-backed penerapan. Ganti import_path dengan modul dan objek aplikasi di direktori kerja Anda.

apiVersion: ray.io/v1 kind: RayService metadata: name: my-service namespace: my-namespace spec: serveConfigV2: | applications: - name: my-app import_path: my_module:app route_prefix: / deployments: - name: Model num_replicas: 2 ray_actor_options: num_gpus: 1 rayClusterConfig: rayVersion: "2.56.1" headGroupSpec: rayStartParams: dashboard-host: "0.0.0.0" template: spec: containers: - name: ray-head image: rayproject/ray:2.56.1 ports: - { containerPort: 8265, name: dashboard } - { containerPort: 8000, name: serve } workerGroupSpecs: - groupName: gpu-workers replicas: 1 rayStartParams: {} template: spec: nodeSelector: node.kubernetes.io/instance-type: ml.g5.xlarge containers: - name: ray-worker image: rayproject/ray:2.56.1-gpu resources: limits: { nvidia.com/gpu: "1" } requests: { cpu: "4", memory: "16Gi", nvidia.com/gpu: "1" }

Terapkan dan konfirmasikan layanan sudah siap:

kubectl apply -f my-service.yaml -n my-namespace kubectl get rayservice my-service -n my-namespace

Mencapai titik akhir

Ray Serve mendengarkan pada port 8000 pada pod kepala. Dari dalam cluster, kirim permintaan ke layanan yang KubeRay membuat untukRayService. Untuk pengujian cepat, Anda dapat menggunakankubectl port-forward:

kubectl port-forward svc/ray-service-head-svc 8000:8000 curl http://localhost:8000/

Untuk Serve deployment API dan penanganan permintaan, lihat Ray Serve API dalam dokumentasi Ray.