View a markdown version of this page

Kapasitas penyajian penskalaan otomatis - Amazon SageMaker AI

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Kapasitas penyajian penskalaan otomatis

Melayani skala kapasitas pada dua tingkat pada HyperPod. Ray Serve menskalakan replika di dalam cluster untuk mencocokkan beban permintaan, dan mengelola skala node cluster Karpenter untuk menampung replika tersebut. Keduanya bekerja sama: replika autoscaling bereaksi terlebih dahulu, dan penskalaan otomatis node menambah kapasitas ketika node yang ada habis.

Ray Serve replika autoscaling

Ray Serve menyesuaikan jumlah replika untuk penerapan berdasarkan beban permintaan. Tetapkan konfigurasi penskalaan otomatis pada penerapan alih-alih jumlah replika tetap:

deployments: - name: Model autoscaling_config: min_replicas: 1 max_replicas: 8 target_ongoing_requests: 5

Agar penskalaan otomatis replika menambah dan menghapus pod pekerja, penskalaan otomatis Ray harus dihidupkan untuk klaster. Atur enableInTreeAutoscaling: true dalam RayCluster spesifikasi, atau di rayClusterConfig aRayService:

spec: enableInTreeAutoscaling: true

Tanpa itu, penerapan autoscaling_config mengubah jumlah replika target, tetapi KubeRay tidak membuat pod pekerja untuk memenuhinya.

Autoscaling replika tetap berada dalam kapasitas node cluster saat ini. Ketika Ray Serve membutuhkan lebih banyak replika daripada yang dapat ditahan oleh node, pod tetap tertunda sampai node tersedia.

Penskalaan otomatis node dengan Karpenter terkelola

Karpenter terkelola saat HyperPod menambahkan node saat pod Ray tertunda dan menghapusnya saat idle, sehingga kapasitas penyajian mengikuti permintaan tanpa kumpulan node tetap. Instans Spot didukung untuk kapasitas node, yang menurunkan biaya untuk penyajian toleran interupsi. Untuk pengaturan dan konfigurasi, lihatPenskalaan otomatis pada EKS SageMaker HyperPod.

Menggunakan keduanya bersama-sama

Setel replika autoscaling pada deployment dan node autoscaling pada cluster. Kedua level bekerja sama dalam rantai yang merespons peningkatan beban permintaan:

  1. Ray Serve mendeteksi peningkatan beban. Autoscaler mengamati bahwa permintaan yang sedang berlangsung melebihi target_ongoing_requests dan memutuskan untuk menambahkan replika lain.

  2. KubeRay membuat pod pekerja baru. Sinyal Ray Serve KubeRay untuk menskalakan grup pekerja, dan KubeRay membuat pod untuk replika baru.

  3. Pod tetap tertunda jika tidak ada kapasitas. Jika node yang ada tidak dapat memuat pod baru (GPU atau memori tidak mencukupi), pod akan masuk Pending status.

  4. Karpenter yang dikelola menyediakan simpul. HyperPod Karpenter terkelola mendeteksi pod yang tertunda, memilih jenis instance yang sesuai, dan meluncurkan node baru.

  5. Node muncul dan pod mulai berjalan. Setelah node siap dan bergabung dengan cluster, Kubernetes menjadwalkan pod yang tertunda ke dalamnya. Replika baru memuat model dan mulai melayani permintaan.

Pada scale-down, proses membalikkan: Ray Serve menghapus replika idle, KubeRay menghapus pod pekerja, dan Karpenter yang dikelola menghentikan node yang tidak memiliki pod yang berjalan setelah jendela konsolidasi.