View a markdown version of this page

Cache dan perutean KV berjenjang yang dikelola - Amazon SageMaker AI

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Cache dan perutean KV berjenjang yang dikelola

Penyajian model bahasa besar menghabiskan komputasi membangun kembali cache nilai kunci (KV) untuk token yang telah diproses. HyperPod menambahkan cache KV dua tingkat yang dikelola dan perutean sadar awalan ke Ray Serve, yang memotong perhitungan ulang yang berlebihan dan menurunkan waktu ke token pertama untuk beban kerja konteks panjang dan multi-putaran.

Cara kerja cache berjenjang

Cache memiliki dua tingkatan:

  • Tingkat lokal dalam memori node yang melayani permintaan, untuk penggunaan kembali tercepat.

  • Tingkat seluruh cluster di HyperPod Tiered Storage, tingkat memori gabungan yang mencakup node cluster. Replika membaca awalan yang dihitung oleh replika lain alih-alih mengkomputernya ulang.

Saat permintaan membagikan awalan token dengan pekerjaan sebelumnya, penerapan membaca status KV yang di-cache dari tingkat lokal, lalu tingkat seluruh cluster, sebelum menghitung ulang apa pun.

Prefix-aware perutean

Prefix-aware routing mengirimkan permintaan ke replika yang sudah menyimpan cache KV untuk awalannya. Multi-turn percakapan dan sistem bersama meminta rute ke replika yang sama, sehingga tingkat hit cache tetap tinggi dan waktu untuk token pertama turun.

Prasyarat

Tingkat seluruh cluster berjalan pada Penyimpanan HyperPod Berjenjang, jadi siapkan Penyimpanan Berjenjang di cluster sebelum Anda mengaktifkan cache di seluruh cluster. Untuk informasi selengkapnya, lihat Menyiapkan cache KV berjenjang.