Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Caching cepat untuk inferensi model yang lebih cepat
Prompt caching adalah fitur opsional yang dapat Anda gunakan dengan model yang didukung di Amazon Bedrock untuk mengurangi latensi respons inferensi dan biaya token input. Dengan menambahkan bagian dari konteks Anda ke cache, model dapat menggunakan cache untuk melewati perhitungan ulang input, memungkinkan Bedrock untuk berbagi dalam penghematan komputasi dan menurunkan latensi respons Anda.
Caching cepat dapat membantu ketika Anda memiliki beban kerja dengan konteks panjang dan berulang yang sering digunakan kembali untuk beberapa kueri. Misalnya, jika Anda memiliki chatbot tempat pengguna dapat mengunggah dokumen dan mengajukan pertanyaan tentangnya, model dapat memakan waktu untuk memproses dokumen setiap kali pengguna memberikan masukan. Dengan caching prompt, Anda dapat men-cache dokumen sehingga kueri future yang berisi dokumen tidak perlu memprosesnya ulang.
Saat menggunakan caching cepat, Anda dikenakan biaya pada tingkat yang lebih rendah untuk token yang dibaca dari cache. Tergantung pada modelnya, token yang ditulis ke cache dapat dikenakan biaya pada tingkat yang lebih tinggi daripada token input yang tidak di-cache. Token apa pun yang tidak dibaca atau ditulis ke cache, dibebankan pada tingkat token input standar untuk model itu. Untuk informasi selengkapnya, lihat halaman harga Amazon Bedrock
Cara kerjanya
Jika Anda memilih untuk menggunakan caching prompt, Amazon Bedrock membuat cache yang terdiri dari pos pemeriksaan cache. Ini adalah penanda yang menentukan subbagian bersebelahan dari prompt Anda yang ingin Anda cache (sering disebut sebagai awalan prompt). Awalan prompt ini harus statis di antara permintaan, perubahan pada awalan prompt dalam permintaan berikutnya akan mengakibatkan kesalahan cache.
Pos pemeriksaan cache memiliki jumlah token minimum dan maksimum, tergantung pada model spesifik yang Anda gunakan. Anda hanya dapat membuat pos pemeriksaan cache jika awalan prompt total Anda memenuhi jumlah minimum token. Misalnya, Claude 3.7 Sonnet membutuhkan setidaknya 1.024 token per pos pemeriksaan cache, sementara,,, Claude Opus 4.5 Claude Opus 4.6Claude Haiku 4.5, dan Claude Sonnet 4.5 memerlukan setidaknya 4.096 token per pos pemeriksaan cache. Itu berarti bahwa untuk model dengan minimum 1.024 token, pos pemeriksaan cache pertama Anda dapat ditentukan setelah 1.024 token dan pos pemeriksaan cache kedua Anda dapat ditentukan setelah 2.048 token. Jika Anda mencoba menambahkan pos pemeriksaan cache sebelum memenuhi jumlah minimum token, inferensi Anda akan tetap berhasil, tetapi awalan Anda tidak akan di-cache. Cache memiliki Time To Live (TTL), yang mengatur ulang dengan setiap hit cache yang berhasil. Selama periode ini, konteks dalam cache dipertahankan. Jika tidak ada klik cache yang terjadi di dalam jendela TTL, cache Anda kedaluwarsa. Banyak model mendukung TTL 5 menit. Periksa kartu model untuk model Anda untuk melihat kondisi TTL yang tepat.
Anda dapat menggunakan caching prompt kapan pun Anda mendapatkan inferensi model di Amazon Bedrock untuk model yang didukung. Prompt caching didukung oleh fitur Amazon Bedrock berikut:
- Converse dan API ConverseStream
-
Anda dapat melakukan percakapan dengan model tempat Anda menentukan pos pemeriksaan cache di prompt Anda.
- InvokeModel dan InvokeModelWithResponseStream API
-
Anda dapat mengirimkan permintaan prompt tunggal di mana Anda mengaktifkan caching prompt dan menentukan pos pemeriksaan cache Anda.
- Prompt Caching dengan Inferensi Cross-region
-
Prompt caching dapat digunakan bersama dengan inferensi lintas wilayah. Cross-region inferensi secara otomatis memilih AWS Wilayah optimal dalam geografi Anda untuk melayani permintaan inferensi Anda, sehingga memaksimalkan sumber daya yang tersedia dan ketersediaan model. Pada saat permintaan tinggi, pengoptimalan ini dapat menyebabkan peningkatan penulisan cache.
- Manajemen Amazon Bedrock Prompt
-
Saat Anda membuat atau memodifikasi prompt, Anda dapat memilih untuk mengaktifkan caching prompt. Bergantung pada modelnya, Anda dapat men-cache prompt sistem, instruksi sistem, dan pesan (pengguna dan asisten). Anda juga dapat memilih untuk menonaktifkan caching prompt.
catatan
Caching cepat hanya didukung untuk titik akhir inferensi sesuai permintaan. Itu tidak didukung dengan API inferensi batch.
API memberi Anda fleksibilitas dan kontrol terperinci paling besar atas cache prompt. Anda dapat mengatur pos pemeriksaan cache individual dalam prompt Anda. Anda dapat menambahkan ke cache dengan membuat lebih banyak pos pemeriksaan cache, hingga jumlah maksimum pos pemeriksaan cache yang diizinkan untuk model tertentu. Untuk informasi selengkapnya, lihat Model, Wilayah, dan batas yang didukung.
Model, Wilayah, dan batas yang didukung
Caching cepat tersedia di semua AWS Wilayah di mana model yang didukung tersedia. Untuk memeriksa ketersediaan model berdasarkan Wilayah, lihatKetersediaan regional berdasarkan model.
Tabel berikut mencantumkan model yang didukung bersama dengan token minimum, jumlah maksimum pos pemeriksaan cache, dan bidang yang memungkinkan pos pemeriksaan cache.
Untuk melihat model mana yang mendukung caching cepat, silakan lihat Model sekilas dan kemudian pilih model yang Anda minati. Tabel berikut menunjukkan caching cepat untuk model yang tidak ada dalam model-at-a-glance.
| Nama model | ID Model | Jenis Rilis | Jumlah minimum token per pos pemeriksaan cache | Jumlah maksimum pos pemeriksaan cache per permintaan | TTL yang didukung | Bidang yang menerima pos pemeriksaan cache yang cepat |
|---|---|---|---|---|---|---|
Claude Opus 4.5 |
anthropic.claude-opus-4-5-20251101-v 1:0 |
Umumnya Tersedia |
4,096 |
4 |
5 menit, 1 jam |
`system`, `pesan`, dan `alat` |
Claude Opus 4.6 |
anthropic.claude-opus-4-6-v1 |
Umumnya Tersedia |
4,096 |
4 |
5 menit |
`system`, `pesan`, dan `alat` |
Claude Sonnet 4.5 |
anthropic.claude-sonnet-4-5-20250929-v 1:0 |
Umumnya Tersedia |
4,096 |
4 |
5 menit, 1 jam |
`system`, `pesan`, dan `alat` |
Claude Sonnet 4.6 |
antropik.claude-sonnet-4-6 |
Umumnya Tersedia |
1,024 |
4 |
5 menit |
`system`, `pesan`, dan `alat` |
Claude Haiku 4.5 |
anthropic.claude-haiku-4-5-20251001-v 1:0 |
Umumnya Tersedia |
4,096 |
4 |
5 menit, 1 jam |
`system`, `pesan`, dan `alat` |
Claude Opus 4 |
anthropic.claude-opus-4-20250514-v 1:0 |
Umumnya Tersedia |
1,024 |
4 |
5 menit |
`system`, `pesan`, dan `alat` |
Claude 3.7 Sonnet |
anthropic.claude-3-7-sonnet-20250219-v 1:0 |
Umumnya Tersedia |
1,024 |
4 |
5 menit |
`system`, `pesan`, dan `alat` |
Claude 3.5 Sonnet v2 |
anthropic.claude-3-5-sonnet-20241022-v 2:0 |
Pratinjau |
1,024 |
4 |
5 menit |
`system`, `pesan`, dan `alat` |
GPT-5.6 Sol |
openai.gpt-5.6-sol |
Umumnya Tersedia |
1,024 |
4 |
30 menit |
|
GPT-5.6 Terra |
openai.gpt-5.6-terra |
Umumnya Tersedia |
1,024 |
4 |
30 menit |
|
GPT-5.6 Luna |
openai.gpt-5.6-luna |
Umumnya Tersedia |
1,024 |
4 |
30 menit |
|
Untuk menggunakan opsi TTL 1 jam dengan model yang didukung (Claude Opus4.5,Claude Haiku 4.5, danClaude Sonnet 4.5), tentukan ttl bidang di pos pemeriksaan cache Anda. Di Converse API, tambahkan "ttl": "1h" ke cachePoint objek Anda. Di InvokeModel API untuk model Claude, tambahkan "ttl": "1h" ke objek Andacache_control. Jika tidak ada ttl nilai yang diberikan, perilaku caching 5 menit default berlaku. TTL 1 jam berguna untuk sesi yang berjalan lebih lama atau skenario pemrosesan batch di mana Anda ingin mempertahankan cache selama periode yang diperpanjang.
Amazon Novamenawarkan caching prompt otomatis untuk semua permintaan teks, termasuk User dan System pesan. Mekanisme ini dapat memberikan manfaat latensi ketika prompt dimulai dengan bagian berulang, bahkan tanpa konfigurasi eksplisit. Namun, untuk membuka penghematan biaya dan memastikan manfaat kinerja yang lebih konsisten, kami sarankan untuk memilih Caching Prompt Eksplisit.
Manajemen Cache untuk Model dari Antropik
Untuk model Claude, Amazon Bedrock menawarkan pendekatan sederhana untuk manajemen cache yang mengurangi kompleksitas menempatkan pos pemeriksaan cache secara manual. Alih-alih mengharuskan Anda menentukan lokasi pos pemeriksaan cache yang tepat, Anda dapat menggunakan manajemen cache otomatis dengan satu breakpoint di akhir konten statis Anda.
Saat Anda mengaktifkan manajemen cache yang disederhanakan, sistem secara otomatis memeriksa klik cache pada batas blok konten sebelumnya, melihat kembali hingga sekitar 20 blok konten dari breakpoint yang Anda tentukan. Hal ini memungkinkan model untuk menemukan awalan pencocokan terpanjang dari cache Anda tanpa mengharuskan Anda untuk memprediksi lokasi pos pemeriksaan yang optimal. Untuk menggunakan ini, letakkan pos pemeriksaan cache tunggal di akhir konten statis Anda, sebelum konten dinamis atau variabel apa pun. Sistem akan secara otomatis menemukan kecocokan cache terbaik.
Untuk kontrol yang lebih terperinci, Anda masih dapat menggunakan beberapa pos pemeriksaan cache (hingga 4 untuk model Claude) untuk menentukan batas cache yang tepat. Anda harus menggunakan pos pemeriksaan cache berlipat ganda jika Anda melakukan caching bagian yang berubah pada frekuensi yang berbeda atau ingin lebih banyak kontrol atas apa yang akan di-cache.
penting
Pemeriksaan awalan otomatis hanya melihat kembali sekitar 20 blok konten dari pos pemeriksaan cache Anda. Jika konten statis Anda melampaui rentang ini, pertimbangkan untuk menggunakan beberapa pos pemeriksaan cache atau restrukturisasi prompt Anda untuk menempatkan konten yang paling sering digunakan kembali dalam rentang ini.
Praktik terbaik untuk menggunakan manajemen cache dalam Model Antropik
Jika Anda memiliki prompt yang digunakan pada irama reguler (yaitu, prompt sistem yang digunakan lebih sering daripada setiap 5 menit), terus gunakan cache 5 menit, karena ini akan terus diperbarui tanpa biaya tambahan.
Cache 1 jam paling baik digunakan dalam skenario berikut:
-
Ketika Anda memiliki petunjuk yang kemungkinan digunakan kurang dari 5 menit, tetapi lebih sering daripada setiap jam. Misalnya, ketika agen samping agen akan memakan waktu lebih dari 5 menit, atau saat menyimpan percakapan obrolan panjang dengan pengguna dan Anda biasanya berharap bahwa pengguna mungkin tidak merespons dalam 5 menit ke depan.
-
Ketika latensi penting dan permintaan tindak lanjut Anda dapat dikirim lebih dari 5 menit.
-
Ketika Anda ingin meningkatkan penggunaan batas tarif Anda, karena klik cache tidak dikurangi terhadap batas tarif Anda.
Anda dapat menggunakan kontrol cache 1 jam dan 5 menit dalam permintaan yang sama, tetapi dengan kendala penting: Entri cache dengan TTL yang lebih panjang harus muncul sebelum TTL yang lebih pendek (yaitu, entri cache 1 jam harus muncul sebelum entri cache 5 menit).
Manajemen Cache untuk Model dari OpenAI
Model OpenAI di Amazon Bedrock mendukung caching prompt melalui Responses API di titik akhir. bedrock-mantle Perilaku caching berbeda tergantung pada pembuatan model.
GPT-5.6 model
GPT-5.6 Sol (openai.gpt-5.6-sol), Terra (openai.gpt-5.6-terra), dan Luna (openai.gpt-5.6-luna) memperkenalkan breakpoint cache prompt eksplisit, memberi Anda kontrol yang tepat atas bagian mana dari prompt Anda yang di-cache. Ini sangat berharga untuk alur kerja agen di mana instruksi sistem, definisi alat, dan file referensi berulang di banyak panggilan sementara hanya input terbaru yang berubah.
Karakteristik utama:
Breakpoint cache eksplisit - Tandai akhir yang tepat dari awalan prompt yang dapat digunakan kembali dengan menambahkan
"prompt_cache_breakpoint": {"mode": "explicit"}ke blok konten yang didukung.Mode cache - Setel
prompt_cache_options.modeuntuk mengontrol perilaku breakpoint:implicit(default) - Menempatkan breakpoint otomatis pada pesan terbaru dan juga menggunakan breakpoint eksplisit yang Anda berikan.explicit- Menonaktifkan breakpoint otomatis. Hanya breakpoint eksplisit yang digunakan untuk membaca dan menulis cache. Jika tidak ada breakpoint eksplisit, permintaan tidak menggunakan caching prompt atau dikenakan biaya penulisan cache.
Panjang awalan minimum — 1.024 token per breakpoint.
TTL minimum 30 menit - Awalan cache tetap tersedia untuk digunakan kembali setidaknya selama 30 menit, cukup lama untuk menutupi ledakan panggilan yang dihasilkan oleh satu agen. TTL diatur melalui
prompt_cache_options.ttldan default ke.30mPenagihan tulis cache — Token yang ditulis ke cache ditagih pada 1,25 × tingkat token input yang tidak di-cache. Pembacaan cache ditagih dengan diskon 90% dibandingkan dengan token input yang tidak di-cache.
Token cache tidak dihitung terhadap batas tarif — Token input cache yang dibaca melalui caching prompt tidak dihitung terhadap kuota input-tokens-per-menit.
Memahami responsnya
Objek penggunaan dalam respons mencakup dua bidang khusus cache:
cached_tokens— Jumlah token input yang dibaca dari cache (ditagih dengan diskon cache-read discount rate).cache_write_tokens— Jumlah token input yang ditulis ke cache (ditagih pada 1,25 × tingkat token input yang tidak di-cache).
Bila cached_tokens lebih besar dari nol dan cache_write_tokens nol, permintaan Anda sepenuhnya cocok dengan entri cache yang ada — tidak ada penulisan baru yang terjadi, dan Anda menerima penghematan biaya maksimum.
Praktik terbaik untuk menggunakan manajemen cache dalam model GPT 5.6
Tempatkan breakpoint setelah konten stabil — Instruksi sistem, definisi alat, dan dokumen referensi yang tidak berubah di antara panggilan akan muncul sebelum breakpoint. Konten setelah breakpoint dapat berubah secara bebas tanpa membatalkan awalan cache.
Gunakan
explicitmode untuk loop agen — Ketika Anda ingin kontrol penuh atas apa yang di-cache dan ingin menghindari breakpoint otomatis yang menggunakan slot tulis.Monitor
cache_write_tokens— Bandingkan volume cache-write dengan pembacaan cache berikutnya untuk memahami dampak biaya bersih dan menyesuaikan penempatan breakpoint yang sesuai.
GPT-5.5 dan model sebelumnya
Untuk model OpenAI sebelum GPT-5.6 (seperti openai.gpt-5.5 danopenai.gpt-5.4), caching prompt bersifat otomatis. Anda tidak perlu menambahkan parameter khusus apa pun — sistem secara otomatis menyimpan awalan prompt yang memenuhi syarat dari 1.024 token atau lebih lama. Penulisan cache tidak memiliki biaya tambahan untuk model ini.
Karakteristik utama:
Caching otomatis - Tidak ada perubahan kode yang diperlukan. Sistem cache awalan secara otomatis berdasarkan pencocokan awalan yang tepat.
Panjang awalan minimum - 1.024 token.
Tidak ada biaya penulisan cache - Hanya pembacaan cache yang ditagih dengan tarif diskon.
Token cache tidak dihitung terhadap batas tarif — Token input cache yang dibaca melalui caching prompt tidak dihitung terhadap kuota input-tokens-per-menit.
Praktik terbaik untuk menggunakan manajemen cache di GPT-5.5 dan model sebelumnya
Tempatkan konten statis (prompt sistem, definisi alat, dokumen referensi) di awal prompt Anda.
Letakkan konten variabel (input khusus pengguna) di bagian akhir.
Pertahankan aliran permintaan yang stabil dengan awalan yang identik untuk meminimalkan penggusuran cache.
Memulai
Bagian berikut menunjukkan gambaran singkat tentang cara menggunakan fitur caching prompt untuk setiap metode berinteraksi dengan model melalui Amazon Bedrock.
Converse API menyediakan opsi lanjutan dan fleksibel untuk menerapkan caching cepat dalam percakapan multi-putaran. Untuk informasi selengkapnya tentang persyaratan prompt untuk setiap model, lihat bagian sebelumnya. Model, Wilayah, dan batas yang didukung
Permintaan contoh
Contoh berikut menunjukkan pos pemeriksaan cache yang disetel di messagessystem,, atau tools bidang permintaan ke Converse API. Anda dapat menempatkan pos pemeriksaan di salah satu lokasi ini untuk permintaan tertentu. Misalnya, jika mengirim permintaan ke model Claude 3.5 Sonnet v2, Anda dapat menempatkan dua pos pemeriksaan cache, satu pos pemeriksaan cachemessages, dan satu disystem. tools Untuk informasi lebih rinci dan contoh penataan dan pengiriman permintaan Converse API, lihatInferensi menggunakan Converse API.
penting
Pos pemeriksaan cache diproses dalam urutan ini: tools → system →messages. Ukuran cache minimum dievaluasi terhadap token kumulatif di ketiga bagian yang digabungkan, bukan setiap bagian secara individual. Karena bagian dirantai, mengubah konten di bagian sebelumnya membatalkan cache untuk bagian selanjutnya (misalnya, memodifikasi tools membatalkan dan cache). system messages Untuk tingkat hit cache terbaik, tempatkan konten stabil (tools,system) sebelum konten variabel (messages), dan tempatkan pos pemeriksaan cache setelah konten stabil.
Tentukan nilai ttl yang diinginkan seperti di bawah ini, ketika nilai ttl tidak ditentukan perilaku default 5 menit caching berlaku.
"cachePoint" : { "type": "default", "ttl" : "5m | 1h" }
Respons model dari Converse API mencakup tiga bidang baru yang khusus untuk prompt caching. cacheWriteInputTokensNilai cacheReadInputTokens dan memberi tahu Anda berapa banyak token yang dibaca dari cache dan berapa banyak token yang ditulis ke cache karena permintaan Anda sebelumnya. cacheDetailsNilai memberi tahu Anda ttl yang digunakan untuk jumlah token yang ditulis ke cache. Ini adalah nilai yang dikenakan biaya oleh Amazon Bedrock, dengan tarif yang lebih rendah dari biaya inferensi model penuh.
penting
Saat caching prompt diaktifkan, inputTokens bidang hanya mewakili token input yang tidak di-cache (token yang tidak dibaca atau ditulis ke cache). Untuk menghitung total token masukan yang dikirim dalam permintaan, gunakan rumus berikut:
total input tokens = inputTokens + cacheReadInputTokens + cacheWriteInputTokens
Caching prompt diaktifkan secara default saat Anda memanggil InvokeModelAPI. Anda dapat mengatur pos pemeriksaan cache kapan saja di badan permintaan Anda, mirip dengan contoh sebelumnya untuk Converse API.
Untuk informasi selengkapnya tentang mengirim InvokeModel permintaan, lihatKirim satu prompt dengan InvokeModel.
Untuk model OpenAI di bedrock-mantle titik akhir, Anda menggunakan Responses API dengan parameter caching prompt khusus untuk pembuatan model. Untuk GPT-5.6 model, Anda mengontrol caching dengan breakpoint eksplisit. Untuk GPT-5.5 dan sebelumnya, caching otomatis.
GPT-5.6 contoh dengan breakpoint cache eksplisit
Contoh berikut menunjukkan permintaan Responses API untuk openai.gpt-5.6-sol menggunakan breakpoint cache eksplisit. Instruksi sistem di-cache dan digunakan kembali di seluruh permintaan berikutnya.
{ "model": "openai.gpt-5.6-sol", "prompt_cache_key": "my-app:system-prompt-v1", "prompt_cache_options": { "mode": "explicit" }, "input": [ { "type": "message", "role": "developer", "content": [ { "type": "input_text", "text": "You are a technical support agent. Use the company knowledge base to answer questions. Follow these guidelines: 1. Always cite the relevant documentation section. 2. If unsure, escalate to a human agent. 3. Be concise but thorough...", "prompt_cache_breakpoint": { "mode": "explicit" } } ] }, { "type": "message", "role": "user", "content": [ { "type": "input_text", "text": "How do I configure SSO for my organization?" } ] } ] }
GPT-5.5 contoh dengan caching otomatis
Untuk GPT-5.5 dan model sebelumnya, caching prompt otomatis. Tidak diperlukan breakpoint atau kunci cache — cukup pastikan awalan prompt Anda melebihi 1.024 token.
{ "model": "openai.gpt-5.5", "input": [ { "type": "message", "role": "developer", "content": [ { "type": "input_text", "text": "You are a technical support agent. Use the company knowledge base to answer questions..." } ] }, { "type": "message", "role": "user", "content": [ { "type": "input_text", "text": "How do I configure SSO for my organization?" } ] } ] }
Respons
Responsnya mencakup metrik penggunaan cache di usage objek:
{ "id": "resp_abc123", "output": [...], "usage": { "input_tokens": 2048, "output_tokens": 256, "total_tokens": 2304, "input_tokens_details": { "cached_tokens": 1920, "cache_write_tokens": 0 } } }
Dalam tanggapan ini, 1.920 token dilayani dari cache dan tidak ada token baru yang ditulis, menunjukkan hit cache penuh dengan penghematan biaya maksimum.
Di taman bermain obrolan di konsol Amazon Bedrock, Anda dapat mengaktifkan opsi caching prompt, dan Amazon Bedrock secara otomatis membuat pos pemeriksaan cache untuk Anda.
Ikuti instruksi Hasilkan tanggapan di konsol menggunakan taman bermain untuk memulai dengan meminta di taman bermain Amazon Bedrock. Untuk model yang didukung, caching prompt secara otomatis dihidupkan di taman bermain. Namun, jika tidak, lakukan hal berikut untuk mengaktifkan caching prompt:
-
Buka menu Konfigurasi.
-
Aktifkan sakelar Prompt caching.
-
Jalankan petunjuk Anda.
Setelah input gabungan dan respons model Anda mencapai jumlah token minimum yang diperlukan untuk pos pemeriksaan (yang bervariasi menurut model), Amazon Bedrock secara otomatis membuat pos pemeriksaan cache pertama untuk Anda. Saat Anda terus mengobrol, setiap jangkauan berikutnya dari jumlah minimum token menciptakan pos pemeriksaan baru, hingga jumlah maksimum pos pemeriksaan yang diizinkan untuk model tersebut. Anda dapat melihat pos pemeriksaan cache Anda kapan saja dengan memilih Lihat pos pemeriksaan cache di sebelah sakelar caching Prompt, seperti yang ditunjukkan pada gambar berikut.
Anda dapat melihat berapa banyak token yang dibaca dan ditulis ke cache karena setiap interaksi dengan model dengan melihat metrik Caching pop-up (
) di respons taman bermain.
Jika Anda mematikan sakelar caching prompt saat berada di tengah percakapan, Anda dapat terus mengobrol dengan model.