Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Caching cepat untuk inferensi model yang lebih cepat
Prompt caching adalah fitur opsional yang dapat Anda gunakan dengan model yang didukung di Amazon Bedrock untuk mengurangi latensi respons inferensi dan biaya token input. Amazon Bedrock mendukung dua jenis cache prompt: Implic it Prompt Caching dan Explicit Prompt Caching. Dukungan untuk setiap jenis bervariasi menurut model dan API.
Caching cepat dapat membantu ketika Anda memiliki beban kerja dengan konteks panjang dan berulang yang sering digunakan kembali untuk beberapa kueri. Misalnya, jika Anda memiliki chatbot tempat pengguna dapat mengunggah dokumen dan mengajukan pertanyaan tentang mereka, mungkin memakan waktu bagi model untuk memproses dokumen setiap kali pengguna memberikan masukan. Dengan cepat caching, Anda dapat menyimpan dokumen dalam cache sehingga kueri di masa mendatang yang berisi dokumen tidak perlu diproses ulang.
Jenis caching prompt
Kedua jenis berbeda dalam cara konten prompt yang dapat digunakan kembali dipilih:
| Tipe | Cara kerjanya | Minta konfigurasi |
|---|---|---|
| Caching Prompt Implisit | Amazon Bedrock dan model secara otomatis mencoba menggunakan kembali awalan prompt yang memenuhi syarat. | Tidak ada kontrol cache atau breakpoint yang diperlukan dalam permintaan Anda. |
| Caching Prompt Eksplisit | Anda mengidentifikasi awalan prompt yang dapat digunakan kembali dengan menambahkan kontrol cache khusus model atau breakpoint. | Permintaan Anda harus menyertakan kontrol cache yang didukung oleh model dan API. |
Caching Prompt Implisit
Implisit Prompt Caching secara otomatis mencoba menggunakan kembali awalan prompt yang memenuhi syarat tanpa memerlukan kontrol cache dalam permintaan Anda. Simpan konten statis di awal prompt Anda dan konten dinamis di akhir untuk meningkatkan kemungkinan kecocokan awalan yang tepat.
Implisit Prompt Caching adalah upaya terbaik. Mengulangi prompt yang identik tidak menjamin hit cache, dan tingkat cache-hit dapat bervariasi.
Caching Prompt Eksplisit
Caching Prompt Eksplisit memungkinkan Anda mengidentifikasi awalan prompt yang dapat digunakan kembali menggunakan kontrol cache khusus model atau pos pemeriksaan cache. Titik pemeriksaan cache adalah penanda yang menentukan subbagian yang berdekatan dari prompt Anda yang ingin Anda simpan dalam cache. Awalan prompt harus tetap statis di antara permintaan. Perubahan pada awalan prompt dalam permintaan berikutnya mengakibatkan cache hilang.
Pos pemeriksaan cache memiliki jumlah token minimum dan maksimum, tergantung pada modelnya. Anda hanya dapat membuat pos pemeriksaan cache jika awalan prompt total Anda memenuhi jumlah minimum token. Misalnya, Claude Opus 5 membutuhkan setidaknya 512 token per checkpoint cache, Claude Sonnet 5 membutuhkan setidaknya 1.024 token per checkpoint cache, dan Claude Haiku 4.5 membutuhkan setidaknya 4.096 token per checkpoint cache. Minimum berlaku secara kumulatif ke seluruh awalan prompt sebelum setiap pos pemeriksaan, termasuk, jika berlaku, konten di bidangtools,system, danmessages. Tidak ada jumlah minimum token yang diperlukan antara pos pemeriksaan cache. Untuk model dengan minimum 1.024 token, Anda dapat menentukan pos pemeriksaan tambahan yang terpisah kurang dari 1.024 token selama awalan prompt total sebelum setiap pos pemeriksaan berisi setidaknya 1.024 token. Jika Anda menambahkan checkpoint cache sebelum awalan prompt total memenuhi jumlah minimum token, inferensi Anda masih berhasil, tetapi awalan Anda tidak di-cache.
Cache memiliki Time To Live (TTL), yang diatur ulang dengan setiap hit cache yang berhasil. Selama periode ini, konteks dalam cache dipertahankan. Jika tidak ada hit cache yang terjadi di dalam jendela TTL, cache Anda kedaluwarsa. Banyak model mendukung TTL 5 menit. Periksa kartu model untuk model Anda untuk melihat kondisi TTL yang tepat.
Caching Prompt Eksplisit memberikan kontrol atas konten prompt mana yang memenuhi syarat untuk caching. Itu tidak menjamin bahwa permintaan yang memenuhi syarat menghasilkan hit cache.
Penagihan untuk token yang di-cache
Untuk Caching Prompt Implisit dan Caching Prompt Eksplisit, token yang berhasil dibaca dari cache dilaporkan sebagai token yang di-cache dan ditagih pada tingkat pembacaan cache model. Token yang tidak dibaca dari cache ditagih dengan tarif token input standar. Tergantung pada modelnya, token yang ditulis ke cache dapat ditagih dengan tarif yang lebih tinggi dari tarif token input standar. Untuk informasi selengkapnya, lihat halaman harga
penting
Dukungan untuk cache yang cepat tidak menjamin hit cache untuk permintaan apa pun. Periksa bidang penggunaan cache dalam respons model untuk menentukan apakah token dibaca dari atau ditulis ke cache.
Anda dapat menggunakan cache prompt saat menjalankan inferensi di Amazon Bedrock dengan model yang didukung. Ketersediaan setiap jenis cache prompt bervariasi menurut model dan API. Caching cepat tersedia melalui fitur Amazon Bedrock berikut:
- Converse dan API ConverseStream
-
Anda dapat melanjutkan percakapan dengan model yang didukung. Untuk Caching Prompt Eksplisit, tentukan pos pemeriksaan cache di prompt Anda.
- InvokeModel dan InvokeModelWithResponseStream API
-
Anda dapat mengirimkan permintaan prompt tunggal ke model yang didukung. Untuk Caching Prompt Eksplisit, aktifkan cache prompt dan tentukan pos pemeriksaan cache Anda.
- Caching cepat dengan inferensi Cross-region
-
Prompt caching dapat digunakan bersama dengan inferensi lintas wilayah. Cross-region inferensi secara otomatis memilih Wil AWS ayah optimal dalam geografi Anda untuk melayani permintaan inferensi Anda, sehingga memaksimalkan sumber daya yang tersedia dan ketersediaan model. Pada saat permintaan tinggi, pengoptimalan ini dapat menyebabkan peningkatan penulisan cache.
- Manajemen cepat Amazon Bedrock
-
Saat Anda membuat atau memodifikasi prompt, Anda dapat memilih untuk mengaktifkan cache prompt. Tergantung pada modelnya, Anda dapat menyimpan perintah sistem, instruksi sistem, dan pesan (pengguna dan asisten). Anda juga dapat memilih untuk menonaktifkan cache prompt.
catatan
Caching prompt hanya didukung untuk titik akhir inferensi sesuai permintaan. Ini tidak didukung dengan API inferensi batch.
Untuk model yang mendukung Explicit Prompt Caching, API menyediakan kontrol granular atas cache prompt. Anda dapat mengatur pos pemeriksaan cache individual dalam prompt Anda dan menambahkan pos pemeriksaan hingga maksimum yang diizinkan untuk model. Untuk informasi selengkapnya, lihat Model yang didukung, Wilayah, dan batas caching eksplisit.
Model yang didukung, Wilayah, dan batas caching eksplisit
Dukungan caching yang cepat bervariasi menurut model dan API. Kartu model mengidentifikasi apakah model mendukung Implicit Prompt Caching, Explicit Prompt Caching, atau keduanya. Caching cepat tersedia di semua Wil AWS ayah di mana model yang didukung tersedia. Untuk memeriksa ketersediaan model berdasarkan Wilayah, lihatKetersediaan regional berdasarkan model.
Tabel berikut mencantumkan model yang mendukung Explicit Prompt Caching, bersama dengan minimum token mereka, jumlah maksimum pos pemeriksaan cache, dan bidang yang memungkinkan pos pemeriksaan cache.
Untuk melihat jenis cache prompt mana yang didukung model, lihat sekilas Model, lalu pilih model yang Anda minati.
| Nama model | Model ID | Jenis rilis | Jumlah minimum token per pos pemeriksaan cache | Jumlah maksimum pos pemeriksaan cache per permintaan | TTL yang didukung | Bidang yang menerima pos pemeriksaan cache prompt |
|---|---|---|---|---|---|---|
Claude Fable 5.1 |
antropic.claude-fabel-5-1 |
Tersedia secara umum |
512 |
4 |
5 menit, 1 jam |
`sistem`, `pesan`, dan `alat` |
Claude Mythos 5.1 |
antropic.claude-mitos-5-1 |
Terjaga keamanannya |
512 |
4 |
5 menit, 1 jam |
`sistem`, `pesan`, dan `alat` |
Claude Fable 5 |
antropic.claude-fable-5 |
Tersedia secara umum |
512 |
4 |
5 menit, 1 jam |
`sistem`, `pesan`, dan `alat` |
Claude Mythos 5 |
antropic.claude-mythos-5 |
Terjaga keamanannya |
512 |
4 |
5 menit, 1 jam |
`sistem`, `pesan`, dan `alat` |
Claude Mythos Preview |
antropic.claude-mythos-pratinjau |
Terjaga keamanannya |
4.096 |
4 |
5 menit, 1 jam |
`sistem`, `pesan`, dan `alat` |
Claude Opus 5 |
antropic.claude-opus-5 |
Tersedia secara umum |
512 |
4 |
5 menit, 1 jam |
`sistem`, `pesan`, dan `alat` |
Claude Opus 4.8 |
antropic.claude-opus-4-8 |
Tersedia secara umum |
1٬024 |
4 |
5 menit, 1 jam |
`sistem`, `pesan`, dan `alat` |
Claude Opus 4.7 |
antropic.claude-opus-4-7 |
Tersedia secara umum |
4.096 |
4 |
5 menit, 1 jam |
`sistem`, `pesan`, dan `alat` |
Claude Opus 4.6 |
antropik.laude-opus-4-6-v1 |
Tersedia secara umum |
4.096 |
4 |
5 menit, 1 jam |
`sistem`, `pesan`, dan `alat` |
Claude Opus 4.5 |
antropik.laude-opus-4-5-20251101-v 1:0 |
Tersedia secara umum |
4.096 |
4 |
5 menit, 1 jam |
`sistem`, `pesan`, dan `alat` |
Claude Sonnet 5 |
antropic.claude-sonnet-5 |
Tersedia secara umum |
1٬024 |
4 |
5 menit, 1 jam |
`sistem`, `pesan`, dan `alat` |
Claude Sonnet 4.6 |
antropic.claude-sonnet-4-6 |
Tersedia secara umum |
1٬024 |
4 |
5 menit, 1 jam |
`sistem`, `pesan`, dan `alat` |
Claude Sonnet 4.5 |
antropik.laude-sonnet-4-5-20250929-v 1:0 |
Tersedia secara umum |
1٬024 |
4 |
5 menit, 1 jam |
`sistem`, `pesan`, dan `alat` |
Claude 3.7 Sonnet |
antropik.laude-3-7-sonnet-20250219-v 1:0 |
Tersedia secara umum |
1٬024 |
4 |
5 menit |
`sistem`, `pesan`, dan `alat` |
Claude 3.5 Sonnet v2 |
antropik.laude-3-5-sonnet-20241022-v 2:0 |
Pratinjau |
1٬024 |
4 |
5 menit |
`sistem`, `pesan`, dan `alat` |
Claude Haiku 4.5 |
antropik.laude-haiku-4-5-20251001-v 1:0 |
Tersedia secara umum |
4.096 |
4 |
5 menit, 1 jam |
`sistem`, `pesan`, dan `alat` |
GPT-5.6 Matahari |
openai.gpt-5.6-sol |
Tersedia secara umum |
1٬024 |
4 |
30 menit |
|
GPT-5.6 Terra |
openai.gpt-5.6-terra |
Tersedia secara umum |
1٬024 |
4 |
30 menit |
|
GPT-5.6 Luna |
openai.gpt-5.6-bulan |
Tersedia secara umum |
1٬024 |
4 |
30 menit |
|
Untuk menggunakan opsi TTL 1 jam dengan model yang didukung (Claude Fable 5,,Claude Opus 5,Claude Opus 4.8,Claude Opus 4.7,Claude Opus 4.6,Claude Opus 4.5, Claude Sonnet 5Claude Sonnet 4.6, danClaude Haiku 4.5)Claude Sonnet 4.5, tentukan ttl bidang di pos pemeriksaan cache Anda. Di Converse API, tambahkan "ttl": "1h" ke cachePoint objek Anda. Di InvokeModel API untuk model Claude, tambahkan "ttl": "1h" ke cache_control objek Anda. Jika tidak ada ttl nilai yang diberikan, perilaku caching 5 menit default berlaku. TTL 1 jam berguna untuk sesi yang berjalan lebih lama atau skenario pemrosesan batch di mana Anda ingin mempertahankan cache selama periode yang lama.
Amazon Novamenawarkan Caching Prompt Implisit untuk semua prompt teks, termasuk User dan System pesan. Mekanisme ini dapat memberikan manfaat latensi ketika prompt dimulai dengan bagian berulang, tanpa konfigurasi eksplisit. Amazon Novamodel yang ditampilkan mendukung Explicit Prompt Caching di kartu model mereka juga memungkinkan Anda menentukan pos pemeriksaan cache untuk kontrol lebih besar atas kelayakan cache.
Caching cepat untuk model dari Anthropic
Model antropis yang mendukung caching cepat di Amazon Bedrock mendukung Caching Prompt Implicit dan Explicit Prompt Caching. Implisit Prompt Caching secara otomatis mencoba menggunakan kembali awalan prompt yang memenuhi syarat tanpa memerlukan kontrol cache dalam permintaan Anda.
Untuk Caching Prompt Eksplisit, Amazon Bedrock menawarkan pendekatan sederhana untuk manajemen cache yang mengurangi kompleksitas menempatkan pos pemeriksaan cache secara manual. Alih-alih mengharuskan Anda untuk menentukan lokasi checkpoint cache yang tepat, Anda dapat menggunakan manajemen cache otomatis dengan satu breakpoint di akhir konten statis Anda.
Saat Anda mengaktifkan manajemen cache yang disederhanakan, sistem secara otomatis memeriksa hit cache pada batas blok konten sebelumnya, melihat kembali hingga sekitar 20 blok konten dari breakpoint yang Anda tentukan. Hal ini memungkinkan model menemukan awalan pencocokan terpanjang dari cache Anda tanpa mengharuskan Anda memprediksi lokasi pos pemeriksaan yang optimal. Untuk menggunakan ini, tempatkan satu pos pemeriksaan cache di akhir konten statis Anda, sebelum konten dinamis atau variabel apa pun. Sistem akan secara otomatis menemukan kecocokan cache terbaik.
Untuk kontrol yang lebih terperinci, Anda masih dapat menggunakan beberapa pos pemeriksaan cache (hingga 4 untuk model Claude) untuk menentukan batas cache yang tepat. Anda harus menggunakan beberapa titik pemeriksaan cache jika Anda menyimpan bagian yang berubah pada frekuensi yang berbeda atau ingin lebih banyak kontrol atas apa yang akan di-cache.
penting
Pemeriksaan awalan otomatis hanya melihat kembali sekitar 20 blok konten dari pos pemeriksaan cache Anda. Jika konten statis Anda melampaui rentang ini, pertimbangkan untuk menggunakan beberapa pos pemeriksaan cache atau merestrukturisasi prompt Anda untuk menempatkan konten yang paling sering digunakan kembali dalam rentang ini.
Praktik terbaik untuk menggunakan manajemen cache dalam Model Anthropic
Jika Anda memiliki prompt yang digunakan pada irama biasa (yaitu, perintah sistem yang digunakan lebih sering daripada setiap 5 menit), lanjutkan menggunakan cache 5 menit, karena ini akan terus diperbarui tanpa biaya tambahan.
Cache 1 jam paling baik digunakan dalam skenario berikut:
-
Ketika Anda memiliki petunjuk yang kemungkinan digunakan kurang sering dari 5 menit, tetapi lebih sering daripada setiap jam. Misalnya, ketika agen samping agen akan memakan waktu lebih dari 5 menit, atau saat menyimpan percakapan obrolan panjang dengan pengguna dan Anda umumnya mengharapkan bahwa pengguna mungkin tidak merespons dalam 5 menit ke depan.
-
Ketika latensi penting dan petunjuk tindak lanjut Anda dapat dikirim lebih dari 5 menit.
-
Saat Anda ingin meningkatkan penggunaan batas tarif, karena hit cache tidak dikurangkan dari batas tarif Anda.
Anda dapat menggunakan kontrol cache 1 jam dan 5 menit dalam permintaan yang sama, tetapi dengan batasan penting: Entri cache dengan TTL yang lebih panjang harus muncul sebelum TTL yang lebih pendek (yaitu, entri cache 1 jam harus muncul sebelum entri cache 5 menit).
Caching cepat untuk model dari OpenAI
Model OpenAI di Amazon Bedrock mendukung Implicit Prompt Caching melalui Responses API. GPT-5.6 model juga mendukung Explicit Prompt Caching. Responses API tersedia di titik akhir bedrock-runtime dan bedrock-mantle titik akhir.
GPT-5.6 model
GPT-5.6 Sol (openai.gpt-5.6-sol), Terra (), dan Luna (openai.gpt-5.6-terraopenai.gpt-5.6-luna) mendukung Caching Prompt Implicit dan Explicit Prompt Caching. Breakpoint cache prompt eksplisit memberi Anda kontrol yang tepat atas bagian mana dari prompt Anda yang memenuhi syarat untuk cache. Ini sangat berharga untuk alur kerja agen di mana instruksi sistem, definisi alat, dan file referensi berulang di banyak panggilan sementara hanya input terbaru yang berubah.
Karakteristik utama:
Breakpoint cache eksplisit — Tandai akhir yang tepat dari awalan prompt yang dapat digunakan kembali dengan menambahkan
"prompt_cache_breakpoint": {"mode": "explicit"}ke blok konten yang didukung.Mode cache - Setel
prompt_cache_options.modeuntuk mengontrol perilaku breakpoint:implicit(default) — Menempatkan breakpoint otomatis pada pesan terbaru dan juga menggunakan breakpoint eksplisit apa pun yang Anda berikan.explicit— Menonaktifkan breakpoint otomatis. Hanya breakpoint eksplisit yang digunakan untuk membaca dan menulis cache. Jika tidak ada breakpoint eksplisit, permintaan tidak menggunakan cache prompt atau dikenakan biaya penulisan cache.
Panjang awalan minimum — 1.024 token per breakpoint.
TTL minimum 30 menit — Awalan yang di-cache tetap tersedia untuk digunakan kembali setidaknya selama 30 menit, cukup lama untuk menutupi ledakan panggilan yang dihasilkan oleh satu agen yang dijalankan. TTL diatur melalui
prompt_cache_options.ttldan default ke.30mPenagihan tulis cache — Token yang ditulis ke cache ditagih dengan 1,25× tarif token input yang tidak di-cache. Pembacaan cache ditagih dengan diskon 90% dibandingkan dengan token input yang tidak di-cache.
Token yang di-cache tidak dihitung terhadap batas tarif — Token input yang di-cache yang dibaca melalui cache prompt tidak dihitung terhadap kuota input-tokens-per-menit.
Memahami respon
Objek penggunaan dalam respons mencakup dua bidang khusus cache:
cached_tokens— Jumlah token input yang dibaca dari cache (ditagih pada tingkat diskonto cache-read).cache_write_tokens— Jumlah token input yang ditulis ke cache (ditagih pada 1,25× tarif token input yang tidak di-cache).
Ketika cached_tokens lebih besar dari nol dan cache_write_tokens nol, permintaan Anda sepenuhnya cocok dengan entri cache yang ada - tidak ada penulisan baru yang terjadi, dan Anda menerima penghematan biaya maksimum.
Praktik terbaik untuk menggunakan manajemen cache dalam model GPT 5.6
Tempatkan breakpoint setelah konten stabil — Instruksi sistem, definisi alat, dan dokumen referensi yang tidak berubah di antara panggilan akan muncul sebelum breakpoint. Konten setelah breakpoint dapat berubah secara bebas tanpa membatalkan awalan cache.
Gunakan
explicitmode untuk loop agentic - Ketika Anda ingin kontrol penuh atas apa yang di-cache dan ingin menghindari breakpoint otomatis yang menghabiskan slot tulis.Monitor
cache_write_tokens— Bandingkan volume cache-write dengan pembacaan cache berikutnya untuk memahami dampak biaya bersih dan sesuaikan penempatan breakpoint yang sesuai.
GPT-5.5 dan model sebelumnya
Untuk model OpenAI sebelum GPT-5.6 (seperti openai.gpt-5.5 danopenai.gpt-5.4), Implicit Prompt Caching otomatis. Anda tidak perlu menambahkan parameter khusus. Sistem secara otomatis mencoba untuk menyimpan prefiks prompt yang memenuhi syarat dari 1.024 token atau lebih lama. Penulisan cache tidak memiliki biaya tambahan pada model ini.
Karakteristik utama:
Implisit Prompt Caching — Tidak ada perubahan kode yang diperlukan. Sistem mencoba untuk menyimpan awalan secara otomatis berdasarkan pencocokan awalan yang tepat.
Panjang awalan minimum — 1.024 token.
Tidak ada biaya penulisan cache — Hanya pembacaan cache yang ditagih dengan tarif diskon.
Token yang di-cache tidak dihitung terhadap batas tarif — Token input yang di-cache yang dibaca melalui cache prompt tidak dihitung terhadap kuota input-tokens-per-menit.
Praktik terbaik untuk menggunakan manajemen cache dalam GPT-5.5 dan model sebelumnya
Tempatkan konten statis (perintah sistem, definisi alat, dokumen referensi) di awal prompt Anda.
Letakkan konten variabel (input khusus pengguna) di akhir.
Pertahankan aliran permintaan yang stabil dengan awalan yang identik untuk meminimalkan penggusuran cache.
Memulai
Bagian berikut menunjukkan gambaran singkat tentang cara menggunakan fitur caching prompt untuk setiap metode berinteraksi dengan model melalui Amazon Bedrock.
API Converse menyediakan opsi lanjutan dan fleksibel untuk menerapkan caching cepat dalam percakapan multi-putaran. Untuk informasi selengkapnya tentang persyaratan prompt untuk setiap model, lihat bagian sebelumnyaModel yang didukung, Wilayah, dan batas caching eksplisit.
Contoh permintaan
Contoh berikut menunjukkan checkpoint cache yang disetel di tools bidang messagessystem,, atau permintaan ke Converse API. Anda dapat menempatkan pos pemeriksaan di salah satu lokasi ini untuk permintaan yang diberikan. Misalnya, jika mengirim permintaan ke model Claude 3.5 Sonnet v2, Anda dapat menempatkan dua pos pemeriksaan cachemessages, satu pos pemeriksaan cache disystem, dan satu di. tools Untuk informasi lebih rinci dan contoh penataan dan pengiriman permintaan Converse API, lihatInferensi menggunakan Converse API.
penting
Pos pemeriksaan cache diproses dalam urutan ini: tools → system →messages. Ukuran cache minimum dievaluasi terhadap token kumulatif di ketiga bagian gabungan, bukan setiap bagian secara individual. Karena bagian dirantai, mengubah konten di bagian sebelumnya membatalkan cache untuk bagian selanjutnya (misalnya, memodifikasi mem tools batalkan dan cache). system messages Untuk tingkat hit cache terbaik, tempatkan konten stabil (tools,system) sebelum konten variabel (messages), dan tempatkan pos pemeriksaan cache setelah konten stabil.
Tentukan nilai ttl yang diinginkan seperti di bawah ini, ketika nilai ttl tidak ditentukan perilaku default cache 5 menit berlaku.
"cachePoint" : { "type": "default", "ttl" : "5m | 1h" }
Respons model dari Converse API mencakup tiga bidang baru yang khusus untuk prompt caching. cacheWriteInputTokensNilai cacheReadInputTokens dan memberi tahu Anda berapa banyak token yang dibaca dari cache dan berapa banyak token yang ditulis ke cache karena permintaan Anda sebelumnya. cacheDetailsNilai memberi tahu Anda ttl yang digunakan untuk jumlah token yang ditulis ke cache. Ini adalah nilai yang dikenakan biaya oleh Amazon Bedrock, dengan tarif yang lebih rendah daripada biaya inferensi model penuh.
penting
Ketika prompt caching diaktifkan, inputTokens bidang hanya mewakili token input non-cache (token yang tidak dibaca dari atau ditulis ke cache). Untuk menghitung total token input yang dikirim dalam permintaan, gunakan rumus berikut:
total input tokens = inputTokens + cacheReadInputTokens + cacheWriteInputTokens
Prompt caching diaktifkan secara default saat Anda memanggil InvokeModel API. Anda dapat mengatur pos pemeriksaan cache di setiap titik di badan permintaan Anda, mirip dengan contoh sebelumnya untuk Converse API.
Untuk informasi selengkapnya tentang mengirim InvokeModel permintaan, lihatKirim satu prompt dengan InvokeModel.
Untuk model OpenAI, Anda menggunakan Responses API — tersedia pada titik akhir bedrock-runtime dan bedrock-mantle titik akhir — dengan parameter caching prompt khusus untuk pembuatan model. Untuk GPT-5.6 model, Anda mengontrol caching dengan breakpoint eksplisit. Untuk GPT-5.5 dan sebelumnya, caching bersifat otomatis.
GPT-5.6 contoh dengan breakpoint cache eksplisit
Contoh berikut menunjukkan permintaan Responses API untuk openai.gpt-5.6-sol menggunakan breakpoint cache eksplisit. Instruksi sistem di-cache dan digunakan kembali di seluruh permintaan berikutnya.
{ "model": "openai.gpt-5.6-sol", "prompt_cache_key": "my-app:system-prompt-v1", "prompt_cache_options": { "mode": "explicit" }, "input": [ { "type": "message", "role": "developer", "content": [ { "type": "input_text", "text": "You are a technical support agent. Use the company knowledge base to answer questions. Follow these guidelines: 1. Always cite the relevant documentation section. 2. If unsure, escalate to a human agent. 3. Be concise but thorough...", "prompt_cache_breakpoint": { "mode": "explicit" } } ] }, { "type": "message", "role": "user", "content": [ { "type": "input_text", "text": "How do I configure SSO for my organization?" } ] } ] }
GPT-5.5 contoh dengan caching otomatis
Untuk GPT-5.5 dan model sebelumnya, caching prompt bersifat otomatis. Tidak diperlukan breakpoint atau kunci cache — pastikan awalan prompt Anda melebihi 1.024 token.
{ "model": "openai.gpt-5.5", "input": [ { "type": "message", "role": "developer", "content": [ { "type": "input_text", "text": "You are a technical support agent. Use the company knowledge base to answer questions..." } ] }, { "type": "message", "role": "user", "content": [ { "type": "input_text", "text": "How do I configure SSO for my organization?" } ] } ] }
Respons
Respons mencakup metrik penggunaan cache dalam usage objek:
{ "id": "resp_abc123", "output": [...], "usage": { "input_tokens": 2048, "output_tokens": 256, "total_tokens": 2304, "input_tokens_details": { "cached_tokens": 1920, "cache_write_tokens": 0 } } }
Dalam tanggapan ini, 1.920 token disajikan dari cache dan tidak ada token baru yang ditulis, menunjukkan hit cache penuh dengan penghematan biaya maksimum.
Di taman bermain obrolan di konsol Amazon Bedrock, Anda dapat mengaktifkan opsi caching prompt, dan Amazon Bedrock secara otomatis membuat pos pemeriksaan cache untuk Anda.
Ikuti instruksi di Hasilkan tanggapan di konsol menggunakan taman bermain untuk memulai dengan meminta di taman bermain Amazon Bedrock. Untuk model yang didukung, cache prompt dihidupkan secara otomatis di taman bermain. Namun, jika tidak, lakukan hal berikut untuk mengaktifkan cache prompt:
-
Buka menu Konfigurasi.
-
Aktifkan sakelar Prompt caching.
-
Jalankan petunjuk Anda.
Setelah masukan gabungan dan respons model Anda mencapai jumlah token minimum yang diperlukan untuk pos pemeriksaan (yang bervariasi menurut model), Amazon Bedrock secara otomatis membuat pos pemeriksaan cache pertama untuk Anda. Saat Anda terus mengobrol, Amazon Bedrock dapat membuat pos pemeriksaan tambahan, hingga jumlah maksimum pos pemeriksaan yang diizinkan untuk model. Minimum dievaluasi terhadap jumlah token kumulatif sebelum setiap pos pemeriksaan, bukan jumlah token yang ditambahkan sejak pos pemeriksaan sebelumnya. Anda dapat melihat pos pemeriksaan cache kapan saja dengan memilih Lihat pos pemeriksaan cache di samping sakelar Prompt caching, seperti yang ditunjukkan pada tangkapan layar berikut.
Anda dapat melihat berapa banyak token yang dibaca dan ditulis ke cache karena setiap interaksi dengan model dengan melihat pop-up metrik Caching (
) di respons taman bermain.
Jika Anda mematikan sakelar caching prompt saat berada di tengah percakapan, Anda dapat melanjutkan mengobrol dengan model.