

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

# Model Penyematan Teks Amazon Titan
<a name="titan-embedding-models"></a>

Model Amazon Titan Embeddings termasuk Amazon Titan Text Embeddings V2 dan model Titan Text Embeddings G1.

**catatan**  
Model penyematan di Amazon Bedrock dibatasi oleh Permintaan Per Menit (RPM), bukan Token Per Menit (TPM). Saat merencanakan kapasitas atau meminta peningkatan kuota untuk model penyematan, gunakan kuota RPM. Untuk informasi selengkapnya, lihat [Kuota untuk Amazon Bedrock](quotas.md).

Penyematan teks mewakili representasi vektor yang bermakna dari teks tidak terstruktur seperti dokumen, paragraf, dan kalimat. Anda memasukkan badan teks dan outputnya adalah vektor (1 x n). Anda dapat menggunakan vektor penyematan untuk berbagai aplikasi.

Model Amazon Titan Text Embedding v2 (`amazon.titan-embed-text-v2:0`) dapat menerima hingga 8.192 token atau 50.000 karakter dan menghasilkan vektor 1.024 dimensi. Model ini dioptimalkan untuk tugas pengambilan teks, tetapi juga dapat digunakan untuk tugas tambahan, seperti kesamaan semantik dan pengelompokan.

Model Amazon Titan Embeddings menghasilkan representasi semantik yang bermakna dari dokumen, paragraf, dan kalimat. Amazon Titan Text Embeddings mengambil sebagai input badan teks dan menghasilkan vektor (1 x n). Amazon Titan Text Embeddings ditawarkan melalui pemanggilan titik akhir yang dioptimalkan latensi untuk menghasilkan vektor pada latensi rendah (disarankan selama langkah pengambilan) serta pekerjaan batch yang dioptimalkan throughput untuk pengindeksan yang lebih cepat. Perhitungan dan pengambilan kesamaan yang sebenarnya dilakukan oleh database vektor Anda, bukan oleh model embedding. Amazon Titan Text Embeddings v2 mendukung dokumen panjang, namun untuk tugas pengambilan, disarankan untuk mengelompokkan dokumen ke dalam segmen logis, seperti paragraf atau bagian.

**catatan**  
Model Amazon Titan Text Embeddings v2 dan model Titan Text Embeddings v1 tidak mendukung parameter inferensi seperti atau. `maxTokenCount` `topP`

**Model Penyematan Teks Amazon Titan V2 **
+ **Model ID ** — `amazon.titan-embed-text-v2:0`
+ **Token teks masukan maksimal ** — 8,192
+ **Maksimal karakter teks masukan ** - 50.000
+ **Bahasa ** - Bahasa Inggris (100\+ bahasa dalam pratinjau)
+ **Ukuran vektor keluaran ** - 1,024 (default), 512, 256
+ **Jenis inferensi ** — On-Demand, Throughput yang Disediakan
+ **Kasus penggunaan yang didukung ** - RAG, pencarian dokumen, rangking ulang, klasifikasi, dll.

**catatan**  
Titan Text Embeddings V2 mengambil input string yang tidak kosong dengan hingga 8.192 token atau 50.000 karakter. Rasio karakter terhadap token dalam bahasa Inggris rata-rata 4,7 karakter per token. Sementara Titan Text Embeddings V1 dan Titan Text Embeddings V2 mampu menampung hingga 8.192 token, disarankan untuk mengelompokkan dokumen ke dalam segmen logis (seperti paragraf atau bagian).

Model Amazon Titan Embedding Text v2 dioptimalkan untuk bahasa Inggris, dengan dukungan multibahasa untuk bahasa-bahasa berikut. Cross-language kueri (seperti menyediakan basis pengetahuan dalam bahasa Korea dan menanyakannya dalam bahasa Jerman) akan mengembalikan hasil yang kurang optimal.
+ Afrikaans
+ bahasa Albania
+ Bahasa Amharik
+ Arab
+ Orang Armenia
+ Orang Assam
+ Orang Azerbaijan
+ Bashkir
+ Basque
+ Belarusia
+ Bengali
+ Orang Bosnia
+ Breton
+ Bulgaria
+ Burma
+ bahasa katala
+ Cebuano
+ Mandarin
+ Korsika
+ orang Kroasia
+ Bahasa Ceko
+ Orang Denmark
+ Dhivehi
+ Bahasa Belanda
+ Bahasa Inggris
+ Esperanto
+ Estonia
+ Faroe
+ orang Finlandia
+ Prancis
+ Galisia
+ Orang Georgia
+ Bahasa Jerman
+ Gujarati
+ Haiti
+ Hausa
+ Ibrani
+ bahasa Hindi
+ Bahasa Hungaria
+ Islandia
+ orang Indonesia
+ orang Irlandia
+ Bahasa Italia
+ Bahasa Jepang
+ Bahasa Jawa
+ Kannada
+ Kazakh
+ Khmer
+ Kinyarwanda
+ Kirghiz
+ Bahasa Korea
+ bahasa Kurdi
+ Lao
+ bahasa Latin
+ Latvia
+ Lituania
+ Luksemburg
+ Makedonia
+ Malagasi
+ Melayu
+ Malayalam
+ Malta
+ Maori
+ Marathi
+ Yunani modern
+ Mongolia
+ Nepal
+ Norwegia
+ Norwegian Nynorsk
+ Occitan
+ Oriya
+ Panjabi
+ Persia
+ Polandia
+ Bahasa Portugis
+ Pushto
+ Rumania
+ Romanian
+ Bahasa Rusia
+ bahasa Sansekerta
+ Bahasa Gaelik Skotlandia
+ Serbia
+ Sindhi
+ Sinhala
+ Orang Slovakia
+ Bahasa Slovenia
+ Somalia
+ Bahasa Spanyol
+ Bahasa Sunda
+ Bahasa Swahili
+ Bahasa Swedia
+ Bahasa Tagalog
+ Tajik
+ Tamil
+ Tatar
+ Telugu
+ Thai
+ Tibet
+ Turki
+ Turkmen
+ Uighur
+ orang Ukraina
+ Bahasa Urdu
+ Uzbek
+ Vietnam
+ Waray
+ Welsh
+ Frisia Barat
+ Xhosa
+ Yiddish
+ Yoruba
+ Zulu