View a markdown version of this page

Membuat basis pengetahuan terkelola - Amazon Bedrock

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Membuat basis pengetahuan terkelola

Saat Anda membuat basis pengetahuan terkelola, Amazon Bedrock AgentCore mengelola infrastruktur penyimpanan, pengindeksan, dan pengambilan untuk Anda. Secara default, model embedding yang dikelola layanan digunakan dan tidak diperlukan pemilihan model atau konfigurasi. Anda dapat secara opsional menyediakan model penyematan Bedrock Anda sendiri sebagai gantinya. Anda juga dapat secara opsional memberikan kunci KMS untuk enkripsi penyimpanan vektor terkelola.

Setelah Anda membuat basis pengetahuan, hubungkan ke sumber data dan mulai konsumsi. Untuk detail tentang menghubungkan sumber data, lihat Mengh ubungkan sumber data. Untuk menyinkronkan sumber data, gunakan StartIngestionJob API. Lihat perinciannya di Sinkronkan data Anda dengan basis pengetahuan Amazon Bedrock.

Untuk mempelajari cara membuat basis pengetahuan terkelola, pilih tab untuk metode pilihan Anda:

Console
Untuk membuat basis pengetahuan terkelola
  1. Masuk ke Konsol Manajemen AWS dan arahkan ke Amazon Bedrock AgentCore > Built-in tools > Kno wledge Base.

  2. Pilih Buat Basis Pengetahuan Terkelola.

  3. (Opsional) Perluas Konfigur asi tambahan bagian detail Basis Pengetahuan untuk mengonfigurasi berikut ini:

    • Tambahkan deskripsi.

    • Pilih jenis model penyematan:

      • Dikelola (default): Model penyematan yang dikelola layanan digunakan. Tidak diperlukan pemilihan model atau konfigurasi.

      • Kustom: Pilih model penyematan batuan dasar. Pilih model untuk membuka pemilih model, yang menunjukkan penyedia yang tersedia (Amazon, Cohere) dan model.

    • Konfigurasikan izin IAM: pilih Buat dan gunakan peran layanan baru (disarankan) atau pilih peran yang ada.

    • Konfigur AWS KMS asikan enkripsi untuk penyimpanan vektor terkel AWS ola (kunci terkelola secara default, atau pilih kunci KMS khusus).

  4. Di bawah Sumber data, berikan nama sumber data.

  5. Pilih jenis sumber data Anda dari dropdown: Amazon S3, Confluence, Custom, Google Drive,, OneDrive SharePoint, atau Web Crawler.

  6. Konfigurasikan pengaturan koneksi sumber data untuk jenis sumber data yang Anda pilih.

  7. (Opsional) Perluas Peng uraian dan pemotongan konten untuk mengonfigurasi yang berikut:

    • Strategi parsing diatur ke Man aged parser secara default.

    • Pilih strategi pemotongan teks dari dropdown:

      • Pemotongan default (disarankan): Membagi teks menjadi potongan ukuran tetap.

      • Fixed-size chunking: Membagi teks ke dalam perkiraan ukuran token yang Anda tetapkan.

      • Tanpa pemotongan: Untuk dokumen pra-proses atau pra-split.

  8. (Opsional) Perluas Konfigurasi lanjutan untuk mengonfigurasi pengindeksan lanjutan. Di bawah Pengindeksan konten, default mengindeks konten berbasis teks dari dokumen umum. Aktifkan pengindeksan lanjutan untuk modalitas tambahan:

    • Konten visual dalam dokumen: Memproses file gambar mandiri (.png, .jpg, .jpeg, .jpe, .tif, .tiff, .gif, .bmp, .webp, .svg, .jp2, .heic) dan visual tertanam dalam file.pdf, .docx, .ppt, .pptx.

    • File audio: Memproses file.mp3, .wav, .m4a, .flac, .ogg.

    • File video: Memproses file.mp4, .mov, .m4v.

    Secara opsional, atur ukuran file maksimum (MB) dan konfigurasikan perlindungan penghapusan dokumen.

  9. (Opsional) Konfigurasikan pengiriman log untuk mengirim log penyerapan basis pengetahuan ke tujuan seperti CloudWatch Logs, Amazon S3, atau Firehose.

  10. Pilih Buat Basis Pengetahuan.

  11. Tunggu basis pengetahuan dan sumber data dibuat (2-5 menit). Jika Anda membuat basis pengetahuan terkelola dengan kunci yang dikelola pelanggan, pembuatan mungkin memakan waktu lebih lama.

API

Berikut ini adalah contoh membuat basis pengetahuan terkelola dan mengonfigurasi sumber data Anda menggunakan API dengan AWS CLI atau SDK yang didukung, seperti Python. Setelah menelepon CreateKnowledgeBase, Anda menelepon CreateDataSource untuk membuat sumber data dengan informasi koneksi Anda di dalamnyadataSourceConfiguration.

Untuk mempelajari tentang penyesuaian yang dapat Anda terapkan ke konsumsi dengan menyertakan vectorIngestionConfiguration bidang opsional, lihatSesuaikan konsumsi untuk sumber data.

AWS Command Line Interface

Langkah 1: Buat basis pengetahuan

Dengan model embedding terkelola (default):

aws bedrock-agent create-knowledge-base \ --name "my-managed-kb" \ --role-arn "arn:aws:iam::123456789012:role/BedrockKBRole" \ --description "My managed knowledge base" \ --knowledge-base-configuration file://kb-config.json kb-config.json { "type": "MANAGED", "managedKnowledgeBaseConfiguration": { "embeddingModelType": "MANAGED" } }

Dengan model embedding khusus (model Bedrock yang disediakan pelanggan):

aws bedrock-agent create-knowledge-base \ --name "my-custom-embed-kb" \ --role-arn "arn:aws:iam::123456789012:role/BedrockKBRole" \ --description "My managed knowledge base with custom embedding" \ --knowledge-base-configuration file://kb-config.json kb-config.json { "type": "MANAGED", "managedKnowledgeBaseConfiguration": { "embeddingModelType": "CUSTOM", "embeddingModelArn": "arn:aws:bedrock:us-west-2::foundation-model/amazon.titan-embed-text-v2:0", "embeddingModelConfiguration": { "bedrockEmbeddingModelConfiguration": { "dimensions": 1024 } } } }
catatan

Ketika embeddingModelType dihilangkan, defaultnya menjadi. MANAGED Saat menggunakanMANAGED, Anda tidak boleh menentukan embeddingModelArn atauembeddingModelConfiguration. Saat menggunakanCUSTOM, kedua bidang wajib diisi.

Langkah 2: Buat sumber data

aws bedrock-agent create-data-source \ --name "S3-connector" \ --description "S3 data source connector for Amazon Bedrock to use content in S3" \ --knowledge-base-id "your-knowledge-base-id" \ --data-source-configuration file://bedrock-s3-managed-connector-configuration.json \ --data-deletion-policy "DELETE" \ --vector-ingestion-configuration '{"parsingConfiguration":{"parsingStrategy":"SMART_PARSING"}}' bedrock-s3-managed-connector-configuration.json { "type": "MANAGED_KNOWLEDGE_BASE_CONNECTOR", "managedKnowledgeBaseConnectorConfiguration": { "mediaExtractionConfiguration": { "imageExtractionConfiguration": { "imageExtractionStatus": "ENABLED" } }, "connectorParameters": { "type": "S3", "version": "1", "connectionConfiguration": { "bucketName": "your-test-s3-bucket", "bucketOwnerAccountId": "123456789012" }, "deletionProtectionConfiguration": { "enableDeletionProtection": false } } } }

Menanamkan opsi model

Basis pengetahuan terkelola mendukung dua jenis model penyematan:

  • Embedding terkelola (default) — Model penyematan yang dikelola layanan digunakan secara otomatis. Anda tidak perlu memilih model, mengkonfigurasi dimensi, atau mengelola batas layanan Bedrock untuk penyematan. Layanan ini menangani pemilihan model, hosting, dan penskalaan secara transparan.

  • Penyematan khusus - Anda menyediakan model penyematan Bedrock Anda sendiri ARN. Saat menggunakan model penyematan khusus, Anda harus menentukan dimensi model (1024) dan tipe data penyematan float32. Model penyematan Bedrock berikut didukung:

    • Penyematan Teks Amazon Titan V2

    • Cohere Embed Bahasa Inggris v3

    • Cohere Embed Multilingual v3

    • Cohere Embed v4

    • Penyematan Multimodal Amazon Nova

catatan

Anda tidak dapat mengubah jenis model penyematan setelah membuat basis pengetahuan. Untuk beralih antara embedding terkelola dan kustom, Anda harus membuat basis pengetahuan baru.

penting

Jika Anda membuat basis pengetahuan dengan model penyematan khusus, reranker terkelola tidak tersedia untuk basis pengetahuan tersebut. Untuk menggunakan reranker terkelola, buat basis pengetahuan Anda dengan model embedding terkelola default.

Konektor sumber data yang didukung

Basis pengetahuan terkelola mendukung konektor sumber data berikut:

  • Amazon S3

  • Confluence

  • Microsoft SharePoint

  • Google Drive

  • Microsoft OneDrive

  • Perayap Web

  • Konektor kustom

Untuk informasi tentang mengonfigurasi konektor sumber data, lihat Menghubungkan sumber data.