Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Menambahkan sumber data dan memulai konsumsi
Setelah membuat basis pengetahuan Anda, tambahkan sumber data yang berisi konten multimodal Anda dan mulai pekerjaan penyerapan untuk memproses dan mengindeks konten.
Perilaku penghapusan sumber data
Saat Anda menghapus sumber data dengan kebijakan penghapusan disetel ke RETAIN, konten yang dicerna tetap berada di database vektor dan akan terus digunakan untuk pengambilan. Konten hanya dihapus jika Anda secara eksplisit menyinkronkan basis pengetahuan setelah menghapus sumber data. Sumber data dengan kebijakan DELETE default akan secara otomatis menghapus konten dari database vektor dan penyimpanan tambahan selama penghapusan. Ini memastikan bahwa basis pengetahuan Anda terus berfungsi bahkan jika file sumber dimodifikasi atau dihapus. Namun, sumber data yang dihapus dengan kebijakan RETAIN mungkin masih berkontribusi pada hasil penelusuran.
Tambahkan sumber data
Tambahkan sumber data yang berisi konten multimodal Anda ke basis pengetahuan Anda.
Untuk sumber data BDA: Hanya sumber data yang dibuat setelah peluncuran audio/video dukungan yang akan memproses file audio dan video. Sumber data BDA yang ada yang dibuat sebelum peluncuran fitur ini akan terus melewatkan file audio dan video. Untuk mengaktifkan audio/video pemrosesan untuk basis pengetahuan yang ada, buat sumber data baru.
- Console
-
Untuk menambahkan sumber data dari konsol
-
Dari halaman detail basis pengetahuan Anda, pilih Tambahkan sumber data.
-
Pilih Amazon S3 sebagai jenis sumber data Anda.
-
Berikan nama dan deskripsi untuk sumber data Anda.
-
Konfigurasikan lokasi Amazon S3 yang berisi file multimodal Anda dengan menyediakan URI bucket dan awalan inklusi apa pun.
-
Di bawah Penguraian dan pemotongan konten, konfigurasikan metode parsing dan chunking Anda:
Model penyematan teks membatasi pengambilan ke konten teks saja. Namun, Anda dapat mengaktifkan pengambilan multimodal melalui teks dengan memilih Otomasi Amazon Bedrock Data (untuk audio, video, dan gambar) atau Model Dasar sebagai parser (untuk gambar).
Pilih dari tiga strategi penguraian:
-
Pengurai default Bedrock: Direkom endasikan untuk penguraian teks saja. Parser ini mengabaikan konten multimodal dan biasanya digunakan dengan model penyematan multimodal.
-
Bedrock Data Automation sebagai parser: Mem ungkinkan penguraian dan penyimpanan konten multimodal sebagai teks, mendukung file PDF, gambar, audio, dan video.
-
Model dasar sebagai parser: Men yediakan penguraian lanjutan untuk gambar dan dokumen terstruktur, mendukung PDF, gambar, tabel, dan dokumen yang kaya secara visual.
-
Pilih Tambahkan sumber data untuk membuat sumber data.
- CLI
-
Untuk menambahkan sumber data menggunakan AWS CLI
-
Buat sumber data untuk konten multimodal Anda. Kirim CreateDataSource permintaan:
aws bedrock-agent create-data-source \
--knowledge-base-id <knowledge-base-id> \
--cli-input-json file://ds-multimodal.json
Untuk Nova Multimodal Embeddings (tidak diperlukan konfigurasi parsing khusus), gunakan konten ini: ds-multimodal.json
{
"dataSourceConfiguration": {
"type": "S3",
"s3Configuration": {
"bucketArn": "arn:aws:s3:::<data-source-bucket>",
"inclusionPrefixes": ["<folder-path>"]
}
},
"name": "multimodal_data_source",
"description": "Data source with multimodal content",
"dataDeletionPolicy": "RETAIN"
}
Untuk pendekatan penguraian BDA, gunakan konfigurasi ini:
{
"dataSourceConfiguration": {
"type": "S3",
"s3Configuration": {
"bucketArn": "arn:aws:s3:::<data-source-bucket>",
"inclusionPrefixes": ["<folder-path>"]
}
},
"name": "multimodal_data_source_bda",
"description": "Data source with BDA multimodal parsing",
"dataDeletionPolicy": "RETAIN",
"vectorIngestionConfiguration": {
"parsingConfiguration": {
"bedrockDataAutomationConfiguration": {
"parsingModality": "MULTIMODAL"
}
}
}
}
Mulai pekerjaan konsumsi
Setelah menambahkan sumber data Anda, mulailah pekerjaan penyerapan untuk memproses dan mengindeks konten multimodal Anda.
- Console
-
Untuk memulai konsumsi dari konsol
-
Dari halaman detail sumber data Anda, pilih Sin kronisasi.
-
Pantau status sinkronisasi pada halaman sumber data. Penelanan mungkin memakan waktu beberapa menit tergantung pada ukuran dan jumlah file multimodal Anda.
-
Setelah sinkronisasi selesai dengan sukses, konten multimodal Anda siap untuk kueri.
- CLI
-
Untuk memulai konsumsi menggunakan AWS CLI
-
Mulai pekerjaan konsumsi. Kirim StartIngestionJob permintaan:
aws bedrock-agent start-ingestion-job \
--knowledge-base-id <knowledge-base-id> \
--data-source-id <data-source-id>
Ganti placeholder dengan:
-
Pantau status pekerjaan konsumsi menggunakan GetIngestionJob.
Menyinkronkan ulang setelah penghapusan sumber data
Jika Anda menghapus sumber data dan ingin menghapus kontennya dari basis pengetahuan, Anda harus secara eksplisit menyinkronkan ulang basis pengetahuan:
Untuk menghapus konten sumber data yang dihapus
-
Hapus sumber data menggunakan konsol atau DeleteDataSource API.
-
Mulai pekerjaan penyerapan baru pada sumber data yang tersisa untuk memperbarui database vektor dan menghapus konten dari sumber data yang dihapus.
-
Pastikan kueri tidak lagi mengembalikan hasil dari sumber data yang dihapus.
Tanpa sinkronisasi ulang, konten dari sumber data yang dihapus akan terus muncul di hasil penelusuran meskipun sumber data tidak ada lagi.