Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.
Crear una base de conocimientos para contenido multimodal
Puede crear bases de conocimiento multimodales mediante la consola o la API. Elija su enfoque en función de sus necesidades de procesamiento multimodal.
importante
El soporte multimodal solo está disponible cuando se crea una base de conocimientos con fuentes de datos no estructuradas. Las fuentes de datos estructurados no admiten el procesamiento de contenido multimodal.
- Console
-
Para crear una base de conocimientos multimodal desde la consola
-
Inicie sesión Consola de administración de AWS con una identidad de IAM que tenga permisos para usar la consola de Amazon Bedrock. A continuación, abra la consola de Amazon Bedrock en. https://console.aws.amazon.com/bedrock
-
En el panel de navegación izquierdo, elija Bases de conocimientos.
-
En la sección Bases de conocimiento, elija Crear y, a continuación, elija Base de conocimientos con almacén vectorial.
-
(Opcional) En Detalles de la base de conocimientos, introduzca el nombre predeterminado y proporcione una descripción de la base de conocimiento.
-
En Permisos de IAM, seleccione un rol de IAM que otorgue permisos a Amazon Bedrock para acceder a otros Servicios de AWS necesarios. Puede hacer que Amazon Bedrock cree el rol de servicio por usted o puede optar por usar su propio rol personalizado. Para obtener información sobre los permisos multimodales, consulte. Permisos para contenido multimodal
-
Elija Amazon S3 como fuente de datos y seleccione Siguiente para configurar la fuente de datos.
nota
Puede añadir hasta 5 fuentes de datos de Amazon S3 durante la creación de la base de conocimientos. Se pueden agregar fuentes de datos adicionales después de crear la base de conocimientos.
-
Proporcione el URI de S3 del bucket que contiene su contenido multimodal y configure un prefijo de inclusión si es necesario. El prefijo de inclusión es una ruta de carpeta que se puede usar para limitar el contenido que se ingiere.
-
En Configuraciones de fragmentación y análisis, elige tu estrategia de análisis:
-
Analizador predeterminado de Bedrock: recomendado para el procesamiento de contenido solo de texto. Este analizador procesa los formatos de texto comunes e ignora los archivos multimodales. Admite documentos de texto, incluidos archivos de Word, Excel, HTML, Markdown, TXT y CSV.
-
Bedrock Data Automation (BDA): convierte el contenido multimodal en representaciones de texto con capacidad de búsqueda. Procesa archivos PDF, imágenes, audio y vídeo para extraer texto, generar descripciones para el contenido visual y crear transcripciones para el contenido de audio y vídeo.
-
Analizador de modelos básicos: proporciona capacidades de análisis avanzadas para estructuras de documentos complejas. Procesa archivos PDF, imágenes, documentos estructurados, tablas y contenido visualmente rico para extraer texto y generar descripciones para elementos visuales.
-
-
Elija Siguiente y seleccione su modelo de incrustación y su enfoque de procesamiento multimodal.
-
Incrustaciones multimodales de Amazon Nova V1.0: elija la incrustación de Amazon Nova V1.0 para realizar búsquedas directas de similitud visual y de audio. Configure la duración de los fragmentos de audio y vídeo (de 1 a 30 segundos, 5 segundos por defecto) para controlar cómo se segmenta el contenido.
nota
Los parámetros de fragmentación de audio y vídeo se configuran en el nivel del modelo de incrustación, no en el nivel de la fuente de datos. Se produce una excepción de validación si proporciona esta configuración para modelos de incrustación no multimodales. Configure la duración de los fragmentos de audio y vídeo (predeterminado: 5 segundos, intervalo: de 1 a 30 segundos) para controlar cómo se segmenta el contenido. Los fragmentos más cortos permiten una recuperación precisa del contenido, mientras que los fragmentos más largos conservan un contexto más semántico.
importante
La versión 1.0 de Amazon Nova Embedding tiene una compatibilidad limitada para buscar contenido de voz en los datos. audio/video Si necesita admitir la voz, utilice Bedrock Data Automation como analizador.
-
Incrustaciones de texto con BDA: elija un modelo de incrustación de texto (como Titan Text Embeddings v2) cuando utilice el procesamiento BDA. Los modelos de incrustación de texto limitan la recuperación a contenido de solo texto, pero puedes habilitar la recuperación multimodal seleccionando Data Automation o Foundation Model como analizadores. Amazon Bedrock
nota
Si utiliza el analizador BDA con Nova Multimodal Embeddings, Amazon Bedrock Knowledge Bases utilizará primero el análisis BDA. En este caso, el modelo de incrustación no generará incrustaciones multimodales nativas para imágenes, audio y vídeo, ya que BDA las convierte en representaciones de texto.
-
-
Si utiliza Nova Multimodal Embeddings, configure el destino de almacenamiento multimodal especificando un bucket de Amazon S3 en el que se almacenarán los archivos procesados para su recuperación. Las bases de conocimiento almacenarán las imágenes analizadas en un único bucket de Amazon S3 con una carpeta creada como .bda para facilitar el acceso.
Recomendación sobre políticas de ciclo de vida
Al utilizar Nova Multimodal Embeddings, Amazon Bedrock almacena los datos transitorios en su destino de almacenamiento multimodal e intenta eliminarlos una vez finalizado el procesamiento. Recomendamos aplicar una política de ciclo de vida en la ruta de datos transitoria para garantizar una limpieza adecuada. Para obtener instrucciones detalladas, consulte Administración de datos transitorios con las políticas de ciclo de vida de Amazon S3.
-
En la sección Base de datos vectorial, elige tu método de almacenamiento vectorial y configura las dimensiones adecuadas en función del modelo de incrustación que hayas seleccionado.
-
Seleccione Siguiente y revise los detalles de la configuración de su base de conocimientos y, a continuación, seleccione Crear base de conocimientos.
-
- CLI
-
Para crear una base de conocimientos multimodal mediante AWS CLI
-
Cree una base de conocimientos con Nova Multimodal Embeddings. Enviar una solicitud:
CreateKnowledgeBaseaws bedrock-agent create-knowledge-base \ --cli-input-json file://kb-nova-mme.jsonContenido de
kb-nova-mme.json(sustituya los valores del marcador de posición por su configuración específica):{ "knowledgeBaseConfiguration": { "vectorKnowledgeBaseConfiguration": { "embeddingModelArn": "arn:aws:bedrock:us-east-1::foundation-model/amazon.nova-2-multimodal-embeddings-v1:0", "supplementalDataStorageConfiguration": { "storageLocations": [ { "type": "S3", "s3Location": { "uri": "s3://<multimodal-storage-bucket>/" } } ] } }, "type": "VECTOR" }, "storageConfiguration": { "opensearchServerlessConfiguration": { "collectionArn": "arn:aws:aoss:us-east-1:<account-id>:collection/<collection-id>", "vectorIndexName": "<index-name>", "fieldMapping": { "vectorField": "<vector-field>", "textField": "<text-field>", "metadataField": "<metadata-field>" } }, "type": "OPENSEARCH_SERVERLESS" }, "name": "<knowledge-base-name>", "description": "Multimodal knowledge base with Nova Multimodal Embeddings" }Reemplace los siguientes marcadores de posición:
-
<multimodal-storage-bucket>- Bucket S3 para almacenar archivos multimodales -
<account-id>- Su ID de AWS cuenta -
<collection-id>- ID de recopilación OpenSearch sin servidor -
<index-name>- Nombre del índice vectorial de su OpenSearch colección (configurado con las dimensiones adecuadas para el modelo de incrustación elegido) -
<vector-field>- Nombre del campo para almacenar incrustaciones -
<text-field>- Nombre de campo para almacenar contenido de texto -
<metadata-field>- Nombre del campo para almacenar metadatos
-
-