View a markdown version of this page

Creación de una base de conocimiento - Amazon Bedrock

Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.

Creación de una base de conocimiento

Cuando crea una base de conocimientos gestionada, Amazon Bedrock AgentCore administra la infraestructura de almacenamiento, indexación y recuperación por usted. De forma predeterminada, se utiliza un modelo de incrustación administrado por servicios y no es necesario seleccionar ni configurar ningún modelo. En su lugar, si lo prefiere, puede proporcionar su propio modelo de incrustación de Bedrock. Si lo desea, también puede proporcionar una clave KMS para el cifrado del almacén vectorial gestionado.

Tras crear la base de conocimientos, conéctela a una fuente de datos e inicie la ingestión. Para obtener más información sobre cómo conectar una fuente de datos, consulte Conectar una fuente de datos. Para sincronizar una fuente de datos, usa la StartIngestionJob API. Para obtener más información, consulte Sincronización de los datos con la base de conocimientos de Amazon Bedrock.

Para obtener información sobre cómo crear una base de conocimientos gestionada, elija la pestaña correspondiente al método que prefiera:

Console
Para crear una base de conocimientos gestionada
  1. Inicie sesión Consola de administración de AWS y navegue hasta Amazon Bedrock AgentCore > Built-in herramientas > Base de conocimientos.

  2. Seleccione Crear base de conocimientos gestionada.

  3. (Opcional) Amplíe la sección de detalles de las configuraciones adicionales de la base de conocimientos para configurar lo siguiente:

    • Añada una descripción.

    • Elija un tipo de modelo de incrustación:

      • Administrado (predeterminado): se usa un modelo de incrustación administrado por servicios. No es necesario seleccionar ni configurar ningún modelo.

      • Personalizado: seleccione un modelo de incrustación de Bedrock. Elija el modelo para abrir el selector de modelos, que muestra los proveedores (Amazon, Cohere) y los modelos disponibles.

    • Configure los permisos de IAM: elija Crear y usar un nuevo rol de servicio (recomendado) o seleccione un rol existente.

    • Configure el AWS KMS cifrado para el almacén vectorial AWS gestionado (clave gestionada de forma predeterminada o seleccione una clave de KMS personalizada).

  4. En Fuente de datos, proporciona un nombre para la fuente de datos.

  5. Selecciona el tipo de fuente de datos en el menú desplegable: Amazon S3, Confluence, Custom, Google Drive o Web SharePoint Crawler. OneDrive

  6. Configure los ajustes de conexión de la fuente de datos para el tipo de fuente de datos seleccionado.

  7. (Opcional) Amplíe el análisis y la fragmentación del contenido para configurar lo siguiente:

    • La estrategia de análisis está configurada como analizador administrado de forma predeterminada.

    • Seleccione una estrategia de fragmentación de texto en el menú desplegable:

      • Fragmentación predeterminada (recomendada): divide el texto en fragmentos de tamaño fijo.

      • Fixed-size fragmentación: divide el texto en el tamaño de ficha aproximado que hayas establecido.

      • Sin fragmentación: para documentos preprocesados o predivididos.

  8. (Opcional) Amplíe las configuraciones avanzadas para configurar la indexación avanzada. En Indexación de contenido, la opción predeterminada indexa el contenido basado en texto de los documentos comunes. Activa la indexación avanzada para otras modalidades:

    • Contenido visual en documentos: procesa archivos de imagen independientes (.png, .jpg, .jpeg, .jpe, .tif, .tiff, .gif, .bmp, .webp, .svg, .jp2, .heic) y elementos visuales incrustados en archivos .pdf, .docx, .ppt, .pptx.

    • Archivos de audio: procesa archivos.mp3, .wav, .m4a, .flac, .ogg.

    • Archivos de vídeo: procesa archivos.mp4, .mov, .m4v.

    Si lo desea, defina un tamaño máximo de archivo (MB) y configure la protección contra la eliminación de documentos.

  9. (Opcional) Configure la entrega de registros para enviar los registros de ingesta de la base de conocimientos a un destino como CloudWatch Logs, Amazon S3 o Firehose.

  10. Elija Crear base de conocimientos.

  11. Espere a que se creen la base de conocimientos y la fuente de datos (de 2 a 5 minutos). Si crea una base de conocimientos gestionada con una clave gestionada por el cliente, la creación puede llevar más tiempo.

API

El siguiente es un ejemplo de cómo crear una base de conocimientos gestionada y configurar la fuente de datos mediante la API con el SDK AWS CLI o un SDK compatible, como Python. Después de llamar CreateKnowledgeBase, llamas CreateDataSource para crear tu fuente de datos con la información de conexión introducida. dataSourceConfiguration

Para obtener información sobre las personalizaciones que puede aplicar a la ingesta mediante la inclusión del campo vectorIngestionConfiguration opcional, consulte Personalización de la ingesta de un origen de datos.

AWS Command Line Interface

Paso 1: Crear la base de conocimientos

Con un modelo de incrustación administrado (predeterminado):

aws bedrock-agent create-knowledge-base \ --name "my-managed-kb" \ --role-arn "arn:aws:iam::123456789012:role/BedrockKBRole" \ --description "My managed knowledge base" \ --knowledge-base-configuration file://kb-config.json kb-config.json { "type": "MANAGED", "managedKnowledgeBaseConfiguration": { "embeddingModelType": "MANAGED" } }

Con un modelo de incrustación personalizado (modelo Bedrock proporcionado por el cliente):

aws bedrock-agent create-knowledge-base \ --name "my-custom-embed-kb" \ --role-arn "arn:aws:iam::123456789012:role/BedrockKBRole" \ --description "My managed knowledge base with custom embedding" \ --knowledge-base-configuration file://kb-config.json kb-config.json { "type": "MANAGED", "managedKnowledgeBaseConfiguration": { "embeddingModelType": "CUSTOM", "embeddingModelArn": "arn:aws:bedrock:us-west-2::foundation-model/amazon.titan-embed-text-v2:0", "embeddingModelConfiguration": { "bedrockEmbeddingModelConfiguration": { "dimensions": 1024 } } } }
nota

Cuando se omiteembeddingModelType, el valor predeterminado es. MANAGED Cuando lo utiliceMANAGED, no debe especificar embeddingModelArn o. embeddingModelConfiguration Cuando se usaCUSTOM, ambos campos son obligatorios.

Paso 2: Crear una fuente de datos

aws bedrock-agent create-data-source \ --name "S3-connector" \ --description "S3 data source connector for Amazon Bedrock to use content in S3" \ --knowledge-base-id "your-knowledge-base-id" \ --data-source-configuration file://bedrock-s3-managed-connector-configuration.json \ --data-deletion-policy "DELETE" \ --vector-ingestion-configuration '{"parsingConfiguration":{"parsingStrategy":"SMART_PARSING"}}' bedrock-s3-managed-connector-configuration.json { "type": "MANAGED_KNOWLEDGE_BASE_CONNECTOR", "managedKnowledgeBaseConnectorConfiguration": { "mediaExtractionConfiguration": { "imageExtractionConfiguration": { "imageExtractionStatus": "ENABLED" } }, "connectorParameters": { "type": "S3", "version": "1", "connectionConfiguration": { "bucketName": "your-test-s3-bucket", "bucketOwnerAccountId": "123456789012" }, "deletionProtectionConfiguration": { "enableDeletionProtection": false } } } }

Opciones de modelo de incrustación

Las bases de conocimiento administradas admiten dos tipos de modelos de incrustación:

  • Incrustación gestionada (predeterminada): un modelo de incrustación gestionado por servicios se utiliza automáticamente. No es necesario seleccionar un modelo, configurar las dimensiones ni gestionar los límites del servicio de Bedrock para la incrustación. El servicio gestiona la selección, el alojamiento y el escalado del modelo de forma transparente.

  • Incrustación personalizada: usted proporciona su propio ARN del modelo de incrustación de Bedrock. Cuando utilice un modelo de incrustación personalizado, debe especificar las dimensiones del modelo (1024) y el tipo de datos de incrustación de float32. Se admiten los siguientes modelos de incrustación de Bedrock:

    • Amazon Titan Text Embeddings V2

    • Cohere Embed English v3

    • Cohere Embed Multilingual v3

    • Cohere Embed v4

    • Incrustaciones multimodales de Amazon Nova

nota

No puede cambiar el tipo de modelo de incrustación después de crear la base de conocimientos. Para cambiar entre la incrustación gestionada y la personalizada, debe crear una nueva base de conocimientos.

importante

Si crea una base de conocimientos con un modelo de incrustación personalizado, el reclasificador administrado no estará disponible para esa base de conocimientos. Para usar el reordenador administrado, cree su base de conocimientos con el modelo de incrustación administrada predeterminado.

Conectores de fuentes de datos compatibles

Las bases de conocimiento administradas admiten los siguientes conectores de fuentes de datos:

  • Amazon S3

  • Confluence

  • Microsoft SharePoint

  • Google Drive

  • Microsoft OneDrive

  • Web Crawler de

  • Conector personalizado

Para obtener información sobre la configuración de los conectores de fuentes de datos, consulte Conectar una fuente de datos.