View a markdown version of this page

Conexión de un origen de datos - Amazon Bedrock

Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.

Conexión de un origen de datos

Una vez finalizadas las configuraciones de la base de conocimiento, debe conectar un origen de datos compatible a la base de conocimiento.

Las bases de conocimiento administradas por Amazon Bedrock permiten la conexión a fuentes de datos no estructuradas. Seleccione un tema para obtener información sobre cómo conectarse a ese tipo de origen de datos:

nota

En el caso de las bases de conocimiento administradas, la CreateDataSource operación es asincrónica. El estado de la fuente de datos pasa de CREATING a AVAILABLE cuando se completa la operación.

Para obtener información sobre cómo conectarse a un origen de datos mediante la consola de Amazon Bedrock, seleccione el tema que corresponda a su tipo de origen de datos en la parte inferior de esta página:

Para conectarse a una fuente de datos mediante la API de Amazon Bedrock, envíe una CreateDataSource solicitud con un punto final de ejecución de Agents for Amazon Bedrock.

Campos obligatorios:

Campo Description (Descripción)
knowledgeBaseId El ID de la base de conocimientos.
name Un nombre para la fuente de datos.
dataSourceConfiguration Especifique el tipo de fuente de datos en el type campo e incluya la configuración correspondiente. Para obtener más información sobre las configuraciones específicas de los conectores, seleccione el tema correspondiente al conector en los temas que aparecen al final de esta página.

DentrodataSourceConfiguration, debe especificar lo siguiente:

  • type: debe ser MANAGED_KNOWLEDGE_BASE_CONNECTOR.

  • managedKnowledgeBaseConnectorConfiguration— Configuración del conector. Contiene los siguientes campos:

    • connectorParameters(obligatorio): contiene un type campo que especifica el tipo de conector y un version campo obligatorio establecido en1. Los valores de tipo admitidos son S3 ONEDRIVECONFLUENCE,SHAREPOINT,WEB_CRAWLER, yGOOGLE_DRIVE. Los campos restantes connectorParameters varían según el tipo de conector; consulte la página de cada conector de datos para obtener más información.

    • deletionProtectionConfiguration(opcional): una protección contra la eliminación masiva accidental del contenido indexado. Contiene deletionProtectionStatus (ENABLEDoDISABLED) y, si está habilitada, una opción opcional deletionProtectionThreshold (de 0 a 100; el valor predeterminado es 15). El umbral es el porcentaje máximo de documentos que un trabajo de sincronización puede eliminar del índice. Si una sincronización elimina más de este porcentaje, la sincronización omite la fase de eliminación y deja los documentos indexados en su lugar. No es compatible con el conector personalizado.

    • mediaExtractionConfiguration(opcional): configuración para extraer contenido multimedia (imágenes, audio, vídeo) de los archivos fuente de datos. Contiene tres subconfiguraciones que puede habilitar de forma independiente:

      • imageExtractionConfiguration(opcional): procesa, extrae e indexa el contenido de archivos de imagen independientes (.png, .jpg, .jpeg, .jpe, .tif, .tiff, .gif, .bmp, .webp, .svg, .jp2, .heic) y de elementos visuales incrustados en archivos .pdf, .docx, .ppt, .pptx.

      • audioExtractionConfiguration(opcional): procesa, extrae e indexa el contenido de los archivos de audio compatibles (.mp3, .wav, .m4a, .flac, .ogg).

      • videoExtractionConfiguration(opcional): procesa, extrae e indexa el contenido de los archivos de vídeo compatibles (.mp4, .mov, .m4v).

      Para ver la referencia de campo completa, consulte la referencia de la API de Amazon MediaExtractionConfiguration Bedrock.

Campos opcionales:

Campo Description (Descripción)
description Proporcione una descripción de la fuente de datos.
vectorIngestionConfiguration Contiene configuraciones para personalizar el proceso de ingesta. Para obtener más información, consulte Personalización de la ingesta de un origen de datos.
clientToken Para garantizar que la solicitud de la API se complete solo una vez. Para obtener más información, consulte Ensuring idempotency.

El siguiente ejemplo muestra una CreateDataSource solicitud con un conector S3:

{ "knowledgeBaseId": "your-knowledge-base-id", "name": "my-s3-data-source", "description": "S3 data source for my managed knowledge base", "dataSourceConfiguration": { "type": "MANAGED_KNOWLEDGE_BASE_CONNECTOR", "managedKnowledgeBaseConnectorConfiguration": { "mediaExtractionConfiguration": { "imageExtractionConfiguration": { "imageExtractionStatus": "ENABLED" } }, "deletionProtectionConfiguration": { "deletionProtectionStatus": "ENABLED", "deletionProtectionThreshold": 15 }, "connectorParameters": { "type": "S3", "version": "1", "connectionConfiguration": { "bucketName": "my-bucket-name", "bucketOwnerAccountId": "123456789012" }, "filterConfiguration": { "maxFileSizeInMegaBytes": "50" } } } } }

Para obtener más información sobre un conector específico y su configuración, seleccione uno de los temas siguientes.