View a markdown version of this page

Web Crawler de - Amazon Bedrock

Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.

Web Crawler de

El rastreador web se conecta a las URL que especifique para usarlas en su base de conocimientos gestionada y las rastrea. El rastreador web recorre las páginas HTML empezando por las URL iniciales y sigue los enlaces secundarios de acuerdo con el alcance y los límites del rastreo. También puedes proporcionar las URL del mapa del sitio como puntos de partida. El Web Crawler respeta el archivo robots.txt de acuerdo con la RFC 9309.

importante

Cuando selecciones sitios web para rastrearlos, debes cumplir la Política de uso aceptable de Amazon y todos los demás términos de Amazon. Usa el rastreador web únicamente para indexar tus propias páginas web o las páginas web para las que tengas autorización para rastrear.

nota

El rastreador web no admite el control de acceso a nivel de documento (ACL). Cualquier usuario que tenga acceso a la base de conocimientos puede acceder a todo el contenido indexado. Si necesita un filtrado de ACL, utilice un conector que lo admita (por ejemplo, Amazon S3 o OneDrive). SharePoint

Características admitidas

  • Rastrea varias URL de inicio y URL de mapa del sitio

  • Profundidad de rastreo, límite de velocidad y límite de enlaces por URL configurables

  • Control del alcance del rastreo: mismo host y ruta, solo host o host y subdominios

  • Filtros de patrones de URL (expresiones regulares de inclusión y exclusión)

  • Rastrea los archivos adjuntos enlazados desde páginas web (PDF, documentos, etc.)

  • Autenticación para sitios protegidos: básica, basada en formularios o SAML

  • El contenido incremental se sincroniza para el contenido agregado, actualizado y eliminado

Métodos de autenticación

El Web Crawler admite cuatro métodos de autenticación. Elija el método que coincida con la forma en que el sitio de destino autentica a los usuarios. Para sitios públicos sin inicio de sesión, utilice. NO_AUTH

Métodos de autenticación de Web Crawler
Método Cómo se autentica Cuándo se debe usar
Sin autenticación () NO_AUTH El rastreador envía solicitudes sin credenciales. Sitios web públicos que no requieren inicio de sesión.
Autenticación básica () BASIC_AUTH El rastreador envía un Authorization: Basic encabezado HTTP con un nombre de usuario y una contraseña de su secreto. Sitios protegidos mediante la autenticación básica HTTP (el cuadro de diálogo de nombre de usuario y contraseña similar al de un navegador).
Autenticación de formularios () FORM El rastreador inicia sesión enviando un formulario HTML. Usted proporciona la URL de inicio de sesión, las credenciales y las expresiones XPath que localizan los campos del formulario. Sitios que utilizan un formulario HTML para iniciar sesión.
Autenticación SAML () SAML El rastreador inicia sesión a través del formulario de inicio de sesión de un proveedor de identidad SAML. Usted proporciona la URL de inicio de sesión del IdP, las credenciales y las expresiones XPath que ubican los campos del formulario. Sitios que utilizan el inicio de sesión SAML-based único.

Requisitos previos

Para el sitio web que quieres rastrear, asegúrate de:

  • Ten permiso para rastrear el sitio web y su contenido.

  • Confirma robots.txt que el sitio no desautoriza las URL que quieres rastrear. El Web Crawler desactiva de forma predeterminada la opción si no se encuentra un archivo. robots.txt

  • Si el sitio requiere iniciar sesión, identifique el método de autenticación (básico, de formulario o SAML). Para el formulario y el SAML, busque las expresiones XPath para el campo de nombre de usuario, el campo de contraseña y el botón de envío en la página de inicio de sesión. Para buscar un XPath, abra el menú contextual (botón derecho) del elemento del formulario en su navegador, seleccione Inspeccionar y, a continuación, copie el XPath de las herramientas del desarrollador.

En tu AWS cuenta, asegúrate de:

  • Si tu sitio requiere autenticación, guarda tus credenciales en un AWS Secrets Manager secreto y anota su nombre de recurso de Amazon (ARN). Para ver los pares clave-valor exactos, consulte. Credenciales de autenticación

  • Incluye los permisos necesarios para conectarte a tu fuente de datos en tu role/permissions política AWS Identity and Access Management (IAM) para tu base de conocimientos. Para obtener información sobre los permisos necesarios, consultePermisos de acceso a los orígenes de datos.

Cómo configurar una fuente de datos de Web Crawler

La configuración de una fuente de datos de Web Crawler implica los siguientes pasos:

  1. (Si su sitio requiere iniciar sesión) Prepare las credenciales. Guarde las credenciales de su método de autenticación en un AWS Secrets Manager secreto. Consulte Credenciales de autenticación.

  2. Conecta la fuente de datos. Cree la fuente de datos de Web Crawler en la base de conocimientos mediante la API Consola de administración de AWS o. Consulte Cree la fuente de datos.

Cree la fuente de datos

Console
Para conectar el Web Crawler a su base de conocimientos gestionada
  1. En Fuente de datos, proporcione un nombre para la fuente de datos.

  2. Selecciona Web Crawler en el menú desplegable de la fuente de datos.

  3. En Fuente, selecciona URL de origen (hasta 10 URL de punto de partida) o mapas del sitio de origen (hasta 3 URL de mapa del sitio).

  4. Introduce tus URL en el área de texto Añadir URL, una por línea.

  5. En Autenticación, selecciona Sin autenticación, Autenticación básica , Autenticación de formulario o Autenticación SAML. Para cualquier método que no sea Sin autenticación, selecciona o crea un AWS Secrets Manager secreto para almacenar tus credenciales.

  6. (Opcional) Amplíe el alcance de la sincronización para establecer la profundidad de rastreo (de 0 a 10), el máximo de enlaces por URL (de 1 a 1000), el máximo de URL rastreadas por minuto (de 1 a 300) y el alcance del rastreo: predeterminado (el mismo host y la misma ruta URL inicial que la URL inicial), Solo host (mismo host, cualquier ruta) o subdominios (el mismo dominio principal, incluidos los subdominios).

  7. (Opcional) Amplíe los patrones de filtro de URL para agregar expresiones regulares que incluyan o excluyan URL específicas.

API

Para crear una fuente de datos de Web Crawler, envíe una CreateDataSource solicitud a un punto final en tiempo de construcción de Agents for Amazon Bedrock. El siguiente AWS Command Line Interface ejemplo crea una fuente de datos que rastrea un sitio público sin autenticación. Para obtener una descripción de cada campo, consulte la referencia a los parámetros del conector que aparece a continuación.

aws bedrock-agent create-data-source \ --name "WebCrawler-connector" \ --knowledge-base-id "your-knowledge-base-id" \ --data-source-configuration file://webcrawler-managed-connector.json

El webcrawler-managed-connector.json archivo contiene lo siguiente:

{ "type": "MANAGED_KNOWLEDGE_BASE_CONNECTOR", "managedKnowledgeBaseConnectorConfiguration": { "connectorParameters": { "type": "WEB", "version": "1", "connectionConfiguration": { "seedUrls": [ "https://docs.example.com" ], "authType": "NO_AUTH" }, "crawlConfiguration": { "crawlDepth": 3, "maxLinksPerUrl": 100, "maxCrawledUrlsPerMinute": 50, "syncScope": "SUB_DOMAINS", "crawlAttachments": true }, "filterConfiguration": { "exclusionPatterns": [ "https://docs.example.com/private/.*" ] } } } }

Para un sitio autenticado, authType configúrelo en BASIC_AUTH FORMSAML, o y agregue un secretArn en. connectionConfiguration

En el caso de las bases de conocimiento administradas, CreateDataSource es asincrónico: el estado de la fuente de datos pasa de CREATING a AVAILABLE cuando se completa la operación.

Parámetros de conector

La configuración de la fuente de datos usa los siguientes parámetros de conector. Para usar el rastreador web, especifique WEB el tipo de conector. connectorParameters Para ver los campos que se connectorParameters agrupan (como deletionProtectionConfiguration ymediaExtractionConfiguration), consulteConexión de un origen de datos.

connectionConfiguration
Campo Obligatorio Description (Descripción)
seedUrls Condicional Lista de URL iniciales desde las que empezar a rastrear. Máximo de 10. Obligatoria a menos que la proporciones. siteMapUrls
siteMapUrls Condicional Lista de URL del mapa del sitio. Máximo de 3. Obligatorio a menos que lo proporcionesseedUrls.
authType El tipo de autenticación: NO_AUTHBASIC_AUTH,FORM, oSAML. Consulte Métodos de autenticación.
secretArn Condicional El ARN del AWS Secrets Manager secreto que contiene sus credenciales. Obligatorio cuando no authType NO_AUTH lo es.
Configuración de rastreo (opcional)
Campo Obligatorio Description (Descripción)
crawlDepth No Profundidad máxima de rastreo. Rango de 0 a 10. 0rastrea solo las URL especificadas; los valores más altos siguen los enlaces que se encuentran más adentro del sitio. El valor predeterminado es 2.
maxLinksPerUrl No Número máximo de enlaces a seguir por URL. Rango de 1 a 1000. El valor predeterminado es 100.
maxCrawledUrlsPerMinute No Número máximo de URL rastreadas por minuto (límite de velocidad). Rango de 1 a 300.
implicitWaitInSeconds No Tiempo de espera, expresado en segundos, después de que una página esté lista antes de que el rastreador la lea. Aumente este valor para las páginas con JavaScript contenido dinámico que se cargan después de la plantilla principal.
syncScope No El alcance de los enlaces a seguir. Uno de PATH_SPECIFIC (el mismo host y la misma ruta URL inicial que la URL de origen), DOMAINS_ONLY (el mismo host que la URL de origen, cualquier ruta) o SUB_DOMAINS (el mismo dominio principal, incluidos los subdominios). Si se omite, el rastreador solo rastreará el mismo host y la misma ruta URL inicial que la URL raíz.
crawlAttachments No Si se deben rastrear los archivos y adjuntos enlazados desde páginas web (como archivos PDF y otros documentos).
Configuración del filtro (opcional)
Campo Obligatorio Description (Descripción)
inclusionPatterns No Lista de expresiones regulares. Solo se rastrean e indexan las URL que coinciden con al menos un patrón.
exclusionPatterns No Lista de expresiones regulares. Las URL que coinciden con algún patrón no se rastrean ni se indexan.
maxFileSizeInMegaBytes No Tamaño máximo, en megabytes, de cualquier archivo que ingiera el rastreador. Proporcione como cadena numérica (por ejemplo,"500"). El valor predeterminado es "500".

Credenciales de autenticación

Si tu sitio web requiere autenticación, guarda tus credenciales en un AWS Secrets Manager secreto. El formato secreto depende del tipo de autenticación que elija.

Autenticación básica (BASIC_AUTH)

{ "userName": "your-username", "password": "your-password", "authentication": "BASIC_AUTH" }

Autenticación de formularios (FORM)

Para la autenticación basada en formularios, proporcione expresiones XPath que identifiquen el campo del nombre de usuario, el campo de la contraseña y el botón de envío en la página de inicio de sesión.

{ "authentication": "FORM", "loginPageUrl": "https://example.com/login", "userName": "your-username", "password": "your-password", "userNameFieldXpath": "//input[@name='username']", "passwordFieldXpath": "//input[@name='password']", "userNameButtonXpath": "//button[@type='submit']", "passwordButtonXpath": "//button[@type='submit']" }

Autenticación SAML () SAML

Para la autenticación SAML, proporcione la URL de la página de inicio de sesión del proveedor de identidad SAML y las expresiones XPath para los campos del formulario.

{ "authentication": "SAML", "loginPageUrl": "https://your-idp.example.com/login", "userName": "your-username", "password": "your-password", "userNameFieldXpath": "//input[@name='username']", "passwordFieldXpath": "//input[@name='password']", "userNameButtonXpath": "//button[@type='submit']", "passwordButtonXpath": "//button[@type='submit']" }
nota

Para buscar un XPath en su navegador, abra el menú contextual (haga clic con el botón derecho) del elemento del formulario en la página de inicio de sesión y seleccione Inspeccionar. En las herramientas para desarrolladores, abra el menú contextual (haga clic con el botón derecho) del HTML resaltado y, a continuación, seleccione Copiar y, a continuación, Copiar XPath.

Resolución de problemas

Problemas, causas y soluciones comunes de Web Crawler
Síntoma Causa probable Fix
La sincronización se completa correctamente, pero solo se indexa la URL inicial. Los enlaces de navegación del sitio se conectan mediante controladores de JavaScript eventos (menús dinámicos, de clic y de desplazamiento) en lugar de mediante elementos estándar<a href="...">. El rastreador procesa JavaScript pero no simula las interacciones de los usuarios, por lo que no puede descubrir esos enlaces. Proporciona URL de inicio adicionales para las páginas que quieres rastrear o proporciona una URL de mapa del sitio que muestre todas las URL que se van a rastrear. Si el contenido se puede exportar como archivos, considera la posibilidad de utilizar el conector Amazon S3 en su lugar.
La sincronización no devuelve ningún contenido o muestra menos páginas de las esperadas. El robots.txt archivo del sitio no permite las URL que quieres rastrear o las páginas tienen una noindex metaetiqueta. Actualiza robots.txt para el anfitrión para que permita que se rastreen las rutas que quieres o elimina la noindex metaetiqueta de las páginas que quieres indexar. No bloquees la página robots.txt si también quieres que se detecten las metaetiquetas, ya que el rastreador debe acceder a la página para leer las metaetiquetas.
La autenticación falla (HTTP 401 o 403, bucle de redireccionamiento de inicio de sesión o tiempo de espera de la sesión). Las credenciales son incorrectas o han caducado, o las expresiones XPath no coinciden con los elementos de la página de inicio de sesión. Compruebe las credenciales de su secreto. Para FORM realizar SAML la autenticación, valide cada XPath en las herramientas de desarrollo de su navegador y verifique. loginPageUrl
La sincronización falla debido a la limitación de velocidad (HTTP 429) o al contenido incompleto. El rastreador busca páginas más rápido de lo que permite el sitio. Reduzca maxCrawledUrlsPerMinute o aumente en el implicitWaitInSeconds caso de los sitios con contenido dinámico que se carga cuando la página está lista.
Faltan páginas porque son más grandes de lo esperado. La página o el archivo adjunto superan el límitemaxFileSizeInMegaBytes. Aumente maxFileSizeInMegaBytes o acepte que los archivos que superen el límite no se ingieran.