Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.
Web Crawler de
El rastreador web se conecta a las URL que especifique para usarlas en su base de conocimientos gestionada y las rastrea. El rastreador web recorre las páginas HTML empezando por las URL iniciales y sigue los enlaces secundarios de acuerdo con el alcance y los límites del rastreo. También puedes proporcionar las URL del mapa del sitio como puntos de partida. El Web Crawler respeta el archivo robots.txt de acuerdo con la RFC 9309.
importante
Cuando selecciones sitios web para rastrearlos, debes cumplir la Política de uso aceptable de Amazon
nota
El rastreador web no admite el control de acceso a nivel de documento (ACL). Cualquier usuario que tenga acceso a la base de conocimientos puede acceder a todo el contenido indexado. Si necesita un filtrado de ACL, utilice un conector que lo admita (por ejemplo, Amazon S3 o OneDrive). SharePoint
Características admitidas
-
Rastrea varias URL de inicio y URL de mapa del sitio
-
Profundidad de rastreo, límite de velocidad y límite de enlaces por URL configurables
-
Control del alcance del rastreo: mismo host y ruta, solo host o host y subdominios
-
Filtros de patrones de URL (expresiones regulares de inclusión y exclusión)
-
Rastrea los archivos adjuntos enlazados desde páginas web (PDF, documentos, etc.)
-
Autenticación para sitios protegidos: básica, basada en formularios o SAML
-
El contenido incremental se sincroniza para el contenido agregado, actualizado y eliminado
Métodos de autenticación
El Web Crawler admite cuatro métodos de autenticación. Elija el método que coincida con la forma en que el sitio de destino autentica a los usuarios. Para sitios públicos sin inicio de sesión, utilice. NO_AUTH
| Método | Cómo se autentica | Cuándo se debe usar |
|---|---|---|
Sin autenticación () NO_AUTH |
El rastreador envía solicitudes sin credenciales. | Sitios web públicos que no requieren inicio de sesión. |
Autenticación básica () BASIC_AUTH |
El rastreador envía un Authorization: Basic encabezado HTTP con un nombre de usuario y una contraseña de su secreto. |
Sitios protegidos mediante la autenticación básica HTTP (el cuadro de diálogo de nombre de usuario y contraseña similar al de un navegador). |
Autenticación de formularios () FORM |
El rastreador inicia sesión enviando un formulario HTML. Usted proporciona la URL de inicio de sesión, las credenciales y las expresiones XPath que localizan los campos del formulario. | Sitios que utilizan un formulario HTML para iniciar sesión. |
Autenticación SAML () SAML |
El rastreador inicia sesión a través del formulario de inicio de sesión de un proveedor de identidad SAML. Usted proporciona la URL de inicio de sesión del IdP, las credenciales y las expresiones XPath que ubican los campos del formulario. | Sitios que utilizan el inicio de sesión SAML-based único. |
Requisitos previos
Para el sitio web que quieres rastrear, asegúrate de:
-
Ten permiso para rastrear el sitio web y su contenido.
-
Confirma
robots.txtque el sitio no desautoriza las URL que quieres rastrear. El Web Crawler desactiva de forma predeterminada la opción si no se encuentra un archivo.robots.txt -
Si el sitio requiere iniciar sesión, identifique el método de autenticación (básico, de formulario o SAML). Para el formulario y el SAML, busque las expresiones XPath para el campo de nombre de usuario, el campo de contraseña y el botón de envío en la página de inicio de sesión. Para buscar un XPath, abra el menú contextual (botón derecho) del elemento del formulario en su navegador, seleccione Inspeccionar y, a continuación, copie el XPath de las herramientas del desarrollador.
En tu AWS cuenta, asegúrate de:
-
Si tu sitio requiere autenticación, guarda tus credenciales en un AWS Secrets Manager secreto y anota su nombre de recurso de Amazon (ARN). Para ver los pares clave-valor exactos, consulte. Credenciales de autenticación
-
Incluye los permisos necesarios para conectarte a tu fuente de datos en tu role/permissions política AWS Identity and Access Management (IAM) para tu base de conocimientos. Para obtener información sobre los permisos necesarios, consultePermisos de acceso a los orígenes de datos.
Cómo configurar una fuente de datos de Web Crawler
La configuración de una fuente de datos de Web Crawler implica los siguientes pasos:
-
(Si su sitio requiere iniciar sesión) Prepare las credenciales. Guarde las credenciales de su método de autenticación en un AWS Secrets Manager secreto. Consulte Credenciales de autenticación.
-
Conecta la fuente de datos. Cree la fuente de datos de Web Crawler en la base de conocimientos mediante la API Consola de administración de AWS o. Consulte Cree la fuente de datos.
Cree la fuente de datos
Parámetros de conector
La configuración de la fuente de datos usa los siguientes parámetros de conector. Para usar el rastreador web, especifique WEB el tipo de conector. connectorParameters Para ver los campos que se connectorParameters agrupan (como deletionProtectionConfiguration ymediaExtractionConfiguration), consulteConexión de un origen de datos.
| Campo | Obligatorio | Description (Descripción) |
|---|---|---|
seedUrls |
Condicional | Lista de URL iniciales desde las que empezar a rastrear. Máximo de 10. Obligatoria a menos que la proporciones. siteMapUrls |
siteMapUrls |
Condicional | Lista de URL del mapa del sitio. Máximo de 3. Obligatorio a menos que lo proporcionesseedUrls. |
authType |
Sí | El tipo de autenticación: NO_AUTHBASIC_AUTH,FORM, oSAML. Consulte Métodos de autenticación. |
secretArn |
Condicional | El ARN del AWS Secrets Manager secreto que contiene sus credenciales. Obligatorio cuando no authType NO_AUTH lo es. |
| Campo | Obligatorio | Description (Descripción) |
|---|---|---|
crawlDepth |
No | Profundidad máxima de rastreo. Rango de 0 a 10. 0rastrea solo las URL especificadas; los valores más altos siguen los enlaces que se encuentran más adentro del sitio. El valor predeterminado es 2. |
maxLinksPerUrl |
No | Número máximo de enlaces a seguir por URL. Rango de 1 a 1000. El valor predeterminado es 100. |
maxCrawledUrlsPerMinute |
No | Número máximo de URL rastreadas por minuto (límite de velocidad). Rango de 1 a 300. |
implicitWaitInSeconds |
No | Tiempo de espera, expresado en segundos, después de que una página esté lista antes de que el rastreador la lea. Aumente este valor para las páginas con JavaScript contenido dinámico que se cargan después de la plantilla principal. |
syncScope |
No | El alcance de los enlaces a seguir. Uno de PATH_SPECIFIC (el mismo host y la misma ruta URL inicial que la URL de origen), DOMAINS_ONLY (el mismo host que la URL de origen, cualquier ruta) o SUB_DOMAINS (el mismo dominio principal, incluidos los subdominios). Si se omite, el rastreador solo rastreará el mismo host y la misma ruta URL inicial que la URL raíz. |
crawlAttachments |
No | Si se deben rastrear los archivos y adjuntos enlazados desde páginas web (como archivos PDF y otros documentos). |
| Campo | Obligatorio | Description (Descripción) |
|---|---|---|
inclusionPatterns |
No | Lista de expresiones regulares. Solo se rastrean e indexan las URL que coinciden con al menos un patrón. |
exclusionPatterns |
No | Lista de expresiones regulares. Las URL que coinciden con algún patrón no se rastrean ni se indexan. |
maxFileSizeInMegaBytes |
No | Tamaño máximo, en megabytes, de cualquier archivo que ingiera el rastreador. Proporcione como cadena numérica (por ejemplo,"500"). El valor predeterminado es "500". |
Credenciales de autenticación
Si tu sitio web requiere autenticación, guarda tus credenciales en un AWS Secrets Manager secreto. El formato secreto depende del tipo de autenticación que elija.
Autenticación básica (BASIC_AUTH)
{ "userName": "your-username", "password": "your-password", "authentication": "BASIC_AUTH" }
Autenticación de formularios (FORM)
Para la autenticación basada en formularios, proporcione expresiones XPath que identifiquen el campo del nombre de usuario, el campo de la contraseña y el botón de envío en la página de inicio de sesión.
{ "authentication": "FORM", "loginPageUrl": "https://example.com/login", "userName": "your-username", "password": "your-password", "userNameFieldXpath": "//input[@name='username']", "passwordFieldXpath": "//input[@name='password']", "userNameButtonXpath": "//button[@type='submit']", "passwordButtonXpath": "//button[@type='submit']" }
Autenticación SAML () SAML
Para la autenticación SAML, proporcione la URL de la página de inicio de sesión del proveedor de identidad SAML y las expresiones XPath para los campos del formulario.
{ "authentication": "SAML", "loginPageUrl": "https://your-idp.example.com/login", "userName": "your-username", "password": "your-password", "userNameFieldXpath": "//input[@name='username']", "passwordFieldXpath": "//input[@name='password']", "userNameButtonXpath": "//button[@type='submit']", "passwordButtonXpath": "//button[@type='submit']" }
nota
Para buscar un XPath en su navegador, abra el menú contextual (haga clic con el botón derecho) del elemento del formulario en la página de inicio de sesión y seleccione Inspeccionar. En las herramientas para desarrolladores, abra el menú contextual (haga clic con el botón derecho) del HTML resaltado y, a continuación, seleccione Copiar y, a continuación, Copiar XPath.
Resolución de problemas
| Síntoma | Causa probable | Fix |
|---|---|---|
| La sincronización se completa correctamente, pero solo se indexa la URL inicial. | Los enlaces de navegación del sitio se conectan mediante controladores de JavaScript eventos (menús dinámicos, de clic y de desplazamiento) en lugar de mediante elementos estándar<a href="...">. El rastreador procesa JavaScript pero no simula las interacciones de los usuarios, por lo que no puede descubrir esos enlaces. |
Proporciona URL de inicio adicionales para las páginas que quieres rastrear o proporciona una URL de mapa del sitio que muestre todas las URL que se van a rastrear. Si el contenido se puede exportar como archivos, considera la posibilidad de utilizar el conector Amazon S3 en su lugar. |
| La sincronización no devuelve ningún contenido o muestra menos páginas de las esperadas. | El robots.txt archivo del sitio no permite las URL que quieres rastrear o las páginas tienen una noindex metaetiqueta. |
Actualiza robots.txt para el anfitrión para que permita que se rastreen las rutas que quieres o elimina la noindex metaetiqueta de las páginas que quieres indexar. No bloquees la página robots.txt si también quieres que se detecten las metaetiquetas, ya que el rastreador debe acceder a la página para leer las metaetiquetas. |
| La autenticación falla (HTTP 401 o 403, bucle de redireccionamiento de inicio de sesión o tiempo de espera de la sesión). | Las credenciales son incorrectas o han caducado, o las expresiones XPath no coinciden con los elementos de la página de inicio de sesión. | Compruebe las credenciales de su secreto. Para FORM realizar SAML la autenticación, valide cada XPath en las herramientas de desarrollo de su navegador y verifique. loginPageUrl |
| La sincronización falla debido a la limitación de velocidad (HTTP 429) o al contenido incompleto. | El rastreador busca páginas más rápido de lo que permite el sitio. | Reduzca maxCrawledUrlsPerMinute o aumente en el implicitWaitInSeconds caso de los sitios con contenido dinámico que se carga cuando la página está lista. |
| Faltan páginas porque son más grandes de lo esperado. | La página o el archivo adjunto superan el límitemaxFileSizeInMegaBytes. |
Aumente maxFileSizeInMegaBytes o acepte que los archivos que superen el límite no se ingieran. |