View a markdown version of this page

Integración con Web Crawler - Amazon Quick

Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.

Integración con Web Crawler

 Se aplica a: Enterprise Edition 

Con la integración de Web Crawler en Amazon Quick, puede crear bases de conocimiento a partir del contenido de los sitios web rastreando e indexando las páginas web. Esta integración admite las capacidades de ingesta de datos con diferentes opciones de autenticación.

Capacidades de Web Crawler

Puede hacer preguntas sobre el contenido almacenado en sitios web y páginas web. Por ejemplo, puede buscar sitios de documentación, bases de conocimiento o información específica en varias páginas web.

Con esta integración, puede acceder al contenido web y comprenderlo independientemente de su ubicación o tipo. También obtiene detalles contextuales, como las fechas de publicación, el historial de modificaciones y la propiedad de la página, para descubrir la información de manera más eficiente.

nota

La integración con Web Crawler solo admite la ingesta de datos. No proporciona funciones de acción para administrar sitios web o servicios web.

Requisitos previos

Antes de configurar la integración de Web Crawler, asegúrese de disponer de lo siguiente:

  • URL de sitios web para rastrear e indexar.

  • Necesitas una cuenta de Amazon Quick con Enterprise Edition.

  • Un sitio web que no esté protegido por un firewall y que no requiera complementos de navegador especiales para conectarse.

Prepare el acceso al sitio web y la autenticación

Antes de configurar la integración en Amazon Quick, prepare las credenciales de acceso al sitio web. La integración de Web Crawler admite diferentes métodos de autenticación:

Sin autenticación

Se usa para rastrear sitios web que no requieren autenticación.

Autenticación básica

Autenticación básica HTTP estándar para sitios web seguros. Cuando visita un sitio protegido, el navegador muestra un cuadro de diálogo en el que se solicitan sus credenciales.

Credenciales requeridas:

  • URL de la página de inicio de sesión: la URL de la página de inicio de sesión

  • Nombre de usuario: nombre de usuario de autenticación básico

  • Contraseña: contraseña de autenticación básica

Autenticación de formulario

Para sitios web que utilizan páginas de inicio de sesión basadas en formularios HTML. Las expresiones XPath se especifican para identificar los campos del formulario en la página de inicio de sesión.

XPath (lenguaje de rutas XML) es un lenguaje de consulta para navegar por los elementos de un documento HTML o XML. Para buscar un XPath para un elemento de una página web, haga clic con el botón derecho en el elemento en el navegador y seleccione Inspeccionar. En las herramientas para desarrolladores, haga clic con el botón derecho en el código HTML resaltado, seleccione Copiar y, a continuación, elija Copiar XPath.

Información requerida:

  • URL de la página de inicio de sesión: URL del formulario de inicio de sesión (por ejemplo,https://example.com/login)

  • Nombre de usuario: nombre de usuario de acceso

  • Contraseña: contraseña de inicio de sesión

  • Campo de nombre de usuario XPath: campo de entrada de XPath para nombre de usuario (por ejemplo,) //input[@id='username']

  • (Opcional) Botón de nombre de usuario XPath: campo de XPath para el botón de nombre de usuario (por ejemplo,) //input[@id='username_button']

  • Campo de contraseña XPath: campo de entrada de XPath para contraseña (por ejemplo,) //input[@id='password']

  • Botón de contraseña XPath: botón XPath para acceder a la contraseña (por ejemplo,) //button[@type='password']

Autenticación SAML

Para sitios web que utilizan la autenticación de inicio de sesión SAML-based único (SSO).

La autenticación SAML (lenguaje de marcado para aserciones de seguridad) es un estándar de identidad federada que permite el inicio de sesión único. La autenticación se realiza mediante un proveedor de identidad centralizado (como Microsoft Azure AD oOkta) en lugar de introducir las credenciales directamente en cada aplicación. El proveedor de identidad devuelve un token seguro a la aplicación para conceder el acceso.

Información requerida:

  • URL de la página de inicio de sesión: URL de la página de inicio de sesión de SAML

  • Nombre de usuario: nombre de usuario de SAML

  • Contraseña: contraseña SAML

  • Campo de nombre de usuario XPath: campo de entrada de XPath para nombre de usuario (por ejemplo,) //input[@id='username']

  • (Opcional) Botón de nombre de usuario XPath: campo de XPath para el botón de nombre de usuario (por ejemplo,) //input[@id='username_button']

  • Campo de contraseña XPath: campo de entrada de XPath para contraseña (por ejemplo,) //input[@id='password']

  • Botón de contraseña XPath: botón XPath para acceder a la contraseña (por ejemplo,) //button[@type='password']

Ejemplos de configuración de XPath

Utilice estos ejemplos de XPath para configurar la autenticación SAML y de formularios:

Username field examples: //input[@id='username'] //input[@name='user'] //input[@class='username-field'] Password field examples: //input[@id='password'] //input[@name='pass'] //input[@type='password'] Submit button examples: //button[@type='submit'] //input[@type='submit'] //button[contains(text(), 'Login')]

Configure la integración de Web Crawler

Tras preparar los requisitos de acceso al sitio web, cree la integración de Web Crawler en Amazon Quick.

  1. En la consola Amazon Quick, elija Knowledge.

  2. Busca Web Crawler y elige el icono Añadir (+).

  3. Selecciona Acceder a los datos desde Web Crawler. La integración con Web Crawler solo admite el acceso a los datos; la ejecución de acciones no está disponible para el rastreo web.

  4. Configure los detalles de la integración y el método de autenticación y, a continuación, cree bases de conocimiento según sea necesario.

    1. Elija el tipo de autenticación para la integración de su rastreador web.

    2. Introduce los detalles necesarios según el método de autenticación que hayas elegido.

    3. (Opcional) Elige una conexión de VPC para rastrear los sitios alojados en tu red privada. La conexión de VPC debe configurarse en los ajustes de administración para poder elegirla aquí. Para obtener más información, consulte Configuración de una VPC para usarla con Amazon Quick.

      nota

      No puedes cambiar la conexión de la VPC una vez creada la integración. Para usar una conexión de VPC diferente, crea una nueva integración.

    4. Seleccione Crear y continuar.

    5. Introduzca el nombre y la descripción de su base de conocimientos.

    6. Añade las URL de contenido que quieras rastrear.

    7. Seleccione Crear.

Tras seleccionar Crear, la sincronización de datos se iniciará automáticamente.

Configure el rastreo

Puede configurar qué sitios web y páginas rastrear y cómo filtrar el contenido.

Configure las URL y las fuentes de contenido

Configure los sitios web y las páginas que desea rastrear:

URL directas

Especifique las URL individuales que desea rastrear:

https://example.com/docs https://example.com/blog https://example.com/support

Límite: máximo de 10 URL por conjunto de datos

Filtros de contenido y ajustes de rastreo

Configuración del alcance de rastreo

Para ver esta configuración, primero debe configurar una base de conocimientos y, a continuación, examinar la opción de configuración avanzada.

Profundidad de rastreo
  • Rango: 0-10 (predeterminado: 1)

  • 0 = rastrear solo las URL especificadas

  • 1 = incluir páginas enlazadas a un nivel de profundidad

  • Los valores más altos siguen a los enlaces más profundos del sitio

Número máximo de enlaces por página
  • Predeterminado: 100

  • Máximo: 1000

  • Controla el número de enlaces que se deben seguir desde cada página

Tiempo de espera
  • Valor predeterminado: 1

  • El tiempo (en segundos) que el rastreador web espera por cada página después de que la página esté lista. Aumente este valor para las páginas con JavaScript contenido dinámico que se cargan después de la plantilla principal.

Gestione las bases de conocimiento

Tras configurar la integración del rastreador web, puede crear y administrar bases de conocimiento a partir del contenido de su sitio web rastreado.

Edite las bases de conocimiento existentes

Puede modificar las bases de conocimiento de Web Crawler existentes:

  1. En la consola Amazon Quick, seleccione Knowledge bases.

  2. Elige tu base de conocimientos sobre Web Crawler de la lista.

  3. Selecciona el icono de tres puntos en Acciones y, a continuación, selecciona Editar base de conocimientos.

  4. Actualice los ajustes de configuración según sea necesario y seleccione Guardar.

Rastreo de archivos y archivos adjuntos

Controle si el sistema procesa los archivos y adjuntos enlazados desde páginas web:

  • Habilitar el rastreo de archivos adjuntos: elija esta opción para rastrear e indexar los archivos y adjuntos que se encuentran en las páginas web, como archivos PDF, documentos y archivos multimedia.

Comportamiento de rastreo y configuración de sincronización

Su integración con Web Crawler sigue estas prácticas de rastreo:

  • Modelo de sincronización incremental: la primera sincronización realiza un rastreo completo. Las sincronizaciones posteriores solo capturan los cambios.

  • Reintento automático: lógica de Built-in reintento para las solicitudes fallidas.

  • Gestión de duplicados: detección automática y deduplicación de URL.

  • Identificación del rastreador: se identifica con la cadena amazon-Quick-on-behalf-of-<UUID> de usuario-agente en los encabezados de las solicitudes. Puedes seleccionar este agente de usuario en tu robots.txt archivo para permitir o no permitir específicamente el rastreador. Para obtener más información, consulte Conformidad de Robots.txt.

Descubrimiento de un mapa

Web Crawler comprueba automáticamente si hay mapas del sitio añadiendo rutas de mapa del sitio comunes a las URL iniciales. No es necesario que proporciones las URL de los mapas de sitio por separado. Se comprueban las siguientes rutas:

sitemap.xml sitemap_index.xml sitemap/sitemap.xml sitemap/sitemap_index.xml sitemaps/sitemap.xml sitemap/index.xml

Por ejemplo, si la URL inicial eshttps://example.com/docs, el rastreador la comprueba https://example.com/docs/sitemap.xmlhttps://example.com/docs/sitemap_index.xml, y así sucesivamente.

nota

Web Crawler no sigue las referencias recursivas a los índices de mapas del sitio. Solo se utilizan las URL que aparecen directamente en un mapa del sitio descubierto. Las directivas del mapa del sitio robots.txt no se utilizan para descubrir los mapas del sitio.

Conformidad de Robots.txt

Web Crawler respeta el protocolo robots.txt y respeta las directivas de usuario-agente y de permitir o no permitir. Usa estas directivas para controlar el modo en que el rastreador accede a tu sitio.

Cómo funciona la comprobación de robots.txt
  • Host-level comprobación: Web Crawler lee los archivos robots.txt a nivel de host (por ejemplo, com/robots.txt).

  • Soporte para varios hosts: en el caso de los dominios con varios hosts, Web Crawler respeta las reglas de los robots para cada host por separado.

  • Comportamiento alternativo: si Web Crawler no puede recuperar el archivo robots.txt debido a un bloqueo, a errores de análisis o a que se ha agotado el tiempo de espera, se comporta como si robots.txt no existiera. En este caso, el rastreador continúa rastreando el sitio.

Campos de robots.txt compatibles

Web Crawler reconoce estos campos de robots.txt (los nombres de los campos no distinguen entre mayúsculas y minúsculas, y los valores distinguen entre mayúsculas y minúsculas):

user-agent

Identifica a qué rastreador se aplican las reglas.

allow

Una ruta URL que se puede rastrear.

disallow

Una ruta de URL que no se puede rastrear.

crawl-delay

El tiempo (en segundos) que transcurre entre las solicitudes a tu sitio web.

Soporte para metaetiquetas

Web Crawler admite metaetiquetas de robots a nivel de página que puedes usar para controlar el uso de tus datos. Puedes especificar la configuración a nivel de página incluyendo una metaetiqueta en las páginas HTML o en un encabezado HTTP.

Metaetiquetas compatibles
noindex

No indexe la página. Si no especificas esta regla, es posible que la página esté indexada y sea apta para aparecer en las experiencias.

nofollow

No sigas los enlaces de esta página. Si no especificas esta regla, Web Crawler puede usar los enlaces de la página para descubrir esas páginas enlazadas.

Puede combinar varios valores con una coma (por ejemplo, «noindex, nofollow»).

nota

Para detectar metaetiquetas, Web Crawler debe acceder a tu página. No bloquees la página con el archivo robots.txt, ya que esto evita que se vuelva a rastrear.

Resolución de problemas

Utilice esta sección para resolver problemas comunes relacionados con la integración de Web Crawler.

Errores de autenticación

Síntomas:

  • Mensajes de error con el mensaje «No se puede autenticar»

  • 401/403 Respuestas HTTP

  • Bucles de redirección de páginas de inicio

  • Errores de tiempo de espera de la sesión

Pasos de resolución:

  1. Compruebe que se puede acceder al sitio desde la AWS región en la que está configurada la instancia de Amazon Quick.

  2. Comprueba que tus credenciales son correctas y que no han caducado.

  3. Compruebe la disponibilidad y accesibilidad de los puntos finales de autenticación.

  4. Valide las configuraciones de XPath probándolas en las herramientas para desarrolladores de navegadores.

  5. Revise los registros de red del navegador para comprender el flujo de autenticación.

  6. Asegúrese de que la URL de la página de inicio de sesión sea correcta y accesible.

  7. Pruebe la autenticación manualmente con las mismas credenciales.

Problemas de acceso y conectividad

Síntomas:

  • Tiempos de espera de conexión y errores de red

  • Errores inalcanzables en la red

  • Fallos de resolución de DNS

Pasos de resolución:

  1. Verifique la conectividad de la red con los sitios web de destino.

  2. Valide la accesibilidad del sitio:

    • Compruebe la resolución de DNS de los dominios de destino.

    • Verifique SSL/TLS la configuración y los certificados.

    • Pruebe el acceso desde diferentes redes si es posible.

Resolución de los DNS

El rastreador web usa el DNS para convertir los nombres de host de los sitios web (por ejemplowww.example.com) en direcciones IP. De forma predeterminada, utiliza la resolución de DNS pública.

Al rastrear sitios dentro de una VPC, es posible que tengas que configurar un servidor DNS privado para que el rastreador pueda resolver los nombres de host de los sitios internos. Elige una de las siguientes opciones en función de la configuración de tu VPC:

  1. Use el servidor VPC-provided DNS: si su VPC tiene habilitados tanto los nombres de host como la resolución de DNS, puede usar el solucionador de DNS de la VPC predeterminado (normalmente, la versión 10.0.0.2 o, más generalmente, la base +2 de CIDR de la VPC). Para obtener más información, consulte VPC.

  2. Usa un servidor DNS personalizado: si tu VPC usa un solucionador de DNS personalizado, proporciona la dirección IP del servidor DNS interno de tu organización. Ponte en contacto con el administrador de la red para obtener esta dirección.

Si no configuras un servidor DNS, el rastreador solo resuelve los nombres de host registrados públicamente.

JavaScript-dependent navegación

Síntomas:

  • Solo se indexa la URL inicial, no se descubren páginas adicionales

  • El rastreo finaliza correctamente, pero solo devuelve un documento

Pasos de resolución:

  1. Web Crawler ejecuta JavaScript y renderiza el contenido de la página, pero no simula las interacciones de los usuarios, como los clics, los desplazamientos o las acciones al pasar el ratón por la página. Si su sitio carga enlaces de navegación mediante la interacción del usuario (por ejemplo, controladores de clics, menús dinámicos o de desplazamiento infinito), el rastreador no puede detectar esos enlaces.

  2. Inspecciona tu página en las herramientas para desarrolladores de navegadores para comprobar si los enlaces de navegación utilizan elementos estándar<a href="...">. Si, en cambio, los enlaces se conectan a través de controladores de JavaScript eventos, el rastreador no los seguirá.

  3. Si tu sitio incluye un mapa del sitio, Web Crawler comprueba automáticamente si hay rutas comunes en tus URL iniciales. Asegúrate de que el mapa del sitio esté disponible en una ubicación estándar (por ejemplo/sitemap.xml) para que el rastreador pueda descubrir más URL sin tener que extraer los enlaces de la página.

  4. También puedes proporcionar todas las URL de la página de destino directamente como URL de inicio.

  5. Si el contenido se puede exportar como archivos HTML, PDF o de texto, considere la posibilidad de utilizar el conector Amazon S3 como fuente de datos.

Problemas de rastreo y contenido

Síntomas:

  • Contenido faltante o incompleto

  • Rastreos incompletos o cancelación anticipada

  • Errores de limitación de frecuencia (429 respuestas)

  • El contenido no se indexa correctamente

Pasos de resolución:

  1. Revisa las restricciones de robots.txt:

    • Consulta el archivo robots.txt para ver las restricciones de rastreo.

    • Compruebe que el rastreador tenga permiso para acceder a las rutas de destino.

    • Asegúrese de que el cumplimiento de robots.txt no bloquee el contenido.

  2. Comprueba la limitación y limitación de velocidad:

    • Supervise los encabezados de respuesta para obtener información sobre los límites de velocidad.

    • Implemente los retrasos de rastreo adecuados.

  3. Verifique los patrones y filtros de URL:

    • Compruebe la precisión de los patrones de expresiones regulares.

    • Compruebe el formato y la estructura de la URL.

    • Valida la lógica del include/exclude patrón.

  4. Revisa las restricciones de contenido:

    • Comprueba si hay metaetiquetas sin índice en las páginas.

    • Verifique la compatibilidad de los tipos de contenido.

    • Asegúrese de que el tamaño del contenido esté dentro de los límites.

  5. Actualiza el tiempo de espera para que el contenido se cargue en la página antes de que el rastreador comience a rastrear.

Limitaciones conocidas

La integración de Web Crawler tiene las siguientes limitaciones:

  • Límites de URL: máximo de 10 URL de inicio por conjunto de datos. No puedes proporcionar las URL del mapa del sitio en el campo URL inicial.

  • Profundidad de rastreo: profundidad máxima de rastreo de 10 niveles

  • Requisitos de seguridad: se requiere HTTPS para las configuraciones de proxy web

Cuando se usa el Web Crawler con una conexión de VPC, se aplican las siguientes limitaciones:

  • Sin soporte HTTP/3 (QUIC): no HTTP/3 se admite. La mayoría de los sitios volverán a funcionar HTTP/2 automáticamente, pero no se podrá acceder a los sitios configurados HTTP/3 únicamente para.

  • Se requiere DNS a través de TCP: la resolución de DNS debe utilizar TCP. Compruebe que su servidor DNS admite DNS a través de TCP antes de configurar el rastreo de VPC.

  • Se requieren certificados SSL de confianza pública: los sitios internos deben usar un certificado de una autoridad de certificación conocida (por ejemplo, Let's Encrypt oDigiCert). Los sitios que utilizan certificados de CA privados o autofirmados no se conectan.

  • Solo IPv4: solo se admiten las direcciones IPv4. Los sitios a los que se puede acceder exclusivamente a través de IPv6 no se pueden rastrear.