Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.
Integración con Web Crawler
| Se aplica a: Enterprise Edition |
Con la integración de Web Crawler en Amazon Quick, puede crear bases de conocimiento a partir del contenido de los sitios web rastreando e indexando las páginas web. Esta integración admite las capacidades de ingesta de datos con diferentes opciones de autenticación.
Capacidades de Web Crawler
Puede hacer preguntas sobre el contenido almacenado en sitios web y páginas web. Por ejemplo, puede buscar sitios de documentación, bases de conocimiento o información específica en varias páginas web.
Con esta integración, puede acceder al contenido web y comprenderlo independientemente de su ubicación o tipo. También obtiene detalles contextuales, como las fechas de publicación, el historial de modificaciones y la propiedad de la página, para descubrir la información de manera más eficiente.
nota
La integración con Web Crawler solo admite la ingesta de datos. No proporciona funciones de acción para administrar sitios web o servicios web.
Requisitos previos
Antes de configurar la integración de Web Crawler, asegúrese de disponer de lo siguiente:
-
URL de sitios web para rastrear e indexar.
-
Necesitas una cuenta de Amazon Quick con Enterprise Edition.
-
Un sitio web que no esté protegido por un firewall y que no requiera complementos de navegador especiales para conectarse.
Prepare el acceso al sitio web y la autenticación
Antes de configurar la integración en Amazon Quick, prepare las credenciales de acceso al sitio web. La integración de Web Crawler admite diferentes métodos de autenticación:
- Sin autenticación
-
Se usa para rastrear sitios web que no requieren autenticación.
- Autenticación básica
-
Autenticación básica HTTP estándar para sitios web seguros. Cuando visita un sitio protegido, el navegador muestra un cuadro de diálogo en el que se solicitan sus credenciales.
Credenciales requeridas:
-
URL de la página de inicio de sesión: la URL de la página de inicio de sesión
Nombre de usuario: nombre de usuario de autenticación básico
Contraseña: contraseña de autenticación básica
-
- Autenticación de formulario
-
Para sitios web que utilizan páginas de inicio de sesión basadas en formularios HTML. Las expresiones XPath se especifican para identificar los campos del formulario en la página de inicio de sesión.
XPath (lenguaje de rutas XML) es un lenguaje de consulta para navegar por los elementos de un documento HTML o XML. Para buscar un XPath para un elemento de una página web, haga clic con el botón derecho en el elemento en el navegador y seleccione Inspeccionar. En las herramientas para desarrolladores, haga clic con el botón derecho en el código HTML resaltado, seleccione Copiar y, a continuación, elija Copiar XPath.
Información requerida:
URL de la página de inicio de sesión: URL del formulario de inicio de sesión (por ejemplo,
https://example.com/login)Nombre de usuario: nombre de usuario de acceso
Contraseña: contraseña de inicio de sesión
Campo de nombre de usuario XPath: campo de entrada de XPath para nombre de usuario (por ejemplo,)
//input[@id='username']-
(Opcional) Botón de nombre de usuario XPath: campo de XPath para el botón de nombre de usuario (por ejemplo,)
//input[@id='username_button'] Campo de contraseña XPath: campo de entrada de XPath para contraseña (por ejemplo,)
//input[@id='password']Botón de contraseña XPath: botón XPath para acceder a la contraseña (por ejemplo,)
//button[@type='password']
- Autenticación SAML
-
Para sitios web que utilizan la autenticación de inicio de sesión SAML-based único (SSO).
La autenticación SAML (lenguaje de marcado para aserciones de seguridad) es un estándar de identidad federada que permite el inicio de sesión único. La autenticación se realiza mediante un proveedor de identidad centralizado (como Microsoft Azure AD oOkta) en lugar de introducir las credenciales directamente en cada aplicación. El proveedor de identidad devuelve un token seguro a la aplicación para conceder el acceso.
Información requerida:
URL de la página de inicio de sesión: URL de la página de inicio de sesión de SAML
Nombre de usuario: nombre de usuario de SAML
Contraseña: contraseña SAML
-
Campo de nombre de usuario XPath: campo de entrada de XPath para nombre de usuario (por ejemplo,)
//input[@id='username'] -
(Opcional) Botón de nombre de usuario XPath: campo de XPath para el botón de nombre de usuario (por ejemplo,)
//input[@id='username_button'] -
Campo de contraseña XPath: campo de entrada de XPath para contraseña (por ejemplo,)
//input[@id='password'] -
Botón de contraseña XPath: botón XPath para acceder a la contraseña (por ejemplo,)
//button[@type='password']
Ejemplos de configuración de XPath
Utilice estos ejemplos de XPath para configurar la autenticación SAML y de formularios:
Username field examples: //input[@id='username'] //input[@name='user'] //input[@class='username-field'] Password field examples: //input[@id='password'] //input[@name='pass'] //input[@type='password'] Submit button examples: //button[@type='submit'] //input[@type='submit'] //button[contains(text(), 'Login')]
Configure la integración de Web Crawler
Tras preparar los requisitos de acceso al sitio web, cree la integración de Web Crawler en Amazon Quick.
-
En la consola Amazon Quick, elija Knowledge.
-
Busca Web Crawler y elige el icono Añadir (+).
-
Selecciona Acceder a los datos desde Web Crawler. La integración con Web Crawler solo admite el acceso a los datos; la ejecución de acciones no está disponible para el rastreo web.
-
Configure los detalles de la integración y el método de autenticación y, a continuación, cree bases de conocimiento según sea necesario.
-
Elija el tipo de autenticación para la integración de su rastreador web.
-
Introduce los detalles necesarios según el método de autenticación que hayas elegido.
-
(Opcional) Elige una conexión de VPC para rastrear los sitios alojados en tu red privada. La conexión de VPC debe configurarse en los ajustes de administración para poder elegirla aquí. Para obtener más información, consulte Configuración de una VPC para usarla con Amazon Quick.
nota
No puedes cambiar la conexión de la VPC una vez creada la integración. Para usar una conexión de VPC diferente, crea una nueva integración.
-
Seleccione Crear y continuar.
-
Introduzca el nombre y la descripción de su base de conocimientos.
-
Añade las URL de contenido que quieras rastrear.
-
Seleccione Crear.
-
Tras seleccionar Crear, la sincronización de datos se iniciará automáticamente.
Configure el rastreo
Puede configurar qué sitios web y páginas rastrear y cómo filtrar el contenido.
Configure las URL y las fuentes de contenido
Configure los sitios web y las páginas que desea rastrear:
URL directas
Especifique las URL individuales que desea rastrear:
https://example.com/docs https://example.com/blog https://example.com/support
Límite: máximo de 10 URL por conjunto de datos
Filtros de contenido y ajustes de rastreo
Configuración del alcance de rastreo
Para ver esta configuración, primero debe configurar una base de conocimientos y, a continuación, examinar la opción de configuración avanzada.
- Profundidad de rastreo
-
Rango: 0-10 (predeterminado: 1)
0 = rastrear solo las URL especificadas
1 = incluir páginas enlazadas a un nivel de profundidad
Los valores más altos siguen a los enlaces más profundos del sitio
- Número máximo de enlaces por página
-
Predeterminado: 100
Máximo: 1000
Controla el número de enlaces que se deben seguir desde cada página
- Tiempo de espera
-
Valor predeterminado: 1
-
El tiempo (en segundos) que el rastreador web espera por cada página después de que la página esté lista. Aumente este valor para las páginas con JavaScript contenido dinámico que se cargan después de la plantilla principal.
Gestione las bases de conocimiento
Tras configurar la integración del rastreador web, puede crear y administrar bases de conocimiento a partir del contenido de su sitio web rastreado.
Edite las bases de conocimiento existentes
Puede modificar las bases de conocimiento de Web Crawler existentes:
-
En la consola Amazon Quick, seleccione Knowledge bases.
-
Elige tu base de conocimientos sobre Web Crawler de la lista.
-
Selecciona el icono de tres puntos en Acciones y, a continuación, selecciona Editar base de conocimientos.
-
Actualice los ajustes de configuración según sea necesario y seleccione Guardar.
Rastreo de archivos y archivos adjuntos
Controle si el sistema procesa los archivos y adjuntos enlazados desde páginas web:
-
Habilitar el rastreo de archivos adjuntos: elija esta opción para rastrear e indexar los archivos y adjuntos que se encuentran en las páginas web, como archivos PDF, documentos y archivos multimedia.
Comportamiento de rastreo y configuración de sincronización
Su integración con Web Crawler sigue estas prácticas de rastreo:
Modelo de sincronización incremental: la primera sincronización realiza un rastreo completo. Las sincronizaciones posteriores solo capturan los cambios.
Reintento automático: lógica de Built-in reintento para las solicitudes fallidas.
Gestión de duplicados: detección automática y deduplicación de URL.
Identificación del rastreador: se identifica con la cadena
amazon-Quick-on-behalf-of-<UUID>de usuario-agente en los encabezados de las solicitudes. Puedes seleccionar este agente de usuario en turobots.txtarchivo para permitir o no permitir específicamente el rastreador. Para obtener más información, consulte Conformidad de Robots.txt.
Descubrimiento de un mapa
Web Crawler comprueba automáticamente si hay mapas del sitio añadiendo rutas de mapa del sitio comunes a las URL iniciales. No es necesario que proporciones las URL de los mapas de sitio por separado. Se comprueban las siguientes rutas:
sitemap.xml sitemap_index.xml sitemap/sitemap.xml sitemap/sitemap_index.xml sitemaps/sitemap.xml sitemap/index.xml
Por ejemplo, si la URL inicial eshttps://example.com/docs, el rastreador la comprueba https://example.com/docs/sitemap.xmlhttps://example.com/docs/sitemap_index.xml, y así sucesivamente.
nota
Web Crawler no sigue las referencias recursivas a los índices de mapas del sitio. Solo se utilizan las URL que aparecen directamente en un mapa del sitio descubierto. Las directivas del mapa del sitio robots.txt no se utilizan para descubrir los mapas del sitio.
Conformidad de Robots.txt
Web Crawler respeta el protocolo robots.txt y respeta las directivas de usuario-agente y de permitir o no permitir. Usa estas directivas para controlar el modo en que el rastreador accede a tu sitio.
Cómo funciona la comprobación de robots.txt
Host-level comprobación: Web Crawler lee los archivos robots.txt a nivel de host (por ejemplo, com/robots.txt).
Soporte para varios hosts: en el caso de los dominios con varios hosts, Web Crawler respeta las reglas de los robots para cada host por separado.
Comportamiento alternativo: si Web Crawler no puede recuperar el archivo robots.txt debido a un bloqueo, a errores de análisis o a que se ha agotado el tiempo de espera, se comporta como si robots.txt no existiera. En este caso, el rastreador continúa rastreando el sitio.
Campos de robots.txt compatibles
Web Crawler reconoce estos campos de robots.txt (los nombres de los campos no distinguen entre mayúsculas y minúsculas, y los valores distinguen entre mayúsculas y minúsculas):
user-agentIdentifica a qué rastreador se aplican las reglas.
allowUna ruta URL que se puede rastrear.
disallowUna ruta de URL que no se puede rastrear.
crawl-delayEl tiempo (en segundos) que transcurre entre las solicitudes a tu sitio web.
Soporte para metaetiquetas
Web Crawler admite metaetiquetas de robots a nivel de página que puedes usar para controlar el uso de tus datos. Puedes especificar la configuración a nivel de página incluyendo una metaetiqueta en las páginas HTML o en un encabezado HTTP.
Metaetiquetas compatibles
noindexNo indexe la página. Si no especificas esta regla, es posible que la página esté indexada y sea apta para aparecer en las experiencias.
nofollowNo sigas los enlaces de esta página. Si no especificas esta regla, Web Crawler puede usar los enlaces de la página para descubrir esas páginas enlazadas.
Puede combinar varios valores con una coma (por ejemplo, «noindex, nofollow»).
nota
Para detectar metaetiquetas, Web Crawler debe acceder a tu página. No bloquees la página con el archivo robots.txt, ya que esto evita que se vuelva a rastrear.
Resolución de problemas
Utilice esta sección para resolver problemas comunes relacionados con la integración de Web Crawler.
Errores de autenticación
Síntomas:
Mensajes de error con el mensaje «No se puede autenticar»
401/403 Respuestas HTTP
Bucles de redirección de páginas de inicio
Errores de tiempo de espera de la sesión
Pasos de resolución:
Compruebe que se puede acceder al sitio desde la AWS región en la que está configurada la instancia de Amazon Quick.
Comprueba que tus credenciales son correctas y que no han caducado.
Compruebe la disponibilidad y accesibilidad de los puntos finales de autenticación.
Valide las configuraciones de XPath probándolas en las herramientas para desarrolladores de navegadores.
Revise los registros de red del navegador para comprender el flujo de autenticación.
Asegúrese de que la URL de la página de inicio de sesión sea correcta y accesible.
Pruebe la autenticación manualmente con las mismas credenciales.
Problemas de acceso y conectividad
Síntomas:
Tiempos de espera de conexión y errores de red
Errores inalcanzables en la red
Fallos de resolución de DNS
Pasos de resolución:
-
Verifique la conectividad de la red con los sitios web de destino.
-
Valide la accesibilidad del sitio:
Compruebe la resolución de DNS de los dominios de destino.
Verifique SSL/TLS la configuración y los certificados.
Pruebe el acceso desde diferentes redes si es posible.
Resolución de los DNS
El rastreador web usa el DNS para convertir los nombres de host de los sitios web (por ejemplowww.example.com) en direcciones IP. De forma predeterminada, utiliza la resolución de DNS pública.
Al rastrear sitios dentro de una VPC, es posible que tengas que configurar un servidor DNS privado para que el rastreador pueda resolver los nombres de host de los sitios internos. Elige una de las siguientes opciones en función de la configuración de tu VPC:
-
Use el servidor VPC-provided DNS: si su VPC tiene habilitados tanto los nombres de host como la resolución de DNS, puede usar el solucionador de DNS de la VPC predeterminado (normalmente, la versión 10.0.0.2 o, más generalmente, la base +2 de CIDR de la VPC). Para obtener más información, consulte VPC.
-
Usa un servidor DNS personalizado: si tu VPC usa un solucionador de DNS personalizado, proporciona la dirección IP del servidor DNS interno de tu organización. Ponte en contacto con el administrador de la red para obtener esta dirección.
Si no configuras un servidor DNS, el rastreador solo resuelve los nombres de host registrados públicamente.
JavaScript-dependent navegación
Síntomas:
Solo se indexa la URL inicial, no se descubren páginas adicionales
El rastreo finaliza correctamente, pero solo devuelve un documento
Pasos de resolución:
-
Web Crawler ejecuta JavaScript y renderiza el contenido de la página, pero no simula las interacciones de los usuarios, como los clics, los desplazamientos o las acciones al pasar el ratón por la página. Si su sitio carga enlaces de navegación mediante la interacción del usuario (por ejemplo, controladores de clics, menús dinámicos o de desplazamiento infinito), el rastreador no puede detectar esos enlaces.
-
Inspecciona tu página en las herramientas para desarrolladores de navegadores para comprobar si los enlaces de navegación utilizan elementos estándar
<a href="...">. Si, en cambio, los enlaces se conectan a través de controladores de JavaScript eventos, el rastreador no los seguirá. -
Si tu sitio incluye un mapa del sitio, Web Crawler comprueba automáticamente si hay rutas comunes en tus URL iniciales. Asegúrate de que el mapa del sitio esté disponible en una ubicación estándar (por ejemplo
/sitemap.xml) para que el rastreador pueda descubrir más URL sin tener que extraer los enlaces de la página. -
También puedes proporcionar todas las URL de la página de destino directamente como URL de inicio.
-
Si el contenido se puede exportar como archivos HTML, PDF o de texto, considere la posibilidad de utilizar el conector Amazon S3 como fuente de datos.
Problemas de rastreo y contenido
Síntomas:
Contenido faltante o incompleto
Rastreos incompletos o cancelación anticipada
Errores de limitación de frecuencia (429 respuestas)
El contenido no se indexa correctamente
Pasos de resolución:
-
Revisa las restricciones de robots.txt:
Consulta el archivo robots.txt para ver las restricciones de rastreo.
Compruebe que el rastreador tenga permiso para acceder a las rutas de destino.
Asegúrese de que el cumplimiento de robots.txt no bloquee el contenido.
-
Comprueba la limitación y limitación de velocidad:
Supervise los encabezados de respuesta para obtener información sobre los límites de velocidad.
Implemente los retrasos de rastreo adecuados.
-
Verifique los patrones y filtros de URL:
Compruebe la precisión de los patrones de expresiones regulares.
Compruebe el formato y la estructura de la URL.
Valida la lógica del include/exclude patrón.
-
Revisa las restricciones de contenido:
Comprueba si hay metaetiquetas sin índice en las páginas.
Verifique la compatibilidad de los tipos de contenido.
Asegúrese de que el tamaño del contenido esté dentro de los límites.
-
Actualiza el tiempo de espera para que el contenido se cargue en la página antes de que el rastreador comience a rastrear.
Limitaciones conocidas
La integración de Web Crawler tiene las siguientes limitaciones:
Límites de URL: máximo de 10 URL de inicio por conjunto de datos. No puedes proporcionar las URL del mapa del sitio en el campo URL inicial.
Profundidad de rastreo: profundidad máxima de rastreo de 10 niveles
Requisitos de seguridad: se requiere HTTPS para las configuraciones de proxy web
Cuando se usa el Web Crawler con una conexión de VPC, se aplican las siguientes limitaciones:
Sin soporte HTTP/3 (QUIC): no HTTP/3 se admite. La mayoría de los sitios volverán a funcionar HTTP/2 automáticamente, pero no se podrá acceder a los sitios configurados HTTP/3 únicamente para.
Se requiere DNS a través de TCP: la resolución de DNS debe utilizar TCP. Compruebe que su servidor DNS admite DNS a través de TCP antes de configurar el rastreo de VPC.
Se requieren certificados SSL de confianza pública: los sitios internos deben usar un certificado de una autoridad de certificación conocida (por ejemplo, Let's Encrypt oDigiCert). Los sitios que utilizan certificados de CA privados o autofirmados no se conectan.
Solo IPv4: solo se admiten las direcciones IPv4. Los sitios a los que se puede acceder exclusivamente a través de IPv6 no se pueden rastrear.