View a markdown version of this page

Intégration de Web Crawler - Amazon Quick

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Intégration de Web Crawler

 S’applique à : édition Enterprise 

Grâce à l'intégration de Web Crawler dans Amazon Quick, vous pouvez créer des bases de connaissances à partir du contenu d'un site Web en explorant et en indexant les pages Web. Cette intégration prend en charge les fonctionnalités d'ingestion de données avec différentes options d'authentification.

Fonctionnalités du Web Crawler

Vous pouvez poser des questions sur le contenu stocké sur les sites Web et les pages Web. Par exemple, vous pouvez effectuer des recherches sur des sites de documentation, des bases de connaissances ou des informations spécifiques sur plusieurs pages Web.

Grâce à cette intégration, vous pouvez accéder au contenu Web et le comprendre quel que soit son emplacement ou son type. Vous obtenez également des informations contextuelles telles que les dates de publication, l'historique des modifications et la propriété des pages pour une découverte plus efficace des informations.

Note

L'intégration de Web Crawler prend uniquement en charge l'ingestion de données. Il ne fournit pas de fonctionnalités d'action pour gérer des sites Web ou des services Web.

Conditions préalables

Avant de configurer l'intégration de Web Crawler, assurez-vous de disposer des éléments suivants :

  • URL de sites Web à explorer et à indexer.

  • Vous avez besoin d'un compte Amazon Quick avec Enterprise Edition.

  • Un site Web qui n'est pas protégé par un pare-feu et qui ne nécessite pas de plug-in de navigateur spécial pour se connecter.

Préparer l'accès au site Web et l'authentification

Avant de configurer l'intégration dans Amazon Quick, préparez les informations d'accès à votre site Web. L'intégration de Web Crawler prend en charge différentes méthodes d'authentification :

Aucune authentification

À utiliser pour explorer des sites Web qui ne nécessitent pas d'authentification.

Authentification de base

Authentification de base HTTP standard pour les sites Web sécurisés. Lorsque vous visitez un site protégé, votre navigateur affiche une boîte de dialogue qui vous demande vos informations d'identification.

Informations d'identification requises :

  • URL de la page de connexion  : URL de la page de connexion

  • Nom d'utilisateur  : nom d'utilisateur d'authentification de base

  • Mot de passe  : mot de passe d'authentification de base

Authentification par formulaire

Pour les sites Web qui utilisent des pages de connexion basées sur des formulaires HTML. Vous spécifiez des expressions XPath pour identifier les champs de formulaire sur la page de connexion.

XPath (XML Path Language) est un langage de requête permettant de naviguer dans les éléments d'un document HTML ou XML. Pour trouver un XPath pour un élément de page Web, cliquez avec le bouton droit sur l'élément dans votre navigateur et choisissez Inspecter. Dans les outils de développement, cliquez avec le bouton droit sur le code HTML surligné, choisissez Copier, puis choisissez Copier XPath.

Informations requises :

  • URL de la page de connexion  : URL du formulaire de connexion (par exemple,https://example.com/login)

  • Nom d'utilisateur - Nom d'utilisateur de connexion

  • Mot de passe - Mot de passe de connexion

  • Champ de nom d'utilisateur XPath - Champ de saisie XPath vers le nom d'utilisateur (par exemple,) //input[@id='username']

  • (Facultatif) Bouton du nom d'utilisateur XPath — Champ du bouton XPath vers le nom d'utilisateur (par exemple,) //input[@id='username_button']

  • Champ de mot de passe XPath - XPath vers le champ de saisie du mot de passe (par exemple,) //input[@id='password']

  • Bouton de mot de passe XPath - Bouton XPath vers le mot de passe (par exemple,) //button[@type='password']

Authentification SAML

Pour les sites Web qui utilisent l'authentification SAML-based unique (SSO).

L'authentification SAML (Security Assertion Markup Language) est une norme d'identité fédérée qui permet le SSO. Vous vous authentifiez via un fournisseur d'identité centralisé (tel que Microsoft Azure AD ouOkta) au lieu de saisir les informations d'identification directement dans chaque application. Le fournisseur d'identité renvoie un jeton sécurisé à l'application pour autoriser l'accès.

Informations requises :

  • URL de la page de connexion  : URL de la page de connexion SAML

  • Nom d'utilisateur  : nom d'utilisateur SAML

  • Mot de passe  : mot de passe SAML

  • Champ de nom d'utilisateur XPath - Champ de saisie XPath vers le nom d'utilisateur (par exemple,) //input[@id='username']

  • (Facultatif) Bouton du nom d'utilisateur XPath — Champ du bouton XPath vers le nom d'utilisateur (par exemple,) //input[@id='username_button']

  • Champ de mot de passe XPath - XPath vers le champ de saisie du mot de passe (par exemple,) //input[@id='password']

  • Bouton de mot de passe XPath - Bouton XPath vers le mot de passe (par exemple,) //button[@type='password']

Exemples de configuration XPath

Utilisez ces exemples XPath pour configurer l'authentification par formulaire et SAML :

Username field examples: //input[@id='username'] //input[@name='user'] //input[@class='username-field'] Password field examples: //input[@id='password'] //input[@name='pass'] //input[@type='password'] Submit button examples: //button[@type='submit'] //input[@type='submit'] //button[contains(text(), 'Login')]

Configurer l'intégration de Web Crawler

Après avoir défini les conditions d'accès à votre site Web, créez l'intégration du Web Crawler dans Amazon Quick.

  1. Dans la console Amazon Quick, sélectionnez Knowledge.

  2. Trouvez Web Crawler et choisissez l'icône Ajouter (+).

  3. Choisissez Accéder aux données depuis Web Crawler. L'intégration du Web Crawler prend uniquement en charge l'accès aux données. L'exécution d'actions n'est pas disponible pour l'exploration Web.

  4. Configurez les détails de l'intégration et la méthode d'authentification, puis créez des bases de connaissances selon vos besoins.

    1. Choisissez le type d'authentification pour l'intégration de votre robot d'exploration Web.

    2. Entrez les informations requises en fonction de la méthode d'authentification que vous avez choisie.

    3. (Facultatif) Choisissez une connexion VPC pour explorer les sites hébergés sur votre réseau privé. La connexion VPC doit être configurée dans les paramètres d'administration avant de pouvoir la sélectionner ici. Pour de plus amples informations, veuillez consulter Configuration d'un VPC à utiliser avec Amazon Quick.

      Note

      Vous ne pouvez pas modifier la connexion VPC une fois l'intégration créée. Pour utiliser une autre connexion VPC, créez une nouvelle intégration.

    4. Choisissez Créer et continuer.

    5. Entrez le nom et la description de votre base de connaissances.

    6. Ajoutez les URL de contenu que vous souhaitez analyser.

    7. Choisissez Créer.

Une fois que vous avez choisi Créer, la synchronisation des données démarre automatiquement.

Configurer le crawling

Vous pouvez configurer les sites Web et les pages à explorer et la manière de filtrer le contenu.

Configuration des URL et des sources de contenu

Configurez les sites Web et les pages à explorer :

URL directes

Spécifiez les URL individuelles à explorer :

https://example.com/docs https://example.com/blog https://example.com/support

Limite : maximum de 10 URL par jeu de données

Filtres de contenu et paramètres d'exploration

Paramètres de la portée du crawl

Pour afficher ces paramètres, vous devez d'abord configurer une base de connaissances, puis examiner l'option des paramètres avancés.

Profondeur du crawl
  • Plage : 0-10 (par défaut : 1)

  • 0 = analyse uniquement les URL spécifiées

  • 1 = inclure les pages liées à un niveau de profondeur

  • Des valeurs plus élevées suivent des liens plus profonds dans le site

Nombre maximum de liens par page
  • Par défaut : 100

  • Maximum : 1 000.

  • Contrôle le nombre de liens à suivre depuis chaque page

Durée d’Attente
  • Valeur par défaut : 1

  • Durée (en secondes) pendant laquelle le robot d'exploration Web attend chaque page une fois que celle-ci est prête. Augmentez cette valeur pour les pages dont JavaScript le contenu dynamique se charge après le modèle principal.

Gérez les bases de connaissances

Après avoir configuré l'intégration de votre Web Crawler, vous pouvez créer et gérer des bases de connaissances à partir du contenu de votre site Web exploré.

Modifier les bases de connaissances existantes

Vous pouvez modifier vos bases de connaissances Web Crawler existantes :

  1. Dans la console Amazon Quick, sélectionnez Bases de connaissances.

  2. Choisissez votre base de connaissances Web Crawler dans la liste.

  3. Cliquez sur l'icône à trois points sous Actions, puis choisissez Modifier la base de connaissances.

  4. Mettez à jour vos paramètres de configuration si nécessaire et choisissez Enregistrer.

Analyse des pièces jointes et des fichiers

Contrôlez si le système traite les fichiers et les pièces jointes liés à des pages Web :

  • Activer l'analyse des pièces jointes — Choisissez cette option pour analyser et indexer les fichiers et les pièces jointes présents sur les pages Web, tels que les PDF, les documents et les fichiers multimédia.

Comportement d'exploration et configuration de synchronisation

Votre intégration au Web Crawler suit les pratiques d'exploration suivantes :

  • Modèle de synchronisation incrémentielle : la première synchronisation effectue une analyse complète. Les synchronisations suivantes ne capturent que les modifications.

  • Nouvelle tentative automatique : logique de Built-in nouvelle tentative pour les demandes ayant échoué.

  • Gestion des doublons : détection et déduplication automatiques des URL.

  • Identification du robot d'exploration : s'identifie à l'aide de la chaîne de l'agent utilisateur amazon-Quick-on-behalf-of-<UUID> dans les en-têtes de demande. Vous pouvez cibler cet agent utilisateur dans votre robots.txt fichier pour autoriser ou interdire spécifiquement le robot d'exploration. Pour de plus amples informations, veuillez consulter Conformité d'Robots.txt.

Découverte d'un plan

Web Crawler vérifie automatiquement la présence de sitemaps en ajoutant des chemins de plan de site courants à vos URL de départ. Il n'est pas nécessaire de fournir les URL des plans de site séparément. Les chemins suivants sont vérifiés :

sitemap.xml sitemap_index.xml sitemap/sitemap.xml sitemap/sitemap_index.xml sitemaps/sitemap.xml sitemap/index.xml

Par exemple, si votre URL de départ esthttps://example.com/docs, le robot vérifie si https://example.com/docs/sitemap.xmlhttps://example.com/docs/sitemap_index.xml, et ainsi de suite.

Note

Web Crawler ne suit pas les références d'index récursives des sitemaps. Seules les URL répertoriées directement dans un plan de site découvert sont utilisées. Les directives de plan de site dans robots.txt ne sont pas utilisées pour la découverte de plans de site.

Conformité d'Robots.txt

Web Crawler respecte le protocole robots.txt et respecte les directives user-agent et allow or disallow. Utilisez ces directives pour contrôler la manière dont le robot accède à votre site.

Comment fonctionne la vérification du fichier robots.txt
  • Host-level vérification : Web Crawler lit les fichiers robots.txt au niveau de l'hôte (par exemple. com/robots.txt).

  • Prise en charge de plusieurs hôtes : pour les domaines comportant plusieurs hôtes, Web Crawler respecte les règles relatives aux robots pour chaque hôte séparément.

  • Comportement de secours : si Web Crawler ne parvient pas à récupérer le fichier robots.txt en raison d'erreurs de blocage, d'analyse ou de temporisation, il se comporte comme si robots.txt n'existait pas. Dans ce cas, le robot d'exploration explore le site.

Champs robots.txt pris en charge

Web Crawler reconnaît les champs robots.txt suivants (les noms des champs ne distinguent pas les majuscules/minuscules, les valeurs les distinguent) :

user-agent

Identifie le robot d'exploration auquel les règles s'appliquent.

allow

Un chemin d'URL qui peut être exploré.

disallow

Un chemin d'URL qui ne peut pas être exploré.

crawl-delay

Le temps d'attente (en secondes) entre les demandes adressées à votre site Web.

Prise en charge des balises Meta

Web Crawler prend en charge les balises méta des robots au niveau des pages que vous pouvez utiliser pour contrôler la façon dont vos données sont utilisées. Vous pouvez spécifier des paramètres au niveau de la page en incluant une balise META sur les pages HTML ou dans un en-tête HTTP.

balises méta prises en charge
noindex

N'indexez pas la page. Si vous ne spécifiez pas cette règle, la page peut être indexée et peut apparaître dans les expériences.

nofollow

Ne suivez pas les liens de cette page. Si vous ne spécifiez pas cette règle, Web Crawler peut utiliser les liens de la page pour découvrir ces pages liées.

Vous pouvez combiner plusieurs valeurs à l'aide d'une virgule (par exemple, « noindex, nofollow »).

Note

Pour détecter les balises méta, Web Crawler doit accéder à votre page. Ne bloquez pas votre page avec robots.txt, car cela empêche toute nouvelle exploration de la page.

Résolution des problèmes

Utilisez cette section pour résoudre les problèmes courants liés à l'intégration de Web Crawler.

Authentication failures (Échecs d’authentification)

Symptômes :

  • Messages d'erreur « Impossible d'authentifier »

  • 401/403 Réponses HTTP

  • Boucles de redirection de la page de connexion

  • Erreurs de temporisation de session

Étapes de résolution :

  1. Vérifiez que le site est accessible depuis la AWS région où l'instance Amazon Quick est configurée.

  2. Vérifiez que vos informations d'identification sont correctes et qu'elles n'ont pas expiré.

  3. Vérifiez la disponibilité et l'accessibilité des terminaux d'authentification.

  4. Validez les configurations XPath en les testant dans les outils de développement du navigateur.

  5. Consultez les journaux réseau du navigateur pour comprendre le flux d'authentification.

  6. Assurez-vous que l'URL de la page de connexion est correcte et accessible.

  7. Testez l'authentification manuellement à l'aide des mêmes informations d'identification.

Problèmes d'accès et de connectivité

Symptômes :

  • Délais de connexion et erreurs réseau

  • Erreurs réseau inaccessibles

  • Défaillances de résolution DNS

Étapes de résolution :

  1. Vérifiez la connectivité réseau aux sites Web cibles.

  2. Validez l'accessibilité du site :

    • Vérifiez la résolution DNS pour les domaines cibles.

    • Vérifiez SSL/TLS la configuration et les certificats.

    • Testez l'accès à partir de différents réseaux si possible.

Résolution DNS

Le Web Crawler utilise le DNS pour convertir les noms d'hôte des sites Web (par exemplewww.example.com) en adresses IP. Par défaut, il utilise la résolution DNS publique.

Lorsque vous analysez des sites à l'intérieur d'un VPC, vous devrez peut-être configurer un serveur DNS privé afin que le robot puisse résoudre les noms d'hôte des sites internes. Choisissez l'une des options suivantes en fonction de la configuration de votre VPC :

  1. Utiliser le serveur VPC-provided DNS  : si les noms d'hôte DNS et la résolution DNS sont activés sur votre VPC, vous pouvez utiliser le résolveur DNS par défaut (généralement 10.0.0.2, ou plus généralement le CIDR VPC base+2). Pour de plus amples informations, veuillez consulter VPC.

  2. Utiliser un serveur DNS personnalisé  : si votre VPC utilise un résolveur DNS personnalisé, indiquez l'adresse IP du serveur DNS interne de votre organisation. Contactez votre administrateur réseau pour obtenir cette adresse.

Si vous ne configurez pas de serveur DNS, le robot d'exploration ne résout que les noms d'hôtes enregistrés publiquement.

JavaScript-dependent navigation

Symptômes :

  • Seule l'URL de départ est indexée, aucune page supplémentaire n'est découverte

  • L'exploration se termine correctement mais ne renvoie qu'un seul document

Étapes de résolution :

  1. Web Crawler exécute JavaScript et affiche le contenu des pages, mais ne simule pas les interactions des utilisateurs telles que les clics, les défilements ou les actions de survol. Si votre site charge des liens de navigation via l'interaction de l'utilisateur (par exemple, des gestionnaires de clics, un défilement infini ou des menus dynamiques), le robot d'exploration ne peut pas détecter ces liens.

  2. Inspectez votre page dans les outils de développement du navigateur pour vérifier si les liens de navigation utilisent <a href="..."> des éléments standard. Si les liens sont plutôt câblés via des gestionnaires d' JavaScript événements, le robot ne les suivra pas.

  3. Si votre site propose un plan du site, Web Crawler vérifie automatiquement la présence de chemins de plan de site courants sur vos URL de départ. Assurez-vous que votre plan du site est disponible à un emplacement standard (par exemple/sitemap.xml) afin que le robot d'exploration puisse découvrir des URL supplémentaires sans recourir à l'extraction de liens sur la page.

  4. Vous pouvez également fournir toutes les URL des pages cibles directement en tant qu'URL de départ.

  5. Si le contenu peut être exporté sous forme de fichiers HTML, PDF ou texte, pensez plutôt à utiliser le connecteur Amazon S3 comme source de données.

Problèmes d'exploration et de contenu

Symptômes :

  • Contenu manquant ou incomplet

  • Crawls incomplets ou résiliation anticipée

  • Erreurs de limitation du débit (429 réponses)

  • Le contenu n'est pas correctement indexé

Étapes de résolution :

  1. Consultez les restrictions relatives au fichier robots.txt :

    • Vérifiez les restrictions d'exploration dans le fichier robots.txt.

    • Vérifiez que le robot d'exploration est autorisé à accéder aux chemins cibles.

    • Assurez-vous que la conformité du fichier robots.txt ne bloque pas le contenu.

  2. Vérifiez la limitation et l'étranglement du débit :

    • Surveillez les en-têtes de réponse pour les informations relatives aux limites de débit.

    • Implémentez des délais d'exploration appropriés.

  3. Vérifiez les modèles et les filtres d'URL :

    • Testez les modèles regex pour en vérifier la précision.

    • Vérifiez le formatage et la structure des URL.

    • Validez la logique des include/exclude modèles.

  4. Consultez les restrictions relatives au contenu :

    • Vérifiez la présence de balises méta noindex sur les pages.

    • Vérifiez la prise en charge des types de contenu.

    • Assurez-vous que la taille du contenu ne dépasse pas les limites.

  5. Mettez à jour le temps d'attente pour que le contenu se charge sur la page avant que le robot d'exploration ne commence à explorer.

Limitations connues

L'intégration de Web Crawler présente les limites suivantes :

  • Limites d'URL : maximum de 10 URL de départ par jeu de données. Vous ne pouvez pas fournir d'URL de plan de site dans le champ URL de départ.

  • Profondeur de rampe : profondeur de rampe maximale de 10 niveaux

  • Exigences de sécurité : HTTPS requis pour les configurations de proxy Web

Les limites suivantes s'appliquent lors de l'utilisation du Web Crawler avec une connexion VPC :

  • Aucune prise en charge HTTP/3 (QUIC) : n' HTTP/3 est pas prise en charge. La plupart des sites reviendront HTTP/2 automatiquement, mais les sites configurés pour HTTP/3 uniquement ne seront pas accessibles.

  • DNS sur TCP requis : la résolution DNS doit utiliser le protocole TCP. Vérifiez que votre serveur DNS prend en charge le DNS sur TCP avant de configurer l'exploration VPC.

  • Certificats SSL approuvés par le public requis : les sites internes doivent utiliser un certificat d'une autorité de certification reconnue (par exemple, Let's Encrypt ouDigiCert). Les sites utilisant des certificats CA autosignés ou privés ne parviennent pas à se connecter.

  • IPv4 uniquement : seules les adresses IPv4 sont prises en charge. Les sites accessibles exclusivement via IPv6 ne peuvent pas être explorés.