View a markdown version of this page

Web-Crawler-Integration - Amazon Quick

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Web-Crawler-Integration

 Gilt für: Enterprise Edition 

Mit der Web Crawler-Integration in Amazon Quick können Sie Wissensdatenbanken aus Webseiteninhalten erstellen, indem Sie Webseiten crawlen und indexieren. Diese Integration unterstützt Datenaufnahmefunktionen mit verschiedenen Authentifizierungsoptionen.

Web Crawler-Funktionen

Sie können Fragen zu Inhalten stellen, die auf Websites und Webseiten gespeichert sind. Sie können beispielsweise Dokumentationsseiten, Wissensdatenbanken oder bestimmte Informationen auf mehreren Webseiten durchsuchen.

Mit dieser Integration können Sie unabhängig von Standort oder Typ auf Webinhalte zugreifen und diese verstehen. Außerdem erhalten Sie kontextbezogene Details wie Veröffentlichungsdaten, Änderungsverlauf und Seitenbesitz für eine effizientere Informationssuche.

Anmerkung

Die Web Crawler-Integration unterstützt nur die Datenaufnahme. Sie bietet keine Aktionsfunktionen für die Verwaltung von Websites oder Webdiensten.

Voraussetzungen

Bevor Sie die Web Crawler-Integration einrichten, stellen Sie sicher, dass Sie über Folgendes verfügen:

  • URLs der Websites, die gecrawlt und indexiert werden sollen.

  • Sie benötigen ein Amazon Quick-Konto mit Enterprise Edition.

  • Eine Website, die sich nicht hinter einer Firewall befindet und keine speziellen Browser-Plugins für die Verbindung benötigt.

Bereiten Sie den Zugriff auf die Website und die Authentifizierung vor

Bevor Sie die Integration in Amazon Quick einrichten, bereiten Sie Ihre Zugangsdaten für die Website vor. Die Web Crawler-Integration unterstützt verschiedene Authentifizierungsmethoden:

Keine Authentifizierung

Wird zum Crawlen von Websites verwendet, für die keine Authentifizierung erforderlich ist.

Grundlegende Authentifizierung

Standard-HTTP-Basisauthentifizierung für gesicherte Websites. Wenn Sie eine geschützte Site besuchen, zeigt Ihr Browser ein Dialogfeld an, in dem Sie nach Ihren Anmeldeinformationen gefragt werden.

Erforderliche Anmeldeinformationen:

  • URL der Anmeldeseite — Die URL der Anmeldeseite

  • Benutzername — Standardbenutzername für die Authentifizierung

  • Passwort — Grundlegendes Authentifizierungskennwort

Formularauthentifizierung

Für Websites, die auf HTML-Formularen basierende Anmeldeseiten verwenden. Sie geben XPath-Ausdrücke an, um die Formularfelder auf der Anmeldeseite zu identifizieren.

XPath (XML Path Language) ist eine Abfragesprache zum Navigieren in Elementen in einem HTML- oder XML-Dokument. Um einen XPath für ein Webseitenelement zu finden, klicken Sie in Ihrem Browser mit der rechten Maustaste auf das Element und wählen Sie Inspect. Klicken Sie in den Entwicklertools mit der rechten Maustaste auf den markierten HTML-Code, wählen Sie „Kopieren“ und dann „XPath kopieren“.

Erforderliche Informationen:

  • URL der Anmeldeseite — URL des Anmeldeformulars (z. B.https://example.com/login)

  • Nutzername — Login-Nutzername

  • Passwort — Login-Passwort

  • Benutzernamen-Feld XPath — XPath zum Eingabefeld für den Benutzernamen (zum Beispiel) //input[@id='username']

  • (Optional) XPath für die Schaltfläche „Benutzername“ — XPath zum Schaltflächenfeld „Benutzername“ (z. B.) //input[@id='username_button']

  • Passwortfeld XPath — XPath zum Passwort-Eingabefeld (zum Beispiel) //input[@id='password']

  • Passwort-Schaltfläche XPath — XPath-Schaltfläche zum Passwort (zum Beispiel) //button[@type='password']

SAML-Authentifizierung

Für Websites, die SAML-based Single Sign-On (SSO) -Authentifizierung verwenden.

Die SAML-Authentifizierung (Security Assertion Markup Language) ist ein föderierter Identitätsstandard, der SSO ermöglicht. Sie authentifizieren sich über einen zentralen Identitätsanbieter (z. B. Microsoft Azure AD oderOkta), anstatt Anmeldeinformationen direkt in jede Anwendung einzugeben. Der Identitätsanbieter übergibt ein sicheres Token zurück an die Anwendung, um den Zugriff zu gewähren.

Erforderliche Informationen:

  • URL der Anmeldeseite — URL der SAML-Anmeldeseite

  • Benutzername — SAML-Benutzername

  • Passwort — SAML-Passwort

  • Benutzernamen-Feld XPath — XPath zum Eingabefeld für den Benutzernamen (zum Beispiel) //input[@id='username']

  • (Optional) XPath für die Schaltfläche „Benutzername“ — XPath zum Schaltflächenfeld „Benutzername“ (z. B.) //input[@id='username_button']

  • Passwortfeld XPath — XPath zum Passwort-Eingabefeld (zum Beispiel) //input[@id='password']

  • Passwort-Schaltfläche XPath — XPath-Schaltfläche zum Passwort (zum Beispiel) //button[@type='password']

Beispiele für XPath-Konfigurationen

Verwenden Sie diese XPath-Beispiele, um die Formular- und SAML-Authentifizierung zu konfigurieren:

Username field examples: //input[@id='username'] //input[@name='user'] //input[@class='username-field'] Password field examples: //input[@id='password'] //input[@name='pass'] //input[@type='password'] Submit button examples: //button[@type='submit'] //input[@type='submit'] //button[contains(text(), 'Login')]

Richten Sie die Web Crawler-Integration ein

Nachdem Sie Ihre Anforderungen für den Zugriff auf Ihre Website vorbereitet haben, erstellen Sie die Web Crawler-Integration in Amazon Quick.

  1. Wählen Sie in der Amazon Quick-Konsole Knowledge aus.

  2. Suchen Sie nach Web Crawler und wählen Sie das Symbol Hinzufügen (+).

  3. Wählen Sie Auf Daten aus Web Crawler zugreifen. Die Web Crawler-Integration unterstützt nur den Datenzugriff — die Ausführung von Aktionen ist für Webcrawling nicht verfügbar.

  4. Konfigurieren Sie die Integrationsdetails und die Authentifizierungsmethode und erstellen Sie dann nach Bedarf Wissensdatenbanken.

    1. Wählen Sie den Authentifizierungstyp für Ihre Webcrawler-Integration.

    2. Geben Sie die erforderlichen Details basierend auf der von Ihnen gewählten Authentifizierungsmethode ein.

    3. (Optional) Wählen Sie eine VPC-Verbindung, um Websites zu crawlen, die in Ihrem privaten Netzwerk gehostet werden. Die VPC-Verbindung muss in den Admin-Einstellungen konfiguriert werden, bevor Sie sie hier auswählen können. Weitere Informationen finden Sie unter Einrichtung einer VPC für die Verwendung mit Amazon Quick.

      Anmerkung

      Sie können die VPC-Verbindung nicht mehr ändern, nachdem die Integration erstellt wurde. Um eine andere VPC-Verbindung zu verwenden, erstellen Sie eine neue Integration.

    4. Wählen Sie Erstellen und fahren Sie fort.

    5. Geben Sie den Namen und die Beschreibung für Ihre Wissensdatenbank ein.

    6. Fügen Sie die Inhalts-URLs hinzu, die Sie crawlen möchten.

    7. Wählen Sie Erstellen aus.

Nachdem Sie Erstellen ausgewählt haben, wird die Datensynchronisierung automatisch gestartet.

Konfigurieren Sie das Crawling

Sie können konfigurieren, welche Websites und Seiten gecrawlt werden sollen und wie der Inhalt gefiltert wird.

Konfiguriere URLs und Inhaltsquellen

Konfiguriere, welche Websites und Seiten gecrawlt werden sollen:

Direkte URLs

Geben Sie einzelne URLs an, die gecrawlt werden sollen:

https://example.com/docs https://example.com/blog https://example.com/support

Limit: Maximal 10 URLs pro Datensatz

Inhaltsfilter und Crawling-Einstellungen

Einstellungen für den Umfang des Crawls

Um diese Einstellungen einsehen zu können, müssen Sie zunächst eine Wissensdatenbank einrichten und dann die Option für erweiterte Einstellungen prüfen.

Tiefe kriechen
  • Bereich: 0-10 (Standard: 1)

  • 0 = Nur angegebene URLs crawlen

  • 1 = Schließt verlinkte Seiten ein, die eine Ebene tief sind

  • Höhere Werte folgen Links, die tiefer in die Seite hineinragen

Maximale Anzahl Links pro Seite
  • Standard: 100

  • Höchstwert: 1 000.

  • Steuert, wie vielen Links von jeder Seite aus gefolgt werden soll

Wait (Warten) Zeit
  • Standard: 1

  • Die Zeit (in Sekunden), die der Webcrawler auf jede Seite wartet, nachdem die Seite den Status Bereit erreicht hat. Erhöhen Sie diesen Wert für Seiten mit dynamischem JavaScript Inhalt, die nach der Hauptvorlage geladen werden.

Wissensdatenbanken verwalten

Nachdem Sie Ihre Web Crawler-Integration eingerichtet haben, können Sie Wissensdatenbanken aus den Inhalten Ihrer gecrawlten Website erstellen und verwalten.

Bestehende Wissensdatenbanken bearbeiten

Sie können Ihre vorhandenen Web Crawler-Wissensdatenbanken ändern:

  1. Wählen Sie in der Amazon Quick-Konsole Wissensdatenbanken aus.

  2. Wählen Sie Ihre Web Crawler-Wissensdatenbank aus der Liste aus.

  3. Wählen Sie das Dreipunktsymbol unter Aktionen aus und wählen Sie dann Wissensdatenbank bearbeiten aus.

  4. Aktualisieren Sie Ihre Konfigurationseinstellungen nach Bedarf und wählen Sie Speichern.

Anlagen und Datei-Crawling

Kontrollieren Sie, ob das System Dateien und Anlagen verarbeitet, die von Webseiten aus verlinkt sind:

  • Crawling von Dateianhängen aktivieren — Wählen Sie diese Option, um Dateien und Anlagen auf Webseiten wie PDFs, Dokumente und Mediendateien zu crawlen und zu indexieren.

Crawling-Verhalten und Synchronisierungskonfiguration

Ihre Web Crawler-Integration folgt diesen Crawling-Praktiken:

  • Inkrementelles Synchronisierungsmodell: Bei der ersten Synchronisierung wird ein vollständiger Crawl durchgeführt. Bei nachfolgenden Synchronisierungen werden nur Änderungen erfasst.

  • Automatischer Wiederholungsversuch: Built-in Wiederholungslogik für fehlgeschlagene Anfragen.

  • Behandlung von Duplikaten: Automatische Erkennung und Deduplizierung von URLs.

  • Crawler-Identifikation: Identifiziert sich mit der User-Agent-Zeichenfolge in den Anforderungsheadernamazon-Quick-on-behalf-of-<UUID>. Sie können diesen User-Agent in Ihrer robots.txt Datei als Ziel auswählen, um den Crawler gezielt zuzulassen oder zu verbieten. Weitere Informationen finden Sie unter Robots.txt -Compliance.

Entdeckung der Sitemap

Web Crawler sucht automatisch nach Sitemaps, indem er allgemeine Sitemap-Pfade an Ihre Seed-URLs anhängt. Sie müssen die Sitemap-URLs nicht separat angeben. Die folgenden Pfade werden überprüft:

sitemap.xml sitemap_index.xml sitemap/sitemap.xml sitemap/sitemap_index.xml sitemaps/sitemap.xml sitemap/index.xml

Wenn Ihre Seed-URL beispielsweise lautethttps://example.com/docs, sucht der Crawler nach https://example.com/docs/sitemap.xmlhttps://example.com/docs/sitemap_index.xml, usw.

Anmerkung

Web Crawler folgt keinen rekursiven Sitemap-Indexverweisen. Es werden nur die URLs verwendet, die direkt in einer erkannten Sitemap aufgeführt sind. Die Sitemap-Direktiven in robots.txt werden nicht für die Sitemap-Erkennung verwendet.

Robots.txt -Compliance

Web Crawler respektiert das Protokoll robots.txt und berücksichtigt die Anweisungen des Benutzeragenten und des Zulassens oder Verbots. Verwenden Sie diese Anweisungen, um zu steuern, wie der Crawler auf Ihre Website zugreift.

Wie funktioniert die Überprüfung von robots.txt
  • Host-level Überprüfung: Web Crawler liest die Dateien robots.txt auf Host-Ebene (zum Beispiel. com/robots.txt).

  • Unterstützung mehrerer Hosts: Bei Domänen mit mehreren Hosts berücksichtigt Web Crawler die Robot-Regeln für jeden Host separat.

  • Fallback-Verhalten: Wenn der Web Crawler robots.txt aufgrund von Blockierungs-, Parsingfehlern oder Timeouts nicht abrufen kann, verhält er sich so, als ob robots.txt nicht existieren würde. In diesem Fall fährt der Crawler mit dem Crawlen der Website fort.

Unterstützte Felder von robots.txt

Web Crawler erkennt diese Felder in der Datei robots.txt (bei Feldnamen wird nicht zwischen Groß- und Kleinschreibung unterschieden, bei Werten wird zwischen Groß- und Kleinschreibung unterschieden):

user-agent

Identifiziert, für welchen Crawler die Regeln gelten.

allow

Ein URL-Pfad, der gecrawlt werden kann.

disallow

Ein URL-Pfad, der nicht gecrawlt werden darf.

crawl-delay

Die Wartezeit (in Sekunden) zwischen Anfragen an Ihre Website.

Unterstützung für Metatags

Web Crawler unterstützt Robots-Metatags auf Seitenebene, mit denen Sie steuern können, wie Ihre Daten verwendet werden. Sie können Einstellungen auf Seitenebene angeben, indem Sie ein Metatag auf HTML-Seiten oder in einen HTTP-Header einfügen.

Unterstützte Metatags
noindex

Indexieren Sie die Seite nicht. Wenn Sie diese Regel nicht angeben, wird die Seite möglicherweise indexiert und kann in Erlebnissen erscheinen.

nofollow

Folgen Sie nicht den Links auf dieser Seite. Wenn Sie diese Regel nicht angeben, verwendet Web Crawler möglicherweise die Links auf der Seite, um die verlinkten Seiten zu ermitteln.

Sie können mehrere Werte mithilfe eines Kommas kombinieren (z. B. „noindex, nofollow“).

Anmerkung

Um Metatags zu erkennen, muss Web Crawler auf Ihre Seite zugreifen. Blockieren Sie Ihre Seite nicht mit robots.txt, da dies verhindert, dass die Seite erneut gecrawlt wird.

Fehlerbehebung

Verwenden Sie diesen Abschnitt, um häufig auftretende Probleme mit der Web Crawler-Integration zu lösen.

Authentication failures (Authentifizierungsfehler)

Symptome:

  • Fehlermeldungen „Authentifizierung nicht möglich“

  • 401/403 HTTP-Antworten

  • Umleitungsschleifen auf der Anmeldeseite

  • Fehler beim Sitzungs-Timeout

Schritte zur Lösung:

  1. Stellen Sie sicher, dass die Site von der AWS Region aus erreichbar ist, in der die Amazon Quick-Instance eingerichtet ist.

  2. Stellen Sie sicher, dass Ihre Anmeldeinformationen korrekt und nicht abgelaufen sind.

  3. Überprüfen Sie die Verfügbarkeit und Zugänglichkeit der Authentifizierungsendpunkte.

  4. Validieren Sie XPath-Konfigurationen, indem Sie sie in Browser-Entwicklertools testen.

  5. Überprüfen Sie die Netzwerkprotokolle des Browsers, um den Authentifizierungsablauf zu verstehen.

  6. Stellen Sie sicher, dass die URL der Anmeldeseite korrekt und zugänglich ist.

  7. Testen Sie die Authentifizierung manuell mit denselben Anmeldeinformationen.

Zugriffs- und Verbindungsprobleme

Symptome:

  • Verbindungs-Timeouts und Netzwerkfehler

  • Fehler, die nicht erreichbar sind

  • Fehler bei der DNS-Auflösung

Schritte zur Lösung:

  1. Überprüfen Sie die Netzwerkkonnektivität zu den Ziel-Websites.

  2. Überprüfen Sie die Barrierefreiheit der Website:

    • Überprüfen Sie die DNS-Auflösung für Zieldomänen.

    • Überprüfen Sie die SSL/TLS Konfiguration und die Zertifikate.

    • Testen Sie nach Möglichkeit den Zugriff von verschiedenen Netzwerken aus.

DNS-Auflösung

Der Web Crawler verwendet DNS, um Website-Hostnamen (z. B.www.example.com) in IP-Adressen aufzulösen. Standardmäßig verwendet er die öffentliche DNS-Auflösung.

Beim Crawlen von Websites innerhalb einer VPC müssen Sie möglicherweise einen privaten DNS-Server konfigurieren, damit der Crawler Hostnamen für interne Websites auflösen kann. Wählen Sie je nach Ihrer VPC-Konfiguration eine der folgenden Optionen aus:

  1. Verwenden Sie den VPC-provided DNS-Server — Wenn für Ihre VPC sowohl DNS-Hostnamen als auch DNS-Auflösung aktiviert sind, können Sie den Standard-VPC-DNS-Resolver verwenden (normalerweise 10.0.0.2 oder allgemeiner die VPC-CIDR-Basis+2). Weitere Informationen finden Sie unter VPC.

  2. Verwenden Sie einen benutzerdefinierten DNS-Server — Wenn Ihre VPC einen benutzerdefinierten DNS-Resolver verwendet, geben Sie die IP-Adresse des internen DNS-Servers Ihrer Organisation an. Wenden Sie sich an Ihren Netzwerkadministrator, um diese Adresse zu erhalten.

Wenn Sie keinen DNS-Server konfigurieren, löst der Crawler nur öffentlich registrierte Hostnamen auf.

JavaScript-dependent Navigation

Symptome:

  • Nur die Seed-URL wird indexiert, es werden keine weiteren Seiten entdeckt

  • Der Crawl wurde erfolgreich abgeschlossen, es wird jedoch nur ein Dokument zurückgegeben

Schritte zur Lösung:

  1. Web Crawler führt Seiteninhalte aus JavaScript und rendert sie, simuliert jedoch keine Benutzerinteraktionen wie Klicks, Scrollen oder Hover-Aktionen. Wenn Ihre Website Navigationslinks durch Benutzerinteraktionen lädt (z. B. Klick-Handler, unendliches Scrollen oder dynamische Menüs), kann der Crawler diese Links nicht erkennen.

  2. Prüfen Sie Ihre Seite in den Entwicklertools Ihres Browsers, um zu überprüfen, ob für Navigationslinks <a href="..."> Standardelemente verwendet werden. Wenn Links stattdessen über JavaScript Event-Handler verkabelt sind, folgt ihnen der Crawler nicht.

  3. Wenn Ihre Website eine Sitemap bereitstellt, sucht Web Crawler automatisch nach allgemeinen Sitemap-Pfaden auf Ihren Seed-URLs. Stellen Sie sicher, dass Ihre Sitemap an einem Standardspeicherort verfügbar ist (z. B./sitemap.xml), damit der Crawler zusätzliche URLs erkennen kann, ohne auf die Extraktion von In-Page-Links angewiesen zu sein.

  4. Alternativ können Sie alle Zielseiten-URLs direkt als Seed-URLs angeben.

  5. Wenn Inhalte als HTML-, PDF- oder Textdateien exportiert werden können, sollten Sie erwägen, stattdessen den Amazon S3-Connector als Datenquelle zu verwenden.

Probleme beim Crawlen und beim Inhalt

Symptome:

  • Fehlender oder unvollständiger Inhalt

  • Unvollständige Crawls oder vorzeitige Beendigung

  • Fehler bei der Ratenbegrenzung (429 Antworten)

  • Inhalt wird nicht richtig indexiert

Schritte zur Lösung:

  1. Überprüfen Sie die Einschränkungen von robots.txt:

    • Überprüfen Sie die Datei robots.txt auf Crawling-Einschränkungen.

    • Stellen Sie sicher, dass der Crawler auf Zielpfade zugreifen darf.

    • Stellen Sie sicher, dass die Einhaltung von robots.txt keine Inhalte blockiert.

  2. Prüfen Sie die Ratenbegrenzung und Drosselung:

    • Überwachen Sie die Antwort-Header auf Informationen zum Ratenlimit.

    • Implementieren Sie angemessene Verzögerungen beim Crawlen.

  3. Überprüfen Sie URL-Muster und Filter:

    • Testen Sie Regex-Muster auf Genauigkeit.

    • Überprüfen Sie die URL-Formatierung und -Struktur.

    • Validieren Sie die include/exclude Musterlogik.

  4. Überprüfen Sie die Inhaltsbeschränkungen:

    • Überprüfe, ob die Seiten keine Index-Metatags enthalten.

    • Stellen Sie sicher, dass Inhaltstypen unterstützt werden.

    • Stellen Sie sicher, dass die Inhaltsgröße innerhalb der Grenzen liegt.

  5. Aktualisieren Sie die Wartezeit, sodass der Inhalt auf die Seite geladen wird, bevor der Crawler mit dem Crawlen beginnt.

Bekannte Beschränkungen

Die Web Crawler-Integration hat die folgenden Einschränkungen:

  • URL-Beschränkungen: Maximal 10 Seed-URLs pro Datensatz. Sie können keine Sitemap-URLs im Feld „Seed-URL“ angeben.

  • Crawl-Tiefe: Maximale Crawl-Tiefe von 10 Stufen

  • Sicherheitsanforderungen: HTTPS ist für Webproxykonfigurationen erforderlich

Die folgenden Einschränkungen gelten, wenn Sie den Web Crawler mit einer VPC-Verbindung verwenden:

  • Nein HTTP/3 (QUIC) -Unterstützung: HTTP/3 wird nicht unterstützt. Auf die meisten Websites wird HTTP/2 automatisch zurückgegriffen, aber auf Websites, die HTTP/3 nur für konfiguriert sind, kann nicht zugegriffen werden.

  • DNS über TCP erforderlich: Die DNS-Auflösung muss TCP verwenden. Stellen Sie sicher, dass Ihr DNS-Server DNS über TCP unterstützt, bevor Sie das VPC-Crawling konfigurieren.

  • Öffentlich vertrauenswürdige SSL-Zertifikate erforderlich: Interne Websites müssen ein Zertifikat einer bekannten Zertifizierungsstelle verwenden (z. B. Let's Encrypt oderDigiCert). Websites, die selbstsignierte oder private CA-Zertifikate verwenden, können keine Verbindung herstellen.

  • Nur IPv4: Nur IPv4-Adressen werden unterstützt. Websites, auf die ausschließlich über IPv6 zugegriffen werden kann, können nicht gecrawlt werden.