Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Web-Crawler-Integration
| Gilt für: Enterprise Edition |
Mit der Web Crawler-Integration in Amazon Quick können Sie Wissensdatenbanken aus Webseiteninhalten erstellen, indem Sie Webseiten crawlen und indexieren. Diese Integration unterstützt Datenaufnahmefunktionen mit verschiedenen Authentifizierungsoptionen.
Web Crawler-Funktionen
Sie können Fragen zu Inhalten stellen, die auf Websites und Webseiten gespeichert sind. Sie können beispielsweise Dokumentationsseiten, Wissensdatenbanken oder bestimmte Informationen auf mehreren Webseiten durchsuchen.
Mit dieser Integration können Sie unabhängig von Standort oder Typ auf Webinhalte zugreifen und diese verstehen. Außerdem erhalten Sie kontextbezogene Details wie Veröffentlichungsdaten, Änderungsverlauf und Seitenbesitz für eine effizientere Informationssuche.
Anmerkung
Die Web Crawler-Integration unterstützt nur die Datenaufnahme. Sie bietet keine Aktionsfunktionen für die Verwaltung von Websites oder Webdiensten.
Voraussetzungen
Bevor Sie die Web Crawler-Integration einrichten, stellen Sie sicher, dass Sie über Folgendes verfügen:
-
URLs der Websites, die gecrawlt und indexiert werden sollen.
-
Sie benötigen ein Amazon Quick-Konto mit Enterprise Edition.
-
Eine Website, die sich nicht hinter einer Firewall befindet und keine speziellen Browser-Plugins für die Verbindung benötigt.
Bereiten Sie den Zugriff auf die Website und die Authentifizierung vor
Bevor Sie die Integration in Amazon Quick einrichten, bereiten Sie Ihre Zugangsdaten für die Website vor. Die Web Crawler-Integration unterstützt verschiedene Authentifizierungsmethoden:
- Keine Authentifizierung
-
Wird zum Crawlen von Websites verwendet, für die keine Authentifizierung erforderlich ist.
- Grundlegende Authentifizierung
-
Standard-HTTP-Basisauthentifizierung für gesicherte Websites. Wenn Sie eine geschützte Site besuchen, zeigt Ihr Browser ein Dialogfeld an, in dem Sie nach Ihren Anmeldeinformationen gefragt werden.
Erforderliche Anmeldeinformationen:
-
URL der Anmeldeseite — Die URL der Anmeldeseite
Benutzername — Standardbenutzername für die Authentifizierung
Passwort — Grundlegendes Authentifizierungskennwort
-
- Formularauthentifizierung
-
Für Websites, die auf HTML-Formularen basierende Anmeldeseiten verwenden. Sie geben XPath-Ausdrücke an, um die Formularfelder auf der Anmeldeseite zu identifizieren.
XPath (XML Path Language) ist eine Abfragesprache zum Navigieren in Elementen in einem HTML- oder XML-Dokument. Um einen XPath für ein Webseitenelement zu finden, klicken Sie in Ihrem Browser mit der rechten Maustaste auf das Element und wählen Sie Inspect. Klicken Sie in den Entwicklertools mit der rechten Maustaste auf den markierten HTML-Code, wählen Sie „Kopieren“ und dann „XPath kopieren“.
Erforderliche Informationen:
URL der Anmeldeseite — URL des Anmeldeformulars (z. B.
https://example.com/login)Nutzername — Login-Nutzername
Passwort — Login-Passwort
Benutzernamen-Feld XPath — XPath zum Eingabefeld für den Benutzernamen (zum Beispiel)
//input[@id='username']-
(Optional) XPath für die Schaltfläche „Benutzername“ — XPath zum Schaltflächenfeld „Benutzername“ (z. B.)
//input[@id='username_button'] Passwortfeld XPath — XPath zum Passwort-Eingabefeld (zum Beispiel)
//input[@id='password']Passwort-Schaltfläche XPath — XPath-Schaltfläche zum Passwort (zum Beispiel)
//button[@type='password']
- SAML-Authentifizierung
-
Für Websites, die SAML-based Single Sign-On (SSO) -Authentifizierung verwenden.
Die SAML-Authentifizierung (Security Assertion Markup Language) ist ein föderierter Identitätsstandard, der SSO ermöglicht. Sie authentifizieren sich über einen zentralen Identitätsanbieter (z. B. Microsoft Azure AD oderOkta), anstatt Anmeldeinformationen direkt in jede Anwendung einzugeben. Der Identitätsanbieter übergibt ein sicheres Token zurück an die Anwendung, um den Zugriff zu gewähren.
Erforderliche Informationen:
URL der Anmeldeseite — URL der SAML-Anmeldeseite
Benutzername — SAML-Benutzername
Passwort — SAML-Passwort
-
Benutzernamen-Feld XPath — XPath zum Eingabefeld für den Benutzernamen (zum Beispiel)
//input[@id='username'] -
(Optional) XPath für die Schaltfläche „Benutzername“ — XPath zum Schaltflächenfeld „Benutzername“ (z. B.)
//input[@id='username_button'] -
Passwortfeld XPath — XPath zum Passwort-Eingabefeld (zum Beispiel)
//input[@id='password'] -
Passwort-Schaltfläche XPath — XPath-Schaltfläche zum Passwort (zum Beispiel)
//button[@type='password']
Beispiele für XPath-Konfigurationen
Verwenden Sie diese XPath-Beispiele, um die Formular- und SAML-Authentifizierung zu konfigurieren:
Username field examples: //input[@id='username'] //input[@name='user'] //input[@class='username-field'] Password field examples: //input[@id='password'] //input[@name='pass'] //input[@type='password'] Submit button examples: //button[@type='submit'] //input[@type='submit'] //button[contains(text(), 'Login')]
Richten Sie die Web Crawler-Integration ein
Nachdem Sie Ihre Anforderungen für den Zugriff auf Ihre Website vorbereitet haben, erstellen Sie die Web Crawler-Integration in Amazon Quick.
-
Wählen Sie in der Amazon Quick-Konsole Knowledge aus.
-
Suchen Sie nach Web Crawler und wählen Sie das Symbol Hinzufügen (+).
-
Wählen Sie Auf Daten aus Web Crawler zugreifen. Die Web Crawler-Integration unterstützt nur den Datenzugriff — die Ausführung von Aktionen ist für Webcrawling nicht verfügbar.
-
Konfigurieren Sie die Integrationsdetails und die Authentifizierungsmethode und erstellen Sie dann nach Bedarf Wissensdatenbanken.
-
Wählen Sie den Authentifizierungstyp für Ihre Webcrawler-Integration.
-
Geben Sie die erforderlichen Details basierend auf der von Ihnen gewählten Authentifizierungsmethode ein.
-
(Optional) Wählen Sie eine VPC-Verbindung, um Websites zu crawlen, die in Ihrem privaten Netzwerk gehostet werden. Die VPC-Verbindung muss in den Admin-Einstellungen konfiguriert werden, bevor Sie sie hier auswählen können. Weitere Informationen finden Sie unter Einrichtung einer VPC für die Verwendung mit Amazon Quick.
Anmerkung
Sie können die VPC-Verbindung nicht mehr ändern, nachdem die Integration erstellt wurde. Um eine andere VPC-Verbindung zu verwenden, erstellen Sie eine neue Integration.
-
Wählen Sie Erstellen und fahren Sie fort.
-
Geben Sie den Namen und die Beschreibung für Ihre Wissensdatenbank ein.
-
Fügen Sie die Inhalts-URLs hinzu, die Sie crawlen möchten.
-
Wählen Sie Erstellen aus.
-
Nachdem Sie Erstellen ausgewählt haben, wird die Datensynchronisierung automatisch gestartet.
Konfigurieren Sie das Crawling
Sie können konfigurieren, welche Websites und Seiten gecrawlt werden sollen und wie der Inhalt gefiltert wird.
Konfiguriere URLs und Inhaltsquellen
Konfiguriere, welche Websites und Seiten gecrawlt werden sollen:
Direkte URLs
Geben Sie einzelne URLs an, die gecrawlt werden sollen:
https://example.com/docs https://example.com/blog https://example.com/support
Limit: Maximal 10 URLs pro Datensatz
Inhaltsfilter und Crawling-Einstellungen
Einstellungen für den Umfang des Crawls
Um diese Einstellungen einsehen zu können, müssen Sie zunächst eine Wissensdatenbank einrichten und dann die Option für erweiterte Einstellungen prüfen.
- Tiefe kriechen
-
Bereich: 0-10 (Standard: 1)
0 = Nur angegebene URLs crawlen
1 = Schließt verlinkte Seiten ein, die eine Ebene tief sind
Höhere Werte folgen Links, die tiefer in die Seite hineinragen
- Maximale Anzahl Links pro Seite
-
Standard: 100
Höchstwert: 1 000.
Steuert, wie vielen Links von jeder Seite aus gefolgt werden soll
- Wait (Warten) Zeit
-
Standard: 1
-
Die Zeit (in Sekunden), die der Webcrawler auf jede Seite wartet, nachdem die Seite den Status Bereit erreicht hat. Erhöhen Sie diesen Wert für Seiten mit dynamischem JavaScript Inhalt, die nach der Hauptvorlage geladen werden.
Wissensdatenbanken verwalten
Nachdem Sie Ihre Web Crawler-Integration eingerichtet haben, können Sie Wissensdatenbanken aus den Inhalten Ihrer gecrawlten Website erstellen und verwalten.
Bestehende Wissensdatenbanken bearbeiten
Sie können Ihre vorhandenen Web Crawler-Wissensdatenbanken ändern:
-
Wählen Sie in der Amazon Quick-Konsole Wissensdatenbanken aus.
-
Wählen Sie Ihre Web Crawler-Wissensdatenbank aus der Liste aus.
-
Wählen Sie das Dreipunktsymbol unter Aktionen aus und wählen Sie dann Wissensdatenbank bearbeiten aus.
-
Aktualisieren Sie Ihre Konfigurationseinstellungen nach Bedarf und wählen Sie Speichern.
Anlagen und Datei-Crawling
Kontrollieren Sie, ob das System Dateien und Anlagen verarbeitet, die von Webseiten aus verlinkt sind:
-
Crawling von Dateianhängen aktivieren — Wählen Sie diese Option, um Dateien und Anlagen auf Webseiten wie PDFs, Dokumente und Mediendateien zu crawlen und zu indexieren.
Crawling-Verhalten und Synchronisierungskonfiguration
Ihre Web Crawler-Integration folgt diesen Crawling-Praktiken:
Inkrementelles Synchronisierungsmodell: Bei der ersten Synchronisierung wird ein vollständiger Crawl durchgeführt. Bei nachfolgenden Synchronisierungen werden nur Änderungen erfasst.
Automatischer Wiederholungsversuch: Built-in Wiederholungslogik für fehlgeschlagene Anfragen.
Behandlung von Duplikaten: Automatische Erkennung und Deduplizierung von URLs.
Crawler-Identifikation: Identifiziert sich mit der User-Agent-Zeichenfolge in den Anforderungsheadern
amazon-Quick-on-behalf-of-<UUID>. Sie können diesen User-Agent in Ihrerrobots.txtDatei als Ziel auswählen, um den Crawler gezielt zuzulassen oder zu verbieten. Weitere Informationen finden Sie unter Robots.txt -Compliance.
Entdeckung der Sitemap
Web Crawler sucht automatisch nach Sitemaps, indem er allgemeine Sitemap-Pfade an Ihre Seed-URLs anhängt. Sie müssen die Sitemap-URLs nicht separat angeben. Die folgenden Pfade werden überprüft:
sitemap.xml sitemap_index.xml sitemap/sitemap.xml sitemap/sitemap_index.xml sitemaps/sitemap.xml sitemap/index.xml
Wenn Ihre Seed-URL beispielsweise lautethttps://example.com/docs, sucht der Crawler nach https://example.com/docs/sitemap.xmlhttps://example.com/docs/sitemap_index.xml, usw.
Anmerkung
Web Crawler folgt keinen rekursiven Sitemap-Indexverweisen. Es werden nur die URLs verwendet, die direkt in einer erkannten Sitemap aufgeführt sind. Die Sitemap-Direktiven in robots.txt werden nicht für die Sitemap-Erkennung verwendet.
Robots.txt -Compliance
Web Crawler respektiert das Protokoll robots.txt und berücksichtigt die Anweisungen des Benutzeragenten und des Zulassens oder Verbots. Verwenden Sie diese Anweisungen, um zu steuern, wie der Crawler auf Ihre Website zugreift.
Wie funktioniert die Überprüfung von robots.txt
Host-level Überprüfung: Web Crawler liest die Dateien robots.txt auf Host-Ebene (zum Beispiel. com/robots.txt).
Unterstützung mehrerer Hosts: Bei Domänen mit mehreren Hosts berücksichtigt Web Crawler die Robot-Regeln für jeden Host separat.
Fallback-Verhalten: Wenn der Web Crawler robots.txt aufgrund von Blockierungs-, Parsingfehlern oder Timeouts nicht abrufen kann, verhält er sich so, als ob robots.txt nicht existieren würde. In diesem Fall fährt der Crawler mit dem Crawlen der Website fort.
Unterstützte Felder von robots.txt
Web Crawler erkennt diese Felder in der Datei robots.txt (bei Feldnamen wird nicht zwischen Groß- und Kleinschreibung unterschieden, bei Werten wird zwischen Groß- und Kleinschreibung unterschieden):
user-agentIdentifiziert, für welchen Crawler die Regeln gelten.
allowEin URL-Pfad, der gecrawlt werden kann.
disallowEin URL-Pfad, der nicht gecrawlt werden darf.
crawl-delayDie Wartezeit (in Sekunden) zwischen Anfragen an Ihre Website.
Unterstützung für Metatags
Web Crawler unterstützt Robots-Metatags auf Seitenebene, mit denen Sie steuern können, wie Ihre Daten verwendet werden. Sie können Einstellungen auf Seitenebene angeben, indem Sie ein Metatag auf HTML-Seiten oder in einen HTTP-Header einfügen.
Unterstützte Metatags
noindexIndexieren Sie die Seite nicht. Wenn Sie diese Regel nicht angeben, wird die Seite möglicherweise indexiert und kann in Erlebnissen erscheinen.
nofollowFolgen Sie nicht den Links auf dieser Seite. Wenn Sie diese Regel nicht angeben, verwendet Web Crawler möglicherweise die Links auf der Seite, um die verlinkten Seiten zu ermitteln.
Sie können mehrere Werte mithilfe eines Kommas kombinieren (z. B. „noindex, nofollow“).
Anmerkung
Um Metatags zu erkennen, muss Web Crawler auf Ihre Seite zugreifen. Blockieren Sie Ihre Seite nicht mit robots.txt, da dies verhindert, dass die Seite erneut gecrawlt wird.
Fehlerbehebung
Verwenden Sie diesen Abschnitt, um häufig auftretende Probleme mit der Web Crawler-Integration zu lösen.
Authentication failures (Authentifizierungsfehler)
Symptome:
Fehlermeldungen „Authentifizierung nicht möglich“
401/403 HTTP-Antworten
Umleitungsschleifen auf der Anmeldeseite
Fehler beim Sitzungs-Timeout
Schritte zur Lösung:
Stellen Sie sicher, dass die Site von der AWS Region aus erreichbar ist, in der die Amazon Quick-Instance eingerichtet ist.
Stellen Sie sicher, dass Ihre Anmeldeinformationen korrekt und nicht abgelaufen sind.
Überprüfen Sie die Verfügbarkeit und Zugänglichkeit der Authentifizierungsendpunkte.
Validieren Sie XPath-Konfigurationen, indem Sie sie in Browser-Entwicklertools testen.
Überprüfen Sie die Netzwerkprotokolle des Browsers, um den Authentifizierungsablauf zu verstehen.
Stellen Sie sicher, dass die URL der Anmeldeseite korrekt und zugänglich ist.
Testen Sie die Authentifizierung manuell mit denselben Anmeldeinformationen.
Zugriffs- und Verbindungsprobleme
Symptome:
Verbindungs-Timeouts und Netzwerkfehler
Fehler, die nicht erreichbar sind
Fehler bei der DNS-Auflösung
Schritte zur Lösung:
-
Überprüfen Sie die Netzwerkkonnektivität zu den Ziel-Websites.
-
Überprüfen Sie die Barrierefreiheit der Website:
Überprüfen Sie die DNS-Auflösung für Zieldomänen.
Überprüfen Sie die SSL/TLS Konfiguration und die Zertifikate.
Testen Sie nach Möglichkeit den Zugriff von verschiedenen Netzwerken aus.
DNS-Auflösung
Der Web Crawler verwendet DNS, um Website-Hostnamen (z. B.www.example.com) in IP-Adressen aufzulösen. Standardmäßig verwendet er die öffentliche DNS-Auflösung.
Beim Crawlen von Websites innerhalb einer VPC müssen Sie möglicherweise einen privaten DNS-Server konfigurieren, damit der Crawler Hostnamen für interne Websites auflösen kann. Wählen Sie je nach Ihrer VPC-Konfiguration eine der folgenden Optionen aus:
-
Verwenden Sie den VPC-provided DNS-Server — Wenn für Ihre VPC sowohl DNS-Hostnamen als auch DNS-Auflösung aktiviert sind, können Sie den Standard-VPC-DNS-Resolver verwenden (normalerweise 10.0.0.2 oder allgemeiner die VPC-CIDR-Basis+2). Weitere Informationen finden Sie unter VPC.
-
Verwenden Sie einen benutzerdefinierten DNS-Server — Wenn Ihre VPC einen benutzerdefinierten DNS-Resolver verwendet, geben Sie die IP-Adresse des internen DNS-Servers Ihrer Organisation an. Wenden Sie sich an Ihren Netzwerkadministrator, um diese Adresse zu erhalten.
Wenn Sie keinen DNS-Server konfigurieren, löst der Crawler nur öffentlich registrierte Hostnamen auf.
JavaScript-dependent Navigation
Symptome:
Nur die Seed-URL wird indexiert, es werden keine weiteren Seiten entdeckt
Der Crawl wurde erfolgreich abgeschlossen, es wird jedoch nur ein Dokument zurückgegeben
Schritte zur Lösung:
-
Web Crawler führt Seiteninhalte aus JavaScript und rendert sie, simuliert jedoch keine Benutzerinteraktionen wie Klicks, Scrollen oder Hover-Aktionen. Wenn Ihre Website Navigationslinks durch Benutzerinteraktionen lädt (z. B. Klick-Handler, unendliches Scrollen oder dynamische Menüs), kann der Crawler diese Links nicht erkennen.
-
Prüfen Sie Ihre Seite in den Entwicklertools Ihres Browsers, um zu überprüfen, ob für Navigationslinks
<a href="...">Standardelemente verwendet werden. Wenn Links stattdessen über JavaScript Event-Handler verkabelt sind, folgt ihnen der Crawler nicht. -
Wenn Ihre Website eine Sitemap bereitstellt, sucht Web Crawler automatisch nach allgemeinen Sitemap-Pfaden auf Ihren Seed-URLs. Stellen Sie sicher, dass Ihre Sitemap an einem Standardspeicherort verfügbar ist (z. B.
/sitemap.xml), damit der Crawler zusätzliche URLs erkennen kann, ohne auf die Extraktion von In-Page-Links angewiesen zu sein. -
Alternativ können Sie alle Zielseiten-URLs direkt als Seed-URLs angeben.
-
Wenn Inhalte als HTML-, PDF- oder Textdateien exportiert werden können, sollten Sie erwägen, stattdessen den Amazon S3-Connector als Datenquelle zu verwenden.
Probleme beim Crawlen und beim Inhalt
Symptome:
Fehlender oder unvollständiger Inhalt
Unvollständige Crawls oder vorzeitige Beendigung
Fehler bei der Ratenbegrenzung (429 Antworten)
Inhalt wird nicht richtig indexiert
Schritte zur Lösung:
-
Überprüfen Sie die Einschränkungen von robots.txt:
Überprüfen Sie die Datei robots.txt auf Crawling-Einschränkungen.
Stellen Sie sicher, dass der Crawler auf Zielpfade zugreifen darf.
Stellen Sie sicher, dass die Einhaltung von robots.txt keine Inhalte blockiert.
-
Prüfen Sie die Ratenbegrenzung und Drosselung:
Überwachen Sie die Antwort-Header auf Informationen zum Ratenlimit.
Implementieren Sie angemessene Verzögerungen beim Crawlen.
-
Überprüfen Sie URL-Muster und Filter:
Testen Sie Regex-Muster auf Genauigkeit.
Überprüfen Sie die URL-Formatierung und -Struktur.
Validieren Sie die include/exclude Musterlogik.
-
Überprüfen Sie die Inhaltsbeschränkungen:
Überprüfe, ob die Seiten keine Index-Metatags enthalten.
Stellen Sie sicher, dass Inhaltstypen unterstützt werden.
Stellen Sie sicher, dass die Inhaltsgröße innerhalb der Grenzen liegt.
-
Aktualisieren Sie die Wartezeit, sodass der Inhalt auf die Seite geladen wird, bevor der Crawler mit dem Crawlen beginnt.
Bekannte Beschränkungen
Die Web Crawler-Integration hat die folgenden Einschränkungen:
URL-Beschränkungen: Maximal 10 Seed-URLs pro Datensatz. Sie können keine Sitemap-URLs im Feld „Seed-URL“ angeben.
Crawl-Tiefe: Maximale Crawl-Tiefe von 10 Stufen
Sicherheitsanforderungen: HTTPS ist für Webproxykonfigurationen erforderlich
Die folgenden Einschränkungen gelten, wenn Sie den Web Crawler mit einer VPC-Verbindung verwenden:
Nein HTTP/3 (QUIC) -Unterstützung: HTTP/3 wird nicht unterstützt. Auf die meisten Websites wird HTTP/2 automatisch zurückgegriffen, aber auf Websites, die HTTP/3 nur für konfiguriert sind, kann nicht zugegriffen werden.
DNS über TCP erforderlich: Die DNS-Auflösung muss TCP verwenden. Stellen Sie sicher, dass Ihr DNS-Server DNS über TCP unterstützt, bevor Sie das VPC-Crawling konfigurieren.
Öffentlich vertrauenswürdige SSL-Zertifikate erforderlich: Interne Websites müssen ein Zertifikat einer bekannten Zertifizierungsstelle verwenden (z. B. Let's Encrypt oderDigiCert). Websites, die selbstsignierte oder private CA-Zertifikate verwenden, können keine Verbindung herstellen.
Nur IPv4: Nur IPv4-Adressen werden unterstützt. Websites, auf die ausschließlich über IPv6 zugegriffen werden kann, können nicht gecrawlt werden.