Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Integrasi Web Crawler
| Berlaku untuk: Enterprise Edition |
Dengan integrasi Web Crawler di Amazon Quick, Anda dapat membuat basis pengetahuan dari konten situs web dengan merayapi dan mengindeks halaman web. Integrasi ini mendukung kemampuan penyerapan data dengan opsi otentikasi yang berbeda.
Kemampuan Web Crawler
Anda dapat mengajukan pertanyaan tentang konten yang disimpan di situs web dan halaman web. Misalnya, Anda dapat mencari situs dokumentasi, basis pengetahuan, atau informasi spesifik di beberapa halaman web.
Dengan integrasi ini, Anda dapat mengakses dan memahami konten web terlepas dari lokasi atau jenisnya. Anda juga mendapatkan detail kontekstual seperti tanggal publikasi, riwayat modifikasi, dan kepemilikan halaman untuk penemuan informasi yang lebih efisien.
catatan
Integrasi Web Crawler hanya mendukung penyerapan data. Itu tidak menyediakan kemampuan tindakan untuk mengelola situs web atau layanan web.
Prasyarat
Sebelum Anda mengatur integrasi Web Crawler, pastikan Anda memiliki yang berikut:
-
URL situs web untuk merayapi dan indeks.
-
Anda memerlukan akun Amazon Quick dengan Enterprise Edition.
-
Situs web yang tidak berada di belakang firewall dan tidak memerlukan plugin browser khusus untuk terhubung.
Siapkan akses dan otentikasi situs web
Sebelum menyiapkan integrasi di Amazon Quick, siapkan kredenSIAL akses situs web Anda. Integrasi Web Crawler mendukung metode otentikasi yang berbeda:
- Tidak ada otentikasi
-
Gunakan untuk merayapi situs web yang tidak memerlukan otentikasi.
- Otentikasi dasar
-
Otentikasi Dasar HTTP Standar untuk situs web yang aman. Saat Anda mengunjungi situs yang dilindungi, browser Anda menampilkan kotak dialog yang meminta kredensibilitas Anda.
Kredensibilitas yang diperlukan:
-
URL halaman login - URL halaman login
Nama Pengguna - Nama pengguna autentikasi dasar
Kata Sandi - Kata sandi autentikasi dasar
-
- Autentikasi IAM
-
Untuk situs web yang menggunakan halaman login berbasis formulir HTML. Anda menentukan ekspresi XPath untuk mengidentifikasi bidang formulir pada halaman login.
XPath (XML Path Language) adalah bahasa query untuk menavigasi elemen dalam dokumen HTML atau XML. Untuk menemukan XPath untuk elemen halaman web, klik kanan elemen di browser Anda dan pilih In spect. Di alat pengembang, klik kanan kode HTML yang disorot, pilih Sal in, lalu pilih Salin XPath.
Informasi yang diperlukan:
URL halaman login - URL formulir login (misalnya,
https://example.com/login)Nama Pengguna - Login Nama pengguna
Kata Sandi - Kata sandi masuk
Bidang nama pengguna XPath - XPath ke bidang input nama pengguna (misalnya,)
//input[@id='username']-
(Opsional) Tombol nama pengguna XPath - bidang tombol XPath ke nama pengguna (misalnya,)
//input[@id='username_button'] Bidang kata sandi XPath - XPath ke bidang input kata sandi (misalnya,)
//input[@id='password']Tombol Kata Sandi XPath - Tombol XPath ke kata sandi (misalnya,)
//button[@type='password']
- Autentikasi SAFL
-
Untuk situs web yang menggunakan oten SAML-based tikasi single sign-on (SSO).
Otentikasi SAML (Security Assertion Markup Language) adalah standar identitas federasi yang memungkinkan SSO. Anda mengotentikasi melalui penyedia identitas terpusat (seperti Microsoft Azure AD atauOkta) alih-alih memasukkan kredenSIAL langsung ke setiap aplikasi. Penyedia identitas meneruskan token aman kembali ke aplikasi untuk memberikan akses.
Informasi yang diperlukan:
URL halaman login - URL halaman login SAML
Nama Pengguna - Nama pengguna SAML
Kata Sandi - Kata sandi SAML
-
Bidang nama pengguna XPath - XPath ke bidang input nama pengguna (misalnya,)
//input[@id='username'] -
(Opsional) Tombol nama pengguna XPath - bidang tombol XPath ke nama pengguna (misalnya,)
//input[@id='username_button'] -
Bidang kata sandi XPath - XPath ke bidang input kata sandi (misalnya,)
//input[@id='password'] -
Tombol Kata Sandi XPath - Tombol XPath ke kata sandi (misalnya,)
//button[@type='password']
Contoh konfigurasi XPath
Gunakan contoh XPath ini untuk mengonfigurasi formulir dan otentikasi SAML:
Username field examples: //input[@id='username'] //input[@name='user'] //input[@class='username-field'] Password field examples: //input[@id='password'] //input[@name='pass'] //input[@type='password'] Submit button examples: //button[@type='submit'] //input[@type='submit'] //button[contains(text(), 'Login')]
Siapkan integrasi Web Crawler
Setelah menyiapkan persyaratan akses situs web Anda, buat integrasi Web Crawler di Amazon Quick.
-
Di konsol Amazon Quick, pilih Penget ahuan.
-
Temukan Web Crawler dan pilih ikon Ad d (+).
-
Pilih Akses data dari Web Crawler. Integrasi Web Crawler hanya mendukung akses data - eksekusi tindakan tidak tersedia untuk perayapan web.
-
Konfigurasikan detail integrasi dan metode otentikasi, lalu buat basis pengetahuan sesuai kebutuhan.
-
Pilih jenis otentikasi untuk integrasi web crawler Anda.
-
Masukkan detail yang diperlukan berdasarkan metode otentikasi yang Anda pilih.
-
(Opsional) Pilih koneksi VPC untuk merayapi situs yang dihosting di jaringan pribadi Anda. Koneksi VPC harus dikonfigurasi dalam pengaturan admin sebelum Anda dapat memilihnya di sini. Untuk informasi selengkapnya, lihat Menyiapkan VPC untuk digunakan dengan Amazon Quick.
catatan
Anda tidak dapat mengubah koneksi VPC setelah integrasi dibuat. Untuk menggunakan koneksi VPC yang berbeda, buat integrasi baru.
-
Pilih Buat dan lanjutkan.
-
Masukkan nama dan deskripsi untuk basis pengetahuan Anda.
-
Tambahkan URL konten yang ingin Anda jelajahi.
-
Pilih Buat.
-
Setelah Anda memilih Buat, sinkronisasi data dimulai secara otomatis.
Konfigurasikan crawling
Anda dapat mengonfigurasi situs web dan halaman mana yang akan di-crawl dan cara memfilter konten.
Konfigurasikan URL dan sumber konten
Konfigurasikan situs web dan halaman mana yang akan di-crawl:
URL langsung
Tentukan URL individual untuk di-crawl:
https://example.com/docs https://example.com/blog https://example.com/support
Batas: Maksimum 10 URL per kumpulan data
Filter konten dan pengaturan perayapan
Pengaturan cakupan crawling
Untuk melihat pengaturan ini, Anda harus terlebih dahulu mengatur basis pengetahuan dan kemudian memeriksa opsi pengaturan lanjutan.
- Kedalaman merangkak
-
Rentang: 0-10 (default: 1)
0 = merayapi hanya URL yang ditentukan
1 = sertakan halaman yang ditautkan satu tingkat dalam
Nilai yang lebih tinggi mengikuti tautan lebih dalam ke situs
- Tautan maksimum per halaman
-
Default: 100
Maksimal: 1.000
Mengontrol berapa banyak tautan yang akan diikuti dari setiap halaman
- Waktu tunggu
-
Default: 1
-
Waktu (dalam detik) di mana crawler web menunggu untuk setiap halaman setelah halaman mencapai status siap. Tingkatkan nilai ini untuk halaman dengan JavaScript konten dinamis yang dimuat setelah template utama.
Kelola basis pengetahuan
Setelah menyiapkan integrasi Web Crawler, Anda dapat membuat dan mengelola basis pengetahuan dari konten situs web yang dirayapi.
Mengedit basis pengetahuan yang ada
Anda dapat memodifikasi basis pengetahuan Web Crawler yang ada:
-
Di konsol Amazon Quick, pilih Bas is pengetahuan.
-
Pilih basis pengetahuan Web Crawler Anda dari daftar.
-
Pilih ikon tiga titik di bawah Tind akan, lalu pilih Edit basis pengetahuan.
-
Perbarui pengaturan konfigurasi Anda sesuai kebutuhan dan pilih S impan.
Lampiran dan perayapan file
Kontrol apakah sistem memproses file dan lampiran yang ditautkan dari halaman web:
-
Aktifkan perayapan lampiran file — Pilih opsi ini untuk merayapi dan mengindeks file dan lampiran yang ditemukan di halaman web, seperti PDF, dokumen, dan file media.
Perilaku crawling dan konfigurasi sinkronisasi
Integrasi Web Crawler Anda mengikuti praktik perayapan berikut:
Model sinkronisasi inkremental: Sinkronisasi pertama melakukan crawling penuh. Sinkronisasi berikutnya hanya menangkap perubahan.
Coba ulang otomatis: logika Built-in coba lagi untuk permintaan yang gagal.
Penanganan duplikat: Deteksi otomatis dan deduplikasi URL.
Identifikasi crawler: Mengidentifikasi dirinya dengan string agen pengguna
amazon-Quick-on-behalf-of-<UUID>di header permintaan. Anda dapat menargetkan agen pengguna ini dirobots.txtfile Anda untuk mengizinkan atau melarang crawler secara khusus. Untuk informasi selengkapnya, lihat Robots.txt kepatuhan.
Penemuan peta situs
Web Crawler secara otomatis memeriksa peta situs dengan menambahkan jalur peta situs umum ke URL benih Anda. Anda tidak perlu memberikan URL sitemap secara terpisah. Jalur berikut diperiksa:
sitemap.xml sitemap_index.xml sitemap/sitemap.xml sitemap/sitemap_index.xml sitemaps/sitemap.xml sitemap/index.xml
Misalnya, jika URL benih Anda adalahhttps://example.com/docs, crawler akan memeriksahttps://example.com/docs/sitemap.xml,https://example.com/docs/sitemap_index.xml, dan seterusnya.
catatan
Web Crawler tidak mengikuti referensi indeks peta situs rekursif. Hanya URL yang tercantum langsung di peta situs yang ditemukan yang digunakan. Arahan peta situs di robots.txt tidak digunakan untuk penemuan peta situs.
Robots.txt kepatuhan
Web Crawler menghormati protokol robots.txt dan menghormati agen pengguna dan mengizinkan atau melarang arahan. Gunakan arahan ini untuk mengontrol bagaimana crawler mengakses situs Anda.
Cara kerja pemeriksaan robots.txt
Host-level memeriksa: Web Crawler membaca file robots.txt di tingkat host (misalnya, misalnya. com/robots.txt).
Dukungan beberapa host: Untuk domain dengan beberapa host, Web Crawler menghormati aturan robot untuk setiap host secara terpisah.
Perilaku fallback: Jika Web Crawler tidak dapat mengambil robots.txt karena pemblokiran, kesalahan penguraian, atau batas waktu, itu berperilaku seolah-olah robots.txt tidak ada. Dalam hal ini, crawler melanjutkan untuk merayapi situs.
Bidang robots.txt yang didukung
Web Crawler mengenali bidang robots.txt ini (nama bidang tidak peka huruf besar/kecil, nilainya peka huruf besar/kecil):
user-agentMengidentifikasi crawler mana yang berlaku aturan.
allowJalur URL yang mungkin dirayapi.
disallowJalur URL yang mungkin tidak di-crawl.
crawl-delayWaktu (dalam detik) untuk menunggu antara permintaan ke situs web Anda.
Dukungan tag meta
Web Crawler mendukung tag meta robot tingkat halaman yang dapat Anda gunakan untuk mengontrol bagaimana data Anda digunakan. Anda dapat menentukan pengaturan tingkat halaman dengan menyertakan tag meta pada halaman HTML atau di header HTTP.
Meta tag yang didukung
noindexJangan mengindeks halaman. Jika Anda tidak menentukan aturan ini, halaman dapat diindeks dan memenuhi syarat untuk ditampilkan di pengalaman.
nofollowJangan ikuti tautan di halaman ini. Jika Anda tidak menentukan aturan ini, Web Crawler dapat menggunakan tautan di halaman untuk menemukan halaman yang ditautkan tersebut.
Anda dapat menggabungkan beberapa nilai menggunakan koma (misalnya, “noindex, nofollow”).
catatan
Untuk mendeteksi tag meta, Web Crawler harus mengakses halaman Anda. Jangan memblokir halaman Anda dengan robots.txt, karena ini mencegah halaman dicabut ulang.
Pemecahan masalah
Gunakan bagian ini untuk menyelesaikan masalah umum dengan integrasi Web Crawler.
Kegagalan otentikasi
Gejala:
Pesan kesalahan “Tidak dapat mengotentikasi”
401/403 Tanggapan HTTP
Loop pengalihan halaman login
Kesalahan batas waktu sesi
Langkah-langkah resolusi:
Verifikasi situs dapat dijangkau dari AWS Wilayah tempat instans Amazon Quick diatur.
Pastikan kredensi Anda benar dan belum kedaluwarsa.
Periksa ketersediaan titik akhir otentikasi dan aksesibilitas.
Validasi konfigurasi XPath dengan mengujinya di alat pengembang browser.
Tinjau log jaringan browser untuk memahami alur otentikasi.
Pastikan URL halaman login benar dan dapat diakses.
Uji otentikasi secara manual menggunakan kredenSIAL yang sama.
Masalah akses dan konektivitas
Gejala:
Batas waktu koneksi dan kesalahan jaringan
Kesalahan jaringan yang tidak dapat dijangkau
Kegagalan resolusi DNS
Langkah-langkah resolusi:
-
Verifikasi konektivitas jaringan ke situs web target.
-
Validasi aksesibilitas situs:
Periksa resolusi DNS untuk domain target.
Veri SSL/TLS fikasi konfigurasi dan sertifikat.
Uji akses dari jaringan yang berbeda jika memungkinkan.
Resolusi DNS
Web Crawler menggunakan DNS untuk menyelesaikan nama host situs web (misalnya,www.example.com) ke alamat IP. Secara default, ia menggunakan resolusi DNS publik.
Saat merayapi situs di dalam VPC, Anda mungkin perlu mengonfigurasi server DNS pribadi sehingga crawler dapat menyelesaikan nama host untuk situs internal. Pilih salah satu opsi berikut berdasarkan konfigurasi VPC Anda:
-
Gunakan server VPC-provided DNS — Jika VPC Anda mengaktifkan nama host DNS dan resolusi DNS, Anda dapat menggunakan resolver DNS VPC default (biasanya 10.0.0.2, atau lebih umum basis VPC CIDR +2). Untuk informasi selengkapnya, lihat VPC.
-
Gunakan server DNS kustom — Jika VPC Anda menggunakan resolver DNS khusus, berikan alamat IP server DNS internal organisasi Anda. Bekerja dengan administrator jaringan Anda untuk mendapatkan alamat ini.
Jika Anda tidak mengonfigurasi server DNS, crawler hanya menyelesaikan nama host yang terdaftar secara publik.
JavaScript-dependent navigasi
Gejala:
Hanya URL benih yang diindeks, tidak ada halaman tambahan yang ditemukan
Perayapan berhasil diselesaikan tetapi hanya mengembalikan satu dokumen
Langkah-langkah resolusi:
-
Web Crawler mengeksekusi JavaScript dan merender konten halaman, tetapi tidak mensimulasikan interaksi pengguna seperti klik, gulir, atau tindakan hover. Jika situs memuat tautan navigasi melalui interaksi pengguna (misalnya, penangan klik, gulir tak terbatas, atau menu dinamis), crawler tidak dapat menemukan tautan tersebut.
-
Periksa halaman Anda di alat pengembang browser untuk memeriksa apakah tautan navigasi menggunakan
<a href="...">elemen standar. Jika tautan dihubungkan melalui JavaScript event handler sebagai gantinya, crawler tidak akan mengikutinya. -
Jika situs Anda menyediakan peta situs, Web Crawler secara otomatis memeriksa jalur peta situs umum pada URL awal Anda. Pastikan peta situs Anda tersedia di lokasi standar (misalnya,
/sitemap.xml) sehingga crawler dapat menemukan URL tambahan tanpa bergantung pada ekstraksi tautan dalam halaman. -
Atau, berikan semua URL halaman target langsung sebagai URL benih.
-
Jika konten dapat diekspor sebagai file HTML, PDF, atau teks, pertimbangkan untuk menggunakan konektor Amazon S3 sebagai sumber data Anda sebagai gantinya.
Masalah crawling dan konten
Gejala:
Konten hilang atau tidak lengkap
Perayapan yang tidak lengkap atau penghentian dini
Kesalahan pembatas nilai (429 tanggapan)
Konten tidak diindeks dengan benar
Langkah-langkah resolusi:
-
Tinjau batasan robots.txt:
Periksa file robots.txt untuk batasan crawling.
Verifikasi bahwa crawler diizinkan untuk mengakses jalur target.
Pastikan kepatuhan robots.txt tidak memblokir konten.
-
Periksa pembatasan dan pelambatan laju:
Pantau header respons untuk informasi batas tarif.
Terapkan penundaan crawling yang sesuai.
-
Verifikasi pola dan filter URL:
Uji pola regex untuk akurasi.
Periksa format dan struktur URL.
Validasi logika include/exclude pola.
-
Tinjau pembatasan konten:
Periksa tag meta noindex di halaman.
Verifikasi dukungan jenis konten.
Pastikan ukuran konten berada dalam batas.
-
Perbarui waktu tunggu sehingga konten dimuat di halaman sebelum crawler mulai merayapi.
Keterbatasan yang Sudah Diketahui
Integrasi Web Crawler memiliki batasan sebagai berikut:
Batas URL: Maksimal 10 URL benih per kumpulan data. Anda tidak dapat memberikan URL peta situs di bidang URL benih.
Kedalaman merangkak: Kedalaman crawling maksimum 10 level
Persyaratan keamanan: HTTPS diperlukan untuk konfigurasi proxy web
Batasan berikut berlaku saat menggunakan Web Crawler dengan koneksi VPC:
Tidak ada dukungan HTTP/3 (QUIC): HTTP/3 tidak didukung. Sebagian besar situs akan kembali secara HTTP/2 otomatis, tetapi situs yang dikonfigurasi HTTP/3 hanya tidak akan dapat diakses.
DNS melalui TCP diperlukan: Resol usi DNS harus menggunakan TCP. Pastikan server DNS Anda mendukung DNS melalui TCP sebelum mengonfigurasi crawling VPC.
Diperlukan sertifikat SSL tepercaya publik: Situs internal harus menggunakan sertifikat dari otoritas sertifikat terkenal (misalnya, Let's Encrypt atauDigiCert). Situs yang menggunakan sertifikat CA yang ditandatangani sendiri atau pribadi gagal terhubung.
Hanya IPv4: Hanya alamat IPv4 yang didukung. Situs yang dapat diakses secara eksklusif melalui IPv6 tidak dapat dirayapi.