

As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.

# Web Crawler
<a name="kb-managed-ds-webcrawler"></a>

O Web Crawler se conecta e rastreia os URLs que você especifica para uso em sua base de conhecimento gerenciada. O Web Crawler percorre páginas HTML a partir de seus URLs iniciais, seguindo links secundários de acordo com seu escopo e limites de rastreamento. Você também pode fornecer URLs de mapas do site como pontos de partida. O Web Crawler respeita o robots.txt de acordo com [ a RFC 9309. ](https://www.rfc-editor.org/rfc/rfc9309.html)

**Importante**  
Ao selecionar sites para rastrear, você deve aderir à Política de Uso Aceitável da [ Amazon ](https://aws.amazon.com/aup/) e a todos os outros termos da Amazon. Use o Web Crawler somente para indexar suas próprias páginas da Web ou páginas da Web que você tenha autorização para rastrear.

**nota**  
O Web Crawler não oferece suporte ao controle de acesso (ACLs) em nível de documento. Todo o conteúdo indexado pode ser acessado por qualquer usuário que tenha acesso à base de conhecimento. Se você precisar de filtragem de ACL, use um conector que a suporte (por exemplo, Amazon S3 SharePoint, ou). OneDrive

## Recursos compatíveis
<a name="kb-managed-supported-features-webcrawler"></a>
+ Rastreie vários URLs iniciais e URLs de mapas do site
+ Profundidade de rastreamento configurável, limite de taxa e limite de links por URL
+ Controle do escopo de rastreamento: mesmo host e caminho, somente host ou host e subdomínios
+ Filtros de padrão de URL (expressões regulares de inclusão e exclusão)
+ Rastreie anexos vinculados a páginas da web (PDFs, documentos etc.)
+ Autenticação para sites protegidos: básica, baseada em formulários ou SAML
+ Sincronização incremental de conteúdo para conteúdo adicionado, atualizado e excluído

## Métodos de autenticação
<a name="kb-managed-webcrawler-auth-methods"></a>

O Web Crawler oferece suporte a quatro métodos de autenticação. Escolha o método que corresponde à forma como o site de destino autentica os usuários. Para sites públicos sem login, use. `NO_AUTH`


**Métodos de autenticação do Web Crawler**  

| Método | Como ele se autentica | Quando usar | 
| --- | --- | --- | 
| Sem autenticação (NO\_AUTH) | O rastreador envia solicitações sem credenciais. | Sites públicos que não exigem login. | 
| Autenticação básica (BASIC\_AUTH) | O rastreador envia um Authorization: Basic cabeçalho HTTP com um nome de usuário e senha do seu segredo. | Sites protegidos pela Autenticação Básica HTTP (a caixa de diálogo de nome de usuário e senha no estilo do navegador). | 
| Autenticação de formulário (FORM) | O rastreador faz login enviando um formulário HTML. Você fornece o URL de login, as credenciais e as expressões XPath que localizam os campos do formulário. | Sites que usam um formulário HTML para fazer login. | 
| Autenticação SAML () SAML | O rastreador faz login por meio do formulário de login de um provedor de identidade SAML. Você fornece o URL de login do IdP, as credenciais e as expressões XPath que localizam os campos do formulário. | Sites que usam login SAML-based único. | 

## Pré-requisitos
<a name="kb-managed-prereqs-webcrawler"></a>

**Para o site que você deseja rastrear, certifique-se ** de:
+ Tenha permissão para rastrear o site e seu conteúdo.
+ Confirme se `robots.txt` o site não proíbe os URLs que você deseja rastrear. O padrão do Web Crawler é proibido se um `robots.txt` arquivo não for encontrado.
+ Se o site exigir login, identifique o método de autenticação (básico, formulário ou SAML). Para formulário e SAML, localize as expressões XPath para o campo de nome de usuário, campo de senha e botão de envio na página de login. Para encontrar um XPath, abra o menu de contexto (clique com o botão direito do mouse) do elemento do formulário em seu navegador**, escolha ** Inspecionar e copie o XPath das ferramentas do desenvolvedor.

**Em sua AWS conta, certifique-se de**:
+ Se seu site exigir autenticação, armazene suas credenciais em [AWS Secrets Manager segredo ](https://docs.aws.amazon.com/secretsmanager/latest/userguide/create_secret.html) e anote o nome de recurso da Amazon (ARN). Para obter os pares exatos de valores-chave, consulte. [Credenciais de autenticação](#kb-managed-webcrawler-credentials)
+ Inclua as permissões necessárias para se conectar à sua fonte de dados em sua role/permissions política AWS Identity and Access Management (IAM) para sua base de conhecimento. Para obter informações sobre as permissões necessárias, consulte[Permissões para acessar as fontes de dados](kb-permissions.md#kb-permissions-access-ds).

## Como configurar uma fonte de dados do Web Crawler
<a name="kb-managed-webcrawler-workflow"></a>

A configuração de uma fonte de dados do Web Crawler envolve as seguintes etapas:

1. **(Se seu site exigir login) Prepare as credenciais. ** Armazene as credenciais do seu método de autenticação em AWS Secrets Manager segredo. Consulte [Credenciais de autenticação](#kb-managed-webcrawler-credentials).

1. **Conecte a fonte de dados. ** Crie a fonte de dados do Web Crawler na base de conhecimento usando o Console de gerenciamento da AWS ou a API. Consulte [Crie a fonte de dados](#kb-managed-ds-webcrawler-create).

## Crie a fonte de dados
<a name="kb-managed-ds-webcrawler-create"></a>

------
#### [ Console ]

**Para conectar o Web Crawler à sua base de conhecimento gerenciada**

1. Em Fonte ** de dados**, forneça um nome para sua fonte de dados.

1. Selecione ** Web Crawler no menu ** suspenso da fonte de dados.

1. Em ** Origem**, escolha URLs de ** origem ** (até 10 URLs de ponto de partida) ou Mapas do site de ** origem ** (até 3 URLs de mapa do site).

1. Insira seus URLs na área de ** texto ** Adicionar URLs, um por linha.

1. Em ** Autenticação**, selecione ** Sem autenticação**, Autenticação ** básica**, Autenticação ** por ** formulário ou Autenticação ** ** SAML. Para qualquer método diferente de ** Sem autenticação**, selecione ou crie um AWS Secrets Manager segredo para armazenar suas credenciais.

1. (Opcional) Expanda o escopo da ** sincronização ** para definir a profundidade do rastreamento (0 a 10), o máximo de links por URL (1 a 1000), o máximo de URLs rastreados por minuto (1 a 300) e o escopo do rastreamento: ** padrão ** (mesmo host e mesmo caminho de URL inicial do URL inicial), somente host (mesmo ** host, qualquer caminho) ou subdomínios ** (mesmo domínio principal, incluindo subdomínios). ** **

1. (Opcional) Expanda os padrões de filtro de ** URL ** para adicionar expressões regulares que incluam ou excluam URLs específicos.

------
#### [ API ]

Para criar uma fonte de dados do Web Crawler, envie uma [ CreateDataSource ](https://docs.aws.amazon.com/bedrock/latest/APIReference/API_agent_CreateDataSource.html) solicitação com um endpoint de tempo de construção Agents for Amazon Bedrock. O AWS Command Line Interface exemplo a seguir cria uma fonte de dados que rastreia um site público sem autenticação. Para obter uma descrição de cada campo, consulte a referência de parâmetros do conector a seguir.

```
aws bedrock-agent create-data-source \
 --name "{{WebCrawler-connector}}" \
 --knowledge-base-id "{{your-knowledge-base-id}}" \
 --data-source-configuration file://webcrawler-managed-connector.json
```

O `webcrawler-managed-connector.json` arquivo contém o seguinte:

```
{
    "type": "MANAGED_KNOWLEDGE_BASE_CONNECTOR",
    "managedKnowledgeBaseConnectorConfiguration": {
        "connectorParameters": {
            "type": "WEB",
            "version": "1",
            "connectionConfiguration": {
                "seedUrls": [
                    "{{https://docs.example.com}}"
                ],
                "authType": "NO_AUTH"
            },
            "crawlConfiguration": {
                "crawlDepth": 3,
                "maxLinksPerUrl": 100,
                "maxCrawledUrlsPerMinute": 50,
                "syncScope": "SUB_DOMAINS",
                "crawlAttachments": true
            },
            "filterConfiguration": {
                "exclusionPatterns": [
                    "{{https://docs.example.com/private/.*}}"
                ]
            }
        }
    }
}
```

Para um site autenticado, `authType` defina como `BASIC_AUTH``FORM`, ou`SAML`, e adicione `secretArn` a. `connectionConfiguration`

Para bases de conhecimento gerenciadas, `CreateDataSource` é assíncrono: o status da fonte de dados muda de `CREATING` para `AVAILABLE` quando a operação é concluída.

------

## Parâmetros do conector
<a name="kb-managed-config-webcrawler"></a>

A configuração da fonte de dados usa os seguintes parâmetros do conector. Para usar o Web Crawler, especifique `WEB` como o conector digitado. `connectorParameters` Para os campos que envolvem `connectorParameters` (como `deletionProtectionConfiguration` e`mediaExtractionConfiguration`), consulte[Conectar uma fonte de dados](kb-managed-connect-ds.md).


**connectionConfiguration**  

| Campo | Obrigatório | Description | 
| --- | --- | --- | 
| seedUrls | Condicional | Lista de URLs iniciais a partir dos quais começar a rastrear. Máximo de 10. Obrigatório, a menos que você forneçasiteMapUrls. | 
| siteMapUrls | Condicional | Lista de URLs de mapas do site. Máximo de 3. Obrigatório, a menos que você forneçaseedUrls. | 
| authType | Sim | O tipo de autenticação: NO\_AUTHBASIC\_AUTH,FORM, ouSAML. Consulte [Métodos de autenticação](#kb-managed-webcrawler-auth-methods). | 
| secretArn | Condicional | O ARN do AWS Secrets Manager segredo contendo suas credenciais. Obrigatório quando não authType éNO\_AUTH. | 


**Configuração de rastreamento (opcional)**  

| Campo | Obrigatório | Description | 
| --- | --- | --- | 
| crawlDepth | Não | Profundidade máxima de rastreamento. Intervalo de 0 a 10. 0rastreia somente os URLs especificados; valores mais altos seguem links mais profundos no site. O padrão é 2. | 
| maxLinksPerUrl | Não | Máximo de links a serem seguidos por URL. Intervalo de 1 a 1000. O padrão é 100. | 
| maxCrawledUrlsPerMinute | Não | Máximo de URLs rastreados por minuto (limite de taxa). Intervalo de 1 a 300. | 
| implicitWaitInSeconds | Não | Tempo de espera, em segundos, após uma página atingir um estado pronto antes que o rastreador a leia. Aumente isso para páginas com JavaScript conteúdo dinâmico que são carregadas após o modelo principal. | 
| syncScope | Não | O escopo dos links a seguir. Um dos PATH\_SPECIFIC (mesmo host e mesmo caminho de URL inicial do URL inicial), DOMAINS\_ONLY (mesmo host do URL inicial, qualquer caminho) ou SUB\_DOMAINS (mesmo domínio primário, incluindo subdomínios). Quando omitido, o rastreador rastreia somente o mesmo host e o mesmo caminho de URL inicial do URL inicial. | 
| crawlAttachments | Não | Se você deve rastrear arquivos e anexos vinculados a partir de páginas da Web (como PDFs e outros documentos). | 


**Configuração do filtro (opcional)**  

| Campo | Obrigatório | Description | 
| --- | --- | --- | 
| inclusionPatterns | Não | Lista de expressões regulares. Somente URLs que correspondam a pelo menos um padrão são rastreados e indexados. | 
| exclusionPatterns | Não | Lista de expressões regulares. Os URLs que correspondem a qualquer padrão não são rastreados nem indexados. | 
| maxFileSizeInMegaBytes | Não | Tamanho máximo, em megabytes, de qualquer arquivo único que o rastreador ingira. Forneça como uma string numérica (por exemplo,"500"). O padrão é "500". | 

## Credenciais de autenticação
<a name="kb-managed-webcrawler-credentials"></a>

Se seu site exigir autenticação, armazene suas credenciais em AWS Secrets Manager segredo. O formato secreto depende do tipo de autenticação escolhido.

**Autenticação básica (`BASIC_AUTH`) **

```
{
    "userName": "{{your-username}}",
    "password": "{{your-password}}",
    "authentication": "BASIC_AUTH"
}
```

**Autenticação de formulário (`FORM`) **

Para autenticação baseada em formulário, forneça expressões XPath que identifiquem o campo de nome de usuário, campo de senha e botão de envio na página de login.

```
{
    "authentication": "FORM",
    "loginPageUrl": "{{https://example.com/login}}",
    "userName": "{{your-username}}",
    "password": "{{your-password}}",
    "userNameFieldXpath": "{{//input[@name='username']}}",
    "passwordFieldXpath": "{{//input[@name='password']}}",
    "userNameButtonXpath": "{{//button[@type='submit']}}",
    "passwordButtonXpath": "{{//button[@type='submit']}}"
}
```

**Autenticação SAML () `SAML` **

Para autenticação SAML, forneça a URL da página de login do provedor de identidade SAML e as expressões XPath para os campos do formulário.

```
{
    "authentication": "SAML",
    "loginPageUrl": "{{https://your-idp.example.com/login}}",
    "userName": "{{your-username}}",
    "password": "{{your-password}}",
    "userNameFieldXpath": "{{//input[@name='username']}}",
    "passwordFieldXpath": "{{//input[@name='password']}}",
    "userNameButtonXpath": "{{//button[@type='submit']}}",
    "passwordButtonXpath": "{{//button[@type='submit']}}"
}
```

**nota**  
Para encontrar um XPath em seu navegador, abra o menu de contexto (clique com o botão direito do mouse) do elemento do formulário na página de login e escolha ** Inspecionar. ** Nas ferramentas do desenvolvedor, abra o menu de contexto (clique com o botão direito do mouse) do HTML destacado, escolha ** Copiar e**, em seguida, escolha ** Copiar ** XPath.

## Comportamento de rastreamento e configuração de sincronização
<a name="kb-managed-webcrawler-crawling-behavior"></a>

O Web Crawler segue estas práticas de rastreamento:
+ **Modelo de sincronização incremental**: a primeira sincronização executa um rastreamento completo. As sincronizações subsequentes capturam somente conteúdo adicionado, atualizado e excluído.
+ **Tentativa automática**: o rastreador inclui uma lógica de nova tentativa integrada para solicitações com falha.
+ **Tratamento de duplicatas**: o rastreador detecta e desduplica URLs automaticamente.
+ **Identificação do rastreador**: o Web Crawler se identifica com a string user-agent nos cabeçalhos da solicitação. `amazon-bedrock-knowledgebase-on-behalf-of-<hash>` Você pode direcionar esse agente de usuário em seu `robots.txt` arquivo para permitir ou proibir especificamente o rastreador. Para obter mais informações, consulte [Robots.txt  Compliance](#kb-managed-webcrawler-robots-txt).

## Robots.txt  Compliance
<a name="kb-managed-webcrawler-robots-txt"></a>

O Web Crawler respeita o protocolo robots.txt e respeita as diretivas de agente de usuário e de permissão ou proibição. Use essas diretivas para controlar como o rastreador acessa seu site.

### Como funciona a verificação do robots.txt
<a name="kb-managed-webcrawler-robots-txt-how"></a>
+ **Host-level verificação**: o Web Crawler lê os arquivos robots.txt no nível do host (por exemplo,`example.com/robots.txt`).
+ **Suporte a vários hosts**: para domínios com vários hosts, o Web Crawler respeita as regras de robôs para cada host separadamente.
+ **Comportamento ** alternativo: se o Web Crawler não conseguir buscar o robots.txt devido a erros de bloqueio, análise ou tempo limite, ele se comporta como se o robots.txt não existisse. Nesse caso, o Web Crawler rastreia o site.

### Campos robots.txt suportados
<a name="kb-managed-webcrawler-robots-txt-fields"></a>

O Web Crawler reconhece os seguintes campos robots.txt. Os nomes dos campos não diferenciam maiúsculas de minúsculas; os valores diferenciam maiúsculas de minúsculas.

`user-agent`  
Identifica a qual rastreador as regras se aplicam.

`allow`  
Um caminho de URL que o Web Crawler pode rastrear.

`disallow`  
Um caminho de URL que o Web Crawler não consegue rastrear.

`crawl-delay`  
O tempo, em segundos, de espera entre as solicitações ao seu site.

## Suporte para metatags
<a name="kb-managed-webcrawler-meta-tags"></a>

O Web Crawler suporta metatags de robôs em nível de página que você pode usar para controlar como seus dados são usados. Você pode especificar configurações em nível de página incluindo uma meta tag em páginas HTML ou em um cabeçalho HTTP.

### Metatags suportadas
<a name="kb-managed-webcrawler-meta-tags-supported"></a>

`noindex`  
Não indexe a página. Se você não especificar essa regra, a página poderá ser indexada e qualificada para ser recuperada da sua base de conhecimento.

`nofollow`  
Não siga os links desta página. Se você não especificar essa regra, o Web Crawler poderá usar os links na página para descobrir páginas vinculadas.

Você pode combinar vários valores usando uma vírgula (por exemplo,`noindex, nofollow`).

**nota**  
Para detectar metatags, o Web Crawler deve acessar sua página. Não bloqueie a página`robots.txt`, pois isso impede que o rastreador rastreie novamente a página para ler suas metatags.

## Solução de problemas
<a name="kb-managed-ds-webcrawler-troubleshooting"></a>


**Problemas, causas e correções comuns do Web Crawler**  

| Sintomas | Causa provável | Correção | 
| --- | --- | --- | 
| A sincronização é concluída com êxito, mas somente o URL inicial é indexado. | Os links de navegação do site são conectados por meio de manipuladores de JavaScript eventos (clique, rolagem, menus dinâmicos) em vez de elementos padrão<a href="...">. O rastreador renderiza JavaScript , mas não simula as interações do usuário, portanto, não consegue descobrir esses links. | Forneça URLs iniciais adicionais para as páginas que você deseja rastrear ou forneça um URL de mapa do site que liste todos os URLs a serem rastreados. Se o conteúdo puder ser exportado como arquivos, considere usar o conector Amazon S3 em vez disso. | 
| A sincronização não retorna nenhum conteúdo ou menos páginas do que o esperado. | O robots.txt arquivo do site não permite os URLs que você deseja rastrear ou as páginas têm uma noindex meta tag. | Atualize o host robots.txt para que ele permita os caminhos que você deseja rastrear ou remova a noindex metatag das páginas que você deseja indexar. Não bloqueie a página robots.txt se você também quiser a detecção de metatags, pois o rastreador deve acessar a página para ler as metatags. | 
| Falha na autenticação (HTTP 401 ou 403, loop de redirecionamento de login ou tempo limite da sessão). | As credenciais estão incorretas ou expiraram, ou as expressões XPath não correspondem aos elementos da página de login. | Verifique as credenciais em seu segredo. Para FORM SAML autenticar, valide cada XPath nas ferramentas de desenvolvedor do seu navegador e verifique. loginPageUrl | 
| A sincronização falha com limitação de taxa (HTTP 429) ou conteúdo incompleto. | O rastreador está buscando páginas mais rápido do que o site permite. | maxCrawledUrlsPerMinuteDiminua ou aumente implicitWaitInSeconds para sites com conteúdo dinâmico que carrega depois que a página fica pronta. | 
| As páginas estão faltando porque são maiores do que o esperado. | A página ou o anexo excedemaxFileSizeInMegaBytes. | Aumente maxFileSizeInMegaBytes ou aceite que arquivos maiores que o limite não sejam ingeridos. | 