View a markdown version of this page

Preparação de conjuntos de dados de treinamento e teste - Amazon Textract

As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.

Preparação de conjuntos de dados de treinamento e teste

Conjuntos de dados de treinamento e teste

O conjunto de dados de treinamento é a base para a criação de um adaptador. Você deve fornecer um conjunto de dados de treinamento anotado para treinar um adaptador. Esse conjunto de dados de treinamento consiste em páginas de documentos carregadas pelo usuário, consultas e respostas de consultas anotadas. O modelo aprende com esse conjunto de dados para melhorar seu desempenho no tipo de documento que você fornece.

O conjunto de dados de teste é usado para avaliar o desempenho do adaptador. O conjunto de dados de teste é criado usando uma fatia do conjunto de dados original que o modelo nunca viu antes. Esse processo avalia o desempenho do adaptador com novos dados, criando medições e métricas precisas.

Você deve dividir todos os seus documentos em conjuntos de treinamento e teste. O conjunto de treinamento é usado para treinar o adaptador. O adaptador aprende os padrões contidos nesses documentos anotados. O conjunto de teste é usado para avaliar o desempenho do adaptador. Se você carregar menos de 20 documentos, divida-os igualmente entre treinamento e teste. Se você fizer upload de mais de 20 documentos, atribua 70% dos dados ao treinamento e 30% aos testes. Ao dividir documentos no Console de gerenciamento da AWS, você pode permitir que o Amazon Textract divida automaticamente seus documentos. Como alternativa, você pode dividir manualmente seus documentos em conjuntos de treinamento e teste.

Componentes do conjunto de dados

Os conjuntos de dados contêm os quatro componentes a seguir, que você deve preparar sozinho ou usando o Console de gerenciamento da AWS:

  • Imagens - As imagens podem ser JPEG, PNG, PDF de 1 página ou TIFF de 1 página. Se você estiver enviando documentos de várias páginas, eles Console de gerenciamento da AWS visualizarão cada página separadamente para anotação.

  • Arquivo de anotação - O arquivo de anotação segue a estrutura do Amazon Textract Block, embora contenha somente blocos QUERY e QUERY_RESULT.

  • Pré-etiquetagem de arquivos - Essa é a estrutura de blocos da resposta atual da API do Amazon Textract, extraída do resultado das operações ou DetectDocumentText. AnalyzeDocument Se você já ligou para o Amazon Textract antes e armazenou o resultado da operação, você pode fornecer as referências a esses resultados. O Amazon Textract aceita vários arquivos de pré-rotulagem, caso sua página do documento tenha vários arquivos de resposta exportados de uma API assíncrona.

  • Arquivo de manifesto - Um JSONL-based arquivo em que cada linha aponta para um arquivo de anotação, o arquivo de pré-rotulagem ou um PDF de imagem ou página única. Consulte esse formato de arquivo de manifesto ao estruturar seu arquivo de manifesto.

Os arquivos de manifesto contêm uma ou mais linhas JSON, com cada linha contendo informações para uma única imagem. O que segue é uma única linha em um arquivo de manifesto:

{ "source-ref": "s3://textract-adapters-sample-bucket-129090f9e-d51c-4034-a732-48caa3b532e7/adapters/0000000000/assets/1003_3_1.png", "source-ref-version": "uPNKaY_2I8dxj9Kp2sO0zDUt4q3MAJen", "source-ref-metadata": { "origin-ref": "s3://textract-adapters-sample-bucket-129090f9e-d51c-4034-a732-48caa3b532e7/adapters/0000000000/original_assets/1003_3.tiff", "page-number": 1 }, "annotations-ref": "s3://textract-adapters-sample-bucket-129090f9e-d51c-4034-a732-48caa3b532e7/adapters/0000000000/annotations/1003_3_1.png.json", "annotations-ref-version": "nwj_MC40zsAae_idwsdEa0r4ZQaVthGs", "annotations-ref-metadata": { "prelabeling-refs": [{ "prelabeling-ref": "s3://textract-adapters-sample-bucket-129090f9e-d51c-4034-a732-48caa3b532e7/adapters/0000000000/prelabels/fd958ee156b5b5de1ee6101dd05263120790836856774c871b877baa35e2f373/1" "prelabeling-ref-version": "uPNKaY_2I8dxj9Kp2sO0zDUt4q3MAJen" ]}, "assignment": "TRAINING", "include": true, }, "schema-version": "1.0" }

Observe que o arquivo de manifesto contém as seguintes informações:

  • source-ref: (Obrigatório) A localização da imagem ou arquivo de página única no Amazon S3. O formato é “s3://BUCKET/OBJECT_PATH”.

  • source-ref-version: (Opcional) A versão do objeto Amazon S3 da imagem ou arquivo de página única.

  • source-ref-metadata: (Opcional) Metadados sobre o source-ref quando essa imagem de um arquivo de página única deve fazer parte de um documento de várias páginas. Essas informações são úteis quando você deseja avaliar o adaptador em documentos de várias páginas. Quando não especificado, consideramos cada source-ref como um documento independente.

  • origin-ref: (Obrigatório) A localização do Amazon S3 para o documento original de várias páginas.

  • número da página: (Obrigatório) Número da página da referência de origem no documento original.

  • annotations-ref: (Obrigatório) A localização do cliente no Amazon S3 fez anotações na imagem. O formato é “s3://BUCKET/OBJECT_PATH”.

  • annotations-ref-metadata: (Obrigatório) Metadados sobre o atributo annotations. Contém referências de pré-rotulagem, junto com o tipo de atribuição do item da linha do manifesto e se é para include/exclude o documento do treinamento.

  • prelabeling-refs: (Obrigatório) Uma lista de arquivos da resposta assíncrona da API Amazon Textract do arquivo source-ref. Cada arquivo em prelabeling-refs deve conter uma propriedade Block, com no máximo 1000 blocos.

  • prelabeling-ref (Obrigatório) A localização das anotações automáticas na imagem no Amazon S3 usando a API Amazon Textract.

  • prelabeling-ref-version (opcional) A versão do objeto Amazon S3 do arquivo de pré-rotulagem.

  • tarefa: (Obrigatório) Especifique “TREINAMENTO” se a imagem pertencer ao conjunto de dados de treinamento. Caso contrário, use “TESTING”.

  • incluir: (Obrigatório) Especifique true para incluir o item de linha para treinamento. Caso contrário, use false.

  • schema-version: (Opcional) Versão do arquivo de manifesto. O valor válido é 1,0.

Para obter melhorias de precisão ideais, consulteMelhores práticas para consultas personalizadas do Amazon Textract.

Anotando os documentos com perguntas e respostas

Ao fazer anotações em seus documentos, você pode optar por rotular automaticamente seus documentos usando o recurso de consultas pré-treinado e, em seguida, editar os rótulos quando necessário. Como alternativa, você pode rotular manualmente as respostas para cada uma das consultas do documento.

Ao rotular manualmente seus documentos, o Amazon Textract extrai o texto bruto do documento. Depois que o texto bruto for extraído, você poderá usar a interface de Console de gerenciamento da AWS anotação para criar consultas para seus documentos. Vincule essas perguntas às respostas relevantes em seus documentos para estabelecer uma “verdade fundamental” para o treinamento.

Ao rotular automaticamente seus documentos, você especifica as consultas apropriadas para seu documento. Quando você termina de adicionar consultas aos seus documentos, o Amazon Textract tenta extrair os elementos adequados dos seus documentos, gerando anotações. Em seguida, você deve verificar a precisão dessas anotações, corrigindo as que estiverem incorretas. Ao vincular consultas a respostas, você ensina ao modelo quais informações são importantes em seus documentos.

Ao criar consultas, considere os tipos de perguntas que você precisará fazer para recuperar os dados relevantes em seus documentos. Para obter mais informações sobre essa estrutura de resposta, consulte Estruturas de resposta de consulta. Para obter mais informações sobre as melhores práticas para consultas, consulte Melhores práticas para consultas.

Você precisará treinar um adaptador em amostras representativas de seus documentos. Quando você usa o Console de gerenciamento da AWS para fazer anotações nos documentos, o console prepara esses arquivos para você automaticamente.