View a markdown version of this page

Melhores práticas para consultas personalizadas do Amazon Textract - Amazon Textract

As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.

Melhores práticas para consultas personalizadas do Amazon Textract

O Amazon Textract permite que você personalize a saída de seu recurso de consultas pré-treinado treinando e usando um adaptador para seu modelo básico. Com as consultas personalizadas do Amazon Textract, você pode usar seus próprios documentos e treinar um adaptador para personalizar o modelo básico, mantendo o controle sobre seus documentos proprietários. Ao criar consultas para seus adaptadores, use as práticas recomendadas a seguir. Para obter mais informações sobre adaptadores, consultePersonalizando suas respostas de consultas.

  1. Os dados da amostra devem conter variações de layout e variações de imagem que sejam representativas dos documentos a serem usados na produção.

  2. É necessário um mínimo de cinco amostras (por nível de consulta) para treinamento ou teste. Quanto mais amostras forem usadas para treinamento, melhor.

  3. As consultas anotadas devem ter uma variedade de respostas. Por exemplo, se a resposta a uma consulta for “Sim” ou “Não”, as amostras anotadas devem ter ocorrências de “Sim” e “Não”

  4. As consultas compostas devem ter significados e estruturas lógicas. Por exemplo, para extrair o nome do beneficiário no cheque, a consulta deve ser “Quem é o beneficiário?” e não 'Qual é o nome? '.

  5. Se um valor que precisa ser extraído tiver uma chave associada, inclua a chave na consulta para obter melhores resultados. Se houver chaves que ocorram várias vezes, use perguntas hierárquicas como “Qual é o primeiro nome do mutuário?” e “Qual é o primeiro nome do co-mutuário?”

  6. Mantenha a consistência no estilo de anotação. Se um campo aparecer em vários lugares em um documento e você decidir anotar somente uma ocorrência, siga a mesma diretriz e anote somente uma ocorrência em todos os documentos. Como alternativa, se você optar por anotar todas as ocorrências de um valor, siga o mesmo processo para todos os documentos.

  7. Mantenha a consistência ao anotar campos com espaços. Se o valor de um campo for '123 456 78' e se você optar por anotá-lo como '12345678', siga a mesma diretriz para todos os documentos. Não altere entre anotar o valor como '123 456 78' e '12345678'.

  8. Anote os dados em todas as páginas de um documento, mesmo que você possa executar inferências em apenas algumas páginas. Se não for possível anotar todas as páginas, divida o documento e use somente as páginas que você pode anotar no seu conjunto de dados.

  9. As consultas personalizadas não oferecem suporte a perguntas relacionadas a assinaturas (como “O documento está assinado?”). Para saber se um documento está assinado, use o recurso de assinaturas na sua solicitação de API.

  10. Ao corrigir as respostas da pré-rotulagem, você pode fazer pequenas modificações no texto apresentado nos documentos, como corrigir alguns erros de caracteres ou remover espaços e pontuação. Mas se o texto não for exibido nos documentos, não o insira como resposta.

  11. Use a consulta exata usada no treinamento para inferência.

  12. Forneça resultados de pré-etiquetagem somente para a source-ref página. Se você tiver resultados de pré-marcação com blocos que não são da source-ref página, isso pode afetar o desempenho.