View a markdown version of this page

Objetos de resposta para detecção de texto e análise de documentos - Amazon Textract

As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.

Objetos de resposta para detecção de texto e análise de documentos

Quando o Amazon Textract processa um documento, ele cria uma lista de objetos de bloco para o texto detectado ou analisado. Cada bloco contém informações sobre um item detectado, onde ele está localizado e a confiança que o Amazon Textract tem na precisão do processamento.

Um documento é composto pelos seguintes tipos de Block objetos.

O conteúdo de um bloco depende da operação que você chama. Se você chamar uma das operações de detecção de texto, as páginas, linhas e palavras do texto detectado serão retornadas. Para obter mais informações, consulte Detectar texto. Se você chamar uma das operações de análise do documento, as informações sobre páginas detectadas, pares de valores-chave, tabelas, elementos de seleção e texto serão retornadas. Para obter mais informações, consulte Analisando documentos.

Alguns campos de Block objeto são comuns aos dois tipos de processamento. Por exemplo, cada bloco tem um identificador exclusivo.

Para exemplos que mostram como usar Block objetos, consulteTutoriais.

Layout do documento

O Amazon Textract retorna uma representação de um documento como uma lista de diferentes tipos de Block objetos vinculados em uma relação pai-filho ou em um par de valores-chave. Os metadados que fornecem o número de páginas em um documento também são retornados. A seguir está o JSON de um Block objeto típico do tipoPAGE.

{ "Blocks": [ { "Geometry": { "BoundingBox": { "Width": 1.0, "Top": 0.0, "Left": 0.0, "Height": 1.0 }, "Polygon": [ { "Y": 0.0, "X": 0.0 }, { "Y": 0.0, "X": 1.0 }, { "Y": 1.0, "X": 1.0 }, { "Y": 1.0, "X": 0.0 } ] }, "Relationships": [ { "Type": "CHILD", "Ids": [ "2602b0a6-20e3-4e6e-9e46-3be57fd0844b", "82aedd57-187f-43dd-9eb1-4f312ca30042", "52be1777-53f7-42f6-a7cf-6d09bdc15a30", "7ca7caa6-00ef-4cda-b1aa-5571dfed1a7c" ] } ], "BlockType": "PAGE", "Id": "8136b2dc-37c1-4300-a9da-6ed8b276ea97" }..... ], "DocumentMetadata": { "Pages": 1 } }

Um documento é feito de um ou mais PAGE blocos. Cada página contém uma lista de blocos secundários para os itens principais detectados na página, como linhas de texto e tabelas. Para obter mais informações, consulte Páginas.

Você pode determinar o tipo de um Block objeto inspecionando o BlockType campo.

Um Block objeto contém uma lista de Block objetos relacionados no Relationships campo, que é uma matriz de objetos de relacionamento. Uma Relationships matriz é do tipo CHILD ou do tipo VALUE. Uma matriz do tipo CHILD é usada para listar os itens que são filhos do bloco atual. Por exemplo, se o bloco atual for do tipo LINE, Relationships conterá uma lista de IDs para os blocos WORD que compõem a linha de texto. Uma matriz do tipo VALUE é usada para conter pares de valores-chave. Você pode determinar o tipo da relação inspecionando o Type campo do Relationship objeto.

Os blocos secundários não têm informações sobre seus objetos de bloco principais.

Para exemplos que mostram Block informações, consulteProcessando documentos de forma síncrona.

Confiança

As operações do Amazon Textract retornam a porcentagem de confiança que o Amazon Textract tem na precisão do item detectado. Para obter confiança, use o Confidence campo do Block objeto. Um valor mais alto indica uma maior confiança. Dependendo do cenário, detecções com baixa confiança podem precisar de confirmação visual por um humano.

Geometria

As operações do Amazon Textract (exceto para análise de identidade) retornam informações de localização sobre a localização dos itens detectados em uma página do documento. Para obter a localização, use o Geometry campo do Block objeto. Para obter mais informações, consulte Localizando itens em uma página de documento.