Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.
Objetos de respuesta para la detección de texto y el análisis de documentos
Cuando Amazon Textract procesa un documento, crea una lista de objetos de bloque para el texto detectado o analizado. Cada bloque contiene información sobre un elemento detectado, su ubicación y la confianza que Amazon Textract tiene en la precisión del procesamiento.
Un documento se compone de los siguientes tipos de Block objetos.
El contenido de un bloque depende de la operación a la que se llame. Si realiza una de las operaciones de detección de texto, se devolverán las páginas, líneas y palabras del texto detectado. Para obtener más información, consulte Detección de texto. Si realiza una de las operaciones de análisis de documentos, se devuelve información sobre las páginas, los pares clave-valor, las tablas, los elementos de selección y el texto detectados. Para obtener más información, consulte Análisis de documentos.
Algunos campos de Block objetos son comunes a ambos tipos de procesamiento. Por ejemplo, cada bloque tiene un identificador único.
Para ver ejemplos que muestran cómo utilizar Block los objetos, consulteTutoriales.
Maquetación del documento
Amazon Textract devuelve una representación de un documento como una lista de distintos tipos de Block objetos que están vinculados en una relación padre-hijo o en un par clave-valor. También se devuelven los metadatos que proporcionan el número de páginas de un documento. El siguiente es el JSON de un tipo de Block objeto típicoPAGE.
{ "Blocks": [ { "Geometry": { "BoundingBox": { "Width": 1.0, "Top": 0.0, "Left": 0.0, "Height": 1.0 }, "Polygon": [ { "Y": 0.0, "X": 0.0 }, { "Y": 0.0, "X": 1.0 }, { "Y": 1.0, "X": 1.0 }, { "Y": 1.0, "X": 0.0 } ] }, "Relationships": [ { "Type": "CHILD", "Ids": [ "2602b0a6-20e3-4e6e-9e46-3be57fd0844b", "82aedd57-187f-43dd-9eb1-4f312ca30042", "52be1777-53f7-42f6-a7cf-6d09bdc15a30", "7ca7caa6-00ef-4cda-b1aa-5571dfed1a7c" ] } ], "BlockType": "PAGE", "Id": "8136b2dc-37c1-4300-a9da-6ed8b276ea97" }..... ], "DocumentMetadata": { "Pages": 1 } }
Un documento está hecho de uno o más PAGE bloques. Cada página contiene una lista de bloques secundarios para los elementos principales detectados en la página, como líneas de texto y tablas. Para obtener más información, consulte Páginas.
Puede determinar el tipo de Block objeto inspeccionando el BlockType campo.
Un Block objeto contiene una lista de Block objetos relacionados en el Relationships campo, que es una matriz de objetos Relationship. Una Relationships matriz es del tipo CHILD o del tipo VALUE. Se utiliza una matriz del tipo CHILD para enumerar los elementos secundarios del bloque actual. Por ejemplo, si el bloque actual es de tipo LINE, Relationships contiene una lista de identificadores de los bloques WORD que componen la línea de texto. Se utiliza una matriz de tipo VALUE para contener pares clave-valor. Puede determinar el tipo de relación inspeccionando el Type campo del objeto. Relationship
Los bloques secundarios no tienen información sobre sus objetos de bloque principales.
Para ver ejemplos que muestran Block información, consulteProcesamiento sincrónico de documentos.
Confianza
Las operaciones de Amazon Textract devuelven el porcentaje de confianza que Amazon Textract tiene en la precisión del elemento detectado. Para obtener la confianza, utilice el Confidence campo del Block objeto. Un valor más alto indica una confianza más alta. Según el escenario, las detecciones con un nivel de confianza bajo pueden necesitar la confirmación visual de un humano.
Geometry
Las operaciones de Amazon Textract (excepto para el análisis de identidad) devuelven información de ubicación sobre la ubicación de los elementos detectados en la página de un documento. Para obtener la ubicación, utilice el Geometry campo del Block objeto. Para obtener más información, consulte Localización de elementos en una página de documento.