Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.
Preparar conjuntos de datos de entrenamiento y prueba
Conjuntos de datos de entrenamiento y pruebas
El conjunto de datos de entrenamiento es la base para crear un adaptador. Debe proporcionar un conjunto de datos de entrenamiento anotado para entrenar un adaptador. Este conjunto de datos de entrenamiento consta de páginas de documentos subidas por el usuario, consultas y respuestas a consultas anotadas. El modelo aprende de este conjunto de datos para mejorar su rendimiento en el tipo de documentos que usted proporciona.
El conjunto de datos de prueba se utiliza para evaluar el rendimiento del adaptador. El conjunto de datos de prueba se crea utilizando una parte del conjunto de datos original que el modelo no ha visto antes. Este proceso evalúa el rendimiento del adaptador con nuevos datos y crea medidas y métricas precisas.
Debe dividir todos sus documentos en conjuntos de formación y pruebas. El conjunto de entrenamiento se utiliza para entrenar el adaptador. El adaptador aprende los patrones contenidos en estos documentos anotados. El conjunto de prueba se utiliza para evaluar el rendimiento del adaptador. Si carga menos de 20 documentos, divídalos en partes iguales entre tren y prueba. Si subes más de 20 documentos, asigna el 70% de los datos a la formación y el 30% a las pruebas. Al dividir documentos en Consola de administración de AWS, puedes dejar que Amazon Textract los divida automáticamente. Como alternativa, puede dividir manualmente sus documentos en conjuntos de formación y pruebas.
Componentes del conjunto de datos
Los conjuntos de datos contienen los cuatro componentes siguientes, que debe preparar usted mismo o utilizar: Consola de administración de AWS
-
Imágenes: las imágenes pueden ser JPEG, PNG, PDF de 1 página o TIFF de 1 página. Si envía documentos de varias páginas, Consola de administración de AWS visualizará cada página por separado para su anotación.
-
Archivo de anotaciones: el archivo de anotaciones sigue la estructura de bloques de Amazon Textract, aunque solo contiene los bloques QUERY y QUERY_RESULT.
-
Etiquetado previo de archivos: esta es la estructura de bloques de la respuesta actual de la API de Amazon Textract, extraída del resultado de DetectDocumentTextlas AnalyzeDocumentoperaciones o. Si ya ha llamado a Amazon Textract anteriormente y ha guardado el resultado de la operación, puede proporcionar las referencias a esos resultados. Amazon Textract acepta varios archivos de preetiquetado en caso de que la página del documento tenga varios archivos de respuesta exportados desde una API asíncrona.
-
Archivo de manifiesto: un JSONL-based archivo en el que cada línea apunta a un archivo de anotaciones, al archivo de preetiquetado o a una imagen o a un PDF de una sola página. Consulte este formato de archivo de manifiesto al estructurar el archivo de manifiesto.
Los archivos de manifiesto contienen una o más líneas JSON, y cada línea contiene información de una sola imagen. Lo que sigue es una sola línea en un archivo de manifiesto:
{ "source-ref": "s3://textract-adapters-sample-bucket-129090f9e-d51c-4034-a732-48caa3b532e7/adapters/0000000000/assets/1003_3_1.png", "source-ref-version": "uPNKaY_2I8dxj9Kp2sO0zDUt4q3MAJen", "source-ref-metadata": { "origin-ref": "s3://textract-adapters-sample-bucket-129090f9e-d51c-4034-a732-48caa3b532e7/adapters/0000000000/original_assets/1003_3.tiff", "page-number": 1 }, "annotations-ref": "s3://textract-adapters-sample-bucket-129090f9e-d51c-4034-a732-48caa3b532e7/adapters/0000000000/annotations/1003_3_1.png.json", "annotations-ref-version": "nwj_MC40zsAae_idwsdEa0r4ZQaVthGs", "annotations-ref-metadata": { "prelabeling-refs": [{ "prelabeling-ref": "s3://textract-adapters-sample-bucket-129090f9e-d51c-4034-a732-48caa3b532e7/adapters/0000000000/prelabels/fd958ee156b5b5de1ee6101dd05263120790836856774c871b877baa35e2f373/1" "prelabeling-ref-version": "uPNKaY_2I8dxj9Kp2sO0zDUt4q3MAJen" ]}, "assignment": "TRAINING", "include": true, }, "schema-version": "1.0" }
Tenga en cuenta que el archivo de manifiesto contiene la siguiente información:
-
source-ref: (obligatorio) La ubicación en Amazon S3 de la imagen o del archivo de una sola página. El formato es «s3://BUCKET/OBJECT_PATH».
-
source-ref-version: (opcional) La versión de objeto de Amazon S3 de la imagen o del archivo de una sola página.
-
source-ref-metadata: (opcional) Metadatos sobre la referencia fuente cuando esta imagen de un archivo de una sola página debe formar parte de un documento de varias páginas. Esta información resulta útil cuando se quiere evaluar el adaptador en documentos de varias páginas. Si no se especifica, consideramos cada referencia de origen como un documento independiente.
-
origin-ref: (obligatorio) La ubicación de Amazon S3 del documento original de varias páginas.
-
número de página: (obligatorio) Número de página de la referencia fuente del documento original.
-
annotations-ref: (obligatorio) La ubicación de Amazon S3 del cliente realizó anotaciones en la imagen. El formato es «s3://_PATH». BUCKET/OBJECT
-
annotations-ref-metadata: (obligatorio) Metadatos sobre el atributo de anotaciones. Contiene las referencias de preetiquetado, junto con el tipo de asignación del elemento de línea del manifiesto y si se trata del documento de formación. include/exclude
-
prelabeling-refs: (obligatorio) Una lista de archivos de la respuesta asíncrona de la API Amazon Textract al archivo source-ref. Cada archivo de prelabeling-refs debe contener una propiedad de bloque, con un máximo de 1000 bloques.
-
prelabeling-ref (obligatorio) La ubicación en Amazon S3 de las anotaciones automáticas de la imagen mediante la API Amazon Textract.
-
prelabeling-ref-version (opcional) La versión objeto de Amazon S3 del archivo de preetiquetado.
-
asignación: (Obligatorio) Especifique «ENTRENAMIENTO» si la imagen pertenece al conjunto de datos de entrenamiento. De lo contrario, usa «TESTING».
-
include: (Obligatorio) Especifique true para incluir la línea de pedido para la formación. De lo contrario, utilice false.
-
schema-version: versión (opcional) del archivo de manifiesto. El valor válido es 1.0.
Para obtener mejoras de precisión óptimas, consultePrácticas recomendadas para las consultas personalizadas de Amazon Textract.
Anotar los documentos con consultas y respuestas
Al anotar sus documentos, puede optar por etiquetarlos automáticamente mediante la función de consultas previamente entrenada y, a continuación, editar las etiquetas cuando sea necesario. Como alternativa, puedes etiquetar manualmente las respuestas para cada una de tus consultas de documentos.
Al etiquetar manualmente los documentos, Amazon Textract extrae el texto sin procesar del documento. Una vez extraído el texto sin procesar, puede utilizar la interfaz de Consola de administración de AWS anotación para crear consultas para sus documentos. Vincule estas consultas con las respuestas pertinentes de sus documentos para establecer una «verdad básica» para la formación.
Al etiquetar automáticamente los documentos, se especifican las consultas adecuadas para el documento. Cuando termine de añadir consultas a los documentos, Amazon Textract intentará extraer los elementos adecuados de los documentos y generar anotaciones. A continuación, debe verificar la precisión de estas anotaciones y corregir las que sean incorrectas. Al vincular las consultas a las respuestas, enseña al modelo qué información es importante en sus documentos.
Al crear consultas, tenga en cuenta los tipos de preguntas que tendrá que hacer para recuperar los datos relevantes de sus documentos. Para obtener más información sobre esta estructura de respuesta, consulte Estructuras de respuesta a consultas. Para obtener más información sobre las prácticas recomendadas para las consultas, consulte Prácticas recomendadas para las consultas.
Necesitará capacitar a un adaptador para que utilice muestras representativas de sus documentos. Al utilizar el Consola de administración de AWS para anotar los documentos, la consola prepara estos archivos automáticamente.