View a markdown version of this page

Mejores prácticas para las consultas personalizadas de Amazon Textract - Amazon Textract

Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.

Mejores prácticas para las consultas personalizadas de Amazon Textract

Amazon Textract le permite personalizar el resultado de su función de consultas previamente entrenada mediante el entrenamiento y el uso de un adaptador para su modelo base. Con las consultas personalizadas de Amazon Textract, puede usar sus propios documentos y entrenar un adaptador para personalizar el modelo base, sin perder el control sobre sus documentos propietarios. Al crear consultas para sus adaptadores, utilice las siguientes prácticas recomendadas. Para obtener más información sobre los adaptadores, consultePersonalización de las respuestas a las consultas.

  1. Los datos de muestra deben contener variaciones de diseño e imágenes que sean representativas de los documentos que se van a utilizar en la producción.

  2. Se requiere un mínimo de cinco muestras (por nivel de consulta) para la formación o las pruebas. Cuantas más muestras se utilicen para la formación, mejor.

  3. Las consultas anotadas deben tener una variedad de respuestas. Por ejemplo, si la respuesta a una consulta es «Sí» o «No», en las muestras anotadas deben aparecer tanto «Sí» como «No»

  4. Las consultas compuestas deben tener estructuras y significados lógicos. Por ejemplo, para extraer el nombre del beneficiario del cheque, la consulta debe ser «¿Quién es el beneficiario?» y no «¿Cuál es el nombre?».

  5. Si un valor que debe extraerse tiene una clave asociada, inclúyala en la consulta para obtener mejores resultados. Si hay claves que aparecen varias veces, utilice preguntas jerárquicas como «¿Cuál es el nombre del prestatario?» y «¿Cuál es el nombre del coprestatario?»

  6. Mantenga la coherencia en el estilo de anotación. Si un campo aparece en varios lugares de un documento y decide anotar solo una aparición, siga las mismas instrucciones y anote solo una aparición en todos los documentos. Como alternativa, si opta por anotar todas las apariciones de un valor, siga el mismo proceso para todos los documentos.

  7. Mantén la coherencia al anotar los campos con espacios. Si el valor de un campo es «123 456 78» y elige anotarlo como «12345678», siga las mismas instrucciones para todos los documentos. No cambie entre anotar el valor como «123 456 78» y «12345678».

  8. Anota los datos de todas las páginas de un documento, aunque podrías hacer inferencias solo en algunas páginas. Si no es posible anotar todas las páginas, divida el documento y utilice solo las páginas que pueda anotar en su conjunto de datos.

  9. Las consultas personalizadas no admiten preguntas relacionadas con las firmas (por ejemplo, «¿Está firmado el documento?»). Para saber si un documento está firmado, usa la función de firmas en tu solicitud de API.

  10. Al corregir las respuestas a partir del etiquetado previo, puedes hacer pequeñas modificaciones en el texto presentado en los documentos, como corregir algunos errores de caracteres o eliminar los espacios y la puntuación. Sin embargo, si el texto no aparece en los documentos, no lo escribas como respuesta.

  11. Usa la consulta exacta que se usó en el entrenamiento para hacer inferencias.

  12. Proporcione los resultados del preetiquetado únicamente para la source-ref página. Si tienes resultados de preetiquetado con bloques que no pertenecen a la source-ref página, esto podría afectar al rendimiento.