Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Bonnes pratiques pour les requêtes personnalisées Amazon Textract
Amazon Textract vous permet de personnaliser le résultat de sa fonctionnalité de requêtes préentraînée en vous entraînant et en utilisant un adaptateur pour son modèle de base. Avec Amazon Textract Custom Queries, vous pouvez utiliser vos propres documents et former un adaptateur pour personnaliser le modèle de base, tout en gardant le contrôle de vos documents propriétaires. Lorsque vous créez des requêtes pour vos adaptateurs, appliquez les meilleures pratiques suivantes. Pour plus d'informations sur les adaptateurs, consultezPersonnalisation de vos requêtes et réponses.
-
Les exemples de données doivent contenir des variations de mise en page et des variations d'image représentatives des documents à utiliser en production.
-
Un minimum de cinq échantillons (par niveau de requête) est requis pour la formation ou les tests. Plus le nombre d'échantillons utilisés pour la formation est élevé, mieux c'est.
-
Les requêtes annotées doivent avoir une variété de réponses. Par exemple, si la réponse à une requête est « Oui » ou « Non », les échantillons annotés doivent contenir des occurrences à la fois « Oui » et « Non »,
-
Les requêtes composées doivent avoir des significations et des structures logiques. Par exemple, pour extraire le nom du bénéficiaire sur le chèque, la requête doit être « Qui est le bénéficiaire ? » et non « Quel est le nom ? ».
-
Si une clé est associée à une valeur qui doit être extraite, incluez-la dans la requête pour de meilleurs résultats. Si certaines clés apparaissent plusieurs fois, utilisez des questions hiérarchiques telles que « Quel est le prénom de l'emprunteur ? » et « Quel est le prénom du coemprunteur ? »
-
Maintenez la cohérence du style d'annotation. Si un champ apparaît à plusieurs endroits d'un document et que vous décidez de n'annoter qu'une seule occurrence, suivez les mêmes directives et n'annotez qu'une seule occurrence dans tous les documents. Sinon, si vous choisissez d'annoter toutes les occurrences d'une valeur, suivez le même processus pour tous les documents.
-
Maintenez la cohérence lorsque vous annotez les champs avec des espaces. Si la valeur d'un champ est « 123 456 78 » et si vous choisissez de l'annoter comme « 12345678 », suivez les mêmes directives pour tous les documents. Ne changez pas entre l'annotation de la valeur « 123 456 78 » et « 12345678 ».
-
Annotez les données sur toutes les pages d'un document, même s'il est possible que vous n'exécutiez des inférences que sur quelques-unes d'entre elles. S'il n'est pas possible d'annoter toutes les pages, divisez le document et utilisez uniquement les pages que vous pouvez annoter dans votre jeu de données.
-
Les requêtes personnalisées ne prennent pas en charge les questions relatives aux signatures (telles que « Le document est-il signé ? »). Pour savoir si un document est signé, utilisez la fonctionnalité de signature de votre demande d'API.
-
Lorsque vous corrigez les réponses après le pré-étiquetage, vous pouvez apporter de petites modifications au texte présenté dans les documents, par exemple en corrigeant quelques erreurs de caractères ou en supprimant les espaces et les signes de ponctuation. Mais si le texte n'apparaît pas dans les documents, ne le saisissez pas comme réponse.
-
Utilisez la requête exacte utilisée lors de l'entraînement pour l'inférence.
-
Fournissez des résultats de pré-étiquetage uniquement pour la
source-refpage. Si vous avez préétiqueté des résultats avec des blocs qui ne figurent passource-refsur la page, cela peut avoir un impact sur les performances.