Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Meilleures pratiques pour les requêtes personnalisées Amazon Textract
Amazon Textract vous permet de personnaliser la sortie de sa fonction de requêtes préentraînée en effectuant une formation et en utilisant un adaptateur pour son modèle de base. Avec Amazon Textract Custom Queries, vous pouvez utiliser vos propres documents et former un adaptateur pour personnaliser le modèle de base, tout en gardant le contrôle de vos documents propriétaires. Lorsque vous créez des requêtes pour vos adaptateurs, suivez les bonnes pratiques suivantes. Pour plus d'informations sur les adaptateurs, consultezPersonnalisation des réponses à vos requêtes.
-
Les exemples de données doivent contenir des variations de mise en page et des variations d'image représentatives des documents à utiliser en production.
-
Un minimum de cinq échantillons (par niveau de requête) est requis pour la formation ou les tests. Plus il y a d'échantillons utilisés pour la formation, mieux c'est.
-
Les requêtes annotées doivent comporter différentes réponses. Par exemple, si la réponse à une requête est « Oui » ou « Non », les exemples annotés doivent avoir des occurrences à la fois « Oui » et « Non »,
-
Les requêtes composées doivent avoir des significations et des structures logiques. Par exemple, pour extraire le nom du bénéficiaire sur le chèque, la requête doit être « Qui est le bénéficiaire ? » et non « Quel est le nom ? ».
-
Si une clé est associée à une valeur qui doit être extraite, incluez cette clé dans la requête pour obtenir de meilleurs résultats. Si certaines clés apparaissent plusieurs fois, utilisez des questions hiérarchiques telles que « Quel est le prénom de l'emprunteur ? » et « Quel est le prénom du coemprunteur ? »
-
Maintenez la cohérence du style d'annotation. Si un champ apparaît à plusieurs endroits sur un document et que vous décidez de n'annoter qu'une seule occurrence, suivez les mêmes instructions et annotez une seule occurrence dans tous les documents. Sinon, si vous choisissez d'annoter toutes les occurrences d'une valeur, suivez le même processus pour tous les documents.
-
Maintenez la cohérence tout en annotant les champs à l'aide d'espaces. Si la valeur d'un champ est « 123 456 78 » et si vous choisissez de l'annoter comme « 12345678 », suivez les mêmes instructions pour tous les documents. Ne changez pas entre l'annotation de la valeur « 123 456 78 » et « 12345678 ».
-
Annotez les données sur toutes les pages d'un document, même s'il est possible que vous ne fassiez des inférences que sur quelques pages. S'il n'est pas possible d'annoter toutes les pages, divisez le document et utilisez uniquement les pages que vous pouvez annoter dans votre jeu de données.
-
Les requêtes personnalisées ne prennent pas en charge les questions relatives aux signatures (telles que « Le document est-il signé ? »). Pour savoir si un document est signé, utilisez la fonction de signature dans votre demande d'API.
-
Lorsque vous corrigez des réponses issues du préétiquetage, vous pouvez apporter de petites modifications au texte présenté dans les documents, par exemple en corrigeant quelques erreurs de caractères ou en supprimant les espaces et la ponctuation. Mais si le texte n'apparaît pas dans les documents, ne le saisissez pas comme réponse.
-
Utilisez la requête exacte utilisée lors de la formation pour l'inférence.
-
Fournissez les résultats de pré-étiquetage uniquement pour la
source-refpage. Si vous présélectionnez les résultats avec des blocs qui ne proviennent pas de lasource-refpage, cela peut avoir un impact sur les performances.