View a markdown version of this page

Documents - Amazon Kendra

Amazon Kendra n'est plus ouvert aux nouveaux clients. Pour des fonctionnalités similaires à Amazon Kendra, explorez les bases de connaissances Amazon Bedrock. En savoir plus.

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Documents

Cette section explique comment Amazon Kendra indexe les nombreux formats de documents qu'elle prend en charge et les différents fields/attributes documents.

Types ou formats de documents

Amazon Kendra prend en charge les types ou formats de documents courants tels que PDF, HTML PowerPoint, Word, etc. Un index peut contenir plusieurs formats de document.

Amazon Kendra extrait le contenu des documents afin de rendre les documents consultables. Les documents sont analysés de manière à optimiser la recherche sur le texte extrait et sur tout contenu tabulaire (tableaux HTML) des documents. Cela implique de structurer les documents en champs ou attributs utilisés pour la recherche. Les métadonnées du document, telles que la date de dernière modification, peuvent être des champs utiles pour la recherche.

Les documents peuvent être organisés en lignes et en colonnes. Par exemple, chaque document est une ligne et chaque document field/attribute, tel que le titre et le corps du texte, est une colonne. Par exemple, si vous utilisez une base de données comme source de données, celles-ci doivent être structurées ou organisées en lignes et en colonnes.

Vous pouvez ajouter des documents à votre index de différentes manières :

Si vous souhaitez ajouter un fichier FAQ, vous pouvez utiliser l'CreateFaqAPI pour ajouter le fichier stocké dans un Amazon S3 bucket. Vous pouvez choisir entre un format CSV de base, un format CSV qui inclut des éléments personnalisés fields/attributes dans un en-tête et un format JSON qui inclut des champs personnalisés. Le format par défaut est CSV de base.

Vous trouverez ci-dessous des informations sur chaque format de document pris en charge et sur la manière dont Amazon Kendra chaque format est traité lors de l'indexation de documents.

Format du document Traité comme Comment le document est traité Structure originale
Format de document portable (PDF) HTML Converti en HTML, le contenu est ensuite extrait. Non structuré
HyperText Langage de balisage (HTML) HTML Les balises HTML sont filtrées pour extraire le contenu. Le contenu doit se situer entre les balises principales de HTML début et de fermeture (<HTML>content</HTML>). Semi-structured
XML (Extensible Markup Language) xml Les balises XML sont filtrées pour extraire le contenu. Semi-structured
Transformation du langage de feuille de style extensible (XSLT) XSLT Les balises sont filtrées pour en extraire le contenu. Semi-structured
MarkDown (MARYLAND) Texte brut Le contenu est extrait avec MarkDown la syntaxe incluse. Semi-structured
Valeurs séparées par des virgules (CSV) CSV Contenu extrait de chaque cellule, un seul fichier étant traité comme un résultat de document unique. Structuré pour les fichiers FAQ, sinon semi-structuré
Microsoft Excel (XLS et XLSX) XLS et XLSX Contenu extrait de chaque cellule, un seul fichier étant traité comme un résultat de document unique. Semi-structured
JavaScript Notation d'objet (JSON) Texte brut Le contenu est extrait avec la syntaxe JSON incluse. Semi-structured
Format de texte enrichi (RTF) RTF La syntaxe RTF est filtrée pour extraire le contenu. Semi-structured
Microsoft PowerPoint (PPT) PPT, PPTX Seul le contenu textuel est extrait des PowerPoint diapositives à des fins de recherche. Les images et autres contenus ne sont pas extraits. Non structuré
Microsoft Word DOC, DOCX Seul le contenu textuel est extrait des pages Word à des fins de recherche. Les images et autres contenus ne sont pas extraits. Non structuré
Texte brut (TXT) TXT Tout le texte du document texte est extrait. Non structuré

Attributs ou champs du document

Un document est associé à des attributs ou à des champs. Les champs d'un document sont les propriétés d'un document ou le contenu de la structure d'un document. Par exemple, chacun de vos documents peut contenir le titre, le corps du texte et l'auteur. Vous pouvez également ajouter des champs personnalisés pour vos documents spécifiques. Par exemple, si votre index recherche des documents fiscaux, vous pouvez spécifier un champ personnalisé pour le type de document fiscal W-2, tel que 1099, etc.

Avant de pouvoir utiliser un champ de document dans une requête, il doit être mappé à un champ d'index. Par exemple, le champ de titre peut être mappé au champ_document_title. Pour plus d'informations, consultez la section Mappage des champs. Pour ajouter un nouveau champ, vous devez créer un champ d'index auquel mapper le champ. Vous créez des champs d'index à l'aide de la console ou de l'UpdateIndexAPI.

Vous pouvez utiliser les champs du document pour filtrer les réponses et créer des résultats de recherche à facettes. Par exemple, vous pouvez filtrer une réponse pour ne renvoyer qu'une version spécifique d'un document, ou vous pouvez filtrer les recherches pour ne renvoyer que les documents fiscaux de type 1099 correspondant au terme de recherche. Pour plus d'informations, voir Filtrage et recherche par facettes.

Vous pouvez également utiliser les champs du document pour ajuster manuellement la réponse à la requête. Par exemple, vous pouvez choisir d'augmenter l'importance du champ de titre pour augmenter le poids qui lui est Amazon Kendra attribué lors de la détermination des documents à renvoyer dans la réponse. Pour plus d'informations, consultez la section Régler la pertinence de la recherche.

Si vous ajoutez un document directement à un index, vous spécifiez les champs dans le paramètre d'entrée Document de l'BatchPutDocumentAPI. Vous spécifiez les valeurs des champs personnalisés dans un tableau d'DocumentAttributeobjets. Si vous utilisez une source de données, la méthode que vous utilisez pour ajouter les champs du document dépend de la source de données. Pour plus d’informations, consultez Mappage des champs de source de données.

Utilisation Amazon Kendra champs de document réservés ou communs

Grâce à l'UpdateIndex API, vous pouvez créer des champs réservés ou communs en utilisant DocumentMetadataConfigurationUpdates et en spécifiant le nom du champ d'index Amazon Kendra réservé pour le mapper au attribute/field nom de votre document équivalent. Vous pouvez également créer des champs personnalisés. Si vous utilisez un connecteur de source de données, la plupart incluent des mappages de champs qui font correspondre les champs de votre document de source de données aux champs d' Amazon Kendra index. Si vous utilisez la console, vous mettez à jour les champs en sélectionnant votre source de données, en sélectionnant l'action de modification, puis en passant à côté de la section des mappages de champs pour configurer la source de données.

Vous pouvez configurer l'Searchobjet pour définir un champ comme affichable, facetable, consultable et triable. Vous pouvez configurer l'Relevanceobjet pour définir l'ordre de classement, la durée ou la période de renforcement d'un champ à appliquer au renforcement, à la fraîcheur, à la valeur d'importance et aux valeurs d'importance mappées à des valeurs de champ spécifiques. Si vous utilisez la console, vous pouvez définir les paramètres de recherche d'un champ en sélectionnant l'option facette dans le menu de navigation. Pour définir le réglage de la pertinence, sélectionnez l'option permettant de rechercher dans votre index dans le menu de navigation, saisissez une requête et utilisez les options du panneau latéral pour ajuster la pertinence de la recherche. Vous ne pouvez pas modifier le type de champ une fois que vous l'avez créé.

Amazon Kendra comporte les champs de document réservés ou communs suivants que vous pouvez utiliser :

  • _authors—Une liste d'un ou de plusieurs auteurs responsables du contenu du document.

  • _category—Une catégorie qui place un document dans un groupe spécifique.

  • _created_at—La date et l'heure au format ISO 8601 auxquelles le document a été créé. Par exemple, 2012-03-25 T12:30:10 + 01:00 est le format de date et heure ISO 8601 pour le 25 mars 2012 à 12 h 30 (plus 10 secondes), heure d'Europe centrale.

  • _data_source_id: identifiant de la source de données qui contient le document.

  • _document_body—Le contenu du document.

  • _document_id—Un identifiant unique pour le document.

  • _document_title—Le titre du document.

  • _excerpt_page_number—Le numéro de page d'un fichier PDF où apparaît l'extrait du document. Si votre index a été créé avant le 8 septembre 2020, vous devez réindexer vos documents avant de pouvoir utiliser cet attribut.

  • _faq_id—S'il s'agit d'un document de type question-réponse (FAQ), identifiant unique pour la FAQ.

  • _file_type—Le type de fichier du document, tel que pdf ou doc.

  • _last_updated_at—Date et heure au format ISO 8601 auxquelles le document a été mis à jour pour la dernière fois. Par exemple, 2012-03-25 T12:30:10 + 01:00 est le format de date et heure ISO 8601 pour le 25 mars 2012 à 12 h 30 (plus 10 secondes), heure d'Europe centrale.

  • _source_uri—L'URI dans lequel le document est disponible. Par exemple, l’URI du document sur le site Web d’une entreprise.

  • _version: identifiant de la version spécifique d'un document.

  • _view_count—Le nombre de fois que le document a été consulté.

  • _language_code(String) : code d'une langue qui s'applique au document. La valeur par défaut est l'anglais si vous ne spécifiez aucune langue. Pour plus d'informations sur les langues prises en charge, y compris leurs codes, voir Ajout de documents dans une langue autre que l'anglais.

Pour les champs personnalisés, vous créez ces champs à l'DocumentMetadataConfigurationUpdatesaide de l'UpdateIndexAPI, comme vous le faites lorsque vous créez un champ réservé ou commun. Vous devez définir le type de données approprié pour votre champ personnalisé. Si vous utilisez la console, vous mettez à jour les champs en sélectionnant votre source de données, en sélectionnant l'action de modification, puis en passant à côté de la section des mappages de champs pour configurer la source de données. Certaines sources de données ne prennent pas en charge l'ajout de nouveaux champs ou de champs personnalisés. Vous ne pouvez pas modifier le type de champ une fois que vous l'avez créé.

Les types que vous pouvez définir pour les champs personnalisés sont les suivants :

  • Date

  • Number

  • Chaîne

  • Liste de chaînes

Si vous avez ajouté des documents à l'index à l'aide fields/attributes de l'BatchPutDocumentAPI, Attributes répertoriez vos documents et créez des champs à l'aide de l'DocumentAttributeobjet.

Pour les documents indexés à partir d'une source de Amazon S3 données, vous créez des champs à l'aide d'un fichier de métadonnées JSON qui inclut les informations des champs.

Si vous utilisez une base de données compatible comme source de données, vous pouvez configurer vos champs à l'aide de l'option de mappage des champs.