Amazon Kendra non è più aperto a nuovi clienti. Per funzionalità simili a Amazon Kendra, esplora le Knowledge Bases di Amazon Bedrock. Ulteriori informazioni.
Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Documenti
Questa sezione spiega come Amazon Kendra indicizza i numerosi formati di documento supportati e i diversi fields/attributes documenti.
Tipi o formati di documento
Amazon Kendra supporta i tipi o i formati di documenti più diffusi come PDF, HTML PowerPoint, Word e altri. Un indice può contenere più formati di documento.
Amazon Kendra estrae il contenuto all'interno dei documenti per renderli ricercabili. I documenti vengono analizzati in modo da ottimizzare la ricerca sul testo estratto e su qualsiasi contenuto tabulare (tabelle HTML) all'interno dei documenti. Ciò significa strutturare i documenti in campi o attributi utilizzati per la ricerca. I metadati del documento, ad esempio la data dell'ultima modifica, possono essere campi utili per la ricerca.
I documenti possono essere organizzati in righe e colonne. Ad esempio, ogni documento è una riga e ogni documento field/attribute, come il titolo e il contenuto del corpo, è una colonna. Ad esempio, se si utilizza un database come origine dati, i dati devono essere strutturati o organizzati in righe e colonne.
Puoi aggiungere documenti all'indice nei seguenti modi:
Se desideri aggiungere un file FAQ, usi l'CreateFaqAPI per aggiungere il file archiviato in un Amazon S3 bucket. Puoi scegliere tra un formato CSV di base, un formato CSV che include elementi personalizzati fields/attributes in un'intestazione e un formato JSON che include campi personalizzati. Il formato predefinito è CSV di base.
Di seguito vengono fornite informazioni su ciascun formato di documento supportato e su come Amazon Kendra trattare ciascun formato durante l'indicizzazione dei documenti.
| Formato del documento | Trattato come | Come viene trattato | Struttura originale |
|---|---|---|---|
| Portable Document Format (PDF) | HTML | Convertito in HTML, quindi il contenuto viene estratto. | Non strutturato |
| HyperText Linguaggio di markup (HTML) | HTML | I tag HTML vengono filtrati per estrarre il contenuto. Il contenuto deve essere compreso tra i tag principali di HTML inizio e di chiusura (<HTML>content</HTML>). |
Semi-structured |
| Extensible Markup Language (XML) | XML | I tag XML vengono filtrati per estrarre il contenuto. | Semi-structured |
| Extensible Stylesheet Language Transformation (XSLT) | XSLT | I tag vengono filtrati per estrarre il contenuto. | Semi-structured |
| MarkDown (MD) | Testo semplice | Il contenuto viene estratto con la MarkDown sintassi inclusa. | Semi-structured |
| Comma Separated Values (CSV) | CSV | Contenuto estratto da ogni cella, con un singolo file trattato come risultato di un singolo documento. | Strutturato per i file delle domande frequenti, altrimenti semi-strutturato |
| Microsoft Excel (XLS e XLSX) | XLS e XLSX | Contenuto estratto da ogni cella, con un singolo file trattato come risultato di un singolo documento. | Semi-structured |
| JavaScript Notazione degli oggetti (JSON) | Testo semplice | Il contenuto viene estratto con la sintassi JSON inclusa. | Semi-structured |
| Rich Text Format (RTF) | RTF | La sintassi RTF viene filtrata per estrarre il contenuto. | Semi-structured |
| Microsoft PowerPoint (PPT) | PPT, PPTX | Solo il contenuto testuale viene estratto dalle PowerPoint diapositive per la ricerca. Le immagini e gli altri contenuti non vengono estratti. | Non strutturato |
| Microsoft Word | DOC, DOCX | Solo il contenuto testuale viene estratto dalle pagine di Word per la ricerca. Le immagini e gli altri contenuti non vengono estratti. | Non strutturato |
| Testo normale (.txt) | TXT | Viene estratto tutto il testo del documento di testo. | Non strutturato |
Attributi o campi del documento
A un documento sono associati attributi o campi. I campi di un documento sono le proprietà di un documento o ciò che è contenuto nella struttura di un documento. Ad esempio, ogni documento potrebbe contenere titolo, corpo del testo e autore. Puoi anche aggiungere campi personalizzati per i tuoi documenti particolari. Ad esempio, se l'indice cerca documenti fiscali, puoi specificare un campo personalizzato per il tipo di documento fiscale W-2, ad esempio 1099 e così via.
Prima di poter utilizzare un campo del documento in una query, è necessario mapparlo a un campo indice. Ad esempio, il campo del titolo può essere mappato al campo. _document_title Per ulteriori informazioni, consulta Mappatura dei campi. Per aggiungere un nuovo campo, è necessario creare un campo indice a cui mappare il campo. È possibile creare campi indice utilizzando la console o utilizzando l'UpdateIndexAPI.
Puoi utilizzare i campi del documento per filtrare le risposte e creare risultati di ricerca sfaccettati. Ad esempio, puoi filtrare una risposta per restituire solo una versione specifica di un documento oppure puoi filtrare le ricerche per restituire solo i documenti fiscali di tipo 1099 che corrispondono al termine di ricerca. Per ulteriori informazioni, consulta Filtraggio e ricerca per facet.
È inoltre possibile utilizzare i campi del documento per regolare manualmente la risposta alla query. Ad esempio, puoi scegliere di aumentare l'importanza del campo del titolo per aumentare il peso Amazon Kendra assegnato al campo nel determinare quali documenti restituire nella risposta. Per ulteriori informazioni, consulta Ottimizzazione della pertinenza della ricerca.
Se stai aggiungendo un documento direttamente a un indice, specifica i campi nel parametro di input del documento all'BatchPutDocumentAPI. Specificate i valori dei campi personalizzati in una matrice di DocumentAttribute oggetti. Se si utilizza un'origine dati, il metodo utilizzato per aggiungere i campi del documento dipende dall'origine dati. Per ulteriori informazioni, consulta la sezione Mappatura dei campi di origine dei dati.
Utilizzo Amazon Kendra campi di documento riservati o comuni
Con l'UpdateIndex API, puoi creare campi riservati o comuni utilizzando DocumentMetadataConfigurationUpdates e specificando il nome del campo indice Amazon Kendra
riservato da mappare al attribute/field nome del documento equivalente. Puoi anche creare campi personalizzati. Se si utilizza un connettore di origine dati, la maggior parte include mappature dei campi che associano i campi del documento di origine dati ai campi Amazon Kendra dell'indice. Se si utilizza la console, è possibile aggiornare i campi selezionando l'origine dati, selezionando l'azione di modifica e quindi procedendo accanto alla sezione delle mappature dei campi per la configurazione dell'origine dati.
È possibile configurare l'Searchoggetto per impostare un campo come visualizzabile, sfaccettabile, ricercabile e ordinabile. È possibile configurare l'Relevanceoggetto per impostare l'ordine di classificazione, la durata dell'incremento o il periodo di tempo da applicare ai valori di incremento, aggiornamento, valore di importanza e valori di importanza mappati a valori di campo specifici. Se si utilizza la console, è possibile impostare le impostazioni di ricerca per un campo selezionando l'opzione facet nel menu di navigazione. Per impostare l'ottimizzazione della pertinenza, seleziona l'opzione per cercare nell'indice nel menu di navigazione, inserisci una query e utilizza le opzioni del pannello laterale per ottimizzare la pertinenza della ricerca. Non è possibile modificare il tipo di campo dopo averlo creato.
Amazon Kendra ha i seguenti campi di documento riservati o comuni che puoi usare:
-
_authors—Un elenco di uno o più autori responsabili del contenuto del documento. -
_category—Una categoria che inserisce un documento in un gruppo specifico. -
_created_at—La data e l'ora in formato ISO 8601 in cui il documento è stato creato. Ad esempio, 2012-03-25 T12:30:10 + 01:00 è il formato di data e ora ISO 8601 per il 25 marzo 2012 alle 12:30 (più 10 secondi) nell'ora dell'Europa centrale. -
_data_source_id—L'identificatore dell'origine dati che contiene il documento. -
_document_body—Il contenuto del documento. -
_document_id—Un identificatore univoco per il documento. -
_document_title—Il titolo del documento. -
_excerpt_page_number—Il numero di pagina in un file PDF in cui appare l'estratto del documento. Se l'indice è stato creato prima dell'8 settembre 2020, è necessario reindicizzare i documenti prima di poter utilizzare questo attributo. -
_faq_id—Se si tratta di un documento di tipo domanda-risposta (FAQ), un identificatore univoco per le FAQ. -
_file_type—Il tipo di file del documento, ad esempio pdf o doc. -
_last_updated_at—La data e l'ora in formato ISO 8601 dell'ultimo aggiornamento del documento. Ad esempio, 2012-03-25 T12:30:10 + 01:00 è il formato di data e ora ISO 8601 per il 25 marzo 2012 alle 12:30 (più 10 secondi) nell'ora dell'Europa centrale. -
_source_uri—L'URI in cui il documento è disponibile. Ad esempio, l’URI del documento su un sito web aziendale. -
_version—Un identificatore per la versione specifica di un documento. -
_view_count—Il numero di volte in cui il documento è stato visualizzato. -
_language_code(String): il codice di una lingua applicabile al documento. Il valore predefinito è l'inglese se non si specifica una lingua. Per ulteriori informazioni sulle lingue supportate, inclusi i relativi codici, vedi Aggiungere documenti in lingue diverse dall'inglese.
Per i campi personalizzati, puoi crearli utilizzando DocumentMetadataConfigurationUpdates l'UpdateIndexAPI, proprio come quando crei un campo riservato o comune. È necessario impostare il tipo di dati appropriato per il campo personalizzato. Se si utilizza la console, è possibile aggiornare i campi selezionando l'origine dati, selezionando l'azione di modifica e quindi procedendo accanto alla sezione delle mappature dei campi per la configurazione dell'origine dati. Alcune origini dati non supportano l'aggiunta di nuovi campi o campi personalizzati. Non è possibile modificare il tipo di campo dopo averlo creato.
Di seguito sono riportati i tipi che è possibile impostare per i campi personalizzati:
-
Data
-
Numero
-
Stringa
-
Elenco stringhe
Se hai aggiunto documenti all'indice utilizzando l'BatchPutDocumentAPI, Attributes elenca fields/attributes i tuoi documenti e crei campi utilizzando l'DocumentAttributeoggetto.
Per i documenti indicizzati da un'origine Amazon S3 dati, crei campi utilizzando un file di metadati JSON che include le informazioni sui campi.
Se utilizzi un database supportato come origine dati, puoi configurare i campi utilizzando l'opzione di mappatura dei campi. https://docs.aws.amazon.com/kendra/latest/dg/data-source-database.html#data-source-procedure-database