View a markdown version of this page

Analisi dei documenti - Amazon Textract

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

Analisi dei documenti

Amazon Textract analizza documenti e moduli per individuare le relazioni tra il testo rilevato. Le operazioni di analisi di Amazon Textract restituiscono 5 categorie di estrazione di documenti: testo, moduli, tabelle, risposte alle query e firme. L'analisi delle fatture e delle ricevute viene gestita attraverso un processo diverso, per ulteriori informazioni, consulta. Analisi di fatture e ricevute

Estrazione del testo

Il testo non elaborato estratto da un documento. Per ulteriori informazioni, consulta Righe e parole di testo.

Estrazione del modulo

I dati del modulo sono collegati agli elementi di testo estratti da un documento. Amazon Textract rappresenta i dati del modulo come coppie chiave-valore.

Nell'esempio seguente, una delle righe di testo rilevate da Amazon Textract è Name: Jane Doe. Amazon Textract identifica anche una chiave (Nome:) e un valore (Jane Doe). Per ulteriori informazioni, consulta Form data (pairs) Key-value.

Nome: Jane Doe

Indirizzo: 123 Any Street, Anytown, Stati Uniti

Data di nascita: 26-12-80

Key-value le coppie vengono utilizzate anche per rappresentare caselle di controllo o pulsanti di opzione (pulsanti di opzione) estratti dai moduli.

Maschio: ☑

Per ulteriori informazioni, vedere Elementi di selezione.

Estrazione della tabella

Amazon Textract può estrarre tabelle, celle di tabella, elementi all'interno delle celle della tabella, titoli e piè di pagina delle tabelle e il tipo di tabella. Amazon Textract può anche essere programmato per restituire i risultati in un file JSON, CSV o TXT.

Nome Indirizzo

Ana Carolina

123 Qualsiasi città

Per ulteriori informazioni, consulta Tabelle. Gli elementi di selezione possono essere estratti anche dalle tabelle. Per ulteriori informazioni, consultate Elementi di selezione.

Firme nell'analisi dei documenti

Amazon Textract è in grado di rilevare la posizione delle firme nei documenti di testo. Queste vengono restituite come oggetti geometrici con riquadri di delimitazione che indicano la posizione di una firma sulla pagina, oltre alla certezza che una firma si trovi in quella posizione. Se la funzionalità di firma viene utilizzata da sola, Amazon Textract restituirà sia le firme che i risultati di rilevamento del testo standard. Il rilevamento delle firme può essere utilizzato insieme ad altri tipi di funzionalità come moduli, tabelle e query. Quando lo si utilizza con moduli e tabelle, le firme possono essere rilevate rispettivamente come parte di una coppia chiave-valore o all'interno di una cella della tabella.

Interrogazioni nell'analisi dei documenti

Quando elabori un documento con Amazon Textract, puoi aggiungere delle domande all'analisi per specificare le informazioni di cui hai bisogno. Ciò comporta l'invio di una domanda, ad esempio «Qual è il numero di previdenza sociale del cliente?» su Amazon Textract. Amazon Textract troverà quindi le informazioni nel documento per quella domanda e le restituirà in una struttura di risposta separata dal resto delle informazioni del documento. Per ulteriori informazioni su questa struttura di risposta, consulta Query Response Structures. Per ulteriori informazioni sulle procedure consigliate per l'utilizzo delle query, vedereLe migliori pratiche per le interrogazioni. Le interrogazioni possono essere elaborate singolarmente o in combinazione con altreFeatureType, ad esempio tabelle o moduli.

Domanda di esempio: cos'è il SSN del cliente?

Esempio di risposta: 111-xx-333

Per gli articoli analizzati, Amazon Textract restituisce quanto segue in più oggetti Block:

  • Le righe e le parole del testo rilevato

  • Il contenuto degli elementi rilevati

  • La relazione tra gli elementi rilevati

  • La pagina in cui è stato rilevato l'elemento

  • La posizione dell'elemento nella pagina del documento

Interrogazioni personalizzate

Con l'analisi dei documenti di Amazon Textract, puoi personalizzare l'output del modello tramite adattatori addestrati sui tuoi documenti. Gli adattatori sono componenti che si collegano al modello di deep learning pre-addestrato di Amazon Textract, personalizzandone l'output per i documenti specifici della tua azienda. Crei un adattatore per il tuo caso d'uso specifico utilizzando annotating/labeling i tuoi documenti di esempio e addestrando l'adattatore sugli esempi annotati.

Dopo aver creato un adattatore, Amazon Textract ti fornisce un. AdapterId Puoi avere più versioni di adattatori all'interno di un unico adattatore. È possibile fornire AdapterId, insieme a un'operazione AdapterVersion, a un'operazione per specificare che si desidera utilizzare l'adattatore creato. Ad esempio, fornite i due parametri all'AnalyzeDocumentAPI per l'analisi sincrona dei documenti o l'StartDocumentAnalysisoperazione per l'analisi asincrona. Fornendoli AdapterId come parte della richiesta, l'adattatore verrà integrato automaticamente nel processo di analisi e lo utilizzerà per migliorare le previsioni per i documenti. In questo modo, è possibile sfruttare le funzionalità offerte dalla personalizzazione AnalyzeDocument del modello per adattarlo al proprio caso d'uso.

Per ulteriori informazioni sull'utilizzo dell'adattatore, consulta Personalizzazione delle risposte alle domande. Per un tutorial su come creare, addestrare e utilizzare adattatori con, consulta Console di gestione AWS. Tutorial sulle interrogazioni personalizzate

Layout nell'analisi dei documenti

Amazon Textract può essere usato per rilevare il layout di un documento trovando le posizioni di diversi elementi e le righe di testo associate. Questi elementi sono paragrafi, elenchi, intestazioni, piè di pagina, numeri di pagina, figure, tabelle, titoli e intestazioni di sezione. Quando analizza il layout di un documento, Amazon Textract restituisce una posizione del riquadro di delimitazione degli elementi del layout e il testo in tali elementi. Queste informazioni vengono restituite nell'ordine di lettura implicito del documento, elencando gli elementi dall'alto verso il basso, da sinistra a destra.

È possibile utilizzare operazioni sincrone o asincrone per analizzare il testo in un documento. Per analizzare il testo in modo sincrono, utilizzate l'AnalyzeDocumentoperazione e passate un documento come input. AnalyzeDocumentrestituisce l'intero set di risultati. Per ulteriori informazioni, consulta Analisi del testo del documento con Amazon Textract.

Per rilevare il testo in modo asincrono, utilizzare StartDocumentAnalysisper avviare l'elaborazione. Per ottenere i risultati, chiama. GetDocumentAnalysis I risultati vengono restituiti in una o più risposte daGetDocumentAnalysis. Per ulteriori informazioni e un esempio, consulta Rilevamento o analisi del testo in un documento multipagina.

Per specificare il tipo di analisi da eseguire, è possibile utilizzare il parametro di input FeatureTypes list. Aggiungi TABLES all'elenco per restituire informazioni sulle tabelle rilevate nel documento di input, ad esempio celle di tabella, testo delle celle ed elementi di selezione nelle celle. Aggiungi FORMS per restituire relazioni tra parole, come coppie chiave-valore ed elementi di selezione. Aggiungi QUERIES per specificare le informazioni che desideri che Amazon Textract cerchi nel documento e ottenere una risposta sotto forma di coppia domanda-risposta. Aggiungi LAYOUT per determinare il layout del documento. Per eseguire tutti i tipi di analisi, aggiungi TABLES, FORMS, QUERIES e LAYOUT aFeatureTypes.

Tutte le righe e le parole rilevate nel documento vengono incluse nella risposta (incluso il testo non correlato al valore diFeatureTypes).