View a markdown version of this page

Tutorial sulle interrogazioni personalizzate - Amazon Textract

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

Tutorial sulle interrogazioni personalizzate

Questo tutorial mostra come creare, addestrare, valutare, utilizzare e gestire gli adattatori.

Con gli adattatori, puoi migliorare la precisione delle operazioni dell'API Amazon Textract, personalizzando il comportamento del modello in base alle tue esigenze e ai tuoi casi d'uso. Dopo aver creato un adattatore con questo tutorial, puoi utilizzarlo per analizzare i tuoi documenti con l'operazione AnalyzeDocumentAPI e anche riaddestrare l'adattatore per futuri miglioramenti.

In questo tutorial, apprenderai come:

  • Crea un adattatore utilizzando. Console di gestione AWS

  • Crea un set di dati per addestrare il tuo adattatore.

  • Annota i dati di allenamento.

  • Addestra il tuo adattatore sul tuo set di dati di allenamento.

  • Verifica le prestazioni del tuo adattatore.

  • Riqualifica l'adattatore.

  • Usa l'adattatore per l'analisi dei documenti.

  • Eliminare l'adattatore.

Prerequisiti

Prima di iniziare, ti consigliamo di leggereCreazione di adattatori.

È inoltre necessario configurare l' AWS account e installare e configurare un AWS SDK. Per le istruzioni di configurazione dell'SDK, consulta. Passaggio 2: configura il AWS CLI and AWS SDK

Crea un adattatore

Prima di poter addestrare o utilizzare un adattatore, è necessario crearne uno. Per creare un adattatore:

  1. Accedi Console di gestione AWS e apri la console Amazon Textract.

  2. Nel riquadro a sinistra, scegli Query personalizzate. Viene visualizzata la pagina iniziale di Amazon Textract Custom Queries.

    Self-service interfaccia che mostra la funzionalità Amazon Textract Custom Queries per migliorare la precisione dell'estrazione delle informazioni sui documenti aziendali, con icone che ne illustrano i vantaggi e le fasi del flusso di lavoro come la creazione di adattatori, il caricamento di campioni, l'etichettatura, i modelli di formazione e il controllo delle metriche delle prestazioni.
  3. La pagina di destinazione Custom Queries mostra un elenco di tutti i tuoi adattatori e c'è anche un pulsante per creare un adattatore. Scegli Crea adattatore per creare il tuo adattatore. Il numero di corsi di formazione di successo che possono essere eseguiti ogni mese è limitato per AWS account. Imposta le quote in Amazon TextractPer ulteriori informazioni sui limiti, fare riferimento a.

    L'elenco degli adattatori è vuoto con il messaggio «Nessun adattatore» e il pulsante «Crea adattatore».
  4. Nella pagina seguente, inserisci il nome dell'adattatore, scegli se aggiornare automaticamente l'adattatore e, facoltativamente, aggiungervi dei tag. Quindi, seleziona Crea adattatore. Se scegli «aggiornamento automatico», Amazon Textract aggiornerà automaticamente l'adattatore quando la funzionalità Queries preaddestrata viene aggiornata.

Dopo aver creato l'adattatore, potrai visualizzarne i dettagli, inclusi il nome e l'ID dell'adattatore. La presenza di questi dettagli verifica che l'adattatore sia stato creato correttamente.

È ora possibile creare i set di dati che verranno utilizzati per addestrare e testare l'adattatore.

Creazione di set di dati

In questo passaggio, crei un set di dati di addestramento e un set di dati di test caricando immagini dal tuo computer locale o da un bucket Amazon S3. Per ulteriori informazioni sui set di dati, consulta Rilevamento del testo Preparazione dei set di dati di addestramento e test

Quando carichi immagini dal tuo computer locale, puoi caricare fino a 30 immagini contemporaneamente. Se hai un gran numero di immagini da caricare, valuta la possibilità di creare i set di dati importando le immagini da un bucket Amazon S3.

  1. Per iniziare a creare il set di dati, scegli l'adattatore dall'elenco degli adattatori, quindi scegli Crea set di dati.

    Pagina Textract Custom Queries per my-test-adapter che mostra i passaggi per creare set di dati, query, verificare documenti, addestrare l'adattatore, controllare le metriche delle prestazioni e migliorare l'adattatore.
  2. Nella sezione Configurazione del set di dati, scegli Divisione manuale o Split automatico. Con la suddivisione manuale, puoi specificare singole immagini come parte dei set di dati di addestramento e test. Se scegliete Autosplit, definirà automaticamente i set di allenamento e test quando caricherete tutte le immagini. La suddivisione manuale è consigliata per le persone che utilizzano adattatori per la prima volta. Per ora, scegli Autosplit.

    Interfaccia che mostra le opzioni per creare un set di dati per Amazon Textract: suddivisione manuale per fornire autonomamente i set di addestramento e test o Autosplit per consentire a Textract di suddividersi automaticamente in set di formazione e test. Importa documenti dal bucket S3 o dai file locali.
  3. Nella sezione Dettagli del set di dati di formazione, puoi scegliere Carica documenti dal tuo computer o Importa documenti dal bucket S3. Se scegli di importare i tuoi documenti da un bucket Amazon S3, fornisci il percorso del bucket e della cartella che contiene le immagini di allenamento. Se carichi i documenti direttamente dal tuo computer, tieni presente che puoi caricare solo 30 documenti alla volta. Ai fini di questo tutorial, scegli Carica documenti dal tuo computer.

  4. Nella sezione Dettagli del set di dati di test, puoi scegliere Carica documenti dal tuo computer o Importa documenti dal bucket S3. Ai fini di questo tutorial, scegli Carica documenti dal tuo computer.

  5. Scegli Crea set di dati.

  6. Dopo aver creato il set di dati, verrai indirizzato a una pagina dei dettagli del set di dati. La pagina dei dettagli del set di dati mostra un elenco di tutti i documenti dell'intero set di dati e a quale parte del set di dati (training o test) è stato assegnato il documento. Visualizzalo nella colonna Set di dati assegnato a. È inoltre possibile visualizzare quanto segue:

    • Nome del documento

    • Stato del documento

    • Numero di pagine del documento

    • Tipo di documento

    • Dimensioni dei documenti

    • Se il documento fa parte del set di formazione o del set di test

  7. Seleziona Aggiungi documenti al set di dati e aggiungi almeno cinque documenti ai set di dati di formazione e test. Se in precedenza hai selezionato Autosplit, puoi aggiungere tutti i documenti contemporaneamente.

  8. Se desideri aggiungere altri documenti al tuo set di dati, usa il menu Aggiungi documenti per farlo.

Prima di iniziare ad addestrare l'adattatore, è necessario annotare i documenti di formazione con Queries. Ciò è necessario per creare le voci «annotations-ref» del file manifest. Dopo aver aggiunto tutti i documenti al set di formazione o di test, puoi iniziare il processo di annotazione.

Annotazione e verifica

In questo passaggio, assegni Query ed etichette a ogni documento che hai caricato nei tuoi set di dati di formazione e test. Collegate una Query alle risposte pertinenti su una pagina del documento con lo strumento di annotazione Console di gestione AWS .

Per assegnare domande e risposte ai tuoi documenti:

  1. Seleziona Crea interrogazioni dalla pagina iniziale di Adapter.

    Per annotare automaticamente i documenti, crea delle interrogazioni da utilizzare con il modello pre-addestrato di Textract selezionando il pulsante «Crea interrogazioni».
  2. Aggiungi una query inserendola nella casella di testo.

    Interfaccia per la creazione di query su Amazon Textract, con una casella di testo per «Specificare le query che Textract può utilizzare per estrarre le informazioni necessarie». La domanda di esempio mostrata è «Qual è l'importo dell'assegno?»
  3. Per aggiungere altre interrogazioni, scegli Aggiungi nuova interrogazione. Le interrogazioni possono avere una risposta di tipo «testo non elaborato» o una risposta «binaria -». Yes/No Per creare un'interrogazione con una risposta binaria, utilizzare l'impostazione avanzata.

    Interfaccia per la creazione di interrogazioni di estrazione di testo su file di documenti. Consente di specificare tipi di risposta in formato testo non elaborato o binario (yes/no) per ogni richiesta di query. L'interfaccia dispone di campi per l'immissione del testo della query, la selezione del tipo di risposta e l'aggiunta di nuove interrogazioni.
  4. Dopo aver creato le interrogazioni, è necessario assegnare delle etichette ai documenti. Per impostare le etichette per i documenti, seleziona Auto-labelingo Etichettatura manuale. Auto-labeling è consigliato per la prima volta che si utilizza l'adattatore. Seleziona l'Auto-labellingopzione, quindi scegli Avvia etichettatura automatica.

    Auto-labeling opzione selezionata con il badge Consigliato e il pulsante Avvia etichettatura automatica.
  5. Il completamento del processo di etichettatura automatica richiederà del tempo. Al termine, riceverai una notifica che indica che «ora Auto-labeling è completato». Una volta completato il processo di etichettatura, è necessario verificare l'accuratezza dell'etichettatura. Seleziona Verifica documenti nel pannello dei dettagli dell'adattatore nella pagina Dettagli, quindi scegli Inizia la revisione dalla pagina Dataset.

    Panoramica della suddivisione del set di dati che mostra 16 documenti totali, di cui 10 nel set di allenamento e 6 nel set di test. Nessun file non valido. Lo stato indica che il set di dati è pronto per la revisione.
  6. Nello strumento di annotazione, è possibile selezionare singoli documenti e visualizzare singole pagine all'interno di tali documenti. Nella sezione «Rivedi le risposte», seleziona una query assegnata alla pagina del documento. Se la risposta alla domanda non è corretta, puoi modificare la risposta facendo clic sul pulsante Modifica relativo alla domanda.

    La schermata di revisione delle risposte mostra un esempio di nome cliente John Doe e richiede di inserire il tipo di ammortamento. Include i pulsanti Applica e Annulla.

    Per le domande con Yes/No risposte, seleziona Sì, No o Vuoto. Quindi, scegli Applica.

    Quando modificate l'OCR per l'etichetta assegnata a una query, scegliete la risposta fornita e poi disegnate un riquadro di selezione attorno a una parte dell'immagine del documento. A tale scopo, utilizzate il tasto di scelta rapida «B» o lo strumento bounding box sulla barra degli strumenti nella parte inferiore dello strumento di annotazione. Quindi, scegli Applica.

    Se una query deve avere più di un elemento di risposta (risposta), puoi aggiungere altre risposte. A tale scopo, seleziona la query, quindi scegli Aggiungi una risposta. Ti viene quindi richiesto di disegnare un riquadro di delimitazione nell'area del documento che contiene la risposta. Verifica che l'etichetta del riquadro di delimitazione sia corretta.

    Per aggiungere una nuova interrogazione per la pagina del documento, scegliete Aggiungi interrogazione. Se aggiungete una query, dovete specificare la query da aggiungere e quindi disegnare un riquadro di delimitazione per l'etichetta della query.

    Al termine, scegli Invia e Avanti per passare al documento successivo e alla serie successiva di domande e risposte. Ripeti l'operazione fino a quando non avrai esaminato tutte le domande e le risposte.

    Dopo aver esaminato e valutato tutte le domande e le risposte, seleziona Invia e chiudi.

Addestramento

Dopo aver aggiunto tutti i documenti al set di formazione o al set di test e aver esaminato le risposte generate alle domande, potete addestrare l'adattatore.

Panoramica del set di dati dell'adattatore Amazon Textract che mostra 16 documenti totali, 10 nel set di formazione, 6 nel set di test, senza file non validi. Lo stato del set di dati è la revisione delle annotazioni completa.

Per addestrare l'adattatore:

  1. Inizia facendo clic su Train adapter nella pagina di gestione del set di dati.

    Notifica che nel set di dati sono presenti abbastanza documenti per addestrare un adattatore, con un pulsante «Train adapter».
  2. Durante l'avvio del processo di formazione, puoi specificare un bucket Amazon S3 che conterrà l'output del processo di formazione sull'adattatore. Se specifichi una posizione del bucket Amazon S3 che non esiste ancora, il percorso del bucket verrà creato automaticamente. Puoi anche aggiungere tag all'adattatore per tracciarlo e personalizzare le impostazioni di crittografia. Personalizza la formazione sull'adattatore in base alle tue esigenze, quindi scegli Train Adapter.

  3. Nella pagina seguente, scegli Train Adapter per confermare che desideri iniziare il processo di formazione. Questo creerà la tua prima versione del tuo adattatore.

Dopo l'inizio del processo di formazione, è possibile monitorare lo stato del processo di formazione nella pagina di destinazione di Adapter.

Riceverai una notifica al termine del processo di formazione. Quindi, puoi valutare le prestazioni dell'adattatore esaminando le metriche.

Valutazione delle prestazioni dell'adattatore

Per valutare le prestazioni del modello, utilizzate il riquadro di navigazione a sinistra per selezionare la versione dell'adattatore da valutare.

Le metriche delle prestazioni dell'adattatore mostrano il punteggio F1, la precisione e il richiamo, tutti al 94,4%.

Esaminando le metriche dell'adattatore, è possibile determinare le prestazioni dell'adattatore sui documenti del set di dati e sulle query definite. È possibile visualizzare i valori F1 Score, Precision e Recall dell'adattatore in base a diversi elementi dei dati di addestramento: domande, documenti e pagine. Per passare da una prestazione all'altra per questi elementi, scegli le diverse schede sotto il riquadro di visualizzazione delle metriche.

Puoi anche visualizzare le metriche di base in qualsiasi momento attivando l'interruttore Passa alle metriche di base.

Il riepilogo delle prestazioni della versione dell'adattatore in uso contiene anche alcuni suggerimenti su come migliorare le prestazioni dell'adattatore. Puoi consultare questi suggerimenti in qualsiasi momento per migliorare il tuo adattatore. Per ulteriori informazioni su come gestire e migliorare l'adattatore, consultaValutazione e miglioramento degli adattatori.

Per una demo dell'adattatore e visualizzarne le prestazioni in un documento:

  1. Scegli Try Adapter.

    Prova il pulsante Adapter e il menu a discesa Ver. 1.
  2. Nella pagina Prova l'adattatore, puoi scegliere un documento da analizzare con l'adattatore. Seleziona il pulsante Scegli documento e accedi alla posizione del documento sul tuo dispositivo. In alternativa, trascina il documento nel riquadro Carica un documento.

Dopo aver caricato un documento, la pagina Try Adapter verrà aggiornata per visualizzare i risultati dell'analisi dell'adattatore, incluse le domande, le risposte alle query e i livelli di confidenza. Se sei soddisfatto delle prestazioni dell'adattatore, puoi procedere all'inferenza, utilizzando l'adattatore in una chiamata a o. AnalyzeDocumentStartDocumentAnalysis Altrimenti, puoi migliorare le prestazioni dell'adattatore riqualificandolo con documenti aggiuntivi.

Migliorare un adattatore

Per migliorare le prestazioni dell'adattatore:

  1. Scegli Modifica il set di dati nella pagina dei dettagli dell'adattatore.

    Diagramma del flusso di lavoro che mostra i passaggi per creare, verificare, addestrare e migliorare un set di dati personalizzato per l'estrazione del testo: 1. Crea set di dati, 2. Creare interrogazioni, 3. Verificare i documenti, 4. Adattatore per treno, 5. Controlla le metriche delle prestazioni, 6. Migliora l'adattatore.
  2. Nella pagina di panoramica del set di dati, seleziona Aggiungi documenti. Per riqualificare l'adattatore, aggiungi almeno altri cinque documenti al set di dati di addestramento.

  3. Riceverai una notifica che i documenti vengono aggiunti al set di dati. Seleziona Inizia la revisione per esaminare i risultati del processo di etichettatura automatica.

  4. Esamina le domande e le risposte. Dopo aver esaminato e approvato tutte le annotazioni per i documenti aggiunti, scegli Invia e chiudi.

  5. Nella pagina di gestione del set di dati, scegli Train adapter per iniziare ad addestrare l'adattatore su tutti i dati del set di dati di allenamento, inclusi i nuovi documenti di formazione.

Ogni processo di formazione che esegui crea una nuova versione dell'adattatore. Annotate il nome della nuova versione dell'adattatore per assicurarvi di valutare le prestazioni della versione corretta dell'adattatore.

Inferenza

Dopo aver creato un adattatore, ti viene fornito un ID per l'adattatore personalizzato. È possibile fornire questo ID all'AnalyzeDocumentoperazione per l'analisi sincrona dei documenti o all'StartDocumentAnalysisoperazione per l'analisi asincrona.

Fornendo l'Adapter ID, l'adattatore si integra automaticamente nel processo di analisi e lo utilizza per migliorare le previsioni per i documenti. In questo modo, puoi sfruttare le funzionalità di AnalyzeDocument mentre lo personalizzi in base alle tue esigenze.

Per un esempio di come eseguire l'inferenza utilizzando l'adattatore e il funzionamento dell' AnalyzeDocumentAPI, consulta. Analisi del testo del documento con Amazon Textract

Quando è necessario applicare più adattatori a pagine diverse dello stesso documento, è possibile specificare uno o più adattatori e le rispettive versioni degli adattatori come parte della richiesta API. È possibile utilizzare il parametro Page per specificare a quali pagine applicare un adattatore.

Tenere presente quanto segue:

È simile al funzionamento del Page parametro Queries. Tenere presente quanto segue:

  • Se una pagina non è specificata, viene impostata come impostazione ["1"] predefinita.

  • I seguenti caratteri sono validi nella stringa dei parametri:1 2 3 4 5 6 7 8 9 - *. Gli spazi vuoti non sono validi.

  • Quando si utilizza* per indicare tutte le pagine, deve essere l'unico elemento dell'elenco.

  • Il Page parametro non si sovrappone tra gli adattatori. A una pagina può essere applicato un solo adattatore.

Gestione degli adattatori

I seguenti passaggi vengono ripetuti in modo iterativo (dopo l'addestramento iniziale dell'adattatore):

  • Scegli Modifica il set di dati nella pagina dei dettagli dell'adattatore della console Amazon Textract.

  • Seleziona Aggiungi documenti.

  • Aggiungi almeno altri cinque documenti al set di dati di addestramento per riqualificare l'adattatore.

  • Riceverai una notifica che i documenti sono stati aggiunti al set di dati. Seleziona Inizia la revisione per esaminare i risultati del processo di etichettatura automatica.

  • Esamina le domande e le risposte. Dopo aver esaminato e approvato tutte le annotazioni per i nuovi documenti, seleziona Train adapter.

  • Attendi che l'adattatore completi il nuovo ciclo di allenamento, quindi controlla le metriche delle prestazioni per la nuova versione dell'adattatore.

Dopo aver addestrato il modello al livello di prestazioni desiderato, puoi utilizzare l'adattatore per effettuare inferenze nell'applicazione.

Assicuratevi di eliminare le versioni degli adattatori che non vi servono più. Per eliminare un adattatore:

  • Vai alla pagina iniziale degli adattatori, seleziona l'adattatore e scegli Elimina.

  • Digita Elimina nella casella di testo, quindi scegli Elimina.