Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Preparazione dei set di dati di addestramento e test
Set di dati di formazione e test
Il set di dati di addestramento è la base per la creazione di un adattatore. È necessario fornire un set di dati di addestramento annotato per addestrare un adattatore. Questo set di dati di formazione è costituito da pagine di documenti caricate dall'utente, domande e risposte a domande annotate. Il modello impara da questo set di dati per migliorare le proprie prestazioni sul tipo di documenti forniti.
Il set di dati di test viene utilizzato per valutare le prestazioni dell'adattatore. Il set di dati di test viene creato utilizzando una parte del set di dati originale che il modello non ha mai visto prima. Questo processo valuta le prestazioni dell'adattatore con nuovi dati, creando misurazioni e metriche accurate.
È necessario suddividere tutti i documenti in set di formazione e test. Il set di allenamento viene utilizzato per addestrare l'adattatore. L'adattatore apprende gli schemi contenuti in questi documenti annotati. Il set di test viene utilizzato per valutare le prestazioni dell'adattatore. Se carichi meno di 20 documenti, suddividili equamente tra train e test. Se carichi più di 20 documenti, assegna il 70% dei dati alla formazione e il 30% ai test. Quando dividi i documenti in Console di gestione AWS, puoi lasciare che Amazon Textract divida automaticamente i tuoi documenti. In alternativa, puoi dividere manualmente i documenti in set di formazione e test.
Componenti del set di dati
I set di dati contengono i quattro componenti seguenti, che è necessario preparare autonomamente o utilizzando: Console di gestione AWS
-
Immagini: le immagini possono essere in formato JPEG, PNG, PDF a 1 pagina o TIFF a 1 pagina. Se si inviano documenti composti da più pagine, ogni pagina Console di gestione AWS verrà visualizzata separatamente per consentirne l'annotazione.
-
File di annotazione: il file di annotazione segue la struttura dei blocchi di Amazon Textract, sebbene contenga solo blocchi QUERY e QUERY_RESULT.
-
File di preetichettatura: questa è la struttura a blocchi dell'attuale risposta dell'API di Amazon Textract, ricavata dal risultato delle operazioni or. DetectDocumentTextAnalyzeDocument Se hai già chiamato Amazon Textract in precedenza e memorizzato il risultato dell'operazione, puoi fornire i riferimenti a tali risultati. Amazon Textract accetta più file di preetichettatura nel caso in cui la pagina del documento contenga più file di risposta esportati da un'API asincrona.
-
File manifesto: un JSONL-based file in cui ogni riga rimanda a un file di annotazioni, al file di preetichettatura o a un'immagine o a un PDF a pagina singola. Fate riferimento a questo formato di file manifesto per strutturare il file manifest.
I file manifest contengono una o più righe JSON, ognuna delle quali contiene informazioni per una singola immagine. Quella che segue è una singola riga in un file manifest:
{ "source-ref": "s3://textract-adapters-sample-bucket-129090f9e-d51c-4034-a732-48caa3b532e7/adapters/0000000000/assets/1003_3_1.png", "source-ref-version": "uPNKaY_2I8dxj9Kp2sO0zDUt4q3MAJen", "source-ref-metadata": { "origin-ref": "s3://textract-adapters-sample-bucket-129090f9e-d51c-4034-a732-48caa3b532e7/adapters/0000000000/original_assets/1003_3.tiff", "page-number": 1 }, "annotations-ref": "s3://textract-adapters-sample-bucket-129090f9e-d51c-4034-a732-48caa3b532e7/adapters/0000000000/annotations/1003_3_1.png.json", "annotations-ref-version": "nwj_MC40zsAae_idwsdEa0r4ZQaVthGs", "annotations-ref-metadata": { "prelabeling-refs": [{ "prelabeling-ref": "s3://textract-adapters-sample-bucket-129090f9e-d51c-4034-a732-48caa3b532e7/adapters/0000000000/prelabels/fd958ee156b5b5de1ee6101dd05263120790836856774c871b877baa35e2f373/1" "prelabeling-ref-version": "uPNKaY_2I8dxj9Kp2sO0zDUt4q3MAJen" ]}, "assignment": "TRAINING", "include": true, }, "schema-version": "1.0" }
Nota che il file manifest contiene le seguenti informazioni:
-
source-ref: (Obbligatorio) La posizione in Amazon S3 dell'immagine o del file a pagina singola. Il formato è «s3://_PATH». BUCKET/OBJECT
-
source-ref-version: (Facoltativo) La versione oggetto Amazon S3 dell'immagine o del file a pagina singola.
-
source-ref-metadata: (Facoltativo) Metadati relativi al codice sorgente quando l'immagine di un file a pagina singola deve far parte di un documento multipagina. Queste informazioni sono utili quando si desidera valutare l'adattatore su documenti composti da più pagine. Quando non viene specificato, consideriamo ogni source-ref come un documento a sé stante.
-
origin-ref: (Obbligatorio) La posizione Amazon S3 del documento multipagina originale.
-
page-number: (Obbligatorio) Numero di pagina del codice sorgente nel documento originale.
-
annotations-ref: (Obbligatorio) La posizione Amazon S3 del cliente ha eseguito annotazioni sull'immagine. Il formato è «s3://_PATH». BUCKET/OBJECT
-
annotations-ref-metadata: (Obbligatorio) Metadati sull'attributo annotations. Contiene i riferimenti alla preetichettatura, oltre al tipo di assegnazione della riga del manifesto e se al documento di formazione. include/exclude
-
prelabeling-refs: (Obbligatorio) Un elenco di file dalla risposta dell'API asincrona Amazon Textract del file source-ref. Ogni file in prelabeling-refs deve contenere una proprietà Block, con un massimo di 1000 blocchi.
-
prelabeling-ref (obbligatorio) La posizione in Amazon S3 delle annotazioni automatiche sull'immagine utilizzando l'API Amazon Textract.
-
prelabeling-ref-version (opzionale) La versione oggetto Amazon S3 del file di preetichettatura.
-
assegnazione: (Obbligatorio) Specificare «TRAINING» se l'immagine appartiene al set di dati di addestramento. Altrimenti, usa «TESTING».
-
include: (Obbligatorio) Specificare true per includere l'elemento di addestramento. Altrimenti, usa false.
-
schema-version: (Facoltativo) Versione del file manifest. Il valore valido è 1.0.
Per un miglioramento ottimale della precisione, vedereBest practice per le query personalizzate di Amazon Textract.
Annotazione dei documenti con domande e risposte
Quando si annotano i documenti, è possibile scegliere di etichettare automaticamente i documenti utilizzando la funzione Query preaddestrata e quindi modificare le etichette dove necessario. In alternativa, puoi etichettare manualmente le risposte per ciascuna delle tue domande relative ai documenti.
Quando si etichettano manualmente i documenti, Amazon Textract estrae il testo non elaborato dal documento. Dopo aver estratto il testo non elaborato, puoi utilizzare l'interfaccia di Console di gestione AWS annotazione per creare interrogazioni per i tuoi documenti. Collega queste domande alle risposte pertinenti contenute nei tuoi documenti per stabilire una «verità fondamentale» per la formazione.
Quando si etichettano automaticamente i documenti, si specificano le domande appropriate per il documento. Al termine dell'aggiunta di query ai documenti, Amazon Textract tenta di estrarre gli elementi corretti dai documenti, generando annotazioni. È quindi necessario verificare l'accuratezza di queste annotazioni, correggendo quelle errate. Collegando le domande alle risposte, insegnate al modello quali informazioni sono importanti nei vostri documenti.
Quando create le interrogazioni, considerate i tipi di domande che dovrete porre per recuperare i dati pertinenti nei vostri documenti. Per ulteriori informazioni su questa struttura di risposta, consulta Query Response Structures. Per ulteriori informazioni sulle procedure consigliate per le query, vedere Best Practices for Queries.
Dovrete addestrare un adattatore su esempi rappresentativi dei vostri documenti. Quando si utilizza il Console di gestione AWS per annotare i documenti, la console prepara automaticamente questi file.