Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Mempersiapkan kumpulan data pelatihan dan pengujian
Kumpulan Data Pelatihan dan Pengujian
Dataset pelatihan adalah dasar untuk membuat adaptor. Anda harus menyediakan kumpulan data pelatihan beranotasi untuk melatih adaptor. Dataset pelatihan ini terdiri dari halaman dokumen yang diunggah pengguna, kueri, dan jawaban kueri beranotasi. Model belajar dari kumpulan data ini untuk meningkatkan kinerjanya pada jenis dokumen yang Anda berikan.
Dataset pengujian digunakan untuk mengevaluasi kinerja adaptor. Dataset pengujian dibuat dengan menggunakan sepotong dataset asli yang belum pernah dilihat model sebelumnya. Proses ini menilai kinerja adaptor dengan data baru, menciptakan pengukuran dan metrik yang akurat.
Anda harus membagi semua dokumen Anda menjadi set pelatihan dan tes. Set pelatihan digunakan untuk melatih adaptor. Adaptor mempelajari pola yang terkandung dalam dokumen beranotasi ini. Set tes digunakan untuk mengevaluasi kinerja adaptor. Jika Anda mengunggah kurang dari 20 dokumen, bagilah secara merata antara kereta dan tes. Jika Anda mengunggah lebih dari 20 dokumen, tetapkan 70% data ke pelatihan dan 30% untuk pengujian. Saat membagi dokumen di Konsol Manajemen AWS, Anda dapat membiarkan Amazon Textract secara otomatis membagi dokumen Anda. Atau, Anda dapat secara manual membagi dokumen Anda ke dalam set pelatihan dan pengujian.
Komponen dataset
Kumpulan data berisi empat komponen berikut, yang harus Anda persiapkan sendiri atau dengan menggunakan: Konsol Manajemen AWS
-
Gambar - Gambar dapat berupa JPEG, PNG, PDF 1 halaman, atau TIFF 1 halaman. Jika Anda mengirimkan dokumen multipage, Konsol Manajemen AWS akan memvisualisasikan setiap halaman secara terpisah untuk anotasi.
-
File anotasi - File anotasi mengikuti struktur Blok Amazon Textract, meskipun hanya berisi blok QUERY dan QUERY_RESULT.
-
File pelabelan awal - Ini adalah struktur Blok dari respons API Amazon Textract saat ini, ditarik dari hasil operasi atau DetectDocumentTextoperasi. AnalyzeDocument Jika Anda telah menelepon Amazon Textract sebelumnya dan menyimpan hasil operasi, Anda dapat memberikan referensi ke hasil tersebut. Amazon Textract menerima beberapa file pelabelan awal jika halaman dokumen Anda memiliki beberapa file respons yang diekspor dari API asinkron.
-
File manifes - JSONL-based File di mana setiap baris menunjuk ke file anotasi, file prelabeling, atau gambar atau PDF satu halaman. Lihat format file manifes ini saat menyusun file manifes Anda.
File manifes berisi satu atau lebih baris JSON, dengan setiap baris berisi informasi untuk satu gambar. Berikut ini adalah satu baris dalam file manifes:
{ "source-ref": "s3://textract-adapters-sample-bucket-129090f9e-d51c-4034-a732-48caa3b532e7/adapters/0000000000/assets/1003_3_1.png", "source-ref-version": "uPNKaY_2I8dxj9Kp2sO0zDUt4q3MAJen", "source-ref-metadata": { "origin-ref": "s3://textract-adapters-sample-bucket-129090f9e-d51c-4034-a732-48caa3b532e7/adapters/0000000000/original_assets/1003_3.tiff", "page-number": 1 }, "annotations-ref": "s3://textract-adapters-sample-bucket-129090f9e-d51c-4034-a732-48caa3b532e7/adapters/0000000000/annotations/1003_3_1.png.json", "annotations-ref-version": "nwj_MC40zsAae_idwsdEa0r4ZQaVthGs", "annotations-ref-metadata": { "prelabeling-refs": [{ "prelabeling-ref": "s3://textract-adapters-sample-bucket-129090f9e-d51c-4034-a732-48caa3b532e7/adapters/0000000000/prelabels/fd958ee156b5b5de1ee6101dd05263120790836856774c871b877baa35e2f373/1" "prelabeling-ref-version": "uPNKaY_2I8dxj9Kp2sO0zDUt4q3MAJen" ]}, "assignment": "TRAINING", "include": true, }, "schema-version": "1.0" }
Perhatikan bahwa file manifes berisi info berikut:
-
source-ref: (Wajib) Lokasi Amazon S3 dari gambar atau file halaman tunggal. Formatnya adalah “s3://BUCKET/OBJECT_PATH”.
-
source-ref-version: (Opsional) Versi objek Amazon S3 dari gambar atau file halaman tunggal.
-
source-ref-metadata: (Opsional) Metadata tentang source-ref ketika gambar file halaman tunggal ini harus merupakan bagian dari dokumen multipage. Informasi ini sangat membantu ketika Anda ingin mengevaluasi adaptor pada dokumen multipage. Ketika tidak ditentukan, kami menganggap setiap referensi sumber sebagai dokumen mandiri.
-
origin-ref: (Wajib) Lokasi Amazon S3 ke dokumen multipage asli.
-
page-number: (Wajib) Nomor halaman dari sumber-ref dalam dokumen asli.
-
annotations-ref: (Wajib) Lokasi Amazon S3 pelanggan melakukan anotasi pada gambar. Formatnya adalah “s3://BUCKET/OBJECT_PATH”.
-
annotations-ref-metadata: (Diperlukan) Metadata tentang atribut anotasi. Memegang referensi pelabelan awal, bersama dengan jenis penugasan item baris manifes, dan if ke dokumen include/exclude dari pelatihan.
-
prelabeling-refs: (Diperlukan) Daftar file dari respons API asinkron Amazon Textract dari file source-ref. Setiap file dalam prelabeling-refs harus berisi properti Block, dengan paling banyak 1000 blok.
-
prelabeling-ref (Wajib) Lokasi Amazon S3 dari anotasi otomatis pada gambar menggunakan Amazon Textract API.
-
prelabeling-ref-version (Opsional) Versi objek Amazon S3 dari file prelabeling.
-
tugas: (Wajib) Tentukan “PELATIHAN” jika gambar milik kumpulan data pelatihan. Jika tidak, gunakan “PENGUJIAN”.
-
termasuk: (Wajib) Tentukan true untuk menyertakan item baris untuk pelatihan. Jika tidak, gunakan false.
-
schema-version: (Opsional) Versi file manifes. Nilai yang valid adalah 1.0.
Untuk peningkatan akurasi yang optimal, lihatPraktik terbaik untuk Kueri Kustom Amazon Texttract.
Menganotasi dokumen dengan pertanyaan dan tanggapan
Saat membuat anotasi dokumen, Anda dapat memilih untuk memberi label otomatis pada dokumen Anda menggunakan fitur Kueri yang telah dilatih sebelumnya dan kemudian mengedit label jika diperlukan. Atau, Anda dapat memberi label tanggapan secara manual untuk setiap kueri dokumen Anda.
Saat memberi label dokumen Anda secara manual, Amazon Textract mengekstrak teks mentah dari dokumen. Setelah teks mentah diekstraksi, Anda dapat menggunakan antarmuka Konsol Manajemen AWS anotasi untuk membuat kueri untuk dokumen Anda. Tautkan pertanyaan ini ke jawaban yang relevan dalam dokumen Anda untuk menetapkan “kebenaran dasar” untuk pelatihan.
Saat memberi label otomatis pada dokumen Anda, Anda menentukan kueri yang sesuai untuk dokumen Anda. Ketika Anda selesai menambahkan kueri ke dokumen Anda, Amazon Textract mencoba mengekstrak elemen yang tepat dari dokumen Anda, menghasilkan anotasi. Anda kemudian harus memverifikasi keakuratan anotasi ini, memperbaiki apa pun yang salah. Dengan menautkan pertanyaan ke jawaban, Anda mengajarkan model informasi apa yang penting dalam dokumen Anda.
Saat membuat kueri, pertimbangkan jenis pertanyaan yang harus Anda tanyakan untuk mengambil data yang relevan dalam dokumen Anda. Untuk informasi selengkapnya tentang struktur respons ini, lihat Struktur Respons Kueri. Untuk informasi selengkapnya tentang praktik terbaik untuk kueri, lihat Praktik Terbaik untuk Kueri.
Anda perlu melatih adaptor pada sampel yang representatif dari dokumen Anda. Saat Anda menggunakan Konsol Manajemen AWS untuk membuat anotasi dokumen, konsol menyiapkan file-file ini untuk Anda secara otomatis.