本文為英文版的機器翻譯版本,如內容有任何歧義或不一致之處,概以英文版為準。
準備訓練和測試資料集
訓練和測試資料集
訓練資料集是建立轉接器的基礎。您必須提供註釋的訓練資料集,才能訓練轉接器。此訓練資料集包含使用者上傳的文件頁面、查詢和註釋查詢答案。此模型會從此資料集學習,以改善其對您提供的文件類型的效能。
測試資料集用於評估轉接器的效能。測試資料集是透過使用模型之前從未見過的原始資料集的配量來建立。此程序會使用新資料評估轉接器的效能,進而建立準確的測量和指標。
您必須將所有文件分割成訓練和測試集。訓練集用於訓練轉接器。轉接器會學習這些註釋文件中包含的模式。測試集用於評估轉接器效能。如果您上傳的文件少於 20 個,請在訓練和測試之間平均分割。如果您上傳超過 20 個文件,請將 70% 的資料指派給訓練,將 30% 指派給測試。在 中分割文件時 AWS 管理主控台,您可以讓 Amazon Textract 自動分割您的文件。或者,您可以手動將文件分割為訓練和測試集。
資料集元件
資料集包含以下四個元件,您必須自行準備或使用 進行準備 AWS 管理主控台:
-
影像 - 影像可以是 JPEG、PNG、1 頁 PDF 或 1 頁 TIFF。如果您要提交多頁文件, AWS 管理主控台 會將每個頁面分別視覺化以供註釋。
-
註釋檔案 - 註釋檔案遵循 Amazon Textract Block 結構,雖然只包含 QUERY 和 QUERY_RESULT 區塊。
-
預先標記檔案 - 這是來自 Amazon Textract 目前 API 回應的區塊結構,擷取自 DetectDocumentText 或 AnalyzeDocument 操作的結果。如果您之前已呼叫 Amazon Textract 並存放操作的結果,您可以提供這些結果的參考。如果您的文件頁面有多個從非同步 API 匯出的回應檔案,Amazon Textract 會接受多個預先標記檔案。
-
資訊清單檔案 - 以 JSONL 為基礎的檔案,其中每一行指向註釋檔案、預先標記檔案或影像或單頁 PDF。建構資訊清單檔案時,請參閱此資訊清單檔案格式。
資訊清單檔案包含一或多個 JSON 行,其中每一行都包含單一影像的資訊。以下是資訊清單檔案中的一行:
{ "source-ref": "s3://textract-adapters-sample-bucket-129090f9e-d51c-4034-a732-48caa3b532e7/adapters/0000000000/assets/1003_3_1.png", "source-ref-version": "uPNKaY_2I8dxj9Kp2sO0zDUt4q3MAJen", "source-ref-metadata": { "origin-ref": "s3://textract-adapters-sample-bucket-129090f9e-d51c-4034-a732-48caa3b532e7/adapters/0000000000/original_assets/1003_3.tiff", "page-number": 1 }, "annotations-ref": "s3://textract-adapters-sample-bucket-129090f9e-d51c-4034-a732-48caa3b532e7/adapters/0000000000/annotations/1003_3_1.png.json", "annotations-ref-version": "nwj_MC40zsAae_idwsdEa0r4ZQaVthGs", "annotations-ref-metadata": { "prelabeling-refs": [{ "prelabeling-ref": "s3://textract-adapters-sample-bucket-129090f9e-d51c-4034-a732-48caa3b532e7/adapters/0000000000/prelabels/fd958ee156b5b5de1ee6101dd05263120790836856774c871b877baa35e2f373/1" "prelabeling-ref-version": "uPNKaY_2I8dxj9Kp2sO0zDUt4q3MAJen" ]}, "assignment": "TRAINING", "include": true, }, "schema-version": "1.0" }
請注意,資訊清單檔案包含下列資訊:
-
source-ref:(必要) 映像或單頁檔案的 Amazon S3 位置。格式為 "s3://BUCKET/OBJECT_PATH"。
-
source-ref-version:(選用) 映像或單頁檔案的 Amazon S3 物件版本。
-
source-ref-metadata:(選用) 當單一頁面檔案的這個影像應該是多頁文件的一部分時,有關 source-ref 的中繼資料。當您想要評估多頁文件上的轉接器時,此資訊很有用。未指定時,我們會將每個 source-ref 視為獨立文件。
-
origin-ref:(必要) 原始多頁文件的 Amazon S3 位置。
-
page-number:(必要) 原始文件中 source-ref 的頁碼。
-
annotations-ref:(必要) 客戶在映像上執行註釋的 Amazon S3 位置。格式為 "s3://BUCKET/OBJECT_PATH"。
-
annotations-ref-metadata:關於註釋屬性的 (必要) 中繼資料。保留預先標記參考,以及資訊清單明細項目的指派類型,以及是否要在訓練中包含/排除文件。
-
prelabeling-refs:(必要) source-ref 檔案的 Amazon Textract 非同步 API 回應中的檔案清單。預先標記參考中的每個檔案都應包含 Block 屬性,最多 1000 個區塊。
-
prelabeling-ref (必要) 使用 Amazon Textract API 的影像上自動註釋的 Amazon S3 位置。
-
prelabeling-ref-version (選用) 預先標記檔案的 Amazon S3 物件版本。
-
指派:(必要) 如果影像屬於訓練資料集,請指定「訓練」。否則,請使用「測試」。
-
包含:(必要) 指定 true 以包含用於訓練的明細項目。否則,請使用 false。
-
schema-version:(選用) 資訊清單檔案的版本。有效值為 1.0。
如需最佳準確度改善,請參閱 Amazon Textract 自訂查詢的最佳實務。
使用查詢和回應註釋文件
註釋文件時,您可以選擇使用預先訓練的查詢功能自動標記文件,然後視需要編輯標籤。或者,您可以為每個文件查詢手動標記回應。
手動標記文件時,Amazon Textract 會從文件中擷取原始文字。擷取原始文字之後,您可以使用 AWS 管理主控台 註釋界面來建立文件的查詢。將這些查詢連結到文件中的相關答案,以建立訓練的「基本事實」。
自動標記文件時,您可以為文件指定適當的查詢。當您完成將查詢新增至文件時,Amazon Textract 會嘗試從您的文件中擷取適當的元素,並產生註釋。然後,您必須驗證這些註釋的準確性,更正任何不正確的註釋。透過將查詢連結到答案,您可以教導模型哪些資訊在文件中很重要。
建立查詢時,請考慮您必須提出的問題類型,才能擷取文件中的相關資料。如需此回應結構的詳細資訊,請參閱查詢回應結構。如需查詢最佳實務的詳細資訊,請參閱查詢的最佳實務。
您需要針對文件的代表性範例訓練轉接器。當您使用 AWS 管理主控台 來註釋文件時,主控台會自動為您準備這些檔案。