本文属于机器翻译版本。若本译文内容与英语原文存在差异,则一律以英文原文为准。
准备训练和测试数据集
训练和测试数据集
训练数据集是创建适配器的基础。必须提供带注释的训练数据集才能训练适配器。该训练数据集由用户上传的文档页面、查询和带注释的查询答案组成。模型从该数据集中学习,以提高其在您提供的文档类型上的性能。
测试数据集用于评估适配器的性能。测试数据集是通过使用模型以前从未见过的原始数据集片段创建的。此过程使用新数据评估适配器的性能,从而创建准确的测量和指标。
您必须将所有文档分成训练集和测试集。训练套装用于训练适配器。适配器学习这些带注释的文档中包含的模式。测试集用于评估适配器的性能。如果您上传的文档少于 20 个,请在培训和考试之间平均分配。如果您上传的文档超过 20 个,请将 70% 的数据分配给训练,30% 分配给测试。在中拆分文档时 AWS 管理控制台,您可以让 Amazon Textract 自动拆分您的文档。或者,您可以手动将文档分成训练集和测试集。
数据集组件
数据集包含以下四个组件,您必须自己或使用以下四个组件进行准备 AWS 管理控制台:
-
图片-图片可以是 JPEG、PNG、1 页 PDF 或 1 页 TIFF。如果您要提交多页文档,则 AWS 管理控制台 会分别显示每页以供注释。
-
注解文件-注解文件遵循亚马逊 Textract 区块结构,但它只包含 QUERY 和 QUERY_RESULT 块。
-
预标记文件-这是来自 Amazon Textract 当前 API 响应的区块结构,取自或DetectDocumentText操作的结果。AnalyzeDocument如果您之前已经调用 Amazon Textract 并存储了操作结果,则可以提供对这些结果的引用。如果您的文档页面有多个从异步 API 导出的响应文件,Amazon Textract 会接受多个预贴标文件。
-
清单文件-每行指向注释文件、预贴标签文件或图像或单页 PDF 的文件。 JSONL-based 在构造清单文件时,请参考此清单文件格式。
清单文件包含一行或多行 JSON 行,每行包含一张图片的信息。接下来是清单文件中的一行:
{ "source-ref": "s3://textract-adapters-sample-bucket-129090f9e-d51c-4034-a732-48caa3b532e7/adapters/0000000000/assets/1003_3_1.png", "source-ref-version": "uPNKaY_2I8dxj9Kp2sO0zDUt4q3MAJen", "source-ref-metadata": { "origin-ref": "s3://textract-adapters-sample-bucket-129090f9e-d51c-4034-a732-48caa3b532e7/adapters/0000000000/original_assets/1003_3.tiff", "page-number": 1 }, "annotations-ref": "s3://textract-adapters-sample-bucket-129090f9e-d51c-4034-a732-48caa3b532e7/adapters/0000000000/annotations/1003_3_1.png.json", "annotations-ref-version": "nwj_MC40zsAae_idwsdEa0r4ZQaVthGs", "annotations-ref-metadata": { "prelabeling-refs": [{ "prelabeling-ref": "s3://textract-adapters-sample-bucket-129090f9e-d51c-4034-a732-48caa3b532e7/adapters/0000000000/prelabels/fd958ee156b5b5de1ee6101dd05263120790836856774c871b877baa35e2f373/1" "prelabeling-ref-version": "uPNKaY_2I8dxj9Kp2sO0zDUt4q3MAJen" ]}, "assignment": "TRAINING", "include": true, }, "schema-version": "1.0" }
请注意,清单文件包含以下信息:
-
s@@ ource-ref:(必填)图片或单页文件的 Amazon S3 位置。格式为 “s3://BUCKET/OBJECT_PATH”。
-
s@@ ource-ref-version:(可选)图像或单页文件的 Amazon S3 对象版本。
-
s@@ ource-ref-metadata:(可选)当这张单页文件图像应该是多页文档的一部分时,有关源引用的元数据。当您想要评估多页文档上的适配器时,此信息很有用。如果未指定,我们将每个 s ource-ref 视为一个独立的文档。
-
origin-ref:(必填)原始多页文档的 Amazon S3 位置。
-
页码:(必填)原始文档中来源参考的页码。
-
annotations-ref:(必填)客户的 Amazon S3 所在地对图片进行了注释。格式为 “s3://BUCKET/OBJECT_PATH”。
-
annotations-ref-metadata:(必填)有关注解属性的元数据。包含预贴标签的引用,以及清单行项目的分配类型,以及是否来自培训 include/exclude 的文档。
-
prelabeling-refs:(必填)源引用文件的 Amazon Textract 异步 API 响应中的文件列表。prelabeling-refs 中的每个文件都应包含一个 Block 属性,最多包含 1000 个区块。
-
prelabeling-ref(必填)使用 Amazon Textract API 在图片上自动注释的 Amazon S3 位置。
-
预标引用版本(可选)预贴标文件的 Amazon S3 对象版本。
-
ass@@ ignment:(必填)如果图像属于训练数据集,则指定 “训练”。否则,请使用 “测试”。
-
包括:(必填)指定 true 以包括用于培训的单列项目。否则,请使用 false。
-
架构版本:(可选)清单文件的版本。有效值为 1.0。
要获得最佳的精度改进,请参见亚马逊 Textract 自定义查询的最佳实践。
用查询和回复为文档添加注释
为文档添加注释时,您可以选择使用预先训练的查询功能自动为文档添加标签,然后根据需要编辑标签。或者,您可以手动标记每个文档查询的响应。
手动为文档贴标时,Amazon Textract 会从文档中提取原始文本。提取原始文本后,您可以使用 AWS 管理控制台 批注界面为文档创建查询。将这些问题与文档中的相关答案联系起来,以确定培训的 “基本真相”。
在自动为文档添加标签时,您可以为文档指定相应的查询。当您完成向文档添加查询后,Amazon Textract 会尝试从您的文档中提取适当的元素,从而生成注释。然后,您必须验证这些注释的准确性,更正任何不正确的注释。通过将查询与答案联系起来,您可以向模型传授文档中哪些信息很重要。
创建查询时,请考虑在检索文档中的相关数据时必须提出的问题类型。有关此响应结构的更多信息,请参阅查询响应结构。有关查询最佳做法的更多信息,请参阅查询最佳实践。
你需要使用具有代表性的文件样本对适配器进行培训。当您使用 AWS 管理控制台 为文档添加注释时,控制台会自动为您准备这些文件。