View a markdown version of this page

异步处理文档 - Amazon Textract

本文属于机器翻译版本。若本译文内容与英语原文存在差异,则一律以英文原文为准。

异步处理文档

您可以使用 Amazon Textract 来检测和分析 PDF 或 TIFF 格式的多页文档中的文本,包括发票和收据。多页文档处理是一种异步操作,它对于处理大型多页文档很有用。例如,超过 1,000 页的 PDF 文件需要很长时间才能处理,但是异步处理 PDF 文件可以让您的应用程序在操作完成的同时完成其他任务。

本节介绍如何使用 Amazon Textract 异步检测和分析多页或单页文档上的文本。多页文档必须采用 PDF 或 TIFF 格式。 Single-page 使用异步操作处理的文档可以采用 JPEG、PNG、TIFF 或 PDF 格式。

您可以将 Amazon Textract 异步操作用于以下目的:

  • 文本检测-您可以检测多页文档中的行和字。异步操作是StartDocumentTextDetectionGetDocumentTextDetection。有关更多信息,请参阅 检测文本

  • 文本分析-您可以识别多页文档中检测到的文本之间的关系。异步操作是StartDocumentAnalysisGetDocumentAnalysis。有关更多信息,请参阅 分析文档

  • 费用分析-您可以识别多页发票和收据上的数据关系。Amazon Textract 将每张发票或多页文档的收据页视为单独的收据或发票。它不会保留多页文档从一页到另一页的上下文。异步操作是StartExpenseAnalysisGetExpenseAnalysis。有关更多信息,请参阅 分析发票和收据

  • 贷款文件分析 — 您可以使用分析贷款工作流程对借阅文件进行分类和分析,该工作流程对文档进行分类,然后自动将文档发送到相应的 Amazon Textract 操作部门进行信息提取。您可以使用开始对借阅文档进行异步分析StartLendingAnalysis,并使用检索提取的信息GetLendingAnalysis或获取信息摘要GetLendingAnalysisSummary。Analyze Lending 会返回从文档中提取的相关信息,包括检测到的签名。如果您使用该OutputConfig功能,您还可以在提交的包中获取不同类型的文档,这些文档按给定文档类型的逻辑边界进行划分。