本文為英文版的機器翻譯版本,如內容有任何歧義或不一致之處,概以英文版為準。
非同步處理文件
您可以使用 Amazon Textract 偵測和分析 PDF 或 TIFF 格式的多頁文件中的文字,包括發票和收據。多頁文件處理是一種非同步操作,適用於處理大型多頁文件。例如,超過 1,000 頁的 PDF 檔案需要很長的時間來處理,但非同步處理 PDF 檔案可讓您的應用程式在操作完成時完成其他任務。
本節說明如何使用 Amazon Textract 非同步偵測和分析多頁或單頁文件上的文字。多頁文件必須是 PDF 或 TIFF 格式。使用非同步操作處理的單頁文件可以是 JPEG、PNG、TIFF 或 PDF 格式。
您可以將 Amazon Textract 非同步操作用於下列目的:
-
文字偵測 – 您可以偵測多頁文件上的行和字。非同步操作為 StartDocumentTextDetection 和 GetDocumentTextDetection。如需詳細資訊,請參閱偵測文字。
-
文字分析 – 您可以識別多頁文件上偵測到的文字之間的關係。非同步操作為 StartDocumentAnalysis 和 GetDocumentAnalysis。如需詳細資訊,請參閱分析文件。
-
費用分析 – 您可以識別多頁發票和收據上的資料關係。Amazon Textract 會將多頁文件的每個發票或接收頁面視為個別的接收或發票。它不會將內容從一個頁面保留到多頁文件的另一個頁面。非同步操作為 StartExpenseAnalysis 和 GetExpenseAnalysis。如需詳細資訊,請參閱分析發票和收據。
-
貸款文件分析 – 您可以使用分析貸款工作流程來分類和分析貸款文件,這會分類文件,然後自動將文件傳送至適當的 Amazon Textract 操作以進行資訊擷取。您可以使用 啟動貸款文件的非同步分析
StartLendingAnalysis,並使用 擷取擷取的資訊,GetLendingAnalysis或使用 取得資訊摘要GetLendingAnalysisSummary。分析貸款會傳回從文件擷取的相關資訊,包括偵測到的簽章。如果您使用OutputConfig功能,也可以在提交的套件中取得不同類型的文件,依指定文件類型的邏輯邊界分割。