翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。
ドキュメントの非同期処理
Amazon Textract を使用して、請求書や領収書など、PDF または TIFF 形式の複数ページのドキュメント内のテキストを検出および分析できます。マルチページドキュメント処理は非同期オペレーションであり、大規模なマルチページドキュメントの処理に役立ちます。例えば、1,000 ページを超える PDF ファイルは処理に時間がかかりますが、PDF ファイルを非同期的に処理すると、アプリケーションはオペレーションの完了中に他のタスクを完了できます。
このセクションでは、Amazon Textract を使用して、複数ページまたは単一ページのドキュメントのテキストを非同期的に検出および分析する方法について説明します。マルチページドキュメントは PDF 形式または TIFF 形式である必要があります。非同期オペレーションで処理される単一ページのドキュメントは、JPEG、PNG、TIFF、または PDF 形式にすることができます。
Amazon Textract の非同期オペレーションは、次の目的で使用できます。
-
テキスト検出 – マルチページドキュメントの行と単語を検出できます。非同期オペレーションは、StartDocumentTextDetection および GetDocumentTextDetection です。詳細については、「テキストの検出」を参照してください。
-
テキスト分析 – マルチページドキュメントで検出されたテキスト間の関係を特定できます。非同期オペレーションは、StartDocumentAnalysis および GetDocumentAnalysis です。詳細については、「ドキュメントの分析」を参照してください。
-
経費分析 – 複数ページの請求書と領収書のデータ関係を特定できます。Amazon Textract は、複数ページのドキュメントの各請求書または受信ページを個々の受信または請求書として扱います。マルチページドキュメントの 1 ページから別のページへのコンテキストは保持されません。非同期オペレーションは、StartExpenseAnalysis および GetExpenseAnalysis です。詳細については、「請求書と領収書の分析」を参照してください。
-
融資ドキュメント分析 – 融資ドキュメントを分類および分析するには、Analyze Lending ワークフローを使用します。これにより、ドキュメントが分類され、情報抽出のためにドキュメントが適切な Amazon Textract オペレーションに自動的に送信されます。を使用して融資ドキュメントの非同期分析を開始し
StartLendingAnalysis、抽出された情報を で取得GetLendingAnalysisするか、 で情報の概要を取得できますGetLendingAnalysisSummary。Analyze Lending は、検出された署名など、ドキュメントから抽出された関連情報を返します。OutputConfigこの機能を使用すると、送信されたパッケージ内のさまざまなタイプのドキュメントを、特定のドキュメントタイプの論理境界で分割して取得することもできます。