View a markdown version of this page

クエリレスポンスのカスタマイズ - Amazon Textract

翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。

クエリレスポンスのカスタマイズ

Amazon Textract では、アダプターを使用して事前トレーニング済みのクエリ機能の出力をカスタマイズできます。Amazon Textract コンソールを使用してアダプターを作成できます。このアダプターは、AnalyzeDocument および StartDocumentAnalysis オペレーションを呼び出すときに参照できます。

コンソールを使用してアダプターを作成するときは、アダプターをトレーニングしてパフォーマンスをテストする目的で、独自のドキュメントをアップロードします。また、ドキュメントにクエリを追加し、これらのクエリをドキュメント内の正しいレスポンス要素にリンクすることで、ドキュメントに注釈を付けます。アダプターを作成し、ドキュメントに注釈を付けたら、アダプターをトレーニングしてパフォーマンスを確認し、ドキュメントを分析するときに使用できます。

アダプターはモジュラーコンポーネントであり、既存の Amazon Textract 深層学習モデルに追加され、トレーニング対象のタスクの機能を拡張します。アダプターを使用して深層学習モデルを微調整することで、特定のユースケースに関連するドキュメント分析タスクの出力をカスタマイズできます。

アダプターを作成して使用するには、以下を実行する必要があります。

  • トレーニング用のサンプルドキュメントをアップロードする

  • トレーニングデータセットとテストデータセットを指定する

  • クエリとレスポンスでドキュメントに注釈を付ける

  • アダプターのトレーニング

  • AdapterId の取得

  • を呼び出すときにアダプターを使用する AnalyzeDocument

サンプルドキュメントのアップロード

アダプターをトレーニングするには、ユースケースを表す一連のサンプルドキュメントをアップロードする必要があります。ドキュメントは、コンピュータまたは Amazon S3 バケットから直接アップロードできます。最良の結果を得るには、トレーニング用のドキュメントをできるだけ多く提供してください (最大 2,500 ページのトレーニングドキュメントと 1,000 のテストドキュメント)。ドキュメントがユースケースのすべての側面を表していることを確認します。少なくとも 5 つのトレーニングドキュメントと 5 つのテストドキュメントをアップロードする必要があります。

トレーニングセットとテストセットの指定

すべてのドキュメントをトレーニングセットとテストセットに分割する必要があります。トレーニングセットは、アダプターのトレーニングに使用されます。アダプターは、これらの注釈付きドキュメントに含まれるパターンを学習します。テストセットは、アダプターのパフォーマンスを評価するために使用されます。

データのトレーニングとテストの詳細については、「」を参照してくださいトレーニングデータセットとテストデータセットの準備

クエリとレスポンスを含むドキュメントの注釈付け

ドキュメントに注釈を付けるときは、事前トレーニング済みのクエリ機能を使用してドキュメントに自動ラベル付けし、必要に応じてラベルを編集できます。または、ドキュメントクエリごとにレスポンスに手動でラベルを付けることもできます。

クエリのベストプラクティスの詳細については、「クエリのベストプラクティス」を参照してください。

アダプターのトレーニング

トレーニングデータに注釈を付けたら、アダプターのトレーニングプロセスを開始できます。Amazon Textract は、ドキュメントに合わせたアダプターをトレーニングします。アダプターのトレーニングには、データセットのサイズと AWS リージョンに応じて 2~30 時間かかります。トレーニングが完了すると、アダプターの詳細ページでトレーニングステータスを表示できます。ステータスが の場合はtraining failedトレーニング失敗のデバッグ「」を参照して障害をデバッグします。

アダプターを評価する

アダプタートレーニングの各ラウンドの後、 AWS マネジメントコンソール のパフォーマンスメトリクスを確認して、アダプターが希望するパフォーマンスレベルにどの程度近いかを判断します。その後、トレーニングドキュメントの新しいバッチをアップロードするか、精度スコアの低いドキュメントの注釈を確認することで、ドキュメントのアダプターの精度をさらに向上させることができます。アダプターの改善バージョンを作成したら、 AWS コンソールを使用して、不要になった以前のアダプターバージョンを削除できます。

評価メトリクスの詳細については、「」を参照してくださいアダプターの評価と改善

AdapterId を取得する

アダプターがトレーニングされると、Amazon Textract ドキュメント分析 API オペレーションで使用するアダプターの一意の ID を取得できます。ListAdapterVersions API オペレーションを使用するか、 を使用して AdapterId を取得します AWS マネジメントコンソール。

AnalyzeDocument API オペレーションを呼び出す

カスタムアダプターを適用するには、AnalyzeDocument または StartDocumentAnalysis API オペレーションを呼び出すときに ID を指定します。これにより、ドキュメントの予測が強化されます。API オペレーションを呼び出すときは、ページごとに最大 1 つのアダプターを使用できます。

動画のデモンストレーションとチュートリアル