View a markdown version of this page

Amazon Textract カスタムクエリのベストプラクティス - Amazon Textract

翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。

Amazon Textract カスタムクエリのベストプラクティス

Amazon Textract では、ベースモデルにアダプターをトレーニングして使用することで、事前トレーニング済みのクエリ機能の出力をカスタマイズできます。Amazon Textract Custom Queries では、独自のドキュメントを使用し、アダプターをトレーニングしてベースモデルをカスタマイズしながら、独自のドキュメントを制御できます。アダプターのクエリを作成するときは、次のベストプラクティスを使用します。アダプターの詳細については、「」を参照してくださいクエリレスポンスのカスタマイズ

  1. サンプルデータには、本番環境で使用するドキュメントを表すレイアウトバリエーションとイメージバリエーションが含まれている必要があります。

  2. トレーニングまたはテストには、最低 5 つのサンプル (クエリレベルごと) が必要です。トレーニングに使用されるサンプルが多いほど、 が適しています。

  3. 注釈付きのクエリには、さまざまな回答が必要です。たとえば、クエリへの回答が「はい」または「いいえ」の場合、注釈付きサンプルには「はい」と「いいえ」の両方の出現が必要です。

  4. 作成されたクエリには論理的な意味と構造が必要です。たとえば、チェックで受取人名を抽出するには、クエリが「受取人は誰ですか?」である必要があります。「名前は何ですか?」ではありません。

  5. 抽出する必要がある値にキーが関連付けられている場合は、クエリに キーを含めると、より良い結果が得られます。キーが複数回発生する場合は、「借用者の名は何ですか?」などの階層的な質問を使用します。および「共同借用者の名前は何ですか?」

  6. 注釈スタイルで一貫性を維持します。ドキュメントの複数の場所にフィールドが表示され、1 つの出現のみに注釈を付ける場合は、同じガイドラインに従い、すべてのドキュメントで 1 つの出現のみに注釈を付けます。または、値のすべての出現に注釈を付けることを選択した場合は、すべてのドキュメントに対して同じプロセスに従います。

  7. フィールドにスペースをアノテーションしながら整合性を維持します。フィールドの値が「123 456 78」で、「12345678」として注釈を付ける場合は、すべてのドキュメントで同じガイドラインに従います。値を「123 456 78」と「12345678」という注釈を付けても変更しないでください。

  8. 推論を実行するページはわずかですが、ドキュメント内のすべてのページにデータに注釈を付けます。すべてのページに注釈を付けることが不可能な場合は、ドキュメントを分割し、データセットで注釈を付けることができるページのみを使用します。

  9. カスタムクエリは、署名に関連する質問 (「ドキュメントは署名されていますか?」など) をサポートしていません。ドキュメントが署名されているかどうかを確認するには、API リクエストの署名機能を使用します。

  10. 事前ラベル付けからのレスポンスを修正するときは、いくつかの文字エラーの修正や、スペースや句読点の削除など、ドキュメントに表示されるテキストに小さな変更を加えることができます。ただし、ドキュメントにテキストが表示されない場合は、レスポンスとして入力しないでください。

  11. 推論のトレーニングで使用した正確なクエリを使用します。

  12. 事前ラベル付けの結果は、 source-refページにのみ入力します。source-ref ページからではないブロックで結果を事前にラベル付けすると、パフォーマンスに影響する可能性があります。