View a markdown version of this page

Tutorial zu benutzerdefinierten Abfragen - Amazon Textract

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Tutorial zu benutzerdefinierten Abfragen

In diesem Tutorial erfahren Sie, wie Sie Adapter erstellen, trainieren, evaluieren, verwenden und verwalten.

Mit Adaptern können Sie die Genauigkeit der Amazon Textract Textract-API-Operationen verbessern und das Verhalten des Modells an Ihre eigenen Bedürfnisse und Anwendungsfälle anpassen. Nachdem Sie mit diesem Tutorial einen Adapter erstellt haben, können Sie ihn verwenden, um Ihre eigenen Dokumente mit der AnalyzeDocumentAPI-Operation zu analysieren. Außerdem können Sie den Adapter für future Verbesserungen neu trainieren.

In diesem Tutorial lernen Sie Folgendes:

  • Erstellen Sie einen Adapter mit dem AWS-Managementkonsole.

  • Erstellen Sie einen Datensatz für das Training Ihres Adapters.

  • Kommentieren Sie Ihre Trainingsdaten.

  • Trainieren Sie Ihren Adapter anhand Ihres Trainingsdatensatzes.

  • Überprüfen Sie die Leistung Ihres Adapters.

  • Trainieren Sie Ihren Adapter erneut.

  • Verwenden Sie Ihren Adapter für die Dokumentenanalyse.

  • Löschen Sie Ihren Adapter.

Voraussetzungen

Bevor Sie beginnen, empfehlen wir Ihnen, zu lesenAdapter erstellen.

Sie müssen außerdem Ihr AWS Konto einrichten und ein AWS SDK installieren und konfigurieren. Anweisungen zur SDK-Einrichtung finden Sie unterSchritt 2: Richten Sie das ein AWS CLI und AWS SDKs.

Erstellen Sie einen Adapter

Bevor Sie einen Adapter trainieren oder verwenden können, müssen Sie einen erstellen. Um einen Adapter zu erstellen:

  1. Melden Sie sich bei der an AWS-Managementkonsole und öffnen Sie die Amazon Textract Textract-Konsole.

  2. Wählen Sie im linken Bereich Benutzerdefinierte Abfragen aus. Die Amazon Textract Custom Queries Landing Page wird angezeigt.

    Self-service Benutzeroberfläche mit der Amazon Textract Textract-Funktion für benutzerdefinierte Abfragen zur Verbesserung der Genauigkeit der Informationsextraktion in Geschäftsdokumenten. Symbole zeigen die Vorteile und Arbeitsschritte wie das Erstellen von Adaptern, Hochladen von Mustern, Etikettierung, Schulungsmodelle und die Überprüfung von Leistungskennzahlen.
  3. Auf der Landingpage für benutzerdefinierte Abfragen wird eine Liste all Ihrer Adapter angezeigt. Außerdem gibt es eine Schaltfläche zum Erstellen eines Adapters. Wählen Sie Adapter erstellen, um Ihren Adapter zu erstellen. Die Anzahl der erfolgreichen Schulungen, die pro Monat durchgeführt werden können, ist pro AWS Konto begrenzt. Weitere Informationen zu Kontingente in Amazon Textract festlegen den Grenzwerten finden Sie unter.

    Ihre Adapterliste ist leer und enthält die Meldung „Keine Adapter“ und die Schaltfläche „Adapter erstellen“.
  4. Geben Sie auf der folgenden Seite den Adapternamen ein, wählen Sie aus, ob Ihr Adapter automatisch aktualisiert werden soll, und fügen Sie ihm optional Tags hinzu. Wählen Sie dann Adapter erstellen aus. Wenn Sie „Automatische Aktualisierung“ wählen, aktualisiert Amazon Textract Ihren Adapter automatisch, wenn die Funktion für vortrainierte Abfragen aktualisiert wird.

Nachdem Sie Ihren Adapter erstellt haben, können Sie die Details für diesen Adapter sehen, einschließlich des Adapternamens und der Adapter-ID. Das Vorhandensein dieser Details bestätigt, dass der Adapter erfolgreich erstellt wurde.

Sie können jetzt die Datensätze erstellen, die zum Trainieren und Testen Ihres Adapters verwendet werden.

Erstellung von Datensätzen

In diesem Schritt erstellen Sie einen Trainingsdatensatz und einen Testdatensatz, indem Sie Bilder von Ihrem lokalen Computer oder aus einem Amazon S3 S3-Bucket hochladen. Weitere Informationen zu Datensätzen finden Sie unter Erkennen von Text Vorbereitung von Trainings- und Testdatensätzen

Wenn Sie Bilder von Ihrem lokalen Computer hochladen, können Sie bis zu 30 Bilder gleichzeitig hochladen. Wenn Sie eine große Anzahl von Bildern hochladen möchten, sollten Sie erwägen, die Datensätze zu erstellen, indem Sie die Bilder aus einem Amazon S3 S3-Bucket importieren.

  1. Um mit der Erstellung Ihres Datensatzes zu beginnen, wählen Sie Ihren Adapter aus der Adapterliste aus und wählen Sie dann Datensatz erstellen.

    Textract-Seite mit benutzerdefinierten Abfragen für my-test-adapter mit Schritten zum Erstellen von Datensätzen, Abfragen, Überprüfen von Dokumenten, Trainieren von Adaptern, Überprüfen von Leistungsmetriken und Verbessern des Adapters.
  2. Wählen Sie im Abschnitt Datensatzkonfiguration entweder Manuelles Teilen oder Automatisches Teilen aus. Mit der manuellen Aufteilung können Sie einzelne Bilder als Teil Ihrer Trainings- und Testdatensätze angeben. Wenn du Autosplit wählst, werden deine Trainings- und Testsets automatisch definiert, wenn du all deine Bilder hochlädst. Die manuelle Aufteilung wird für Personen empfohlen, die zum ersten Mal Adapter trainieren. Wählen Sie vorerst Autosplit.

    Schnittstelle mit Optionen zum Erstellen eines Datensatzes für Amazon Textract — entweder manuelles Teilen, um Train- und Testsets selbst bereitzustellen, oder Autosplit, um Textract automatisch in Trainings- und Testsätze aufteilen zu lassen. Importieren Sie Dokumente aus dem S3-Bucket oder lokalen Dateien.
  3. Im Abschnitt Details zum Trainingsdatensatz können Sie Dokumente von Ihrem Computer hochladen oder Dokumente aus dem S3-Bucket importieren auswählen. Wenn Sie Ihre Dokumente aus einem Amazon-S3-Bucket importieren möchten, geben Sie den Pfad zu dem Bucket und dem Ordner an, der Ihre Trainingsbilder enthält. Wenn Sie Ihre Dokumente direkt von Ihrem Computer hochladen, beachten Sie, dass Sie nur 30 Dokumente gleichzeitig hochladen können. Wählen Sie für die Zwecke dieses Tutorials die Option Dokumente von Ihrem Computer hochladen.

  4. Im Abschnitt Details zum Testdatensatz können Sie Dokumente von Ihrem Computer hochladen oder Dokumente aus dem S3-Bucket importieren auswählen. Wählen Sie für die Zwecke dieses Tutorials die Option Dokumente von Ihrem Computer hochladen aus.

  5. Wählen Sie Datensatz erstellen.

  6. Nachdem Sie den Datensatz erstellt haben, werden Sie zu einer Seite mit den Datensatz-Details weitergeleitet. Auf der Seite mit den Datensatz-Details wird eine Liste aller Dokumente in Ihrem gesamten Datensatz angezeigt. Außerdem wird angezeigt, welchem Teil des Datensatzes (Training oder Test) Ihr Dokument zugewiesen wurde. Sehen Sie sich dies in der Spalte Datensatz zugewiesen an. Sie können sich auch Folgendes ansehen:

    • Dokumentname

    • Status des Dokuments

    • Anzahl der Seiten im Dokument

    • Dokumenttyp

    • Dokumentengröße

    • Wenn das Dokument Teil des Schulungssatzes oder des Testsatzes ist

  7. Wählen Sie Dokumente zum Datensatz hinzufügen aus und fügen Sie mindestens fünf Dokumente zu Ihren Trainings- und Testdatensätzen hinzu. Wenn Sie zuvor Autosplit ausgewählt haben, können Sie alle Dokumente auf einmal hinzufügen.

  8. Wenn Sie Ihrem Datensatz weitere Dokumente hinzufügen möchten, verwenden Sie dazu das Menü Dokumente hinzufügen.

Bevor Sie mit dem Training Ihres Adapters beginnen können, müssen Sie Ihre Schulungsdokumente mit Abfragen versehen. Dies ist erforderlich, um die „annotations-ref“ -Einträge Ihrer Manifestdatei zu erstellen. Nachdem Sie alle Ihre Dokumente zum Schulungs- oder Testset hinzugefügt haben, können Sie mit dem Annotationsprozess beginnen.

Anmerkung und Überprüfung

In diesem Schritt weisen Sie jedem Dokument, das Sie in Ihre Trainings- und Testdatensätze hochgeladen haben, Abfragen und Labels zu. Mit dem AWS-Managementkonsole Annotationstool verknüpfen Sie eine Abfrage mit den entsprechenden Antworten auf einer Dokumentseite.

So weisen Sie Ihren Dokumenten Fragen und Antworten zu:

  1. Wählen Sie auf der Adapter-Landingpage die Option Abfragen erstellen aus.

    Um Dokumente automatisch mit Anmerkungen zu versehen, erstellen Sie Abfragen für das vortrainierte Modell von Textract, indem Sie auf die Schaltfläche „Abfragen erstellen“ klicken.
  2. Fügen Sie eine Abfrage hinzu, indem Sie sie in das Textfeld eingeben.

    Schnittstelle zum Erstellen von Abfragen auf Amazon Textract mit einem Textfeld zur „Angabe von Abfragen, die Textract verwenden kann, um die benötigten Informationen zu extrahieren“. Die angezeigte Beispielabfrage lautet „Wie hoch ist der Scheckbetrag?“
  3. Um weitere Abfragen hinzuzufügen, wählen Sie Neue Abfrage hinzufügen. Abfragen können eine „Rohtext“ -Antwort oder eine „binäre - Yes/No“ -Antwort haben. Verwenden Sie die erweiterten Einstellungen, um eine Abfrage mit einer binären Antwort zu erstellen.

    Schnittstelle zum Erstellen von Textextraktionsabfragen für Dokumentdateien. Ermöglicht die Angabe der Antworttypen Rohtext oder Binärtext (yes/no) für jede Abfrageaufforderung. Die Benutzeroberfläche verfügt über Felder zur Eingabe von Abfragetext, zur Auswahl des Antworttyps und zum Hinzufügen neuer Abfragen.
  4. Nachdem Sie Ihre Abfragen erstellt haben, müssen Sie Ihren Dokumenten Labels zuweisen. Um Beschriftungen für Ihre Dokumente festzulegen, wählen Sie Auto-labelingoder Manuelles Etikettieren aus. Auto-labeling wird empfohlen, wenn Sie den Adapter zum ersten Mal trainieren. Wählen Sie die Auto-labellingOption aus, und wählen Sie dann Automatische Kennzeichnung starten aus.

    Auto-labeling Die Option wurde mit dem Emblem „Empfohlen“ und der Schaltfläche „Automatische Kennzeichnung starten“ ausgewählt.
  5. Es wird einige Zeit dauern, bis der automatische Kennzeichnungsvorgang abgeschlossen ist. Wenn der Vorgang abgeschlossen ist, werden Sie darüber informiert, dass „jetzt abgeschlossen“ Auto-labeling ist. Nach Abschluss des Etikettierungsvorgangs müssen Sie die Richtigkeit der Kennzeichnung überprüfen. Wählen Sie auf der Detailseite im Bereich Adapterdetails die Option Dokumente verifizieren und wählen Sie dann auf der Datensatzseite die Option Überprüfung starten aus.

    Übersicht über die Aufteilung der Datensätze mit insgesamt 16 Dokumenten, davon 10 im Trainingssatz und 6 im Testsatz. Keine ungültigen Dateien. Der Status gibt an, dass der Datensatz zur Überprüfung bereit ist.
  6. Im Kommentar-Tool können Sie einzelne Dokumente auswählen und einzelne Seiten innerhalb dieser Dokumente anzeigen. Wählen Sie im Bereich „Antworten überprüfen“ eine Abfrage aus, die Ihrer Dokumentseite zugewiesen wurde. Wenn die Antwort auf die Anfrage falsch ist, können Sie die Antwort bearbeiten, indem Sie für die Anfrage auf die Schaltfläche Bearbeiten klicken.

    Überprüfen Sie den Bildschirm mit den Antworten, auf dem ein Beispiel für den Kundennamen John Doe angezeigt wird, und fordern Sie ihn auf, die Art der Tilgung einzugeben. Beinhaltet die Schaltflächen Anwenden und Stornieren.

    Wählen Sie für Abfragen mit Yes/No Antworten Ja, Nein oder Leer aus. Wählen Sie dann Anwenden aus.

    Wenn Sie die OCR für das Etikett bearbeiten, das einer Abfrage zugewiesen ist, wählen Sie die angegebene Antwort aus und zeichnen Sie dann einen Begrenzungsrahmen um einen Teil des Dokumentbilds. Verwenden Sie dazu die Tastenkombination „B“ oder das Bounding-Box-Werkzeug in der Werkzeugleiste am unteren Rand des Kommentarwerkzeugs. Wählen Sie dann Anwenden.

    Wenn eine Anfrage mehr als ein Antwortelement (Antwort) enthalten sollte, können Sie zusätzliche Antworten hinzufügen. Wählen Sie dazu die Abfrage aus und klicken Sie dann auf Antwort hinzufügen. Sie werden dann aufgefordert, einen Begrenzungsrahmen auf den Bereich des Dokuments zu zeichnen, der die Antwort enthält. Vergewissern Sie sich, dass die Bezeichnung für Ihren Begrenzungsrahmen korrekt ist.

    Um eine neue Abfrage für die Dokumentseite hinzuzufügen, wählen Sie Abfrage hinzufügen. Wenn Sie eine Abfrage hinzufügen, müssen Sie die Abfrage angeben, die Sie hinzufügen möchten, und dann einen Begrenzungsrahmen für die Abfragebezeichnung zeichnen.

    Wenn Sie fertig sind, wählen Sie Senden und Weiter, um mit dem nächsten Dokument und der nächsten Gruppe von Abfragen und Antworten fortzufahren. Wiederholen Sie den Vorgang, bis Sie alle Ihre Fragen und Antworten überprüft haben.

    Nachdem Sie alle Ihre Anfragen und Antworten überprüft und bewertet haben, wählen Sie Senden und schließen aus.

Training

Nachdem Sie alle Ihre Dokumente dem Trainingsset oder dem Testset hinzugefügt und die generierten Antworten für Ihre Abfragen überprüft haben, können Sie den Adapter trainieren.

Übersicht der Amazon Textract Textract-Adapter-Datensätze mit insgesamt 16 Dokumenten, 10 im Trainingssatz, 6 im Testsatz, ohne ungültige Dateien. Der Status des Datensatzes lautet: Überprüfung der Anmerkung abgeschlossen.

Um den Adapter zu trainieren:

  1. Klicken Sie zunächst auf der Seite zur Datensatzverwaltung auf Adapter trainieren.

    Benachrichtigung, dass Ihr Datensatz über genügend Dokumente verfügt, um einen Adapter zu trainieren, mit der Schaltfläche „Adapter trainieren“.
  2. Beim Starten des Trainingsprozesses können Sie einen Amazon S3 S3-Bucket angeben, der die Ausgabe Ihres Adapter-Trainingsjobs enthält. Wenn Sie einen Amazon S3 S3-Bucket-Speicherort angeben, der noch nicht existiert, wird der Bucket-Pfad für Sie erstellt. Sie können Ihrem Adapter auch Tags hinzufügen, um ihn zu verfolgen und Ihre Verschlüsselungseinstellungen anzupassen. Passen Sie das Adaptertraining an Ihre Bedürfnisse an und wählen Sie dann Train Adapter.

  3. Wählen Sie auf der folgenden Seite Train Adapter aus, um zu bestätigen, dass Sie den Trainingsprozess starten möchten. Dadurch wird Ihre erste Version Ihres Adapters erstellt.

Nachdem der Trainingsprozess gestartet wurde, können Sie den Status des Trainingsprozesses auf der Adapter-Landingpage überwachen.

Sie werden benachrichtigt, wenn der Trainingsprozess abgeschlossen ist. Anschließend können Sie die Leistung des Adapters anhand von Metriken bewerten.

Bewertung der Adapterleistung

Um die Modellleistung zu bewerten, wählen Sie im linken Navigationsbereich die Adapterversion aus, die Sie bewerten möchten.

Die Leistungskennzahlen des Adapters zeigen F1-Score, Precision und Recall bei 94,4 Prozent.

Indem Sie die Metriken Ihres Adapters untersuchen, können Sie feststellen, wie Ihr Adapter bei den Dokumenten in Ihrem Datensatz und den von Ihnen definierten Abfragen abschneidet. Sie können den F1-Score, die Präzision und den Rückruf für Ihren Adapter für verschiedene Elemente der Trainingsdaten einsehen: Abfragen, Dokumente und Seiten. Um zwischen der Leistung dieser Elemente zu wechseln, wählen Sie die verschiedenen Registerkarten unter dem Messwertanzeigefenster aus.

Sie können die Basiskennzahlen auch jederzeit einsehen, indem Sie den Schalter Zu Basiskennzahlen wechseln umschalten.

Die Zusammenfassung der Leistung Ihrer Adapterversion enthält auch einige Tipps, wie Sie die Leistung Ihres Adapters verbessern können. Sie können sich diese Tipps jederzeit ansehen, um Ihren Adapter zu verbessern. Weitere Informationen zur Verwaltung und Verbesserung Ihres Adapters finden Sie unterEvaluierung und Verbesserung Ihrer Adapter.

Um Ihren Adapter zu testen und seine Leistung anhand eines Dokuments zu überprüfen:

  1. Wählen Sie „Adapter testen“.

    Testen Sie die Schaltfläche Adapter und das Dropdownmenü Version 1.
  2. Auf der Seite Adapter testen können Sie ein Dokument auswählen, das mit Ihrem Adapter analysiert werden soll. Wählen Sie die Schaltfläche „Dokument auswählen“ und suchen Sie den Speicherort des Dokuments auf Ihrem Gerät. Sie können das Dokument auch per Drag-and-Drop in den Bereich Dokument hochladen ziehen.

Nach dem Hochladen eines Dokuments wird die Seite Try Adapter aktualisiert und zeigt nun die Ergebnisse der Adapter-Analyse an, einschließlich Abfragen, Abfrageantworten und Konfidenzniveaus. Wenn Sie mit der Leistung Ihres Adapters zufrieden sind, können Sie mit der Inferenz fortfahren und Ihren Adapter in einem Aufruf von oder verwenden. AnalyzeDocumentStartDocumentAnalysis Andernfalls können Sie die Leistung Ihres Adapters verbessern, indem Sie Ihren Adapter anhand zusätzlicher Dokumente erneut schulen.

Verbesserung eines Adapters

So verbessern Sie die Leistung Ihres Adapters:

  1. Wählen Sie auf der Seite mit den Adapter-Details die Option Datensatz ändern aus.

    Workflow-Diagramm, das die Schritte zur Erstellung, Überprüfung, Schulung und Verbesserung eines benutzerdefinierten Datensatzes für die Textextraktion zeigt: 1. Datensatz erstellen, 2. Abfragen erstellen, 3. Dokumente überprüfen, 4. Zugadapter, 5. Überprüfen Sie die Leistungskennzahlen, 6. Adapter verbessern.
  2. Wählen Sie auf der Datensatz-Übersichtsseite die Option Dokumente hinzufügen aus. Um Ihren Adapter neu zu trainieren, fügen Sie dem Trainingsdatensatz mindestens fünf weitere Dokumente hinzu.

  3. Sie werden benachrichtigt, dass die Dokumente dem Datensatz hinzugefügt wurden. Wählen Sie Überprüfung starten aus, um die Ergebnisse des automatischen Labeling-Prozesses zu überprüfen.

  4. Überprüfen Sie die Anfragen und Antworten. Nachdem Sie alle Anmerkungen zu den von Ihnen hinzugefügten Dokumenten überprüft und genehmigt haben, wählen Sie Senden und schließen.

  5. Wählen Sie auf der Seite zur Datensatzverwaltung die Option Adapter trainieren aus, um Ihren Adapter mit allen Daten in Ihrem Trainingsdatensatz, einschließlich der neuen Trainingsdokumente, zu trainieren.

Jeder Trainingsjob, den Sie ausführen, erstellt eine neue Version des Adapters. Notieren Sie sich den Namen der neuen Adapterversion, um sicherzugehen, dass Sie die Leistung der richtigen Adapterversion bewerten.

Inferenz

Nachdem Sie einen Adapter erstellt haben, erhalten Sie eine ID für Ihren benutzerdefinierten Adapter. Sie können diese ID für den AnalyzeDocumentVorgang für die synchrone Dokumentenanalyse oder den StartDocumentAnalysisVorgang für die asynchrone Analyse angeben.

Durch die Angabe der Adapter-ID wird der Adapter automatisch in den Analyseprozess integriert und zur Verbesserung der Prognosen für Ihre Dokumente verwendet. Auf diese Weise können Sie die Funktionen von nutzen und ihn AnalyzeDocument gleichzeitig an Ihre Bedürfnisse anpassen.

Ein Beispiel für die Ausführung von Inferenzen mithilfe Ihres Adapters und der AnalyzeDocument API-Operation finden Sie unter. Analysieren von Dokumententext mit Amazon Textract

Wenn mehrere Adapter auf verschiedene Seiten in demselben Dokument angewendet werden müssen, können Sie einen oder mehrere Adapter und deren jeweilige Adapterversionen als Teil der API-Anfrage angeben. Sie können den Page-Parameter verwenden, um anzugeben, auf welche Seiten ein Adapter angewendet werden soll.

Beachten Sie Folgendes:

Dies ähnelt der Funktionsweise des Page Parameters für Abfragen. Beachten Sie Folgendes:

  • Wenn eine Seite nicht angegeben ist, ist sie ["1"] standardmäßig auf eingestellt.

  • Die folgenden Zeichen sind in der Parameterzeichenfolge gültig:1 2 3 4 5 6 7 8 9 - *. Leerzeichen sind nicht gültig.

  • Wenn Sie * verwenden, um alle Seiten anzugeben, muss es das einzige Element in der Liste sein.

  • Der Page Parameter überschneidet sich nicht zwischen den Adaptern. Auf eine Seite kann nur ein Adapter angewendet werden.

Adapterverwaltung

Die folgenden Schritte werden iterativ wiederholt (nach dem ersten Training Ihres Adapters):

  • Wählen Sie auf der Seite mit den Adapter-Details der Amazon Textract Textract-Konsole die Option Datensatz ändern aus.

  • Wählen Sie Dokumente hinzufügen aus.

  • Fügen Sie dem Trainingsdatensatz mindestens fünf weitere Dokumente hinzu, um Ihren Adapter neu zu trainieren.

  • Sie werden benachrichtigt, dass die Dokumente dem Datensatz hinzugefügt wurden. Wählen Sie Überprüfung starten aus, um die Ergebnisse des automatischen Labeling-Prozesses zu überprüfen.

  • Überprüfen Sie die Anfragen und Antworten. Nachdem Sie alle Anmerkungen für die neuen Dokumente geprüft und genehmigt haben, wählen Sie Train Adapter aus.

  • Warten Sie, bis der Adapter die neue Trainingsrunde abgeschlossen hat, und überprüfen Sie dann die Leistungskennzahlen für Ihre neue Adapterversion.

Nachdem Sie Ihr Modell auf Ihr angestrebtes Leistungsniveau trainiert haben, können Sie Ihren Adapter als Inferenz in Ihrer Anwendung verwenden.

Achten Sie darauf, Adapterversionen zu löschen, die Sie nicht mehr benötigen. Um einen Adapter zu löschen:

  • Gehen Sie zur Adapter-Landingpage, wählen Sie den Adapter aus und klicken Sie auf Löschen.

  • Geben Sie Löschen in das Textfeld ein und wählen Sie dann Löschen.