Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Vorbereitung von Trainings- und Testdatensätzen
Trainings- und Testdatensätze
Der Trainingsdatensatz ist die Grundlage für die Erstellung eines Adapters. Sie müssen einen Trainingsdatensatz mit Anmerkungen bereitstellen, um einen Adapter zu trainieren. Dieser Trainingsdatensatz besteht aus vom Benutzer hochgeladenen Dokumentseiten, Abfragen und kommentierten Abfrageantworten. Das Modell lernt aus diesem Datensatz, um seine Leistung bei der Art der von Ihnen bereitgestellten Dokumente zu verbessern.
Der Testdatensatz wird verwendet, um die Leistung des Adapters zu bewerten. Der Testdatensatz wird erstellt, indem ein Teil des ursprünglichen Datensatzes verwendet wird, den das Modell noch nicht gesehen hat. Bei diesem Prozess wird die Leistung des Adapters anhand neuer Daten bewertet, wodurch genaue Messungen und Metriken erstellt werden.
Sie müssen alle Ihre Dokumente in Schulungs- und Testsätze unterteilen. Das Trainingsset wird verwendet, um den Adapter zu trainieren. Der Adapter lernt die Muster, die in diesen kommentierten Dokumenten enthalten sind. Das Testset wird verwendet, um die Leistung des Adapters zu bewerten. Wenn Sie weniger als 20 Dokumente hochladen, teilen Sie sie gleichmäßig auf Training und Test auf. Wenn Sie mehr als 20 Dokumente hochladen, weisen Sie 70% der Daten dem Training und 30% dem Testen zu. Wenn Sie Dokumente in der teilen AWS-Managementkonsole, können Sie Amazon Textract Ihre Dokumente automatisch teilen lassen. Alternativ können Sie Ihre Dokumente manuell in Schulungs- und Testsätze aufteilen.
Komponenten des Datensatzes
Datensätze enthalten die folgenden vier Komponenten, die Sie selbst oder mithilfe von vorbereiten müssen: AWS-Managementkonsole
-
Bilder — Bilder können JPEG, PNG, einseitiges PDF oder einseitiges TIFF sein. Wenn Sie mehrseitige Dokumente einreichen, AWS-Managementkonsole wird jede Seite separat für Anmerkungen visualisiert.
-
Annotationsdatei — Die Annotationsdatei folgt der Amazon Textract Textract-Blockstruktur, obwohl sie nur QUERY- und QUERY_RESULT-Blöcke enthält.
-
Dateien vorab kennzeichnen — Dies ist die Blockstruktur aus der aktuellen API-Antwort von Amazon Textract, die aus dem Ergebnis von Oder-Vorgängen abgerufen wurde. DetectDocumentTextAnalyzeDocument Wenn Sie Amazon Textract bereits zuvor aufgerufen und das Ergebnis des Vorgangs gespeichert haben, können Sie die Verweise auf diese Ergebnisse angeben. Amazon Textract akzeptiert mehrere Prelabeling-Dateien, falls auf Ihrer Dokumentseite mehrere Antwortdateien aus einer asynchronen API exportiert wurden.
-
Manifestdatei — Eine JSONL-based Datei, in der jede Zeile auf eine Annotationsdatei, die Vorbeschriftungsdatei oder ein Bild oder eine einseitige PDF-Datei verweist. Verwenden Sie dieses Manifest-Dateiformat, wenn Sie Ihre Manifestdatei strukturieren.
Manifestdateien enthalten eine oder mehrere JSON-Zeilen, wobei jede Zeile Informationen für ein einzelnes Bild enthält. Was folgt, ist eine einzelne Zeile in einer Manifestdatei:
{ "source-ref": "s3://textract-adapters-sample-bucket-129090f9e-d51c-4034-a732-48caa3b532e7/adapters/0000000000/assets/1003_3_1.png", "source-ref-version": "uPNKaY_2I8dxj9Kp2sO0zDUt4q3MAJen", "source-ref-metadata": { "origin-ref": "s3://textract-adapters-sample-bucket-129090f9e-d51c-4034-a732-48caa3b532e7/adapters/0000000000/original_assets/1003_3.tiff", "page-number": 1 }, "annotations-ref": "s3://textract-adapters-sample-bucket-129090f9e-d51c-4034-a732-48caa3b532e7/adapters/0000000000/annotations/1003_3_1.png.json", "annotations-ref-version": "nwj_MC40zsAae_idwsdEa0r4ZQaVthGs", "annotations-ref-metadata": { "prelabeling-refs": [{ "prelabeling-ref": "s3://textract-adapters-sample-bucket-129090f9e-d51c-4034-a732-48caa3b532e7/adapters/0000000000/prelabels/fd958ee156b5b5de1ee6101dd05263120790836856774c871b877baa35e2f373/1" "prelabeling-ref-version": "uPNKaY_2I8dxj9Kp2sO0zDUt4q3MAJen" ]}, "assignment": "TRAINING", "include": true, }, "schema-version": "1.0" }
Beachten Sie, dass die Manifestdatei die folgenden Informationen enthält:
-
source-ref: (Erforderlich) Der Amazon S3 S3-Speicherort des Bilds oder der einseitigen Datei. Das Format ist „s3://BUCKET/OBJECT_PATH“.
-
source-ref-version: (Optional) Die Amazon S3 S3-Objektversion des Bilds oder der einseitigen Datei.
-
source-ref-metadata: (Optional) Metadaten zur Quellenreferenz, wenn dieses Bild einer einseitigen Datei Teil eines mehrseitigen Dokuments sein soll. Diese Informationen sind hilfreich, wenn Sie den Adapter für mehrseitige Dokumente testen möchten. Wenn nicht anders angegeben, betrachten wir jede Quellenreferenz als eigenständiges Dokument.
-
origin-ref: (Erforderlich) Der Amazon S3 S3-Speicherort des mehrseitigen Originaldokuments.
-
Seitennummer: (Erforderlich) Seitennummer der Quellreferenz im Originaldokument.
-
annotations-ref: (Erforderlich) Der Amazon S3 S3-Standort, an dem der Kunde Anmerkungen zum Bild vorgenommen hat. Das Format ist „s3://BUCKET/OBJECT_PATH“.
-
annotations-ref-metadata: (Erforderlich) Metadaten zum Annotations-Attribut. Enthält Verweise auf Vorbeschriftungen sowie den Zuweisungstyp des Manifestzeilenelements und ob es sich um das Dokument aus dem Training handelt. include/exclude
-
prelabeling-refs: (Erforderlich) Eine Liste von Dateien aus der asynchronen Amazon Textract Textract-API-Antwort der Quell-Ref-Datei. Jede Datei in prelabeling-refs sollte eine Blockeigenschaft mit höchstens 1000 Blöcken enthalten.
-
prelabeling-ref (Erforderlich) Der Amazon S3 S3-Speicherort der automatischen Anmerkungen auf dem Bild mithilfe der Amazon Textract Textract-API.
-
prelabeling-ref-version (Optional) Die Amazon S3 S3-Objektversion der Prelabeling-Datei.
-
Zuweisung: (Erforderlich) Geben Sie „TRAINING“ an, wenn das Bild zum Trainingsdatensatz gehört. Verwenden Sie andernfalls „TESTING“.
-
include: (Erforderlich) Geben Sie true an, um die Zeile für das Training einzubeziehen. Verwenden Sie andernfalls false.
-
schema-version: (Optional) Version der Manifestdatei. Der gültige Wert ist 1.0.
Informationen zu optimalen Genauigkeitsverbesserungen finden Sie unterBewährte Methoden für benutzerdefinierte Amazon Textract Textract-Abfragen.
Kommentieren der Dokumente mit Fragen und Antworten
Wenn Sie Ihre Dokumente mit Anmerkungen versehen, können Sie festlegen, dass Ihre Dokumente mithilfe der Funktion für vortrainierte Abfragen automatisch beschriftet und die Beschriftungen dann bei Bedarf bearbeitet werden. Alternativ können Sie die Antworten für jede Ihrer Dokumentanfragen manuell kennzeichnen.
Wenn Sie Ihre Dokumente manuell beschriften, extrahiert Amazon Textract den Rohtext aus dem Dokument. Nachdem der Rohtext extrahiert wurde, können Sie die AWS-Managementkonsole Annotationsoberfläche verwenden, um Abfragen für Ihre Dokumente zu erstellen. Verknüpfen Sie diese Fragen mit den entsprechenden Antworten in Ihren Dokumenten, um eine „Grundwahrheit“ für Schulungen zu ermitteln.
Wenn Sie Ihre Dokumente automatisch beschriften, geben Sie die entsprechenden Abfragen für Ihr Dokument an. Wenn Sie mit dem Hinzufügen von Abfragen zu Ihren Dokumenten fertig sind, versucht Amazon Textract, die richtigen Elemente aus Ihren Dokumenten zu extrahieren und Anmerkungen zu generieren. Anschließend müssen Sie die Richtigkeit dieser Anmerkungen überprüfen und alle falschen Anmerkungen korrigieren. Indem Sie Abfragen mit Antworten verknüpfen, vermitteln Sie dem Modell, welche Informationen in Ihren Dokumenten wichtig sind.
Berücksichtigen Sie beim Erstellen von Abfragen, welche Arten von Fragen Sie stellen müssen, um die relevanten Daten in Ihren Dokumenten abzurufen. Weitere Informationen zu dieser Antwortstruktur finden Sie unter Antwortstrukturen für Abfragen. Weitere Informationen zu bewährten Methoden für Abfragen finden Sie unter Bewährte Methoden für Abfragen.
Sie müssen einen Adapter anhand repräsentativer Beispiele Ihrer Dokumente schulen. Wenn Sie den AWS-Managementkonsole zum Kommentieren der Dokumente verwenden, bereitet die Konsole diese Dateien automatisch für Sie vor.