View a markdown version of this page

Klassifizierungsmodelle trainieren - Amazon Comprehend

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Klassifizierungsmodelle trainieren

Um ein Modell für die benutzerdefinierte Klassifizierung zu trainieren, definieren Sie die Kategorien und stellen Beispieldokumente zur Verfügung, um das benutzerdefinierte Modell zu trainieren. Sie trainieren das Modell entweder im Mehrklassen- oder im Multi-Label-Modus. Multi-class Der Modus ordnet jedem Dokument eine einzelne Klasse zu. Multi-label mode ordnet jedem Dokument eine oder mehrere Klassen zu.

Die benutzerdefinierte Klassifizierung unterstützt zwei Typen von Klassifikatormodellen: Klartextmodelle und native Dokumentmodelle. Ein Klartextmodell klassifiziert Dokumente anhand ihres Textinhalts. Ein systemeigenes Dokumentmodell klassifiziert Dokumente auch anhand des Textinhalts. Ein systemeigenes Dokumentmodell kann auch zusätzliche Signale verwenden, z. B. aus dem Layout des Dokuments. Sie trainieren ein systemeigenes Dokumentmodell mit systemeigenen Dokumenten, damit das Modell die Layoutinformationen lernt.

Plain-text Modelle haben die folgenden Eigenschaften:

  • Sie trainieren das Modell mit UTF-8 codierten Textdokumenten.

  • Sie können das Modell anhand von Dokumenten in einer der folgenden Sprachen trainieren: Englisch, Spanisch, Deutsch, Italienisch, Französisch oder Portugiesisch.

  • Die Trainingsdokumente für einen bestimmten Klassifikator müssen alle dieselbe Sprache verwenden.

  • Die Schulungsdokumente sind Klartext, sodass keine zusätzlichen Kosten für die Textextraktion anfallen.

Systemeigene Dokumentmodelle weisen die folgenden Merkmale auf:

  • Sie trainieren das Modell mithilfe halbstrukturierter Dokumente, zu denen die folgenden Dokumenttypen gehören:

    • Digitale und gescannte PDF-Dokumente.

    • Word-Dokumente (DOCX).

    • Bilder: JPG-Dateien, PNG-Dateien und einseitige TIFF-Dateien.

    • Textract API-Ausgabe-JSON-Dateien.

  • Sie trainieren das Modell anhand englischer Dokumente.

  • Wenn Ihre Trainingsdokumente gescannte Dokumentdateien enthalten, fallen zusätzliche Gebühren für die Textextraktion an. Einzelheiten finden Sie auf der Amazon Comprehend-Preisseite.

Sie können jeden der unterstützten Dokumenttypen anhand eines der beiden Modelltypen klassifizieren. Für die genauesten Ergebnisse empfehlen wir jedoch, ein Klartextmodell für die Klassifizierung von Klartextdokumenten und ein systemeigenes Dokumentmodell für die Klassifizierung halbstrukturierter Dokumente zu verwenden.