Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Trainieren Sie benutzerdefinierte Klassifikatoren (Konsole)
Sie können mithilfe der Konsole einen benutzerdefinierten Klassifikator erstellen und trainieren und den benutzerdefinierten Klassifikator dann zur Analyse Ihrer Dokumente verwenden.
Um einen benutzerdefinierten Klassifikator zu trainieren, benötigen Sie eine Reihe von Trainingsdokumenten. Sie kennzeichnen diese Dokumente mit den Kategorien, die der Dokumentenklassifikator erkennen soll. Informationen zur Vorbereitung Ihrer Schulungsunterlagen finden Sie unterVorbereitung der Trainingsdaten des Klassifikators.
So erstellen und trainieren Sie ein Dokumentenklassifizierermodell
-
Melden Sie sich bei der an AWS-Managementkonsole und öffnen Sie die Amazon Comprehend-Konsole unter https://console.aws.amazon.com/comprehend/
-
Wählen Sie im linken Menü Anpassung und dann Benutzerdefinierte Klassifizierung aus.
-
Wählen Sie Neues Modell erstellen aus.
-
Geben Sie unter Modelleinstellungen einen Modellnamen für den Klassifikator ein. Der Name muss innerhalb Ihres Kontos und Ihrer aktuellen Region eindeutig sein.
(Optional) Geben Sie einen Versionsnamen ein. Der Name muss innerhalb Ihres Kontos und Ihrer aktuellen Region eindeutig sein.
-
Wählen Sie die Sprache der Schulungsdokumente aus. Informationen zu den Sprachen, die Klassifikatoren unterstützen, finden Sie unterKlassifizierungsmodelle trainieren.
-
(Optional) Wenn Sie die Daten auf dem Speichervolume verschlüsseln möchten, während Amazon Comprehend Ihren Schulungsauftrag verarbeitet, wählen Sie Classifier-Verschlüsselung. Wählen Sie dann, ob Sie einen KMS-Schlüssel verwenden möchten, der mit Ihrem aktuellen Konto verknüpft ist, oder einen von einem anderen Konto.
Wenn Sie einen Schlüssel verwenden, der dem aktuellen Konto zugeordnet ist, wählen Sie die Schlüssel-ID für die KMS-Schlüssel-ID.
Wenn Sie einen Schlüssel verwenden, der einem anderen Konto zugeordnet ist, geben Sie die ARN für die Schlüssel-ID unter KMS-Schlüssel-ARN ein.
Anmerkung
Weitere Informationen zum Erstellen und Verwenden von KMS-Schlüsseln und der zugehörigen Verschlüsselung finden Sie unter AWS Key Management Service (AWS KMS).
-
Wählen Sie unter Datenspezifikationen den zu verwendenden Trainingsmodelltyp aus.
Nur-Text-Dokumente: Wählen Sie diese Option, um ein Nur-Text-Modell zu erstellen. Trainieren Sie das Modell mithilfe von Klartextdokumenten.
Systemeigene Dokumente: Wählen Sie diese Option, um ein systemeigenes Dokumentmodell zu erstellen. Trainieren Sie das Modell mithilfe systemeigener Dokumente (PDF, Word, Bilder).
-
Wählen Sie das Datenformat Ihrer Trainingsdaten. Hinweise zu den Datenformaten findest du unterFormate der Classifier-Trainingsdateien.
CSV-Datei: Wähle diese Option, wenn deine Trainingsdaten das CSV-Dateiformat verwenden.
Erweitertes Manifest: Wähle diese Option, wenn du Ground Truth verwendet hast, um erweiterte Manifestdateien für deine Trainingsdaten zu erstellen. Dieses Format ist verfügbar, wenn Sie Nur-Text-Dokumente als Trainingsmodelltyp ausgewählt haben.
-
Wählen Sie den Klassifizierungsmodus, den Sie verwenden möchten.
Single-label Modus: Wählen Sie diesen Modus, wenn sich die Kategorien, die Sie Dokumenten zuweisen, gegenseitig ausschließen und Sie Ihrem Klassifizierer beibringen möchten, jedem Dokument ein Label zuzuweisen. In der Amazon Comprehend API wird der Modus mit einem Etikett als Mehrklassenmodus bezeichnet.
Multi-label Modus: Wählen Sie diesen Modus, wenn mehrere Kategorien gleichzeitig auf ein Dokument angewendet werden können und Sie Ihren Klassifizierer darin schulen, jedem Dokument ein oder mehrere Labels zuzuweisen.
-
Wenn Sie Multi-label den Modus wählen, können Sie das Trennzeichen für Beschriftungen auswählen. Verwenden Sie dieses Trennzeichen, um Beschriftungen zu trennen, wenn ein Trainingsdokument mehrere Klassen enthält. Das Standardtrennzeichen ist das Pipezeichen.
-
(Optional) Wenn Sie Augmented Manifest als Datenformat ausgewählt haben, können Sie bis zu fünf erweiterte Manifestdateien eingeben. Jede erweiterte Manifestdatei enthält entweder einen Trainingsdatensatz oder einen Testdatensatz. Sie müssen mindestens einen Trainingsdatensatz angeben. Testdatensätze sind optional. Gehen Sie wie folgt vor, um die erweiterten Manifestdateien zu konfigurieren:
-
Erweitern Sie unter Trainings- und Testdatensatz den Bereich Eingabeposition.
-
Wählen Sie unter Datensatztyp die Option Trainingsdaten oder Testdaten aus.
-
Geben Sie für den S3-Speicherort der erweiterten Manifestdatei von SageMaker AI Ground Truth den Speicherort des Amazon S3-Buckets ein, der die Manifestdatei enthält, oder navigieren Sie zu dieser, indem Sie Browse S3 wählen. Die IAM-Rolle, die Sie für die Zugriffsberechtigungen für den Trainingsjob verwenden, muss über Leseberechtigungen für den S3-Bucket verfügen.
-
Geben Sie für die Attributnamen den Namen des Attributs ein, das Ihre Anmerkungen enthält. Wenn die Datei Anmerkungen aus mehreren verketteten Beschriftungsaufträgen enthält, fügen Sie für jeden Auftrag ein Attribut hinzu.
Um eine weitere Eingabeposition hinzuzufügen, wählen Sie Eingabeposition hinzufügen und konfigurieren Sie dann die nächste Position.
-
-
(Optional) Wenn Sie eine CSV-Datei als Datenformat ausgewählt haben, gehen Sie wie folgt vor, um den Trainingsdatensatz und den optionalen Testdatensatz zu konfigurieren:
-
Geben Sie unter Trainingsdatensatz den Speicherort des Amazon S3-Buckets ein, der Ihre CSV-Datei mit Ihren Trainingsdaten enthält, oder navigieren Sie zu diesem, indem Sie S3 durchsuchen wählen. Die IAM-Rolle, die Sie für die Zugriffsberechtigungen für den Trainingsjob verwenden, muss über Leseberechtigungen für den S3-Bucket verfügen.
(Optional) Wenn Sie native Dokumente als Trainingsmodelltyp ausgewählt haben, geben Sie auch die URL des Amazon S3-Ordners an, der die Trainingsbeispieldateien enthält.
-
Wählen Sie unter Testdatensatz aus, ob Sie zusätzliche Daten für Amazon Comprehend bereitstellen, um das trainierte Modell zu testen.
-
Autosplit: Autosplit wählt automatisch 10% Ihrer Trainingsdaten aus, um sie für die Verwendung als Testdaten zu reservieren.
(Optional) Vom Kunden bereitgestellt: Geben Sie die URL der CSV-Datei mit den Testdaten in Amazon S3 ein. Sie können auch zu ihrem Speicherort in Amazon S3 navigieren und Ordner auswählen auswählen.
(Optional) Wenn Sie Systemeigene Dokumente als Trainingsmodelltyp ausgewählt haben, geben Sie auch die URL des Amazon S3-Ordners an, der die Testdateien enthält.
-
-
-
(Optional) Für den Dokumentlesemodus können Sie die Standardaktionen zur Textextraktion überschreiben. Diese Option ist für Klartextmodelle nicht erforderlich, da sie für die Textextraktion gescannter Dokumente gilt. Weitere Informationen finden Sie unter Optionen für die Textextraktion festlegen.
-
(Optional für Klartextmodelle) Geben Sie für Ausgabedaten den Speicherort eines Amazon S3-Buckets ein, um die Trainingsausgabedaten zu speichern, z. B. die Konfusionsmatrix. Weitere Informationen finden Sie unter Verwechslungsmatrix.
(Optional) Wenn Sie das Ausgabeergebnis Ihres Trainingsjobs verschlüsseln möchten, wählen Sie Verschlüsselung. Wählen Sie dann, ob Sie einen KMS-Schlüssel verwenden möchten, der dem aktuellen Konto zugeordnet ist, oder einen von einem anderen Konto.
Wenn Sie einen Schlüssel verwenden, der dem aktuellen Konto zugeordnet ist, wählen Sie den Schlüsselalias für die KMS-Schlüssel-ID.
Wenn Sie einen Schlüssel verwenden, der einem anderen Konto zugeordnet ist, geben Sie den ARN für den Schlüsselalias oder die ID unter KMS-Schlüssel-ID ein.
-
Wählen Sie für die IAM-Rolle die Option Choose an existing IAM role aus und wählen Sie dann eine vorhandene IAM-Rolle aus, die über Leseberechtigungen für den S3-Bucket verfügt, der Ihre Schulungsdokumente enthält. Die Rolle muss über eine Vertrauensrichtlinie verfügen, die mit 1 beginnt, um gültig
comprehend.amazonaws.com.rproxy.goskope.comzu sein.Wenn Sie noch keine IAM-Rolle mit diesen Berechtigungen haben, wählen Sie IAM-Rolle erstellen, um eine zu erstellen. Wählen Sie die Zugriffsberechtigungen aus, um diese Rolle zu gewähren, und wählen Sie dann ein Namenssuffix, um die Rolle von den IAM-Rollen in Ihrem Konto zu unterscheiden.
Anmerkung
Für verschlüsselte Eingabedokumente muss die verwendete IAM-Rolle ebenfalls über eine entsprechende Berechtigung verfügen.
kms:DecryptWeitere Informationen finden Sie unter Für die Verwendung der KMS-Verschlüsselung sind Berechtigungen erforderlich. -
(Optional) Um Ihre Ressourcen von einer VPC aus in Amazon Comprehend zu starten, geben Sie die VPC-ID unter VPC ein oder wählen Sie die ID aus der Dropdownliste aus.
Wählen Sie das Subnetz unter Subnetze (s) aus. Nachdem Sie das erste Subnetz ausgewählt haben, können Sie weitere Subnetze auswählen.
Wählen Sie unter Sicherheitsgruppe (n) die zu verwendende Sicherheitsgruppe aus, falls Sie eine angegeben haben. Nachdem Sie die erste Sicherheitsgruppe ausgewählt haben, können Sie weitere auswählen.
Anmerkung
Wenn Sie für Ihren Klassifizierungsauftrag eine VPC verwenden, muss die für die Vorgänge Erstellen und Starten
DataAccessRoleverwendete VPC über Berechtigungen für die VPC verfügen, die auf die Eingabedokumente und den Ausgabe-Bucket zugreift. -
(Optional) Um dem benutzerdefinierten Klassifikator ein Tag hinzuzufügen, geben Sie unter Tags ein Schlüssel-Wert-Paar ein. Wählen Sie Add tag. Um dieses Paar vor der Erstellung des Klassifikators zu entfernen, wählen Sie Tag entfernen aus. Weitere Informationen finden Sie unter Markieren von Ressourcen.
-
Wählen Sie Erstellen aus.
In der Konsole wird die Seite „Klassifikatoren“ angezeigt. Der neue Klassifikator wird in der Tabelle mit seinem Status angezeigtSubmitted. Wenn der Klassifikator mit der Verarbeitung der Trainingsdokumente beginnt, ändert sich der Status in. Training Wenn ein Klassifikator einsatzbereit ist, ändert sich der Status in oder. Trained Trained with warnings Wenn der Status lautetTRAINED_WITH_WARNINGS, überprüfen Sie den Ordner mit übersprungenen Dateien im. Trainingsergebnis des Klassifikators
Wenn Amazon Comprehend bei der Erstellung oder beim Training auf Fehler gestoßen ist, ändert sich der Status in. In error Sie können einen Klassifizierer-Job in der Tabelle auswählen, um weitere Informationen über den Klassifikator zu erhalten, einschließlich aller Fehlermeldungen.