View a markdown version of this page

Classificateurs personnalisés Train (console) - Amazon Comprehend

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Classificateurs personnalisés Train (console)

Vous pouvez créer et entraîner un classificateur personnalisé à l'aide de la console, puis utiliser le classificateur personnalisé pour analyser vos documents.

Pour entraîner un classificateur personnalisé, vous avez besoin d'un ensemble de documents de formation. Vous attribuez à ces documents les catégories que vous souhaitez que le classificateur de documents reconnaisse. Pour plus d'informations sur la préparation de vos documents de formation, consultezPréparation des données d'entraînement du classificateur.

Pour créer et entraîner un modèle de classificateur de documents
  1. Connectez-vous à la console Amazon Comprehend Console de gestion AWS et ouvrez la console à l'adresse https://console.aws.amazon.com/comprehend/

  2. Dans le menu de gauche, choisissez Personnalisation, puis Classification personnalisée.

  3. Choisissez Créer un nouveau modèle.

  4. Dans Paramètres du modèle, entrez un nom de modèle pour le classificateur. Le nom doit être unique au sein de votre compte et de votre région actuelle.

    (Facultatif) Entrez un nom de version. Le nom doit être unique au sein de votre compte et de votre région actuelle.

  5. Sélectionnez la langue des documents de formation. Pour connaître les langues prises en charge par les classificateurs, consultezModèles de classification de la formation.

  6. (Facultatif) Si vous souhaitez chiffrer les données du volume de stockage pendant qu'Amazon Comprehend traite votre travail de formation, choisissez le chiffrement Classifier. Choisissez ensuite si vous souhaitez utiliser une clé KMS associée à votre compte actuel ou une clé provenant d'un autre compte.

    • Si vous utilisez une clé associée au compte actuel, choisissez l'ID de clé pour l'ID de clé KMS.

    • Si vous utilisez une clé associée à un autre compte, entrez l'ARN de l'ID de clé sous KMS key ARN.

    Note

    Pour plus d'informations sur la création et l'utilisation de clés KMS et sur le chiffrement associé, consultez AWS Key Management Service (AWS KMS).

  7. Dans Spécifications des données, choisissez le type de modèle de formation à utiliser.

    • Documents en texte brut : choisissez cette option pour créer un modèle en texte brut. Entraînez le modèle à l'aide de documents en texte brut.

    • Documents natifs : choisissez cette option pour créer un modèle de document natif. Entraînez le modèle à l'aide de documents natifs (PDF, Word, images).

  8. Choisissez le format de données de vos données d'entraînement. Pour plus d'informations sur les formats de données, consultezFormats de fichiers de formation sur les classificateurs.

    • Fichier CSV : choisissez cette option si vos données d'entraînement utilisent le format de fichier CSV.

    • Manifeste augmenté : choisissez cette option si vous avez utilisé Ground Truth pour créer des fichiers manifestes augmentés pour vos données d'entraînement. Ce format est disponible si vous avez choisi Documents en texte brut comme type de modèle de formation.

  9. Choisissez le mode Classificateur à utiliser.

    • Single-label mode : choisissez ce mode si les catégories que vous attribuez aux documents s'excluent mutuellement et que vous entraînez votre classificateur à attribuer une étiquette à chaque document. Dans l'API Amazon Comprehend, le mode étiquette unique est appelé mode multiclasse.

    • Multi-label mode : Choisissez ce mode si plusieurs catégories peuvent être appliquées à un document en même temps et que vous entraînez votre classificateur à attribuer une ou plusieurs étiquettes à chaque document.

  10. Si vous choisissez Multi-label le mode, vous pouvez sélectionner le délimiteur pour les étiquettes. Utilisez ce caractère de délimitation pour séparer les étiquettes lorsqu'un document de formation comporte plusieurs classes. Le délimiteur par défaut est le caractère pipe.

  11. (Facultatif) Si vous avez choisi Manifeste augmenté comme format de données, vous pouvez saisir jusqu'à cinq fichiers manifestes augmentés. Chaque fichier manifeste augmenté contient soit un ensemble de données d'entraînement, soit un ensemble de données de test. Vous devez fournir au moins un jeu de données d'entraînement. Les ensembles de données de test sont facultatifs. Pour configurer les fichiers manifestes augmentés, procédez comme suit :

    1. Sous Ensemble de données d'entraînement et de test, développez le panneau Emplacement des entrées.

    2. Dans Type de jeu de données, choisissez Données d'entraînement ou Données de test.

    3. Pour l'emplacement S3 du fichier manifeste augmenté SageMaker AI Ground Truth, entrez l'emplacement du compartiment Amazon S3 qui contient le fichier manifeste ou accédez-y en choisissant Parcourir S3. Le rôle IAM que vous utilisez pour les autorisations d'accès à la tâche de formation doit disposer d'autorisations de lecture pour le compartiment S3.

    4. Pour les noms d'attributs, entrez le nom de l'attribut qui contient vos annotations. Si le fichier contient des annotations provenant de plusieurs tâches d'étiquetage en chaîne, ajoutez un attribut pour chaque tâche.

    5. Pour ajouter un autre emplacement d'entrée, choisissez Ajouter un emplacement d'entrée, puis configurez l'emplacement suivant.

  12. (Facultatif) Si vous avez choisi un fichier CSV comme format de données, procédez comme suit pour configurer le jeu de données d'entraînement et le jeu de données de test facultatif :

    1. Sous Ensemble de données d'entraînement, entrez l'emplacement du compartiment Amazon S3 qui contient le fichier CSV de vos données d'entraînement ou accédez-y en choisissant Parcourir S3. Le rôle IAM que vous utilisez pour les autorisations d'accès à la tâche de formation doit disposer d'autorisations de lecture pour le compartiment S3.

      (Facultatif) Si vous avez choisi Documents natifs comme type de modèle de formation, vous fournissez également l'URL du dossier Amazon S3 qui contient les exemples de fichiers de formation.

    2. Sous Ensemble de données de test, indiquez si vous fournissez des données supplémentaires à Amazon Comprehend pour tester le modèle entraîné.

      • Autosplit  : Autosplit sélectionne automatiquement 10 % de vos données d'entraînement à réserver pour les utiliser comme données de test.

      • (Facultatif) Fourni par le client  : entrez l'URL du fichier CSV des données de test dans Amazon S3. Vous pouvez également accéder à son emplacement dans Amazon S3 et choisir Sélectionner un dossier.

        (Facultatif) Si vous avez choisi Documents natifs comme type de modèle de formation, vous fournissez également l'URL du dossier Amazon S3 contenant les fichiers de test.

  13. (Facultatif) Pour le mode Lecture du document, vous pouvez modifier les actions d'extraction de texte par défaut. Cette option n'est pas requise pour les modèles en texte brut, car elle s'applique à l'extraction de texte pour les documents numérisés. Pour de plus amples informations, veuillez consulter Configuration des options d'extraction de texte.

  14. (Facultatif pour les modèles en texte brut) Pour les données de sortie, entrez l'emplacement d'un compartiment Amazon S3 pour enregistrer les données de sortie d'entraînement, telles que la matrice de confusion. Pour de plus amples informations, veuillez consulter Matrice Confusion.

    (Facultatif) Si vous choisissez de chiffrer le résultat de votre formation, choisissez Chiffrement. Choisissez ensuite si vous souhaitez utiliser une clé KMS associée au compte actuel ou une clé provenant d'un autre compte.

    • Si vous utilisez une clé associée au compte actuel, choisissez l'alias de clé pour l'ID de clé KMS.

    • Si vous utilisez une clé associée à un autre compte, entrez l'ARN de l'alias ou de l'ID de clé sous ID de clé KMS.

  15. Pour le rôle IAM, choisissez Choisir un rôle IAM existant, puis choisissez un rôle IAM existant doté d'autorisations de lecture pour le compartiment S3 qui contient vos documents de formation. Le rôle doit avoir une politique de confiance qui commence par comprehend.amazonaws.com être valide.

    Si vous ne possédez pas encore de rôle IAM doté de ces autorisations, choisissez Créer un rôle IAM pour en créer un. Choisissez les autorisations d'accès pour accorder ce rôle, puis choisissez un suffixe de nom pour distinguer le rôle des rôles IAM de votre compte.

    Note

    Pour les documents d'entrée chiffrés, le rôle IAM utilisé doit également disposer d'une kms:Decrypt autorisation. Pour de plus amples informations, veuillez consulter Autorisations requises pour utiliser le chiffrement KMS.

  16. (Facultatif) Pour lancer vos ressources dans Amazon Comprehend depuis un VPC, entrez l'ID du VPC sous VPC ou choisissez-le dans la liste déroulante.

    1. Choisissez le sous-réseau sous Sous-réseaux (s). Après avoir sélectionné le premier sous-réseau, vous pouvez en choisir d'autres.

    2. Sous Groupe (s) de sécurité, choisissez le groupe de sécurité à utiliser si vous en avez spécifié un. Après avoir sélectionné le premier groupe de sécurité, vous pouvez en choisir d'autres.

    Note

    Lorsque vous utilisez un VPC avec votre tâche de classification, les personnes DataAccessRole utilisées pour les opérations de création et de démarrage doivent disposer d'autorisations sur le VPC qui accède aux documents d'entrée et au compartiment de sortie.

  17. (Facultatif) Pour ajouter une balise au classificateur personnalisé, entrez une paire clé-valeur sous Balises. Choisissez Ajouter une balise. Pour supprimer cette paire avant de créer le classificateur, choisissez Supprimer la balise. Pour de plus amples informations, veuillez consulter Balisage de vos ressources .

  18. Choisissez Créer.

La console affiche la page Classificateurs. Le nouveau classificateur apparaît dans le tableau et indique son Submitted statut. Lorsque le classificateur commence à traiter les documents de formation, le statut passe àTraining. Lorsqu'un classificateur est prêt à être utilisé, son statut passe à Trained ouTrained with warnings. Si le statut est définiTRAINED_WITH_WARNINGS, passez en revue le dossier des fichiers ignorés dans leRésultat d'entraînement du classificateur.

Si Amazon Comprehend a rencontré des erreurs lors de la création ou de la formation, le statut passe àIn error. Vous pouvez choisir une tâche de classification dans le tableau pour obtenir plus d'informations sur le classificateur, y compris les éventuels messages d'erreur.

La liste de classificateurs personnalisés.