View a markdown version of this page

Latih pengklasifikasi khusus (konsol) - Amazon Comprehend

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Latih pengklasifikasi khusus (konsol)

Anda dapat membuat dan melatih pengklasifikasi khusus menggunakan konsol, lalu menggunakan pengklasifikasi khusus untuk menganalisis dokumen Anda.

Untuk melatih pengklasifikasi khusus, Anda memerlukan satu set dokumen pelatihan. Anda memberi label dokumen-dokumen ini dengan kategori yang Anda ingin pengklasifikasi dokumen mengenali. Untuk informasi tentang menyiapkan dokumen pelatihan Anda, lihatMempersiapkan data pelatihan pengklasifikasi.

Untuk membuat dan melatih model pengklasifikasi dokumen
  1. Masuk ke Konsol Manajemen AWS dan buka konsol Amazon Comprecept di https://console.aws.amazon.com/comprehend/

  2. Dari menu sebelah kiri, pilih Ku stomisasi dan kemudian pilih Klasifikasi K ustom.

  3. Pilih Buat model baru.

  4. Di bawah Pengaturan model, masukkan nama model untuk pengklasifikasi. Nama harus unik dalam akun Anda dan Wilayah saat ini.

    (Opsional) Masukkan nama versi. Nama harus unik dalam akun Anda dan Wilayah saat ini.

  5. Pilih bahasa dokumen pelatihan. Untuk melihat bahasa yang didukung pengklasifikasi, lihatModel klasifikasi pelatihan.

  6. (Opsional) Jika Anda ingin mengenkripsi data dalam volume penyimpanan saat Amazon Comprecept memproses pekerjaan pelatihan Anda, pilih Enkripsi peng klasifikasi. Kemudian pilih apakah akan menggunakan kunci KMS yang terkait dengan akun Anda saat ini, atau satu dari akun lain.

    • Jika Anda menggunakan kunci yang terkait dengan akun saat ini, pilih ID kunci untuk ID kunci KMS.

    • Jika Anda menggunakan kunci yang terkait dengan akun lain, masukkan ARN untuk ID kunci di bawah kunci KMS AR N.

    catatan

    Untuk informasi selengkapnya tentang membuat dan menggunakan kunci KMS dan enkripsi terkait, lihat AWS Key Management Service (AWS KMS).

  7. Di bawah Spesifikasi data, pilih jenis model pelatihan yang akan digunakan.

    • Dokumen teks biasa: Pilih opsi ini untuk membuat model teks biasa. Latih model menggunakan dokumen teks biasa.

    • Dokumen asli: Pilih opsi ini untuk membuat model dokumen asli. Latih model menggunakan dokumen asli (PDF, Word, gambar).

  8. Pilih format Data dari data pelatihan Anda. Untuk informasi tentang format data, lihatFormat file pelatihan pengklasifikasi.

    • File CSV: Pilih opsi ini jika data pelatihan Anda menggunakan format file CSV.

    • Manifes tambahan: Pilih opsi ini jika Anda menggunakan Ground Truth untuk membuat file manifes tambahan untuk data pelatihan Anda. Format ini tersedia jika Anda memilih Dokumen teks biasa sebagai jenis model pelatihan.

  9. Pilih mode Classifier yang akan digunakan.

    • Single-label mode: Pilih mode ini jika kategori yang Anda tetapkan untuk dokumen saling eksklusif dan Anda melatih pengklasifikasi untuk menetapkan satu label ke setiap dokumen. Di Amazon Comprecept API, mode label tunggal dikenal sebagai mode multi-kelas.

    • Multi-label mode: Pilih mode ini jika beberapa kategori dapat diterapkan ke dokumen secara bersamaan, dan Anda melatih pengklasifikasi Anda untuk menetapkan satu atau lebih label untuk setiap dokumen.

  10. Jika Anda memilih Multi-label mode, Anda dapat memilih Pem batas untuk label. Gunakan karakter pembatas ini untuk memisahkan label ketika ada beberapa kelas untuk dokumen pelatihan. Pembatas default adalah karakter pipa.

  11. (Opsional) Jika Anda memilih Augmented manifes sebagai format data, Anda dapat memasukkan hingga lima file manifes ditambah. Setiap file manifes yang diperbesar berisi kumpulan data pelatihan atau kumpulan data pengujian. Anda harus menyediakan setidaknya satu dataset pelatihan. Kumpulan data uji bersifat opsional. Gunakan langkah-langkah berikut untuk mengonfigurasi file manifes yang diperbesar:

    1. Di bawah Training and test dataset, perluas panel lokasi Input.

    2. Di Jenis Dataset, pilih Data pelatihan atau Data uji.

    3. Untuk lokasi S3 file manifes tambahan SageMaker AI Ground Truth, masukkan lokasi bucket Amazon S3 yang berisi file manifes atau arahkan ke sana dengan memilih Browse S3. Peran IAM yang Anda gunakan untuk izin akses untuk pekerjaan pelatihan harus memiliki izin baca untuk bucket S3.

    4. Untuk nama Atribut, masukkan nama atribut yang berisi anotasi Anda. Jika file berisi anotasi dari beberapa pekerjaan pelabelan beranTAI, tambahkan atribut untuk setiap pekerjaan.

    5. Untuk menambahkan lokasi input lain, pilih Tambahkan lokasi input dan kemudian konfigurasikan lokasi berikutnya.

  12. (Opsional) Jika Anda memilih file CSV sebagai format data, gunakan langkah-langkah berikut untuk mengonfigurasi kumpulan data pelatihan dan kumpulan data pengujian opsional:

    1. Di bawah Dataset pelatihan, masukkan lokasi bucket Amazon S3 yang berisi file CSV data pelatihan Anda atau arahkan ke sana dengan memilih Jelajahi S3. Peran IAM yang Anda gunakan untuk izin akses untuk pekerjaan pelatihan harus memiliki izin baca untuk bucket S3.

      (Opsional) Jika Anda memilih dokumen asli sebagai jenis model pelatihan, Anda juga memberikan URL folder Amazon S3 yang berisi file contoh pelatihan.

    2. Di bawah Uji kumpulan data, pilih apakah Anda menyediakan data tambahan untuk Amazon Comprecept untuk menguji model terlatih.

      • Autosplit: Autosplit secara otomatis memilih 10% dari data pelatihan Anda untuk cadangan untuk digunakan sebagai data pengujian.

      • (Opsional) Pelanggan disediakan: Masukkan URL file CSV data pengujian di Amazon S3. Anda juga dapat menavigasi ke lokasinya di Amazon S3 dan memilih Pilih folder.

        (Opsional) Jika Anda memilih dokumen asli sebagai jenis model pelatihan, Anda juga memberikan URL folder Amazon S3 yang berisi file pengujian.

  13. (Opsional) Untuk mode baca dokumen, Anda dapat mengganti tindakan ekstraksi teks default. Opsi ini tidak diperlukan untuk model teks biasa, karena berlaku untuk ekstraksi teks untuk dokumen yang dipindai. Untuk informasi selengkapnya, lihat Mengatur opsi ekstraksi teks.

  14. (Opsional untuk model teks biasa) Untuk data Output, masukkan lokasi bucket Amazon S3 untuk menyimpan data keluaran pelatihan, seperti matriks kebingungan. Untuk informasi selengkapnya, lihat Matriks kebingungan.

    (Opsional) Jika Anda memilih untuk mengenkripsi hasil keluaran dari pekerjaan pelatihan Anda, pilih Enkripsi. Kemudian pilih apakah akan menggunakan kunci KMS yang terkait dengan akun saat ini, atau satu dari akun lain.

    • Jika Anda menggunakan kunci yang terkait dengan akun saat ini, pilih alias kunci untuk ID kunci KMS.

    • Jika Anda menggunakan kunci yang terkait dengan akun lain, masukkan ARN untuk alias kunci atau ID di bawah ID kunci KMS.

  15. Untuk peran IAM, pilih Pilih peran IAM yang ada, lalu pilih peran IAM yang sudah ada yang memiliki izin baca untuk bucket S3 yang berisi dokumen pelatihan Anda. Peran harus memiliki kebijakan kepercayaan yang dimulai dengan comprehend.amazonaws.com menjadi valid.

    Jika Anda belum memiliki peran IAM dengan izin ini, pilih Buat peran IAM untuk membuatnya. Pilih izin akses untuk memberikan peran ini, lalu pilih akhiran nama untuk membedakan peran dari peran IAM di akun Anda.

    catatan

    Untuk dokumen input terenkripsi, peran IAM yang digunakan juga harus memiliki kms:Decrypt izin. Untuk informasi selengkapnya, lihat Izin diperlukan untuk menggunakan enkripsi KMS.

  16. (Opsional) Untuk meluncurkan sumber daya Anda ke Amazon Comprecept dari VPC, masukkan ID VPC di bawah VPC atau pilih ID dari daftar dropdown.

    1. Pilih subnet di bawah Subnet (s). Setelah Anda memilih subnet pertama, Anda dapat memilih yang tambahan.

    2. Di bawah Grup Keamanan, pilih grup keamanan yang akan digunakan jika Anda menentukannya. Setelah Anda memilih grup keamanan pertama, Anda dapat memilih yang tambahan.

    catatan

    Saat Anda menggunakan VPC dengan pekerjaan klasifikasi Anda, yang DataAccessRole digunakan untuk operasi Buat dan Mulai harus memiliki izin ke VPC yang mengakses dokumen input dan bucket keluaran.

  17. (Opsional) Untuk menambahkan tag ke pengklasifikasi khusus, masukkan pasangan kunci-nilai di bawah Tag. Pilih Tambahkan tanda. Untuk menghapus pasangan ini sebelum membuat pengklasifikasi, pilih H apus tag. Untuk informasi selengkapnya, lihat Memberikan tag ke sumber daya Anda.

  18. Pilih Buat.

Konsol menampilkan halaman Classifiers. Pengklasifikasi baru muncul dalam tabel, ditampilkan Submitted sebagai statusnya. Ketika pengklasifikasi mulai memproses dokumen pelatihan, status berubah menjadiTraining. Ketika pengklasifikasi siap digunakan, status berubah menjadi Trained atauTrained with warnings. Jika statusnyaTRAINED_WITH_WARNINGS, tinjau folder file yang dilewati diOutput pelatihan pengklasifikasi.

Jika Amazon Comprecept mengalami kesalahan selama pembuatan atau pelatihan, status berubah menjadiIn error. Anda dapat memilih pekerjaan pengklasifikasi dalam tabel untuk mendapatkan informasi lebih lanjut tentang pengklasifikasi, termasuk pesan kesalahan apa pun.

Daftar pengklasifikasi khusus.