Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
File Manifest Augmented untuk Pekerjaan Pelatihan
Untuk menyertakan metadata dengan dataset Anda dalam pekerjaan pelatihan, gunakan file manifes tambahan. Saat menggunakan file manifes yang diperbesar, dataset Anda harus disimpan di Amazon Simple Storage Service (Amazon S3), dan Anda harus mengonfigurasi pekerjaan pelatihan Anda untuk menggunakan kumpulan data yang disimpan di sana. Anda menentukan lokasi dan format dataset ini untuk satu atau lebih Channel. Manifes yang diperbesar hanya dapat mendukung mode input Pipe. Lihat bagian, InputMode di Channel untuk mempelajari lebih lanjut tentang mode input pipa.
Saat menentukan parameter saluran, Anda menentukan jalur ke file, yang disebut aS3Uri. Amazon SageMaker AI menafsirkan URI ini berdasarkan yang ditentukan S3DataType dalam S3DataSource. AugmentedManifestFileOpsi mendefinisikan format manifes yang menyertakan metadata dengan data input. Menggunakan file manifes yang diperbesar adalah alternatif untuk pra-pemrosesan ketika Anda telah memberi label data. Untuk pekerjaan pelatihan menggunakan data berlabel, Anda biasanya perlu melakukan praproses dataset untuk menggabungkan data input dengan metadata sebelum pelatihan. Jika dataset pelatihan Anda besar, pra-pemrosesan bisa memakan waktu dan mahal.
Format File Manifest yang Ditingkatkan
File manifes yang diperbesar harus diformat dalam format
Selama pelatihan, SageMaker AI mengurai setiap baris JSON dan mengirimkan beberapa atau semua atributnya ke algoritma pelatihan. Anda menentukan konten atribut mana yang akan dilewati dan urutan untuk meneruskannya dengan AttributeNames parameter CreateTrainingJob API. AttributeNamesParameter adalah daftar nama atribut yang dic SageMaker ari AI di objek JSON untuk digunakan sebagai input pelatihan.
Misalnya, jika Anda mencant ["line", "book"] umkan untukAttributeNames, data input harus menyertakan nama atribut line dan book dalam urutan yang ditentukan. Untuk contoh ini, konten file manifes ditambah berikut ini valid:
{"author": "Herman Melville", "line": "Call me Ishmael", "book": "Moby Dick"} {"line": "It was love at first sight.", "author": "Joseph Heller", "book": "Catch-22"}
SageMaker AI mengabaikan nama atribut yang tidak terdaftar meskipun mereka mendahului, mengikuti, atau berada di antara atribut yang terdaftar.
Saat menggunakan file manifes yang diperbesar, perhatikan pedoman berikut:
-
Urutan atribut yang tercantum dalam
AttributeNamesparameter menentukan urutan atribut yang diteruskan ke algoritma dalam pekerjaan pelatihan. -
Yang terdaftar
AttributeNamesdapat menjadi subset dari semua atribut di baris JSON. SageMaker AI mengabaikan atribut yang tidak terdaftar dalam file. -
Anda dapat menentukan semua jenis data yang diizinkan oleh format JSON
AttributeNames, termasuk teks, numerik, array data, atau objek. -
Untuk menyertakan URI S3 sebagai nama atribut, tambahkan akhiran
-refke sana.
Jika nama atribut berisi akhiran-ref, nilai atribut harus berupa URI S3 ke file data yang dapat diakses oleh pekerjaan pelatihan. Misalnya, jika AttributeNames berisi["image-ref", "is-a-cat"], contoh berikut menunjukkan file manifes tambahan yang valid:
{"image-ref": "s3://amzn-s3-demo-bucket/sample01/image1.jpg", "is-a-cat": 1} {"image-ref": "s3://amzn-s3-demo-bucket/sample02/image2.jpg", "is-a-cat": 0}
Dalam kasus baris JSON pertama dari file manifes ini, SageMaker AI mengambil image1.jpg file dari s3://amzn-s3-demo-bucket/sample01/ dan representasi string dari is-a-cat atribut "1" untuk klasifikasi gambar.
Tip
Untuk membuat file manifes tambahan, gunakan Amazon G SageMaker round Truth dan buat pekerjaan pelabelan. Untuk informasi selengkapnya tentang output dari pekerjaan pelabelan, lihatPelabelan data keluaran pekerjaan.
Gunakan File Manifest Augmented
Bagian berikut menunjukkan cara menggunakan file manifes yang diperbesar dalam pekerjaan SageMaker pelatihan Amazon Anda, baik dengan konsol SageMaker AI atau secara terprogram menggunakan SageMaker Python SDK.
Gunakan File Manifest Augmented (Konsol)
Untuk menyelesaikan prosedur ini, Anda perlu:
-
URL bucket S3 tempat Anda menyimpan file manifes yang diperbesar.
-
Untuk menyimpan data yang tercantum dalam file manifes ditambah dalam bucket S3.
-
URL bucket S3 tempat Anda ingin menyimpan output pekerjaan.
Untuk menggunakan file manifes ditambah dalam pekerjaan pelatihan (konsol)
Buka konsol Amazon SageMaker AI di https://console.aws.amazon.com/sagemaker/
. -
Di panel navigasi, pilih Pel atihan, lalu pilih Pekerjaan pelatihan.
-
Pilih Buat pekerjaan pelatihan.
-
Berikan nama untuk pekerjaan pelatihan. Nama harus unik dalam Wil AWS ayah dalam AWS akun. Ini dapat memiliki 1 hingga 63 karakter. Karakter yang valid: a-z, A-Z, 0-9, dan.: + = @ _% - (tanda hubung).
-
Pilih algoritma yang ingin Anda gunakan. Untuk informasi tentang algoritma bawaan yang didukung, lihatBuilt-in algoritma dan model terlatih di Amazon SageMaker. Jika Anda ingin menggunakan algoritma khusus, pastikan itu kompatibel dengan mode Pipe.
-
(Opsional) Untuk konfigurasi Sumber Daya, terima nilai default atau, untuk mengurangi waktu komputasi, tingkatkan konsumsi sumber daya.
-
(Opsional) Untuk tipe Inst ance, pilih jenis instance komputasi ML yang ingin Anda gunakan. Dalam kebanyakan kasus, ml.m4. xlarge sudah cukup.
-
Untuk Jumlah contoh, gunakan default,
1. -
(Opsional) Untuk Volume tambahan per instans (GB), pilih ukuran volume penyimpanan ML yang ingin Anda sediakan. Dalam kebanyakan kasus, Anda dapat menggunakan default,
1. Jika Anda menggunakan dataset besar, gunakan ukuran yang lebih besar.
-
-
Berikan informasi tentang data input untuk dataset pelatihan.
-
Untuk nama saluran, terima default (
train) atau masukkan nama yang lebih bermakna, sepertitraining-augmented-manifest-file. -
Untuk InputMode, pilih Pipa.
-
Untuk tipe distribusi data S3, pilih FullyReplicated. Saat berlatih secara bertahap, replikasi penuh menyebabkan setiap instance komputasi ML menggunakan salinan lengkap dari kumpulan data yang diperluas. Untuk algoritma berbasis saraf, sepertiAlgoritma Model Topik Saraf (NTM), pilih.
ShardedByS3Key -
Jika data yang ditentukan dalam file manifes ditambah tidak terkompresi, setel tipe Kompresi ke Tidak Ada. Jika data dikompresi menggunakan gzip, atur ke G zip.
-
(Opsional) Untuk jenis Konten, tentukan jenis MIME yang sesuai. Jenis konten adalah jenis ekstensi surat internet multiguna (MIME) dari data.
-
Untuk Record wrapper, jika dataset yang ditentukan dalam file manifes ditambah disimpan dalam format Recordio, pilih Recordio. Jika dataset Anda tidak disimpan sebagai RecordIO-formatted file, pilih Tidak Ada.
-
Untuk tipe data S3, pilih AugmentedManifestFile.
-
Untuk lokasi S3, berikan jalur ke bucket tempat Anda menyimpan file manifes yang diperbesar.
-
Untuk nama AugmentedManifestFile atribut, tentukan nama atribut yang ingin Anda gunakan. Nama atribut harus ada dalam file manifes yang diperbesar, dan peka huruf besar/kecil.
-
(Opsional) Untuk menambahkan lebih banyak nama atribut, pilih Tambah baris dan tentukan nama atribut lain untuk setiap atribut.
-
(Opsional) Untuk menyesuaikan urutan nama atribut, pilih tombol atas atau bawah di sebelah nama. Saat menggunakan file manifes yang diperbesar, urutan nama atribut yang ditentukan penting.
-
Pilih Selesai.
-
-
Untuk konfigurasi data keluaran, berikan informasi berikut:
-
Untuk lokasi S3, ketik jalur ke bucket S3 tempat Anda ingin menyimpan data keluaran.
-
(Opsional) Anda dapat menggunakan kunci enkripsi AWS Key Management Service (AWS KMS) untuk mengenkripsi data keluaran saat diam. Untuk kunci enkripsi, berikan ID kunci atau Nomor Sumber Daya Amazon (ARN). Untuk informasi selengkapnya, lihat K KMS-Managed unci Enkripsi.
-
-
(Opsional) Untuk Tag, tambahkan satu atau beberapa tag ke pekerjaan pelatihan. Tag adalah metadata yang dapat Anda tentukan dan tetapkan ke AWS sumber daya. Dalam hal ini, Anda dapat menggunakan tag untuk membantu mengelola pekerjaan pelatihan Anda. Tag terdiri dari kunci dan nilai, yang Anda tentukan. Misalnya, Anda mungkin ingin membuat tag dengan
Projectsebagai kunci dan nilai yang mengacu pada proyek yang terkait dengan pekerjaan pelatihan, sepertiHome value forecasts. -
Pilih Buat pekerjaan pelatihan. SageMaker AI menciptakan dan menjalankan pekerjaan pelatihan.
Setelah pekerjaan pelatihan selesai, SageMaker AI menyimpan artefak model di bucket yang jalurnya Anda berikan untuk jalur keluaran S3 di bidang konfigurasi data keluaran. Untuk menerapkan model untuk mendapatkan prediksi, lihatTerapkan model ke Amazon EC2.
Gunakan File Manifest Augmented (API)
Berikut ini menunjukkan cara melatih model dengan file manifes yang diperbesar menggunakan pustaka Python tingkat tinggi SageMaker AI:
import sagemaker from sagemaker.train import ModelTrainer from sagemaker.core.shapes import Channel, DataSource, S3DataSource from sagemaker.train.configs import Compute, StoppingCondition, OutputDataConfig # Create a model object set to using "Pipe" mode. compute = Compute( instance_type='ml.p3.2xlarge', instance_count=1, volume_size_in_gb=50 ) model_trainer = ModelTrainer( training_image=training_image, role=role, compute=compute, stopping_condition=StoppingCondition(max_runtime_in_seconds=360000), training_input_mode='Pipe', output_data_config=OutputDataConfig(s3_output_path=s3_output_location), sagemaker_session=session) # Create a train data channel with S3_data_type as 'AugmentedManifestFile' and attribute names. train_data = Channel( channel_name='train', data_source=DataSource( s3_data_source=S3DataSource( s3_data_type='AugmentedManifestFile', s3_uri=your_augmented_manifest_file, s3_data_distribution_type='FullyReplicated', attribute_names=['source-ref','annotations'], ) ), content_type='application/x-recordio', input_mode='Pipe', record_wrapper_type='RecordIO' ) # Train a model. model_trainer.train(input_data_config=[train_data])
Setelah pekerjaan pelatihan selesai, SageMaker AI menyimpan artefak model di bucket yang jalurnya Anda berikan untuk jalur keluaran S3 di bidang konfigurasi data keluaran. Untuk menerapkan model untuk mendapatkan prediksi, lihatTerapkan model ke Amazon EC2.