Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Algoritma Random Cut Forest (RCF)
Amazon SageMaker AI Random Cut Forest (RCF) adalah algoritma tanpa pengawasan untuk mendeteksi titik data anomali dalam kumpulan data. Ini adalah pengamatan yang menyimpang dari data yang terstruktur dengan baik atau berpola. Anomali dapat bermanifestasi sebagai lonjakan tak terduga dalam data deret waktu, jeda periodisitas, atau titik data yang tidak dapat diklasifikasikan. Mereka mudah dijelaskan dalam hal itu, ketika dilihat dalam plot, mereka sering mudah dibedakan dari data “biasa”. Memasukkan anomali ini dalam kumpulan data dapat secara drastis meningkatkan kompleksitas tugas pembelajaran mesin karena data “reguler” sering dapat dijelaskan dengan model sederhana.
Dengan setiap titik data, RCF mengaitkan skor anomali. Nilai skor rendah menunjukkan bahwa titik data dianggap “normal.” Nilai tinggi menunjukkan adanya anomali dalam data. Definisi “rendah” dan “tinggi” bergantung pada aplikasi tetapi praktik umum menunjukkan bahwa skor di luar tiga standar deviasi dari skor rata-rata dianggap anomali.
Meskipun ada banyak aplikasi algoritma deteksi anomali untuk data deret waktu satu dimensi seperti analisis volume lalu lintas atau deteksi lonjakan volume suara, RCF dirancang untuk bekerja dengan input dimensi sewenang-wenang. Amazon SageMaker AI RCF berskala dengan baik sehubungan dengan jumlah fitur, ukuran kumpulan data, dan jumlah instance.
Topik
Input/Output Antarmuka untuk Algoritma RCF
Amazon SageMaker AI Random Cut Forest mendukung saluran test data train dan. Saluran uji opsional digunakan untuk menghitung akurasi, presisi, mengingat, dan F1-score metrik pada data berlabel. Jenis konten data melatih dan uji dapat berupa text/csv format application/x-recordio-protobuf atau format. Untuk data uji, saat menggunakan text/csv format, konten harus ditentukan sebagai text/csv; label_size=1 di mana kolom pertama dari setiap baris mewakili label anomali: “1" untuk titik data anomali dan “0" untuk titik data normal. Anda dapat menggunakan mode File atau mode Pipe untuk melatih model RCF pada data yang diformat sebagai recordIO-wrapped-protobuf atau sebagai CSV
Saluran kereta hanya mendukung S3DataDistributionType=ShardedByS3Key dan saluran uji hanya mendukungS3DataDistributionType=FullyReplicated. Contoh berikut menentukan tipe distribusi S3 untuk saluran kereta menggunakan Amazon SageMaker Python SDK
catatan
sagemaker.inputs.s3_inputMetode ini diganti dengan S3DataSource bentuk Channel dan di SageMaker Python SDK v3. Jenis distribusi dikonfigurasi di S3DataSource dalam aChannel.
import sagemaker from sagemaker.train import ModelTrainer from sagemaker.core.shapes import Channel, DataSource, S3DataSource from sagemaker.core.helper.session_helper import Session, get_execution_role # specify Random Cut Forest training job information and hyperparameters rcf = ModelTrainer(...) # specify training data input channel with ShardedByS3Key distribution train_data = Channel( channel_name="training", data_source=DataSource( s3_data_source=S3DataSource( s3_data_type="S3Prefix", s3_uri=s3_training_data_location, s3_data_distribution_type="ShardedByS3Key" ) ) ) # run the training job on input data stored in S3 rcf.train(input_data_config=[train_data])
Untuk menghindari kesalahan umum seputar peran eksekusi, pastikan bahwa Anda memiliki peran eksekusi yang diperlukan, AmazonSageMakerFullAccess danAmazonEC2ContainerRegistryFullAccess. Untuk menghindari kesalahan umum di sekitar gambar Anda yang tidak ada atau izinnya salah, pastikan bahwa gambar ECR Anda tidak lebih besar dari ruang disk yang dialokasikan pada instance pelatihan. Untuk menghindari hal ini, jalankan pekerjaan pelatihan Anda pada instance yang memiliki ruang disk yang cukup. Selain itu, jika gambar ECR Anda berasal dari repositori Elastic Container Service (ECS) AWS akun yang berbeda, dan Anda tidak menetapkan izin repositori untuk memberikan akses, ini akan mengakibatkan kesalahan. Lihat izin reposit ori ECR untuk informasi selengkapnya tentang pengaturan pernyataan kebijakan repositori.
Lihat S3DataSource untuk informasi selengkapnya tentang menyesuaikan atribut sumber data S3. Akhirnya, untuk memanfaatkan pelatihan multi-instance, data pelatihan harus dipartisi menjadi setidaknya file sebanyak instance.
Untuk inferensi, RCF mendukungapplication/x-recordio-protobuf, text/csv dan application/json memasukkan jenis konten data. Lihat Parameter untuk Built-in Algoritma dokumentasi untuk informasi lebih lanjut. Inferensi RCF mengembalikan application/x-recordio-protobuf atau output yang application/json diformat. Setiap catatan dalam data keluaran ini berisi skor anomali yang sesuai untuk setiap titik data input. Lihat Format Data Umum - Inferensi untuk informasi selengkapnya.
Untuk informasi lebih lanjut tentang format file input dan output, lihat Format Respon RCF untuk inferensi dan. Notebook Contoh RCF
Rekomendasi Instance untuk Algoritma RCF
Untuk pelatihan, kami merekomendasikan keluarga ml.m4ml.c4,, dan ml.c5 contoh. Untuk inferensi, kami sarankan menggunakan jenis ml.c5.xl instans khususnya, untuk kinerja maksimum serta meminimalkan biaya per jam penggunaan. Meskipun algoritma secara teknis dapat berjalan pada jenis instance GPU, algoritma tidak memanfaatkan perangkat keras GPU.
Notebook Contoh RCF
Untuk contoh cara melatih model RCF dan melakukan kesimpulan dengannya, lihat buku catatan Peng antar SageMaker AI Random Cut Forests
Untuk posting blog tentang penggunaan algoritma RCF, lihat Menggunakan algoritma Amazon SageMaker AI Random Cut Forest bawaan untuk deteksi