View a markdown version of this page

K-Means Hyperparameter - Amazon SageMaker AI

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

K-Means Hyperparameter

Dalam CreateTrainingJob permintaan, Anda menentukan algoritma pelatihan yang ingin Anda gunakan. Anda juga dapat menentukan hyperparameter spesifik algoritma sebagai peta string-to-string. Tabel berikut mencantumkan hyperparameter untuk algoritma pelatihan k-mean yang disediakan oleh Amazon SageMaker AI. Untuk informasi lebih lanjut tentang cara kerja pengelompokan k-mean, lihat. Bagaimana Pengel K-Means ompokan Bekerja

Nama Parameter Deskripsi
feature_dim

Jumlah fitur dalam data input.

Diperlukan

Nilai yang valid: Integer positif

k

Jumlah cluster yang dibutuhkan.

Diperlukan

Nilai yang valid: Integer positif

epochs

Jumlah pass yang dilakukan di atas data pelatihan.

Opsional

Nilai yang valid: Integer positif

Nilai default: 1

eval_metrics

Daftar JSON jenis metrik yang digunakan untuk melaporkan skor untuk model. Nilai yang diizinkan adalah msd untuk Rata-rata Penyimpangan Kuadrat dan ssd untuk Jumlah Jarak Kuadrat. Jika data tes disediakan, skor dilaporkan untuk setiap metrik yang diminta.

Opsional

Nilai yang valid: Baik [\"msd\"] atau [\"ssd\"] atau[\"msd\",\"ssd\"].

Nilai default: [\"msd\"]

extra_center_factor

Algoritma membuat K center = num_clusters * extra_center_factor saat berjalan dan mengurangi jumlah pusat dari K ke k saat menyelesaikan model.

Opsional

Nilai yang valid: Entah bilangan bulat positif atauauto.

Nilai default: auto

half_life_time_size

Digunakan untuk menentukan bobot yang diberikan pada pengamatan saat menghitung rata-rata cluster. Bobot ini meluruh secara eksponensial karena lebih banyak titik diamati. Ketika suatu titik pertama kali diamati, ia diberi bobot 1 saat menghitung rata-rata cluster. Konstanta peluruhan untuk fungsi peluruhan eksponensial dipilih sehingga setelah mengamati half_life_time_size titik, bobotnya adalah 1/2. Jika disetel ke 0, tidak ada pembusukan.

Opsional

Nilai yang valid: Non-negative integer

Nilai default: 0

init_method

Metode dimana algoritma memilih pusat cluster awal. Pendekatan k-mean standar memilihnya secara acak. Metode k-means++ alternatif memilih pusat cluster pertama secara acak. Kemudian menyebarkan posisi cluster awal yang tersisa dengan membobot pemilihan pusat dengan distribusi probabilitas yang sebanding dengan kuadrat jarak titik data yang tersisa dari pusat yang ada.

Opsional

Nilai yang valid: Baik random ataukmeans++.

Nilai default: random

local_lloyd_init_method

Metode inisialisasi untuk prosedur maksimalisasi harapan (EM) Lloyd yang digunakan untuk membangun model akhir yang berisi pusat. k

Opsional

Nilai yang valid: Baik random ataukmeans++.

Nilai default: kmeans++

local_lloyd_max_iter

Jumlah maksimum iterasi untuk prosedur maksimalisasi harapan (EM) Lloyd yang digunakan untuk membangun model akhir yang berisi pusat. k

Opsional

Nilai yang valid: Integer positif

Nilai default: 300

local_lloyd_num_trials

Berapa kali prosedur maksimalisasi harapan (EM) Lloyd dengan kerugian paling sedikit dijalankan saat membangun model akhir yang berisi pusat. k

Opsional

Nilai yang valid: Entah bilangan bulat positif atauauto.

Nilai default: auto

local_lloyd_tol

Toleransi terhadap perubahan kerugian untuk penghentian awal prosedur maksimalisasi harapan (EM) Lloyd yang digunakan untuk membangun model akhir yang berisi pusat. k

Opsional

Nilai yang valid: Float. Rentang dalam [0, 1].

Nilai default: 0.0001

mini_batch_size

Jumlah pengamatan per batch mini untuk iterator data.

Opsional

Nilai yang valid: Integer positif

Nilai default: 5000