Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Panduan laporan pelatihan Debugger XGBoost
catatan
Amazon SageMaker Debugger tidak lagi terbuka untuk pelanggan baru. Pelanggan yang sudah ada dapat terus menggunakan layanan seperti biasa. AWS terus berinvestasi dalam peningkatan keamanan dan ketersediaan untuk Debugger, tetapi kami tidak berencana untuk memperkenalkan fitur baru. Untuk informasi selengkapnya, lihat Perubahan ketersediaan debugger.
Bagian ini memandu Anda melalui laporan pelatihan Debugger XGBoost. Laporan secara otomatis digabungkan tergantung pada regex tensor keluaran, mengenali jenis pekerjaan pelatihan Anda di antara klasifikasi biner, klasifikasi multiclass, dan regresi.
penting
Dalam laporan tersebut, plot dan rekomendasi disediakan untuk tujuan informasi dan tidak definitif. Anda bertanggung jawab untuk membuat penilaian independen Anda sendiri terhadap informasi tersebut.
Topik
Distribusi label sebenarnya dari kumpulan data
Histogram ini menunjukkan distribusi kelas berlabel (untuk klasifikasi) atau nilai (untuk regresi) dalam kumpulan data asli Anda. Kemiringan dalam kumpulan data Anda dapat berkontribusi pada ketidakakuratan. Visualisasi ini tersedia untuk jenis model berikut: klasifikasi biner, multiklasifikasi, dan regresi.
Grafik kerugian versus langkah
Ini adalah bagan garis yang menunjukkan perkembangan kerugian pada data pelatihan dan data validasi selama langkah-langkah pelatihan. Kerugian adalah apa yang Anda definisikan dalam fungsi tujuan Anda, seperti kesalahan kuadrat rata-rata. Anda dapat mengukur apakah model tersebut overfit atau kurang fit dari plot ini. Bagian ini juga memberikan wawasan yang dapat Anda gunakan untuk menentukan cara mengatasi masalah overfit dan kurang fit. Visualisasi ini tersedia untuk jenis model berikut: klasifikasi biner, multiklasifikasi, dan regresi.
Pentingnya fitur
Ada tiga jenis visualisasi kepentingan fitur yang disediakan: Berat, Pertambahan, dan Cakupan. Kami memberikan definisi terperinci untuk masing-masing dari tiga dalam laporan. Visualisasi kepentingan fitur membantu Anda mempelajari fitur apa dalam kumpulan data pelatihan Anda yang berkontribusi pada prediksi. Visualisasi kepentingan fitur tersedia untuk jenis model berikut: klasifikasi biner, multiklasifikasi, dan regresi.
Matriks kebingungan
Visualisasi ini hanya berlaku untuk model klasifikasi biner dan multiclass. Akurasi saja mungkin tidak cukup untuk mengevaluasi kinerja model. Untuk beberapa kasus penggunaan, seperti perawatan kesehatan dan deteksi penipuan, penting juga untuk mengetahui tingkat positif palsu dan tingkat negatif palsu. Matriks kebingungan memberi Anda dimensi tambahan untuk mengevaluasi kinerja model Anda.
Evaluasi matriks kebingungan
Bagian ini memberi Anda wawasan lebih lanjut tentang metrik mikro, makro, dan tertimbang tentang presisi, penarikan, dan F1-score untuk model Anda.
Tingkat akurasi setiap elemen diagonal selama iterasi
Visualisasi ini hanya berlaku untuk klasifikasi biner dan model klasifikasi multiclass. Ini adalah bagan garis yang memplot nilai diagonal dalam matriks kebingungan di seluruh langkah pelatihan untuk setiap kelas. Plot ini menunjukkan kepada Anda bagaimana keakuratan setiap kelas berkembang selama langkah-langkah pelatihan. Anda dapat mengidentifikasi kelas yang berkinerja buruk dari plot ini.
Kurva karakteristik operasi penerima
Visualisasi ini hanya berlaku untuk model klasifikasi biner. Kurva Karakteristik Operasi Penerima umumnya digunakan untuk mengevaluasi kinerja model klasifikasi biner. Sumbu y kurva adalah True Positive Rate (TPF) dan sumbu x adalah tingkat positif palsu (FPR). Plot juga menampilkan nilai untuk area di bawah kurva (AUC). Semakin tinggi nilai AUC, semakin prediktif pengklasifikasi Anda. Anda juga dapat menggunakan kurva ROC untuk memahami pertukaran antara TPR dan FPR dan mengidentifikasi ambang klasifikasi optimal untuk kasus penggunaan Anda. Ambang klasifikasi dapat disesuaikan untuk menyesuaikan perilaku model untuk mengurangi lebih dari satu atau jenis kesalahan lainnya (FP/FN).
Distribusi residu pada langkah terakhir yang disimpan
Visualisasi ini adalah bagan kolom yang menunjukkan distribusi residu pada langkah terakhir tangkapan Debugger. Dalam visualisasi ini, Anda dapat memeriksa apakah distribusi residual mendekati distribusi normal yang berpusat pada nol. Jika residu miring, fitur Anda mungkin tidak cukup untuk memprediksi label.
Kesalahan validasi absolut per bin label selama iterasi
Visualisasi ini hanya berlaku untuk model regresi. Nilai target aktual dibagi menjadi 10 interval. Visualisasi ini menunjukkan bagaimana kesalahan validasi berkembang untuk setiap interval di seluruh langkah pelatihan dalam plot baris. Kesalahan validasi absolut adalah nilai absolut perbedaan antara prediksi dan aktual selama validasi. Anda dapat mengidentifikasi interval berkinerja buruk dari visualisasi ini.