View a markdown version of this page

Pemurnian data selama pelatihan dengan pemilingan SageMaker pintar Amazon - Amazon SageMaker AI

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Pemurnian data selama pelatihan dengan pemilingan SageMaker pintar Amazon

SageMaker penyaringan cerdas adalah kemampuan Pel SageMaker atihan yang membantu meningkatkan efisiensi kumpulan data pelatihan Anda dan mengurangi total waktu dan biaya pelatihan.

Model pembelajaran mendalam modern seperti model bahasa besar (LLM) atau model transformator visi sering membutuhkan kumpulan data besar untuk mencapai akurasi yang dapat diterima. Misalnya, LLM sering membutuhkan triliunan token atau petabyte data untuk bertemu. Semakin besar ukuran kumpulan data pelatihan, bersama dengan ukuran model canggih, dapat meningkatkan waktu komputasi dan biaya pelatihan model.

Selalu, sampel dalam kumpulan data tidak berkontribusi sama pada proses pembelajaran selama pelatihan model. Sebagian besar sumber daya komputasi yang disediakan selama pelatihan dapat dihabiskan untuk memproses sampel mudah yang tidak berkontribusi secara substansif terhadap akurasi keseluruhan model. Idealnya, kumpulan data pelatihan hanya akan mencakup sampel yang benar-benar meningkatkan konvergensi model. Memfilter data yang kurang bermanfaat dapat mengurangi waktu pelatihan dan biaya komputasi. Namun, mengidentifikasi data yang kurang bermanfaat bisa menantang dan berisiko. Praktis sulit untuk mengidentifikasi sampel mana yang kurang informatif sebelum pelatihan, dan akurasi model dapat terpengaruh jika sampel yang salah atau terlalu banyak sampel dikecualikan.

Penyaringan data yang cerdas dengan Amazon SageMaker AI dapat membantu mengurangi waktu dan biaya pelatihan dengan meningkatkan efisiensi data. Algoritma penyaringan SageMaker cerdas mengevaluasi nilai kehilangan setiap data selama tahap pemuatan data dari pekerjaan pelatihan dan mengecualikan sampel yang kurang informatif untuk model. Dengan menggunakan data yang disempurnakan untuk pelatihan, total waktu dan biaya pelatihan model Anda dikurangi dengan menghilangkan transfer maju dan mundur yang tidak perlu pada data yang tidak ditingkatkan. Oleh karena itu, ada dampak minimal atau tidak ada pada keakuratan model.

SageMaker penyaringan cerdas tersedia melalui Tra SageMaker ining Deep Learning Containers (DLC) dan mendukung PyTorch beban kerja melalui. PyTorch DataLoader Hanya beberapa baris perubahan kode yang diperlukan untuk menerapkan penyar SageMaker ingan cerdas dan Anda tidak perlu mengubah alur kerja pelatihan atau pemrosesan data yang ada.