

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

# Jenis file dataset dan format data input
<a name="autopilot-llms-finetuning-data-format"></a>

Instruction-based fine tuning menggunakan kumpulan data berlabel untuk meningkatkan kinerja LLM pra-terlatih pada tugas pemrosesan bahasa alami (NLP) tertentu. Contoh berlabel diformat sebagai pasangan prompt-response dan diungkapkan sebagai instruksi.



Untuk mempelajari tentang jenis file dataset yang didukung, lihat[Jenis file dataset yang didukung](#autopilot-llms-finetuning-dataset-format).

Untuk mempelajari tentang format data input, lihat[Format data input untuk penyempurnaan berbasis instruksi](#autopilot-llms-finetuning-input-format).

## Jenis file dataset yang didukung
<a name="autopilot-llms-finetuning-dataset-format"></a>

Autopilot mendukung kumpulan data penyempurnaan berbasis instruksi yang diformat sebagai file CSV (default) atau sebagai file Parquet.
+ **CSV ** (nilai yang dipisahkan koma) adalah format file berbasis baris yang menyimpan data dalam teks biasa yang dapat dibaca manusia, yang merupakan pilihan populer untuk pertukaran data karena didukung oleh berbagai aplikasi.
+ **Parket ** adalah format file biner berbasis kolom di mana data disimpan dan diproses lebih efisien daripada dalam format file yang dapat dibaca manusia seperti CSV. Ini menjadikannya pilihan yang lebih baik untuk masalah data besar.

**catatan**  
Dataset dapat terdiri dari beberapa file, yang masing-masing harus mematuhi template tertentu. Untuk informasi tentang cara memformat data input Anda, lihat[Format data input untuk penyempurnaan berbasis instruksi](#autopilot-llms-finetuning-input-format).

## Format data input untuk penyempurnaan berbasis instruksi
<a name="autopilot-llms-finetuning-input-format"></a>

Setiap file dalam dataset harus mematuhi format berikut:
+ Dataset harus berisi tepat dua kolom yang dipisahkan koma dan diberi nama, `input` dan. `output` Autopilot tidak mengizinkan kolom tambahan. 
+ `input`Kolom berisi petunjuk, dan yang sesuai `output` berisi jawaban yang diharapkan. Kedu `input` `output` anya dan dalam format string.

Contoh berikut menggambarkan format data input untuk penyempurnaan berbasis instruksi di Autopilot.

```
input,output
"<prompt text>","<expected generated text>"
```

**catatan**  
Sebaiknya gunakan kumpulan data dengan minimal 1000 baris untuk memastikan pembelajaran dan kinerja model yang optimal.

Selain itu, Autopilot menetapkan batas maksimum pada jumlah baris dalam dataset dan panjang konteks berdasarkan jenis model yang digunakan.
+ Batas jumlah baris dalam kumpulan data berlaku untuk jumlah baris kumulatif di semua file dalam kumpulan data, termasuk beberapa file. Jika ada dua jenis [ saluran yang ](https://docs.aws.amazon.com/sagemaker/latest/APIReference/API_AutoMLChannel.html) ditentukan (satu untuk pelatihan dan satu untuk validasi), batas berlaku untuk jumlah total baris di semua kumpulan data dalam kedua saluran. Ketika jumlah baris melebihi ambang batas, pekerjaan gagal dengan kesalahan validasi.
+ Ketika panjang input atau output dari baris dalam dataset melebihi batas yang ditetapkan pada konteks model bahasa, itu secara otomatis dipotong. Jika lebih dari 60% baris dalam dataset dipotong, baik dalam input atau outputnya, Autopilot gagal dalam pekerjaan dengan kesalahan validasi.

Tabel berikut menyajikan batas-batas tersebut untuk setiap model.


| JumpStart Model ID | `BaseModelName`dalam permintaan API | Batas Baris | Batas Panjang Konteks | 
| --- | --- | --- | --- | 
| huggingface-textgeneration-dolly-v2-3b-bf16 | Dolly3B | 10.000 baris | 1024 token | 
| huggingface-textgeneration-dolly-v2-7b-bf16 | Dolly7B | 10.000 baris | 1024 token | 
| huggingface-textgeneration-dolly-v2-12b-bf16 | Dolly12B | 10.000 baris | 1024 token | 
| huggingface-llm-falcon-7b-bf16 | Falcon7B | 1.000 baris | 1024 token | 
| huggingface-llm-falcon-7b-instruct-bf16 | Falcon7BInstruct | 1.000 baris | 1024 token | 
| huggingface-llm-falcon-40b-bf16 | Falcon40B | 10.000 baris | 1024 token | 
| huggingface-llm-falcon-40b-instruct-bf16 | Falcon40BInstruct | 10.000 baris | 1024 token | 
| huggingface-text2text-flan-t5-large | FlanT5L | 10.000 baris | 1024 token | 
| huggingface-text2text-flan-t5-xl | FlanT5XL | 10.000 baris | 1024 token | 
| huggingface-text2text-flan-t5-xxll | FlanT5XXL | 10.000 baris | 1024 token | 
| meta-textgeneration-llama-2-7b | Llama2-7B | 10.000 baris | 2048 token | 
| meta-textgeneration-llama-2-7b-f | Llama2-7BChat | 10.000 baris | 2048 token | 
| meta-textgeneration-llama-2-13b | Llama2-13B | 7.000 baris | 2048 token | 
| meta-textgeneration-llama-2-13b-f | Llama2-13BChat | 7.000 baris | 2048 token | 
| huggingface-llm-mistral-7b | Mistral7B | 10.000 baris | 2048 token | 
| huggingface-llm-mistral-7b-instruct | Mistral7BInstruct | 10.000 baris | 2048 token | 
| huggingface-textgeneration1-mpt-7b-bf16 | MPT7B | 10.000 baris | 1024 token | 
| huggingface-textgeneration1-mpt-7b-instruct-bf16 | MPT7BInstruct | 10.000 baris | 1024 token | 