Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Mengakses dan menganalisis hasil evaluasi
Setelah pekerjaan evaluasi Anda selesai dengan sukses, Anda dapat mengakses dan menganalisis hasil menggunakan informasi di bagian ini. Berdasarkan output_s3_path (sepertis3://output_path/) yang didefinisikan dalam resep, struktur output adalah sebagai berikut:
job_name/ ├── eval-result/ │ └── results_[timestamp].json │ └── inference_output.jsonl (only present for gen_qa) │ └── details/ │ └── model/ │ └── execution-date-time/ │ └──details_task_name_#_datetime.parquet └── tensorboard-results/ └── eval/ └── events.out.tfevents.[timestamp]
Hasil metrik disimpan di lokasi keluaran S3 yang ditentukans3://output_path/job_name/eval-result/result-timestamp.json.
Hasil Tensorboard disimpan di jalur S3. s3://output_path/job_name/eval-tensorboard-result/eval/event.out.tfevents.epoch+ip
Semua output inferensi, kecuali llm_judge danstrong_reject, disimpan di jalur S3:s3://output_path/job_name/eval-result/details/model/taskname.parquet.
Untukgen_qa, inference_output.jsonl file berisi bidang berikut untuk setiap objek JSON:
-
prompt - Prompt terakhir yang dikirimkan ke model
-
inferensi - Output inferensi mentah dari model
-
emas - Respons target dari dataset input
-
metadata - String metadata dari dataset input jika disediakan
Untuk memvisualisasikan metrik evaluasi Anda di Tensorboard, selesaikan langkah-langkah berikut:
-
Arahkan ke SageMaker AI Tensorboard.
-
Pilih folder S3.
-
Tambahkan jalur folder S3 Anda, misalnya
s3://output_path/job-name/eval-tensorboard-result/eval. -
Tunggu hingga sinkronisasi selesai.
Deret waktu, skalar, dan visualisasi teks tersedia.
Kami merekomendasikan praktik terbaik berikut:
-
Jaga agar jalur keluaran Anda diatur berdasarkan model dan jenis benchmark.
-
Pertahankan konvensi penamaan yang konsisten untuk memudahkan pelacakan.
-
Simpan hasil yang diekstraksi di lokasi yang aman.
-
Pantau status TensorBoard sinkronisasi agar pemuatan data berhasil.
Anda dapat menemukan log kesalahan SageMaker HyperPod pekerjaan di grup CloudWatch log/aws/sagemaker/Clusters/cluster-id.
Format Output Probabilitas Log
Ketika top_logprobs dikonfigurasi dalam pengaturan inferensi Anda, output evaluasi menyertakan probabilitas log tingkat token dalam file parket. Setiap posisi token berisi kamus token kandidat teratas dengan probabilitas log mereka dalam struktur berikut:
{ "Ġint": {"logprob_value": -17.8125, "decoded_value": " int"}, "Ġthe": {"logprob_value": -2.345, "decoded_value": " the"} }
Setiap entri token berisi:
-
logprob_value: Nilai probabilitas log untuk token -
decoded_value: Representasi string yang didekodekan yang dapat dibaca manusia dari token
Token tokenizer mentah digunakan sebagai kunci kamus untuk memastikan keunikan, sementara decoded_value memberikan interpretasi yang dapat dibaca.