

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

# Benchmark LLM dengan vLLM dan lm-evaluation-harness di Deadline Cloud
<a name="examples-jb-vllm-leaderboard"></a>

Bundel pekerjaan [ vllm\_lm\_eval\_leaderboard mengevaluasi beberapa LLM terhadap beberapa tol ](https://github.com/aws-deadline/deadline-cloud-samples/tree/mainline/job_bundles/vllm_lm_eval_leaderboard) ok ukur dalam satu pekerjaan Deadline Cloud. Setiap model menjadi satu tugas dalam sapuan parameter, dan tugas berjalan secara paralel di seluruh pekerja. Langkah terakhir menggabungkan hasil per model menjadi papan peringkat peringkat (CSV dan Markdown).

Setiap tugas dalam `EvalModels` langkah memulai [ server ](https://github.com/vllm-project/vllm) vLLM lokal, menjalankan setiap benchmark dengan lm-evaluation-harness [ eL ](https://github.com/EleutherAI/lm-evaluation-harness) eutherai terhadap titik akhir lokal, lalu menghentikan vLLM. Model dimuat langsung dari HuggingFace Hub, jadi lampiran pekerjaan tidak diperlukan.

Untuk menjalankan bundel ini, gunakan CloudFormation template pertanian [ CUDA](https://github.com/aws-deadline/deadline-cloud-samples/tree/mainline/cloudformation/farm_templates/cuda_farm). Template menyediakan armada yang dikelola layanan NVIDIA GPU (A10G atau L4) dan antrian dengan lingkungan antrian conda yang digunakan bundel ini tanpa modifikasi. Jika Anda sudah memiliki peternakan, Anda memerlukan armada SMF dengan GPU NVIDIA, setidaknya 32 GB RAM, dan setidaknya 4 vCPU.

Daftar model default adalah campuran kecil, tanpa batas, dan cepat yang cocok untuk satu A10G atau L4:,, dan. `Qwen/Qwen2.5-0.5B` `Qwen/Qwen2.5-1.5B` `EleutherAI/pythia-1.4b` Untuk menggunakan model lain, edit `range` daftar `parameterSpace.taskParameterDefinitions` di bawah`template.yaml`.

Tolok ukur default membentuk rangkaian penalaran akal sehat:`hellaswag,arc_easy,arc_challenge,winogrande`. Ganti pada waktu pengiriman:

```
deadline bundle submit ./job_bundles/vllm_lm_eval_leaderboard/ \
  --parameter Benchmarks="hellaswag,mmlu,gsm8k"
```

Jika armada Anda tidak meningkatkan jumlah pekerja, penyebab paling umum adalah kuota layanan EC2 vCPU. Konfirmasikan bahwa Anda memiliki ruang untuk * Menjalankan instans On-Demand G dan VT * di konsol Kuota Layanan.

Untuk panduan lengkap yang mencakup prasyarat, pengaturan pertanian, model dan tolok ukur khusus, dan pembersihan, lihat[Benchmark LLM dengan VLLm dan lm-evaluation-harness](tutorial-vllm-leaderboard.md).