View a markdown version of this page

Benchmark LLM dengan vLLM dan lm-evaluation-harness di Deadline Cloud - Awan Batas Waktu

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Benchmark LLM dengan vLLM dan lm-evaluation-harness di Deadline Cloud

Bundel pekerjaan vllm_lm_eval_leaderboard mengevaluasi beberapa LLM terhadap beberapa tol ok ukur dalam satu pekerjaan Deadline Cloud. Setiap model menjadi satu tugas dalam sapuan parameter, dan tugas berjalan secara paralel di seluruh pekerja. Langkah terakhir menggabungkan hasil per model menjadi papan peringkat peringkat (CSV dan Markdown).

Setiap tugas dalam EvalModels langkah memulai server vLLM lokal, menjalankan setiap benchmark dengan lm-evaluation-harness eL eutherai terhadap titik akhir lokal, lalu menghentikan vLLM. Model dimuat langsung dari HuggingFace Hub, jadi lampiran pekerjaan tidak diperlukan.

Untuk menjalankan bundel ini, gunakan CloudFormation template pertanian CUDA. Template menyediakan armada yang dikelola layanan NVIDIA GPU (A10G atau L4) dan antrian dengan lingkungan antrian conda yang digunakan bundel ini tanpa modifikasi. Jika Anda sudah memiliki peternakan, Anda memerlukan armada SMF dengan GPU NVIDIA, setidaknya 32 GB RAM, dan setidaknya 4 vCPU.

Daftar model default adalah campuran kecil, tanpa batas, dan cepat yang cocok untuk satu A10G atau L4:,, dan. Qwen/Qwen2.5-0.5B Qwen/Qwen2.5-1.5B EleutherAI/pythia-1.4b Untuk menggunakan model lain, edit range daftar parameterSpace.taskParameterDefinitions di bawahtemplate.yaml.

Tolok ukur default membentuk rangkaian penalaran akal sehat:hellaswag,arc_easy,arc_challenge,winogrande. Ganti pada waktu pengiriman:

deadline bundle submit ./job_bundles/vllm_lm_eval_leaderboard/ \ --parameter Benchmarks="hellaswag,mmlu,gsm8k"

Jika armada Anda tidak meningkatkan jumlah pekerja, penyebab paling umum adalah kuota layanan EC2 vCPU. Konfirmasikan bahwa Anda memiliki ruang untuk Menjalankan instans On-Demand G dan VT di konsol Kuota Layanan.

Untuk panduan lengkap yang mencakup prasyarat, pengaturan pertanian, model dan tolok ukur khusus, dan pembersihan, lihatBenchmark LLM dengan VLLm dan lm-evaluation-harness.