Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Benchmark LLM dengan vLLM dan lm-evaluation-harness di Deadline Cloud
Bundel pekerjaan vllm_lm_eval_leaderboard mengevaluasi beberapa LLM terhadap beberapa tol
Setiap tugas dalam EvalModels langkah memulai server
Untuk menjalankan bundel ini, gunakan CloudFormation template pertanian CUDA
Daftar model default adalah campuran kecil, tanpa batas, dan cepat yang cocok untuk satu A10G atau L4:,, dan. Qwen/Qwen2.5-0.5B Qwen/Qwen2.5-1.5B EleutherAI/pythia-1.4b Untuk menggunakan model lain, edit range daftar parameterSpace.taskParameterDefinitions di bawahtemplate.yaml.
Tolok ukur default membentuk rangkaian penalaran akal sehat:hellaswag,arc_easy,arc_challenge,winogrande. Ganti pada waktu pengiriman:
deadline bundle submit ./job_bundles/vllm_lm_eval_leaderboard/ \ --parameter Benchmarks="hellaswag,mmlu,gsm8k"
Jika armada Anda tidak meningkatkan jumlah pekerja, penyebab paling umum adalah kuota layanan EC2 vCPU. Konfirmasikan bahwa Anda memiliki ruang untuk Menjalankan instans On-Demand G dan VT di konsol Kuota Layanan.
Untuk panduan lengkap yang mencakup prasyarat, pengaturan pertanian, model dan tolok ukur khusus, dan pembersihan, lihatBenchmark LLM dengan VLLm dan lm-evaluation-harness.