View a markdown version of this page

在 Deadline Cloud 上使用 vLLM 和 lm-evaluation-harness 对 LL - 截止日期云

本文属于机器翻译版本。若本译文内容与英语原文存在差异,则一律以英文原文为准。

在 Deadline Cloud 上使用 vLLM 和 lm-evaluation-harness 对 LL

vllm_lm_eval_leaderboard 任务包根据单个 Deadline Cloud 任务中的多个基准测试对多个 LLM 进行评估。在参数扫描中,每个模型都成为一项任务,任务在工作器之间并行运行。最后一步将每个模型的结果汇总到排名排行榜(CSV 和 Markdown)中。

EvalModels步骤中的每项任务都会启动本地 vLLM 服务器,使用 E leutherai 的 lm-evaluation-harnes-harness 针对本地端点运行每个基准测试,然后停止 vLLM 。模型直接从 HuggingFace Hub 加载,因此不需要作业附件。

要运行此捆绑包,请部署 CUDA 农场 CloudFormation 模板。该模板提供了 NVIDIA GPU 服务管理的队列(A10G 或 L4)和一个带有 conda 队列环境的队列,该套装无需修改即可使用该队列。如果你已经有一个农场,你需要一支配有 NVIDIA GPU、至少 32 GB 内存和至少 4 个 vCPU 的 SMF 机群。

默认型号列表是一个小型、无门限、可快速加载的组合,适用于单个 A10G 或 L4:、和。Qwen/Qwen2.5-0.5B Qwen/Qwen2.5-1.5B EleutherAI/pythia-1.4b要使用其他型号,请编辑parameterSpace.taskParameterDefinitions中的range列表template.yaml

默认基准测试构成了常识推理套件:hellaswag,arc_easy,arc_challenge,winogrande. 在提交时覆盖:

deadline bundle submit ./job_bundles/vllm_lm_eval_leaderboard/ \ --parameter Benchmarks="hellaswag,mmlu,gsm8k"

如果您的队列无法扩大工作人员规模,则最常见的原因是 EC2 vCPU 服务配额。确认您有足够的空间在服务配额控制台运行 On-Demand G 和 VT 实例。

有关涵盖先决条件、农场设置、自定义模型和基准测试以及清理的完整演练,请参阅使用 vLLM 和 lm-评估工具对 LLM 进行基准测试