本文為英文版的機器翻譯版本,如內容有任何歧義或不一致之處,概以英文版為準。
在截止日期雲端使用 vLLM 和 lm-evaluation-harness 對 LLMs 進行基準測試
GitHub 網站上的 vllm_lm_eval_leaderboard
EvalModels 步驟中的每個任務都會啟動本機 vLLM 伺服器,針對本機端點使用 EleutherAI 的 lm-evaluation-harness 執行每個基準測試,然後停止 vLLM。如需詳細資訊,請參閱 GitHub 網站上的 vLLM
若要執行此套件,請在 GitHub 網站上部署 CUDA 陣列 CloudFormation 範本
預設模型清單是小型、無門控、快速載入的混合,適用於單一 A10G 或 L4:Qwen/Qwen2.5-0.5B、 Qwen/Qwen2.5-1.5B和 EleutherAI/pythia-1.4b。若要使用其他模型,請在 parameterSpace.taskParameterDefinitions中編輯 下的range清單template.yaml。
預設基準會形成通用推理套件:hellaswag,arc_easy,arc_challenge,winogrande。在提交時覆寫:
deadline bundle submit ./job_bundles/vllm_lm_eval_leaderboard/ \ --parameter Benchmarks="hellaswag,mmlu,gsm8k"
如果您的機群未擴展工作者,最常見的原因是截止日期雲端服務配額。在 Service Quotas 主控台中,確認您有每個區域的 OnDemand G 執行個體 GPUs 和每個區域的 OnDemand vCPUs 空間。
如需涵蓋先決條件、陣列設定、自訂模型和基準以及清除的完整演練,請參閱 使用 vLLM 和 lm-evaluation-harness 為 LLMs 建立基準。