As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.
Compare LLMs com vLLM e lm-evaluation-harness no Deadline Cloud
O pacote de tarefas vllm_lm_eval_leaderboard no GitHub site avalia vários LLMs em relação a vários benchmarks em um único
Cada tarefa na EvalModels etapa inicia um servidor vLLM local, executa cada benchmark com o lm-evaluation-harness da EleutherAI no endpoint local e, em seguida, interrompe o vLLM. Para obter mais informações, consulte vLLM
Para executar esse pacote, implante o CloudFormation modelo de fazenda CUDA
A lista de modelos padrão é uma mistura pequena, não controlada e de carregamento rápido que cabe em um único A10G ou L4:, e. Qwen/Qwen2.5-0.5B Qwen/Qwen2.5-1.5B EleutherAI/pythia-1.4b Para usar outros modelos, edite a range lista abaixo parameterSpace.taskParameterDefinitions emtemplate.yaml.
Os benchmarks padrão formam um conjunto de raciocínio de senso comum:. hellaswag,arc_easy,arc_challenge,winogrande Substituir no momento do envio:
deadline bundle submit ./job_bundles/vllm_lm_eval_leaderboard/ \ --parameter Benchmarks="hellaswag,mmlu,gsm8k"
Se sua frota não aumentar a escala de trabalhadores, a causa mais comum é uma cota de serviço do Deadline Cloud. Confirme se você tem espaço livre para GPUs de instância OnDemand G por região e OnDemand vCPUs por região no console Service Quotas.
Para obter uma explicação completa que abrange pré-requisitos, configuração da fazenda, modelos e benchmarks personalizados e limpeza, consulte. Compare LLMs com vLLM e lm-evaluation-harness