As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.
Compare LLMs com vLLM e lm-evaluation-harness no Deadline Cloud
O pacote de tarefas vllm_lm_eval_leaderboard avalia vários LLMs em relação a vários benchmarks em um único
Cada tarefa na EvalModels etapa inicia um servidor
Para executar esse pacote, implante o modelo de fazenda CloudFormation CUDA.
A lista de modelos padrão é uma mistura pequena, não controlada e de carregamento rápido que cabe em um único A10G ou L4:, e. Qwen/Qwen2.5-0.5B Qwen/Qwen2.5-1.5B EleutherAI/pythia-1.4b Para usar outros modelos, edite a range lista abaixo parameterSpace.taskParameterDefinitions emtemplate.yaml.
Os benchmarks padrão formam um conjunto de raciocínio de senso comum:. hellaswag,arc_easy,arc_challenge,winogrande Substituir no momento do envio:
deadline bundle submit ./job_bundles/vllm_lm_eval_leaderboard/ \ --parameter Benchmarks="hellaswag,mmlu,gsm8k"
Se sua frota não aumentar a escala de trabalhadores, a causa mais comum é uma cota de serviço de vCPU do EC2. Confirme se você tem espaço livre para executar instâncias On-Demand G e VT no console de cotas de serviço.
Para obter uma explicação completa que abrange pré-requisitos, configuração da fazenda, modelos e benchmarks personalizados e limpeza, consulte. Compare LLMs com vLLM e lm-evaluation-harness