View a markdown version of this page

Compare LLMs com vLLM e lm-evaluation-harness no Deadline Cloud - Deadline Cloud

As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.

Compare LLMs com vLLM e lm-evaluation-harness no Deadline Cloud

O pacote de tarefas vllm_lm_eval_leaderboard avalia vários LLMs em relação a vários benchmarks em um único trabalho do Deadline Cloud. Cada modelo se torna uma tarefa em uma varredura de parâmetros, e as tarefas são executadas em paralelo entre os trabalhadores. Uma etapa final agrega os resultados por modelo em uma tabela de classificação classificada (CSV e Markdown).

Cada tarefa na EvalModels etapa inicia um servidor vLLM local, executa cada benchmark com o lm-evaluation-harness da EleutherAI no endpoint local e, em seguida, interrompe o vLLM. Os modelos são carregados diretamente do HuggingFace Hub, portanto, os anexos de trabalho não são necessários.

Para executar esse pacote, implante o modelo de fazenda CloudFormation CUDA. O modelo fornece uma frota gerenciada por serviços de GPU NVIDIA (A10G ou L4) e uma fila com um ambiente de fila conda que esse pacote usa sem modificação. Se você já tem uma fazenda, precisa de uma frota SMF com GPUs NVIDIA, pelo menos 32 GB de RAM e pelo menos 4 vCPUs.

A lista de modelos padrão é uma mistura pequena, não controlada e de carregamento rápido que cabe em um único A10G ou L4:, e. Qwen/Qwen2.5-0.5B Qwen/Qwen2.5-1.5B EleutherAI/pythia-1.4b Para usar outros modelos, edite a range lista abaixo parameterSpace.taskParameterDefinitions emtemplate.yaml.

Os benchmarks padrão formam um conjunto de raciocínio de senso comum:. hellaswag,arc_easy,arc_challenge,winogrande Substituir no momento do envio:

deadline bundle submit ./job_bundles/vllm_lm_eval_leaderboard/ \ --parameter Benchmarks="hellaswag,mmlu,gsm8k"

Se sua frota não aumentar a escala de trabalhadores, a causa mais comum é uma cota de serviço de vCPU do EC2. Confirme se você tem espaço livre para executar instâncias On-Demand G e VT no console de cotas de serviço.

Para obter uma explicação completa que abrange pré-requisitos, configuração da fazenda, modelos e benchmarks personalizados e limpeza, consulte. Compare LLMs com vLLM e lm-evaluation-harness