

Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.

# Compare los LLM con vLLM y lm-evaluation-harness en Deadline Cloud
<a name="examples-jb-vllm-leaderboard"></a>

El paquete de trabajos [ vllm\_lm\_eval\_leaderboard evalúa varios LLM comparándolos con varios puntos de referencia en un solo ](https://github.com/aws-deadline/deadline-cloud-samples/tree/mainline/job_bundles/vllm_lm_eval_leaderboard) trabajo de Deadline Cloud. Cada modelo se convierte en una tarea en un barrido de parámetros y las tareas se ejecutan en paralelo entre los trabajadores. En un último paso, se agregan los resultados de cada modelo en una tabla clasificatoria (CSV y Markdown).

Cada tarea del `EvalModels` paso inicia un [ servidor ](https://github.com/vllm-project/vllm) vLLM local, ejecuta todos los puntos de referencia con el sistema de evaluación lm-evaluation de [ EleutherAI comparándolos con el punto final local y, a continuación, detiene el ](https://github.com/EleutherAI/lm-evaluation-harness) vLLM. Los modelos se cargan directamente desde Hub, por lo que no es necesario adjuntar el trabajo. HuggingFace 

Para ejecutar este paquete, implemente la CloudFormation plantilla [ de granja de ](https://github.com/aws-deadline/deadline-cloud-samples/tree/mainline/cloudformation/farm_templates/cuda_farm) CUDA. La plantilla aprovisiona una flota gestionada por servicios de GPU de NVIDIA (A10G o L4) y una cola con un entorno de cola conda que este paquete utiliza sin modificaciones. Si ya tienes una granja, necesitas una flota de SMF con GPU NVIDIA, al menos 32 GB de RAM y al menos 4 CPU virtuales.

La lista de modelos predeterminada es una combinación pequeña, completa y de carga rápida que cabe en un solo A10G o L4:,, y. `Qwen/Qwen2.5-0.5B` `Qwen/Qwen2.5-1.5B` `EleutherAI/pythia-1.4b` Para usar otros modelos, edita la lista que se encuentra debajo de. `range` `parameterSpace.taskParameterDefinitions` `template.yaml`

Los puntos de referencia predeterminados forman un conjunto de razonamiento de sentido común:`hellaswag,arc_easy,arc_challenge,winogrande`. Anular en el momento del envío:

```
deadline bundle submit ./job_bundles/vllm_lm_eval_leaderboard/ \
  --parameter Benchmarks="hellaswag,mmlu,gsm8k"
```

Si su flota no aumenta el número de trabajadores, la causa más común es una cuota de servicio de vCPU de EC2. Confirme que dispone de margen para * ejecutar instancias On-Demand G y VT * en la consola de cuotas de servicio.

Para ver un tutorial completo sobre los requisitos previos, la configuración de la granja, los modelos y puntos de referencia personalizados y la limpieza, consulta. [LLM de referencia con vLLM y lm-evaluation-harness](tutorial-vllm-leaderboard.md)