Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.
Compare los LLM con vLLM y lm-evaluation-harness en Deadline Cloud
El paquete de trabajos vllm_lm_eval_leaderboard del GitHub sitio web evalúa varios LLM comparándolos con varios puntos de referencia en un solo
Cada tarea del EvalModels paso inicia un servidor vLLM local, ejecuta todos los puntos de referencia con el sistema de evaluación lm-evaluation de EleutherAI comparándolos con el punto final local y, a continuación, detiene el vLLM. Para obtener más información, consulte vLLM y lm-evaluation-harness en el sitio web. https://github.com/vllm-project/vllm
Para ejecutar este paquete, implementa la CloudFormation plantilla de granja de CUDA
La lista de modelos predeterminada es una combinación pequeña, completa y de carga rápida que cabe en un solo A10G o L4:,, y. Qwen/Qwen2.5-0.5B Qwen/Qwen2.5-1.5B EleutherAI/pythia-1.4b Para usar otros modelos, edita la lista que se encuentra debajo de. range parameterSpace.taskParameterDefinitions template.yaml
Los puntos de referencia predeterminados forman un conjunto de razonamiento de sentido común:hellaswag,arc_easy,arc_challenge,winogrande. Anular en el momento del envío:
deadline bundle submit ./job_bundles/vllm_lm_eval_leaderboard/ \ --parameter Benchmarks="hellaswag,mmlu,gsm8k"
Si su flota no aumenta el número de trabajadores, la causa más común es una cuota de servicio de Deadline Cloud. Comprueba que dispones de espacio libre para las GPU de las instancias OnDemand G por región y las OnDemand vCPU por región en la consola de cuotas de servicio.
Para ver un tutorial completo sobre los requisitos previos, la configuración de la granja, los modelos y puntos de referencia personalizados y la limpieza, consulta. Compare los LLM con vLLM y lm-evaluation-harness