Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.
Compare los LLM con vLLM y lm-evaluation-harness en Deadline Cloud
El paquete de trabajos vllm_lm_eval_leaderboard evalúa varios LLM comparándolos con varios puntos de referencia en un solo
Cada tarea del EvalModels paso inicia un servidor
Para ejecutar este paquete, implemente la CloudFormation plantilla de granja de
La lista de modelos predeterminada es una combinación pequeña, completa y de carga rápida que cabe en un solo A10G o L4:,, y. Qwen/Qwen2.5-0.5B Qwen/Qwen2.5-1.5B EleutherAI/pythia-1.4b Para usar otros modelos, edita la lista que se encuentra debajo de. range parameterSpace.taskParameterDefinitions template.yaml
Los puntos de referencia predeterminados forman un conjunto de razonamiento de sentido común:hellaswag,arc_easy,arc_challenge,winogrande. Anular en el momento del envío:
deadline bundle submit ./job_bundles/vllm_lm_eval_leaderboard/ \ --parameter Benchmarks="hellaswag,mmlu,gsm8k"
Si su flota no aumenta el número de trabajadores, la causa más común es una cuota de servicio de vCPU de EC2. Confirme que dispone de margen para ejecutar instancias On-Demand G y VT en la consola de cuotas de servicio.
Para ver un tutorial completo sobre los requisitos previos, la configuración de la granja, los modelos y puntos de referencia personalizados y la limpieza, consulta. LLM de referencia con vLLM y lm-evaluation-harness