View a markdown version of this page

Compare los LLM con vLLM y lm-evaluation-harness en Deadline Cloud - Deadline Cloud

Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.

Compare los LLM con vLLM y lm-evaluation-harness en Deadline Cloud

El paquete de trabajos vllm_lm_eval_leaderboard evalúa varios LLM comparándolos con varios puntos de referencia en un solo trabajo de Deadline Cloud. Cada modelo se convierte en una tarea en un barrido de parámetros y las tareas se ejecutan en paralelo entre los trabajadores. En un último paso, se agregan los resultados de cada modelo en una tabla clasificatoria (CSV y Markdown).

Cada tarea del EvalModels paso inicia un servidor vLLM local, ejecuta todos los puntos de referencia con el sistema de evaluación lm-evaluation de EleutherAI comparándolos con el punto final local y, a continuación, detiene el vLLM. Los modelos se cargan directamente desde Hub, por lo que no es necesario adjuntar el trabajo. HuggingFace

Para ejecutar este paquete, implemente la CloudFormation plantilla de granja de CUDA. La plantilla aprovisiona una flota gestionada por servicios de GPU de NVIDIA (A10G o L4) y una cola con un entorno de cola conda que este paquete utiliza sin modificaciones. Si ya tienes una granja, necesitas una flota de SMF con GPU NVIDIA, al menos 32 GB de RAM y al menos 4 CPU virtuales.

La lista de modelos predeterminada es una combinación pequeña, completa y de carga rápida que cabe en un solo A10G o L4:,, y. Qwen/Qwen2.5-0.5B Qwen/Qwen2.5-1.5B EleutherAI/pythia-1.4b Para usar otros modelos, edita la lista que se encuentra debajo de. range parameterSpace.taskParameterDefinitions template.yaml

Los puntos de referencia predeterminados forman un conjunto de razonamiento de sentido común:hellaswag,arc_easy,arc_challenge,winogrande. Anular en el momento del envío:

deadline bundle submit ./job_bundles/vllm_lm_eval_leaderboard/ \ --parameter Benchmarks="hellaswag,mmlu,gsm8k"

Si su flota no aumenta el número de trabajadores, la causa más común es una cuota de servicio de vCPU de EC2. Confirme que dispone de margen para ejecutar instancias On-Demand G y VT en la consola de cuotas de servicio.

Para ver un tutorial completo sobre los requisitos previos, la configuración de la granja, los modelos y puntos de referencia personalizados y la limpieza, consulta. LLM de referencia con vLLM y lm-evaluation-harness