View a markdown version of this page

Comparez les LLM avec vLLM et lm-evaluation-harness sur Deadline Cloud - Deadline Cloud

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Comparez les LLM avec vLLM et lm-evaluation-harness sur Deadline Cloud

Le bundle de tâches vllm_lm_eval_leaderboard évalue plusieurs LLM par rapport à plusieurs benchmarks dans le cadre d'une seule tâche Deadline Cloud. Chaque modèle devient une tâche lors d'un balayage de paramètres, et les tâches sont exécutées en parallèle entre les travailleurs. Une dernière étape regroupe les résultats par modèle dans un classement classé (CSV et Markdown).

Chaque tâche de cette EvalModels étape démarre un serveur vLLM local, exécute chaque test de référence avec le harnais d'évaluation lm-d' EleutherAI par rapport au point de terminaison local, puis arrête vLLM. Les modèles se chargent directement depuis HuggingFace Hub, il n'est donc pas nécessaire de joindre des pièces jointes aux tâches.

Pour exécuter ce bundle, déployez le CloudFormation modèle de ferme CUDA. Le modèle fournit un parc géré par le service GPU NVIDIA (A10G ou L4) et une file d'attente avec un environnement de file d'attente conda que ce bundle utilise sans modification. Si vous possédez déjà une ferme, vous avez besoin d'un parc SMF doté de GPU NVIDIA, d'au moins 32 Go de RAM et d'au moins 4 vCPU.

La liste de modèles par défaut est un petit mix non daté à chargement rapide qui convient à un seul A10G ou L4 :, et. Qwen/Qwen2.5-0.5B Qwen/Qwen2.5-1.5B EleutherAI/pythia-1.4b Pour utiliser d'autres modèles, modifiez la range liste ci-dessous parameterSpace.taskParameterDefinitions danstemplate.yaml.

Les benchmarks par défaut forment une suite de raisonnement sensée :hellaswag,arc_easy,arc_challenge,winogrande. Annuler au moment de la soumission :

deadline bundle submit ./job_bundles/vllm_lm_eval_leaderboard/ \ --parameter Benchmarks="hellaswag,mmlu,gsm8k"

Si votre flotte n'augmente pas le nombre de travailleurs, la cause la plus courante est un quota de service vCPU EC2. Vérifiez que vous disposez de suffisamment d'espace pour exécuter des instances On-Demand G et VT dans la console Service Quotas.

Pour une présentation complète des conditions préalables, de la configuration de la ferme, des modèles et des tests personnalisés, ainsi que du nettoyage, voir. Comparez les LLM avec vLLM et lm-evaluation-harness