

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

# Comparez les LLM avec vLLM et lm-evaluation-harness sur Deadline Cloud
<a name="examples-jb-vllm-leaderboard"></a>

L'ensemble de tâches [ vllm\_lm\_eval\_leaderboard disponible sur le GitHub site Web évalue plusieurs LLM par rapport à plusieurs critères de référence dans une seule ](https://github.com/aws-deadline/deadline-cloud-samples/tree/mainline/job_bundles/vllm_lm_eval_leaderboard) tâche Deadline Cloud. Chaque modèle devient une tâche dans le cadre d'un balayage des paramètres, et les tâches sont exécutées en parallèle entre les opérateurs. Une dernière étape regroupe les résultats par modèle dans un classement classé (CSV et Markdown).

Chaque tâche de cette `EvalModels` étape démarre un serveur vLLM local, exécute chaque test de performance avec le système lm-evaluation-harness d'EleutherAI par rapport au point de terminaison local, puis arrête vLLM. Pour plus d'informations, consultez [ vLLM ](https://github.com/vllm-project/vllm) et [https://github.com/EleutherAI/lm-evaluation-harness](https://github.com/EleutherAI/lm-evaluation-harness) lm-evaluation-harness sur le site Web. GitHub Les modèles se chargent directement depuis Hugging Face Hub, il n'est donc pas nécessaire de joindre des tâches.

Pour exécuter ce bundle, déployez le CloudFormation modèle de ferme [ CUDA ](https://github.com/aws-deadline/deadline-cloud-samples/tree/mainline/cloudformation/farm_templates/cuda_farm) sur le GitHub site Web. Le modèle fournit une flotte gérée par des services GPU NVIDIA (A10G ou L4) et une file d'attente avec un environnement de file d'attente conda que ce bundle utilise sans modification. Si vous possédez déjà une ferme, vous avez besoin d'une flotte SMF équipée de GPU NVIDIA, d'au moins 32 Go de RAM et d'au moins 4 processeurs virtuels.

La liste des modèles par défaut est un petit mix non fermé à chargement rapide qui s'adapte à un seul A10G ou L4 :, et. `Qwen/Qwen2.5-0.5B` `Qwen/Qwen2.5-1.5B` `EleutherAI/pythia-1.4b` Pour utiliser d'autres modèles, modifiez la `range` liste `parameterSpace.taskParameterDefinitions` ci-dessous`template.yaml`.

Les repères par défaut forment une suite de raisonnement de bon sens :`hellaswag,arc_easy,arc_challenge,winogrande`. Annuler au moment de la soumission :

```
deadline bundle submit ./job_bundles/vllm_lm_eval_leaderboard/ \
  --parameter Benchmarks="hellaswag,mmlu,gsm8k"
```

Si votre parc ne dispose pas d'effectifs supplémentaires, la cause la plus courante est un quota de service Deadline Cloud. Vérifiez que vous disposez d'une marge de manœuvre pour les GPU d'instance * OnDemand G par région * et les * OnDemand vCPU par région * dans la console Service Quotas.

Pour une procédure pas à pas complète qui couvre les prérequis, la configuration de la ferme, les modèles et les benchmarks personnalisés, ainsi que le nettoyage, consultez. [Comparez les LLM avec vLLM et lm-evaluation-harness](tutorial-vllm-leaderboard.md)