View a markdown version of this page

Comparez les LLM avec vLLM et lm-evaluation-harness sur Deadline Cloud - Deadline Cloud

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Comparez les LLM avec vLLM et lm-evaluation-harness sur Deadline Cloud

Le bundle de tâches vllm_lm_eval_leaderboard évalue plusieurs LLM par rapport à plusieurs benchmarks dans une seule tâche Deadline Cloud. Chaque modèle devient une tâche dans le cadre d'un balayage des paramètres, et les tâches sont exécutées en parallèle entre les opérateurs. Une dernière étape regroupe les résultats par modèle dans un classement classé (CSV et Markdown).

Chaque tâche de cette EvalModels étape démarre un serveur vLLM local, exécute chaque test de performance avec le système lm-evaluation-harness d'EleutherAI par rapport au point de terminaison local, puis arrête vLLM. Les modèles se chargent directement depuis HuggingFace Hub, de sorte que les pièces jointes ne sont pas nécessaires.

Pour exécuter ce bundle, déployez le CloudFormation modèle de ferme CUDA. Le modèle fournit une flotte gérée par des services GPU NVIDIA (A10G ou L4) et une file d'attente avec un environnement de file d'attente conda que ce bundle utilise sans modification. Si vous possédez déjà une ferme, vous avez besoin d'une flotte SMF équipée de GPU NVIDIA, d'au moins 32 Go de RAM et d'au moins 4 processeurs virtuels.

La liste des modèles par défaut est un petit mix non fermé à chargement rapide qui s'adapte à un seul A10G ou L4 :, et. Qwen/Qwen2.5-0.5B Qwen/Qwen2.5-1.5B EleutherAI/pythia-1.4b Pour utiliser d'autres modèles, modifiez la range liste parameterSpace.taskParameterDefinitions ci-dessoustemplate.yaml.

Les repères par défaut forment une suite de raisonnement de bon sens :hellaswag,arc_easy,arc_challenge,winogrande. Annuler au moment de la soumission :

deadline bundle submit ./job_bundles/vllm_lm_eval_leaderboard/ \ --parameter Benchmarks="hellaswag,mmlu,gsm8k"

Si votre parc ne dispose pas d'effectifs supplémentaires, la cause la plus courante est un quota de service du processeur virtuel EC2. Vérifiez que vous disposez de suffisamment d'espace pour exécuter des instances On-Demand G et VT dans la console Service Quotas.

Pour une procédure pas à pas complète qui couvre les prérequis, la configuration de la ferme, les modèles et les benchmarks personnalisés, ainsi que le nettoyage, consultez. Comparez les LLM avec vLLM et lm-evaluation-harness