Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Comparez les LLM avec vLLM et lm-evaluation-harness sur Deadline Cloud
L'ensemble de tâches vllm_lm_eval_leaderboard disponible sur le GitHub site Web évalue plusieurs LLM par rapport à plusieurs critères de référence dans une seule
Chaque tâche de cette EvalModels étape démarre un serveur vLLM local, exécute chaque test de performance avec le système lm-evaluation-harness d'EleutherAI par rapport au point de terminaison local, puis arrête vLLM. Pour plus d'informations, consultez vLLM
Pour exécuter ce bundle, déployez le CloudFormation modèle de ferme CUDA
La liste des modèles par défaut est un petit mix non fermé à chargement rapide qui s'adapte à un seul A10G ou L4 :, et. Qwen/Qwen2.5-0.5B Qwen/Qwen2.5-1.5B EleutherAI/pythia-1.4b Pour utiliser d'autres modèles, modifiez la range liste parameterSpace.taskParameterDefinitions ci-dessoustemplate.yaml.
Les repères par défaut forment une suite de raisonnement de bon sens :hellaswag,arc_easy,arc_challenge,winogrande. Annuler au moment de la soumission :
deadline bundle submit ./job_bundles/vllm_lm_eval_leaderboard/ \ --parameter Benchmarks="hellaswag,mmlu,gsm8k"
Si votre parc ne dispose pas d'effectifs supplémentaires, la cause la plus courante est un quota de service Deadline Cloud. Vérifiez que vous disposez d'une marge de manœuvre pour les GPU d'instance OnDemand G par région et les OnDemand vCPU par région dans la console Service Quotas.
Pour une procédure pas à pas complète qui couvre les prérequis, la configuration de la ferme, les modèles et les benchmarks personnalisés, ainsi que le nettoyage, consultez. Comparez les LLM avec vLLM et lm-evaluation-harness