Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Comparez les LLM avec vLLM et lm-evaluation-harness sur Deadline Cloud
Le bundle de tâches vllm_lm_eval_leaderboard
Chaque tâche de cette EvalModels étape démarre un serveur vLLM
Pour exécuter ce bundle, déployez le CloudFormation modèle de ferme CUDA
La liste de modèles par défaut est un petit mix non daté à chargement rapide qui convient à un seul A10G ou L4 :, et. Qwen/Qwen2.5-0.5B Qwen/Qwen2.5-1.5B EleutherAI/pythia-1.4b Pour utiliser d'autres modèles, modifiez la range liste ci-dessous parameterSpace.taskParameterDefinitions danstemplate.yaml.
Les benchmarks par défaut forment une suite de raisonnement sensée :hellaswag,arc_easy,arc_challenge,winogrande. Annuler au moment de la soumission :
deadline bundle submit ./job_bundles/vllm_lm_eval_leaderboard/ \ --parameter Benchmarks="hellaswag,mmlu,gsm8k"
Si votre flotte n'augmente pas le nombre de travailleurs, la cause la plus courante est un quota de service vCPU EC2. Vérifiez que vous disposez de suffisamment d'espace pour exécuter des instances On-Demand G et VT dans la console Service Quotas.
Pour une présentation complète des conditions préalables, de la configuration de la ferme, des modèles et des tests personnalisés, ainsi que du nettoyage, voir. Comparez les LLM avec vLLM et lm-evaluation-harness