Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Comparez les LLM avec vLLM et lm-evaluation-harness sur Deadline Cloud
Le bundle de tâches vllm_lm_eval_leaderboard évalue plusieurs LLM par rapport à plusieurs benchmarks dans une seule
Chaque tâche de cette EvalModels étape démarre un serveur
Pour exécuter ce bundle, déployez le CloudFormation modèle de ferme
La liste des modèles par défaut est un petit mix non fermé à chargement rapide qui s'adapte à un seul A10G ou L4 :, et. Qwen/Qwen2.5-0.5B Qwen/Qwen2.5-1.5B EleutherAI/pythia-1.4b Pour utiliser d'autres modèles, modifiez la range liste parameterSpace.taskParameterDefinitions ci-dessoustemplate.yaml.
Les repères par défaut forment une suite de raisonnement de bon sens :hellaswag,arc_easy,arc_challenge,winogrande. Annuler au moment de la soumission :
deadline bundle submit ./job_bundles/vllm_lm_eval_leaderboard/ \ --parameter Benchmarks="hellaswag,mmlu,gsm8k"
Si votre parc ne dispose pas d'effectifs supplémentaires, la cause la plus courante est un quota de service du processeur virtuel EC2. Vérifiez que vous disposez de suffisamment d'espace pour exécuter des instances On-Demand G et VT dans la console Service Quotas.
Pour une procédure pas à pas complète qui couvre les prérequis, la configuration de la ferme, les modèles et les benchmarks personnalisés, ainsi que le nettoyage, consultez. Comparez les LLM avec vLLM et lm-evaluation-harness