Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Benchmarken Sie LLMs mit vLLM und lm-evaluation-harness auf Deadline Cloud
Das Jobpaket
Jede Aufgabe in diesem EvalModels Schritt startet einen lokalen vLLM-Server, führt jeden Benchmark mit dem lm-evaluation-harness von Eleutherai gegen den lokalen Endpunkt aus und stoppt dann vLLM. Weitere Informationen finden Sie unter vLLM und lm-evaluation-harness auf der Website. https://github.com/vllm-project/vllm
Um dieses Paket auszuführen, stellen Sie die CloudFormation CUDA-Farmvorlage
Die Standardmodellliste ist eine kleine, ungestörte, schnell ladende Mischung, die auf einen einzelnen A10G oder L4 passt:, und. Qwen/Qwen2.5-0.5B Qwen/Qwen2.5-1.5B EleutherAI/pythia-1.4b Um andere Modelle zu verwenden, bearbeiten Sie die Liste unter in. range parameterSpace.taskParameterDefinitions template.yaml
Die Standard-Benchmarks bilden eine Reihe von Argumenten mit gesundem Menschenverstand:. hellaswag,arc_easy,arc_challenge,winogrande Zum Zeitpunkt der Übermittlung überschreiben:
deadline bundle submit ./job_bundles/vllm_lm_eval_leaderboard/ \ --parameter Benchmarks="hellaswag,mmlu,gsm8k"
Wenn Ihr Fuhrpark die Anzahl der Mitarbeiter nicht erweitert, ist die häufigste Ursache ein Deadline Cloud-Servicekontingent. Vergewissern Sie sich in der Servicequota-Konsole, dass Sie genügend Platz für OnDemand G-Instance-GPUs pro Region und OnDemand vCPUs pro Region haben.
Eine vollständige Anleitung, die die Voraussetzungen, die Einrichtung der Farm, benutzerdefinierte Modelle und Benchmarks sowie die Bereinigung behandelt, finden Sie unter. Benchmark-LLMs mit vLLM und lm-evaluation-harness