View a markdown version of this page

Benchmarken Sie LLMs mit vLLM und lm-evaluation-harness auf Deadline Cloud - Deadline Cloud

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Benchmarken Sie LLMs mit vLLM und lm-evaluation-harness auf Deadline Cloud

Das Jobpaket vllm_lm_eval_leaderboard auf der GitHub Website bewertet mehrere LLMs anhand mehrerer Benchmarks in einem einzigen Deadline Cloud-Job. Jedes Modell wird in einem Parameter-Sweep zu einer Aufgabe, und die Aufgaben werden parallel für alle Mitarbeiter ausgeführt. In einem letzten Schritt werden die Ergebnisse pro Modell zu einer Rangliste zusammengefasst (CSV und Markdown).

Jede Aufgabe in diesem EvalModels Schritt startet einen lokalen vLLM-Server, führt jeden Benchmark mit dem lm-evaluation-harness von Eleutherai gegen den lokalen Endpunkt aus und stoppt dann vLLM. Weitere Informationen finden Sie unter vLLM und lm-evaluation-harness auf der Website. https://github.com/vllm-project/vllm https://github.com/EleutherAI/lm-evaluation-harness GitHub Modelle werden direkt von Hugging Face Hub geladen, sodass keine Jobanhänge erforderlich sind.

Um dieses Paket auszuführen, stellen Sie die CloudFormation CUDA-Farmvorlage auf der Website bereit. GitHub Die Vorlage stellt eine vom NVIDIA GPU-Service verwaltete Flotte (A10G oder L4) und eine Warteschlange mit einer Conda-Warteschlangenumgebung bereit, die dieses Paket unverändert verwendet. Wenn Sie bereits über eine Farm verfügen, benötigen Sie eine SMF-Flotte mit NVIDIA-GPUs, mindestens 32 GB RAM und mindestens 4 vCPUs.

Die Standardmodellliste ist eine kleine, ungestörte, schnell ladende Mischung, die auf einen einzelnen A10G oder L4 passt:, und. Qwen/Qwen2.5-0.5B Qwen/Qwen2.5-1.5B EleutherAI/pythia-1.4b Um andere Modelle zu verwenden, bearbeiten Sie die Liste unter in. range parameterSpace.taskParameterDefinitions template.yaml

Die Standard-Benchmarks bilden eine Reihe von Argumenten mit gesundem Menschenverstand:. hellaswag,arc_easy,arc_challenge,winogrande Zum Zeitpunkt der Übermittlung überschreiben:

deadline bundle submit ./job_bundles/vllm_lm_eval_leaderboard/ \ --parameter Benchmarks="hellaswag,mmlu,gsm8k"

Wenn Ihr Fuhrpark die Anzahl der Mitarbeiter nicht erweitert, ist die häufigste Ursache ein Deadline Cloud-Servicekontingent. Vergewissern Sie sich in der Servicequota-Konsole, dass Sie genügend Platz für OnDemand G-Instance-GPUs pro Region und OnDemand vCPUs pro Region haben.

Eine vollständige Anleitung, die die Voraussetzungen, die Einrichtung der Farm, benutzerdefinierte Modelle und Benchmarks sowie die Bereinigung behandelt, finden Sie unter. Benchmark-LLMs mit vLLM und lm-evaluation-harness