

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

# Vergleichen Sie LLMs mit vLLM und lm-evaluation-harness auf Deadline Cloud
<a name="examples-jb-vllm-leaderboard"></a>

Das Jobpaket [vllm\_lm\_eval\_leaderboard](https://github.com/aws-deadline/deadline-cloud-samples/tree/mainline/job_bundles/vllm_lm_eval_leaderboard) bewertet mehrere LLMs anhand mehrerer Benchmarks in einem einzigen Deadline Cloud-Job. Jedes Modell wird in einem Parameter-Sweep zu einer Aufgabe, und die Aufgaben werden parallel zwischen den Workern ausgeführt. In einem letzten Schritt werden die Ergebnisse pro Modell zu einer Rangliste zusammengefasst (CSV und Markdown).

Jede Aufgabe in diesem `EvalModels` Schritt startet einen lokalen [vLLM-Server, führt jeden Benchmark mit dem lm-evaluation-harness](https://github.com/vllm-project/vllm) von [EleutherAI gegen den lokalen Endpunkt aus und stoppt dann vLLM](https://github.com/EleutherAI/lm-evaluation-harness). Modelle werden direkt vom Hub geladen, sodass keine Auftragsanhänge erforderlich sind. HuggingFace 

Um dieses Paket auszuführen, stellen Sie die [ CloudFormation CUDA-Farmvorlage](https://github.com/aws-deadline/deadline-cloud-samples/tree/mainline/cloudformation/farm_templates/cuda_farm) bereit. Die Vorlage stellt eine vom Dienst verwaltete NVIDIA-GPU-Flotte (A10G oder L4) und eine Warteschlange mit einer Conda-Warteschlangenumgebung bereit, die dieses Paket unverändert verwendet. Wenn Sie bereits eine Farm haben, benötigen Sie eine SMF-Flotte mit NVIDIA-GPUs, mindestens 32 GB RAM und mindestens 4 vCPUs.

Die Standardmodellliste ist eine kleine, ungegliederte, schnell ladende Mischung, die auf einen einzelnen A10G oder L4 passt:,, und. `Qwen/Qwen2.5-0.5B` `Qwen/Qwen2.5-1.5B` `EleutherAI/pythia-1.4b` Um andere Modelle zu verwenden, bearbeiten Sie die Liste unter in. `range` `parameterSpace.taskParameterDefinitions` `template.yaml`

Die Standard-Benchmarks bilden eine Sammlung vernünftiger Überlegungen:. `hellaswag,arc_easy,arc_challenge,winogrande` Zum Zeitpunkt des Absendens überschreiben:

```
deadline bundle submit ./job_bundles/vllm_lm_eval_leaderboard/ \
  --parameter Benchmarks="hellaswag,mmlu,gsm8k"
```

Wenn Ihre Flotte nicht skaliert, ist die häufigste Ursache ein EC2-vCPU-Servicekontingent. Vergewissern Sie sich, dass Sie in der Service Quotas Quotas-Konsole genügend Spielraum für *Running On-Demand G- und VT-Instances* haben.

Eine vollständige exemplarische Vorgehensweise, in der die Voraussetzungen, die Einrichtung der Farm, benutzerdefinierte Modelle und Benchmarks sowie die Bereinigung behandelt werden, finden Sie unter. [Benchmark-LLMs mit vLLM und lm-evaluation-harness](tutorial-vllm-leaderboard.md)