View a markdown version of this page

Confronta gli LLM con vLLM e lm-evaluation-harness su Deadline Cloud - Deadline Cloud

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

Confronta gli LLM con vLLM e lm-evaluation-harness su Deadline Cloud

Il job bundle vllm_lm_eval_leaderboard valuta più LLM rispetto a più benchmark in un singolo job Deadline Cloud. Ogni modello diventa un'attività in un'analisi dei parametri e le attività vengono eseguite in parallelo tra i lavoratori. Un passaggio finale aggrega i risultati per modello in una classifica classificata (CSV e Markdown).

Ogni attività della EvalModels fase avvia un server vLLM locale, esegue ogni benchmark con lm-evaluation-harness di EleutherAI rispetto all'endpoint locale, quindi interrompe il vLLM. I HuggingFace modelli vengono caricati direttamente da Hub, quindi non sono necessari allegati al lavoro.

Per eseguire questo pacchetto, implementa il modello di farm CUDA. CloudFormation Il modello fornisce una flotta gestita da GPU NVIDIA (A10G o L4) e una coda con un ambiente di coda conda che questo pacchetto utilizza senza modifiche. Se hai già una farm, hai bisogno di una flotta SMF con GPU NVIDIA, almeno 32 GB di RAM e almeno 4 vCPU.

L'elenco di modelli predefinito è un mix piccolo, non datato e a caricamento rapido che si adatta a un singolo A10G o L4:,, e. Qwen/Qwen2.5-0.5B Qwen/Qwen2.5-1.5B EleutherAI/pythia-1.4b Per utilizzare altri modelli, modifica l'elenco sotto in. range parameterSpace.taskParameterDefinitions template.yaml

I benchmark predefiniti costituiscono una suite di ragionamento basato sul buon senso:. hellaswag,arc_easy,arc_challenge,winogrande Sostituisci al momento dell'invio:

deadline bundle submit ./job_bundles/vllm_lm_eval_leaderboard/ \ --parameter Benchmarks="hellaswag,mmlu,gsm8k"

Se la tua flotta non è in grado di aumentare il numero di dipendenti, la causa più comune è una quota di servizio vCPU EC2. Verifica di avere spazio per eseguire le istanze On-Demand G e VT nella console Service Quotas.

Per una procedura dettagliata completa che include i prerequisiti, la configurazione della farm, i modelli e i benchmark personalizzati e la pulizia, consulta. Effettua il benchmark dei LLM con vLLM e lm-evaluation-harness