Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Confronta gli LLM con vLLM e lm-evaluation-harness su Deadline Cloud
Il job bundle
Ogni attività della EvalModels fase avvia un server
Per eseguire questo pacchetto, implementa il modello di farm CUDA. CloudFormation
L'elenco di modelli predefinito è un mix piccolo, non datato e a caricamento rapido che si adatta a un singolo A10G o L4:,, e. Qwen/Qwen2.5-0.5B Qwen/Qwen2.5-1.5B EleutherAI/pythia-1.4b Per utilizzare altri modelli, modifica l'elenco sotto in. range parameterSpace.taskParameterDefinitions template.yaml
I benchmark predefiniti costituiscono una suite di ragionamento basato sul buon senso:. hellaswag,arc_easy,arc_challenge,winogrande Sostituisci al momento dell'invio:
deadline bundle submit ./job_bundles/vllm_lm_eval_leaderboard/ \ --parameter Benchmarks="hellaswag,mmlu,gsm8k"
Se la tua flotta non è in grado di aumentare il numero di dipendenti, la causa più comune è una quota di servizio vCPU EC2. Verifica di avere spazio per eseguire le istanze On-Demand G e VT nella console Service Quotas.
Per una procedura dettagliata completa che include i prerequisiti, la configurazione della farm, i modelli e i benchmark personalizzati e la pulizia, consulta. Effettua il benchmark dei LLM con vLLM e lm-evaluation-harness