View a markdown version of this page

Deadline Cloud에서 vLLM 및 lm-evaluation-harness를 사용하여 LLMs 벤치마크 - 기한 클라우드

기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.

Deadline Cloud에서 vLLM 및 lm-evaluation-harness를 사용하여 LLMs 벤치마크

GitHub 웹 사이트의 vllm_lm_eval_leaderboard 작업 번들은 단일 Deadline Cloud 작업의 여러 벤치마크와 비교하여 여러 LLMs을 평가합니다. 각 모델은 파라미터 스윕에서 하나의 작업이 되며 작업은 작업자 간에 병렬로 실행됩니다. 마지막 단계는 모델별 결과를 순위가 매겨진 리더보드(CSV 및 마크다운)로 집계합니다.

이 EvalModels 단계의 각 작업은 로컬 vLLM 서버를 시작하고, 로컬 엔드포인트에 대한 EleutherAI의 lm-evaluation-harness를 사용하여 모든 벤치마크를 실행한 다음, vLLM을 중지합니다. 자세한 내용은 GitHub 웹 사이트의 vLLM 및 lm-evaluation-harness를 참조하세요. 모델은 Hugging Face Hub에서 직접 로드되므로 작업 연결이 필요하지 않습니다.

이 번들을 실행하려면 GitHub 웹 사이트에 CUDA 팜 CloudFormation 템플릿을 배포합니다. 템플릿은 NVIDIA GPU 서비스 관리형 플릿(A10G 또는 L4)과이 번들이 수정 없이 사용하는 conda 대기열 환경이 있는 대기열을 프로비저닝합니다. 이미 팜이 있는 경우 NVIDIA GPUs, 최소 32GB의 RAM 및 최소 4개의 vCPUs가 있는 SMF 플릿이 필요합니다.

기본 모델 목록은 단일 A10G 또는 L4: , Qwen/Qwen2.5-0.5B Qwen/Qwen2.5-1.5B및에 적합한 작고 빠르게 로드되는 비동기식 혼합입니다EleutherAI/pythia-1.4b. 다른 모델을 사용하려면의 parameterSpace.taskParameterDefinitions에서 range 목록을 편집합니다template.yaml.

기본 벤치마크는 공통 추론 제품군인를 형성합니다hellaswag,arc_easy,arc_challenge,winogrande. 제출 시 재정의:

deadline bundle submit ./job_bundles/vllm_lm_eval_leaderboard/ \ --parameter Benchmarks="hellaswag,mmlu,gsm8k"

플릿이 작업자를 스케일 업하지 않는 경우 가장 일반적인 원인은 Deadline Cloud 서비스 할당량입니다. Service Quotas 콘솔에서 리전당 OnDemand G 인스턴스 GPUs 및 리전당 OnDemand vCPUs에 대한 헤드룸이 있는지 확인합니다.

사전 조건, 팜 설정, 사용자 지정 모델 및 벤치마크, 정리를 다루는 전체 연습은 섹션을 참조하세요vLLM 및 lm-evaluation-harnessLLMs 벤치마크.