기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.
관리형 계층형 KV 캐시 및 라우팅
서비스를 제공하는 대규모 언어 모델은 이미 처리한 토큰에 대한 키-값(KV) 캐시를 컴퓨팅 재구축하는 데 사용됩니다. HyperPod는 Ray Serve에 관리형 2계층 KV 캐시 및 접두사 인식 라우팅을 추가하여 긴 컨텍스트 및 멀티턴 워크로드에 대한 중복 재계산을 줄이고 첫 번째 토큰까지의 시간을 단축합니다.
계층형 캐시의 작동 방식
캐시에는 두 개의 티어가 있습니다.
-
가장 빠른 재사용을 위해 요청을 처리하는 노드 메모리의 로컬 티어입니다.
-
클러스터 노드에 걸쳐 있는 풀링 메모리 계층인 HyperPod 계층형 스토리지의 클러스터 전체 계층입니다. 복제본은 다시 계산하는 대신 다른 복제본에서 계산한 접두사를 읽습니다.
요청이 이전 작업과 토큰 접두사를 공유하면 배포는 캐시된 KV 상태를 로컬 계층에서 읽은 다음 클러스터 전체 계층에서 읽은 다음 다시 계산합니다.
접두사 인식 라우팅
접두사 인식 라우팅은 접두사에 대한 KV 캐시가 이미 있는 복제본에 요청을 보냅니다. 멀티턴 대화와 공유 시스템 프롬프트는 동일한 복제본으로 라우팅되므로 캐시 적중률이 높게 유지되고 첫 번째 토큰 삭제까지 시간이 걸립니다.
사전 조건
클러스터 전체 계층은 HyperPod 계층형 스토리지에서 실행되므로 클러스터 전체 캐시를 켜기 전에 클러스터에 계층형 스토리지를 설정합니다. 자세한 내용은 계층형 KV 캐시 설정 단원을 참조하십시오.