As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.
Cache e roteamento de KV em camadas gerenciados
O grande servidor de modelos de linguagem gasta a computação reconstruindo o cache de valores-chave (KV) dos tokens que ele já processou. HyperPod adiciona um cache KV gerenciado de duas camadas e um roteamento com reconhecimento de prefixo ao Ray Serve, o que reduz a recomputação redundante e reduz o tempo até o primeiro token para cargas de trabalho de longo contexto e várias voltas.
Como funciona o cache hierárquico
O cache tem duas camadas:
-
Uma camada local na memória do nó que atende à solicitação, para a reutilização mais rápida.
-
Uma camada de armazenamento HyperPod hierárquico que abrange todo o cluster, uma camada de memória agrupada que abrange os nós do cluster. Uma réplica lê um prefixo calculado por outra réplica em vez de recalculá-lo.
Quando uma solicitação compartilha um prefixo de token com um trabalho anterior, a implantação lê o estado do KV em cache da camada local e, em seguida, da camada de todo o cluster, antes de recalcular qualquer coisa.
Prefix-aware roteamento
Prefix-aware o roteamento envia uma solicitação para uma réplica que já contém o cache KV como prefixo. Multi-turn as conversas e os prompts compartilhados do sistema são direcionados para a mesma réplica, para que a taxa de acerto do cache permaneça alta e o tempo até o primeiro token diminua.
Pré-requisito
O nível de todo o cluster é executado no armazenamento HyperPod hierárquico, portanto, configure o armazenamento em camadas no cluster antes de ativar o cache em todo o cluster. Para obter mais informações, consulte Configurando o cache KV em camadas.