View a markdown version of this page

Cache e roteamento de KV em camadas gerenciados - SageMaker IA da Amazon

As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.

Cache e roteamento de KV em camadas gerenciados

O grande servidor de modelos de linguagem gasta a computação reconstruindo o cache de valores-chave (KV) dos tokens que ele já processou. HyperPod adiciona um cache KV gerenciado de duas camadas e um roteamento com reconhecimento de prefixo ao Ray Serve, o que reduz a recomputação redundante e reduz o tempo até o primeiro token para cargas de trabalho de longo contexto e várias voltas.

Como funciona o cache hierárquico

O cache tem duas camadas:

  • Uma camada local na memória do nó que atende à solicitação, para a reutilização mais rápida.

  • Uma camada de armazenamento HyperPod hierárquico que abrange todo o cluster, uma camada de memória agrupada que abrange os nós do cluster. Uma réplica lê um prefixo calculado por outra réplica em vez de recalculá-lo.

Quando uma solicitação compartilha um prefixo de token com um trabalho anterior, a implantação lê o estado do KV em cache da camada local e, em seguida, da camada de todo o cluster, antes de recalcular qualquer coisa.

Prefix-aware roteamento

Prefix-aware o roteamento envia uma solicitação para uma réplica que já contém o cache KV como prefixo. Multi-turn as conversas e os prompts compartilhados do sistema são direcionados para a mesma réplica, para que a taxa de acerto do cache permaneça alta e o tempo até o primeiro token diminua.

Pré-requisito

O nível de todo o cluster é executado no armazenamento HyperPod hierárquico, portanto, configure o armazenamento em camadas no cluster antes de ativar o cache em todo o cluster. Para obter mais informações, consulte Configurando o cache KV em camadas.