Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Cache et routage KV hiérarchisés gérés
Le serveur de grands modèles de langage dépense des calculs pour reconstruire le cache clé-valeur (KV) pour les jetons qu'il a déjà traités. HyperPod ajoute à Ray Serve un cache KV géré à deux niveaux et un routage prenant en compte les préfixes, ce qui permet de réduire les recalculs redondants et le délai d'obtention du premier jeton pour les charges de travail à contexte long et à tours multiples.
Comment fonctionne le cache hiérarchisé
Le cache comporte deux niveaux :
-
Un niveau local dans la mémoire du nœud qui traite la demande, pour une réutilisation rapide.
-
Un niveau à l'échelle du cluster sur le stockage HyperPod hiérarchisé, un niveau de mémoire groupée qui couvre les nœuds du cluster. Un réplica lit un préfixe calculé par un autre réplica au lieu de le recalculer.
Lorsqu'une demande partage un préfixe de jeton avec un travail antérieur, le déploiement lit l'état KV mis en cache à partir du niveau local, puis du niveau à l'échelle du cluster, avant de recalculer quoi que ce soit.
Prefix-aware routage
Prefix-aware le routage envoie une demande à une réplique qui contient déjà le cache KV pour son préfixe. Multi-turn les conversations et les instructions du système partagé sont acheminées vers la même réplique, de sorte que le taux d'accès au cache reste élevé et que le délai avant le premier jeton diminue.
Prérequis
Le niveau à l'échelle du cluster s'exécute sur le stockage HyperPod hiérarchisé. Configurez donc le stockage hiérarchisé sur le cluster avant d'activer le cache à l'échelle du cluster. Pour de plus amples informations, veuillez consulter Configuration du cache KV hiérarchisé.