View a markdown version of this page

マネージド階層型 KV キャッシュとルーティング - Amazon SageMaker AI

翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。

マネージド階層型 KV キャッシュとルーティング

大規模言語モデルの提供では、処理済みのトークンのキーバリュー (KV) キャッシュのコンピューティング再構築に費やされます。HyperPod は、マネージド 2 層 KV キャッシュとプレフィックス対応ルーティングを Ray Serve に追加します。これにより、冗長な再計算が削減され、ロングコンテキストワークロードとマルチターンワークロードの最初のトークンまでの時間が短縮されます。

階層型キャッシュの仕組み

キャッシュには 2 つの階層があります。

  • 最も迅速に再利用できるように、リクエストを処理するノードのメモリ内のローカル階層。

  • HyperPod 階層型ストレージのクラスター全体の階層。クラスターノードにまたがるプールされたメモリ階層。レプリカは、再計算するのではなく、別のレプリカによって計算されたプレフィックスを読み取ります。

リクエストがトークンプレフィックスを以前の作業と共有すると、デプロイはキャッシュされた KV 状態をローカル階層、次にクラスター全体の階層から読み取り、その後に何かを再計算します。

プレフィックス対応ルーティング

プレフィックス対応ルーティングは、プレフィックスの KV キャッシュをすでに保持しているレプリカにリクエストを送信します。マルチターン会話と共有システムプロンプトは同じレプリカにルーティングされるため、キャッシュヒット率は高く維持され、最初のトークンがドロップするまでの時間が短縮されます。

前提条件

クラスター全体の階層は HyperPod 階層型ストレージで実行されるため、クラスター全体のキャッシュを有効にする前に、クラスターで階層型ストレージを設定します。詳細については、「階層型 KV キャッシュの設定」を参照してください。