View a markdown version of this page

Amazon Bedrock でサポートされているエンドポイント - Amazon Bedrock

翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。

Amazon Bedrock でサポートされているエンドポイント

Amazon Bedrock は、推論オペレーションを実行するためのさまざまなエンドポイントをサポートしています。

推論オペレーション

新しいアプリケーションの場合は、 bedrock-runtimeエンドポイントをお勧めします。Bedrock ネイティブの InvokeModel API と Converse APIs、OpenAI 互換の Responses and Chat Completions APIs、および Anthropic Messages API をサポートしており、ガードレールインテリジェントプロンプトルーティングクロスリージョン推論などの Amazon Bedrock 機能を利用できます。Amazon Bedrock は 2 番目のエンドポイントである もサポートしています。これは現在bedrock-mantle、サーバー側および事前設定されたツールの使用 (ウェブ検索を含む)、 を使用した非同期推論background=trueプロジェクトワークスペースの作成などの追加機能を提供します。各モデルがサポートするエンドポイントを確認するには、「」を参照してくださいモデル別のエンドポイントの可用性

Endpoint サポートされている APIs 説明
bedrock-runtime.{region}.amazonaws.com (推奨) InvokeModel / Converse / Chat Completions / Responses API / Messages API InvokeModel/Converse/Chat Completions/Responses/Messages API を使用して Amazon Bedrock でホストされているモデルの推論リクエストを行うためのリージョン固有のエンドポイント。 Completions/Responses/Messages APIs Bedrock ネイティブオペレーションの詳細については、「Amazon Bedrock ランタイム API オペレーション」を参照してください。OpenAI 互換 APIsは、SDK ではなく、このエンドポイントの/openai/v1パスで呼び出されます。 AWS SDKs
bedrock-mantle.{region}.api.aws Responses API / Chat Completions API / Messages API OpenAI 互換エンドポイントと Anthropic Messages API を使用して Amazon Bedrock でホストされているモデルの推論リクエストを行うためのリージョン固有のエンドポイント。

を使用する既存のアプリケーションはbedrock-mantle引き続き完全にサポートされるため、変更する必要はありません。どちらのエンドポイントでも、ベース URL と API キーのみを変更することで、既存の OpenAI SDK コードベースを Amazon Bedrock に持ち込むことができ、どちらも OpenAI 互換の Responses and Chat Completions APIs と Anthropic Messages API をサポートしています。

次の表は、各エンドポイントで使用できるものを比較したものです。

注記

Messages API は両方のエンドポイントで使用できますが、2 つの表面は同じ機能をサポートしていません。特に、構造化出力 ( output_config.formatパラメータ) は ではサポートされていませんbedrock-mantle。 を含むリクエストoutput_config.formatは 400 エラーで拒否されます。Anthropic Claude モデルで構造化出力を使用するには、 で Converse または InvokeModel APIsますbedrock-runtime

注記

Responses API は、同じ機能をサポートしていない両方のエンドポイントでも使用できます。bedrock-runtime の場合

  • リクエストは常に同期されます。 background=trueは 400 エラーで拒否されます。store パラメータは影響を受けず、デフォルトの のままになるためtrue、保存されているマルチターン会話は正常に機能します。

  • サーバー側のツールの使用や、ウェブ検索などの事前設定されたツールは利用できませんウェブ検索クライアント側のツールの使用は、両方のエンドポイントで機能します。

  • デフォルトのプロジェクトのみがサポートされています。プロジェクト (OpenAI 互換)」を参照してください。

  • 保存されたレスポンスは、それ AWS リージョン に対応した に属します。それを取得、キャンセル、または削除し、 との会話を続行するとprevious_response_id、すべてそのリージョンによって処理されます。

注記

ではbedrock-runtime、Responsions API は IAM プリンシパルによる使用のみを属性します。リクエストごとのメタデータタグ付けとアプリケーション推論プロファイルは使用できません。アプリケーション推論プロファイルを推論ターゲットとして指定するリクエストは、400 エラーで拒否されます。これはクロスリージョン推論には影響しません。システム定義の地理的推論プロファイルとグローバル推論プロファイルは正常に機能します。

注記

のプロンプトキャッシュのサポートbedrock-mantleは、特定のモデルによって異なります。モデルの概要詳細については、「」の各モデルカードを参照してください。

スループットとクォータのアプローチ

各エンドポイントは、スループットを管理するために異なるアプローチを使用します。

  • bedrock-runtime – 従来の多くのマルチテナントサービスでは、このアーキテクチャは、共有リソースへの公平な共有アクセスを管理するためにアカウントごとのクォータを中心に設計されています。これは、 で使用されるアプローチですbedrock-runtime。各モデルには、引き上げをリクエストできる固定スループットクォータ (RPM と TPM) があります。詳細については、「bedrock-runtime エンドポイントのクォータ」を参照してください。

  • bedrock-mantle – このエンドポイントは、より高い初期スループット制限をサポートしながら公平な配分を実現する高度なスケジューリングとワークキューイングメカニズムで設計されています。また、この設計によりbedrock-mantle、 はさまざまなモデルをホストし、モデルカタログ全体で利用できる幅広い機能を提供できます。ほとんどの場合、リクエストはすぐに処理されます。場合によっては、処理中のワークロードが完了し、スループットが利用可能になったときに、リクエストが一時的にキューに入れられることがあります。詳細については、「bedrock-mantle エンドポイントのクォータ」および「スケーリングとスループットのベストプラクティス」を参照してください。

料金

同じモデルのトークンごとの料金は、 bedrock-runtimeと で同じですbedrock-mantle。コストではなく、必要な APIsと機能に基づいてエンドポイントを選択します。現在の料金については、「Amazon Bedrock の料金」を参照してください。

各エンドポイントを選択するタイミング

以下を行うbedrock-runtimeときは、 から始めます。

次のbedrock-mantle場合に使用します。

  • サーバー側のツールを使用するか、ウェブ検索などの事前設定されたツールを使用して、エージェントワークフローを構築します。

  • でレスポンスリクエストを含む、非同期または長時間実行される推論ワークロードを実行しますbackground=true

  • プロジェクト (OpenAI 互換) または WorkSpaces (Anthropic 互換)を作成してワークロードを分離し、コストと使用状況をアプリケーションレベルで追跡します。

  • でのみ使用可能なモデルを使用しますbedrock-mantle。「モデル別のエンドポイントの可用性」を参照してください。

両方のエンドポイントを同じアプリケーションから一緒に使用できます。ユースケースごとに選択します。

VPC インターフェイスエンドポイントを使用してデータ出力コストを削減する

VPC 内から Amazon Bedrock を呼び出す場合は、VPC インターフェイスエンドポイント (AWS PrivateLink) を使用してトラフィックを AWS ネットワーク内に保持し、NAT ゲートウェイまたはインターネットゲートウェイに関連するデータ出力料金を回避することを検討してください。