

기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.

# bedrock-runtime 엔드포인트 할당량
<a name="quotas-runtime"></a>

`bedrock-runtime.{{region}}.amazonaws.com` 엔드포인트는 Amazon Bedrock의 기본 추론 엔드포인트입니다. 이 엔드포인트에 대한 추론 트래픽은 모델별 토큰 기반 할당량에 의해 관리됩니다. [Service Quotas 콘솔](https://docs.aws.amazon.com/servicequotas/latest/userguide/gs-request-quota.html)에서 **Amazon Bedrock**을 서비스로 선택하거나의 [Amazon Bedrock 서비스 할당량 테이블에서 이러한 할당량을](https://docs.aws.amazon.com/general/latest/gr/bedrock.html#limits_bedrock) 볼 수 있습니다 AWS 일반 참조.

## 할당량 유형
<a name="quotas-runtime-types"></a>

`bedrock-runtime` 엔드포인트에 대한 추론은 다음과 같은 모델별 할당량에 의해 관리됩니다.


**bedrock-runtime 모델당 할당량**  

| 할당량 | Scope | 설명 | 
| --- | --- | --- | 
| {{${model}}}에 대한 분당 교차 리전 InvokeModel 토큰 | 모델별, 리전별 | 교차 리전 추론 프로파일을 통해 호출할 때 계정이 모델에 사용할 수 있는 분당 최대 토큰 수(입력 \+ 출력, 결합). | 
| {{${model}}}에 대한 분당 온디맨드 InvokeModel 토큰 | 모델별, 리전별 | 단일 리전에서 온디맨드 방식으로 호출할 때 계정이 모델에 사용할 수 있는 분당 최대 토큰 수(입력 \+ 출력, 결합). | 
| {{${model}}}에 대한 일일 모델 간접 호출 최대 토큰 | 모델별, 리전별 | 계정이 모델에 사용할 수 있는 일일 최대 토큰 수(입력 \+ 출력, 결합)입니다. 기본적으로이 값은 분당 할당량에 24 × 60을 곱한 값입니다. 새는 감소된 할당량을 받을 AWS 계정 수 있습니다. | 
| {{${model}}}에 대한 분당 InvokeModel 요청 | 모델별, 리전별 | 계정이 모델에 대해 제출할 수 있는 분당 최대 추론 요청 수입니다. RPM은 bedrock-runtime 엔드포인트의 일부 모델에는 적용되지만 다른 모델에는 적용되지 않습니다. 모델에 적용되는 정확한 할당량은 Service Quotas 콘솔을 참조하세요. | 

`bedrock-runtime` 엔드포인트 TPM 할당량은 모델당 단일 할당량에 대해 입력 토큰과 출력 토큰을 함께 계산합니다. `bedrock-mantle` 엔드포인트는 input-tokens-per-minute 및 분당 output-tokens-per-minute 할당량을 적용합니다. 자세한 내용은 섹션을 참조하세요[bedrock-mantle 엔드포인트 할당량](quotas-mantle.md).

**참고**  
`bedrock-runtime` 엔드포인트의 RPM 할당량은 모델별로 다릅니다. 예를 들어 Anthropic Claude Opus 4.7 및 Claude Opus 4.8과 같은 일부 모델은 RPM 할당량이 없으며이 섹션에 설명된 토큰 기반 할당량에 의해서만 관리됩니다. RPM 할당량이 있는 모델의 경우 [Service Quotas 콘솔](https://docs.aws.amazon.com/servicequotas/latest/userguide/gs-request-quota.html)에서 정확한 값을 확인합니다.

출력 토큰은 모델별 연소율을 통해 할당량 사용량으로 변환됩니다. 토큰 기반 할당량을 계산하는 방법과 `max_tokens` 요청 파라미터가 공제에 미치는 영향에 대한 자세한 내용은 섹션을 참조하세요[Amazon Bedrock에서 토큰을 계산하는 방법](quotas-token-burndown.md).

## 관련 런타임 할당량
<a name="quotas-runtime-other"></a>

다음 Amazon Bedrock 기능은 `bedrock-runtime` 엔드포인트를 통해 제공되며 별도의 할당량이 있습니다.
+ **사용자 지정 추론 프로필** - 기본 모델을 래핑하는 애플리케이션 정의 추론 프로필입니다. [추론 프로파일을 사용하여 모델 간접 호출 리소스 설정](inference-profiles.md)을(를) 참조하세요.
+ **배치 추론** - 비동기식 대용량 추론 작업입니다. [배치 추론을 사용하여 여러 프롬프트 처리](batch-inference.md)을(를) 참조하세요.
+ **프로비저닝된 처리량** - 예약 모델 단위 용량입니다. [Amazon Bedrock에서 프로비저닝된 처리량으로 모델 간접 호출 용량 증대](prov-throughput.md)을(를) 참조하세요.

이러한 할당량은 `bedrock-runtime` 엔드포인트에만 적용되며 `bedrock-mantle` 엔드포인트에는 노출되지 않습니다.

## 할당량 증가 요청
<a name="quotas-runtime-increase"></a>

계정에 대한 할당량 증가를 요청하는 단계는 [Amazon Bedrock 서비스 할당량](https://docs.aws.amazon.com/general/latest/gr/bedrock.html#limits_bedrock)에 있는 할당량 테이블의 **조정 가능** 열에 있는 값에 따라 달라집니다.

**중요**  
할당량 증가를 요청하기 전에 모델이 *레거시* 또는 *더 이상 사용되지 않는* 수명 주기 상태가 아닌지 확인합니다. 만료 예정인 모델에는 할당량 증가가 부여되지 않습니다. [모델 수명 주기](model-lifecycle.md) 페이지에서 모델의 수명 주기 상태를 확인하고 대신 후속 모델로 마이그레이션하는 것이 좋습니다.
+ 할당량이 **예**로 표시된 경우 Service Quotas 사용 설명서의 [할당량 증가 요청](https://docs.aws.amazon.com/servicequotas/latest/userguide/request-quota-increase.html) 단계에 따라 할당량을 조정할 수 있습니다.
+ 모든 모델에 대해 다음 할당량에 대한 증가를 함께 요청할 수 없습니다.
  + {{${model}}}에 대한 분당 교차 리전 InvokeModel 토큰
  + {{${model}}}에 대한 분당 온디맨드 InvokeModel 토큰
  + {{${model}}}에 대한 일일 모델 간접 호출 최대 토큰

  이러한 할당량의 조합에 대한 증가를 요청하려면 Service Quotas 사용 설명서의 [할당량 증가 요청](https://docs.aws.amazon.com/servicequotas/latest/userguide/request-quota-increase.html)의 단계에 따라 **{{${model}}} 할당량에 대한 분당 교차 리전 InvokeModel 토큰** 증가를 요청하세요. 이렇게 하면 지원 팀이 연락하여 다른 두 할당량을 늘릴 수 있는 옵션도 제공합니다.
**참고**  
수요가 압도적인 관계로, 기존에 할당된 할당량을 소비하는 트래픽을 생성하는 고객에게 우선 순위가 부여됩니다. 이 조건을 충족하지 않으면 요청이 거부될 수 있습니다.

할당`bedrock-mantle`량 증가는 섹션을 참조하세요[할당량 증가 요청](quotas-mantle.md#quotas-mantle-increase).