View a markdown version of this page

Amazon SageMaker HyperPod 추론 릴리스 정보 - Amazon SageMaker AI

기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.

Amazon SageMaker HyperPod 추론 릴리스 정보

이 주제에서는 Amazon SageMaker HyperPod 추론의 업데이트, 수정 사항 및 새로운 기능을 추적하는 릴리스 정보를 다룹니다. SageMaker HyperPod 추론을 사용하면 엔터프라이즈급 안정성으로 HyperPod 클러스터에 기계 학습 모델을 배포하고 확장할 수 있습니다. 일반적인 Amazon SageMaker HyperPod 플랫폼 릴리스, 업데이트 및 개선 사항은 섹션을 참조하세요Amazon SageMaker HyperPod 릴리스 정보.

SageMaker HyperPod 추론 기능 및 배포 옵션에 대한 자세한 내용은 섹션을 참조하세요Amazon SageMaker HyperPod에 모델 배포.

SageMaker HyperPod 추론 릴리스 정보: HyperPod 추론 Amazon EKS v2.0.0-eksbuild.2 및 추론 연산자 v3.6

릴리스 날짜: 2026년 9월 10일

요약

HyperPod Inference Amazon EKS 추가 기능의 v2.0.0-eksbuild.2 릴리스에는 요청 본문 콘텐츠 및 GPU 인식 엔드포인트 선택을 사용하여 모델 서비스 포드 간에 추론 트래픽을 분산하는 Kubernetes 네이티브 LLM 인식 라우팅 계층인 HyperPod Inference Gateway가 도입되었습니다. 추론 연산자와 추론 게이트웨이는 모두이 추가 기능 릴리스의 일부로 함께 제공됩니다.

이는에서 v1.6.0-eksbuild.1 로 추가 기능의 메이저 버전 업데이트입니다v2.0.0-eksbuild.2. 버전 업데이트는 Inference Gateway의 추가를 반영하며 릴리스는 기존 추가 기능들과 이전 버전과의 호환성을 유지합니다. 두 구성 요소가 모두 필요하지 않은 경우 inferenceGateway.enabled 또는를 로 설정하여 추가 기능 구성에서 해당 구성 요소를 비활성화inferenceOperator.enabled할 수 있습니다false.

추론 게이트웨이

  • 추론 게이트웨이 - 요청 model 필드를 읽는 본문 기반 라우터, 헤더 기반 라우팅을 위한 HTTPRoute가 있는 게이트웨이, GPU 인식 엔드포인트 선택기의 세 가지 라우팅 계층을 사용하여 단일 게이트웨이 엔드포인트를 통해 여러 모델의 추론 트래픽을 라우팅합니다. 모델별 스케줄러, 점수 가중치, LoRA 어댑터 지원, 선택적 TLS 종료를 포함하여 새 InferenceGatewayConfig CRD로 게이트웨이를 구성합니다. Amazon SageMaker HyperPod 추론을 위한 추론 게이트웨이을(를) 참조하세요.

추론 연산자

  • InferenceEndpointConfig 및의 게이트웨이 통합 JumpStartModel - 두 CRD 모두에 선택적 inferenceGateway 필드를 추가했습니다. CRDs 모델을 공유 게이트웨이로 옵트true인inferenceGateway.enabled하려면 로 설정합니다. 그런 다음 연산자는 해당 모델의 스케줄러 항목을에 추가하여 게이트웨이가 아직 없는 경우 게이트웨이를 InferenceGatewayConfig생성합니다. inferenceGateway.name를 사용하여 게이트웨이를 선택합니다. 동일한 네임스페이스에서 동일한 이름을 지정하는 모델은 하나의 게이트웨이를 공유하며 아직 사용되지 않은 이름은 새 게이트웨이를 생성합니다. 필드가 비어 있으면 연산자가 고유한 이름을 생성하여 모델이 자체 게이트웨이를 가져옵니다. 연산자는에서 게이트웨이의 준비 상태를 미러링합니다status.inferenceGateway. 자세한 내용은 HyperPod 추론 연산자와 통합 단원을 참조하십시오.

  • 의 사용자 지정 포드 주석 InferenceEndpointConfig- 아래에 선택적 podTemplateAnnotations 필드가 추가되었습니다spec.kubernetes. 연산자는 이러한 주석을 기본 포드에 전파하므로 지표 자동 검색과 같은 포드 스크래핑 통합에서 해당 주석을 읽을 수 있습니다.

v2.0.0-eksbuild.2 또는 v3.6으로 업그레이드

구성 스키마 변경 사항:

이 릴리스에서 추가 기능 구성 스키마가 변경되었습니다. inferenceGateway는 새로 추가되고 HyperPod Inference Gateway를 구성합니다. 또한 스키마는를 추가하여 추론 연산자를 독립적으로 켜거나 끌 수 inferenceOperator있는 유연성을 제공합니다. 두 구성 요소 모두 기본적으로 활성화inferenceGateway.enabled되며 및는 로 inferenceOperator.enabled 설정됩니다true. 두 구성 요소 중 하나를 비활성화하려면 false에서 해당 enabled 필드를 로 설정합니다--configuration-values.

EKS 추가 기능 업그레이드:

추론 연산자를 EKS 추가 기능으로 설치한 경우 다음 명령을 v2.0.0-eksbuild.2 사용하여 로 업그레이드합니다.

CLUSTER=EKS_CLUSTER_NAME REGION=REGION ACCOUNT=AWS_ACCOUNT_ID aws eks update-addon \ --cluster-name $CLUSTER --region $REGION \ --addon-name amazon-sagemaker-hyperpod-inference \ --addon-version v2.0.0-eksbuild.2 \ --resolve-conflicts OVERWRITE \ --configuration-values '{ "executionRoleArn": "arn:aws:iam::<ACCOUNT>:role/<EXEC_ROLE>", "tlsCertificateS3Bucket": "<TLS_BUCKET>", "inferenceOperator": { "enabled": true }, "inferenceGateway": { "enabled": true, "serviceAccount": { "roleArn": "arn:aws:iam::<ACCOUNT>:role/<CERT_ISSUER_ROLE>" } }, "keda": { "enabled": true, "auth": { "aws": { "irsa": { "enabled": true, "roleArn": "arn:aws:iam::<ACCOUNT>:role/<KEDA_IRSA_ROLE>" } } } }, "alb": { "enabled": true, "serviceAccount": { "create": true, "roleArn": "arn:aws:iam::<ACCOUNT>:role/<ALB_IRSA_ROLE>" } }, "jumpstartGatedModelDownloadRoleArn": "arn:aws:iam::<ACCOUNT>:role/<JUMPSTART_ROLE>" }'

Helm 업그레이드:

추론 게이트웨이는 Amazon EKS 추가 기능을 통해서만 사용할 수 있습니다. Helm으로 추론 연산자를 관리하고 연산자 전용 기능을 계속 사용하려면 다음 명령을 사용하여 Helm 릴리스를 업그레이드하세요. 추론 연산자와 추론 게이트웨이의 전체 기능을 얻으려면 추가 기능으로 마이그레이션하는 것이 좋습니다.

helm get values -n kube-system hyperpod-inference-operator \ > current-values.yaml cd sagemaker-hyperpod-cli/helm_chart/HyperPodHelmChart/\ charts/inference-operator helm upgrade hyperpod-inference-operator . -n kube-system \ -f current-values.yaml --set image.tag=v3.6 # Verification kubectl get deployment hyperpod-inference-operator-controller-manager \ -n hyperpod-inference-system \ -o jsonpath='{.spec.template.spec.containers[0].image}'

Helm에서 Amazon EKS 추가 기능으로 마이그레이션하려면 섹션을 참조하세요Helm에서 EKS로 추가 기능 마이그레이션.

SageMaker HyperPod 추론 릴리스 정보: HyperPod 추론 Amazon EKS v1.6.0-eksbuild.1 및 추론 연산자 v3.5

릴리스 날짜: 2026년 9월 3일

요약

Amazon SageMaker HyperPod 추론 연산자 v3.5를 사용하면 모델 가중치가 사전 캐시되는 위치를 직접 제어할 수 있습니다. 이제 운영자가 배포에서 파생한 인스턴스 유형을 대상으로 하는 인스턴스 유형에만 의존하는 대신 자체 노드 선호도 규칙을 가중치 캐시에 연결할 수 있습니다. 또한이 릴리스에는 인바운드 요청 볼륨에 대한 두 개의 Prometheus 지표가 추가되며 몇 가지 보안 수정 사항이 포함되어 있습니다.

Amazon SageMaker HyperPod 추론 연산자 v3.5는 SageMaker HyperPod가 지원되는 모든 AWS 리전에서 사용할 수 있습니다.

새로운 기능

  • 모델 가중치 캐싱에 대한 노드 선호도 - InferenceEndpointConfig 또는 modelCacheConfig.weightsCache의 아래에 있는 새 nodeAffinity 필드를 사용하여 캐시 전 모델 가중치를 제한합니다JumpStartModel. 필드는 표준 Kubernetes 노드 선호도 구조를 허용하므로 requiredDuringSchedulingIgnoredDuringExecution 및 preferredDuringSchedulingIgnoredDuringExecution 용어를 가져옵니다. 여러은 OR 의미 체계를 nodeSelectorTerms 제공하므로 노드 풀, 가용 영역 또는 사용자 지정 레이블 세트를 하나의 배포로 대상으로 지정할 수 있습니다.

    연산자는 spec.instanceType 또는에서 파생된 인스턴스 유형을 대상으로 하는 것 외에도 규칙을 적용spec.instanceTypes하므로 가중치는 둘 다를 충족하는 노드에서만 캐시됩니다. 이를 사용하여 가중치 캐시를 단일 가용 영역 또는 특정 HyperPod 인스턴스 그룹에 고정합니다.

  • 인바운드 요청 추적 - 두 가지 새로운 Prometheus 지표는 인바운드 추론 요청 볼륨에 대한 가시성을 제공하므로 총 수요를 측정하고, 감소된 부하를 추적하고, 그에 따라 Auto Scaling 및 용량을 계획할 수 있습니다.

    • model_requests_received_total - 승인 제어 결정 전에 프록시 진입점의 모든 요청을 계산합니다. 여기에는 나중에 삭제되는 요청이 포함됩니다.

    • model_requests_shed_total - 제한을 통해 승인 제어에 의해 거부된 요청을 계산합니다.

v3.5 또는 v1.6.0-eksbuild.1로 업그레이드

Helm 업그레이드:

Helm을 사용하여 추론 연산자를 이미 설치한 경우 다음 명령을 사용하여 업그레이드합니다.

helm get values -n kube-system hyperpod-inference-operator \ > current-values.yaml cd sagemaker-hyperpod-cli/helm_chart/HyperPodHelmChart/\ charts/inference-operator helm upgrade hyperpod-inference-operator . -n kube-system \ -f current-values.yaml --set image.tag=v3.5 # Verification kubectl get deployment hyperpod-inference-operator-controller-manager \ -n hyperpod-inference-system \ -o jsonpath='{.spec.template.spec.containers[0].image}'

EKS 추가 기능 업그레이드:

추론 연산자를 EKS 추가 기능으로 설치한 경우 최신 버전으로 업그레이드합니다.

CLUSTER=EKS_CLUSTER_NAME REGION=REGION aws eks update-addon \ --cluster-name $CLUSTER \ --addon-name amazon-sagemaker-hyperpod-inference \ --addon-version v1.6.0-eksbuild.1 \ --resolve-conflicts OVERWRITE \ --region $REGION

SageMaker HyperPod 추론 릴리스 정보: HyperPod 추론 Amazon EKS v1.5.0-eksbuild.1 및 추론 연산자 v3.4

릴리스 날짜: 2026년 8월 21일

요약

Amazon SageMaker HyperPod Inference Operator v3.4는 CRD를 통해 관리형 사이드카 컨테이너의 리소스 요청 및 제한을 구성할 수 있도록 합니다. 이제 고정 기본값을 사용하는 대신 워크로드에 맞게 역방향 프록시, 지표 수집기 및 데이터 캡처 업로더 컨테이너의 크기를 조정할 수 있습니다.

Amazon SageMaker HyperPod 추론 연산자 v3.4는 SageMaker HyperPod가 지원되는 모든 AWS 리전에서 사용할 수 있습니다.

새로운 기능

  • 구성 가능한 컨테이너 리소스 - 운영자 관리형 사이드카 컨테이너에 대한 리소스 요청 및 제한을 설정합니다. InferenceEndpointConfig 또는에서 새 metricsSidecarResourcesmetricsCollectorResources, 및 s3UploaderResources 필드를 사용합니다JumpStartModel. 이러한 필드를 사용하면 동시성이 높은 배포를 위해 역방향 프록시 메모리를 높이고, 지표 수집기를 조정하고, 데이터 캡처 업로더의 크기를 조정할 수 있습니다. 필드가 설정되면 연산자는 기본 제공 기본값 대신 값을 적용하고 조정 전반에 걸쳐 값을 보존합니다. 각 필드는 해당 컨테이너의 리소스 블록을 완전히 대체하므로 전체 요청 및 제한을 지정합니다.

v3.4 또는 v1.5.0-eksbuild.1로 업그레이드

Helm 업그레이드:

Helm을 사용하여 추론 연산자를 이미 설치한 경우 다음 명령을 사용하여 업그레이드합니다.

helm get values -n kube-system hyperpod-inference-operator \ > current-values.yaml cd sagemaker-hyperpod-cli/helm_chart/HyperPodHelmChart/\ charts/inference-operator helm upgrade hyperpod-inference-operator . -n kube-system \ -f current-values.yaml --set image.tag=v3.4 # Verification kubectl get deployment hyperpod-inference-operator-controller-manager \ -n hyperpod-inference-system \ -o jsonpath='{.spec.template.spec.containers[0].image}'

EKS 추가 기능 업그레이드:

추론 연산자를 EKS 추가 기능으로 설치한 경우 최신 버전으로 업그레이드합니다.

CLUSTER=EKS_CLUSTER_NAME REGION=REGION aws eks update-addon \ --cluster-name $CLUSTER \ --addon-name amazon-sagemaker-hyperpod-inference \ --addon-version v1.5.0-eksbuild.1 \ --resolve-conflicts OVERWRITE \ --region $REGION

SageMaker HyperPod 추론 릴리스 정보: HyperPod 추론 Amazon EKS v1.4.0-eksbuild.1 및 추론 연산자 v3.3

릴리스 날짜: 2026년 8월 4일

요약

Amazon SageMaker HyperPod Inference Operator v3.3에는 호스트-로컬 모델 캐싱이 도입되었습니다. 이렇게 하면 추론 배포를 확장할 때 콜드 스타트 지연 시간이 줄어듭니다. 또한이 릴리스에서는 각 배포에 대해 Application Load Balancer 유휴 제한 시간을 구성할 수 있습니다.

Amazon SageMaker HyperPod 추론 연산자 v3.3은 SageMaker HyperPod가 지원되는 모든 AWS 리전에서 사용할 수 있습니다.

새로운 기능

  • 모델 가중치 및 이미지 캐싱 - 노드-로컬 NVMe 스토리지에서 모델 가중치를 캐싱하고 추론 서버 컨테이너 이미지를 대상 노드로 미리 끌어옵니다. 확장 중에 추가된 포드는 Amazon S3 또는 Amazon FSx에서 가중치를 다운로드하지 않습니다. 콜드 이미지 풀을 기다리지 않습니다. CRDmodelCacheConfig에서를 사용하여 메커니즘을 독립적으로 활성화하거나 두 메커니즘을 함께 활성화합니다. 이 기능을 사용하려면 로컬 NVMe 스토리지가 있는 인스턴스 유형이 필요합니다. 모델 가중치 캐싱 및 이미지 캐싱을(를) 참조하세요.

  • 구성 가능한 ALB 유휴 제한 시간 - Application Load Balancer가 InferenceEndpointConfig 또는에서를 사용하여 유휴 연결을 열어 두는 시간을 제어loadBalancer.idleTimeoutSeconds합니다JumpStartModel. 유효한 값은 1~4000초이고 기본값은 60초입니다. 요청을 반환하는 데 기본값보다 오래 걸리는 배포의 경우이 값을 늘립니다.

버그 수정

  • 라우팅 서비스 누락 - 중단된 초기 조정으로 인해 Kubernetes 라우팅 서비스 없이 배포가 종료될 수 있는 문제를 수정했습니다. 이 서비스는 배포의 수신 및 로드 밸런서를 지원합니다. 엔드포인트는 HTTP 503 응답을 반환한 반면 모든 상태 신호는 정상으로 보고되었습니다. 이제 운영자는 라우팅 서비스가 누락되면 다시 생성합니다.

  • 지능형 라우팅 엔드포인트 등록 - 지능형 라우팅 배포가 수신 경로 조회에 접두사가 없는 이름을 사용하는 문제를 수정했습니다. 모든 조정에서 조회가 실패하여 SageMaker AI 엔드포인트 등록이 완료되지 않았습니다.

  • KV 캐시 구성 - 연산자가에서를 준수하지 enableL1Cache 않거나를 false 로 enableL2Cache 설정하지 않는 문제를 수정했습니다kvCacheSpec.

v3.3 또는 v1.4.0-eksbuild.1로 업그레이드

Helm 업그레이드:

Helm을 사용하여 추론 연산자를 이미 설치한 경우 다음 명령을 사용하여 업그레이드합니다.

helm get values -n kube-system hyperpod-inference-operator \ > current-values.yaml cd sagemaker-hyperpod-cli/helm_chart/HyperPodHelmChart/\ charts/inference-operator helm upgrade hyperpod-inference-operator . -n kube-system \ -f current-values.yaml --set image.tag=v3.3 # Verification kubectl get deployment hyperpod-inference-operator-controller-manager \ -n hyperpod-inference-system \ -o jsonpath='{.spec.template.spec.containers[0].image}'

EKS 추가 기능 업그레이드:

추론 연산자를 EKS 추가 기능으로 설치한 경우 최신 버전으로 업그레이드합니다.

CLUSTER=EKS_CLUSTER_NAME REGION=REGION aws eks update-addon \ --cluster-name $CLUSTER \ --addon-name amazon-sagemaker-hyperpod-inference \ --addon-version v1.4.0-eksbuild.1 \ --resolve-conflicts OVERWRITE \ --region $REGION

SageMaker HyperPod 추론 릴리스 정보: HyperPod 추론 Amazon EKS v1.3.0-eksbuild.1 및 추론 연산자 v3.2

릴리스 날짜: 2026년 6월 12일

요약

Inference Operator v3.2를 사용하면 고객은 동시 로드 시 토큰당 지연 시간을 예측할 수 있는 긴 컨텍스트 LLMs(예: Llama 3.3 70B)을 배포할 수 있습니다. 이 릴리스에는 컴퓨팅 바운드 사전 채우기 단계와 memory-bandwidth-bound드 디코딩 단계를 별도의 GPU 풀로 분리하고 GPU-Direct RDMA를 사용하여 EFA를 통해 KV 캐시를 전송하는 DPD(Disaggregated Prefill and Decode)가 도입되었습니다. DPD는 테일 토큰당 지연 시간을 줄이고 처리량을 늘리며 사전 채우기 및 디코딩 용량을 독립적으로 확장할 수 있습니다. 이 릴리스에는 DPD 외에도 다른 버그 수정이 포함되어 있습니다.

주요 기능

분해된 사전 채우기 및 디코딩(DPD)

  • 분해된 추론을 활성화하는 새 pdSpec 필드를 InferenceEndpointConfig CRD에 추가했습니다. pdSpec이 설정되면 연산자는 별도의 프리필러 및 디코더 포드를 프로비저닝하고, DPD 라우터를 통해 함께 연결하며, GPU-Direct RDMA를 사용하는 NIXL 및 EFA를 통해 LMCache를 사용하여 KV 캐시를 전송합니다. 구성 가능한 필드의 예는 다음과 같습니다(더 많은 구성이 사용 설명서를 확인할 수 있음).

    • routingThreshold - 요청이 분리된 경로를 사용하는 토큰 길이 임계값입니다. 임계값 미만에서는 요청이 프리필러를 우회하고 디코더로 직접 이동합니다.

    • prefillSpec.args 및 decodingSpec.args - 시작 worker.args 시에 병합된 역할별 vLLM 플래그입니다.

    • prefillSpec.replicas 및 decodingSpec.replicas - 워크로드의 입력 및 출력 길이 분포에 맞게 사전 채우기 및 디코딩 용량을 독립적으로 조정합니다.

  • 사전 조건

    • DPD 엔드포인트를 배포하려면 클러스터 노드가 RDMA 읽기 및 쓰기를 통해 EFA를 지원하고 고대역폭 node-to-node 통신을 위해 동일한 가용 영역에 있어야 합니다.

    • 권장 인스턴스 패밀리: ml.p5.48xlarge, ml.p5e.48xlarge, ml.p5en.48xlarge, ml.p6-b200.48xlarge, ml.p6-b300.48xlarge.

버그 수정

  • x86 노드에서 운영자 예약 - 운영자 배포는 이제 nodeAffinity를 사용하여 amd64 Linux 노드에서만 예약합니다.

  • 기타 마이너 및 보안 수정 사항이 포함되어 있습니다.

v3.2 또는 v1.3.0-eksbuild.1로 업그레이드

Helm 업그레이드:

Helm을 통해 추론 연산자를 이미 설치한 경우 다음 명령을 사용하여 업그레이드합니다.

helm get values -n kube-system hyperpod-inference-operator \ > current-values.yaml cd sagemaker-hyperpod-cli/helm_chart/HyperPodHelmChart/\ charts/inference-operator helm upgrade hyperpod-inference-operator . -n kube-system \ -f current-values.yaml --set image.tag=v3.2 # Verification kubectl get deployment hyperpod-inference-operator-controller-manager \ -n hyperpod-inference-system \ -o jsonpath='{.spec.template.spec.containers[0].image}'

EKS 추가 기능 업그레이드:

추론 연산자를 EKS 추가 기능으로 설치한 경우 최신 버전으로 업그레이드합니다.

CLUSTER=EKS_CLUSTER_NAME REGION=REGION aws eks update-addon \ --cluster-name $CLUSTER \ --addon-name amazon-sagemaker-hyperpod-inference \ --addon-version v1.3.0-eksbuild.1 \ --resolve-conflicts OVERWRITE \ --region $REGION

SageMaker HyperPod 추론 릴리스 정보: HyperPod 추론 Amazon EKS v1.2.0-eksbuild.1 및 추론 연산자 v3.1.2

릴리스 날짜: 2026년 5월 6일

요약

추론 연산자 v3.1.2는 엔드포인트 트래픽 로깅을 위한 추론 데이터 캡처, 직접 모델 배포를 위한 HuggingFace Hub 통합, 사용자 지정 도메인을 위한 Route 53 DNS 관리, 콜드 스타트 지연 시간을 줄이기 위한 로컬 NVMe 모델 배포, IRSA를 지원하는 사용자 지정 서비스 계정을 도입합니다.

새로운 기능

  • 추론 데이터 캡처 - SageMaker AI 엔드포인트, 로드 밸런서(ALB 액세스 로그) 및 모델 포드의 세 가지 캡처 지점에서 입력 및 출력을 기록합니다. CRDdataCapture에서를 통해 모든 조합을 활성화합니다. HyperPod에서 추론을 위한 데이터 캡처을(를) 참조하세요.

  • HuggingFace 모델 소스 - S3 또는 FSx에 사전 스테이징하지 않고 HuggingFace Hub에서 직접 모델을 배포합니다. 를 통한 게이트 모델tokenSecretRef,를 통한 개정 고정 commitSHA및 토큰 격리를 지원합니다. vLLM, TGI 및 SGLang 런타임과 호환됩니다. kubectl을 사용하여 Amazon S3, Amazon FSx 또는 Hugging Face Hub에서 모델 배포을(를) 참조하세요.

  • Route 53 DNS 관리 -를 통해 사용자 지정 도메인에 대한 DNS 레코드를 자동으로 생성하고 관리합니다dnsConfig. HyperPod 추론을 위한 사용자 지정 인증서 및 Route 53 DNS 관리을(를) 참조하세요.

  • 로컬 NVMe 모델 배포 -를 통해 노드-로컬 NVMe 스토리지에서 모델 가중치를 로드modelSourceType: kubernetesVolume하여 콜드 스타트 지연 시간을 줄입니다. S3로의 대체를 지원합니다. kubectl을 사용하여 로컬 NVMe 스토리지에서 모델 배포을(를) 참조하세요.

  • 사용자 지정 서비스 계정 - IRSA 지원을 통해 사용자 지정 ServiceAccounts 할당하여를 통해 포드를 추론합니다spec.kubernetes.serviceAccountName.

버그 수정

  • 태그 전파 -의 사용자 정의 태그InferenceEndpointConfig가 이제 SageMakerEndpointRegistration CRD 및 다운스트림 SageMaker AI 리소스에 올바르게 전파됩니다. 이전에는 엔드포인트 등록 또는 업데이트 중에 태그가 전달되지 않았습니다.

  • 자동 크기 조정 복제본 보존 - InferenceEndpointConfig 또는 JumpStartModel CR을 업데이트하면 복제본 수가 사양 값으로 재설정되어 현재 HPA/KEDA 관리형 복제본 수가 재정의되는 문제를 수정했습니다. 이제 연산자는 CR 업데이트 중에 활성 복제본 수를 유지합니다.

  • CRD 검증 자동 크기 조정 - 후행 경로 세그먼트가 잘못 필요하여 KEDA가 AMP 워크스페이스 URL/api/v1/query에 추가될 때 404 오류가 발생하는 prometheusTrigger.serverAddress 검증 정규식을 수정했습니다.

  • 인증서 교체 - 운영자 포드를 다시 시작한 후 사용자 지정 인증서 교체가 ALB로 전파되지 않는 문제를 수정했습니다.

v3.1.2 또는 v1.2.0-eksbuild.1로 업그레이드

Helm 업그레이드:

Helm을 통해 추론 연산자를 이미 설치한 경우 다음 명령을 사용하여 업그레이드합니다.

helm get values -n kube-system hyperpod-inference-operator \ > current-values.yaml cd sagemaker-hyperpod-cli/helm_chart/HyperPodHelmChart/\ charts/inference-operator helm upgrade hyperpod-inference-operator . -n kube-system \ -f current-values.yaml --set image.tag=v3.1.2 # Verification kubectl get deployment hyperpod-inference-operator-controller-manager \ -n hyperpod-inference-system \ -o jsonpath='{.spec.template.spec.containers[0].image}'

EKS 추가 기능 업그레이드:

추론 연산자를 EKS 추가 기능으로 설치한 경우 최신 버전으로 업그레이드합니다.

먼저 hyperpodClusterArn가 이미 추가 기능 구성에 있는지 확인합니다.

CLUSTER=EKS_CLUSTER_NAME REGION=REGION aws eks describe-addon \ --cluster-name $CLUSTER \ --addon-name amazon-sagemaker-hyperpod-inference \ --region $REGION \ --query 'addon.configurationValues' --output text | jq .

hyperpodClusterArn가 출력에 있는 경우 다음 명령을 실행하여 업그레이드합니다.

aws eks update-addon \ --cluster-name $CLUSTER \ --addon-name amazon-sagemaker-hyperpod-inference \ --addon-version v1.2.0-eksbuild.1 \ --resolve-conflicts OVERWRITE \ --region $REGION

hyperpodClusterArn이 없는 경우 현재 구성을 가져와 추가하고 업그레이드합니다.

HP_ARN=HYPERPOD_CLUSTER_ARN CURRENT_CONFIG=$(aws eks describe-addon \ --cluster-name $CLUSTER \ --addon-name amazon-sagemaker-hyperpod-inference \ --region $REGION \ --query 'addon.configurationValues' --output text) # Add hyperpodClusterArn to the configuration NEW_CONFIG=$(echo "$CURRENT_CONFIG" | jq --arg arn "$HP_ARN" \ '. + {hyperpodClusterArn: $arn}') aws eks update-addon \ --cluster-name $CLUSTER \ --addon-name amazon-sagemaker-hyperpod-inference \ --addon-version v1.2.0-eksbuild.1 \ --configuration-values "$NEW_CONFIG" \ --resolve-conflicts OVERWRITE \ --region $REGION

모델을 배포하기 전에 추가 기능이 활성화될 때까지 기다립니다.

SageMaker HyperPod 추론 릴리스 정보: 추론 연산자 v3.1

릴리스 날짜: 2026년 4월 3일

요약

추론 연산자 v3.1에는 사용자 지정 Kubernetes 포드 구성, 사용자 지정 인증서 지원 및 포드당 요청 제한이 도입되었습니다.

주요 기능

  • 사용자 지정 Kubernetes 포드 구성 - 사용자가 추론 포드 구성을 사용자 지정할 수 있도록 InferenceEndpointConfig CRD에 새 kubernetes 필드를 추가했습니다.

    • 사용자 지정 init 컨테이너 - 추론 서버가 시작되기 전에 사용자 정의 init 컨테이너를 실행합니다(예: 캐시 워밍, GDS 설정). Init 컨테이너는 운영자의 프리페치 컨테이너 뒤에 주입됩니다.

    • 사용자 지정 볼륨 - 포드 사양에 볼륨(emptyDir, hostPathconfigMap, 등)을 추가합니다.이 볼륨은를 통해 init 컨테이너에서 참조할 수 있습니다volumeMounts.

    • 사용자 지정 스케줄러 이름 - 포드 배치를 위한 사용자 지정 Kubernetes 스케줄러를 지정합니다.

  • 사용자 지정 인증서 -를 통해 구성된 운영자 생성 자체 서명 인증서 대신 추론 엔드포인트에 자체 ACM 인증서를 사용합니다customCertificateConfig. 공개적으로 신뢰할 수 있는 ACM 인증서, AWS 프라이빗 CA 인증서 및 외부 CAs에서 가져온 인증서를 지원합니다. 운영자는 인증서 상태를 모니터링하고 자동 갱신 감지를 지원합니다.

  • 요청 제한 - 다음 구성 가능한 필드를 Worker사용하여의 새 RequestLimits 구성을 통해 포드당 요청 처리를 제어합니다.

    • maxConcurrentRequests - 포드당 최대 동시 진행 중 요청 수입니다.

    • maxQueueSize - 거부하기 전에 동시성 한도에 도달하면 대기열에 대한 요청입니다.

    • overflowStatusCode - 제한을 초과하면 HTTP 상태 코드가 반환됩니다(기본값: 429).

사전 조건 및 업그레이드 지침을 포함한 자세한 내용은 아래 섹션을 참조하세요.

사전 조건

사용자 지정 인증서 기능을 사용하려면 추론 연산자 실행 역할에 다음 권한을 추가합니다.

{ "Sid": "ACMCertificateAccess", "Effect": "Allow", "Action": [ "acm:DescribeCertificate", "acm:GetCertificate" ], "Resource": "arn:aws:acm:*:*:certificate/*" }

v3.1로 업그레이드

Helm을 통해 추론 연산자를 이미 설치한 경우 다음 명령을 사용하여 업그레이드합니다.

helm get values -n kube-system hyperpod-inference-operator \ > current-values.yaml cd sagemaker-hyperpod-cli/helm_chart/HyperPodHelmChart/\ charts/inference-operator helm upgrade hyperpod-inference-operator . -n kube-system \ -f current-values.yaml --set image.tag=v3.1 # Verification kubectl get deployment hyperpod-inference-operator-controller-manager \ -n hyperpod-inference-system \ -o jsonpath='{.spec.template.spec.containers[0].image}'

SageMaker HyperPod 추론 릴리스 정보: 추론 연산자 v3.0

릴리스 날짜: 2026년 2월 23일

요약

추론 연산자 3.0에는 간소화된 수명 주기 관리를 위한 EKS 추가 기능 통합, 세분화된 일정 제어를 위한 노드 선호도 지원, 향상된 리소스 태그 지정이 도입되었습니다. 제공된 마이그레이션 스크립트를 사용하여 기존 Helm 기반 설치를 EKS 추가 기능으로 마이그레이션할 수 있습니다. 업그레이드하기 전에 새 태그 지정 권한으로 추론 연산자 실행 역할을 업데이트합니다.

주요 기능

  • EKS 추가 기능 통합 - 간소화된 설치 환경을 갖춘 엔터프라이즈급 수명 주기 관리

  • 노드 선호도 - 스팟 인스턴스를 제외하거나, 가용 영역을 선호하거나, 사용자 지정 레이블이 있는 노드를 대상으로 지정하기 위한 세분화된 예약 제어

사전 조건, 업그레이드 지침 및 마이그레이션 지침을 포함한 자세한 내용은 아래 섹션을 참조하세요.

사전 조건

Helm 버전을 3.0으로 업그레이드하기 전에 고객은 추론 연산자 실행 역할에 태그 지정 권한을 추가해야 합니다. 리소스 태그 지정 및 보안 개선의 일환으로 추론 연산자는 이제 ALB, S3 및 ACM 리소스에 태그를 지정합니다. 이 개선 사항에는 추론 연산자 실행 역할에 대한 추가 권한이 필요합니다. 추론 연산자 실행 역할에 다음 권한을 추가합니다.

{ "Sid": "CertificateTagginPermission", "Effect": "Allow", "Action": [ "acm:AddTagsToCertificate" ], "Resource": "arn:aws:acm:*:*:certificate/*", }, { "Sid": "S3PutObjectTaggingAccess", "Effect": "Allow", "Action": [ "s3:PutObjectTagging" ], "Resource": [ "arn:aws:s3:::<TLS_BUCKET>/*" # Replace * with your TLS bucket ] }

v3.0으로 업그레이드

Helm을 통해 추론 연산자를 이미 설치한 경우 다음 명령을 사용하여 업그레이드합니다.

helm get values -n kube-system hyperpod-inference-operator \ > current-values.yaml cd sagemaker-hyperpod-cli/helm_chart/HyperPodHelmChart/\ charts/inference-operator helm upgrade hyperpod-inference-operator . -n kube-system \ -f current-values.yaml --set image.tag=v3.0 # Verification kubectl get deployment hyperpod-inference-operator-controller-manager \ -n hyperpod-inference-system \ -o jsonpath='{.spec.template.spec.containers[0].image}'

Helm에서 EKS로 추가 기능 마이그레이션

3.0 버전 이전의 Helm을 통해 추론 연산자를 설치하는 경우 EKS 추가 기능으로 마이그레이션하여 추론 연산자에 대해 릴리스될 새 기능에 대한 업데이트를 적시에 받는 것이 좋습니다. 이 스크립트는 SageMaker HyperPod 추론 연산자를 Helm 기반 설치에서 EKS 추가 기능 설치로 마이그레이션합니다.

개요: 스크립트는 클러스터 이름과 리전을 파라미터로 사용하고, 기존 Helm 설치 구성을 검색하고, EKS 추가 기능 배포로 마이그레이션합니다. 추론 연산자, ALB 컨트롤러 및 KEDA 연산자에 대한 새 IAM 역할을 생성합니다.

추론 연산자를 마이그레이션하기 전에 스크립트는 필수 종속성(S3 CSI 드라이버, FSx CSI 드라이버, cert-manager 및 metrics-server)이 존재하는지 확인합니다. 존재하지 않는 경우 추가 기능으로 배포됩니다.

추론 연산자 추가 기능 마이그레이션이 완료되면 스크립트는 원래 추론 연산자 Helm 차트를 통해 설치된 경우 S3, FSx 및 기타 종속성(ALB, KEDA, cert-manager, metrics-server)도 마이그레이션합니다. --skip-dependencies-migration를 사용하여 S3 CSI 드라이버, FSx CSI 드라이버, cert-manager 및 metrics-server에 대해이 단계를 건너뜁니다. ALB 및 KEDA는 추론 연산자와 동일한 네임스페이스에 추가 기능의 일부로 설치되며 추론 연산자 추가 기능의 일부로 마이그레이션됩니다.

중요

마이그레이션 중에 새 모델은 마이그레이션이 완료될 때까지 배포되지 않으므로 배포하지 마십시오. 추론 연산자 추가 기능이 ACTIVE 상태가 되면 새 모델을 배포할 수 있습니다. 마이그레이션 시간은 일반적으로 15~20분이 소요되며 현재 몇 개의 모델만 배포된 경우 30분 이내에 완료될 수 있습니다.

마이그레이션 사전 조건:

  • AWS CLI 적절한 자격 증명으로 구성됨

  • EKS 클러스터에 대한 액세스 권한으로 구성된 kubectl

  • Helm 설치됨

  • hyperpod-inference-operator의 기존 Helm 설치

참고

이미 실행 중인 엔드포인트는 마이그레이션 프로세스 중에 중단되지 않습니다. 기존 엔드포인트는 마이그레이션 전반에 걸쳐 중단 없이 트래픽을 계속 제공합니다.

마이그레이션 스크립트 가져오기:

git clone https://github.com/aws/sagemaker-hyperpod-cli.git cd sagemaker-hyperpod-cli/helm_chart/HyperPodHelmChart/\ charts/inference-operator/migration

사용량:

./helm_to_addon.sh [OPTIONS] \ --cluster-name <cluster-name> (Required) \ --region <region> (Required) \ --helm-namespace kube-system (Optional) \ --auto-approve (Optional) \ --skip-dependencies-migration (Optional) \ --s3-mountpoint-role-arn <s3-mountpoint-role-arn> (Optional) \ --fsx-role-arn <fsx-role-arn> (Optional)

옵션:

  • --cluster-name NAME – EKS 클러스터 이름(필수)

  • --region REGION – AWS 리전(필수)

  • --helm-namespace NAMESPACE - 차트 Helm이 설치된 네임스페이스(기본값: kube-system)(선택 사항)

  • --s3-mountpoint-role-arn ARN – S3 Mountpoint CSI 드라이버 IAM 역할 ARN(선택 사항)

  • --fsx-role-arn ARN – FSx CSI 드라이버 IAM 역할 ARN(선택 사항)

  • --auto-approve -이 플래그가 활성화된 경우 확인 프롬프트를 건너뜁니다. step-by-step 및 auto-approve는 상호 배타적--auto-approve입니다.이 제공된 경우 지정하지 마십시오--step-by-step(선택 사항).

  • --step-by-step - 검토를 위해 각 주요 단계 후에 일시 중지합니다. --auto-approve이 이미 추가된 경우 언급해서는 안 됩니다(선택 사항).

  • --skip-dependencies-migration - Helm에 설치된 종속성을 추가 기능으로 마이그레이션하지 않습니다. 종속성의 경우 추론 연산자 차트 Helm을 통해 설치되지 않았거나 별도로 관리하려는 경우(선택 사항)

예:

기본 마이그레이션(종속성 마이그레이션):

./helm_to_addon.sh \ --cluster-name my-cluster \ --region us-east-1

프롬프트 없이 자동 승인:

./helm_to_addon.sh \ --cluster-name my-cluster \ --region us-east-1 \ --auto-approve

FSx, S3 탑재 지점, 인증서 관리자 및 지표 서버에 대한 종속성 마이그레이션 건너뛰기:

./helm_to_addon.sh \ --cluster-name my-cluster \ --region us-east-1 \ --skip-dependencies-migration

기존 S3 및 FSx IAM 역할을 제공합니다.

./helm_to_addon.sh \ --cluster-name my-cluster \ --region us-east-1 \ --s3-mountpoint-role-arn arn:aws:iam::123456789012:role/s3-csi-role \ --fsx-role-arn arn:aws:iam::123456789012:role/fsx-csi-role

백업 위치:

백업은에 저장됩니다. /tmp/hyperpod-migration-backup-<timestamp>/

백업을 통해 안전한 마이그레이션 및 복구가 가능합니다.

  • 실패 시 롤백 - 마이그레이션에 실패하면 스크립트는 백업된 구성을 사용하여 클러스터를 마이그레이션 전 상태로 자동 복원할 수 있습니다.

  • 감사 추적 - 문제 해결 및 규정 준수를 위해 마이그레이션 전에 존재했던 내용에 대한 전체 레코드를 제공합니다.

  • 구성 참조 - 마이그레이션 전 구성과 마이그레이션 후 구성을 비교할 수 있습니다.

  • 수동 복구 - 필요한 경우 백업 디렉터리에서 특정 리소스를 수동으로 검사하고 복원할 수 있습니다.

롤백:

마이그레이션에 실패하면 이전 상태를 복원하기 위해 롤백을 시작하기 전에 스크립트에 사용자 확인 메시지가 표시됩니다.

SageMaker HyperPod 추론 릴리스 정보: 추론 연산자 v2.3

새로운 기능

이 릴리스에서는 배포 구성 유연성을 높이기 위해 사용자 지정 리소스 정의(CRDs)에 새로운 선택적 필드를 도입합니다.

Features

  • 다중 인스턴스 유형

    • 배포 안정성 향상 - 기본 옵션에 용량이 부족한 경우 대체 인스턴스 유형으로 자동 장애 조치를 통해 다중 인스턴스 유형 구성 지원

    • 지능형 리소스 예약 - Kubernetes 노드 선호도를 사용하여 인스턴스 유형의 우선 순위를 지정하는 동시에 선호하는 리소스를 사용할 수 없는 경우에도 배포를 보장합니다.

    • 비용 및 성능 최적화 - 인스턴스 유형 기본 설정을 유지하고 클러스터 변동 중에 용량 관련 장애를 방지합니다.

버그 수정

이제 invocationEndpoint 사양의 필드에 대한 변경 사항이 적용됩니다InferenceEndpointConfig.

  • invocationEndpoint 필드가 패치되거나 업데이트되면 , Load BalancerIngress, SageMakerEndpointRegistration및 SageMaker 엔드포인트와 같은 종속 리소스가 정규화로 업데이트됩니다.

  • invocationEndpoint 제공된 값은 InferenceEndpointConfig 사양 자체에 있는 그대로 저장됩니다. 이 값을 사용하여 Load Balancer 생성하고 활성화된 경우 SageMaker 엔드포인트를 생성하면 앞에 슬래시가 하나 있도록 정규화됩니다.

    • v1/chat/completions는 Ingress, AWS Load Balancer 및 SageMaker 엔드포인트에 /v1/chat/completions 대해 로 정규화됩니다. 의 경우 사양에 로 SageMakerEndpointRegistration표시됩니다v1/chat/completions.

    • ///invoke는 Ingress, AWS Load Balancer 및 SageMaker 엔드포인트에 /invoke 대해 로 정규화됩니다. 의 경우 사양에 로 SageMakerEndpointRegistration표시됩니다invoke.

Helm 설치:

팔로우: https://github.com/aws/sagemaker-hyperpod-cli/tree/main/helm_chart

추론 연산자만 설치하는 데 중점을 두는 경우 1단계, 즉 후에 Set Up Your Helm Environment를 수행합니다cd HyperPodHelmChart/charts/inference-operator. 추론 연산자 차트 디렉터리 자체에 있으므로 명령에서가 표시되는 모든 곳에서를 . 로 바helm_chart/HyperPodHelmChart꿉니다.

이미 설치된 경우 연산자를 v2.3으로 업그레이드합니다.

cd sagemaker-hyperpod-cli/helm_chart/HyperPodHelmChart/\ charts/inference-operator helm get values -n kube-system hyperpod-inference-operator \ > current-values.yaml helm upgrade hyperpod-inference-operator . \ -n kube-system \ -f current-values.yaml \ --set image.tag=v2.3