View a markdown version of this page

Versionshinweise zu Amazon SageMaker HyperPod Inference - Amazon SageMaker KI

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Versionshinweise zu Amazon SageMaker HyperPod Inference

Dieses Thema behandelt Versionshinweise, in denen Updates, Problembehebungen und neue Funktionen für Amazon SageMaker HyperPod Inference nachverfolgt werden. SageMaker HyperPod Inference ermöglicht es Ihnen, Modelle für maschinelles Lernen auf Ihren HyperPod Clustern mit Zuverlässigkeit auf Unternehmensebene bereitzustellen und zu skalieren. Allgemeine Versionen, Updates und Verbesserungen der SageMaker HyperPod Amazon-Plattform finden Sie unter. SageMaker HyperPod Versionshinweise von Amazon

Informationen zu den Funktionen und Bereitstellungsoptionen von SageMaker HyperPod Inference finden Sie unterModelle auf Amazon bereitstellen SageMaker HyperPod.

SageMaker HyperPod Versionshinweise zu Inference: v3.2

Datum der Veröffentlichung: 12. Juni 2026

Übersicht

Inference Operator v3.2 ermöglicht es Kunden, LLMs mit langem Kontext (wie Llama 3.3 70B) mit vorhersehbarer Latenz pro Token bei gleichzeitiger Last bereitzustellen. In der Version wird Disaggregated Prefill and Decode (DPD) eingeführt, das die rechnergebundene Vorfüllphase und die speicherbandbreitengebundene Decodierungsphase auf unterschiedliche GPU-Pools aufteilt und den KV-Cache zwischen ihnen über EFA mit RDMA überträgt. GPU-Direct DPD reduziert die Latenz pro Token, erhöht den Durchsatz und ermöglicht es Ihnen, die Kapazität zum Vorfüllen und Dekodieren unabhängig voneinander zu skalieren. Neben DPD enthalten wir in dieser Version noch weitere Bugfixes.

Die wichtigsten Funktionen

Disaggregiertes Vorfüllen und Dekodieren (DPD)

  • Der InferenceEndpointConfig CRD wurde ein neues pdSpec Feld hinzugefügt, das disaggregierte Inferenz ermöglicht. Wenn diese pdSpec Option gesetzt ist, stellt der Operator separate Prefiller- und Decoder-Pods bereit, verbindet sie über den DPD-Router miteinander und überträgt den KV-Cache zwischen ihnen mithilfe von LMCache über NIXL und EFA mit RDMA. GPU-Direct Zu den konfigurierbaren Feldern gehören beispielsweise (weitere Konfigurationsmöglichkeiten finden Sie im Benutzerhandbuch):

    • routingThreshold— Token-length Schwellenwert, ab dem Anfragen den disaggregierten Pfad verwenden. Unterhalb des Schwellenwerts umgehen Anfragen den Prefiller und werden direkt an den Decoder weitergeleitet.

    • prefillSpec.argsund decodingSpec.args — Per-role vLLM-Flags wurden beim Start zusammengeführt. worker.args

    • prefillSpec.replicasund decodingSpec.replicas — Skalieren Sie die Kapazität zum Vorfüllen und Dekodieren unabhängig voneinander, um sie an die Eingabe- und Ausgabelängenverteilung Ihres Workloads anzupassen.

  • Voraussetzung

    • Für die Bereitstellung von DPD-Endpunkten müssen Ihre Clusterknoten EFA mit RDMA-Lese- und Schreibzugriff unterstützen und sich in derselben Availability Zone befinden, um eine Node-zu-Knoten-Kommunikation mit hoher Bandbreite zu ermöglichen.

    • Empfohlene Instance-Familien:,,,,. ml.p5.48xlarge ml.p5e.48xlarge ml.p5en.48xlarge ml.p6-b200.48xlarge ml.p6-b300.48xlarge

Fehlerbehebungen

  • Terminplanung für Operatoren auf x86-Knoten — Das Operator-Deployment wird jetzt nur noch nodeAffinity für die Planung auf AMD64-Linux-Knoten verwendet.

  • Wir fügen weitere kleinere und sicherheitsrelevante Korrekturen hinzu.

Führen Sie ein Upgrade auf Version 3.2 durch

Aktualisierung des Helms:

Wenn Sie den Inferenzoperator bereits über Helm installiert haben, verwenden Sie für das Upgrade die folgenden Befehle:

helm get values -n kube-system hyperpod-inference-operator \ > current-values.yaml cd sagemaker-hyperpod-cli/helm_chart/HyperPodHelmChart/\ charts/inference-operator helm upgrade hyperpod-inference-operator . -n kube-system \ -f current-values.yaml --set image.tag=v3.2 # Verification kubectl get deployment hyperpod-inference-operator-controller-manager \ -n hyperpod-inference-system \ -o jsonpath='{.spec.template.spec.containers[0].image}'

Add-on EKS-Aktualisierung:

Wenn Sie den Inferenzoperator als EKS installiert haben Add-on, führen Sie ein Upgrade auf die neueste Version durch:

CLUSTER=EKS_CLUSTER_NAME REGION=REGION aws eks update-addon \ --cluster-name $CLUSTER \ --addon-name amazon-sagemaker-hyperpod-inference \ --addon-version v1.3.0-eksbuild.1 \ --resolve-conflicts OVERWRITE \ --region $REGION

SageMaker HyperPod Versionshinweise zu Inference: v3.1.2

Datum der Veröffentlichung: 6. Mai 2026

Übersicht

Inference Operator v3.1.2 bietet die Erfassung von Inferenzdaten zur Protokollierung des Endpunktverkehrs, die HuggingFace Hub-Integration für die direkte Modellbereitstellung, das Route 53-DNS-Management für benutzerdefinierte Domänen, die lokale NVMe-Modellbereitstellung für reduzierte Kaltstartlatenz und benutzerdefinierte Dienstkonten mit IRSA-Unterstützung.

Neue Funktionen

Fehlerbehebungen

  • Tag-Propagation — Die User-defined aktivierten Tags werden InferenceEndpointConfig jetzt korrekt an das SageMakerEndpointRegistration CRD und die nachgelagerten KI-Ressourcen weitergegeben. SageMaker Bisher wurden Tags bei der Erstellung oder Aktualisierung der Endpunktregistrierung nicht weitergegeben.

  • Autoscaling Replica Preservation — Es wurde ein Problem behoben, bei dem beim Aktualisieren eines InferenceEndpointConfig oder JumpStartModel CR die Replikatanzahl auf den Spezifikationswert zurückgesetzt und die aktuelle Replikatanzahl überschrieben wurde. HPA/KEDA-managed Der Operator behält jetzt die Anzahl der aktiven Replikate bei, wenn CR-Updates durchgeführt werden.

  • Automatische CRD-Validierung — Es wurde ein Regex für die prometheusTrigger.serverAddress Überprüfung behoben, der fälschlicherweise ein abschließendes Pfadsegment erforderte und 404-Fehler verursachte, wenn KEDA an die AMP-Workspace-URL angehängt wurde. /api/v1/query

  • Zertifikatsrotation — Die benutzerdefinierte Zertifikatsrotation wurde behoben, die nach einem Neustart des Operator-Pods nicht an ALB weitergegeben wurde.

Führen Sie ein Upgrade auf Version 3.1.2 durch

Aktualisierung des Helms:

Wenn Sie den Inferenzoperator bereits über Helm installiert haben, verwenden Sie für das Upgrade die folgenden Befehle:

helm get values -n kube-system hyperpod-inference-operator \ > current-values.yaml cd sagemaker-hyperpod-cli/helm_chart/HyperPodHelmChart/\ charts/inference-operator helm upgrade hyperpod-inference-operator . -n kube-system \ -f current-values.yaml --set image.tag=v3.1 # Verification kubectl get deployment hyperpod-inference-operator-controller-manager \ -n hyperpod-inference-system \ -o jsonpath='{.spec.template.spec.containers[0].image}'

Add-on EKS-Upgrade:

Wenn Sie den Inferenzoperator als EKS installiert haben Add-on, führen Sie ein Upgrade auf die neueste Version durch.

Überprüfen Sie zunächst, ob Ihre Zusatzkonfiguration bereits vorhanden hyperpodClusterArn ist:

CLUSTER=EKS_CLUSTER_NAME REGION=REGION aws eks describe-addon \ --cluster-name $CLUSTER \ --addon-name amazon-sagemaker-hyperpod-inference \ --region $REGION \ --query 'addon.configurationValues' --output text | jq .

Wenn hyperpodClusterArn es in der Ausgabe vorhanden ist, führen Sie den folgenden Befehl aus, um das Upgrade durchzuführen:

aws eks update-addon \ --cluster-name $CLUSTER \ --addon-name amazon-sagemaker-hyperpod-inference \ --addon-version v1.2.0-eksbuild.1 \ --resolve-conflicts OVERWRITE \ --region $REGION

Wenn nicht hyperpodClusterArn vorhanden, rufen Sie die aktuelle Konfiguration ab, fügen Sie sie hinzu und führen Sie ein Upgrade durch:

HP_ARN=HYPERPOD_CLUSTER_ARN CURRENT_CONFIG=$(aws eks describe-addon \ --cluster-name $CLUSTER \ --addon-name amazon-sagemaker-hyperpod-inference \ --region $REGION \ --query 'addon.configurationValues' --output text) # Add hyperpodClusterArn to the configuration NEW_CONFIG=$(echo "$CURRENT_CONFIG" | jq --arg arn "$HP_ARN" \ '. + {hyperpodClusterArn: $arn}') aws eks update-addon \ --cluster-name $CLUSTER \ --addon-name amazon-sagemaker-hyperpod-inference \ --addon-version v1.2.0-eksbuild.1 \ --configuration-values "$NEW_CONFIG" \ --resolve-conflicts OVERWRITE \ --region $REGION

Warten Sie, bis das Add-on aktiv wird, bevor Sie Modelle bereitstellen.

SageMaker HyperPod Versionshinweise zu Inference: v3.1

Datum der Veröffentlichung: 3. April 2026

Übersicht

Inference Operator v3.1 führt eine benutzerdefinierte Kubernetes-Pod-Konfiguration, benutzerdefinierte Zertifikatsunterstützung und Anforderungslimits pro Pod ein.

Die wichtigsten Funktionen

  • Benutzerdefinierte Kubernetes-Pod-Konfiguration — Der InferenceEndpointConfig CRD wurde ein neues kubernetes Feld hinzugefügt, mit dem Benutzer die Inferenz-Pod-Konfigurationen anpassen können:

    • Benutzerdefinierte Init-Container — Führen Sie benutzerdefinierte Init-Container aus, bevor der Inferenzserver gestartet wird (z. B. Cache-Warming, GDS-Setup). Init-Container werden nach dem Prefetch-Container des Operators eingefügt.

    • Benutzerdefinierte Volumes — Fügen Sie der Pod-Spezifikation zusätzliche Volumes (emptyDirhostPathconfigMap,, usw.) hinzu, auf die Init-Container über verweisen können. volumeMounts

    • Benutzerdefinierter Scheduler-Name — Geben Sie einen benutzerdefinierten Kubernetes-Scheduler für die Pod-Platzierung an.

  • Benutzerdefinierte Zertifikate — Verwenden Sie Ihre eigenen ACM-Zertifikate für Inferenzendpunkte anstelle von vom Betreiber generierten, selbstsignierten Zertifikaten, konfiguriert über. customCertificateConfig Unterstützt öffentlich vertrauenswürdige ACM-Zertifikate, AWS private CA-Zertifikate und Zertifikate, die von externen Zertifizierungsstellen importiert wurden. Der Betreiber überwacht den Zustand des Zertifikats und unterstützt die automatische Erkennung von Verlängerungen.

  • Anforderungslimits — Steuern Sie die Bearbeitung von Anfragen pro Pod über die neue RequestLimits Konfiguration unter Worker mit den folgenden konfigurierbaren Feldern:

    • maxConcurrentRequests— Maximale Anzahl gleichzeitiger Anfragen während des Fluges pro Pod.

    • maxQueueSize— Anfragen werden in die Warteschlange gestellt, wenn das Parallelitätslimit erreicht ist, bevor sie abgelehnt werden.

    • overflowStatusCode— HTTP-Statuscode, der zurückgegeben wird, wenn die Grenzwerte überschritten werden (Standard: 429).

Detaillierte Informationen, einschließlich Voraussetzungen und Anweisungen zum Upgrade, finden Sie in den folgenden Abschnitten.

Voraussetzungen

Um die Funktion „Benutzerdefinierte Zertifikate“ zu verwenden, fügen Sie Ihrer Ausführungsrolle „Inferenzoperator“ die folgenden Berechtigungen hinzu:

{ "Sid": "ACMCertificateAccess", "Effect": "Allow", "Action": [ "acm:DescribeCertificate", "acm:GetCertificate" ], "Resource": "arn:aws:acm:*:*:certificate/*" }

Führen Sie ein Upgrade auf Version 3.1 durch

Wenn Sie den Inferenzoperator bereits über Helm installiert haben, verwenden Sie für das Upgrade die folgenden Befehle:

helm get values -n kube-system hyperpod-inference-operator \ > current-values.yaml cd sagemaker-hyperpod-cli/helm_chart/HyperPodHelmChart/\ charts/inference-operator helm upgrade hyperpod-inference-operator . -n kube-system \ -f current-values.yaml --set image.tag=v3.1 # Verification kubectl get deployment hyperpod-inference-operator-controller-manager \ -n hyperpod-inference-system \ -o jsonpath='{.spec.template.spec.containers[0].image}'

SageMaker HyperPod Versionshinweise zu Inference: v3.0

Datum der Veröffentlichung: 23. Februar 2026

Übersicht

Inference Operator 3.0 führt die Add-on EKS-Integration für ein vereinfachtes Lebenszyklusmanagement, Node Affinity-Unterstützung für eine granulare Planungssteuerung und ein verbessertes Ressourcen-Tagging ein. Bestehende Helm-based Installationen können Add-on mithilfe des mitgelieferten Migrationsskripts auf das EKS migriert werden. Aktualisieren Sie Ihre Inference Operator-Ausführungsrolle vor dem Upgrade mit neuen Tagging-Berechtigungen.

Die wichtigsten Funktionen

  • Add-on EKS-Integration — Enterprise-grade Lebenszyklusmanagement mit vereinfachter Installationserfahrung

  • Node Affinity — Granulare Planungssteuerung für den Ausschluss von Spot-Instances, die Bevorzugung von Availability Zones oder das Targeting von Nodes mit benutzerdefinierten Labels

Detaillierte Informationen, einschließlich Voraussetzungen, Upgrade-Anweisungen und Anleitungen zur Migration, finden Sie in den folgenden Abschnitten.

Voraussetzungen

Vor dem Upgrade der Helm-Version auf 3.0 sollten Kunden ihrer Ausführungsrolle als Inferenzoperator zusätzliche Tagging-Berechtigungen hinzufügen. Im Rahmen der Verbesserung der Ressourcen-Tagging und der Sicherheit taggt der Inference Operator jetzt ALB-, S3- und ACM-Ressourcen. Für diese Erweiterung sind zusätzliche Berechtigungen in der Ausführungsrolle Inference Operator erforderlich. Fügen Sie Ihrer Ausführungsrolle „Inferenzoperator“ die folgenden Berechtigungen hinzu:

{ "Sid": "CertificateTagginPermission", "Effect": "Allow", "Action": [ "acm:AddTagsToCertificate" ], "Resource": "arn:aws:acm:*:*:certificate/*", }, { "Sid": "S3PutObjectTaggingAccess", "Effect": "Allow", "Action": [ "s3:PutObjectTagging" ], "Resource": [ "arn:aws:s3:::<TLS_BUCKET>/*" # Replace * with your TLS bucket ] }

Führen Sie ein Upgrade auf Version 3.0 durch

Wenn Sie den Inferenzoperator bereits über Helm installiert haben, verwenden Sie für das Upgrade die folgenden Befehle:

helm get values -n kube-system hyperpod-inference-operator \ > current-values.yaml cd sagemaker-hyperpod-cli/helm_chart/HyperPodHelmChart/\ charts/inference-operator helm upgrade hyperpod-inference-operator . -n kube-system \ -f current-values.yaml --set image.tag=v3.0 # Verification kubectl get deployment hyperpod-inference-operator-controller-manager \ -n hyperpod-inference-system \ -o jsonpath='{.spec.template.spec.containers[0].image}'

Migration von Helm zu EKS Add-on

Wenn der Inference Operator vor der Version 3.0 über Helm installiert wurde, empfehlen wir, auf EKS zu migrieren, Add-on um rechtzeitig über die neuen Funktionen informiert zu werden, die für Inference Operator veröffentlicht werden. Dieses Skript migriert den SageMaker HyperPod Inference Operator von Helm-based der Installation zur EKS-Installation. Add-on

Überblick: Das Skript verwendet einen Clusternamen und eine Region als Parameter, ruft die vorhandene Helm-Installationskonfiguration ab und migriert zur EKS-Bereitstellung. Add-on Es erstellt neue IAM-Rollen für den Inferenzoperator, den ALB-Controller und den KEDA-Operator.

Vor der Migration des Inferenzoperators stellt das Skript sicher, dass die erforderlichen Abhängigkeiten (S3-CSI-Treiber, FSx-CSI-Treiber, Cert-Manager und Metrics-Server) vorhanden sind. Wenn sie nicht existieren, werden sie bereitgestellt als. Add-on

Nach Abschluss der Add-on Inferenzoperator-Migration migriert das Skript auch S3, FSx und andere Abhängigkeiten (ALB, KEDA, cert-manager, metrics-server), sofern sie ursprünglich über das Inference Operator-Helm-Diagramm installiert wurden. Verwenden Sie--skip-dependencies-migration, um diesen Schritt für den S3-CSI-Treiber, den FSx-CSI-Treiber, den Cert-Manager und den Metrics-Server zu überspringen. Beachten Sie, dass ALB und KEDA als Teil von Add-on im selben Namespace wie Inference Operator installiert werden und als Teil des Inference Operators migriert werden. Add-on

Wichtig

Stellen Sie während der Migration keine neuen Modelle bereit, da diese erst bereitgestellt werden, wenn die Migration abgeschlossen ist. Sobald sich der Inferenzoperator im Status AKTIV Add-on befindet, können neue Modelle bereitgestellt werden. Die Migration dauert in der Regel 15 bis 20 Minuten und kann innerhalb von 30 Minuten abgeschlossen werden, wenn derzeit nur wenige Modelle bereitgestellt werden.

Voraussetzungen für die Migration:

  • AWS CLI mit den entsprechenden Anmeldeinformationen konfiguriert

  • kubectl ist mit Zugriff auf Ihren EKS-Cluster konfiguriert

  • Helm installiert

  • Bestehende Helm-Installation des Hyperpod-Inferenz-Operators

Anmerkung

Endpunkte, die bereits laufen, werden während des Migrationsprozesses nicht unterbrochen. Bestehende Endpunkte werden den Datenverkehr während der gesamten Migration weiterhin unterbrechungsfrei abwickeln.

Das Migrationsskript wird abgerufen:

git clone https://github.com/aws/sagemaker-hyperpod-cli.git cd sagemaker-hyperpod-cli/helm_chart/HyperPodHelmChart/\ charts/inference-operator/migration

Verwendung:

./helm_to_addon.sh [OPTIONS] \ --cluster-name <cluster-name> (Required) \ --region <region> (Required) \ --helm-namespace kube-system (Optional) \ --auto-approve (Optional) \ --skip-dependencies-migration (Optional) \ --s3-mountpoint-role-arn <s3-mountpoint-role-arn> (Optional) \ --fsx-role-arn <fsx-role-arn> (Optional)

Optionen:

  • --cluster-name NAME— EKS-Clustername (erforderlich)

  • --region REGION— AWS Region (erforderlich)

  • --helm-namespace NAMESPACE— Namespace, in dem das Helm-Diagramm installiert ist (Standard: kube-system) (optional)

  • --s3-mountpoint-role-arn ARN— ARN der IAM-Rolle des S3 Mountpoint CSI-Treibers (optional)

  • --fsx-role-arn ARN— ARN für die IAM-Rolle des FSx CSI-Treibers (optional)

  • --auto-approve— Überspringen Sie die Bestätigungsaufforderungen, wenn dieses Flag aktiviert ist. step-by-stepund schließen auto-approve sich gegenseitig aus, falls --auto-approve angegeben, nicht angeben --step-by-step (optional)

  • --step-by-step— Machen Sie nach jedem wichtigen Schritt eine Pause zur Überprüfung. Dies sollte nicht erwähnt werden, wenn --auto-approve es bereits hinzugefügt wurde (optional)

  • --skip-dependencies-migration— Überspringen Sie die Migration von Helm-installed Abhängigkeiten zu Add-on. Denn Abhängigkeiten wurden NICHT über das Inference Operator-Helm-Diagramm installiert, oder wenn Sie sie separat verwalten möchten. (fakultativ)

Beispiele:

Einfache Migration (migriert Abhängigkeiten):

./helm_to_addon.sh \ --cluster-name my-cluster \ --region us-east-1

Auto-approve ohne Eingabeaufforderungen:

./helm_to_addon.sh \ --cluster-name my-cluster \ --region us-east-1 \ --auto-approve

Überspringen Sie die Abhängigkeitsmigration für FSx, S3-Mountpoint, Cert Manager und Metrics-Server:

./helm_to_addon.sh \ --cluster-name my-cluster \ --region us-east-1 \ --skip-dependencies-migration

Stellen Sie vorhandene S3- und FSx-IAM-Rollen bereit:

./helm_to_addon.sh \ --cluster-name my-cluster \ --region us-east-1 \ --s3-mountpoint-role-arn arn:aws:iam::123456789012:role/s3-csi-role \ --fsx-role-arn arn:aws:iam::123456789012:role/fsx-csi-role

Speicherort der Sicherungskopie:

Backups werden gespeichert in /tmp/hyperpod-migration-backup-<timestamp>/

Backups ermöglichen eine sichere Migration und Wiederherstellung:

  • Rollback bei Ausfall — Wenn die Migration fehlschlägt, kann das Skript Ihren Cluster mithilfe der gesicherten Konfigurationen automatisch in den Zustand vor der Migration zurückversetzen

  • Audit Trail — Bietet eine vollständige Aufzeichnung dessen, was vor der Migration existierte, zur Problembehebung und zur Einhaltung der Vorschriften

  • Konfigurationsreferenz — Ermöglicht den Vergleich von Konfigurationen vor und nach der Migration

  • Manuelle Wiederherstellung — Bei Bedarf können Sie bestimmte Ressourcen aus dem Backup-Verzeichnis manuell überprüfen und wiederherstellen

Rollback:

Wenn die Migration fehlschlägt, fordert das Skript den Benutzer zur Bestätigung auf, bevor ein Rollback initiiert wird, um den vorherigen Status wiederherzustellen.

SageMaker HyperPod Versionshinweise zu Inference: v2.3

Was ist neu

In dieser Version werden neue optionale Felder in den Custom Resource Definitions (CRDs) eingeführt, um die Flexibilität bei der Konfiguration der Bereitstellung zu erhöhen.

Funktionen

  • Typen mit mehreren Instanzen

    • Verbesserte Zuverlässigkeit bei der Bereitstellung — Unterstützt Konfigurationen mit mehreren Instanzen mit automatischem Failover auf alternative Instance-Typen, wenn die Kapazität der bevorzugten Optionen nicht ausreicht

    • Intelligente Ressourcenplanung — Nutzt die Kubernetes-Knotenaffinität, um Instanztypen zu priorisieren und gleichzeitig die Bereitstellung auch dann zu gewährleisten, wenn bevorzugte Ressourcen nicht verfügbar sind

    • Optimierte Kosten und Leistung — Behält Ihre Präferenzen für den Instanztyp bei und verhindert kapazitätsbedingte Ausfälle bei Cluster-Schwankungen

Fehlerbehebungen

Änderungen an dem Feld invocationEndpoint in der Spezifikation von InferenceEndpointConfig werden jetzt wirksam:

  • Wenn das invocationEndpoint Feld gepatcht oder aktualisiert wird, werden abhängige Ressourcen wie derIngress, der Load Balancer und SageMaker Endpoint mit der Normalisierung aktualisiert. SageMakerEndpointRegistration

  • Der Wert für invocationEndpoint provided wird unverändert in der Spezifikation selbst gespeichert. InferenceEndpointConfig Wenn dieser Wert verwendet wird, um einen Load Balancer und — falls aktiviert — einen SageMaker Endpunkt zu erstellen, wird er so normalisiert, dass er einen Schrägstrich am Anfang hat.

    • v1/chat/completionswird /v1/chat/completions für AWS Load Balancer Ingress und Endpoint auf normalisiert. SageMaker Für den SageMakerEndpointRegistration wird es in seiner Spezifikation als angezeigt. v1/chat/completions

    • ///invokewird auf /invoke für AWS Load Balancer Ingress und Endpoint normalisiert. SageMaker Für den SageMakerEndpointRegistration wird es in seiner Spezifikation als angezeigt. invoke

Helm installieren:

Folgen Sie: https://github.com/aws/sagemaker-hyperpod-cli/tree/main/helm_chart

Wenn Sie sich darauf konzentrieren, nur den Inferenzoperator zu installieren, tun Sie dies cd HyperPodHelmChart/charts/inference-operator nach Schritt 1 Set Up Your Helm Environment z. B. Da Sie sich im Verzeichnis des Inferenzoperatordiagramms selbst befinden, ersetzen Sie in den Befehlen, wo immer Sie es sehenhelm_chart/HyperPodHelmChart, durch. .

Aktualisieren Sie den Operator auf Version 2.3, falls er bereits installiert ist:

cd sagemaker-hyperpod-cli/helm_chart/HyperPodHelmChart/\ charts/inference-operator helm get values -n kube-system hyperpod-inference-operator \ > current-values.yaml helm upgrade hyperpod-inference-operator . \ -n kube-system \ -f current-values.yaml \ --set image.tag=v2.3