View a markdown version of this page

Modellbereitstellung - Amazon SageMaker KI

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Modellbereitstellung

Nach Abschluss Ihrer Trainingsaufgabe ist das trainierte Modell als Modellpaket in Ihrer Ausgabemodellpaketgruppe verfügbar. Sie haben zwei Möglichkeiten, es bereitzustellen.

Option 1: Bereitstellung mit SageMaker AI AI Inference

Hosten Sie Ihr Modell auf einem SageMaker KI-Inferenzendpunkt für Vorhersagen in Echtzeit, serverlos oder asynchron. Diese Option bietet Ihnen eine detaillierte Kontrolle über Instanztypen, Skalierungsrichtlinien und Netzwerkkonfiguration. Sie eignet sich gut, wenn Sie Serving mit niedriger Latenz, benutzerdefinierte Inferenzlogik oder eine enge Integration in bestehende SageMaker KI-KI-Workflows benötigen.

Rufen Sie zur Bereitstellung das OutputModelPackageArn aus Ihrem abgeschlossenen Schulungsjob ab und erstellen Sie damit einen Endpunkt.

# Retrieve the output model ARN from your completed job aws sagemaker describe-job \ --job-name "my-agent-rft-job" \ --job-category AgentRFT \ --region us-west-2

Vollständige Bereitstellungsoptionen und Konfiguration finden Sie unter Deploy models for inference in der SageMaker KI AI-Dokumentation.

Option 2: In Amazon Bedrock importieren

Importieren Sie Ihr Modell in Amazon Bedrock, um die verwalteten Inferenz-APIs von Bedrock zu verwenden, ohne dass eine Endpunktkonfiguration erforderlich ist. Amazon Bedrock unterstützt den Import von maßgeschneiderten Open-Source-Foundation-Modellen (wie Mistral AI oder Llama) und Amazon Nova-Modellen, die in KI KI fein abgestimmt sind. SageMaker Weitere Informationen finden Sie unter Importieren eines vortrainierten Modells in Amazon Bedrock im Amazon Bedrock-Benutzerhandbuch. Informationen zu Nova-Modellen finden Sie unter Import mit benutzerdefiniertem Modell erstellen.

Mit SageMaker AI Studio bereitstellen

  • Navigieren Sie zu Jobs > Training und wählen Sie die Registerkarte Multi-turn RL aus.

  • Wählen Sie einen abgeschlossenen Job aus und wählen Sie das Modell unter Benutzerdefiniertes Modell aus, um Leistungskennzahlen, Modellherkunft und Trainingsprotokolle zu überprüfen.

  • Genehmigen Sie das Modell auf der Registerkarte „Governance“, damit es bereitgestellt werden kann.

  • Wählen Sie Bereitstellen. Wählen Sie aus, ob die Bereitstellung auf einem SageMaker KI-Echtzeit-Endpunkt oder über Amazon Bedrock erfolgen soll und ob ein neuer Endpunkt erstellt oder ein vorhandener wiederverwendet werden soll.

  • Wählen Sie den Instanztyp aus und konfigurieren Sie optional VPC-Einstellungen, IAM-Rolle und KMS-Verschlüsselungsschlüssel.

  • Überwachen Sie den Bereitstellungsfortschritt auf der Registerkarte Bereitstellungen.

  • Navigieren Sie zu Bereitstellungen > Endpoints. Wenn Ihr Endpunkt und die zugehörigen Inferenzkomponenten den Status von erreichen InService, ist Ihr Endpunkt bereit für den Aufruf.

Mit dem SageMaker AI Python SDK bereitstellen

Auf einem SageMaker KI-Endpunkt bereitstellen:

from sagemaker.serve import ModelBuilder from sagemaker.core.resources import ModelPackage # Get the output model package from your completed training job model_package = ModelPackage.get( model_package_name=job.output_model_package_arn ) model_builder = ModelBuilder( model=model_package, image_uri="763104351884.dkr.ecr.us-west-2.amazonaws.com/djl-inference:0.36.0-lmi24.0.0-cu129", instance_type="ml.g6e.48xlarge", ) model_builder.accept_eula = True model_builder.build() endpoint = model_builder.deploy( endpoint_name="mtrl-finetuned-endpoint", instance_type="ml.g6e.48xlarge", initial_instance_count=1, )

Rufen Sie den Endpunkt auf:

import json response = endpoint.invoke( body=json.dumps({ "model": "/opt/ml/model", "messages": [{"role": "user", "content": "What is 25 * 4?"}], "max_tokens": 200, "stream": False, }).encode("utf-8"), content_type="application/json", )