View a markdown version of this page

Bereitstellen von Grundlagenmodellen und maßgeschneiderten, optimierten Modellen - Amazon SageMaker KI

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Bereitstellen von Grundlagenmodellen und maßgeschneiderten, optimierten Modellen

Ganz gleich, ob Sie vortrainierte Open-Weights-Modelle oder Gated-Modelle von Amazon oder Ihre eigenen benutzerdefinierten SageMaker JumpStart oder fein abgestimmten Modelle, die in Amazon S3 oder Amazon FSx gespeichert sind, bereitstellen, SageMaker HyperPod bietet die flexible, skalierbare Infrastruktur, die Sie für Inferenz-Workloads in der Produktion benötigen.

Stellen Sie Open-Weights- und Gated-Foundation-Modelle von bereit JumpStart Implementieren Sie benutzerdefinierte und fein abgestimmte Modelle von Amazon S3 und Amazon FSx Stellen Sie Modelle aus dem lokalen NVMe-Speicher bereit
Beschreibung

Nutzen Sie für die Implementierung einen umfassenden Katalog vortrainierter Grundlagenmodelle mit automatischen Optimierungs- und Skalierungsrichtlinien, die auf jede Modellfamilie zugeschnitten sind.

Bringen Sie Ihre eigenen maßgeschneiderten und fein abgestimmten Modelle mit und nutzen Sie die SageMaker HyperPod Unternehmensinfrastruktur für Rückschlüsse im Produktionsumfang. Wählen Sie zwischen kostengünstigem Speicher mit Amazon S3 oder einem leistungsstarken Dateisystem mit Amazon FSx. Laden Sie Modellgewichte aus dem lokalen NVMe-Speicher eines Knotens, um die Netzwerklatenz beim Pod-Start zu vermeiden. Nützlich für Autoscaling-Ereignisse, Workloads, die von Null aus skalieren, und latenzempfindliche Failover.
Die wichtigsten Vorteile
  • One-click Bereitstellung über die Amazon SageMaker Studio-Benutzeroberfläche

  • Auto-scaling basierend auf eingehenden Anfragen automatisch aktiviert

  • Pre-optimized Container und Konfigurationen für jede Modellfamilie

  • EULA-Verwaltung für geschlossene Modelle

  • Support für mehrere Speicher-Backends: Amazon S3, Amazon FSx

  • Flexible Container- und Framework-Unterstützung

  • Benutzerdefinierte Skalierungsrichtlinien, die auf den Merkmalen Ihres Modells basieren

  • Verkürzte Kaltstartzeit durch lokales Ablesen der Gewichte

  • Keine Netzwerkabhängigkeit beim Laden von Modellen

  • Optionales Fallback auf Amazon S3, wenn der NVMe-Cache fehlt

  • Benutzerdefinierte Kubernetes-Volumes und InitContainer

Optionen für die Bereitstellung
  • Amazon Studio für SageMaker die visuelle Bereitstellung

  • kubectl für den Betrieb Kubernetes-native

  • Python-SDK für programmatische Integration

  • HyperPod CLI für die Befehlszeilenautomatisierung

  • kubectl für Operationen Kubernetes-native

  • Python-SDK für programmatische Integration

  • HyperPod CLI für die Befehlszeilenautomatisierung

  • kubectl für Operationen Kubernetes-native

  • Python-SDK für programmatische Integration

  • HyperPod CLI für die Befehlszeilenautomatisierung

Die folgenden Abschnitte führen Sie durch die Bereitstellung von Modellen von Amazon SageMaker JumpStart, Amazon S3 und Amazon FSx sowie aus lokalem NVMe-Speicher.