View a markdown version of this page

SageMaker Inferensi - Amazon Nova

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

SageMaker Inferensi

Model Amazon Nova khusus sekarang tersedia berdasarkan SageMaker inferensi. Dengan Amazon Nova aktif SageMaker, Anda dapat mulai mendapatkan prediksi, atau kesimpulan, dari model Amazon Nova kustom terlatih Anda. SageMaker menyediakan berbagai pilihan infrastruktur ML dan opsi penerapan model untuk membantu memenuhi semua kebutuhan inferensi ML Anda. Dengan SageMaker inferensi, Anda dapat meningkatkan skala penerapan model, mengelola model secara lebih efektif dalam produksi, dan mengurangi beban operasional.

SageMaker memberi Anda berbagai opsi inferensi, seperti titik akhir real-time untuk mendapatkan inferensi latensi rendah, dan titik akhir asinkron untuk kumpulan permintaan. Dengan memanfaatkan opsi inferensi yang sesuai untuk kasus penggunaan Anda, Anda dapat memastikan penerapan dan inferensi model yang efisien. Untuk informasi selengkapnya tentang SageMaker inferensi, lihat Menye barkan model untuk infer ensi.

penting

Hanya model dan LoRA-merged model kustom peringkat penuh yang didukung pada SageMaker inferensi. Untuk model LoRa yang tidak terendam dan model dasar, gunakan Amazon Bedrock.

Fitur

Fitur-fitur berikut tersedia untuk model Amazon Nova berdasarkan SageMaker inferensi:

Kemampuan Model

  • Pembuatan teks

Penerapan dan Penskalaan

  • Real-time titik akhir dengan pemilihan instance khusus

  • Penskalaan Otomatis — Secara otomatis menyesuaikan kapasitas berdasarkan pola lalu lintas untuk mengoptimalkan biaya dan pemanfaatan GPU. Untuk informasi selengkapnya, lihat Menskal akan SageMaker Model Amazon Secara Otomatis.

  • Dukungan API streaming untuk pembuatan token real-time

Pemantauan dan Optimasi

  • CloudWatch Integrasi Amazon untuk pemantauan dan peringatan

  • Pengoptimalan Zone-aware latensi ketersediaan melalui konfigurasi VPC

Alat Pengembangan

Model dan contoh yang didukung

Saat membuat titik akhir SageMaker inferensi, Anda dapat mengatur dua variabel lingkungan untuk mengonfigurasi penerapan Anda: CONTEXT_LENGTH dan. MAX_CONCURRENCY

  • CONTEXT_LENGTH— Total panjang token maksimum (input + output) per permintaan

  • MAX_CONCURRENCY— Jumlah maksimum permintaan bersamaan yang akan dilayani oleh titik akhir

Tabel berikut mencantumkan model Amazon Nova yang didukung, jenis instans, dan konfigurasi yang didukung. Nilai MAX_CONCURRENCY mewakili konkurensi maksimum yang didukung untuk setiap pengaturan CONTEXT_LENGTH:

Model Tipe Instans Konfigurasi yang Didukung Kuantisasi FP8 Diperlukan
Amazon Nova Mikro ml.g5.12xbesar

PANJANG_KONTEKS: 4000, MAKSIMAL_KONKURENSI: 12

PANJANG_KONTEKS: 8000, MAKSIMAL_KONKURENSI: 6

Tidak
ml.g5.24xbesar PANJANG_KONTEKS: 8000, MAKSIMAL_KONKURENSI: 8 Tidak
ml.g6e.xlarge

PANJANG_KONTEKS: 8000, MAKSIMAL_KONKURENSI: 2

Tidak
ml.g6e.2xbesar

PANJANG_KONTEKS: 8000, MAKSIMAL_KONKURENSI: 2

Tidak
ml.g6e.4xbesar

PANJANG_KONTEKS: 8000, MAKSIMAL_KONKURENSI: 4

Tidak
ml.g6.12xbesar

PANJANG_KONTEKS: 4000, MAKSIMAL_KONKURENSI: 12

PANJANG_KONTEKS: 8000, MAKSIMAL_KONKURENSI: 6

Tidak
ml.g6.24xbesar PANJANG_KONTEKS: 8000, MAKSIMAL_KONKURENSI: 8 Tidak
ml.g6.48xbesar PANJANG_KONTEKS: 8000, MAKSIMAL_KONKURENSI: 12 Tidak
ml.p5.48xbesar

PANJANG_KONTEKS: 16000, MAKSIMAL_KONKURENSI: 128

PANJANG_KONTEKS: 64000, MAKSIMAL_KONKURENSI: 32

PANJANG_KONTEKS: 128000, MAKSIMAL_KONKURENSI: 8

Tidak
Amazon Nova Lite ml.g6.12xbesar

PANJANG_KONTEKS: 8000, MAKSIMAL_KONKURENSI: 2

Ya - Diaktifkan Secara Default
ml.g6.24xbesar

PANJANG_KONTEKS: 8000, MAKSIMAL_KONKURENSI: 4

Ya - Diaktifkan Secara Default
ml.g6.48xbesar

PANJANG_KONTEKS: 4000, MAKSIMAL_KONKURENSI: 16

PANJANG_KONTEKS: 8000, MAKSIMAL_KONKURENSI: 8

Tidak
ml.p5.48xbesar

PANJANG_KONTEKS: 16000, MAKSIMAL_KONKURENSI: 128

PANJANG_KONTEKS: 60000, MAKSIMAL_KONKURENSI: 8

Tidak
Nova 2 Lite ml.g6.48xbesar

PANJANG_KONTEKS: 8000, MAKSIMAL_KONKURENSI: 8

Ya - Diaktifkan Secara Default
ml.p5.48xbesar

PANJANG_KONTEKS: 16000, MAKSIMAL_KONKURENSI: 128

PANJANG_KONTEKS: 64000, MAKSIMAL_KONKURENSI: 32

PANJANG_KONTEKS: 128000, MAKSIMAL_KONKURENSI: 8

PANJANG_KONTEKS: 256000, MAKSIMAL_KONKURENSI: 2

Tidak
catatan

Untuk contoh di mana kuantisasi FP8 diperlukan, itu akan diaktifkan secara default.

Nilai MAX_CONCURRENCY yang ditampilkan adalah batas atas untuk setiap pengaturan CONTEXT_LENGTH. Anda dapat menggunakan panjang konteks yang lebih rendah dengan konkurensi yang sama, tetapi melebihi nilai-nilai ini akan menyebabkan SageMaker pembuatan titik akhir gagal.

Misalnya, di Amazon Nova Micro dengan ml.g5.12xlarge:

  • CONTEXT_LENGTH=2000, MAX_CONCURRENCY=12 → Valid

  • CONTEXT_LENGTH=8000, MAX_CONCURRENCY=12 → Ditolak (batas konkurensi adalah 6 pada panjang konteks 8000)

  • CONTEXT_LENGTH=8000, MAX_CONCURRENCY=4 → Valid

  • CONTEXT_LENGTH=8000, MAX_CONCURRENCY=6 → Valid

  • CONTEXT_LENGTH=10000→ Ditolak (panjang konteks maksimal adalah 8000 pada contoh ini)

Komponen inferensi

Anda dapat menerapkan model Amazon Nova menggunakan komponen SageMaker inferensi, yang memungkinkan Anda meng-host beberapa model pada satu titik akhir dan mengoptimalkan pemanfaatan sumber daya. Komponen inferensi memungkinkan Anda menentukan sumber daya komputasi (CPU, memori, GPU) yang diperlukan untuk setiap model, memungkinkan hosting multi-model yang efisien pada infrastruktur bersama.

Tabel berikut mencantumkan persyaratan sumber daya komputasi minimum untuk setiap model Amazon Nova saat menggunakan komponen inferensi:

Model Inti CPU Min Memori Min (MB) Jumlah GPU Min
Amazon Nova Mikro 15 25000 4
Amazon Nova Lite 20 35000 4
Nova 2 Lite 20 100000 4
catatan

ComputeResourceRequirementsNilai harus memenuhi atau melebihi persyaratan minimum yang tercantum dalam tabel di atas untuk model yang Anda gunakan. Menggunakan nilai di bawah minimum akan menyebabkan pembuatan komponen inferensi gagal.

Anda dapat menerapkan beberapa komponen inferensi pada titik akhir yang sama, selama total kebutuhan sumber daya tidak melebihi kapasitas instans.

Jumlah komponen inferensi yang dapat Anda host pada titik akhir tunggal bergantung pada sumber daya jenis instans yang tersedia dan persyaratan minimum masing-masing model. Misalnya, pada ml.p5.48xlarge (8 GPU, 192 vCPU, memori ~1 TB):

  • 1 komponen inferensi Amazon Nova Micro (4 GPU, 15 inti CPU, 25000 MB) → Valid

  • 2 komponen inferensi Amazon Nova Micro (total 8 GPU, 30 inti CPU, 50000 MB) → Valid (cocok dengan kapasitas instance)

  • 1 Nova 2 Lite komponen inferensi (4 GPU, 20 inti CPU, 100000 MB) → Valid

  • 2 komponen inferensi Nova 2 Lite (total 8 GPU, 40 inti CPU, 200000 MB) → Valid

  • 3 komponen inferensi Amazon Nova Micro (total 12 GPU) → Ditolak (melebihi 8 GPU yang tersedia)

Didukung AWS Wilayah

Tabel berikut mencantumkan AWS Wilayah tempat model Amazon Nova tersedia berdasarkan SageMaker inferensi:

Nama wilayah Kode Wilayah Ketersediaan
US East (Northern Virginia) us-east-1 Available
AS Barat (Oregon) us-west-2 Available

Gambar Kontainer yang Didukung

Tabel berikut mencantumkan URI gambar kontainer untuk model Amazon Nova berdasarkan SageMaker inferensi berdasarkan wilayah. SM-Inference-latestTag saat ini menunjuk kev1.4.

Region URI Gambar Kontainer
us-east-1 708977205387.dkr.ecr.us-east-1.amazonaws.com/nova-inference-repo:SM-Inference-latest
us-west-2 176779409107.dkr.ecr.us-west-2.amazonaws.com/nova-inference-repo:SM-Inference-latest

Praktik Terbaik

Untuk praktik terbaik tentang penerapan dan pengelolaan model pada SageMaker, lihat Praktik Terbaik untuk SageMaker.

Dukungan

Untuk masalah dan dukungan dengan model Amazon Nova pada SageMaker inferensi, hubungi AWS Dukungan melalui Konsol atau manajer AWS akun Anda.