Fitur Model dan instance yang didukung Komponen inferensi Didukung AWS Wilayah Gambar Kontainer yang Didukung Praktik Terbaik Support

SageMaker Inferensi

Model Amazon Nova khusus sekarang tersedia pada SageMaker inferensi. Dengan Amazon Nova aktif SageMaker, Anda dapat mulai mendapatkan prediksi, atau kesimpulan, dari model Amazon Nova kustom Anda yang terlatih. SageMaker menyediakan berbagai pilihan infrastruktur dan opsi penerapan model ML untuk membantu memenuhi semua kebutuhan inferensi ML Anda. Dengan SageMaker inferensi, Anda dapat menskalakan penerapan model Anda, mengelola model secara lebih efektif dalam produksi, dan mengurangi beban operasional.

SageMaker memberi Anda berbagai opsi inferensi, seperti titik akhir waktu nyata untuk mendapatkan inferensi latensi rendah, dan titik akhir asinkron untuk kumpulan permintaan. Dengan memanfaatkan opsi inferensi yang sesuai untuk kasus penggunaan Anda, Anda dapat memastikan penerapan dan inferensi model yang efisien. Untuk informasi lebih lanjut tentang SageMaker inferensi, lihat Menerapkan model untuk inferensi.

penting

Hanya model dan LoRA-merged model kustom peringkat penuh yang didukung pada SageMaker inferensi. Untuk model LoRa yang tidak digabungkan dan model dasar, gunakan Amazon Bedrock.

Fitur

Fitur-fitur berikut tersedia untuk model Amazon Nova pada SageMaker inferensi:

Kemampuan Model

Pembuatan teks

Penerapan dan Penskalaan

Real-time titik akhir dengan pemilihan instance kustom
Auto Scaling — Secara otomatis menyesuaikan kapasitas berdasarkan pola lalu lintas untuk mengoptimalkan biaya dan pemanfaatan GPU. Untuk informasi selengkapnya, lihat Menskalakan SageMaker Model Amazon secara otomatis.
Dukungan API streaming untuk pembuatan token waktu nyata

Pemantauan dan Optimalisasi

CloudWatch Integrasi Amazon untuk pemantauan dan peringatan
Optimalisasi Zone-aware latensi ketersediaan melalui konfigurasi VPC

Alat Pengembangan

AWS CLI dukungan - Untuk informasi selengkapnya, lihat Referensi Perintah AWS CLI untuk. SageMaker
Integrasi notebook melalui dukungan SDK

Model dan instance yang didukung

Saat membuat titik akhir SageMaker inferensi, Anda dapat mengatur dua variabel lingkungan untuk mengonfigurasi penerapan: dan. CONTEXT_LENGTH MAX_CONCURRENCY

CONTEXT_LENGTH— Total panjang token maksimum (input+output) per permintaan
MAX_CONCURRENCY— Jumlah maksimum permintaan bersamaan yang akan dilayani titik akhir

Tabel berikut mencantumkan model Amazon Nova yang didukung, jenis instans, dan konfigurasi yang didukung. Nilai MAX_CONCURRENCY mewakili konkurensi maksimum yang didukung untuk setiap pengaturan CONTEXT_LENGTH:

Model	Tipe Instans	Konfigurasi yang Didukung	Kuantisasi FP8 Diperlukan
Amazon Nova Mikro	ml.g5.12xbesar	CONTEXT_LENGTH: 4000, MAX_CONCURRENCY: 12 CONTEXT_LENGTH: 8000, MAX_CONCURRENCY: 6	Tidak
	ml.g5.24xbesar	CONTEXT_LENGTH: 8000, MAX_CONCURRENCY: 8	Tidak
	ml.g6e.xlarge	CONTEXT_LENGTH: 8000, MAX_CONCURRENCY: 2	Tidak
	ml.g6e.2xlarge	CONTEXT_LENGTH: 8000, MAX_CONCURRENCY: 2	Tidak
	ml.g6e.4xlarge	CONTEXT_LENGTH: 8000, MAX_CONCURRENCY: 4	Tidak
	ml.g6.12xlarge	CONTEXT_LENGTH: 4000, MAX_CONCURRENCY: 12 CONTEXT_LENGTH: 8000, MAX_CONCURRENCY: 6	Tidak
	ml.g6.24xbesar	CONTEXT_LENGTH: 8000, MAX_CONCURRENCY: 8	Tidak
	ml.g6.48xlarge	CONTEXT_LENGTH: 8000, MAX_CONCURRENCY: 12	Tidak
	ml.p5.48xbesar	CONTEXT_LENGTH: 16000, MAX_CONCURRENCY: 128 CONTEXT_LENGTH: 64000, MAX_CONCURRENCY: 32 CONTEXT_LENGTH: 128000, MAX_CONCURRENCY: 8	Tidak
Amazon Nova Lite	ml.g6.12xlarge	CONTEXT_LENGTH: 8000, MAX_CONCURRENCY: 2	Ya - Diaktifkan Secara Default
	ml.g6.24xbesar	CONTEXT_LENGTH: 8000, MAX_CONCURRENCY: 4	Ya - Diaktifkan Secara Default
	ml.g6.48xlarge	CONTEXT_LENGTH: 4000, MAX_CONCURRENCY: 16 CONTEXT_LENGTH: 8000, MAX_CONCURRENCY: 8	Tidak
	ml.p5.48xbesar	CONTEXT_LENGTH: 16000, MAX_CONCURRENCY: 128 CONTEXT_LENGTH: 60000, MAX_CONCURRENCY: 8	Tidak
Nova 2 Lite	ml.g6.48xlarge	CONTEXT_LENGTH: 8000, MAX_CONCURRENCY: 8	Ya - Diaktifkan Secara Default
Nova 2 Lite	ml.p5.48xbesar	CONTEXT_LENGTH: 16000, MAX_CONCURRENCY: 128 CONTEXT_LENGTH: 64000, MAX_CONCURRENCY: 32 CONTEXT_LENGTH: 128000, MAX_CONCURRENCY: 8 CONTEXT_LENGTH: 256000, MAX_CONCURRENCY: 2	Tidak

catatan

Untuk contoh di mana kuantisasi FP8 diperlukan, itu akan diaktifkan secara default.

Nilai MAX_CONCURRENCY yang ditampilkan adalah batas atas untuk setiap pengaturan CONTEXT_LENGTH. Anda dapat menggunakan panjang konteks yang lebih rendah dengan konkurensi yang sama, tetapi melebihi nilai ini akan menyebabkan pembuatan SageMaker titik akhir gagal.

Misalnya, di Amazon Nova Micro dengan ml.g5.12xlarge:

CONTEXT_LENGTH=2000, MAX_CONCURRENCY=12 → Berlaku
CONTEXT_LENGTH=8000, MAX_CONCURRENCY=12 → Ditolak (batas konkurensi adalah 6 pada panjang konteks 8000)
CONTEXT_LENGTH=8000, MAX_CONCURRENCY=4 → Berlaku
CONTEXT_LENGTH=8000, MAX_CONCURRENCY=6 → Berlaku
CONTEXT_LENGTH=10000→ Ditolak (panjang konteks maks adalah 8000 pada contoh ini)

Komponen inferensi

Anda dapat menerapkan model Amazon Nova menggunakan komponen SageMaker inferensi, yang memungkinkan Anda meng-host beberapa model pada satu titik akhir dan mengoptimalkan pemanfaatan sumber daya. Komponen inferensi memungkinkan Anda menentukan sumber daya komputasi (CPU, memori, GPU) yang diperlukan untuk setiap model, memungkinkan hosting multi-model yang efisien pada infrastruktur bersama.

Tabel berikut mencantumkan persyaratan sumber daya komputasi minimum untuk setiap model Amazon Nova saat menggunakan komponen inferensi:

Model	Inti CPU Min	Memori Min (MB)	Jumlah GPU Min
Amazon Nova Mikro	15	25000	4
Amazon Nova Lite	20	35000	4
Nova 2 Lite	20	100000	4

catatan

ComputeResourceRequirementsNilai harus memenuhi atau melebihi persyaratan minimum yang tercantum dalam tabel di atas untuk model yang Anda gunakan. Menggunakan nilai di bawah minimum akan menyebabkan pembuatan komponen inferensi gagal.

Anda dapat menerapkan beberapa komponen inferensi pada titik akhir yang sama, selama total persyaratan sumber daya tidak melebihi kapasitas instance.

Jumlah komponen inferensi yang dapat Anda host pada satu titik akhir bergantung pada sumber daya jenis instans yang tersedia dan persyaratan minimum setiap model. Misalnya, pada ml.p5.48xlarge (8 GPU, 192 vCPU, ~ memori 1 TB):

1 komponen inferensi Amazon Nova Micro (4 GPU, 15 inti CPU, 25000 MB) → Valid
2 komponen inferensi Amazon Nova Micro (total 8 GPU, 30 inti CPU, 50000 MB) → Valid (sesuai dengan kapasitas instans)
1 komponen inferensi Nova 2 Lite (4 GPU, 20 inti CPU, 100000 MB) → Valid
2 komponen inferensi Nova 2 Lite (total 8 GPU, 40 inti CPU, 200000 MB) → Valid
3 komponen inferensi Amazon Nova Micro (total 12 GPU) → Ditolak (melebihi 8 GPU yang tersedia)

Didukung AWS Wilayah

Tabel berikut mencantumkan AWS Wilayah tempat model Amazon Nova tersedia pada SageMaker inferensi:

Nama wilayah	Kode Wilayah	Ketersediaan
US East (Northern Virginia)	us-east-1	Available
AS Barat (Oregon)	us-west-2	Available

Gambar Kontainer yang Didukung

Tabel berikut mencantumkan URI gambar kontainer untuk model Amazon Nova pada SageMaker inferensi berdasarkan wilayah. SM-Inference-latestTag saat ini menunjuk kev1.4.

Region	URI Gambar Kontainer
us-east-1	`708977205387.dkr.ecr.us-east-1.amazonaws.com/nova-inference-repo:SM-Inference-latest`
us-west-2	`176779409107.dkr.ecr.us-west-2.amazonaws.com/nova-inference-repo:SM-Inference-latest`

Praktik Terbaik

Untuk praktik terbaik dalam menerapkan dan mengelola model SageMaker, lihat Praktik Terbaik untuk SageMaker.

Support

Untuk masalah dan dukungan dengan model Amazon Nova pada SageMaker inferensi, hubungi AWS Support melalui Konsol atau manajer AWS akun Anda.

Topik

Awas Javascript dinonaktifkan atau tidak tersedia di browser Anda.

Untuk menggunakan Dokumentasi AWS, Javascript harus diaktifkan. Lihat halaman Bantuan browser Anda untuk petunjuk.

Konvensi Dokumen

Penggabungan Model

Memulai