Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Inferensi real-time latensi rendah dengan AWS PrivateLink
Amazon SageMaker AI memberikan latensi rendah untuk kesimpulan real-time sambil mempertahankan ketersediaan dan ketahanan tinggi menggunakan penerapan Multi-AZ. Latensi aplikasi terdiri dari dua komponen utama: infrastruktur atau latensi overhead dan latensi inferensi model. Pengurangan latensi overhead membuka kemungkinan baru seperti menerapkan model yang lebih kompleks, mendalam, dan akurat atau membagi aplikasi monolitik menjadi modul layanan mikro yang dapat diskalakan dan dapat dipelihara. Anda dapat mengurangi latensi untuk kesimpulan real-time dengan SageMaker AI menggunakan AWS PrivateLink penerapan. Dengan AWS PrivateLink, Anda dapat mengakses semua operasi SageMaker API secara pribadi dari Virtual Private Cloud (VPC) Anda dengan cara yang dapat diskalakan dengan menggunakan antarmuka titik akhir VPC. Antarmuka titik akhir VPC adalah antarmuka jaringan elastis di subnet Anda dengan alamat IP pribadi yang berfungsi sebagai titik masuk untuk semua panggilan SageMaker API.
Secara default, titik akhir SageMaker AI dengan 2 instans atau lebih digunakan di setidaknya 2 Avail AWS ability Zones (AZ) dan instans di AZ mana pun dapat memproses pemanggilan. Ini menghasilkan satu atau lebih “lompatan” AZ yang berkontribusi pada latensi overhead. Pener AWS PrivateLink apan dengan privateDNSEnabled opsi yang ditetapkan sebagai true mengurangi ini dengan mencapai dua tujuan:
-
Itu menyimpan semua lalu lintas inferensi dalam VPC Anda.
-
Itu menjaga lalu lintas pemanggilan di AZ yang sama dengan klien yang memulainya saat menggunakan SageMaker Runtime. Ini menghindari “lompatan” antara AZ yang mengurangi latensi overhead.
Bagian berikut dari panduan ini menunjukkan bagaimana Anda dapat mengurangi latensi untuk kesimpulan real-time dengan AWS PrivateLink penerapan.
Topik
Deploy AWS PrivateLink
Untuk menerapkan AWS PrivateLink, pertama-tama buat titik akhir antarmuka untuk VPC tempat Anda terhubung ke titik akhir SageMaker AI. Ikuti langkah-langkah di Akses AWS layanan menggunakan titik akhir VPC antarmuka untuk membuat titik akhir antarmuka. Saat membuat titik akhir, pilih pengaturan berikut di antarmuka konsol:
-
Pilih kotak centang Aktifkan nama DNS di bawah Pengaturan Tambahan
-
Pilih grup keamanan yang sesuai dan subnet yang akan digunakan dengan titik akhir SageMaker AI.
Juga pastikan bahwa VPC memiliki nama host DNS yang diaktifkan. Untuk informasi selengkapnya tentang cara mengubah atribut DNS untuk VPC Anda, lihat Meli hat dan memperbarui atribut DNS untuk V PC Anda.
Menyebarkan titik akhir SageMaker AI di VPC
Untuk mencapai latensi overhead yang rendah, buat titik akhir SageMaker AI menggunakan subnet yang sama yang Anda tentukan saat menerapkan. AWS PrivateLink Subnet ini harus cocok dengan AZ aplikasi klien Anda, seperti yang ditunjukkan dalam cuplikan kode berikut.
model_name ='<the-name-of-your-model>'vpc ='vpc-0123456789abcdef0'subnet_a ='subnet-0123456789abcdef0'subnet_b ='subnet-0123456789abcdef1'security_group ='sg-0123456789abcdef0'create_model_response = sagemaker_client.create_model( ModelName = model_name, ExecutionRoleArn = sagemaker_role, PrimaryContainer = { 'Image': container, 'ModelDataUrl': model_url }, VpcConfig = { 'SecurityGroupIds': [security_group], 'Subnets': [subnet_a, subnet_b], }, )
Cuplikan kode yang disebutkan di atas mengasumsikan bahwa Anda telah mengikuti langkah-langkah diSebelum Anda mulai.
Memanggil titik akhir SageMaker AI
Terakhir, tentukan klien SageMaker Runtime dan panggil titik akhir SageMaker AI seperti yang ditunjukkan dalam cuplikan kode berikut.
endpoint_name ='<endpoint-name>'runtime_client = boto3.client('sagemaker-runtime') response = runtime_client.invoke_endpoint(EndpointName=endpoint_name, ContentType='text/csv', Body=payload)
Untuk informasi selengkapnya tentang konfigurasi titik akhir, lihatTerapkan model untuk inferensi real-time.