Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Membuat danau data Amazon Chime SDK
Danau data analitik panggilan Amazon Chime SDK memungkinkan Anda melakukan streaming wawasan yang didukung pembelajaran mesin dan metadata apa pun dari Amazon Kinesis Data Stream ke bucket Amazon S3 Anda. Misalnya, menggunakan data lake untuk mengakses URL ke rekaman. Untuk membuat data lake, Anda menerapkan serangkaian AWS CloudFormation templat baik dari konsol Amazon Chime SDK atau secara terprogram menggunakan. AWS CLI Danau data memungkinkan Anda menanyakan metadata panggilan dan data analitik suara dengan mereferensikan tabel data AWS Glue di Amazon Athena.
Topik
Prasyarat
Anda harus memiliki item berikut untuk membuat danau Amazon Chime SDK:
-
Aliran data Amazon Kinesis. Untuk informasi selengkapnya, lihat Membuat Stream melalui Konsol Manajemen AWS di Panduan Pengembang Amazon Kinesis Streams.
-
Ember S3. Untuk informasi selengkapnya, lihat Membuat bucket Amazon S3 pertama Anda di Panduan Pengguna Amazon S3.
Terminologi dan konsep danau data
Gunakan istilah dan konsep berikut untuk memahami cara kerja data lake.
- Amazon Kinesis Data Firehose
-
Layanan ekstrak, transformasi, dan muat (ETL) yang secara andal menangkap, mengubah, dan mengirimkan data streaming ke danau data, penyimpanan data, dan layanan analitik. Untuk informasi selengkapnya, lihat Apa itu Amazon Kinesis Data Firehose?
- Amazon Athena
-
Amazon Athena adalah layanan kueri interaktif yang memungkinkan Anda menganalisis data di Amazon S3 menggunakan SQL standar. Athena tanpa server, jadi Anda tidak memiliki infrastruktur untuk dikelola, dan Anda hanya membayar untuk kueri yang Anda jalankan. Untuk menggunakan Athena, arahkan ke data Anda di Amazon S3, tentukan skema, dan gunakan kueri SQL standar. Anda juga dapat menggunakan grup kerja untuk mengelompokkan pengguna dan mengontrol sumber daya yang dapat mereka akses saat menjalankan kueri. Workgroup memungkinkan Anda mengelola konkurensi kueri dan memprioritaskan eksekusi kueri di berbagai kelompok pengguna dan beban kerja.
- Katalog Data Lem
-
Di Amazon Athena, tabel dan database berisi metadata yang merinci skema untuk data sumber yang mendasarinya. Untuk setiap dataset, tabel harus ada di Athena. Metadata dalam tabel memberi tahu Athena lokasi bucket Amazon S3 Anda. Ini juga menentukan struktur data, seperti nama kolom, tipe data, dan nama tabel. Database hanya menyimpan metadata dan informasi skema untuk dataset.
Membuat beberapa danau data
Beberapa danau data dapat dibuat dengan menyediakan nama database Glue yang unik untuk menentukan tempat menyimpan wawasan panggilan. Untuk AWS akun tertentu, mungkin ada beberapa konfigurasi analitik panggilan, masing-masing dengan danau data yang sesuai. Ini berarti bahwa pemisahan data dapat diterapkan untuk kasus penggunaan tertentu, seperti menyesuaikan kebijakan penyimpanan, dan kebijakan akses tentang bagaimana data disimpan. Mungkin ada kebijakan keamanan berbeda yang diterapkan untuk akses wawasan, rekaman, dan metadata.
Ketersediaan regional danau data
Danau data Amazon Chime SDK tersedia di Wilayah berikut.
Region |
Meja lem |
Quick |
|---|---|---|
us-east-1 |
Tersedia |
Tersedia |
us-west-2 |
Tersedia |
Tersedia |
eu-central-1 |
Tersedia |
Tersedia |
Arsitektur danau data
Diagram berikut menunjukkan arsitektur danau data. Angka dalam gambar sesuai dengan teks bernomor di bawah ini.
Dalam diagram, setelah Anda menggunakan AWS konsol untuk menerapkan CloudFormation template dari alur kerja pengaturan konfigurasi pipeline wawasan media, data berikut mengalir ke bucket Amazon S3:
-
Analisis panggilan Amazon Chime SDK akan mulai streaming data real-time ke Kinesis Data Stream pelanggan.
-
Amazon Kinesis Firehose menyangga data real-time ini hingga terakumulasi 128 MB, atau 60 detik berlalu, mana yang lebih dulu. Firehose kemudian menggunakan
amazon_chime_sdk_call_analytics_firehose_schemadi Katalog Data Glue untuk mengompres data dan mengubah catatan JSON menjadi file parket. -
File parket berada di bucket Amazon S3 Anda, dalam format yang dipartisi.
-
Selain data real-time, file.wav ringkasan Amazon Transcribe Call Analytics pasca-panggilan (disunting dan tidak disunting, jika ditentukan dalam konfigurasi), dan file.wav rekaman panggilan juga dikirim ke Amazon S3 Bucket Anda.
-
Anda dapat menggunakan Amazon Athena dan SQL standar untuk menanyakan data di bucket Amazon S3.
-
Tem CloudFormation plate juga membuat Katalog Data Glue untuk menanyakan data ringkasan pasca-panggilan ini melalui Athena.
-
Semua data di bucket Amazon S3 juga dapat divisualisasikan menggunakan Quick. QuickSight membangun koneksi dengan bucket Amazon S3 menggunakan Amazon Athena.
Tabel Amazon Athena menggunakan fitur berikut untuk mengoptimalkan kinerja kueri:
- Pembuatan Partisi Data
-
Partisi membagi tabel menjadi beberapa bagian dan menyimpan data terkait bersama-sama berdasarkan nilai kolom seperti tanggal, negara, dan wilayah. Partisi bertindak sebagai kolom virtual. Dalam hal ini, CloudFormation template mendefinisikan partisi pada pembuatan tabel, yang membantu mengurangi jumlah data yang dipindai per kueri dan meningkatkan kinerja. Anda juga dapat memfilter berdasarkan partisi untuk membatasi jumlah data yang dipindai oleh kueri. Untuk informasi selengkapnya, lihat Mem partisi data di Athena di Panduan Pengguna Amazon Athena.
Contoh ini menunjukkan struktur partisi dengan tanggal 1 Januari 2023:
-
s3://example-bucket/amazon_chime_sdk_data_lake /serviceType=CallAnalytics/detailType={DETAIL_TYPE}/year=2023/month=01/day=01/example-file.parquet -
dimana
DETAIL_TYPEsalah satu dari berikut ini:-
CallAnalyticsMetadata -
TranscribeCallAnalytics -
TranscribeCallAnalyticsCategoryEvents -
Transcribe -
Recording -
VoiceAnalyticsStatus -
SpeakerSearchStatus -
VoiceToneAnalysisStatus
-
-
- Mengoptimalkan pembuatan penyimpanan data kolumnar
-
Apache Parquet menggunakan kompresi berdasarkan kolom, kompresi berdasarkan tipe data, dan pushdown predikat untuk menyimpan data. Rasio kompresi yang lebih baik atau melewatkan blok data berarti membaca lebih sedikit byte dari bucket Amazon S3 Anda. Itu mengarah pada kinerja kueri yang lebih baik dan pengurangan biaya. Untuk pengoptimalan ini, konversi data dari JSON ke parket diaktifkan di Amazon Kinesis Data Firehose.
- Partisi
-
Fitur Athena ini secara otomatis membuat partisi untuk setiap hari untuk meningkatkan kinerja kueri berbasis tanggal.
Pengaturan danau data
Gunakan konsol Amazon Chime SDK untuk menyelesaikan langkah-langkah berikut.
-
Mulai konsol Amazon Chime SDK (https://console.aws.amazon.com/chime-sdk/home
) dan di panel navigasi, di bawah Call Analytics, pilih Konfigur asi. -
Selesaikan Langkah 1, pilih Berikutnya dan pada halaman Langkah 2, pilih kotak cent ang Analisis Suara.
-
Di bawah Detail keluaran, pilih kotak centang Gudang data untuk melakukan analisis historis, lalu pilih tautan De ploy CloudFormation stack.
Sistem mengirimkan Anda ke halaman Quick create stack di CloudFormation konsol.
-
Masukkan nama untuk tumpukan, lalu masukkan parameter berikut:
-
DataLakeType— Pilih Buat Analisis Panggilan DataLake. -
KinesisDataStreamName— Pilih streaming Anda. Ini harus menjadi aliran yang digunakan untuk streaming analitik panggilan. -
S3BucketURI— Pilih bucket Amazon S3 Anda. URI harus memiliki awalans3://bucket-name -
GlueDatabaseName— Pilih nama Database AWS Lem yang unik. Anda tidak dapat menggunakan kembali database yang ada di AWS akun.
-
-
Pilih kotak centang pengakuan, lalu pilih Buat danau data. Biarkan 10 menit bagi sistem untuk membuat danau.
Pengaturan danau data menggunakan AWS CLI
Gunakan AWS CLI untuk membuat peran dengan izin untuk memanggil CloudFormation tumpukan buat. Ikuti prosedur di bawah ini untuk membuat dan mengatur peran IAM. Untuk informasi selengkapnya, lihat Membuat tumpukan di Panduan AWS CloudFormation Pengguna.
-
Buat peran yang dipanggil AmazonChimeSdkCallAnalytics-Datalake-Provisioning-Role dan lampirkan kebijakan kepercayaan ke peran yang memungkinkan CloudFormation untuk mengambil peran tersebut.
-
Buat kebijakan kepercayaan IAM menggunakan template berikut dan simpan file dalam format.json.
-
Jalan aws iam create-role kan perintah dan meneruskan kebijakan kepercayaan sebagai parameter.
aws iam create-role \ --role-name AmazonChimeSdkCallAnalytics-Datalake-Provisioning-Role --assume-role-policy-document file://role-trust-policy.json -
Catat peran arn yang dikembalikan dari respons. peran arn diperlukan pada langkah berikutnya.
-
-
Buat kebijakan dengan izin untuk membuat CloudFormation tumpukan.
-
Buat kebijakan IAM menggunakan template berikut dan simpan file dalam format.json. File ini diperlukan saat memanggil create-policy.
-
Jalankan aws iam create-policy dan meneruskan kebijakan buat tumpukan sebagai parameter.
aws iam create-policy --policy-name testCreateStackPolicy --policy-document file://create-cloudformation-stack-policy.json -
Catat peran arn yang dikembalikan dari respons. peran arn diperlukan pada langkah berikutnya.
-
-
Lampirkan kebijakan aws iam attach-role-policy pada peran tersebut.
aws iam attach-role-policy --role-name {Role name created above} --policy-arn {Policy ARN created above} -
Buat CloudFormation tumpukan dan masukkan parameter yang diperlukan:aws cloudformation create-stack.
Berikan nilai parameter untuk setiap ParameterKey penggunaan ParameterValue.
aws cloudformation create-stack --capabilities CAPABILITY_NAMED_IAM --stack-name testDeploymentStack --template-url https://chime-sdk-assets.s3.amazonaws.com/public_templates/AmazonChimeSDKDataLake.yaml --parameters ParameterKey=S3BucketURI,ParameterValue={S3 URI} ParameterKey=DataLakeType,ParameterValue="Create call analytics datalake" ParameterKey=KinesisDataStreamName,ParameterValue={Name of Kinesis Data Stream} --role-arn {Role ARN created above}
Sumber daya yang dibuat oleh pengaturan danau data
Tabel berikut mencantumkan sumber daya yang dibuat saat Anda membuat danau data.
Tipe sumber daya |
Nama dan deskripsi sumber daya |
Nama layanan |
|---|---|---|
Database Katalog Data AWS Glue |
GlueDatabaseName— Secara logis mengelompokkan semua tabel Data AWS Glue milik wawasan panggilan dan analisis suara. |
Analisis panggilan, analisis suara |
|
Tabel Katalog Data AWS Glue |
amazon_chime_sdk_call_analytics_firehose_schema — Skema gabungan untuk analitik suara analitik panggilan yang diumpankan ke Kinesis Fire hose. |
Analisis panggilan, analisis suara |
call_analytics_metadata — Skema untuk metadata analisis panggilan. Berisi SipMetadata dan OneTimeMetadata. |
Analisis panggilan |
|
| call_analytics_recording_metadata — Skema untuk metadata Perekaman dan Peningkatan Suara | Analisis panggilan, analisis suara | |
transcribe_call_analytics — Skema untuk Payload “UtteranceEvent” TranscribeCallAnalytics |
Analisis panggilan |
|
transcribe_call_analytics_category_events — Skem a untuk Payload “CategoryEvent” TranscribeCallAnalytics |
Analisis panggilan |
|
transcribe_call_analytics_post_call — Skema untuk muatan ringkasan Analisis Panggilan Transkripsi Panggilan Pasca Panggilan |
Analisis panggilan |
|
transkrip - Skema untuk Transkripsikan Payload |
Analisis panggilan |
|
voice_analytics_status — Skema untuk acara siap analisis suara |
Analisis suara |
|
speaker_search_status — Skema untuk kecocokan identifikasi |
Analisis suara |
|
voice_tone_analysis_status — Skem a untuk peristiwa analisis nada suara |
Analisis suara |
|
Amazon Kinesis Data Firehose |
AmazonChimeSDK-call-analytics- |
Analisis panggilan, analisis suara |
Kelompok Kerja Amazon Athena |
GlueDatabaseName-AmazonChimeSDKDataAnalytics— Kelompok pengguna logis untuk mengontrol sumber daya yang mereka akses saat menjalankan kueri. |
Analisis panggilan, analitik suara |