Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Resolusi Entitas AWS Glosarium
Amazon Resource Name (ARN)
Pengidentifikasi unik untuk AWS sumber daya. ARN diperlukan saat Anda perlu menentukan sumber daya secara jelas di semua, seperti dalam Resolusi Entitas AWS kebijakan Resolusi Entitas AWS, tag Amazon Relational Database Service (Amazon RDS), dan panggilan API.
Jenis Atribut
Jenis atribut untuk bidang input. Saat Anda membuat pemetaan skema, Anda memilih jenis A tribut dari daftar nilai yang telah dikonfigurasi sebelumnya seperti Nama, Alamat, Nomor Telepon, atau Alamat Email. Jenis atribut memberi tahu jenis data Resolusi Entitas AWS apa yang Anda sajikan, memungkinkannya untuk diklasifikasikan dan dinormalisasi dengan benar.
Pemrosesan otomatis
Opsi irama pemrosesan untuk pekerjaan alur kerja yang cocok yang memungkinkannya dijalankan secara otomatis saat input data Anda berubah.
Opsi ini hanya tersedia untuk pen cocokan berbasis aturan.
Secara default, irama pemrosesan untuk pekerjaan alur kerja yang cocok diatur ke Manual , yang memungkinkannya dijalankan sesuai permintaan. Anda dapat mengatur Pemro sesan otomatis untuk menjalankan pekerjaan alur kerja pencocokan secara otomatis saat input data Anda berubah. Ini membuat output alur kerja pencocokan Anda tetap mutakhir.
AWS KMS key ARN
Ini adalah Nama Sumber AWS KMS Daya Amazon (ARN) Anda untuk enkripsi saat diam. Jika tidak disediakan, sistem akan menggunakan kunci K Resolusi Entitas AWS MS terkelola.
Alur kerja batch
Sebuah proses yang berjalan pada interval terjadwal untuk mencocokkan dan menyelesaikan data di seluruh dataset. Alur kerja batch paling Resolusi Entitas AWS baik digunakan untuk pengaturan awal, penyegaran penuh berkala, dan skenario dengan perubahan signifikan pada kumpulan data sumber dan target.
Teks jelas
Data yang tidak dilindungi secara kriptografis.
Tingkat kepercayaan (ConfidenceLevel)
Untuk pencocokan ML, ini adalah tingkat kepercayaan yang diterapkan Resolusi Entitas AWS ketika ML mengidentifikasi kumpulan catatan yang cocok. Ini adalah bagian dari metadata alur kerja yang cocok yang akan disertakan dalam output.
Rekam tingkat kepercayaan (RecordConfidenceLevel)
Untuk pencocokan inkremental ML, ini adalah tingkat kepercayaan per rekaman yang diterapkan Resolusi Entitas AWS ketika ML mengidentifikasi kumpulan rekaman yang cocok. Ini adalah bagian dari metadata alur kerja yang cocok yang akan disertakan dalam output.
Dekripsi
Proses mengubah data terenkripsi kembali ke bentuk aslinya. Dekripsi hanya dapat dilakukan jika Anda memiliki akses ke kunci rahasia.
Enkripsi
Proses pengkodean data ke dalam bentuk yang muncul acak menggunakan nilai rahasia yang disebut kunci. Tidak mungkin untuk menentukan plaintext asli tanpa akses ke kunci.
Nama grup
Nama Grup meref erensikan seluruh grup bidang input dan dapat membantu Anda mengelompokkan data yang diurai bersama untuk tujuan pencocokan.
Misalnya, jika ada tiga bidang input:first_name,, dan middle_namelast_name, Anda dapat mengelompokkan mereka bersama-sama dengan memasukkan nama Grup sebagai full_name untuk pencocokan dan keluaran.
Hash
Hashing berarti menerapkan algoritma kriptografi yang menghasilkan string karakter yang tidak dapat diubah dan unik dengan ukuran tetap—yang disebut hash. Resolusi Entitas AWS menggunakan protokol hash Secure Hash Algorithm 256-bit (SHA256) dan akan menampilkan string karakter 32-byte. Di Resolusi Entitas AWS, Anda dapat memilih apakah akan hash nilai data dalam output Anda.
Protokol hash (HashingProtocol)
Resolusi Entitas AWS menggunakan protokol hash Secure Hash Algorithm 256-bit (SHA256) dan akan menampilkan string karakter 32-byte. Ini adalah bagian dari metadata alur kerja yang cocok yang akan disertakan dalam output.
Metode pemetaan ID
Bagaimana Anda ingin pemetaan ID dilakukan.
Ada dua metode pemetaan ID:
-
Rule-based — Metode yang digunakan untuk menggunakan aturan pencocokan untuk menerjemahkan data pihak pertama dari sumber ke target dalam alur kerja pemetaan ID.
-
Layanan penyedia — Metode yang digunakan untuk menggunakan layanan penyedia untuk menerjemahkan data yang dikodekan pihak ketiga dari sumber ke target dalam alur kerja pemetaan ID.
Resolusi Entitas AWS saat ini mendukung LiveRamp sebagai metode pemetaan ID berbasis layanan penyedia. Anda harus berlangganan LiveRamp AWS Data Exchange untuk menggunakan metode ini. Untuk informasi selengkapnya, lihat Langkah 1: Berlangganan layanan penyedia di AWS Data Exchange.
Alur kerja pemetaan ID
Pekerjaan pemrosesan data yang memetakan data dari sumber data input ke target data input berdasarkan metode pemetaan ID yang ditentukan. Ini menghasilkan tabel pemetaan ID. Alur kerja ini mengharuskan Anda untuk menentukan metode pemetaan ID dan data input yang ingin Anda terjemahkan dari sumber ke target.
Anda dapat mengatur alur kerja pemetaan ID untuk dijalankan sendiri Akun AWS atau di dua alur kerja Akun AWS.
Ruang nama ID
Sumber daya yang berisi metadata Resolusi Entitas AWS yang menjelaskan kumpulan data di beberapa Akun AWS dan cara menggunakan kumpulan data ini dalam alur kerja pemetaan ID.
Ada dua jenis ruang nama ID: SOURCE dan. TARGET Ber SOURCE isi konfigurasi untuk data sumber yang akan diproses dalam alur kerja pemetaan ID. Ber TARGET isi konfigurasi data target yang akan diselesaikan oleh semua sumber. Untuk mendefinisikan data input yang ingin Anda selesaikan di dua Akun AWS, buat sumber namespace ID dan target namespace ID untuk menerjemahkan data Anda dari satu set (SOURCE) ke set lain (). TARGET
Setelah Anda dan anggota lain membuat ruang nama ID dan menjalankan alur kerja pemetaan ID, Anda dapat bergabung dengan kolaborasi AWS Clean Rooms untuk menjalankan gabungan multi tabel pada tabel pemetaan ID, dan menganalisis data.
Untuk informasi selengkapnya, silakan lihat Panduan Pengguna AWS Clean Rooms.
Alur kerja tambahan
Sebuah proses yang hanya cocok dan menyelesaikan catatan baru atau yang diperbarui sejak dijalankan terakhir, daripada memproses seluruh dataset. Alur kerja inkremental Resolusi Entitas AWS paling baik digunakan untuk pembaruan yang sering untuk menjaga kesegaran data ketika hanya sebagian kecil dari kumpulan data yang berubah.
Bidang masukan
Bidang input sesuai dengan nama kolom dari tabel data AWS Glue input Anda.
Sumber Masukan ARN (InputSourceARN)
Nama Sumber Daya Amazon (ARN) yang dihasilkan untuk input AWS Glue tabel. Ini adalah bagian dari metadata alur kerja yang cocok yang akan disertakan dalam output.
Pencocokan berbasis machine learning
Pencocokan berbasis pembelajaran mesin (pencocokan ML) menemukan kecocokan di seluruh data Anda yang mungkin tidak lengkap atau mungkin tidak terlihat persis sama. Pencocokan ML adalah proses preset yang akan mencoba mencocokkan catatan di semua data yang Anda masukkan. Pencocokan ML mengembalikan ID keco cokan dan tingkat kepercayaan untuk setiap kumpulan data yang cocok.
Pemrosesan manual
Opsi irama pemrosesan untuk pekerjaan alur kerja yang cocok yang memungkinkannya dijalankan sesuai permintaan.
Opsi ini diatur secara default dan tersedia untuk pencocokan berbasis aturan dan pencocokan berbasis pembelajaran mesin.
Many-to-Many mencocokkan
Many-to-many pencocokan membandingkan beberapa contoh data serupa. Nilai dalam bidang input yang telah ditetapkan kunci kecocokan yang sama akan dicocokkan satu sama lain, terlepas dari apakah mereka berada di bidang input yang sama atau bidang input yang berbeda.
Misalnya, Anda mungkin memiliki beberapa bidang input nomor telepon seperti mobile_phone dan home_phone yang memiliki tombol kecocokan yang sama “Telepon”. Gunakan pencocokan banyak-ke-banyak untuk membandingkan data di bidang mobile_phone input dengan data di bidang mobile_phone input dan data di bidang input. home_phone
Aturan pencocokan mengevaluasi data di beberapa bidang input dengan kunci pencocokan yang sama dengan operasi (atau), dan pencocokan satu-ke-banyak membandingkan nilai di beberapa bidang input. Ini berarti bahwa jika ada kombinasi mobile_phone atau kecoco home_phone kan antara dua catatan, tombol kecocokan “Telepon” akan mengembalikan kecocokan. Untuk tombol kecocokan “Telepon” untuk menemukan kecocokan, Record One mobile_phone = Record Two mobile_phone Record One mobile_phone
= Record Two home_phone ATAU Record One home_phone = Record Two home_phone ATAU ATAURecord One home_phone = Record Two mobile_phone.
ID kecocokan (MatchID)
Untuk pencocokan berbasis aturan dan pencocokan ML, ini adalah ID yang dihasilkan oleh Resolusi Entitas AWS dan diterapkan ke setiap kumpulan catatan yang cocok. Ini adalah bagian dari metadata alur kerja yang cocok yang akan disertakan dalam output.
Kunci Cocokkan (MatchKey)
Kunci Match menginstruksikan bidang input Resolusi Entitas AWS mana yang dianggap sebagai data serupa dan mana yang harus dipertimbangkan sebagai data yang berbeda. Ini membantu Resolusi Entitas AWS secara otomatis mengonfigurasi aturan pencocokan berbasis aturan dan membandingkan data serupa yang disimpan di bidang input yang berbeda.
Jika ada beberapa jenis informasi nomor telepon seperti bidang mobile_phone input dan bidang home_phone input dalam data Anda yang ingin Anda bandingkan bersama, Anda dapat memberi keduanya tombol kecocokan “Telepon”. Kemudian pencocokan berbasis aturan dapat dikonfigurasi untuk membandingkan data menggunakan pernyataan “atau” di semua bidang masukan dengan tombol kecocokan “Telepon” (lihat Definisi Pencocokan dan One-to-One Many-to-Many Pencocokan di bagian Alur Kerja Pencocokan).
Jika Anda ingin pencocokan berbasis aturan mempertimbangkan berbagai jenis informasi nomor telepon secara terpisah, Anda dapat membuat kunci pencocokan yang lebih spesifik seperti “Mobile_Phone” dan “Home_Phone”. Kemudian, saat menyiapkan alur kerja pencocokan, Anda dapat menentukan bagaimana setiap tombol kecocokan telepon akan digunakan dalam pencocokan berbasis aturan.
Jika no MatchKey ditentukan untuk bidang input tertentu, itu tidak dapat digunakan dalam pencocokan tetapi dapat dilakukan melalui proses alur kerja pencocokan dan dapat dikeluarkan jika diinginkan.
Nama Kunci Pencocokan
Nama yang ditetapkan untuk tombol Cocokkan.
Aturan pertandingan (MatchRule)
Untuk pencocokan berbasis aturan, ini adalah nomor aturan yang diterapkan yang menghasilkan kumpulan catatan yang cocok. Ini adalah bagian dari metadata alur kerja yang cocok yang akan disertakan dalam output.
Pencocokan
Proses menggabungkan dan membandingkan data dari berbagai bidang input, tabel, atau database dan menentukan mana yang sama — atau “cocok” — berdasarkan memenuhi kriteria pencocokan tertentu (misalnya, baik melalui aturan atau model pencocokan).
Alur kerja yang cocok
Proses yang Anda atur untuk menentukan data input untuk dicocokkan bersama dan bagaimana pencocokan harus dilakukan.
Pencocokan deskripsi alur kerja
Deskripsi opsional alur kerja pencocokan yang mungkin Anda pilih untuk dimasukkan. Deskripsi membantu Anda membedakan antara alur kerja yang cocok jika Anda membuat lebih dari satu.
Nama alur kerja yang cocok
Nama untuk alur kerja pencocokan yang Anda tentukan.
catatan
Nama alur kerja yang cocok harus unik. Mereka tidak dapat memiliki nama yang sama atau kesalahan akan dikembalikan.
Mencocokkan metadata alur kerja
Informasi yang dihasilkan dan dikeluarkan oleh Resolusi Entitas AWS selama pekerjaan alur kerja yang cocok. Informasi ini diperlukan pada output.
Normalisasi (ApplyNormalization)
Pilih apakah akan menormalkan data input seperti yang didefinisikan dalam skema. Normalisasi menstandarkan data dengan menghapus spasi ekstra dan karakter khusus dan standarisasi ke format huruf kecil.
Misalnya, jika bidang input memiliki tipe atribut Full phone, dan nilai-nilai dalam tabel input diformat sebagai(123) 456-7890, Resolusi Entitas AWS akan menormalkan nilai ke1234567890.
Bagian berikut menjelaskan aturan normalisasi standar kami.
Untuk pen ML-based cocokan secara khusus, lihatNormalisasi (ApplyNormalization) — ML-based hanya.
Nama
catatan
Normalisasi hanya didukung untuk tipe grup Nama.
Jenis grup Nama muncul sebagai Nama lengkap di konsol dan seperti NAME di API.
Jika Anda ingin menormalkan sub-tipe dari tipe grup Nama:
-
Di konsol, tetapkan subtipe berikut ke grup Nama lengkap: Nama depan, Nama tengah, dan Nama belakang.
-
Di CreateSchemaMapping API, tetapkan Jenis berikut ke
NAMEGroupName:NAME_FIRST,NAME_MIDDLE, danNAME_LAST.
-
TRIM = Memangkas spasi kosong di depan dan di belakang
-
HURUF KECIL = Huruf kecil semua karakter alfa
-
CONVERT_ACCENT =Huruf beraksen rahasia menjadi huruf biasa
-
REMOVE_ALL_NON_ALPHA=Menghapus semua karakter non-alpha [a- z] A-Z
catatan
Normalisasi didukung untuk jenis grup Email.
Jenis grup Email muncul sebagai Alamat email di konsol dan seperti EMAIL_ADDRESS di API.
-
TRIM = Memangkas spasi kosong di depan dan di belakang
-
HURUF KECIL = Huruf kecil semua karakter alfa
-
CONVERT_ACCENT =Huruf beraksen rahasia menjadi huruf biasa
-
EMAIL_ADDRESS_UTIL_NORM = Menghapus setiap titik (.) dari nama pengguna, menghapus apa pun setelah tanda plus (+) di nama pengguna, dan menstandarisasi variasi domain umum
-
REMOVE_ALL_NON_EMAIL_CHARS=Menghapus semua karakter non-alfa-numerik [a-z] dan [.@-] A-Z0-9
Telepon
catatan
Normalisasi hanya didukung untuk tipe grup Telepon.
Jenis grup Telepon muncul sebagai Telepon penuh di konsol dan seperti PHONE di API.
Jika Anda ingin menormalkan sub-tipe dari jenis grup Telepon:
-
Di konsol, tetapkan sub-tipe berikut ke grup Telepon lengkap: Nomor telepon, dan Kode negara Telepon.
-
Di CreateSchemaMapping API, tetapkan Jenis berikut ke
PHONEGroupName:PHONE_NUMBERdanPHONE_COUNTRYCODE.
-
TRIM = Memangkas spasi kosong di depan dan di belakang
-
REMOVE_ALL_NON_NUMERIC=Menghapus semua karakter non-numerik [0- 9]
-
REMOVE_ALL_LEADING_ZEROES=Menghapus semua nol di depan
-
ENSURE_PREFIX_WITH_MAP, “phonePrefixMap" = Memeriksa setiap nomor telepon dan mencoba mencocokkannya dengan pola di telepon. PrefixMap Jika kecocokan ditemukan, aturan akan menambah atau memodifikasi awalan nomor telepon untuk memastikannya sesuai dengan format standar yang ditentukan dalam peta.
Alamat
catatan
Normalisasi hanya didukung untuk tipe grup Alamat.
Jenis grup Alamat muncul sebagai Alamat lengkap di konsol dan seperti ADDRESS di API.
Jika Anda ingin menormalkan sub-tipe dari jenis grup Alamat:
-
Di konsol, tetapkan sub-tipe berikut ke grup Alamat lengkap: Alamat jalan 1, Alamat jalan 2: Nama alamat jalan 3, Nama kota, Negara, Negara , dan Kode pos t
-
Di CreateSchemaMapping API, tetapkan Jenis berikut ke
ADDRESSGroupName:ADDRESS_STREET1,,ADDRESS_STREET2,ADDRESS_STREET3,ADDRESS_CITY,ADDRESS_STATEADDRESS_COUNTRY, danADDRESS_POSTALCODE.
-
TRIM = Memangkas spasi kosong di depan dan di belakang
-
HURUF KECIL = Huruf kecil semua karakter alfa
-
CONVERT_ACCENT =Huruf beraksen rahasia menjadi huruf biasa
-
REMOVE_ALL_NON_ALPHA=Menghapus semua karakter non-alpha [a- z] A-Z
-
RENAME_WORDS menggunakan ADDRESS_RENAME_WORD_MAP = ganti kata-kata dalam string Alamat dengan kata-kata dari ADDRESS_RENAME_WORD_MAP ALAMAT_GANTI NAMA_KATA_PETA
-
RENAME_DELIMITERS menggunakan ADDRESS_RENAME_DELIMITER_MAP = ganti pembatas dalam string Alamat dengan string dari ADDRESS_RENAME_DELIMITER_MAP ALAMAT_NAMA_DELIMITER_MAP
-
RENAME_DIRECTIONS menggunakan ADDRESS_RENAME_DIRECTION_MAP = ganti pembatas dalam string Alamat dengan string dari ADDRESS_RENAME_DIRECTION_MAP ALAMAT_GANTI NAMA_PETA_ARAH_ARAH
-
RENAME_NUMBERS menggunakan ADDRESS_RENAME_NUMBER_MAP = ganti angka dalam string Alamat dengan string dari ADDRESS_RENAME_NUMBER_MAP
-
RENAME_SPECIAL_CHARS menggunakan ADDRESS_RENAME_SPECIAL_CHAR_MAP = ganti karakter khusus dalam string Alamat dengan string dari ADDRESS_RENAME_SPECIAL_CHAR_MAP
ALAMAT_GANTI NAMA_KATA_PETA
Ini adalah kata-kata yang akan diganti namanya saat menormalkan string alamat.
"avenue": "ave", "bouled": "blvd", "circle": "cir", "circles": "cirs", "court": "ct", "centre": "ctr", "center": "ctr", "drive": "dr", "freeway": "fwy", "frwy": "fwy", "highway": "hwy", "lane": "ln", "parks": "park", "parkways": "pkwy", "pky": "pkwy", "pkway": "pkwy", "pkwys": "pkwy", "parkway": "pkwy", "parkwy": "pkwy", "place": "pl", "plaza": "plz", "plza": "plz", "road": "rd", "square": "sq", "squ": "sq", "sqr": "sq", "street": "st", "str": "st", "str.": "strasse"
ALAMAT_NAMA_DELIMITER_MAP
Ini adalah pembatas yang akan diganti namanya saat menormalkan string alamat.
",": " ", ".": " ", "[": " ", "]": " ", "/": " ", "-": " ", "#": " number "
ALAMAT_GANTI NAMA_PETA_ARAH_ARAH
Ini adalah pengidentifikasi arah yang akan diganti namanya saat menormalkan string alamat.
"east": "e", "north": "n", "south": "s", "west": "w", "northeast": "ne", "northwest": "nw", "southeast": "se", "southwest": "sw"
ALAMAT_NAMA_NAMA_NOMOR_PETA
Ini adalah string angka yang akan diganti namanya saat menormalkan string alamat.
"número": "number", "numero": "number", "no": "number", "núm": "number", "num": "number"
ALAMAT_BERGANTI NAMA_MAP_KARAKTER KHUSUS
Ini adalah string karakter khusus yang akan diganti namanya saat menormalkan string alamat.
"ß": "ss", "ä": "ae", "ö": "oe", "ü": "ue", "ø": "o", "æ": "ae"
Hash-di-hash
-
TRIM = Memangkas spasi kosong di depan dan di belakang
Source_ID
-
TRIM = Memangkas spasi kosong di depan dan di belakang
Normalisasi (ApplyNormalization) — ML-based hanya
Pilih apakah akan menormalkan data input seperti yang didefinisikan dalam skema. Normalisasi menstandarkan data dengan menghapus spasi ekstra dan karakter khusus dan standarisasi ke format huruf kecil.
Misalnya, jika bidang input memiliki tipe atributNAME, dan nilai-nilai dalam tabel input diformat sebagaiJohns Smith, Resolusi Entitas AWS akan menormalkan nilai kejohn smith.
Bagian berikut menjelaskan aturan normalisasi untuk alur kerja pencocokan berbasis pembelajaran mesin.
Nama
-
TRIM = Memangkas spasi kosong di depan dan di belakang
-
HURUF KECIL = Huruf kecil semua karakter alfa
-
HURUF KECIL = Huruf kecil semua karakter alfa
-
Hanya mengganti (at) (case sensitive) dengan simbol @
-
Menghapus semua spasi, di mana saja dalam nilai
-
Menghapus semua yang ada di luar yang pertama
"<>"jika ada
Telepon
-
TRIM = Memangkas spasi kosong di depan dan di belakang
-
REMOVE_ALL_NON_NUMERIC=Menghapus semua karakter non-numerik [0- 9]
-
REMOVE_ALL_LEADING_ZEROES=Menghapus semua nol di depan
-
ENSURE_PREFIX_WITH_MAP, “phonePrefixMap" = Memeriksa setiap nomor telepon dan mencoba mencocokkannya dengan pola di telepon. PrefixMap Jika kecocokan ditemukan, aturan akan menambah atau memodifikasi awalan nomor telepon untuk memastikannya sesuai dengan format standar yang ditentukan dalam peta.
One-to-One mencocokkan
One-to-one pencocokan membandingkan contoh tunggal dari data serupa. Bidang input dengan kunci dan nilai kecocokan yang sama di bidang input yang sama akan dicocokkan satu sama lain.
Misalnya, Anda mungkin memiliki beberapa bidang input nomor telepon seperti mobile_phone dan home_phone yang memiliki tombol kecocokan yang sama “Telepon”. Gunakan pencocokan satu-ke-satu untuk membandingkan data di bidang mobile_phone input dengan data di bidang mobile_phone input dan untuk membandingkan data di bidang home_phone input dengan data di bidang home_phone input. Data di bidang mobile_phone input tidak akan dibandingkan dengan data di bidang home_phone input.
Aturan pencocokan mengevaluasi data di beberapa bidang input dengan kunci pencocokan yang sama dengan operasi (atau), dan pencocokan satu-ke-banyak membandingkan nilai dalam satu bidang input. Ini berarti bahwa jika mobile_phone atau home_phone cocok antara dua catatan, tombol kecocokan “Telepon” akan mengembalikan kecocokan. Untuk tombol kecocokan “Telepon” untuk menemukan kecocokan, Record One
mobile_phone = Record Two mobile_phone ATAURecord One home_phone = Record Two
home_phone.
Aturan pencocokan mengevaluasi data di bidang input dengan kunci kecocokan yang berbeda dengan operasi (dan). Jika Anda ingin pencocokan berbasis aturan untuk mempertimbangkan berbagai jenis informasi nomor telepon secara terpisah, Anda dapat membuat kunci pencocokan yang lebih spesifik seperti “mobile_phone” dan “home_phone”. Jika Anda ingin menggunakan kedua tombol kecocokan dalam aturan untuk menemukan kecocokan, Record One
mobile_phone = Record Two mobile_phone DANRecord One home_phone = Record Two
home_phone.
Output
Daftar OutputAttribute objek, yang masing-masing memiliki bidang Nama dan Hashed. Masing-masing objek ini mewakili kolom yang akan dimasukkan dalam tabel AWS Glue keluaran dan apakah Anda ingin nilai-nilai dalam kolom untuk di-hash.
Output3path
Tujuan S3 yang Resolusi Entitas AWS akan menulis tabel keluaran.
OutputSourceConfig
Daftar OutputSource objek, yang masing-masing memiliki bidang outputs3path, ApplyNormalization, dan Output.
Pencocokan berbasis layanan penyedia
Pencocokan berbasis layanan penyedia adalah proses yang dirancang untuk mencocokkan, menautkan, dan meningkatkan catatan Anda dengan penyedia layanan data pilihan dan kumpulan data berlisensi. Anda harus berlangganan melalui AWS Data Exchange layanan penyedia untuk menggunakan teknik pencocokan ini.
Resolusi Entitas AWS saat ini terintegrasi dengan penyedia layanan data berikut:
-
LiveRamp
-
TransUnion
-
UID 2.0
Rule-based mencocokkan
Rule-based pencocokan adalah proses yang dirancang untuk menemukan kecocokan yang tepat. Rule-based pencocokan adalah seperangkat aturan pencocokan air terjun hierarkis Resolusi Entitas AWS, disarankan oleh, berdasarkan data yang Anda masukkan dan sepenuhnya dapat dikonfigurasi oleh Anda. Semua kunci kecocokan yang disediakan dalam kriteria aturan harus cocok dengan tepat agar data yang dibandingkan dinyatakan sebagai kecocokan dan agar metadata terkait dapat dikeluarkan. Rule-based pencocokan mengembalikan ID Pen cocokan dan nomor aturan untuk setiap kumpulan data yang cocok.
Kami merekomendasikan untuk mendefinisikan aturan yang dapat mengidentifikasi entitas secara unik. Urutkan aturan Anda untuk menemukan kecocokan yang lebih tepat terlebih dahulu.
Misalnya, katakanlah Anda memiliki dua aturan, A turan 1 dan A turan 2.
Aturan-aturan ini memiliki kunci kecocokan berikut:
-
Aturan 1 termasuk Nama lengkap dan Alamat
-
Aturan 2 termasuk Nama Lengkap, Alamat, dan Telepon
Karena Aturan 1 berjalan lebih dulu, tidak ada pertandingan yang akan ditemukan oleh A turan 2 karena semuanya akan ditemukan oleh A turan 1.
Untuk menemukan kecocokan yang dibedakan berdasarkan Telepon, susun ulang aturan, seperti ini:
-
Aturan 2 termasuk Nama Lengkap, Alamat, dan Telepon
-
Aturan 1 termasuk Nama lengkap dan Alamat
Pencocokan transitif
Pencocokan transitif adalah fitur opsional untuk alur Rule-based mencocokkan kerja pencocokan berbasis aturan yang menggunakan tipe aturan lanjutan. Secara default, Resolusi Entitas AWS menggunakan pendekatan pencocokan air terjun di mana catatan yang dicocokkan pada tingkat aturan yang lebih tinggi dikecualikan dari aturan berikutnya. Dengan pencocokan transitif diaktifkan, semua catatan diproses di semua tingkat aturan. ID keco cokan catatan ditetapkan pada pertandingan pertamanya, tetapi catatan terus bertindak sebagai tautan untuk menghubungkan catatan yang tidak cocok dari aturan selanjutnya untuk mencocokkan grup dari aturan sebelumnya.
Untuk informasi selengkapnya, lihat Menggunakan pencocokan transitif.
Skema
Istilah yang digunakan untuk struktur atau tata letak yang mendefinisikan bagaimana satu set data diatur dan terhubung.
Deskripsi skema
Deskripsi opsional skema yang dapat Anda pilih untuk dimasukkan. Deskripsi membantu Anda membedakan antara pemetaan skema jika Anda membuat lebih dari satu.
Nama skema
Nama skema.
catatan
Nama skema harus unik. Mereka tidak dapat memiliki nama yang sama atau kesalahan akan dikembalikan.
Pemetaan skema
Pemetaan skema Resolusi Entitas AWS adalah proses di mana Anda memberi tahu Resolusi Entitas AWS cara menafsirkan data Anda untuk pencocokan. Anda menentukan skema tabel data input yang ingin Anda baca Resolusi Entitas AWS ke alur kerja yang cocok.
Pemetaan skema ARN
Nama Sumber Daya Amazon (ARN) yang dihasilkan untuk pemetaan skema.
ID unik
Pengidentifikasi unik yang Anda tentukan dan yang harus ditetapkan untuk setiap baris data input yang di Resolusi Entitas AWS baca.
contoh
Misalnya: Primary_key, Row_ID, atau Record_ID.
Kol om ID Unik diperlukan.
ID Unik harus berupa pengidentifikasi unik dalam satu tabel.
ID Unik harus memenuhi pola ini: [a-zA-Z0-9_-]
Di berbagai tabel, ID Unik dapat memiliki nilai duplikat.
Panjang ID Unik maksimum adalah 38 untuk alur kerja yang cocok
Panjang ID Unik maksimum 257 karakter untuk Alur kerja pemetaan ID
Saat alur kerja pen cocokan dijalankan, catatan akan ditolak jika ID Unik:
-
tidak ditentukan
-
tidak unik dalam tabel yang sama
-
tumpang tindih dalam hal nama atribut di seluruh sumber
-
melebihi 38 karakter (hanya alur kerja pencocokan berbasis aturan)