Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
AWS Entity Resolution Glossario
Nome della risorsa Amazon (ARN)
Un identificatore univoco per le risorse. AWS Gli ARN sono necessari quando è necessario specificare una risorsa in modo univoco in tutte le aree AWS Entity Resolution, ad esempio nelle AWS Entity Resolution policy, nei tag Amazon Relational Database Service (Amazon RDS) e nelle chiamate API.
Tipo di attributo
Tipo di attributo per il campo di input. Quando si crea una mappatura dello schema, si seleziona il tipo di attributo da un elenco preconfigurato di valori come nome, indirizzo , numero di telefono o indirizzo e-mail. Il tipo di attributo indica il AWS Entity Resolution tipo di dati che stai presentando, consentendone la classificazione e la normalizzazione corretta.
Elaborazione automatica
Un'opzione di cadenza di elaborazione per un processo di flusso di lavoro corrispondente che ne consente l'esecuzione automatica quando l'input dei dati cambia.
Questa opzione è disponibile solo per la corrispondenza basata su regole.
Per impostazione predefinita, la cadenza di elaborazione per un processo di workflow corrispondente è impostata su Manuale , il che ne consente l'esecuzione su richiesta. È possibile impostare l'elaborazione automatica per eseguire automaticamente il processo di flusso di lavoro corrispondente quando l'input dei dati cambia. Ciò mantiene aggiornato l'output del flusso di lavoro corrispondente.
AWS KMS key ARN
Questo è il tuo AWS KMS Amazon Resource Name (ARN) per la crittografia a riposo. Se non viene fornita, il sistema utilizzerà una chiave KMS AWS Entity Resolution gestita.
Flusso di lavoro batch
Un processo che viene eseguito a intervalli pianificati per abbinare e risolvere i dati di un intero set di dati. I flussi di lavoro in batch AWS Entity Resolution sono utilizzati al meglio per la configurazione iniziale, gli aggiornamenti completi periodici e gli scenari con modifiche significative nei set di dati di origine e di destinazione.
Testo in chiaro
Dati non protetti crittograficamente.
Livello di confidenza () ConfidenceLevel
Per la corrispondenza ML, questo è il livello di confidenza applicato AWS Entity Resolution quando ML identifica un set di record corrispondente. Questo fa parte dei metadati del flusso di lavoro corrispondenti che verranno inclusi nell'output.
Livello di confidenza dei record () RecordConfidenceLevel
Per la corrispondenza incrementale ML, questo è il livello di confidenza per record applicato AWS Entity Resolution quando ML identifica un set di record corrispondente. Questo fa parte dei metadati del flusso di lavoro corrispondenti che verranno inclusi nell'output.
Decrittografia
Processo di trasformazione dei dati crittografati nella loro forma originale. La decrittografia può essere eseguita solo se si ha accesso alla chiave segreta.
Encryption (Crittografia)
Processo di codifica dei dati in un formato che appare casuale utilizzando un valore segreto chiamato chiave. È impossibile determinare il testo in chiaro originale senza accedere alla chiave.
Group name (Nome gruppo)
Il nome del gruppo fa riferimento all'intero gruppo di campi di input e può aiutarti a raggruppare i dati analizzati per scopi corrispondenti.
Ad esempio, se sono presenti tre campi di input: first_namemiddle_name, elast_name, puoi raggrupparli inserendo il nome del gruppo full_name per la corrispondenza e l'output.
Hash
L'hashing significa applicare un algoritmo crittografico che produce una stringa di caratteri irreversibile e unica di dimensione fissa, chiamata hash. AWS Entity Resolution utilizza il protocollo hash Secure Hash Algorithm a 256 bit (SHA256) e produrrà una stringa di caratteri da 32 byte. In AWS Entity Resolution, puoi scegliere se eseguire l'hashing dei valori dei dati nell'output.
Protocollo hash () HashingProtocol
AWS Entity Resolution utilizza il protocollo hash Secure Hash Algorithm 256-bit (SHA256) e produrrà una stringa di caratteri da 32 byte. Questo fa parte dei metadati del flusso di lavoro corrispondenti che verranno inclusi nell'output.
Metodo di mappatura degli ID
Come desideri che venga eseguita la mappatura degli ID.
Esistono due metodi di mappatura degli ID:
-
Rule-based — Il metodo con cui si utilizzano le regole di corrispondenza per tradurre i dati di prime parti da un'origine a una destinazione in un flusso di lavoro di mappatura degli ID.
-
Servizi del provider: il metodo con cui si utilizza un servizio del provider per tradurre i dati codificati da terze parti da un'origine a una destinazione in un flusso di lavoro di mappatura degli ID.
AWS Entity Resolution attualmente supporta LiveRamp come metodo di mappatura degli ID basato sui servizi del provider. È necessario disporre di un abbonamento a LiveRamp through per AWS Data Exchange utilizzare questo metodo. Per ulteriori informazioni, consulta Fase 1: Abbonarsi a un servizio fornito da un provider su AWS Data Exchange.
Workflow di mappatura degli ID
Un processo di elaborazione dati che mappa i dati da un'origine dati di input a una destinazione di dati di input in base al metodo di mappatura degli ID specificato. Produce una tabella di mappatura degli ID. Questo flusso di lavoro richiede di specificare il metodo di mappatura degli ID e i dati di input che si desidera tradurre da una fonte a una destinazione.
Puoi configurare un flusso di lavoro di mappatura degli ID da eseguire singolarmente Account AWS o su due. Account AWS
Namespace ID
Una risorsa AWS Entity Resolution che contiene metadati che spiegano i set di dati su più set di dati Account AWS e come utilizzarli in un flusso di lavoro di mappatura degli ID. Workflow di mappatura degli ID
Esistono due tipi di namespace ID: e. SOURCE TARGET SOURCEContiene le configurazioni per i dati di origine che verranno elaborati in un flusso di lavoro di mappatura degli ID. TARGETContiene una configurazione dei dati di destinazione in cui verranno risolte tutte le fonti. Per definire i dati di input che desideri risolvere in due Account AWS, crea una sorgente dello spazio dei nomi ID e una destinazione dello spazio dei nomi ID per tradurre i dati da un set () a un altro ()SOURCE. TARGET
Dopo che tu e un altro membro avete creato gli spazi dei nomi ID ed eseguito un flusso di lavoro di mappatura degli ID, potete unirvi a una collaborazione AWS Clean Rooms per eseguire un'unione di più tabelle sulla tabella di mappatura degli ID e analizzare i dati.
Per ulteriori informazioni, consulta la Guida per l’utente di AWS Clean Rooms.
Flusso di lavoro incrementale
Un processo che abbina e risolve solo i record nuovi o aggiornati dall'ultima esecuzione, anziché elaborare l'intero set di dati. I flussi di lavoro incrementali in entrata AWS Entity Resolution sono utilizzati al meglio per gli aggiornamenti frequenti per mantenere la freschezza dei dati quando è stata modificata solo una piccola parte del set di dati.
Campo di immissione
Un campo di input corrisponde al nome di una colonna della tabella dei dati AWS Glue di input.
Fonte di ingresso ARN (InputSourceARN)
L'Amazon Resource Name (ARN) generato per l'input di una AWS Glue tabella. Questo fa parte dei metadati corrispondenti del flusso di lavoro che verranno inclusi nell'output.
Abbinamento basato sul machine learning
La corrispondenza basata sull'apprendimento automatico (ML matching) trova corrispondenze tra i dati che potrebbero essere incomplete o che potrebbero non apparire esattamente uguali. La corrispondenza ML è un processo preimpostato che tenterà di abbinare i record di tutti i dati inseriti. La corrispondenza ML restituisce un ID di corrispondenza e un livello di confidenza per ogni set di dati corrispondente.
Elaborazione manuale
Un'opzione di cadenza di elaborazione per un processo di flusso di lavoro corrispondente che ne consente l'esecuzione su richiesta.
Questa opzione è impostata per impostazione predefinita ed è disponibile sia per la corrispondenza basata su regole che per la corrispondenza basata sull'apprendimento automatico.
Many-to-Many abbinamento
Many-to-many la corrispondenza confronta più istanze di dati simili. I valori nei campi di input a cui è stata assegnata la stessa chiave di corrispondenza verranno confrontati tra loro, indipendentemente dal fatto che si trovino nello stesso campo di input o in campi di input diversi.
Ad esempio, potresti avere più campi di immissione del numero di telefono come «Telefono» mobile_phone e home_phone che hanno lo stesso tasto di corrispondenza. Utilizza la corrispondenza molti-a-molti per confrontare i dati nel campo mobile_phone di immissione con i dati nel campo di mobile_phone immissione e i dati nel campo di home_phone immissione.
Le regole di corrispondenza valutano i dati in più campi di input con la stessa chiave di corrispondenza con un'operazione (o) e la corrispondenza uno-a-molti confronta i valori di più campi di input. Ciò significa che se una combinazione mobile_phone o home_phone corrisponde tra due record, il tasto di corrispondenza «Telefono» restituirà una corrispondenza. Per trovare una corrispondenza con il tasto «Telefono», Record One mobile_phone = Record Two mobile_phone Record One mobile_phone
= Record Two home_phone OR Record One home_phone = Record Two home_phone ORRecord One home_phone = Record Two mobile_phone.
ID partita (MatchID)
Per la corrispondenza basata su regole e la corrispondenza ML, questo è l'ID generato AWS Entity Resolution e applicato a ciascun set di record corrispondente. Questo fa parte dei metadati del flusso di lavoro corrispondenti che verranno inclusi nell'output.
Tasto Match () MatchKey
La chiave Match indica AWS Entity Resolution quali campi di input considerare come dati simili e quali come dati diversi. Ciò consente di configurare AWS Entity Resolution automaticamente le regole di corrispondenza basate su regole e di confrontare dati simili memorizzati in diversi campi di input.
Se nei tuoi dati sono presenti più tipi di informazioni sul numero di telefono, ad esempio un mobile_phone campo di home_phone immissione e un campo di immissione, puoi assegnare a entrambi il tasto di corrispondenza «Telefono». Quindi la corrispondenza basata su regole può essere configurata per confrontare i dati utilizzando le istruzioni «o» in tutti i campi di input con il tasto di corrispondenza «Telefono» (vedi One-to-One Corrispondenza e Many-to-Many corrispondenza delle definizioni nella sezione Matching Workflow).
Se desideri che la corrispondenza basata su regole consideri diversi tipi di informazioni sui numeri di telefono in modo completamente separato, puoi creare chiavi di corrispondenza più specifiche come «Mobile_Phone» e «». Home_Phone Quindi, quando imposti un flusso di lavoro di corrispondenza, puoi specificare in che modo ogni chiave di corrispondenza telefonica verrà utilizzata nella corrispondenza basata su regole.
Se MatchKey viene specificato un no per un particolare campo di input, non può essere utilizzato per la corrispondenza, ma può essere eseguito durante il processo del flusso di lavoro di abbinamento e può essere emesso se lo si desidera.
Abbina il nome della chiave
Il nome assegnato a una chiave Match.
Regola di abbinamento (MatchRule)
Per la corrispondenza basata su regole, questo è il numero della regola applicata che ha generato un set di record corrispondente. Questo fa parte dei metadati del flusso di lavoro corrispondenti che verranno inclusi nell'output.
Corrispondenza
Processo di combinazione e confronto dei dati provenienti da diversi campi di input, tabelle o database e di determinazione dei dati simili (o «corrispondenti») in base al soddisfacimento di determinati criteri di corrispondenza (ad esempio, tramite regole o modelli di corrispondenza).
Flusso di lavoro corrispondente
Processo impostato per specificare i dati di input da abbinare e come deve essere eseguita la corrispondenza.
Descrizione del flusso di lavoro corrispondente
Una descrizione opzionale del flusso di lavoro corrispondente che potresti scegliere di inserire. Le descrizioni consentono di distinguere i flussi di lavoro corrispondenti se ne crei più di uno.
Nome del flusso di lavoro corrispondente
Il nome del flusso di lavoro corrispondente specificato.
Nota
I nomi dei flussi di lavoro corrispondenti devono essere univoci. Non possono avere lo stesso nome o verrà restituito un errore.
Metadati del flusso di lavoro corrispondenti
Informazioni generate ed emesse AWS Entity Resolution durante un processo di flusso di lavoro corrispondente. Queste informazioni sono obbligatorie al momento dell'output.
Normalizzazione () ApplyNormalization
Scegli se normalizzare i dati di input come definito nello schema. La normalizzazione standardizza i dati rimuovendo spazi aggiuntivi e caratteri speciali e standardizzandoli in formato minuscolo.
Ad esempio, se un campo di input ha un tipo di attributo Full phone e i valori nella tabella di input sono formattati come(123) 456-7890, AWS Entity Resolution i valori verranno normalizzati a. 1234567890
Nota
Le sezioni seguenti descrivono le nostre regole di normalizzazione standard.
Per una ML-based corrispondenza specifica, vedereNormalizzazione () — solo ApplyNormalization ML-based.
Nome
Nota
La normalizzazione è supportata solo per il tipo di gruppo Name.
Il tipo di gruppo Name viene visualizzato come Nome completo nella console e come NAME nell'API.
Se desideri normalizzare i sottotipi del tipo di gruppo Name:
-
Nella console, assegna i seguenti sottotipi al gruppo Nome completo: Nome, Secondo nome e Cognome.
-
Nell'CreateSchemaMappingAPI, assegna i seguenti tipi al
NAMEGroupName:NAME_FIRST,NAME_MIDDLE, e.NAME_LAST
-
TRIM = Taglia gli spazi bianchi iniziali e finali
-
LOWERCASE = Riduce in minuscolo tutti i caratteri alfa
-
CONVERT_ACCENT = Da lettera accentata nascosta a lettera normale
-
REMOVE_ALL_NON_ALPHA = Rimuove tutti i caratteri non alfa [a-z] A-Z
Nota
La normalizzazione è supportata per il tipo di gruppo di posta elettronica.
Il tipo di gruppo di posta elettronica viene visualizzato come indirizzo e-mail nella console e come EMAIL_ADDRESS nell'API.
-
TRIM = Taglia gli spazi bianchi iniziali e finali
-
LOWERCASE = Riduce in minuscolo tutti i caratteri alfa
-
CONVERT_ACCENT = Da lettera accentata nascosta a lettera normale
-
EMAIL_ADDRESS_UTIL_NORM = Rimuove qualsiasi punto (.) dal nome utente, rimuove qualsiasi cosa dopo il segno più (+) nel nome utente e standardizza le varianti di dominio comuni
-
REMOVE_ALL_NON_EMAIL_CHARS = Rimuove tutti i caratteri non alfanumerici [a-z] e [.@-] A-Z0-9
Telefono
Nota
La normalizzazione è supportata solo per il tipo di gruppo Telefono.
Il tipo di gruppo telefonico viene visualizzato come Telefono completo nella console e come PHONE nell'API.
Se desideri normalizzare i sottotipi del tipo di gruppo Telefono:
-
Nella console, assegna i seguenti sottotipi al gruppo telefonico completo: numero di telefono e prefisso telefonico.
-
Nell'CreateSchemaMappingAPI, assegna i seguenti tipi al
PHONEGroupName:PHONE_NUMBERe.PHONE_COUNTRYCODE
-
TRIM = Taglia gli spazi bianchi iniziali e finali
-
REMOVE_ALL_NON_NUMERIC = Rimuove tutti i caratteri non numerici [0-9]
-
REMOVE_ALL_LEADING_ZEROES = Rimuove tutti gli zeri iniziali
-
ENSURE_PREFIX_WITH_MAP, «phone" = Esamina ogni numero di telefono e cerca di confrontarlo con gli schemi del telefonoPrefixMap. PrefixMap Se viene trovata una corrispondenza, la regola aggiungerà o modificherà il prefisso del numero di telefono per assicurarne la conformità al formato standardizzato specificato nella mappa.
Indirizzo
Nota
La normalizzazione è supportata solo per il tipo di gruppo di indirizzi.
Il tipo di gruppo di indirizzi viene visualizzato come Indirizzo completo nella console e come ADDRESS nell'API.
Se desideri normalizzare i sottotipi del tipo di gruppo di indirizzi:
-
Nella console, assegna i seguenti sottotipi al gruppo di indirizzi completo: Indirizzo 1, Indirizzo 2: Indirizzo 3, Nome città, Stato , Paese e Codice postale t
-
Nell'CreateSchemaMappingAPI, assegna i seguenti tipi al
ADDRESSGroupName:ADDRESS_STREET1,,ADDRESS_STREET2,ADDRESS_STREET3,ADDRESS_CITYADDRESS_STATEADDRESS_COUNTRY, e.ADDRESS_POSTALCODE
-
TRIM = Taglia gli spazi bianchi iniziali e finali
-
LOWERCASE = Riduce in minuscolo tutti i caratteri alfa
-
CONVERT_ACCENT = Da lettera accentata nascosta a lettera normale
-
REMOVE_ALL_NON_ALPHA = Rimuove tutti i caratteri non alfa [a-z] A-Z
-
RENAME_WORDS utilizzando ADDRESS_RENAME_WORD_MAP = sostituisci le parole nella stringa di indirizzo con le parole di ADDRESS_RENAME_WORD_MAP ADDRESS_RENAME_WORD_MAP
-
RENAME_DELIMITERS utilizzando ADDRESS_RENAME_DELIMITER_MAP = sostituisci i delimitatori nella stringa di indirizzo con la stringa di ADDRESS_RENAME_DELIMITER_MAP
-
RENAME_DIRECTIONS utilizzando ADDRESS_RENAME_DIRECTION_MAP = sostituisci i delimitatori nella stringa di indirizzo con una stringa da ADDRESS_RENAME_DIRECTION_MAP ADDRESS_RENAME_DIRECTION_MAP
-
RENAME_NUMBERS utilizzando ADDRESS_RENAME_NUMBER_MAP = sostituisci i numeri nella stringa di indirizzo con la stringa di ADDRESS_RENAME_NUMBER_MAP
-
RENAME_SPECIAL_CHARS utilizzando ADDRESS_RENAME_SPECIAL_CHAR_MAP = sostituisci i caratteri speciali nella stringa di indirizzo con la stringa di ADDRESS_RENAME_SPECIAL_CHAR_MAP
ADDRESS_RENAME_WORD_MAP
Queste sono le parole che verranno rinominate durante la normalizzazione della stringa di indirizzi.
"avenue": "ave", "bouled": "blvd", "circle": "cir", "circles": "cirs", "court": "ct", "centre": "ctr", "center": "ctr", "drive": "dr", "freeway": "fwy", "frwy": "fwy", "highway": "hwy", "lane": "ln", "parks": "park", "parkways": "pkwy", "pky": "pkwy", "pkway": "pkwy", "pkwys": "pkwy", "parkway": "pkwy", "parkwy": "pkwy", "place": "pl", "plaza": "plz", "plza": "plz", "road": "rd", "square": "sq", "squ": "sq", "sqr": "sq", "street": "st", "str": "st", "str.": "strasse"
ADDRESS_RENAME_DELIMITER_MAP
Questi sono i delimitatori che verranno rinominati durante la normalizzazione della stringa di indirizzi.
",": " ", ".": " ", "[": " ", "]": " ", "/": " ", "-": " ", "#": " number "
ADDRESS_RENAME_DIRECTION_MAP
Questi sono gli identificatori di direzione che verranno rinominati durante la normalizzazione della stringa di indirizzi.
"east": "e", "north": "n", "south": "s", "west": "w", "northeast": "ne", "northwest": "nw", "southeast": "se", "southwest": "sw"
ADDRESS_RENAME_NUMBER_MAP
Queste sono le stringhe numeriche che verranno rinominate durante la normalizzazione della stringa di indirizzo.
"número": "number", "numero": "number", "no": "number", "núm": "number", "num": "number"
ADDRESS_RENAME_SPECIAL_CHAR_MAP
Si tratta della stringa di caratteri speciali che verrà rinominata durante la normalizzazione della stringa di indirizzi.
"ß": "ss", "ä": "ae", "ö": "oe", "ü": "ue", "ø": "o", "æ": "ae"
Con hash
-
TRIM = Taglia gli spazi bianchi iniziali e finali
Source_ID
-
TRIM = Taglia gli spazi bianchi iniziali e finali
Normalizzazione () — solo ApplyNormalization ML-based
Scegli se normalizzare i dati di input come definito nello schema. La normalizzazione standardizza i dati rimuovendo spazi aggiuntivi e caratteri speciali e standardizzandoli in formato minuscolo.
Ad esempio, se un campo di input ha un tipo di attributo di NAME e i valori nella tabella di input sono formattati comeJohns Smith, AWS Entity Resolution i valori verranno normalizzati a. john smith
Le sezioni seguenti descrivono le regole di normalizzazione per i flussi di lavoro di abbinamento basati sull'apprendimento automatico.
Nome
-
TRIM = Taglia gli spazi bianchi iniziali e finali
-
LOWERCASE = Riduce in minuscolo tutti i caratteri alfa
-
LOWERCASE = Mette in minuscolo tutti i caratteri alfa
-
Sostituisce solo (at) (con distinzione tra maiuscole e minuscole) con un simbolo @
-
Rimuove tutti gli spazi bianchi, ovunque nel valore
-
Rimuove tutto ciò che è al di fuori del primo,
"<>"se esiste
Telefono
-
TRIM = Taglia gli spazi bianchi iniziali e finali
-
REMOVE_ALL_NON_NUMERIC = Rimuove tutti i caratteri non numerici [0-9]
-
REMOVE_ALL_LEADING_ZEROES = Rimuove tutti gli zeri iniziali
-
ENSURE_PREFIX_WITH_MAP, «phone" = Esamina ogni numero di telefono e cerca di confrontarlo con gli schemi del telefonoPrefixMap. PrefixMap Se viene trovata una corrispondenza, la regola aggiungerà o modificherà il prefisso del numero di telefono per assicurarne la conformità al formato standardizzato specificato nella mappa.
One-to-One corrispondente
One-to-one la corrispondenza confronta singole istanze di dati simili. I campi di input con la stessa chiave di corrispondenza e i valori nello stesso campo di input verranno confrontati tra loro.
Ad esempio, potresti avere più campi di immissione del numero di telefono come «Telefono» mobile_phone e home_phone che hanno lo stesso tasto di corrispondenza. Utilizza la corrispondenza uno a uno per confrontare i dati nel campo di mobile_phone immissione con i dati nel campo di mobile_phone immissione e per confrontare i dati nel campo di home_phone immissione con i dati nel campo di home_phone immissione. I dati nel campo mobile_phone di input non verranno confrontati con i dati nel campo di home_phone input.
Le regole di corrispondenza valutano i dati in più campi di input con la stessa chiave di corrispondenza con un'operazione (o) e la corrispondenza uno-a-molti confronta i valori all'interno di un singolo campo di input. Ciò significa che se due record home_phone corrispondono mobile_phone o corrispondono, il tasto di corrispondenza «Telefono» restituirà una corrispondenza. Per trovare una corrispondenza con il tasto «Telefono», Record One
mobile_phone = Record Two mobile_phone ORRecord One home_phone = Record Two
home_phone.
Le regole di corrispondenza valutano i dati nei campi di input con diverse chiavi di corrispondenza con un'operazione (e). Se desideri che la corrispondenza basata su regole consideri diversi tipi di informazioni sui numeri di telefono in modo completamente separato, puoi creare chiavi di corrispondenza più specifiche come «mobile_phone» e «home_phone». Se desideri utilizzare entrambi i tasti di corrispondenza in una regola per trovare le corrispondenze, AND. Record One
mobile_phone = Record Two mobile_phone Record One home_phone = Record Two
home_phone
Output
Un elenco di OutputAttribute oggetti, ognuno dei quali ha i campi Name e Hashed. Ognuno di questi oggetti rappresenta una colonna da includere nella tabella di AWS Glue output e indica se si desidera che i valori nella colonna vengano sottoposti a hashing.
Outputs3Path
La destinazione S3 in cui AWS Entity Resolution scriverà la tabella di output.
OutputSourceConfig
Un elenco di OutputSource oggetti, ognuno dei quali ha i campi OutputS3Path e Output. ApplyNormalization
Corrispondenza basata sui servizi del fornitore
La corrispondenza basata sui servizi dei fornitori è un processo progettato per abbinare, collegare e migliorare i tuoi record con i fornitori di servizi di dati preferiti e i set di dati con licenza. È necessario disporre di un abbonamento presso il AWS Data Exchange servizio del fornitore per utilizzare questa tecnica di abbinamento.
AWS Entity Resolution attualmente si integra con i seguenti fornitori di servizi dati:
-
LiveRamp
-
TransUnion
-
UID 2.0
Rule-based abbinamento
Rule-based la corrispondenza è un processo progettato per trovare corrispondenze esatte. Rule-based la corrispondenza è un insieme gerarchico di regole di abbinamento a cascata, suggerite da AWS Entity Resolution, basate sui dati inseriti e completamente configurabili dall'utente. Tutte le chiavi di corrispondenza fornite all'interno dei criteri delle regole devono corrispondere esattamente affinché i dati confrontati siano dichiarati corrispondenti e vengano emessi i metadati associati. Rule-based la corrispondenza restituisce un Match ID e un numero di regola per ogni set di dati corrispondente.
Consigliamo di definire regole in grado di identificare in modo univoco un'entità. Ordina le tue regole per trovare prima corrispondenze più precise.
Ad esempio, supponiamo che tu abbia due regole, Regola 1 e Regola 2.
Queste regole hanno le seguenti chiavi di corrispondenza:
-
La regola 1 include il nome completo e l'indirizzo
-
La regola 2 include nome completo, indirizzo e telefono
Poiché la Regola 1 viene eseguita per prima, nessuna corrispondenza verrà trovata dalla Regola 2 perché sarebbero state tutte trovate dalla Regola 1.
Per trovare le corrispondenze differenziate per telefono, riordina le regole, in questo modo:
-
La regola 2 include nome completo, indirizzo e telefono
-
La regola 1 include nome completo e indirizzo
Corrispondenza transitiva
La corrispondenza transitiva è una funzionalità opzionale per i flussi di lavoro di corrispondenza basati su regole che utilizzano il tipo di regola Avanzato. Per impostazione predefinita, AWS Entity Resolution utilizza un approccio di corrispondenza a cascata in cui i record corrispondenti a un livello di regola superiore vengono esclusi dalle regole successive. Con la corrispondenza transitiva abilitata, tutti i record vengono elaborati a tutti i livelli di regole. L'ID di corrispondenza di un record viene fissato al momento della prima corrispondenza, ma il record continua a fungere da collegamento per collegare i record non corrispondenti delle regole successive ai gruppi corrispondenti delle regole precedenti.
Per ulteriori informazioni, consulta Utilizzo della corrispondenza transitiva.
Schema
Termine utilizzato per indicare una struttura o un layout che definisce il modo in cui un set di dati è organizzato e connesso.
Descrizione dello schema
Una descrizione opzionale dello schema che puoi scegliere di inserire. Le descrizioni consentono di distinguere le mappature dello schema se ne crei più di una.
Nome dello schema
Il nome dello schema.
Nota
I nomi degli schemi devono essere univoci. Non possono avere lo stesso nome o verrà restituito un errore.
Mappatura dello schema
La mappatura dello schema AWS Entity Resolution è il processo mediante il quale si indica AWS Entity Resolution come interpretare i dati per verificarne la corrispondenza. Si definisce lo schema della tabella dei dati di input che si AWS Entity Resolution desidera leggere in un flusso di lavoro corrispondente.
Mappatura dello schema ARN
L'Amazon Resource Name (ARN) generato per la mappatura dello schema.
ID univoco
Un identificatore univoco indicato dall'utente e che deve essere assegnato a ogni riga di dati di input letta. AWS Entity Resolution
Esempio
Ad esempio: Primary_key, Row_ID o Record_ID.
La colonna ID univoco è obbligatoria.
L'ID univoco deve essere un identificatore univoco all'interno di una singola tabella.
L'ID univoco deve soddisfare questo schema: [a-zA-Z0-9_-]
In diverse tabelle, l'ID univoco può avere valori duplicati.
La lunghezza massima dell'ID univoco è 38 per un flusso di lavoro corrispondente
La lunghezza massima dell'ID univoco 257 caratteri per a Workflow di mappatura degli ID
Quando viene eseguito il flusso di lavoro corrispondente, il record verrà rifiutato se l'ID univoco:
-
non è specificato
-
non è univoco all'interno della stessa tabella
-
si sovrappone in termini di nome dell'attributo tra le fonti
-
supera i 38 caratteri (solo flussi di lavoro di corrispondenza basati su regole)