View a markdown version of this page

Distribuzione - AWS Aderenza

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

Distribuzione

Usa l'Distributionanalizzatore per calcolare la distribuzione di frequenza dei valori in una colonna. L'analizzatore produce diversi output a seconda del tipo di dati della colonna:

  • Colonne numeriche: genera un istogramma raggruppato. L'istogramma divide l'intervallo di valori della colonna in intervalli di uguale larghezza (bin) e conta il numero di valori in ogni raccoglitore.

  • Stringa, data e altre colonne non numeriche: genera una distribuzione dei valori che conta la frequenza di ogni valore distinto, ordinata in ordine decrescente per frequenza. L'analizzatore restituisce solo i primi 20 valori più frequenti.

Nota

È possibile utilizzare l'DistributionAnalyzer solo nel Analyzers blocco del set di regole DQDL. Non può essere usato come regola.

Sintassi

Distribution <COL_NAME> Distribution <COL_NAME> with bins = <BIN_COUNT> Distribution <COL_NAME> with bins = <BIN_COUNT>, rebin = <true|false>
  • COL_NAME — Il nome della colonna da analizzare o per calcolare le distribuzioni AllColumns per tutte le colonne del set di dati.

    Tipi di colonna supportati: qualsiasi tipo di colonna

  • bins (opzionale) — Il numero di bin (intervalli) da utilizzare per gli istogrammi numerici delle colonne. Il valore predefinito è 20. Il valore massimo è 20. Questo parametro non ha effetto sulle colonne non numeriche.

  • rebin (opzionale) — Controlla il comportamento di rebinning automatico. Quando l'overflow supera la soglia per esecuzioni consecutive, l'analizzatore si riavvia automaticamente. Il valore predefinito è true. Impostato per mantenere i bordi del contenitore congelati false a tempo indeterminato indipendentemente dalla frequenza di overflow. Per ulteriori informazioni, consulta Riavvio automatico.

Esempio: distribuzione di base per una singola colonna

L'esempio seguente calcola una distribuzione di frequenza per la Salary colonna utilizzando i 20 bin predefiniti:

Analyzers = [ Distribution "Salary" ]

Esempio: numero di raccoglitori personalizzato

L'esempio seguente calcola un istogramma per la Age colonna utilizzando 10 contenitori:

Analyzers = [ Distribution "Age" with bins = 10 ]

Esempio: distribuzione per tutte le colonne

L'esempio seguente calcola le distribuzioni per tutte le colonne del set di dati. Le colonne numeriche producono istogrammi con 20 contenitori e le colonne non numeriche producono distribuzioni di valori:

Analyzers = [ Distribution AllColumns ]

Esempio: combinazione con regole e altri analizzatori

L'esempio seguente mostra un set di regole che combina regole, analizzatori standard e l'analizzatore: Distribution

Rules = [ RowCount > 100, Completeness "Salary" > 0.9 ] Analyzers = [ Mean "Salary", StandardDeviation "Salary", Distribution "Salary" with bins = 15, Distribution "Department" ]

Formato di output

Quando si esegue l'DistributionAnalyzer, viene prodotta una statistica denominata. Distribution Le statistiche scalari (come Mean oSum) restituiscono un singolo valore numerico. La Distribution statistica, al contrario, restituisce un risultato strutturato:

  • BinEdges— Una matrice che definisce i limiti del contenitore (per le colonne numeriche) o i valori distinti (per le colonne non numeriche).

  • Count— Una serie di frequenze per ogni contenitore o valore.

È possibile recuperare i risultati della distribuzione utilizzando l'ListDataQualityStatisticsAPI o l'GetDataQualityResultAPI. Per ulteriori informazioni sulle API Data Quality, consulta le API Data Quality nel AWS Glue API Reference.

Comportamento nullo

L'analizzatore esclude le righe con valori NULL nella colonna di destinazione dal calcolo del bin.

Per ulteriori informazioni sui bordi dei bin bloccati, sulle osservazioni di overflow e sul rebinning automatico, vedere. Analizzatore di distribuzione