View a markdown version of this page

Ottimizzazione delle prestazioni delle query con le statistiche delle colonne - AWS Aderenza

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

Ottimizzazione delle prestazioni delle query con le statistiche delle colonne

È possibile calcolare statistiche a livello di colonna per AWS Glue Data Catalog tabelle in formati di dati come Parquet, ORC, JSON, ION, CSV e XML senza configurare pipeline di dati aggiuntive. Le statistiche delle colonne consentono di comprendere i profili di dati ottenendo informazioni dettagliate sui valori all'interno di una colonna.

Data Catalog supporta la generazione di statistiche per valori di colonna come valore minimo, valore massimo, valori nulli totali, valori distinti totali, lunghezza media dei valori e occorrenze totali di valori reali. AWS servizi analitici come Amazon Redshift e Amazon Athena possono utilizzare queste statistiche su colonne per generare piani di esecuzione delle query e scegliere il piano ottimale che migliora le prestazioni delle query.

Sono possibili tre scenari per generare le statistiche delle colonne:

Automatico

AWS Glue supporta la generazione automatica di statistiche sulle colonne a livello di catalogo in modo da poter generare automaticamente statistiche per nuove tabelle in. AWS Glue Data Catalog

Pianificato

AWS Glue supporta la generazione di statistiche sulle colonne di pianificazione in modo che possa essere eseguita automaticamente su una pianificazione ricorrente.

Con il calcolo pianificato delle statistiche, l'attività di statistica delle colonne aggiorna le statistiche complessive a livello di tabella, ad esempio min, max e medio, con le nuove statistiche, fornendo ai motori di query statistiche accurate e aggiornate per ottimizzare la loro esecuzione.

On-demand

Utilizzare questa opzione per generare statistiche delle colonne on demand ogni volta che è necessario. Questo è utile per analisi ad hoc o quando le statistiche devono essere calcolate immediatamente.

È possibile configurare l'esecuzione dell'attività di generazione delle statistiche delle colonne utilizzando la AWS Glue console e AWS Glue le operazioni AWS CLI API. Quando avvii il processo, AWS Glue avvia un processo Spark in background e aggiorna i metadati della AWS Glue tabella nel catalogo dati. Puoi visualizzare le statistiche delle colonne usando la AWS Glue console AWS CLI o chiamando l'operazione API. GetColumnStatisticsForTable

Nota

Se utilizzi le autorizzazioni di Lake Formation per controllare l'accesso alla tabella, il ruolo assunto dall'attività di statistica delle colonne richiede l'accesso completo alla tabella per generare statistiche.

Nota

Le statistiche sulle colonne non supportano i tipi di dati Iceberg v3, inclusi VARIANT, UNKNOWN, Geography e Geometry. Le colonne con questi tipi di dati vengono saltate durante la generazione delle statistiche.

Il video seguente illustra come migliorare le prestazioni delle query utilizzando le statistiche delle colonne.