Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Ottimizzazione delle prestazioni delle query per le tabelle Iceberg
Apache Iceberg è un formato a tabella aperta ad alte prestazioni per enormi set di dati di analisi. AWS Glue supporta il calcolo e l'aggiornamento del numero di valori distinti (NDV) per ogni colonna nelle tabelle Iceberg. Queste statistiche possono facilitare una migliore ottimizzazione delle query, la gestione dei dati e l'efficienza delle prestazioni per gli ingegneri e gli scienziati che lavorano con set di dati su larga scala.
AWS Glue stima il numero di valori distinti in ogni colonna della tabella Iceberg e li memorizza nei file
È possibile configurare l'esecuzione dell'attività di generazione delle statistiche delle colonne utilizzando la console o. AWS Glue AWS CLI Quando avvii il processo, AWS Glue avvia un job Spark in background e aggiorna i metadati della AWS Glue tabella nel Data Catalog. Puoi visualizzare le statistiche delle colonne usando la AWS Glue console AWS CLI o chiamando l'operazione API. GetColumnStatisticsForTable
Nota
Se utilizzi AWS Lake Formation le autorizzazioni per controllare l'accesso alla tabella, il ruolo assunto dall'attività di statistica delle colonne richiede l'accesso completo alla tabella per generare statistiche.