Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Optimisation des performances des requêtes à l’aide des statistiques de colonne
Vous pouvez calculer des statistiques au niveau des colonnes pour les AWS Glue Data Catalog tableaux dans des formats de données tels que Parquet, ORC, JSON, ION, CSV et XML sans configurer de pipelines de données supplémentaires. Les statistiques de colonne vous aident à comprendre les profils de données en obtenant des informations sur les valeurs d'une colonne.
Data Catalog permet de générer des statistiques pour les valeurs des colonnes, telles que la valeur minimale, la valeur maximale, le total des valeurs nulles, le total des valeurs distinctes, la longueur moyenne des valeurs et le nombre total d'occurrences de valeurs vraies. AWS des services d'analyse tels qu'Amazon Redshift et Amazon Athena peuvent utiliser ces statistiques de colonne pour générer des plans d'exécution des requêtes et choisir le plan optimal qui améliore les performances des requêtes.
Il existe trois scénarios pour générer des statistiques de colonne :
- Automatique
AWS Glue prend en charge la génération automatique de statistiques de colonnes au niveau du catalogue afin de générer automatiquement des statistiques pour les nouvelles tables du. AWS Glue Data Catalog
- Planifié
AWS Glue prend en charge la génération de statistiques de colonne de planification afin qu'elle puisse être exécutée automatiquement selon un calendrier récurrent.
Avec le calcul planifié des statistiques, la tâche de statistiques de colonne met à jour les statistiques globales au niveau de la table, telles que min, max et avg, avec les nouvelles statistiques, fournissant ainsi aux moteurs de requêtes des statistiques précises et actualisées pour optimiser l’exécution des requêtes.
- On-demand
Utilisez cette option pour générer des statistiques de colonnes à la demande chaque fois que cela s’avère nécessaire. Cela est utile pour les analyses ad hoc ou lorsque les statistiques doivent être calculées immédiatement.
Vous pouvez configurer pour exécuter une tâche de génération de statistiques de colonne à l'aide d' AWS CLI opérations de AWS Glue console et AWS Glue d'API. Lorsque vous lancez le processus, AWS Glue lancez une tâche Spark en arrière-plan et mettez à jour les métadonnées de la AWS Glue table dans le catalogue de données. Vous pouvez consulter les statistiques des colonnes à l'aide de la AWS Glue console AWS CLI ou en appelant l'opération GetColumnStatisticsForTable API.
Note
Si vous utilisez les autorisations de Lake Formation pour contrôler l'accès à la table, le rôle assumé par la tâche de statistiques de colonne nécessite un accès complet à la table pour générer des statistiques.
Note
Les statistiques de colonne ne prennent pas en charge les types de données Iceberg v3, notamment VARIANT, UNKNOWN, Geography et Geometry. Les colonnes contenant ces types de données sont ignorées lors de la génération des statistiques.
La vidéo suivante montre comment améliorer les performances des requêtes à l’aide des statistiques de colonne.