Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Concetti e termini fondamentali in AWS Glue DataBrew
Di seguito, è possibile trovare una panoramica dei concetti e della terminologia principali in AWS Glue DataBrew. Dopo aver letto questa sezione, vedeteNozioni di base su AWS Glue DataBrew, che illustra il processo di creazione di progetti, connessione dei set di dati e esecuzione dei job.
Progetto
L'area di lavoro interattiva per la preparazione dei dati in DataBrew si chiama progetto. Utilizzando un progetto di dati, gestisci una raccolta di elementi correlati: dati, trasformazioni e processi pianificati. Come parte della creazione di un progetto, scegli o crei un set di dati su cui lavorare. Successivamente, crei una ricetta, che è un insieme di istruzioni o passaggi su cui DataBrew vuoi agire. Queste azioni trasformano i dati grezzi in un modulo pronto per essere utilizzato dalla pipeline di dati.
Set di dati
Per set di dati si intende semplicemente un insieme di dati, ovvero righe o record suddivisi in colonne o campi. Quando crei un DataBrew progetto, ti connetti o carichi i dati che desideri trasformare o preparare. DataBrew può lavorare con dati provenienti da qualsiasi fonte, importati da file formattati, e si collega direttamente a un elenco crescente di archivi dati.
Infatti DataBrew, un set di dati è una connessione di sola lettura ai dati. DataBrew raccoglie una serie di metadati descrittivi per fare riferimento ai dati. Nessun dato effettivo può essere modificato o archiviato da. DataBrew Per semplicità, utilizziamo il set di dati per fare riferimento sia al set di dati effettivo che agli usi dei metadati. DataBrew
Recipe
In DataBrew, una ricetta è un insieme di istruzioni o passaggi relativi ai dati su cui si desidera DataBrew agire. Una ricetta può contenere molti passaggi e ogni passaggio può contenere molte azioni. Utilizzi gli strumenti di trasformazione sulla barra degli strumenti per impostare tutte le modifiche che desideri apportare ai tuoi dati. Successivamente, quando sei pronto per vedere il prodotto finito della tua ricetta, assegni questo lavoro DataBrew e lo pianifichi. DataBrew memorizza le istruzioni sulla trasformazione dei dati, ma non memorizza nessuno dei dati effettivi. Puoi scaricare e riutilizzare le ricette in altri progetti. Puoi anche pubblicare più versioni di una ricetta.
Processo
DataBrew si occupa di trasformare i dati eseguendo le istruzioni impostate durante la preparazione di una ricetta. Il processo di esecuzione di queste istruzioni è chiamato processo. Un job può mettere in atto le tue ricette di dati in base a una pianificazione preimpostata. Ma non sei limitato a un programma. Puoi anche eseguire lavori su richiesta. Se vuoi profilare alcuni dati, non hai bisogno di una ricetta. In tal caso, puoi semplicemente impostare un processo di profilazione per creare un profilo di dati.
Data lineage
DataBrew tiene traccia dei dati in un'interfaccia visiva per determinarne l'origine, chiamata derivazione dei dati. Questa visualizzazione mostra come i dati fluiscono attraverso diverse entità da dove provenivano originariamente. Puoi vederne l'origine, le altre entità da cui è stato influenzato, cosa gli è successo nel tempo e dove sono stati archiviati.
Profilo dei dati
Quando crei il profilo dei tuoi dati, DataBrew crea un rapporto chiamato profilo dati. Questo riepilogo descrive la forma esistente dei dati, incluso il contesto del contenuto, la struttura dei dati e le relative relazioni. È possibile creare un profilo dati per qualsiasi set di dati eseguendo un processo di profilo dati.