翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。
の主要な概念と用語AWS Glue DataBrew
以下に、 の主要な概念と用語の概要を示しますAWS Glue DataBrew。このセクションを読んだら、の開始方法AWS Glue DataBrew「」を参照してください。プロジェクトの作成、データセットの接続、ジョブの実行のプロセスについて説明します。
プロジェクト
DataBrew のインタラクティブデータ準備ワークスペースはプロジェクトと呼ばれます。データプロジェクトを使用して、データ、変換、スケジュールされたプロセスなどの関連項目のコレクションを管理します。プロジェクトの作成の一環として、作業するデータセットを選択または作成します。次に、DataBrew が実行する一連の手順であるレシピを作成します。これらのアクションは、raw データをデータパイプラインで使用できる形式に変換します。
データセット
データセットとは、列またはフィールドに分割された行またはレコードのデータセットを意味します。DataBrew プロジェクトを作成するときは、変換または準備するデータに接続またはアップロードします。DataBrew は、フォーマットされたファイルからインポートされた任意のソースからのデータを操作でき、増え続けるデータストアのリストに直接接続します。
DataBrew の場合、データセットはデータへの読み取り専用接続です。DataBrew は、データを参照するために一連の説明メタデータを収集します。DataBrew が実際のデータを変更または保存することはできません。わかりやすくするために、データセットを使用して実際のデータセットと DataBrew が使用するメタデータの両方を参照します。
レシピ
DataBrew では、レシピは DataBrew が実行するデータの一連の指示またはステップです。レシピには多くのステップを含めることができ、各ステップには多くのアクションを含めることができます。ツールバーの変換ツールを使用して、データに加えるすべての変更を設定します。その後、レシピの完成した製品を表示する準備ができたら、このジョブを DataBrew に割り当ててスケジュールします。DataBrew はデータ変換に関する指示を保存しますが、実際のデータは保存しません。レシピは他のプロジェクトでダウンロードして再利用できます。レシピの複数のバージョンを発行することもできます。
ジョブ
DataBrew は、レシピの作成時に設定した手順を実行して、データを変換するジョブを実行します。これらの手順を実行するプロセスはジョブと呼ばれます。ジョブは、プリセットスケジュールに従ってデータレシピを実行に移すことができます。ただし、スケジュールに限定されません。オンデマンドでジョブを実行することもできます。一部のデータをプロファイリングする場合は、レシピは必要ありません。その場合は、プロファイルジョブを設定してデータプロファイルを作成することができます。
データリネージュ
DataBrew は、ビジュアルインターフェイスでデータを追跡し、データリネージュと呼ばれるオリジンを決定します。このビューは、データが元の場所とは異なるエンティティをどのように流れるかを示しています。そのオリジン、影響を受けた他のエンティティ、時間の経過とともに何が起こったか、保存場所を確認できます。
データプロフィール
データをプロファイルすると、DataBrew はデータプロファイルと呼ばれるレポートを作成します。この概要では、コンテンツのコンテキスト、データの構造、その関係など、データの既存の形状について説明します。データプロファイルジョブを実行することで、任意のデータセットのデータプロファイルを作成できます。