View a markdown version of this page

API pekerjaan visual - AWS Lem
 —  tipe data  —CodeGenConfigurationNodeJDBCConnectorOptionsStreamingDataPreviewOptionsAthenaConnectorSourceJDBCConnectorSourceSparkConnectorSourceCatalogSourceMySQLCatalogSourcePostgreSQLCatalogSourceOracleSQLCatalogSourceMicrosoftSQLServerCatalogSourceCatalogKinesisSourceDirectKinesisSourceKinesisStreamingSourceOptionsCatalogKafkaSourceDirectKafkaSourceKafkaStreamingSourceOptionsRedshiftSourceAmazonRedshiftSourceAmazonRedshiftNodeDataAmazonRedshiftAdvancedOptionOpsiS3CatalogSourceS3SourceAdditionalOptionsS3CsvSourceDirectjdbcSourceS3DirectSourceAdditionalOptionsS3JsonSourceS3ParquetSourceS3DeltaSourceS3CatalogDeltaSourceCatalogDeltaSourceS3HudiSourceS3CatalogHudiSourceS3ExcelSourceCatalogHudiSourceDynamoDBCatalogSourceRelationalCatalogSourceJDBCConnectorTargetSparkConnectorTargetBasicCatalogTargetMySQLCatalogTargetPostgreSQLCatalogTargetOracleSQLCatalogTargetMicrosoftSQLServerCatalogTargetRedshiftTargetAmazonRedshiftTargetUpsertRedshiftTargetOptionsS3CatalogTargetS3GlueParquetTargetCatalogSchemaChangePolicyS3DirectTargetS3HudiCatalogTargetS3HudiDirectTargetS3DeltaCatalogTargetS3DeltaDirectTargetS3HyperDirectTargetS3IcebergDirectTargetDirectSchemaChangePolicyApplyMappingPemetaanSelectFieldsDropFieldsRenameFieldSpigotJoinJoinColumnSplitFieldsSelectFromCollectionFillMissingValuesFilterFilterExpressionFilterValueCustomCodeSparkSQLSqlAliasDropNullFieldsNullCheckBoxListNullValueFieldJenisDataMenggabungkanUnionPiideteksiAgregatDropDuplicatesGovernedCatalogTargetGovernedCatalogSourceAggregateOperationGlueSchemaGlueStudioSchemaColumnGlueStudioColumnDynamicTransformTransformConfigParameterEvaluateDataQualityDQResultsPublishingOptionsDQStopJobOnFailureOptionsEvaluateDataQualityMultiFrameResepRecipeReferenceSnowflakeNodeDataSnowflakeSourceSnowflakeTargetConnectorDataSourceConnectorDataTargetRecipeStepRecipeActionConditionExpressionS3CatalogIcebergSourceCatalogIcebergSourceS3IcebergCatalogTargetDynamoDBELTConnectorSourceDDBELTConnectionOptionsDDBELTCatalogAdditionalOptionsRuteGroupFiltersAutoDataQuality

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

API pekerjaan visual

Visual job API memungkinkan Anda membuat pekerjaan integrasi data dengan menggunakan AWS Glue API dari objek JSON yang mewakili konfigurasi visual dari suatu AWS Glue pekerjaan.

Daftar CodeGenConfigurationNodes disediakan untuk membuat atau memperbarui API pekerjaan untuk mendaftarkan DAG di AWS Glue Studio untuk pekerjaan yang dibuat dan menghasilkan kode terkait.

Jenis Data

CodeGenConfigurationNode struktur

CodeGenConfigurationNodemenyebutkan semua jenis Node yang valid. Satu dan hanya satu variabel anggotanya dapat diisi.

Bidang
  • AthenaConnectorSource — Sebuah objek AthenaConnectorSource.

    Menentukan konektor ke sumber data Amazon Athena.

  • JDBCConnectorSource — Sebuah objek JDBCConnectorSource.

    Menentukan konektor ke sumber data JDBC.

  • SparkConnectorSource — Sebuah objek SparkConnectorSource.

    Menentukan konektor ke sumber data Apache Spark.

  • CatalogSource — Sebuah objek CatalogSource.

    Menentukan penyimpanan data di Katalog AWS Glue Data.

  • RedshiftSource — Sebuah objek RedshiftSource.

    Menentukan penyimpanan data Amazon Redshift.

  • S3CatalogSource — Sebuah objek S3CatalogSource.

    Menentukan penyimpanan data Amazon S3 di Katalog AWS Glue Data.

  • S3CsvSource — Sebuah objek S3CsvSource.

    Menentukan penyimpanan data nilai terpisah perintah (CSV) yang disimpan di Amazon S3.

  • S3JsonSource — Sebuah objek S3JsonSource.

    Menentukan penyimpanan data JSON yang disimpan di Amazon S3.

  • S3ParquetSource — Sebuah objek S3ParquetSource.

    Menentukan penyimpanan data Apache Parquet yang disimpan di Amazon S3.

  • RelationalCatalogSource — Sebuah objek RelationalCatalogSource.

    Menentukan penyimpanan data katalog relasional di Katalog AWS Glue Data.

  • DynamoDBCatalogSource — Sebuah objek DynamoDBCatalogSource.

    Menentukan penyimpanan data Katalog DynamoDBC di Katalog AWS Glue Data.

  • JDBCConnectorTarget — Sebuah objek JDBCConnectorTarget.

    Menentukan target data yang menulis ke Amazon S3 di penyimpanan kolom Apache Parquet.

  • SparkConnectorTarget — Sebuah objek SparkConnectorTarget.

    Menentukan target yang menggunakan konektor Apache Spark.

  • CatalogTarget — Sebuah objek BasicCatalogTarget.

    Menentukan target yang menggunakan tabel Katalog AWS Glue Data.

  • RedshiftTarget — Sebuah objek RedshiftTarget.

    Menentukan target yang menggunakan Amazon Redshift.

  • S3CatalogTarget — Sebuah objek S3CatalogTarget.

    Menentukan target data yang menulis ke Amazon S3 menggunakan Katalog AWS Glue Data.

  • S3GlueParquetTarget — Sebuah objek S3GlueParquetTarget.

    Menentukan target data yang menulis ke Amazon S3 di penyimpanan kolom Apache Parquet.

  • S3DirectTarget — Sebuah objek S3DirectTarget.

    Menentukan target data yang menulis ke Amazon S3.

  • ApplyMapping — Sebuah objek ApplyMapping.

    Menentukan transformasi yang memetakan kunci properti data dalam sumber data ke kunci properti data di target data. Anda dapat mengganti nama kunci, memodifikasi tipe data untuk kunci, dan memilih kunci mana yang akan dibuang dari set data.

  • SelectFields — Sebuah objek SelectFields.

    Menentukan transformasi yang memilih kunci properti data yang ingin Anda simpan.

  • DropFields — Sebuah objek DropFields.

    Menentukan transformasi yang memilih kunci properti data yang ingin Anda jatuhkan.

  • RenameField — Sebuah objek RenameField.

    Menentukan transformasi yang mengganti nama kunci properti data tunggal.

  • Spigot — Sebuah objek Spigot.

    Menentukan transformasi yang menulis sampel data ke bucket Amazon S3.

  • Join — Sebuah objek Join.

    Menentukan transformasi yang menggabungkan dua kumpulan data menjadi satu dataset menggunakan frasa perbandingan pada kunci properti data yang ditentukan. Anda dapat menggunakan join bagian dalam, luar, kiri, kanan, kiri semi, dan lawan kiri.

  • SplitFields — Sebuah objek SplitFields.

    Menentukan transformasi yang membagi kunci properti data menjadi duaDynamicFrames. Outputnya adalah kumpulanDynamicFrames: satu dengan kunci properti data yang dipilih, dan satu dengan kunci properti data yang tersisa.

  • SelectFromCollection — Sebuah objek SelectFromCollection.

    Menentukan transformasi yang memilih satu DynamicFrame dari koleksiDynamicFrames. Outputnya adalah yang dipilih DynamicFrame

  • FillMissingValues — Sebuah objek FillMissingValues.

    Menentukan transformasi yang menemukan catatan dalam dataset yang memiliki nilai yang hilang dan menambahkan bidang baru dengan nilai yang ditentukan oleh imputasi. Kumpulan data input digunakan untuk melatih model pembelajaran mesin yang menentukan nilai yang hilang seharusnya.

  • Filter — Sebuah objek Filter.

    Menentukan transformasi yang membagi dataset menjadi dua, berdasarkan kondisi filter.

  • CustomCode — Sebuah objek CustomCode.

    Menentukan transformasi yang menggunakan kode kustom yang Anda berikan untuk melakukan transformasi data. Outputnya adalah kumpulan DynamicFrames.

  • SparkSQL — Sebuah objek SparkSQL.

    Menentukan transformasi tempat Anda memasukkan kueri SQL menggunakan sintaks Spark SQL untuk mengubah data. Outputnya adalah satu DynamicFrame.

  • DirectKinesisSource — Sebuah objek DirectKinesisSource.

    Menentukan sumber data Amazon Kinesis langsung.

  • DirectKafkaSource — Sebuah objek DirectKafkaSource.

    Menentukan penyimpanan data Apache Kafka.

  • CatalogKinesisSource — Sebuah objek CatalogKinesisSource.

    Menentukan sumber data Kinesis dalam Katalog AWS Glue Data.

  • CatalogKafkaSource — Sebuah objek CatalogKafkaSource.

    Menentukan penyimpanan data Apache Kafka di Katalog Data.

  • DropNullFields — Sebuah objek DropNullFields.

    Menentukan transformasi yang menghapus kolom dari dataset jika semua nilai dalam kolom adalah 'null'. Secara default, AWS Glue Studio akan mengenali objek null, tetapi beberapa nilai seperti string kosong, string yang “null”, bilangan bulat -1 atau placeholder lainnya seperti nol, tidak secara otomatis dikenali sebagai nol.

  • Merge — Sebuah objek Menggabungkan.

    Menentukan transformasi yang menggabungkan a DynamicFrame dengan pementasan DynamicFrame berdasarkan kunci utama yang ditentukan untuk mengidentifikasi catatan. Catatan duplikat (catatan dengan kunci primer yang sama) tidak di-deduplikasi.

  • Union — Sebuah objek Union.

    Menentukan transformasi yang menggabungkan baris dari dua atau lebih kumpulan data menjadi satu hasil.

  • PIIDetection — Sebuah objek Piideteksi.

    Menentukan transformasi yang mengidentifikasi, menghapus, atau menutupi data PII.

  • Aggregate — Sebuah objek Agregat.

    Menentukan transformasi yang mengelompokkan baris berdasarkan bidang yang dipilih dan menghitung nilai agregat dengan fungsi yang ditentukan.

  • DropDuplicates — Sebuah objek DropDuplicates.

    Menentukan transformasi yang menghapus baris data berulang dari kumpulan data.

  • GovernedCatalogTarget — Sebuah objek GovernedCatalogTarget.

    Menentukan target data yang menulis ke katalog yang diatur.

  • GovernedCatalogSource — Sebuah objek GovernedCatalogSource.

    Menentukan sumber data dalam Katalog Data yang diatur.

  • MicrosoftSQLServerCatalogSource — Sebuah objek MicrosoftSQLServerCatalogSource.

    Menentukan sumber data server Microsoft SQL di Katalog AWS Glue Data.

  • MySQLCatalogSource — Sebuah objek MySQLCatalogSource.

    Menentukan sumber data MySQL di Katalog AWS Glue Data.

  • OracleSQLCatalogSource — Sebuah objek OracleSQLCatalogSource.

    Menentukan sumber data Oracle di Katalog AWS Glue Data.

  • PostgreSQLCatalogSource — Sebuah objek PostgreSQLCatalogSource.

    Menentukan sumber data PostgresSQL di Katalog AWS Glue Data.

  • MicrosoftSQLServerCatalogTarget — Sebuah objek MicrosoftSQLServerCatalogTarget.

    Menentukan target yang menggunakan Microsoft SQL.

  • MySQLCatalogTarget — Sebuah objek MySQLCatalogTarget.

    Menentukan target yang menggunakan MySQL.

  • OracleSQLCatalogTarget — Sebuah objek OracleSQLCatalogTarget.

    Menentukan target yang menggunakan Oracle SQL.

  • PostgreSQLCatalogTarget — Sebuah objek PostgreSQLCatalogTarget.

    Menentukan target yang menggunakan Postgres SQL.

  • Route — Sebuah objek Rute.

    Menentukan node rute yang mengarahkan data ke jalur keluaran yang berbeda berdasarkan kondisi penyaringan yang ditentukan.

  • DynamicTransform — Sebuah objek DynamicTransform.

    Menentukan transformasi visual kustom yang dibuat oleh pengguna.

  • EvaluateDataQuality — Sebuah objek EvaluateDataQuality.

    Menentukan kriteria evaluasi kualitas data Anda.

  • S3CatalogHudiSource — Sebuah objek S3CatalogHudiSource.

    Menentukan sumber data Hudi yang terdaftar di Katalog AWS Glue Data. Sumber data harus disimpan di Amazon S3.

  • CatalogHudiSource — Sebuah objek CatalogHudiSource.

    Menentukan sumber data Hudi yang terdaftar di Katalog AWS Glue Data.

  • S3HudiSource — Sebuah objek S3HudiSource.

    Menentukan sumber data Hudi yang disimpan di Amazon S3.

  • S3HudiCatalogTarget — Sebuah objek S3HudiCatalogTarget.

    Menentukan target yang menulis ke sumber data Hudi di Katalog AWS Glue Data.

  • S3HudiDirectTarget — Sebuah objek S3HudiDirectTarget.

    Menentukan target yang menulis ke sumber data Hudi di. Amazon S3

  • S3CatalogDeltaSource — Sebuah objek S3CatalogDeltaSource.

    Menentukan sumber data Delta Lake yang terdaftar di Katalog AWS Glue Data. Sumber data harus disimpan di Amazon S3.

  • CatalogDeltaSource — Sebuah objek CatalogDeltaSource.

    Menentukan sumber data Delta Lake yang terdaftar di Katalog AWS Glue Data.

  • S3DeltaSource — Sebuah objek S3DeltaSource.

    Menentukan sumber data Delta Lake yang disimpan di Amazon S3.

  • S3DeltaCatalogTarget — Sebuah objek S3DeltaCatalogTarget.

    Menentukan target yang menulis ke sumber data Delta Lake di Katalog AWS Glue Data.

  • S3DeltaDirectTarget — Sebuah objek S3DeltaDirectTarget.

    Menentukan target yang menulis ke sumber data Delta Lake di Amazon S3.

  • AmazonRedshiftSource — Sebuah objek AmazonRedshiftSource.

    Menentukan target yang menulis ke sumber data di Amazon Redshift.

  • AmazonRedshiftTarget — Sebuah objek AmazonRedshiftTarget.

    Menentukan target yang menulis ke target data di Amazon Redshift.

  • EvaluateDataQualityMultiFrame — Sebuah objek EvaluateDataQualityMultiFrame.

    Menentukan kriteria evaluasi kualitas data Anda. Memungkinkan beberapa data input dan mengembalikan koleksi Dynamic Frames.

  • Recipe — Sebuah objek Resep.

    Menentukan simpul AWS Glue DataBrew resep.

  • SnowflakeSource — Sebuah objek SnowflakeSource.

    Menentukan sumber data Snowflake.

  • SnowflakeTarget — Sebuah objek SnowflakeTarget.

    Menentukan target yang menulis ke sumber data Snowflake.

  • ConnectorDataSource — Sebuah objek ConnectorDataSource.

    Menentukan sumber yang dihasilkan dengan opsi koneksi standar.

  • ConnectorDataTarget — Sebuah objek ConnectorDataTarget.

    Menentukan target yang dihasilkan dengan opsi koneksi standar.

  • S3CatalogIcebergSource — Sebuah objek S3CatalogIcebergSource.

    Menentukan sumber data Apache Iceberg yang terdaftar di Katalog AWS Glue Data. Sumber data gunung es harus disimpan di Amazon S3.

  • CatalogIcebergSource — Sebuah objek CatalogIcebergSource.

    Menentukan sumber data Apache Iceberg yang terdaftar di Katalog AWS Glue Data.

  • S3IcebergCatalogTarget — Sebuah objek S3IcebergCatalogTarget.

    Menentukan target katalog Apache Iceberg yang menulis data ke Amazon S3 dan mendaftarkan tabel di Katalog AWS Glue Data.

  • S3IcebergDirectTarget — Sebuah objek S3IcebergDirectTarget.

    Mendefinisikan parameter konfigurasi untuk menulis data ke Amazon S3 sebagai tabel Apache Iceberg.

  • S3ExcelSource — Sebuah objek S3ExcelSource.

    Mendefinisikan parameter konfigurasi untuk membaca file Excel dari Amazon S3.

  • S3HyperDirectTarget — Sebuah objek S3HyperDirectTarget.

    Mendefinisikan parameter konfigurasi untuk menulis data ke Amazon S3 menggunakan peng HyperDirect optimalan.

  • DynamoDBELTConnectorSource — Sebuah objek DynamoDBELTConnectorSource.

    Menentukan sumber konektor DynamoDB ELT untuk mengekstraksi data dari tabel DynamoDB.

JDBCConnectorOptions struktur

Opsi koneksi tambahan untuk konektor.

Bidang
  • FilterPredicate— UTF-8 string, cocok denganCustom string pattern #66.

    Klausa kondisi tambahan untuk memfilter data dari sumber. Contoh:

    BillingCity='Mountain View'

    Saat menggunakan kueri alih-alih nama tabel, Anda harus memvalidasi bahwa kueri bekerja dengan yang ditentukanfilterPredicate.

  • PartitionColumn— UTF-8 string, cocok denganCustom string pattern #66.

    Nama kolom integer yang digunakan untuk partisi. Opsi ini bekerja hanya ketika ia disertakan dengan lowerBound, upperBound, dan numPartitions. Pilihan ini bekerja dengan cara yang sama seperti pada pembaca Spark SQL JDBC.

  • LowerBound — Nomor (panjang).

    Nilai minimum partitionColumn itu digunakan untuk menentukan langkah partisi.

  • UpperBound — Nomor (panjang).

    Nilai maksimum partitionColumn yang digunakan untuk menentukan langkah partisi.

  • NumPartitions — Nomor (panjang).

    Jumlah partisi. Nilai ini, bersama dengan lowerBound (inklusif) dan upperBound (eksklusif), membentuk langkah partisi untuk ekspresi klausul WHERE yang dihasilkan yang digunakan untuk membagi partitionColumn.

  • JobBookmarkKeys— Sebuah array UTF-8 string.

    Nama tombol bookmark pekerjaan yang digunakan untuk mengurutkan.

  • JobBookmarkKeysSortOrder— UTF-8 string, cocok denganCustom string pattern #66.

    Menentukan urutan menaik atau menurun.

  • DataTypeMapping – Susunan peta pasangan nilai kunci.

    Setiap kunci adalah UTF-8 string (nilai yang valid: ARRAY BIGINT | BINARY | BIT | BLOB | BOOLEAN | CHAR | CLOB | DATALINK | DATE | DECIMAL | DISTINCT DOUBLE | FLOAT | INTEGER | JAVA_OBJECT | LONGNVARCHAR | LONGVARBINARY | LONGVARCHAR | NCHAR | NCLOB | NULL | NUMERIC | NVARCHAR | OTHER | REAL | REF REF_CURSOR | ROWID | SMALLINT | SQLXML | STRUCT | TIME | TIME_WITH_TIMEZONE | TIMESTAMP | TIMESTAMP_WITH_TIMEZONE| TINYINT | VARBINARY |VARCHAR).

    Setiap nilai adalah UTF-8 string (nilai yang valid: DATE STRING | TIMESTAMP | INT | FLOAT | LONG | BIGDECIMAL | BYTE | SHORT |DOUBLE).

    Pemetaan tipe data kustom yang membangun pemetaan dari tipe data JDBC ke tipe AWS Glue data. Misalnya, opsi mem "dataTypeMapping":{"FLOAT":"STRING"} etakan bidang data tipe JDBC FLOAT ke dalam String tipe Java dengan memanggil ResultSet.getString() metode driver, dan menggunakannya untuk membangun catatan. AWS Glue Objek ResultSet dilaksanakan oleh masing-masing driver, sehingga perilaku bersifat spesifik untuk driver yang Anda gunakan. Lihat dokumentasi untuk driver JDBC Anda untuk memahami bagaimana driver melakukan konversi.

StreamingDataPreviewOptions struktur

Menentukan opsi yang terkait dengan pratinjau data untuk melihat sampel data Anda.

Bidang
  • PollingTime— Angka (panjang), minimal 10.

    Waktu polling dalam milidetik.

  • RecordPollingLimit— Angka (panjang), minimal 1.

    Batas jumlah catatan yang disurvei.

AthenaConnectorSource struktur

Menentukan konektor ke sumber data Amazon Athena.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama dari sumber data.

  • ConnectionName Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Nama koneksi yang terkait dengan konektor.

  • ConnectorName Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Nama konektor yang membantu mengakses penyimpanan data di AWS Glue Studio.

  • ConnectionType Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Jenis koneksi, seperti marketplace.athena atau custom.athena, menunjuk koneksi ke penyimpanan data Amazon Athena.

  • ConnectionTable— UTF-8 string, cocok denganCustom string pattern #66.

    Nama tabel di sumber data.

  • SchemaName Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Nama grup log Cloudwatch untuk dibaca. Misalnya, /aws-glue/jobs/output.

  • OutputSchemas – Susunan objek GlueSchema.

    Menentukan skema data untuk sumber Athena kustom.

JDBCConnectorSource struktur

Menentukan konektor ke sumber data JDBC.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama dari sumber data.

  • ConnectionName Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Nama koneksi yang terkait dengan konektor.

  • ConnectorName Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Nama konektor yang membantu mengakses penyimpanan data di AWS Glue Studio.

  • ConnectionType Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Jenis koneksi, seperti marketplace.jdbc atau custom.jdbc, menunjuk koneksi ke penyimpanan data JDBC.

  • AdditionalOptions — Sebuah objek JDBCConnectorOptions.

    Opsi koneksi tambahan untuk konektor.

  • ConnectionTable— UTF-8 string, cocok denganCustom string pattern #66.

    Nama tabel di sumber data.

  • Query— UTF-8 string, cocok denganCustom string pattern #67.

    Tabel atau kueri SQL untuk mendapatkan data dari. Anda dapat menentukan salah satu dari ConnectionTable atau query, bukan keduanya.

  • OutputSchemas – Susunan objek GlueSchema.

    Menentukan skema data untuk sumber JDBC kustom.

SparkConnectorSource struktur

Menentukan konektor ke sumber data Apache Spark.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama dari sumber data.

  • ConnectionName Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Nama koneksi yang terkait dengan konektor.

  • ConnectorName Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Nama konektor yang membantu mengakses penyimpanan data di AWS Glue Studio.

  • ConnectionType Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Jenis koneksi, seperti marketplace.spark atau custom.spark, menunjuk koneksi ke penyimpanan data Apache Spark.

  • AdditionalOptions – Susunan peta pasangan nilai kunci.

    Setiap kunci adalah UTF-8 string, cocok denganCustom string pattern #66.

    Setiap nilai adalah UTF-8 string, cocok denganCustom string pattern #66.

    Opsi koneksi tambahan untuk konektor.

  • OutputSchemas – Susunan objek GlueSchema.

    Menentukan skema data untuk sumber percikan kustom.

CatalogSource struktur

Menentukan penyimpanan data di Katalog AWS Glue Data.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama penyimpanan data

  • Database Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Nama database yang akan dibaca.

  • Table Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Nama tabel dalam database untuk dibaca.

  • PartitionPredicate— UTF-8 string, cocok denganCustom string pattern #66.

    Partisi yang memenuhi predikat ini dihapus. File dalam periode penyimpanan dalam partisi ini tidak dihapus.

  • OutputSchemas – Susunan objek GlueSchema.

    Menentukan skema data untuk sumber katalog.

MySQLCatalogSource struktur

Menentukan sumber data MySQL di Katalog AWS Glue Data.

Bidang

PostgreSQLCatalogSource struktur

Menentukan sumber data PostgresSQL di Katalog AWS Glue Data.

Bidang

OracleSQLCatalogSource struktur

Menentukan sumber data Oracle di Katalog AWS Glue Data.

Bidang

MicrosoftSQLServerCatalogSource struktur

Menentukan sumber data server Microsoft SQL di Katalog AWS Glue Data.

Bidang

CatalogKinesisSource struktur

Menentukan sumber data Kinesis dalam Katalog AWS Glue Data.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama dari sumber data.

  • WindowSize — Nomor (bilangan bulat).

    Jumlah waktu yang dihabiskan untuk memproses setiap batch mikro.

  • DetectSchema – Boolean.

    Apakah akan secara otomatis menentukan skema dari data yang masuk.

  • Table Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Nama tabel dalam database untuk dibaca.

  • Database Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Nama database yang akan dibaca.

  • StreamingOptions — Sebuah objek KinesisStreamingSourceOptions.

    Opsi tambahan untuk sumber data streaming Kinesis.

  • DataPreviewOptions — Sebuah objek StreamingDataPreviewOptions.

    Opsi tambahan untuk pratinjau data.

DirectKinesisSource struktur

Menentukan sumber data Amazon Kinesis langsung.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama dari sumber data.

  • WindowSize — Nomor (bilangan bulat).

    Jumlah waktu yang dihabiskan untuk memproses setiap batch mikro.

  • DetectSchema – Boolean.

    Apakah akan secara otomatis menentukan skema dari data yang masuk.

  • StreamingOptions — Sebuah objek KinesisStreamingSourceOptions.

    Opsi tambahan untuk sumber data streaming Kinesis.

  • DataPreviewOptions — Sebuah objek StreamingDataPreviewOptions.

    Opsi tambahan untuk pratinjau data.

KinesisStreamingSourceOptions struktur

Opsi tambahan untuk sumber data streaming Amazon Kinesis.

Bidang
  • EndpointUrl— UTF-8 string, cocok denganCustom string pattern #66.

    URL titik akhir Kinesis.

  • StreamName— UTF-8 string, cocok denganCustom string pattern #66.

    Nama aliran data Kinesis.

  • Classification— UTF-8 string, cocok denganCustom string pattern #66.

    Klasifikasi opsional.

  • Delimiter— UTF-8 string, cocok denganCustom string pattern #66.

    Menentukan karakter pembatas.

  • StartingPosition— UTF-8 string (nilai valid: latest="LATEST" | trim_horizon="TRIM_HORIZON" | earliest="EARLIEST" |timestamp="TIMESTAMP").

    Posisi awal dalam aliran data Kinesis untuk membaca data. Nilai yang mungkin adalah"latest","trim_horizon","earliest", atau string stempel waktu dalam format UTC dalam pola yyyy-mm-ddTHH:MM:SSZ (di mana Z mewakili offset zona waktu UTC dengan +/-. Misalnya: “2023-04-04 T08:00:00-04:00 “). Nilai default-nya adalah "latest".

    Catatan: Menggunakan nilai yang merupakan string stempel waktu dalam format UTC untuk “startingPosition” hanya didukung untuk AWS Glue versi 4.0 atau yang lebih baru.

  • MaxFetchTimeInMs — Nomor (panjang).

    Waktu maksimum yang dihabiskan eksekutor pekerjaan untuk membaca catatan untuk batch saat ini dari aliran data Kinesis, ditentukan dalam milidetik (ms). Beberapa panggilan GetRecords API dapat dilakukan dalam waktu ini. Nilai default-nya adalah 1000.

  • MaxFetchRecordsPerShard — Nomor (panjang).

    Jumlah maksimum rekaman untuk diambil per shard dalam aliran data Kinesis per mikrobatch. Catatan: Klien dapat melebihi batas ini jika pekerjaan streaming telah membaca catatan tambahan dari Kinesis (dalam panggilan get-records yang sama). Jika MaxFetchRecordsPerShard perlu ketat maka itu harus kelipatanMaxRecordPerRead. Nilai default-nya adalah 100000.

  • MaxRecordPerRead — Nomor (panjang).

    Jumlah maksimum rekaman yang akan diambil dari aliran data Kinesis di setiap operasi getRecords. Nilai default-nya adalah 10000.

  • AddIdleTimeBetweenReads – Boolean.

    Menambahkan penundaan waktu antara dua operasi getRecords berturut-turut. Nilai default-nya adalah "False". Opsi ini hanya dapat dikonfigurasi untuk AWS Glue versi 2.0 ke atas.

  • IdleTimeBetweenReadsInMs — Nomor (panjang).

    Penundaan waktu minimum antara dua operasi getRecords berturut-turut, ditentukan dalam ms. Nilai default-nya adalah 1000. Opsi ini hanya dapat dikonfigurasi untuk AWS Glue versi 2.0 ke atas.

  • DescribeShardInterval — Nomor (panjang).

    Interval waktu minimum antara dua panggilan ListShards API untuk skrip Anda untuk mempertimbangkan harding ulang. Nilai default-nya adalah 1s.

  • NumRetries — Nomor (bilangan bulat).

    Jumlah maksimum percobaan ulang untuk permintaan API Kinesis Data Streams. Nilai default-nya adalah 3.

  • RetryIntervalMs — Nomor (panjang).

    Periode waktu pendinginan (ditentukan dalam ms) sebelum mencoba lagi panggilan API Kinesis Data Streams. Nilai default-nya adalah 1000.

  • MaxRetryIntervalMs — Nomor (panjang).

    Periode waktu pendinginan maksimum (ditentukan dalam ms) antara dua percobaan ulang panggilan API Kinesis Data Streams. Nilai default-nya adalah 10000.

  • AvoidEmptyBatches – Boolean.

    Menghindari pembuatan pekerjaan microbatch kosong dengan memeriksa data yang belum dibaca di aliran data Kinesis sebelum batch dimulai. Nilai default-nya adalah "False".

  • StreamArn— UTF-8 string, cocok denganCustom string pattern #66.

    Nama Sumber Daya Amazon (ARN) dari aliran data Kinesis.

  • RoleArn— UTF-8 string, cocok denganCustom string pattern #66.

    Nama Sumber Daya Amazon (ARN) dari peran yang akan diasumsikan menggunakan AWS Security Token Service (AWS STS). Peran ini harus memiliki izin untuk mendeskripsikan atau membaca operasi rekaman untuk aliran data Kinesis. Anda harus menggunakan parameter ini saat mengakses aliran data di akun yang berbeda. Digunakan bersama dengan"awsSTSSessionName".

  • RoleSessionName— UTF-8 string, cocok denganCustom string pattern #66.

    Pengidentifikasi untuk sesi yang mengasumsikan peran menggunakan AWS STS. Anda harus menggunakan parameter ini saat mengakses aliran data di akun yang berbeda. Digunakan bersama dengan"awsSTSRoleARN".

  • AddRecordTimestamp— UTF-8 string, cocok denganCustom string pattern #66.

    Ketika opsi ini disetel ke 'true', output data akan berisi kolom tambahan bernama “__src_timestamp” yang menunjukkan waktu ketika catatan yang sesuai diterima oleh aliran. Nilai defaultnya adalah 'palsu'. Opsi ini didukung di AWS Glue versi 4.0 atau yang lebih baru.

  • EmitConsumerLagMetrics— UTF-8 string, cocok denganCustom string pattern #66.

    Ketika opsi ini disetel ke 'true', untuk setiap batch, itu akan memancarkan metrik untuk durasi antara rekaman tertua yang diterima oleh aliran dan waktu dat AWS Glue angnya CloudWatch. Nama metrik adalah “glue.driver. ConsumerLagInMs streaming.max”. Nilai defaultnya adalah 'palsu'. Opsi ini didukung di AWS Glue versi 4.0 atau yang lebih baru.

  • StartingTimestamp— UTF-8 tali.

    Stempel waktu catatan dalam aliran data Kinesis untuk mulai membaca data. Nilai yang mungkin adalah string stempel waktu dalam format UTC dari pola yyyy-mm-ddTHH:MM:SSZ (di mana Z mewakili offset zona waktu UTC dengan +/-. Misalnya: “2023-04-04 T08:00:00 + 08:00 “).

  • FanoutConsumerARN— UTF-8 string, cocok denganCustom string pattern #66.

    Nama Sumber Daya Amazon (ARN) dari Kinesis Data Streams meningkatkan konsumen fan-out. Jika ditentukan, aktifkan fan-out yang ditingkatkan untuk throughput khusus dan konsumsi data latensi yang lebih rendah.

CatalogKafkaSource struktur

Menentukan penyimpanan data Apache Kafka di Katalog Data.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama penyimpanan data

  • WindowSize — Nomor (bilangan bulat).

    Jumlah waktu yang dihabiskan untuk memproses setiap batch mikro.

  • DetectSchema – Boolean.

    Apakah akan secara otomatis menentukan skema dari data yang masuk.

  • Table Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Nama tabel dalam database untuk dibaca.

  • Database Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Nama database yang akan dibaca.

  • StreamingOptions — Sebuah objek KafkaStreamingSourceOptions.

    Menentukan opsi streaming.

  • DataPreviewOptions — Sebuah objek StreamingDataPreviewOptions.

    Menentukan opsi yang terkait dengan pratinjau data untuk melihat sampel data Anda.

DirectKafkaSource struktur

Menentukan penyimpanan data Apache Kafka.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama penyimpanan data

  • StreamingOptions — Sebuah objek KafkaStreamingSourceOptions.

    Menentukan opsi streaming.

  • WindowSize — Nomor (bilangan bulat).

    Jumlah waktu yang dihabiskan untuk memproses setiap batch mikro.

  • DetectSchema – Boolean.

    Apakah akan secara otomatis menentukan skema dari data yang masuk.

  • DataPreviewOptions — Sebuah objek StreamingDataPreviewOptions.

    Menentukan opsi yang terkait dengan pratinjau data untuk melihat sampel data Anda.

KafkaStreamingSourceOptions struktur

Opsi tambahan untuk streaming.

Bidang
  • BootstrapServers— UTF-8 string, cocok denganCustom string pattern #66.

    Daftar URL server bootstrap, misalnya, sebagaib-1.vpc-test-2.o4q88o.c6.kafka.us-east-1.amazonaws.com:9094. Opsi ini harus ditentukan dalam panggilan API atau didefinisikan dalam metadata tabel dalam Katalog Data.

  • SecurityProtocol— UTF-8 string, cocok denganCustom string pattern #66.

    Protokol yang digunakan untuk berkomunikasi dengan broker. Nilai yang mungkin adalah "SSL" atau "PLAINTEXT".

  • ConnectionName— UTF-8 string, cocok denganCustom string pattern #66.

    Nama koneksi.

  • TopicName— UTF-8 string, cocok denganCustom string pattern #66.

    Nama topik seperti yang ditentukan dalam Apache Kafka. Anda harus menentukan setidaknya satu "topicName", "assign" atau "subscribePattern".

  • Assign— UTF-8 string, cocok denganCustom string pattern #66.

    Spesifik TopicPartitions untuk dikonsumsi. Anda harus menentukan setidaknya satu "topicName", "assign" atau "subscribePattern".

  • SubscribePattern— UTF-8 string, cocok denganCustom string pattern #66.

    String regex Java yang mengidentifikasi daftar topik untuk berlangganan. Anda harus menentukan setidaknya satu "topicName", "assign" atau "subscribePattern".

  • Classification— UTF-8 string, cocok denganCustom string pattern #66.

    Klasifikasi opsional.

  • Delimiter— UTF-8 string, cocok denganCustom string pattern #66.

    Menentukan karakter pembatas.

  • StartingOffsets— UTF-8 string, cocok denganCustom string pattern #66.

    Posisi awal dalam topik Kafka untuk membaca data. Nilai yang mungkin adalah "earliest" atau "latest". Nilai default-nya adalah "latest".

  • EndingOffsets— UTF-8 string, cocok denganCustom string pattern #66.

    Titik akhir saat kueri batch berakhir. Nilai yang mungkin adalah "latest" atau string JSON yang menentukan sebuah ending offset untuk setiap TopicPartition.

  • PollTimeoutMs — Nomor (panjang).

    Batas waktu dalam milidetik untuk data jajak pendapat dari Kafka di pelaksana pekerjaan Spark. Nilai default-nya adalah 512.

  • NumRetries — Nomor (bilangan bulat).

    Jumlah kali untuk mencoba lagi sebelum gagal mengambil offset Kafka. Nilai default-nya adalah 3.

  • RetryIntervalMs — Nomor (panjang).

    Waktu dalam milidetik untuk menunggu sebelum mencoba kembali mengambil offset Kafka. Nilai default-nya adalah 10.

  • MaxOffsetsPerTrigger — Nomor (panjang).

    Batas laju pada jumlah maksimum offset yang diproses per interval pemicu. Jumlah total offset yang ditentukan dibagi secara proporsional di seluruh topicPartitions dengan volume yang berbeda. Nilai default-nya adalah nol, yang berarti bahwa konsumen membaca semua offset sampai diketahui offset terbaru.

  • MinPartitions — Nomor (bilangan bulat).

    Jumlah minimum partisi yang diinginkan untuk dibaca dari Kafka. Nilai default-nya adalah nol, yang berarti bahwa jumlah partisi spark sama dengan jumlah partisi Kafka.

  • IncludeHeaders – Boolean.

    Apakah akan menyertakan header Kafka. Ketika opsi diatur ke “true”, output data akan berisi kolom tambahan bernama “glue_streaming_kafka_headers” dengan tipe. Array[Struct(key: String, value: String)] Nilai defaultnya adalah “false”. Opsi ini hanya tersedia dalam AWS Glue versi 3.0 atau yang lebih baru.

  • AddRecordTimestamp— UTF-8 string, cocok denganCustom string pattern #66.

    Ketika opsi ini disetel ke 'true', output data akan berisi kolom tambahan bernama “__src_timestamp” yang menunjukkan waktu ketika catatan yang sesuai diterima oleh topik. Nilai defaultnya adalah 'palsu'. Opsi ini didukung di AWS Glue versi 4.0 atau yang lebih baru.

  • EmitConsumerLagMetrics— UTF-8 string, cocok denganCustom string pattern #66.

    Ketika opsi ini disetel ke 'true', untuk setiap batch, itu akan memancarkan metrik untuk durasi antara catatan tertua yang diterima oleh topik dan waktu AWS Glue masuk CloudWatch. Nama metrik adalah “glue.driver. ConsumerLagInMs streaming.max”. Nilai defaultnya adalah 'palsu'. Opsi ini didukung di AWS Glue versi 4.0 atau yang lebih baru.

  • StartingTimestamp— UTF-8 tali.

    Stempel waktu catatan dalam topik Kafka untuk mulai membaca data. Nilai yang mungkin adalah string stempel waktu dalam format UTC dari pola yyyy-mm-ddTHH:MM:SSZ (di mana Z mewakili offset zona waktu UTC dengan +/-. Misalnya: “2023-04-04 T08:00:00 + 08:00 “).

    Hanya satu dari StartingTimestamp atau StartingOffsets harus diatur.

RedshiftSource struktur

Menentukan penyimpanan data Amazon Redshift.

Bidang

AmazonRedshiftSource struktur

Menentukan sumber Amazon Redshift.

Bidang

AmazonRedshiftNodeData struktur

Menentukan simpul Amazon Redshift.

Bidang
  • AccessType— UTF-8 string, cocok denganCustom string pattern #65.

    Jenis akses untuk koneksi Redshift. Bisa berupa koneksi langsung atau koneksi katalog.

  • SourceType— UTF-8 string, cocok denganCustom string pattern #65.

    Jenis sumber untuk menentukan apakah tabel tertentu adalah sumber atau kueri khusus.

  • Connection — Sebuah objek Opsi.

    Kon AWS Glue eksi ke cluster Redshift.

  • Schema — Sebuah objek Opsi.

    Nama skema Redshift saat bekerja dengan koneksi langsung.

  • Table — Sebuah objek Opsi.

    Nama tabel Redshift saat bekerja dengan koneksi langsung.

  • CatalogDatabase — Sebuah objek Opsi.

    Nama database Katalog AWS Glue Data saat bekerja dengan katalog data.

  • CatalogTable — Sebuah objek Opsi.

    Nama tabel Katalog AWS Glue Data saat bekerja dengan katalog data.

  • CatalogRedshiftSchema— UTF-8 tali.

    Nama skema Redshift saat bekerja dengan katalog data.

  • CatalogRedshiftTable— UTF-8 tali.

    Tabel database untuk dibaca.

  • TempDir— UTF-8 string, cocok denganCustom string pattern #66.

    Jalur Amazon S3 tempat data sementara dapat dipentaskan saat menyalin keluar dari database.

  • IamRole — Sebuah objek Opsi.

    Tidak wajib. Nama peran digunakan saat koneksi ke S3. Peran IAM akan menjadi default peran pada pekerjaan saat dibiarkan kosong.

  • AdvancedOptions – Susunan objek AmazonRedshiftAdvancedOption.

    Nilai opsional saat menghubungkan ke cluster Redshift.

  • SampleQuery— UTF-8 tali.

    SQL digunakan untuk mengambil data dari sumber Redshift ketika SourceType adalah 'kueri'.

  • PreAction— UTF-8 tali.

    SQL yang digunakan sebelum MERGE atau APPEND dengan upsert dijalankan.

  • PostAction— UTF-8 tali.

    SQL yang digunakan sebelum MERGE atau APPEND dengan upsert dijalankan.

  • Action— UTF-8 tali.

    Menentukan bagaimana penulisan ke cluser Redshift akan terjadi.

  • TablePrefix— UTF-8 string, cocok denganCustom string pattern #65.

    Menentukan awalan ke tabel.

  • Upsert – Boolean.

    Tindakan yang digunakan pada Redshift tenggelam saat melakukan APPEND.

  • MergeAction— UTF-8 string, cocok denganCustom string pattern #65.

    Tindakan yang digunakan saat menentukan bagaimana MERGE di wastafel Redshift akan ditangani.

  • MergeWhenMatched— UTF-8 string, cocok denganCustom string pattern #65.

    Tindakan yang digunakan kapan untuk menentukan bagaimana MERGE di wastafel Redshift akan ditangani ketika rekaman yang ada cocok dengan catatan baru.

  • MergeWhenNotMatched— UTF-8 string, cocok denganCustom string pattern #65.

    Tindakan yang digunakan kapan untuk menentukan bagaimana MERGE di wastafel Redshift akan ditangani ketika catatan yang ada tidak cocok dengan catatan baru.

  • MergeClause— UTF-8 tali.

    SQL digunakan dalam penggabungan kustom untuk menangani catatan yang cocok.

  • CrawlerConnection— UTF-8 tali.

    Menentukan nama koneksi yang terkait dengan tabel katalog yang digunakan.

  • TableSchema – Susunan objek Opsi.

    Array keluaran skema untuk node tertentu.

  • StagingTable— UTF-8 tali.

    Nama tabel pementasan sementara yang digunakan saat melakukan MERGE atau APPEND dengan upsert.

  • SelectedColumns – Susunan objek Opsi.

    Daftar nama kolom yang digunakan untuk menentukan catatan yang cocok saat melakukan MERGE atau APPEND dengan upsert.

AmazonRedshiftAdvancedOption struktur

Menentukan nilai opsional saat menghubungkan ke cluster Redshift.

Bidang
  • Key— UTF-8 tali.

    Kunci untuk opsi koneksi tambahan.

  • Value— UTF-8 tali.

    Nilai untuk opsi koneksi tambahan.

Struktur opsi

Menentukan nilai opsi.

Bidang

S3CatalogSource struktur

Menentukan penyimpanan data Amazon S3 di Katalog AWS Glue Data.

Bidang

S3SourceAdditionalOptions struktur

Menentukan opsi koneksi tambahan untuk penyimpanan data Amazon S3.

Bidang
  • BoundedSize — Nomor (panjang).

    Menetapkan batas atas untuk ukuran target dataset dalam byte yang akan diproses.

  • BoundedFiles — Nomor (panjang).

    Menetapkan batas atas untuk jumlah target file yang akan diproses.

S3CsvSource struktur

Menentukan penyimpanan data nilai terpisah perintah (CSV) yang disimpan di Amazon S3.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama penyimpanan data

  • Paths- Diperlukan: Array UTF-8 string.

    Daftar jalur Amazon S3 untuk dibaca.

  • CompressionType— UTF-8 string (nilai valid: gzip="GZIP" |bzip2="BZIP2").

    Menentukan bagaimana data dikompresi. Hal ini umumnya tidak diperlukan jika data memiliki sebuah ekstensi file standar. Nilai yang mungkin adalah "gzip" dan"bzip").

  • Exclusions— Sebuah array UTF-8 string.

    String yang berisi daftar JSON pola Unix-style glob untuk dikecualikan. Misalnya, “[\" **.pdf\ "]” mengecualikan semua file PDF.

  • GroupSize— UTF-8 string, cocok denganCustom string pattern #66.

    Ukuran kelompok target dalam byte. Default-nya dihitung berdasarkan ukuran input data dan ukuran klaster Anda. Ketika ada kurang dari 50.000 file input, "groupFiles" harus diatur ke "inPartition" agar ini berlaku.

  • GroupFiles— UTF-8 string, cocok denganCustom string pattern #66.

    Pengelompokan file diaktifkan secara default ketika input berisi lebih dari 50.000 file. Untuk mengaktifkan pengelompokan dengan kurang dari 50.000 file, atur parameter ini ke “inPartition”. Untuk menonaktifkan pengelompokan dalam grup ketika ada lebih dari 50.000 file, tetapkan parameter ini ke "none".

  • Recurse – Boolean.

    Jika disetel ke true, secara rekursif membaca file di semua subdirektori di bawah jalur yang ditentukan.

  • MaxBand — Nomor (bilangan bulat).

    Opsi ini mengontrol durasi dalam milidetik setelah itu daftar s3 cenderung konsisten. File dengan stempel waktu modifikasi yang berada dalam milidetik MaxBand terakhir dilacak secara khusus saat digunakan JobBookmarks untuk memperhitungkan konsistensi akhir Amazon S3. Sebagian besar pengguna tidak perlu mengatur opsi ini. Default-nya adalah 900000 milidetik, atau 15 menit.

  • MaxFilesInBand — Nomor (bilangan bulat).

    Opsi ini menentukan jumlah maksimum file untuk disimpan dari detik MaxBand terakhir. Jika jumlah ini terlampaui, file tambahan akan dilewati dan hanya diproses dalam eksekusi tugas berikutnya.

  • AdditionalOptions — Sebuah objek S3DirectSourceAdditionalOptions.

    Menentukan opsi koneksi tambahan.

  • Separator Diperlukan: UTF-8 string (nilai valid: comma="COMMA" | ctrla="CTRLA" | pipe="PIPE" | semicolon="SEMICOLON" |tab="TAB").

    Menentukan karakter pembatas. Defaultnya adalah koma: “,”, tetapi karakter lain dapat ditentukan.

  • Escaper— UTF-8 string, cocok denganCustom string pattern #66.

    Menentukan karakter yang akan digunakan untuk melarikan diri. Pilihan ini hanya digunakan saat membaca file CSV saja. Nilai default-nya adalah none. Jika diaktifkan, karakter yang ada langsung setelahnya digunakan apa adanya, kecuali untuk satu set karakter escape yang sudah sangat dikenal (\n, \r, \t, dan \0).

  • QuoteChar Diperlukan: UTF-8 string (nilai valid: quote="QUOTE" | quillemet="QUILLEMET" | single_quote="SINGLE_QUOTE" |disabled="DISABLED").

    Menentukan karakter yang akan digunakan untuk mengutip. Default-nya adalah kutipan ganda: '"'. Atur ini ke -1 untuk menonaktifkan pengutipan seluruhnya.

  • Multiline – Boolean.

    Nilai Boolean yang menentukan apakah satu catatan dapat menjangkau beberapa baris. Hal ini dapat terjadi ketika bidang berisi karakter baris baru yang dikutip. Anda harus mengatur opsi ini ke True jika ada catatan yang mencakup beberapa baris. Nilai default-nya adalah False, yang memungkinkan untuk pemecahan file yang lebih agresif selama penguraian.

  • WithHeader – Boolean.

    Nilai Boolean yang menentukan apakah akan memperlakukan baris pertama sebagai header. Nilai default-nya adalah False.

  • WriteHeader – Boolean.

    Nilai Boolean yang menentukan apakah akan menulis header untuk output. Nilai default-nya adalah True.

  • SkipFirst – Boolean.

    Nilai Boolean yang menentukan apakah akan melewati baris data pertama. Nilai default-nya adalah False.

  • OptimizePerformance – Boolean.

    Nilai Boolean yang menentukan apakah akan menggunakan pembaca CSV SIMD lanjutan bersama dengan format memori kolumnar berbasis Apache Arrow. Hanya tersedia dalam AWS Glue versi 3.0.

  • OutputSchemas – Susunan objek GlueSchema.

    Menentukan skema data untuk sumber CSV S3.

Struktur DirectJDBCSource

Menentukan koneksi sumber JDBC langsung.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama koneksi sumber JDBC.

  • Database Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Basis data koneksi sumber JDBC.

  • Table Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Tabel koneksi sumber JDBC.

  • ConnectionName Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Nama koneksi sumber JDBC.

  • ConnectionType Diperlukan: UTF-8 string (nilai valid: sqlserver | mysql | oracle | postgresql |redshift).

    Jenis koneksi sumber JDBC.

  • RedshiftTmpDir— UTF-8 string, cocok denganCustom string pattern #66.

    Direktori temp dari sumber JDBC Redshift.

  • OutputSchemas – Susunan objek GlueSchema.

    Menentukan skema data untuk sumber JDBC langsung.

S3DirectSourceAdditionalOptions struktur

Menentukan opsi koneksi tambahan untuk penyimpanan data Amazon S3.

Bidang
  • BoundedSize — Nomor (panjang).

    Menetapkan batas atas untuk ukuran target dataset dalam byte yang akan diproses.

  • BoundedFiles — Nomor (panjang).

    Menetapkan batas atas untuk jumlah target file yang akan diproses.

  • EnableSamplePath – Boolean.

    Menetapkan opsi untuk mengaktifkan jalur sampel.

  • SamplePath— UTF-8 string, cocok denganCustom string pattern #66.

    Jika diaktifkan, tentukan jalur sampel.

S3JsonSource struktur

Menentukan penyimpanan data JSON yang disimpan di Amazon S3.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama penyimpanan data

  • Paths- Diperlukan: Array UTF-8 string.

    Daftar jalur Amazon S3 untuk dibaca.

  • CompressionType— UTF-8 string (nilai valid: gzip="GZIP" |bzip2="BZIP2").

    Menentukan bagaimana data dikompresi. Hal ini umumnya tidak diperlukan jika data memiliki sebuah ekstensi file standar. Nilai yang mungkin adalah "gzip" dan"bzip").

  • Exclusions— Sebuah array UTF-8 string.

    String yang berisi daftar JSON pola Unix-style glob untuk dikecualikan. Misalnya, “[\" **.pdf\ "]” mengecualikan semua file PDF.

  • GroupSize— UTF-8 string, cocok denganCustom string pattern #66.

    Ukuran kelompok target dalam byte. Default-nya dihitung berdasarkan ukuran input data dan ukuran klaster Anda. Ketika ada kurang dari 50.000 file input, "groupFiles" harus diatur ke "inPartition" agar ini berlaku.

  • GroupFiles— UTF-8 string, cocok denganCustom string pattern #66.

    Pengelompokan file diaktifkan secara default ketika input berisi lebih dari 50.000 file. Untuk mengaktifkan pengelompokan dengan kurang dari 50.000 file, atur parameter ini ke “inPartition”. Untuk menonaktifkan pengelompokan dalam grup ketika ada lebih dari 50.000 file, tetapkan parameter ini ke "none".

  • Recurse – Boolean.

    Jika disetel ke true, secara rekursif membaca file di semua subdirektori di bawah jalur yang ditentukan.

  • MaxBand — Nomor (bilangan bulat).

    Opsi ini mengontrol durasi dalam milidetik setelah itu daftar s3 cenderung konsisten. File dengan stempel waktu modifikasi yang berada dalam milidetik MaxBand terakhir dilacak secara khusus saat digunakan JobBookmarks untuk memperhitungkan konsistensi akhir Amazon S3. Sebagian besar pengguna tidak perlu mengatur opsi ini. Default-nya adalah 900000 milidetik, atau 15 menit.

  • MaxFilesInBand — Nomor (bilangan bulat).

    Opsi ini menentukan jumlah maksimum file untuk disimpan dari detik MaxBand terakhir. Jika jumlah ini terlampaui, file tambahan akan dilewati dan hanya diproses dalam eksekusi tugas berikutnya.

  • AdditionalOptions — Sebuah objek S3DirectSourceAdditionalOptions.

    Menentukan opsi koneksi tambahan.

  • JsonPath— UTF-8 string, cocok denganCustom string pattern #66.

    Sebuah JsonPath string yang mendefinisikan data JSON.

  • Multiline – Boolean.

    Nilai Boolean yang menentukan apakah satu catatan dapat menjangkau beberapa baris. Hal ini dapat terjadi ketika bidang berisi karakter baris baru yang dikutip. Anda harus mengatur opsi ini ke True jika ada catatan yang mencakup beberapa baris. Nilai default-nya adalah False, yang memungkinkan untuk pemecahan file yang lebih agresif selama penguraian.

  • OutputSchemas – Susunan objek GlueSchema.

    Menentukan skema data untuk sumber S3 JSON.

S3ParquetSource struktur

Menentukan penyimpanan data Apache Parquet yang disimpan di Amazon S3.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama penyimpanan data

  • Paths- Diperlukan: Array UTF-8 string.

    Daftar jalur Amazon S3 untuk dibaca.

  • CompressionType— UTF-8 string (nilai yang valid: snappy="SNAPPY" lzo="LZO" | gzip="GZIP" | brotli="BROTLI" | lz4="LZ4" | uncompressed="UNCOMPRESSED" |none="NONE").

    Menentukan bagaimana data dikompresi. Hal ini umumnya tidak diperlukan jika data memiliki sebuah ekstensi file standar. Nilai yang mungkin adalah "gzip" dan"bzip").

  • Exclusions— Sebuah array UTF-8 string.

    String yang berisi daftar JSON pola Unix-style glob untuk dikecualikan. Misalnya, “[\" **.pdf\ "]” mengecualikan semua file PDF.

  • GroupSize— UTF-8 string, cocok denganCustom string pattern #66.

    Ukuran kelompok target dalam byte. Default-nya dihitung berdasarkan ukuran input data dan ukuran klaster Anda. Ketika ada kurang dari 50.000 file input, "groupFiles" harus diatur ke "inPartition" agar ini berlaku.

  • GroupFiles— UTF-8 string, cocok denganCustom string pattern #66.

    Pengelompokan file diaktifkan secara default ketika input berisi lebih dari 50.000 file. Untuk mengaktifkan pengelompokan dengan kurang dari 50.000 file, atur parameter ini ke “inPartition”. Untuk menonaktifkan pengelompokan dalam grup ketika ada lebih dari 50.000 file, tetapkan parameter ini ke "none".

  • Recurse – Boolean.

    Jika disetel ke true, secara rekursif membaca file di semua subdirektori di bawah jalur yang ditentukan.

  • MaxBand — Nomor (bilangan bulat).

    Opsi ini mengontrol durasi dalam milidetik setelah itu daftar s3 cenderung konsisten. File dengan stempel waktu modifikasi yang berada dalam milidetik MaxBand terakhir dilacak secara khusus saat digunakan JobBookmarks untuk memperhitungkan konsistensi akhir Amazon S3. Sebagian besar pengguna tidak perlu mengatur opsi ini. Default-nya adalah 900000 milidetik, atau 15 menit.

  • MaxFilesInBand — Nomor (bilangan bulat).

    Opsi ini menentukan jumlah maksimum file untuk disimpan dari detik MaxBand terakhir. Jika jumlah ini terlampaui, file tambahan akan dilewati dan hanya diproses dalam eksekusi tugas berikutnya.

  • AdditionalOptions — Sebuah objek S3DirectSourceAdditionalOptions.

    Menentukan opsi koneksi tambahan.

  • OutputSchemas – Susunan objek GlueSchema.

    Menentukan skema data untuk sumber S3 Parquet.

S3DeltaSource struktur

Menentukan sumber data Delta Lake yang disimpan di Amazon S3.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama sumber Danau Delta.

  • Paths- Diperlukan: Array UTF-8 string.

    Daftar jalur Amazon S3 untuk dibaca.

  • AdditionalDeltaOptions – Susunan peta pasangan nilai kunci.

    Setiap kunci adalah UTF-8 string, cocok denganCustom string pattern #66.

    Setiap nilai adalah UTF-8 string, cocok denganCustom string pattern #66.

    Menentukan opsi koneksi tambahan.

  • AdditionalOptions — Sebuah objek S3DirectSourceAdditionalOptions.

    Menentukan opsi tambahan untuk konektor.

  • OutputSchemas – Susunan objek GlueSchema.

    Menentukan skema data untuk sumber Delta Lake.

S3CatalogDeltaSource struktur

Menentukan sumber data Delta Lake yang terdaftar di Katalog AWS Glue Data. Sumber data harus disimpan di Amazon S3.

Bidang

CatalogDeltaSource struktur

Menentukan sumber data Delta Lake yang terdaftar di Katalog AWS Glue Data.

Bidang

S3HudiSource struktur

Menentukan sumber data Hudi yang disimpan di Amazon S3.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama sumber Hudi.

  • Paths- Diperlukan: Array UTF-8 string.

    Daftar jalur Amazon S3 untuk dibaca.

  • AdditionalHudiOptions – Susunan peta pasangan nilai kunci.

    Setiap kunci adalah UTF-8 string, cocok denganCustom string pattern #66.

    Setiap nilai adalah UTF-8 string, cocok denganCustom string pattern #66.

    Menentukan opsi koneksi tambahan.

  • AdditionalOptions — Sebuah objek S3DirectSourceAdditionalOptions.

    Menentukan opsi tambahan untuk konektor.

  • OutputSchemas – Susunan objek GlueSchema.

    Menentukan skema data untuk sumber Hudi.

S3CatalogHudiSource struktur

Menentukan sumber data Hudi yang terdaftar di Katalog AWS Glue Data. Sumber data Hudi harus disimpan di Amazon S3.

Bidang

S3ExcelSource struktur

Menentukan sumber data S3 Excel.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama sumber data S3 Excel.

  • Paths- Diperlukan: Array UTF-8 string.

    Jalur S3 tempat file Excel berada.

  • CompressionType— UTF-8 string (nilai yang valid: snappy="SNAPPY" lzo="LZO" | gzip="GZIP" | brotli="BROTLI" | lz4="LZ4" | uncompressed="UNCOMPRESSED" |none="NONE").

    Format kompresi yang digunakan untuk file Excel.

  • Exclusions— Sebuah array UTF-8 string.

    Pola untuk mengecualikan file atau jalur tertentu dari pemrosesan.

  • GroupSize— UTF-8 string, cocok denganCustom string pattern #66.

    Mendefinisikan ukuran grup file untuk pemrosesan batch.

  • GroupFiles— UTF-8 string, cocok denganCustom string pattern #66.

    Menentukan bagaimana file harus dikelompokkan untuk diproses.

  • Recurse – Boolean.

    Menunjukkan apakah akan memproses subdirektori secara rekursif.

  • MaxBand — Nomor (bilangan bulat).

    Jumlah maksimum pita pemrosesan yang akan digunakan.

  • MaxFilesInBand — Nomor (bilangan bulat).

    Jumlah maksimum file untuk diproses di setiap band.

  • AdditionalOptions — Sebuah objek S3DirectSourceAdditionalOptions.

    Opsi konfigurasi tambahan untuk pemrosesan sumber langsung S3.

  • NumberRows — Nomor (panjang).

    Jumlah baris yang akan diproses dari setiap file Excel.

  • SkipFooter — Nomor (bilangan bulat).

    Jumlah baris yang akan dilewati di akhir setiap file Excel.

  • OutputSchemas – Susunan objek GlueSchema.

    S AWS Glue kema untuk diterapkan pada data yang diproses.

CatalogHudiSource struktur

Menentukan sumber data Hudi yang terdaftar di Katalog AWS Glue Data.

Bidang

DynamoDBCatalogSource struktur

Menentukan sumber data DynamoDB di Katalog AWS Glue Data.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama dari sumber data.

  • Database Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Nama database yang akan dibaca.

  • Table Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Nama tabel dalam database untuk dibaca.

  • PitrEnabled – Boolean.

    Menentukan apakah Point-in-Time Recovery (PITR) diaktifkan untuk tabel DynamoDB. Ketika diset true el ke, memungkinkan membaca dari titik waktu tertentu. Nilai default-nya adalah false.

  • AdditionalOptions — Sebuah objek DDBELTCatalogAdditionalOptions.

    Menentukan opsi koneksi tambahan untuk sumber data DynamoDB.

RelationalCatalogSource struktur

Menentukan sumber data database relasional dalam Katalog AWS Glue Data.

Bidang

JDBCConnectorTarget struktur

Menentukan target data yang menulis ke Amazon S3 di penyimpanan kolom Apache Parquet.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama target data.

  • Inputs- Diperlukan: Sebuah array UTF-8 string, tidak kurang dari 1 atau lebih dari 1 string.

    Node yang merupakan input ke target data.

  • ConnectionName Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Nama koneksi yang terkait dengan konektor.

  • ConnectionTable Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Nama tabel di target data.

  • ConnectorName Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Nama konektor yang akan digunakan.

  • ConnectionType Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Jenis koneksi, seperti marketplace.jdbc atau custom.jdbc, menunjuk koneksi ke target data JDBC.

  • AdditionalOptions – Susunan peta pasangan nilai kunci.

    Setiap kunci adalah UTF-8 string, cocok denganCustom string pattern #66.

    Setiap nilai adalah UTF-8 string, cocok denganCustom string pattern #66.

    Opsi koneksi tambahan untuk konektor.

  • OutputSchemas – Susunan objek GlueSchema.

    Menentukan skema data untuk target JDBC.

SparkConnectorTarget struktur

Menentukan target yang menggunakan konektor Apache Spark.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama target data.

  • Inputs- Diperlukan: Sebuah array UTF-8 string, tidak kurang dari 1 atau lebih dari 1 string.

    Node yang merupakan input ke target data.

  • ConnectionName Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Nama koneksi untuk konektor Apache Spark.

  • ConnectorName Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Nama konektor Apache Spark.

  • ConnectionType Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Jenis koneksi, seperti marketplace.spark atau custom.spark, menunjuk koneksi ke penyimpanan data Apache Spark.

  • AdditionalOptions – Susunan peta pasangan nilai kunci.

    Setiap kunci adalah UTF-8 string, cocok denganCustom string pattern #66.

    Setiap nilai adalah UTF-8 string, cocok denganCustom string pattern #66.

    Opsi koneksi tambahan untuk konektor.

  • OutputSchemas – Susunan objek GlueSchema.

    Menentukan skema data untuk target percikan kustom.

BasicCatalogTarget struktur

Menentukan target yang menggunakan tabel Katalog AWS Glue Data.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama target data Anda.

  • Inputs- Diperlukan: Sebuah array UTF-8 string, tidak kurang dari 1 atau lebih dari 1 string.

    Node yang merupakan input ke target data.

  • PartitionKeys— Sebuah array UTF-8 string.

    Kunci partisi digunakan untuk mendistribusikan data di beberapa partisi atau pecahan berdasarkan kunci tertentu atau kumpulan kunci.

  • Database Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Database yang berisi tabel yang ingin Anda gunakan sebagai target. Basis data ini harus sudah ada dalam Katalog Data.

  • Table Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Tabel yang mendefinisikan skema data keluaran Anda. Tabel ini sudah harus ada dalam Katalog Data.

MySQLCatalogTarget struktur

Menentukan target yang menggunakan MySQL.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama target data.

  • Inputs- Diperlukan: Sebuah array UTF-8 string, tidak kurang dari 1 atau lebih dari 1 string.

    Node yang merupakan input ke target data.

  • Database Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Nama database untuk menulis.

  • Table Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Nama tabel dalam database untuk menulis.

PostgreSQLCatalogTarget struktur

Menentukan target yang menggunakan Postgres SQL.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama target data.

  • Inputs- Diperlukan: Sebuah array UTF-8 string, tidak kurang dari 1 atau lebih dari 1 string.

    Node yang merupakan input ke target data.

  • Database Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Nama database untuk menulis.

  • Table Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Nama tabel dalam database untuk menulis.

OracleSQLCatalogTarget struktur

Menentukan target yang menggunakan Oracle SQL.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama target data.

  • Inputs- Diperlukan: Sebuah array UTF-8 string, tidak kurang dari 1 atau lebih dari 1 string.

    Node yang merupakan input ke target data.

  • Database Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Nama database untuk menulis.

  • Table Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Nama tabel dalam database untuk menulis.

MicrosoftSQLServerCatalogTarget struktur

Menentukan target yang menggunakan Microsoft SQL.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama target data.

  • Inputs- Diperlukan: Sebuah array UTF-8 string, tidak kurang dari 1 atau lebih dari 1 string.

    Node yang merupakan input ke target data.

  • Database Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Nama database untuk menulis.

  • Table Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Nama tabel dalam database untuk menulis.

RedshiftTarget struktur

Menentukan target yang menggunakan Amazon Redshift.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama target data.

  • Inputs- Diperlukan: Sebuah array UTF-8 string, tidak kurang dari 1 atau lebih dari 1 string.

    Node yang merupakan input ke target data.

  • Database Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Nama database untuk menulis.

  • Table Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Nama tabel dalam database untuk menulis.

  • RedshiftTmpDir— UTF-8 string, cocok denganCustom string pattern #66.

    Jalur Amazon S3 tempat data sementara dapat dipentaskan saat menyalin keluar dari database.

  • TmpDirIAMRole— UTF-8 string, cocok denganCustom string pattern #66.

    Peran IAM dengan izin.

  • UpsertRedshiftOptions — Sebuah objek UpsertRedshiftTargetOptions.

    Kumpulan opsi untuk mengonfigurasi operasi upsert saat menulis ke target Redshift.

AmazonRedshiftTarget struktur

Menentukan target Amazon Redshift.

Bidang
  • Name— UTF-8 string, cocok denganCustom string pattern #68.

    Nama target Amazon Redshift.

  • Data — Sebuah objek AmazonRedshiftNodeData.

    Menentukan data simpul target Amazon Redshift.

  • Inputs— Sebuah array UTF-8 string, tidak kurang dari 1 atau lebih dari 1 string.

    Node yang merupakan input ke target data.

UpsertRedshiftTargetOptions struktur

Opsi untuk mengonfigurasi operasi upsert saat menulis ke target Redshift.

Bidang
  • TableLocation— UTF-8 string, cocok denganCustom string pattern #66.

    Lokasi fisik tabel Redshift.

  • ConnectionName— UTF-8 string, cocok denganCustom string pattern #66.

    Nama koneksi yang digunakan untuk menulis ke Redshift.

  • UpsertKeys— Sebuah array UTF-8 string.

    Tombol yang digunakan untuk menentukan apakah akan melakukan pembaruan atau menyisipkan.

S3CatalogTarget struktur

Menentukan target data yang menulis ke Amazon S3 menggunakan Katalog AWS Glue Data.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama target data.

  • Inputs- Diperlukan: Sebuah array UTF-8 string, tidak kurang dari 1 atau lebih dari 1 string.

    Node yang merupakan input ke target data.

  • PartitionKeys— Sebuah array UTF-8 string.

    Menentukan partisi asli menggunakan urutan kunci.

  • Table Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Nama tabel dalam database untuk menulis.

  • Database Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Nama database untuk menulis.

  • SchemaChangePolicy — Sebuah objek CatalogSchemaChangePolicy.

    Kebijakan yang menentukan perilaku pembaruan untuk crawler.

  • AutoDataQuality — Sebuah objek AutoDataQuality.

    Menentukan apakah akan secara otomatis mengaktifkan evaluasi kualitas data untuk target katalog S3. Ketika disetel ketrue, pemeriksaan kualitas data dilakukan secara otomatis selama operasi penulisan.

S3GlueParquetTarget struktur

Menentukan target data yang menulis ke Amazon S3 di penyimpanan kolom Apache Parquet.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama target data.

  • Inputs- Diperlukan: Sebuah array UTF-8 string, tidak kurang dari 1 atau lebih dari 1 string.

    Node yang merupakan input ke target data.

  • PartitionKeys— Sebuah array UTF-8 string.

    Menentukan partisi asli menggunakan urutan kunci.

  • Path Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Satu jalur Amazon S3 untuk menulis.

  • Compression— UTF-8 string (nilai yang valid: snappy="SNAPPY" lzo="LZO" | gzip="GZIP" | brotli="BROTLI" | lz4="LZ4" | uncompressed="UNCOMPRESSED" |none="NONE").

    Menentukan bagaimana data dikompresi. Hal ini umumnya tidak diperlukan jika data memiliki sebuah ekstensi file standar. Nilai yang mungkin adalah "gzip" dan"bzip").

  • NumberTargetPartitions— UTF-8 tali.

    Menentukan jumlah partisi target untuk file Parquet saat menulis ke Amazon S3 menggunakan AWS Glue.

  • SchemaChangePolicy — Sebuah objek DirectSchemaChangePolicy.

    Kebijakan yang menentukan perilaku pembaruan untuk crawler.

  • AutoDataQuality — Sebuah objek AutoDataQuality.

    Menentukan apakah akan secara otomatis mengaktifkan evaluasi kualitas data untuk target S3 AWS Glue Parquet. Ketika disetel ketrue, pemeriksaan kualitas data dilakukan secara otomatis selama operasi penulisan.

CatalogSchemaChangePolicy struktur

Kebijakan yang menentukan perilaku pembaruan untuk crawler.

Bidang
  • EnableUpdateCatalog – Boolean.

    Apakah akan menggunakan perilaku pembaruan yang ditentukan saat crawler menemukan skema yang diubah.

  • UpdateBehavior— UTF-8 string (nilai valid: UPDATE_IN_DATABASE |LOG).

    Perilaku pembaruan ketika perayap menemukan skema yang berubah.

S3DirectTarget struktur

Menentukan target data yang menulis ke Amazon S3.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama target data.

  • Inputs- Diperlukan: Sebuah array UTF-8 string, tidak kurang dari 1 atau lebih dari 1 string.

    Node yang merupakan input ke target data.

  • PartitionKeys— Sebuah array UTF-8 string.

    Menentukan partisi asli menggunakan urutan kunci.

  • Path Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Satu jalur Amazon S3 untuk menulis.

  • Compression— UTF-8 string, cocok denganCustom string pattern #66.

    Menentukan bagaimana data dikompresi. Hal ini umumnya tidak diperlukan jika data memiliki sebuah ekstensi file standar. Nilai yang mungkin adalah "gzip" dan"bzip").

  • NumberTargetPartitions— UTF-8 tali.

    Menentukan jumlah partisi target saat menulis data langsung ke Amazon S3.

  • Format Diperlukan: UTF-8 string (nilai yang valid: json="JSON" csv="CSV" | avro="AVRO" | orc="ORC" | parquet="PARQUET" | hudi="HUDI" | delta="DELTA" | iceberg="ICEBERG" | hyper="HYPER" |xml="XML").

    Menentukan format output data untuk target.

  • SchemaChangePolicy — Sebuah objek DirectSchemaChangePolicy.

    Kebijakan yang menentukan perilaku pembaruan untuk crawler.

  • AutoDataQuality — Sebuah objek AutoDataQuality.

    Menentukan apakah akan secara otomatis mengaktifkan evaluasi kualitas data untuk target langsung S3. Ketika disetel ketrue, pemeriksaan kualitas data dilakukan secara otomatis selama operasi penulisan.

  • OutputSchemas – Susunan objek GlueSchema.

    Menentukan skema data untuk target langsung S3.

S3HudiCatalogTarget struktur

Menentukan target yang menulis ke sumber data Hudi di Katalog AWS Glue Data.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama target data.

  • Inputs- Diperlukan: Sebuah array UTF-8 string, tidak kurang dari 1 atau lebih dari 1 string.

    Node yang merupakan input ke target data.

  • PartitionKeys— Sebuah array UTF-8 string.

    Menentukan partisi asli menggunakan urutan kunci.

  • Table Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Nama tabel dalam database untuk menulis.

  • Database Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Nama database untuk menulis.

  • AdditionalOptionsWajib: Susunan peta pasangan nilai kunci.

    Setiap kunci adalah UTF-8 string, cocok denganCustom string pattern #66.

    Setiap nilai adalah UTF-8 string, cocok denganCustom string pattern #66.

    Menentukan opsi koneksi tambahan untuk konektor.

  • SchemaChangePolicy — Sebuah objek CatalogSchemaChangePolicy.

    Kebijakan yang menentukan perilaku pembaruan untuk crawler.

  • AutoDataQuality — Sebuah objek AutoDataQuality.

    Menentukan apakah akan secara otomatis mengaktifkan evaluasi kualitas data untuk target katalog S3 Hudi. Ketika disetel ketrue, pemeriksaan kualitas data dilakukan secara otomatis selama operasi penulisan.

  • OutputSchemas – Susunan objek GlueSchema.

    Menentukan skema data untuk target katalog S3 Hudi.

S3HudiDirectTarget struktur

Menentukan target yang menulis ke sumber data Hudi di. Amazon S3

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama target data.

  • Inputs- Diperlukan: Sebuah array UTF-8 string, tidak kurang dari 1 atau lebih dari 1 string.

    Node yang merupakan input ke target data.

  • Path Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Jalur Amazon S3 dari sumber data Hudi Anda untuk menulis.

  • Compression Diperlukan: UTF-8 string (nilai valid: gzip="GZIP" | lzo="LZO" | uncompressed="UNCOMPRESSED" |snappy="SNAPPY").

    Menentukan bagaimana data dikompresi. Hal ini umumnya tidak diperlukan jika data memiliki sebuah ekstensi file standar. Nilai yang mungkin adalah "gzip" dan"bzip").

  • NumberTargetPartitions— UTF-8 tali.

    Menentukan jumlah partisi target untuk mendistribusikan file dataset Hudi di Amazon S3.

  • PartitionKeys— Sebuah array UTF-8 string.

    Menentukan partisi asli menggunakan urutan kunci.

  • Format Diperlukan: UTF-8 string (nilai yang valid: json="JSON" csv="CSV" | avro="AVRO" | orc="ORC" | parquet="PARQUET" | hudi="HUDI" | delta="DELTA" | iceberg="ICEBERG" | hyper="HYPER" |xml="XML").

    Menentukan format output data untuk target.

  • AdditionalOptionsWajib: Susunan peta pasangan nilai kunci.

    Setiap kunci adalah UTF-8 string, cocok denganCustom string pattern #66.

    Setiap nilai adalah UTF-8 string, cocok denganCustom string pattern #66.

    Menentukan opsi koneksi tambahan untuk konektor.

  • SchemaChangePolicy — Sebuah objek DirectSchemaChangePolicy.

    Kebijakan yang menentukan perilaku pembaruan untuk crawler.

  • AutoDataQuality — Sebuah objek AutoDataQuality.

    Menentukan apakah akan secara otomatis mengaktifkan evaluasi kualitas data untuk target langsung S3 Hudi. Ketika disetel ketrue, pemeriksaan kualitas data dilakukan secara otomatis selama operasi penulisan.

S3DeltaCatalogTarget struktur

Menentukan target yang menulis ke sumber data Delta Lake di Katalog AWS Glue Data.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama target data.

  • Inputs- Diperlukan: Sebuah array UTF-8 string, tidak kurang dari 1 atau lebih dari 1 string.

    Node yang merupakan input ke target data.

  • PartitionKeys— Sebuah array UTF-8 string.

    Menentukan partisi asli menggunakan urutan kunci.

  • Table Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Nama tabel dalam database untuk menulis.

  • Database Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Nama database untuk menulis.

  • AdditionalOptions – Susunan peta pasangan nilai kunci.

    Setiap kunci adalah UTF-8 string, cocok denganCustom string pattern #66.

    Setiap nilai adalah UTF-8 string, cocok denganCustom string pattern #66.

    Menentukan opsi koneksi tambahan untuk konektor.

  • SchemaChangePolicy — Sebuah objek CatalogSchemaChangePolicy.

    Kebijakan yang menentukan perilaku pembaruan untuk crawler.

  • AutoDataQuality — Sebuah objek AutoDataQuality.

    Menentukan apakah akan secara otomatis mengaktifkan evaluasi kualitas data untuk target katalog S3 Delta. Ketika disetel ketrue, pemeriksaan kualitas data dilakukan secara otomatis selama operasi penulisan.

  • OutputSchemas – Susunan objek GlueSchema.

    Menentukan skema data untuk target katalog S3 Delta.

S3DeltaDirectTarget struktur

Menentukan target yang menulis ke sumber data Delta Lake di Amazon S3.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama target data.

  • Inputs- Diperlukan: Sebuah array UTF-8 string, tidak kurang dari 1 atau lebih dari 1 string.

    Node yang merupakan input ke target data.

  • PartitionKeys— Sebuah array UTF-8 string.

    Menentukan partisi asli menggunakan urutan kunci.

  • Path Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Jalur Amazon S3 dari sumber data Delta Lake Anda untuk menulis.

  • Compression Diperlukan: UTF-8 string (nilai valid: uncompressed="UNCOMPRESSED" |snappy="SNAPPY").

    Menentukan bagaimana data dikompresi. Hal ini umumnya tidak diperlukan jika data memiliki sebuah ekstensi file standar. Nilai yang mungkin adalah "gzip" dan"bzip").

  • NumberTargetPartitions— UTF-8 tali.

    Menentukan jumlah partisi target untuk mendistribusikan file dataset Delta Lake di Amazon S3.

  • Format Diperlukan: UTF-8 string (nilai yang valid: json="JSON" csv="CSV" | avro="AVRO" | orc="ORC" | parquet="PARQUET" | hudi="HUDI" | delta="DELTA" | iceberg="ICEBERG" | hyper="HYPER" |xml="XML").

    Menentukan format output data untuk target.

  • AdditionalOptions – Susunan peta pasangan nilai kunci.

    Setiap kunci adalah UTF-8 string, cocok denganCustom string pattern #66.

    Setiap nilai adalah UTF-8 string, cocok denganCustom string pattern #66.

    Menentukan opsi koneksi tambahan untuk konektor.

  • SchemaChangePolicy — Sebuah objek DirectSchemaChangePolicy.

    Kebijakan yang menentukan perilaku pembaruan untuk crawler.

  • AutoDataQuality — Sebuah objek AutoDataQuality.

    Menentukan apakah akan secara otomatis mengaktifkan evaluasi kualitas data untuk target langsung S3 Delta. Ketika disetel ketrue, pemeriksaan kualitas data dilakukan secara otomatis selama operasi penulisan.

S3HyperDirectTarget struktur

Menentukan target HyperDirect data yang menulis ke Amazon S3.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Pengidentifikasi unik untuk simpul HyperDirect target.

  • Inputs- Diperlukan: Sebuah array UTF-8 string, tidak kurang dari 1 atau lebih dari 1 string.

    Menentukan sumber input untuk HyperDirect target.

  • Format— UTF-8 string (nilai yang valid: json="JSON" csv="CSV" | avro="AVRO" | orc="ORC" | parquet="PARQUET" | hudi="HUDI" | delta="DELTA" | iceberg="ICEBERG" | hyper="HYPER" |xml="XML").

    Menentukan format output data untuk HyperDirect target.

  • PartitionKeys— Sebuah array UTF-8 string.

    Mendefinisikan strategi partisi untuk data keluaran.

  • Path Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Lokasi S3 tempat data output akan ditulis.

  • Compression— UTF-8 string (nilai valid:uncompressed="UNCOMPRESSED").

    Jenis kompresi untuk diterapkan pada data output.

  • SchemaChangePolicy — Sebuah objek DirectSchemaChangePolicy.

    Mendefinisikan bagaimana perubahan skema ditangani selama operasi penulisan.

  • AutoDataQuality — Sebuah objek AutoDataQuality.

    Menentukan apakah akan secara otomatis mengaktifkan evaluasi kualitas data untuk target langsung S3 Hyper. Ketika disetel ketrue, pemeriksaan kualitas data dilakukan secara otomatis selama operasi penulisan.

  • OutputSchemas – Susunan objek GlueSchema.

    Menentukan skema data untuk target langsung S3 Hyper.

S3IcebergDirectTarget struktur

Menentukan target yang menulis ke sumber data gunung es di Amazon S3.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Menentukan pengidentifikasi unik untuk node target gunung es di pipeline data Anda.

  • Inputs- Diperlukan: Sebuah array UTF-8 string, tidak kurang dari 1 atau lebih dari 1 string.

    Mendefinisikan sumber input tunggal yang menyediakan data ke target gunung es ini.

  • PartitionKeys— Sebuah array UTF-8 string.

    Menentukan kolom yang digunakan untuk mempartisi data tabel Iceberg di S3.

  • Path Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Mendefinisikan lokasi S3 tempat data tabel Iceberg akan disimpan.

  • Format Diperlukan: UTF-8 string (nilai yang valid: json="JSON" csv="CSV" | avro="AVRO" | orc="ORC" | parquet="PARQUET" | hudi="HUDI" | delta="DELTA" | iceberg="ICEBERG" | hyper="HYPER" |xml="XML").

    Menentukan format file yang digunakan untuk menyimpan data tabel Iceberg (misalnya, Parquet, ORC).

  • AdditionalOptions – Susunan peta pasangan nilai kunci.

    Setiap kunci adalah UTF-8 string, cocok denganCustom string pattern #66.

    Setiap nilai adalah UTF-8 string, cocok denganCustom string pattern #66.

    Menyediakan opsi konfigurasi tambahan untuk menyesuaikan perilaku tabel Iceberg.

  • SchemaChangePolicy — Sebuah objek DirectSchemaChangePolicy.

    Mendefinisikan bagaimana perubahan skema ditangani saat menulis data ke tabel Iceberg.

  • Compression Diperlukan: UTF-8 string (nilai valid: gzip="GZIP" | lzo="LZO" | uncompressed="UNCOMPRESSED" |snappy="SNAPPY").

    Menentukan codec kompresi yang digunakan untuk file tabel Iceberg di S3.

  • NumberTargetPartitions— UTF-8 tali.

    Menetapkan jumlah partisi target untuk mendistribusikan file tabel Iceberg di S3.

  • OutputSchemas – Susunan objek GlueSchema.

    Menentukan skema data untuk target langsung S3 Iceberg.

DirectSchemaChangePolicy struktur

Kebijakan yang menentukan perilaku pembaruan untuk crawler.

Bidang
  • EnableUpdateCatalog – Boolean.

    Apakah akan menggunakan perilaku pembaruan yang ditentukan saat crawler menemukan skema yang diubah.

  • UpdateBehavior— UTF-8 string (nilai valid: UPDATE_IN_DATABASE |LOG).

    Perilaku pembaruan ketika perayap menemukan skema yang berubah.

  • Table— UTF-8 string, cocok denganCustom string pattern #66.

    Menentukan tabel dalam database yang diterapkan kebijakan perubahan skema.

  • Database— UTF-8 string, cocok denganCustom string pattern #66.

    Menentukan database yang diterapkan kebijakan perubahan skema.

ApplyMapping struktur

Menentukan transformasi yang memetakan kunci properti data dalam sumber data ke kunci properti data di target data. Anda dapat mengganti nama kunci, memodifikasi tipe data untuk kunci, dan memilih kunci mana yang akan dibuang dari set data.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama node transformasi.

  • Inputs- Diperlukan: Sebuah array UTF-8 string, tidak kurang dari 1 atau lebih dari 1 string.

    Input data diidentifikasi dengan nama simpul mereka.

  • MappingWajib: Susunan objek Pemetaan.

    Menentukan pemetaan kunci properti data di sumber data ke kunci properti data di target data.

Struktur pemetaan

Menentukan pemetaan kunci properti data.

Bidang
  • ToKey— UTF-8 string, cocok denganCustom string pattern #66.

    Setelah menerapkan pemetaan, apa nama kolom yang seharusnya. Bisa sama denganFromPath.

  • FromPath— Sebuah array UTF-8 string.

    Tabel atau kolom yang akan dimodifikasi.

  • FromType— UTF-8 string, cocok denganCustom string pattern #66.

    Jenis data yang akan dimodifikasi.

  • ToType— UTF-8 string, cocok denganCustom string pattern #66.

    Jenis data tempat data akan dimodifikasi.

  • Dropped – Boolean.

    Jika benar, maka kolom dihapus.

  • Children – Susunan objek Pemetaan.

    Hanya berlaku untuk struktur data bersarang. Jika Anda ingin mengubah struktur induk, tetapi juga salah satu turunannya, Anda dapat mengisi struktur data ini. Itu jugaMapping, tetapi itu FromPath akan menjadi nilai FromPath tambah orang tua FromPath dari struktur ini.

    Untuk bagian anak-anak, misalkan Anda memiliki struktur:

    { "FromPath": "OuterStructure", "ToKey": "OuterStructure", "ToType": "Struct", "Dropped": false, "Chidlren": [{ "FromPath": "inner", "ToKey": "inner", "ToType": "Double", "Dropped": false, }] }

    Anda dapat menentukan Mapping yang terlihat seperti:

    { "FromPath": "OuterStructure", "ToKey": "OuterStructure", "ToType": "Struct", "Dropped": false, "Chidlren": [{ "FromPath": "inner", "ToKey": "inner", "ToType": "Double", "Dropped": false, }] }

SelectFields struktur

Menentukan transformasi yang memilih kunci properti data yang ingin Anda simpan.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama node transformasi.

  • Inputs- Diperlukan: Sebuah array UTF-8 string, tidak kurang dari 1 atau lebih dari 1 string.

    Input data diidentifikasi dengan nama simpul mereka.

  • Paths- Diperlukan: Array UTF-8 string.

    Sebuah jalur JSON ke variabel dalam struktur data.

DropFields struktur

Menentukan transformasi yang memilih kunci properti data yang ingin Anda jatuhkan.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama node transformasi.

  • Inputs- Diperlukan: Sebuah array UTF-8 string, tidak kurang dari 1 atau lebih dari 1 string.

    Input data diidentifikasi dengan nama simpul mereka.

  • Paths- Diperlukan: Array UTF-8 string.

    Sebuah jalur JSON ke variabel dalam struktur data.

RenameField struktur

Menentukan transformasi yang mengganti nama kunci properti data tunggal.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama node transformasi.

  • Inputs- Diperlukan: Sebuah array UTF-8 string, tidak kurang dari 1 atau lebih dari 1 string.

    Input data diidentifikasi dengan nama simpul mereka.

  • SourcePath- Diperlukan: Array UTF-8 string.

    Sebuah jalur JSON ke variabel dalam struktur data untuk data sumber.

  • TargetPath- Diperlukan: Array UTF-8 string.

    Jalur JSON ke variabel dalam struktur data untuk data target.

Struktur keran

Menentukan transformasi yang menulis sampel data ke bucket Amazon S3.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama node transformasi.

  • Inputs- Diperlukan: Sebuah array UTF-8 string, tidak kurang dari 1 atau lebih dari 1 string.

    Input data diidentifikasi dengan nama simpul mereka.

  • Path Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Jalur di Amazon S3 di mana transformasi akan menulis subset catatan dari dataset ke file JSON dalam bucket Amazon S3.

  • Topk— Angka (integer), tidak lebih dari 100.

    Menentukan sejumlah catatan untuk ditulis mulai dari awal dataset.

  • Prob— Nomor (ganda), tidak lebih dari 1.

    Probabilitas (nilai desimal dengan nilai maksimum 1) untuk memilih catatan tertentu. Nilai 1 menunjukkan bahwa setiap baris yang dibaca dari dataset harus dimasukkan dalam output sampel.

Bergabunglah dengan struktur

Menentukan transformasi yang menggabungkan dua kumpulan data menjadi satu dataset menggunakan frasa perbandingan pada kunci properti data yang ditentukan. Anda dapat menggunakan join bagian dalam, luar, kiri, kanan, kiri semi, dan lawan kiri.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama node transformasi.

  • Inputs- Diperlukan: Sebuah array UTF-8 string, tidak kurang dari 2 atau lebih dari 2 string.

    Input data diidentifikasi dengan nama simpul mereka.

  • JoinType Diperlukan: UTF-8 string (nilai yang valid: equijoin="EQUIJOIN" left="LEFT" | right="RIGHT" | outer="OUTER" | leftsemi="LEFT_SEMI" |leftanti="LEFT_ANTI").

    Menentukan jenis gabungan yang akan dilakukan pada kumpulan data.

  • Columns- Diperlukan: Array JoinColumn objek, tidak kurang dari 2 atau lebih dari 2 struktur.

    Daftar dua kolom yang akan digabungkan.

JoinColumn struktur

Menentukan kolom yang akan digabungkan.

Bidang
  • From Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Kolom yang akan digabungkan.

  • Keys- Diperlukan: Array UTF-8 string.

    Kunci kolom yang akan digabungkan.

SplitFields struktur

Menentukan transformasi yang membagi kunci properti data menjadi duaDynamicFrames. Outputnya adalah kumpulanDynamicFrames: satu dengan kunci properti data yang dipilih, dan satu dengan kunci properti data yang tersisa.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama node transformasi.

  • Inputs- Diperlukan: Sebuah array UTF-8 string, tidak kurang dari 1 atau lebih dari 1 string.

    Input data diidentifikasi dengan nama simpul mereka.

  • Paths- Diperlukan: Array UTF-8 string.

    Sebuah jalur JSON ke variabel dalam struktur data.

SelectFromCollection struktur

Menentukan transformasi yang memilih satu DynamicFrame dari koleksiDynamicFrames. Outputnya adalah yang dipilih DynamicFrame

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama node transformasi.

  • Inputs- Diperlukan: Sebuah array UTF-8 string, tidak kurang dari 1 atau lebih dari 1 string.

    Input data diidentifikasi dengan nama simpul mereka.

  • IndexWajib: Nomor (bilangan bulat).

    Indeks DynamicFrame untuk yang akan dipilih.

FillMissingValues struktur

Menentukan transformasi yang menemukan catatan dalam dataset yang memiliki nilai yang hilang dan menambahkan bidang baru dengan nilai yang ditentukan oleh imputasi. Kumpulan data input digunakan untuk melatih model pembelajaran mesin yang menentukan nilai yang hilang seharusnya.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama node transformasi.

  • Inputs- Diperlukan: Sebuah array UTF-8 string, tidak kurang dari 1 atau lebih dari 1 string.

    Input data diidentifikasi dengan nama simpul mereka.

  • ImputedPath Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Jalur JSON ke variabel dalam struktur data untuk dataset yang diperhitungkan.

  • FilledPath— UTF-8 string, cocok denganCustom string pattern #66.

    Jalur JSON ke variabel dalam struktur data untuk dataset yang diisi.

Struktur filter

Menentukan transformasi yang membagi dataset menjadi dua, berdasarkan kondisi filter.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama node transformasi.

  • Inputs- Diperlukan: Sebuah array UTF-8 string, tidak kurang dari 1 atau lebih dari 1 string.

    Input data diidentifikasi dengan nama simpul mereka.

  • LogicalOperator Diperlukan: UTF-8 string (nilai valid: AND |OR).

    Operator digunakan untuk memfilter baris dengan membandingkan nilai kunci dengan nilai yang ditentukan.

  • FiltersWajib: Susunan objek FilterExpression.

    Menentukan ekspresi filter.

FilterExpression struktur

Menentukan ekspresi filter.

Bidang
  • Operation Diperlukan: UTF-8 string (nilai yang valid: EQ LT | GT | LTE | GTE | REGEX |ISNULL).

    Jenis operasi yang akan dilakukan dalam ekspresi.

  • Negated – Boolean.

    Apakah ekspresi tersebut akan dinegasikan.

  • ValuesWajib: Susunan objek FilterValue.

    Daftar nilai filter.

FilterValue struktur

Merupakan satu entri dalam daftar nilai untuk aFilterExpression.

Bidang
  • Type Diperlukan: UTF-8 string (nilai valid: COLUMNEXTRACTED |CONSTANT).

    Jenis nilai filter.

  • Value- Diperlukan: Array UTF-8 string.

    Nilai yang akan dikaitkan.

CustomCode struktur

Menentukan transformasi yang menggunakan kode kustom yang Anda berikan untuk melakukan transformasi data. Outputnya adalah kumpulan DynamicFrames.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama node transformasi.

  • Inputs- Diperlukan: Sebuah array UTF-8 string, setidaknya 1 string.

    Input data diidentifikasi dengan nama simpul mereka.

  • Code Diperlukan: UTF-8 string, cocok denganCustom string pattern #59.

    Kode kustom yang digunakan untuk melakukan transformasi data.

  • ClassName Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Nama yang ditentukan untuk kelas node kode kustom.

  • OutputSchemas – Susunan objek GlueSchema.

    Menentukan skema data untuk transformasi kode kustom.

Struktur SparkSQL

Menentukan transformasi tempat Anda memasukkan kueri SQL menggunakan sintaks Spark SQL untuk mengubah data. Outputnya adalah satu DynamicFrame.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama node transformasi.

  • Inputs- Diperlukan: Sebuah array UTF-8 string, setidaknya 1 string.

    Input data diidentifikasi dengan nama simpul mereka. Anda dapat mengaitkan nama tabel dengan setiap simpul input untuk digunakan dalam query SQL. Nama yang Anda pilih harus memenuhi batasan penamaan Spark SQL.

  • SqlQuery Diperlukan: UTF-8 string, cocok denganCustom string pattern #67.

    Kueri SQL yang harus menggunakan sintaks Spark SQL dan mengembalikan satu kumpulan data.

  • SqlAliasesWajib: Susunan objek SqlAlias.

    Daftar alias. Alias memungkinkan Anda untuk menentukan nama apa yang akan digunakan dalam SQL untuk input yang diberikan. Misalnya, Anda memiliki sumber data bernama "MyDataSource”. Jika Anda menentukan From sebagai MyDataSource, dan Alias sebagai SqlName, maka di SQL Anda dapat melakukan:

    select * from SqlName

    dan itu mendapatkan data dari MyDataSource.

  • OutputSchemas – Susunan objek GlueSchema.

    Menentukan skema data untuk transformasi SparkSQL.

SqlAlias struktur

Merupakan satu entri dalam daftar nilai untukSqlAliases.

Bidang
  • From Diperlukan: UTF-8 string, cocok denganCustom string pattern #65.

    Sebuah tabel, atau kolom dalam tabel.

  • Alias Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Nama sementara yang diberikan ke tabel, atau kolom dalam tabel.

DropNullFields struktur

Menentukan transformasi yang menghapus kolom dari dataset jika semua nilai dalam kolom adalah 'null'. Secara default, AWS Glue Studio akan mengenali objek null, tetapi beberapa nilai seperti string kosong, string yang “null”, bilangan bulat -1 atau placeholder lainnya seperti nol, tidak secara otomatis dikenali sebagai nol.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama node transformasi.

  • Inputs- Diperlukan: Sebuah array UTF-8 string, tidak kurang dari 1 atau lebih dari 1 string.

    Input data diidentifikasi dengan nama simpul mereka.

  • NullCheckBoxList — Sebuah objek NullCheckBoxList.

    Struktur yang mewakili apakah nilai-nilai tertentu dikenali sebagai nilai nol untuk dihapus.

  • NullTextList — Susunan objek NullValueField, tidak lebih dari 50 struktur.

    Struktur yang menentukan daftar NullValueField struktur yang mewakili nilai null khusus seperti nol atau nilai lain yang digunakan sebagai placeholder null yang unik untuk dataset.

    DropNullFieldsTransformasi menghapus nilai null khusus hanya jika nilai placeholder null dan tipe data cocok dengan data.

NullCheckBoxList struktur

Merupakan apakah nilai-nilai tertentu dikenali sebagai nilai nol untuk dihapus.

Bidang
  • IsEmpty – Boolean.

    Menentukan bahwa string kosong dianggap sebagai nilai null.

  • IsNullString – Boolean.

    Menentukan bahwa nilai yang mengeja kata 'null' dianggap sebagai nilai null.

  • IsNegOne – Boolean.

    Menentukan bahwa nilai integer -1 dianggap sebagai nilai nol.

NullValueField struktur

Merupakan nilai null khusus seperti nol atau nilai lain yang digunakan sebagai placeholder null yang unik untuk dataset.

Bidang

Struktur tipe data

Struktur yang mewakili tipe data dari nilai.

Bidang

Gabungkan struktur

Menentukan transformasi yang menggabungkan a DynamicFrame dengan pementasan DynamicFrame berdasarkan kunci utama yang ditentukan untuk mengidentifikasi catatan. Catatan duplikat (catatan dengan kunci primer yang sama) tidak di-deduplikasi.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama node transformasi.

  • Inputs- Diperlukan: Sebuah array UTF-8 string, tidak kurang dari 2 atau lebih dari 2 string.

    Input data diidentifikasi dengan nama simpul mereka.

  • Source Diperlukan: UTF-8 string, cocok denganCustom string pattern #65.

    Sumber DynamicFrame yang akan digabungkan dengan pementasanDynamicFrame.

  • PrimaryKeys- Diperlukan: Array UTF-8 string.

    Daftar bidang kunci utama untuk mencocokkan catatan dari sumber dan frame dinamis pementasan.

Struktur serikat

Menentukan transformasi yang menggabungkan baris dari dua atau lebih kumpulan data menjadi satu hasil.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama node transformasi.

  • Inputs- Diperlukan: Sebuah array UTF-8 string, tidak kurang dari 2 atau lebih dari 2 string.

    Masukan ID simpul ke transformasi.

  • UnionType Diperlukan: UTF-8 string (nilai valid: ALL |DISTINCT).

    Menunjukkan jenis transformasi Union.

    Tentukan ALL untuk menggabungkan semua baris dari sumber data ke hasil DynamicFrame. Serikat yang dihasilkan tidak menghapus baris duplikat.

    Tentukan DISTINCT untuk menghapus baris duplikat dalam hasil DynamicFrame.

Struktur PIIDeteksi

Menentukan transformasi yang mengidentifikasi, menghapus, atau menutupi data PII.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama node transformasi.

  • Inputs- Diperlukan: Sebuah array UTF-8 string, tidak kurang dari 1 atau lebih dari 1 string.

    Masukan ID simpul ke transformasi.

  • PiiType Diperlukan: UTF-8 string (nilai yang valid: RowAudit RowHashing | RowMasking | RowPartialMasking | ColumnAudit | ColumnHashing |ColumnMasking).

    Menunjukkan jenis transformasi PIIDetection.

  • EntityTypesToDetect- Diperlukan: Array UTF-8 string.

    Menunjukkan jenis entitas yang akan diidentifikasi oleh transformasi PIIDetection sebagai data PII.

    Entitas tipe PII meliputi: PERSON_NAME, DATE, USA_SNN, EMAIL, USA_ITIN, USA_PASSPORT_NUMBER, NOMOR TELEPON, BANK_ACCOUNT, IP_ADDRESS, MAC_ADDRESS, USA_CPT_CODE, USA_HCPCS_CODE, USA_NATIONAL_DRUG_CODE, USA_MEDICARE_BENEFICIARY_IDENTIFIER, USA_HEALTH_INSURANCE_CLAIM_NUMBER, KARTU KREDIT, PENGIDENTIFIKASI PENYEDIA NASIONAL, NOMOR DEA AS, LISENSI MENGEMUDI AMERIKA SERIKAT

  • OutputColumnName— UTF-8 string, cocok denganCustom string pattern #66.

    Menunjukkan nama kolom keluaran yang akan berisi setiap jenis entitas yang terdeteksi di baris itu.

  • SampleFraction— Nomor (ganda), tidak lebih dari 1.

    Menunjukkan fraksi data yang akan diambil sampelnya saat memindai entitas PII.

  • ThresholdFraction— Nomor (ganda), tidak lebih dari 1.

    Menunjukkan fraksi data yang harus dipenuhi agar kolom dapat diidentifikasi sebagai data PII.

  • MaskValue— UTF-8 string, panjangnya tidak lebih dari 256 byte, cocok denganCustom string pattern #63.

    Menunjukkan nilai yang akan menggantikan entitas yang terdeteksi.

  • RedactText— UTF-8 string, cocok denganCustom string pattern #66.

    Menentukan apakah akan menyunting teks PII yang terdeteksi. Saat disetel ketrue, konten PII diganti dengan karakter redaksi.

  • RedactChar— UTF-8 string, cocok denganCustom string pattern #66.

    Karakter yang digunakan untuk mengganti konten PII yang terdeteksi saat penyuntingan diaktifkan. Karakter penyuntingan default adalah*.

  • MatchPattern— UTF-8 string, cocok denganCustom string pattern #66.

    Pola ekspresi reguler yang digunakan untuk mengidentifikasi konten PII tambahan di luar algoritma deteksi standar.

  • NumLeftCharsToExclude — Nomor (bilangan bulat).

    Jumlah karakter yang akan dikecualikan dari redaksi di sisi kiri konten PII yang terdeteksi. Hal ini memungkinkan melestarikan konteks di sekitar data sensitif.

  • NumRightCharsToExclude — Nomor (bilangan bulat).

    Jumlah karakter yang akan dikecualikan dari redaksi di sisi kanan konten PII yang terdeteksi. Hal ini memungkinkan melestarikan konteks di sekitar data sensitif.

  • DetectionParameters— UTF-8 string, cocok denganCustom string pattern #66.

    Parameter tambahan untuk mengonfigurasi perilaku deteksi PII dan pengaturan sensitivitas.

  • DetectionSensitivity— UTF-8 string, cocok denganCustom string pattern #66.

    Tingkat sensitivitas untuk deteksi PII. Tingkat sensitivitas yang lebih tinggi mendeteksi lebih banyak PII potensial tetapi dapat menghasilkan lebih banyak positif palsu.

Struktur agregat

Menentukan transformasi yang mengelompokkan baris berdasarkan bidang yang dipilih dan menghitung nilai agregat dengan fungsi yang ditentukan.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama node transformasi.

  • Inputs- Diperlukan: Sebuah array UTF-8 string, tidak kurang dari 1 atau lebih dari 1 string.

    Menentukan bidang dan baris yang akan digunakan sebagai input untuk transformasi agregat.

  • Groups- Diperlukan: Array UTF-8 string.

    Menentukan bidang yang akan dikelompokkan.

  • Aggs- Diperlukan: Array AggregateOperation objek, tidak kurang dari 1 atau lebih dari 30 struktur.

    Menentukan fungsi agregat yang akan dilakukan pada bidang tertentu.

DropDuplicates struktur

Menentukan transformasi yang menghapus baris data berulang dari kumpulan data.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama node transformasi.

  • Inputs- Diperlukan: Sebuah array UTF-8 string, tidak kurang dari 1 atau lebih dari 1 string.

    Input data diidentifikasi dengan nama simpul mereka.

  • Columns— Sebuah array UTF-8 string.

    Nama kolom yang akan digabungkan atau dihapus jika diulang.

GovernedCatalogTarget struktur

Menentukan target data yang menulis ke Amazon S3 menggunakan Katalog AWS Glue Data.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama target data.

  • Inputs- Diperlukan: Sebuah array UTF-8 string, tidak kurang dari 1 atau lebih dari 1 string.

    Node yang merupakan input ke target data.

  • PartitionKeys— Sebuah array UTF-8 string.

    Menentukan partisi asli menggunakan urutan kunci.

  • Table Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Nama tabel dalam database untuk menulis.

  • Database Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Nama database untuk menulis.

  • SchemaChangePolicy — Sebuah objek CatalogSchemaChangePolicy.

    Kebijakan yang menentukan perilaku pembaruan untuk katalog yang diatur.

GovernedCatalogSource struktur

Menentukan penyimpanan data dalam Katalog AWS Glue Data yang diatur.

Bidang

AggregateOperation struktur

Menentukan kumpulan parameter yang diperlukan untuk melakukan agregasi dalam transformasi agregat.

Bidang
  • Column- Diperlukan: Array UTF-8 string.

    Menentukan kolom pada kumpulan data di mana fungsi agregasi akan diterapkan.

  • AggFunc Diperlukan: UTF-8 string (nilai yang valid: avg countDistinct count | first | | last | kurtosis | max | min | skewness | stddev_samp | stddev_pop | sum | sumDistinct | var_samp |var_pop).

    Menentukan fungsi agregasi untuk diterapkan.

    Fungsi agregasi yang mungkin meliputi: avg countDistinct, count, first, last, kurtosis, max, min, skewness, stddev_samp, stddev_pop, sum, sumDistinct, var_samp, var_pop

GlueSchema struktur

Menentukan skema yang ditentukan pengguna ketika skema tidak dapat ditentukan oleh AWS Glue.

Bidang

GlueStudioSchemaColumn struktur

Menentukan kolom tunggal dalam definisi AWS Glue skema.

Bidang
  • Name- Diperlukan: UTF-8 string, panjang tidak lebih dari 1024 byte, cocok denganSingle-line string pattern.

    Nama kolom dalam skema AWS Glue Studio.

  • Type— UTF-8 string, panjangnya tidak lebih dari 131072 byte, cocok dengan. Single-line string pattern

    Jenis sarang untuk kolom ini dalam skema AWS Glue Studio.

  • GlueStudioType— UTF-8 string, panjangnya tidak lebih dari 131072 byte, cocok dengan. Single-line string pattern

    Jenis data kolom seperti yang didefinisikan dalam AWS Glue Studio.

GlueStudioColumn struktur

Menentukan kolom tunggal di AWS Glue Studio.

Bidang
  • Key Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Kunci kolom di AWS Glue Studio.

  • FullPath- Diperlukan: Array UTF-8 string.

    TURL lengkap kolom di AWS Glue Studio.

  • Type Diperlukan: UTF-8 string (nilai yang valid: array="ARRAY" bigint="BIGINT" | bigint array="BIGINT_ARRAY" | binary="BINARY" | binary array="BINARY_ARRAY" | boolean="BOOLEAN" | boolean array="BOOLEAN_ARRAY" | byte="BYTE" | byte array="BYTE_ARRAY" | char="CHAR" | char array="CHAR_ARRAY" | choice="CHOICE" | | choice array="CHOICE_ARRAY" | date="DATE" | date array="DATE_ARRAY" | decimal="DECIMAL" | decimal array="DECIMAL_ARRAY" | double="DOUBLE" | double array="DOUBLE_ARRAY" | enum="ENUM" | enum array="ENUM_ARRAY" | float="FLOAT" | float array="FLOAT_ARRAY" | int="INT" | int array="INT_ARRAY" | | interval="INTERVAL" | interval array="INTERVAL_ARRAY" | long="LONG" | long array="LONG_ARRAY" | object="OBJECT" | short="SHORT" | short array="SHORT_ARRAY" | smallint="SMALLINT"| smallint array="SMALLINT_ARRAY" | string="STRING" | string array="STRING_ARRAY" | timestamp="TIMESTAMP" | timestamp array="TIMESTAMP_ARRAY" tinyint="TINYINT" | tinyint array="TINYINT_ARRAY" | varchar="VARCHAR" | varchar array="VARCHAR_ARRAY" | null="NULL" | unknown="UNKNOWN" |unknown array="UNKNOWN_ARRAY").

    TJenis kolom di AWS Glue Studio.

  • Children— Sebuah array struktur.

    TAnak dari kolom induk di AWS Glue Studio.

  • GlueStudioType— UTF-8 string (nilai yang valid: array="ARRAY" bigint="BIGINT" | bigint array="BIGINT_ARRAY" | binary="BINARY" | binary array="BINARY_ARRAY" | boolean="BOOLEAN" | boolean array="BOOLEAN_ARRAY" | byte="BYTE" | byte array="BYTE_ARRAY" | char="CHAR" | char array="CHAR_ARRAY" | choice="CHOICE" | choice array="CHOICE_ARRAY" | date="DATE" | date array="DATE_ARRAY" | decimal="DECIMAL" | decimal array="DECIMAL_ARRAY" | double="DOUBLE" | double array="DOUBLE_ARRAY" | enum="ENUM" | enum array="ENUM_ARRAY" | float="FLOAT" | float array="FLOAT_ARRAY" | int="INT" | int array="INT_ARRAY" | interval="INTERVAL" | interval array="INTERVAL_ARRAY" | long="LONG" | long array="LONG_ARRAY" | object="OBJECT" | short="SHORT" | short array="SHORT_ARRAY" | smallint="SMALLINT" | smallint array="SMALLINT_ARRAY" | string="STRING"| string array="STRING_ARRAY" | timestamp="TIMESTAMP" | timestamp array="TIMESTAMP_ARRAY" | tinyint="TINYINT" | tinyint array="TINYINT_ARRAY" varchar="VARCHAR" | varchar array="VARCHAR_ARRAY" | null="NULL" | unknown="UNKNOWN" |unknown array="UNKNOWN_ARRAY").

    Jenis data kolom seperti yang didefinisikan dalam AWS Glue Studio.

DynamicTransform struktur

Menentukan set parameter yang diperlukan untuk melakukan transformasi dinamis.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Menentukan nama transformasi dinamis.

  • TransformName Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Menentukan nama transformasi dinamis seperti yang muncul di editor visual AWS Glue Studio.

  • Inputs- Diperlukan: Sebuah array UTF-8 string, tidak kurang dari 1 atau lebih dari 1 string.

    Menentukan input untuk transformasi dinamis yang diperlukan.

  • Parameters – Susunan objek TransformConfigParameter.

    Menentukan parameter transformasi dinamis.

  • FunctionName Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Menentukan nama fungsi transformasi dinamis.

  • Path Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Menentukan jalur sumber transformasi dinamis dan file konfigurasi.

  • Version— UTF-8 string, cocok denganCustom string pattern #66.

    Bidang ini tidak digunakan dan akan usang dalam rilis mendatang.

  • OutputSchemas – Susunan objek GlueSchema.

    Menentukan skema data untuk transformasi dinamis.

TransformConfigParameter struktur

Menentukan parameter dalam file konfigurasi transformasi dinamis.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Menentukan nama parameter dalam file konfigurasi transformasi dinamis.

  • Type Diperlukan: UTF-8 string (nilai yang valid: str="STR" int="INT" | float="FLOAT" | complex="COMPLEX" | bool="BOOL" | list="LIST" |null="NULL").

    Menentukan jenis parameter dalam file konfigurasi transformasi dinamis.

  • ValidationRule— UTF-8 string, cocok denganCustom string pattern #66.

    Menentukan aturan validasi dalam file konfigurasi transformasi dinamis.

  • ValidationMessage— UTF-8 string, cocok denganCustom string pattern #66.

    Menentukan pesan validasi dalam file konfigurasi transformasi dinamis.

  • Value— Sebuah array UTF-8 string.

    Menentukan nilai parameter dalam file konfigurasi transformasi dinamis.

  • ListType— UTF-8 string (nilai yang valid: str="STR" int="INT" | float="FLOAT" | complex="COMPLEX" | bool="BOOL" | list="LIST" |null="NULL").

    Menentukan jenis daftar parameter dalam file konfigurasi transformasi dinamis.

  • IsOptional – Boolean.

    Menentukan apakah parameter opsional atau tidak dalam file konfigurasi transformasi dinamis.

EvaluateDataQuality struktur

Menentukan kriteria evaluasi kualitas data Anda.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama evaluasi kualitas data.

  • Inputs- Diperlukan: Sebuah array UTF-8 string, tidak kurang dari 1 atau lebih dari 1 string.

    Masukan evaluasi kualitas data Anda.

  • Ruleset- Diperlukan: UTF-8 string, panjang tidak kurang dari 1 atau lebih dari 65536 byte, cocok dengan. Custom string pattern #64

    Kumpulan aturan untuk evaluasi kualitas data Anda.

  • Output— UTF-8 string (nilai valid: PrimaryInput |EvaluationResults).

    Output dari evaluasi kualitas data Anda.

  • PublishingOptions — Sebuah objek DQResultsPublishingOptions.

    Opsi untuk mengonfigurasi bagaimana hasil Anda dipublikasikan.

  • StopJobOnFailureOptions — Sebuah objek DQStopJobOnFailureOptions.

    Opsi untuk mengonfigurasi bagaimana pekerjaan Anda akan berhenti jika evaluasi kualitas data Anda gagal.

DQResultsPublishingOptions struktur

Opsi untuk mengonfigurasi bagaimana hasil evaluasi kualitas data Anda dipublikasikan.

Bidang
  • EvaluationContext— UTF-8 string, cocok denganCustom string pattern #65.

    Konteks evaluasi.

  • ResultsS3Prefix— UTF-8 string, cocok denganCustom string pattern #66.

    Awalan Amazon S3 ditambahkan ke hasil.

  • CloudWatchMetricsEnabled – Boolean.

    Aktifkan metrik untuk hasil kualitas data Anda.

  • ResultsPublishingEnabled – Boolean.

    Aktifkan penerbitan untuk hasil kualitas data Anda.

DQStopJobOnFailureOptions struktur

Opsi untuk mengonfigurasi bagaimana pekerjaan Anda akan berhenti jika evaluasi kualitas data Anda gagal.

Bidang
  • StopJobOnFailureTiming— UTF-8 string (nilai valid: Immediate |AfterDataLoad).

    Kapan harus menghentikan pekerjaan jika evaluasi kualitas data Anda gagal. Pilihannya adalah Langsung atau AfterDataLoad.

EvaluateDataQualityMultiFrame struktur

Menentukan kriteria evaluasi kualitas data Anda.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama evaluasi kualitas data.

  • Inputs- Diperlukan: Sebuah array UTF-8 string, setidaknya 1 string.

    Masukan evaluasi kualitas data Anda. Input pertama dalam daftar ini adalah sumber data utama.

  • AdditionalDataSources – Susunan peta pasangan nilai kunci.

    Setiap kunci adalah UTF-8 string, cocok denganCustom string pattern #68.

    Setiap nilai adalah UTF-8 string, cocok denganCustom string pattern #66.

    Alias dari semua sumber data kecuali primer.

  • Ruleset- Diperlukan: UTF-8 string, panjang tidak kurang dari 1 atau lebih dari 65536 byte, cocok dengan. Custom string pattern #64

    Kumpulan aturan untuk evaluasi kualitas data Anda.

  • PublishingOptions — Sebuah objek DQResultsPublishingOptions.

    Opsi untuk mengonfigurasi bagaimana hasil Anda dipublikasikan.

  • AdditionalOptions – Susunan peta pasangan nilai kunci.

    Setiap kunci adalah UTF-8 string (nilai valid: performanceTuning.caching="CacheOption" | observations.scope="ObservationsOption" |compositeRuleEvaluation.method="CompositeOption").

    Setiap nilai adalah UTF-8 string.

    Opsi untuk mengkonfigurasi perilaku runtime transformasi.

  • StopJobOnFailureOptions — Sebuah objek DQStopJobOnFailureOptions.

    Opsi untuk mengonfigurasi bagaimana pekerjaan Anda akan berhenti jika evaluasi kualitas data Anda gagal.

Struktur resep

Node AWS Glue Studio yang menggunakan AWS Glue DataBrew resep dalam AWS Glue pekerjaan.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama node AWS Glue Studio.

  • Inputs- Diperlukan: Sebuah array UTF-8 string, tidak kurang dari 1 atau lebih dari 1 string.

    Node yang merupakan input ke node resep, diidentifikasi oleh id.

  • RecipeReference — Sebuah objek RecipeReference.

    Referensi ke DataBrew resep yang digunakan oleh node.

  • RecipeSteps – Susunan objek RecipeStep.

    Langkah-langkah transformasi yang digunakan dalam simpul resep.

RecipeReference struktur

Referensi ke AWS Glue DataBrew resep.

Bidang
  • RecipeArn Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    ARN DataBrew resep.

  • RecipeVersion- Diperlukan: UTF-8 string, tidak kurang dari 1 atau lebih dari 16 byte panjangnya.

    DataBrew Resepnya. RecipeVersion

SnowflakeNodeData struktur

Menentukan konfigurasi untuk node Snowflake di AWS Glue Studio.

Bidang
  • SourceType— UTF-8 string, cocok denganCustom string pattern #65.

    Menentukan bagaimana data yang diambil ditentukan. Nilai-nilai yang valid: "table", "query".

  • Connection — Sebuah objek Opsi.

    Menentukan Kon AWS Glue eksi Katalog Data ke titik akhir Snowflake.

  • Schema— UTF-8 tali.

    Menentukan skema database Snowflake untuk node Anda untuk digunakan.

  • Table— UTF-8 tali.

    Menentukan tabel Snowflake untuk simpul Anda untuk digunakan.

  • Database— UTF-8 tali.

    Menentukan database Snowflake untuk node Anda untuk digunakan.

  • TempDir— UTF-8 string, cocok denganCustom string pattern #66.

    Saat ini tidak digunakan.

  • IamRole — Sebuah objek Opsi.

    Saat ini tidak digunakan.

  • AdditionalOptions – Susunan peta pasangan nilai kunci.

    Setiap kunci adalah UTF-8 string, cocok denganCustom string pattern #66.

    Setiap nilai adalah UTF-8 string, cocok denganCustom string pattern #66.

    Menentukan opsi tambahan yang diteruskan ke konektor Snowflake. Jika opsi ditentukan di tempat lain di node ini, ini akan diutamakan.

  • SampleQuery— UTF-8 tali.

    Sebuah string SQL digunakan untuk mengambil data dengan tipe query sumber.

  • PreAction— UTF-8 tali.

    String SQL berjalan sebelum konektor Snowflake melakukan tindakan standarnya.

  • PostAction— UTF-8 tali.

    String SQL berjalan setelah konektor Snowflake melakukan tindakan standarnya.

  • Action— UTF-8 tali.

    Menentukan tindakan apa yang harus diambil saat menulis ke tabel dengan data yang sudah ada sebelumnya. Nilai yang valid: append,merge,truncate,drop.

  • Upsert – Boolean.

    Digunakan saat Tindakan adaappend. Menentukan perilaku resolusi ketika baris sudah ada. Jika benar, baris yang sudah ada sebelumnya akan diperbarui. Jika salah, baris tersebut akan dimasukkan.

  • MergeAction— UTF-8 string, cocok denganCustom string pattern #65.

    Menentukan tindakan penggabungan. Nilai-nilai yang valid: simple, custom. Jika sederhana, perilaku penggabungan ditentukan oleh MergeWhenMatched dan MergeWhenNotMatched. Jika kustom, ditentukan olehMergeClause.

  • MergeWhenMatched— UTF-8 string, cocok denganCustom string pattern #65.

    Menentukan cara menyelesaikan catatan yang cocok dengan data yang sudah ada sebelumnya saat menggabungkan. Nilai-nilai yang valid: update, delete.

  • MergeWhenNotMatched— UTF-8 string, cocok denganCustom string pattern #65.

    Menentukan cara memproses catatan yang tidak cocok dengan data yang sudah ada sebelumnya saat menggabungkan. Nilai-nilai yang valid: insert, none.

  • MergeClause— UTF-8 tali.

    Pernyataan SQL yang menentukan perilaku penggabungan kustom.

  • StagingTable— UTF-8 tali.

    Nama tabel pementasan yang digunakan saat melakukan merge atau meningkatkan tindakan. append Data ditulis ke tabel ini, kemudian dipindahkan table oleh postaction yang dihasilkan.

  • SelectedColumns – Susunan objek Opsi.

    Menentukan kolom yang digabungkan untuk mengidentifikasi catatan saat mendeteksi kecocokan untuk penggabungan dan peningkatan. Daftar struktur denganvalue, label dan description kunci. Setiap struktur menggambarkan kolom.

  • AutoPushdown – Boolean.

    Menentukan apakah pushdown kueri otomatis diaktifkan. Jika pushdown diaktifkan, maka ketika kueri dijalankan di Spark, jika bagian dari kueri dapat “didorong ke bawah” ke server Snowflake, itu ditekan ke bawah. Ini meningkatkan kinerja beberapa kueri.

  • TableSchema – Susunan objek Opsi.

    Secara manual mendefinisikan skema target untuk node. Daftar struktur denganvalue, label dan description kunci. Setiap struktur mendefinisikan kolom.

SnowflakeSource struktur

Menentukan sumber data Snowflake.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama sumber data Snowflake.

  • DataWajib: Sebuah objek SnowflakeNodeData.

    Konfigurasi untuk sumber data Snowflake.

  • OutputSchemas – Susunan objek GlueSchema.

    Menentukan skema yang ditentukan pengguna untuk data keluaran Anda.

SnowflakeTarget struktur

Menentukan target Snowflake.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama target Snowflake.

  • DataWajib: Sebuah objek SnowflakeNodeData.

    Menentukan data simpul target Snowflake.

  • Inputs— Sebuah array UTF-8 string, tidak kurang dari 1 atau lebih dari 1 string.

    Node yang merupakan input ke target data.

ConnectorDataSource struktur

Menentukan sumber yang dihasilkan dengan opsi koneksi standar.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama node sumber ini.

  • ConnectionType Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    YangconnectionType, sebagaimana disediakan untuk AWS Glue perpustakaan yang mendasarinya. Jenis node ini mendukung jenis koneksi berikut:

    • opensearch

    • azuresql

    • azurecosmos

    • bigquery

    • saphana

    • teradata

    • vertica

  • DataWajib: Susunan peta pasangan nilai kunci.

    Setiap kunci adalah UTF-8 string.

    Setiap nilai adalah UTF-8 string.

    Peta yang menentukan opsi koneksi untuk node. Anda dapat menemukan opsi koneksi standar untuk jenis koneksi yang sesuai di bagian parameter koneksi AWS Glue dokumentasi.

  • OutputSchemas – Susunan objek GlueSchema.

    Menentukan skema data untuk sumber ini.

ConnectorDataTarget struktur

Menentukan target yang dihasilkan dengan opsi koneksi standar.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama node target ini.

  • ConnectionType Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    YangconnectionType, sebagaimana disediakan untuk AWS Glue perpustakaan yang mendasarinya. Jenis node ini mendukung jenis koneksi berikut:

    • opensearch

    • azuresql

    • azurecosmos

    • bigquery

    • saphana

    • teradata

    • vertica

  • DataWajib: Susunan peta pasangan nilai kunci.

    Setiap kunci adalah UTF-8 string.

    Setiap nilai adalah UTF-8 string.

    Peta yang menentukan opsi koneksi untuk node. Anda dapat menemukan opsi koneksi standar untuk jenis koneksi yang sesuai di bagian parameter koneksi AWS Glue dokumentasi.

  • Inputs— Sebuah array UTF-8 string, tidak kurang dari 1 atau lebih dari 1 string.

    Node yang merupakan input ke target data.

RecipeStep struktur

Langkah resep yang digunakan dalam node resep persiapan data AWS Glue Studio.

Bidang
  • ActionWajib: Sebuah objek RecipeAction.

    Tindakan transformasi dari langkah resep.

  • ConditionExpressions – Susunan objek ConditionExpression.

    Ekspresi kondisi untuk langkah resep.

RecipeAction struktur

Tindakan yang ditentukan dalam simpul resep persiapan data AWS Glue Studio.

Bidang
  • Operation- Diperlukan: UTF-8 string, panjang tidak kurang dari 1 atau lebih dari 128 byte, cocok denganCustom string pattern #61.

    Pengoperasian tindakan resep.

  • Parameters – Susunan peta pasangan nilai kunci.

    Setiap kunci adalah UTF-8 string, panjangnya tidak kurang dari 1 atau lebih dari 128 byte, cocok denganCustom string pattern #62.

    Setiap nilai adalah UTF-8 string, tidak kurang dari 1 atau lebih dari 32768 byte panjangnya.

    Parameter tindakan resep.

ConditionExpression struktur

Ekspresi kondisi didefinisikan dalam simpul resep persiapan data AWS Glue Studio.

Bidang
  • Condition- Diperlukan: UTF-8 string, panjang tidak kurang dari 1 atau lebih dari 128 byte, cocok denganCustom string pattern #61.

    Kondisi ekspresi kondisi.

  • Value— UTF-8 string, tidak lebih dari 1024 byte panjangnya.

    Nilai ekspresi kondisi.

  • TargetColumn- Diperlukan: UTF-8 string, tidak kurang dari 1 atau lebih dari 1024 byte panjangnya.

    Kolom target dari ekspresi kondisi.

S3CatalogIcebergSource struktur

Menentukan sumber data Apache Iceberg yang terdaftar di Katalog AWS Glue Data. Sumber data gunung es harus disimpan di Amazon S3.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama sumber data gunung es.

  • Database Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Nama database yang akan dibaca.

  • Table Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Nama tabel dalam database untuk dibaca.

  • AdditionalIcebergOptions – Susunan peta pasangan nilai kunci.

    Setiap kunci adalah UTF-8 string, cocok denganCustom string pattern #66.

    Setiap nilai adalah UTF-8 string, cocok denganCustom string pattern #66.

    Menentukan opsi koneksi tambahan untuk sumber data Iceberg.

  • OutputSchemas – Susunan objek GlueSchema.

    Menentukan skema data untuk sumber gunung es.

CatalogIcebergSource struktur

Menentukan sumber data Apache Iceberg yang terdaftar di Katalog AWS Glue Data.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama sumber data gunung es.

  • Database Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Nama database yang akan dibaca.

  • Table Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Nama tabel dalam database untuk dibaca.

  • AdditionalIcebergOptions – Susunan peta pasangan nilai kunci.

    Setiap kunci adalah UTF-8 string, cocok denganCustom string pattern #66.

    Setiap nilai adalah UTF-8 string, cocok denganCustom string pattern #66.

    Menentukan opsi koneksi tambahan untuk sumber data Iceberg.

  • OutputSchemas – Susunan objek GlueSchema.

    Menentukan skema data untuk sumber gunung es.

S3IcebergCatalogTarget struktur

Menentukan target katalog Apache Iceberg yang menulis data ke Amazon S3 dan mendaftarkan tabel di Katalog AWS Glue Data.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama target katalog gunung es.

  • Inputs- Diperlukan: Sebuah array UTF-8 string, tidak kurang dari 1 atau lebih dari 1 string.

    Koneksi input untuk target katalog Iceberg.

  • PartitionKeys— Sebuah array UTF-8 string.

    Daftar kunci partisi untuk tabel Iceberg.

  • Table Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Nama tabel untuk ditulis dalam katalog.

  • Database Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Nama database untuk menulis.

  • AdditionalOptions – Susunan peta pasangan nilai kunci.

    Setiap kunci adalah UTF-8 string, cocok denganCustom string pattern #66.

    Setiap nilai adalah UTF-8 string, cocok denganCustom string pattern #66.

    Menentukan opsi koneksi tambahan untuk target katalog Iceberg.

  • SchemaChangePolicy — Sebuah objek CatalogSchemaChangePolicy.

    Kebijakan untuk menangani perubahan skema pada target katalog.

  • AutoDataQuality — Sebuah objek AutoDataQuality.

    Menentukan apakah akan secara otomatis mengaktifkan evaluasi kualitas data untuk target katalog S3 Iceberg. Ketika disetel ketrue, pemeriksaan kualitas data dilakukan secara otomatis selama operasi penulisan.

DynamoDBELTConnectorSource struktur

Menentukan sumber konektor DynamoDB ELT untuk mengekstraksi data dari tabel DynamoDB.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama sumber konektor DynamoDB ELT.

  • ConnectionOptions — Sebuah objek DDBELTConnectionOptions.

    Opsi koneksi untuk sumber konektor DynamoDB ELT.

  • OutputSchemas – Susunan objek GlueSchema.

    Menentukan skema data untuk sumber konektor DynamoDB ELT.

DDBELTConnectionOptions struktur

Menentukan opsi koneksi untuk operasi DynamoDB ELT (Extract, Load, Transform). Struktur ini berisi parameter konfigurasi untuk menghubungkan dan mengekstraksi data dari tabel DynamoDB menggunakan konektor ELT.

Bidang
  • DynamodbExport— UTF-8 string (nilai valid: ddb |s3).

    Menentukan jenis ekspor untuk ekstraksi data DynamoDB. Parameter ini menentukan bagaimana data diekspor dari tabel DynamoDB selama proses ELT.

  • DynamodbUnnestDDBJson – Boolean.

    Nilai boolean yang menentukan apakah format JSON DynamoDB tidak diuji selama ekstraksi data. Saat disetel ketrue, konektor akan meratakan struktur JSON bersarang dari item DynamoDB. Saat disetel kefalse, struktur JSON DynamoDB asli dipertahankan.

  • DynamodbTableArn Diperlukan: UTF-8 string, cocok denganCustom string pattern #66.

    Nama Sumber Daya Amazon (ARN) dari tabel DynamoDB untuk mengekstrak data. Parameter ini menentukan tabel sumber untuk operasi ELT.

  • DynamodbS3Bucket— UTF-8 string, cocok denganCustom string pattern #66.

    Nama bucket Amazon S3 yang digunakan untuk penyimpanan perantara selama proses DynamoDB ELT. Bucket ini digunakan untuk menyimpan sementara data DynamoDB yang diekspor sebelum diproses oleh tugas ELT.

  • DynamodbS3Prefix— UTF-8 string, cocok denganCustom string pattern #66.

    Awalan kunci objek S3 untuk file yang disimpan dalam bucket S3 perantara selama proses DynamoDB ELT. Awalan ini membantu mengatur dan mengidentifikasi file sementara yang dibuat selama ekstraksi data.

  • DynamodbS3BucketOwner— UTF-8 string, cocok denganCustom string pattern #66.

    ID AWS akun pemilik bucket S3 yang ditentukan dalamDynamodbS3Bucket. Parameter ini diperlukan ketika bucket S3 dimiliki oleh akun yang berbeda dari AWS akun yang menjalankan tugas ELT, memungkinkan akses lintas akun ke bucket penyimpanan perantara.

  • DynamodbStsRoleArn— UTF-8 string, cocok denganCustom string pattern #66.

    Nama Sumber Daya Amazon (ARN) dari peran AWS Security Token Service (STS) yang akan diasumsikan untuk mengakses sumber daya DynamoDB dan S3 selama operasi ELT. Peran ini harus memiliki izin yang diperlukan untuk membaca dari tabel DynamoDB dan menulis ke bucket S3 perantara.

DDBELTCatalogAdditionalOptions struktur

Menentukan opsi tambahan untuk operasi katalog DynamoDB ELT.

Bidang
  • DynamodbExport— UTF-8 string, cocok denganCustom string pattern #66.

    Menentukan konfigurasi ekspor DynamoDB untuk operasi ELT.

  • DynamodbUnnestDDBJson – Boolean.

    Menentukan apakah format JSON DynamoDB akan dibatalkan. Saat disetel ketrue, struktur JSON bersarang di item DynamoDB diratakan.

Struktur rute

Menentukan node rute yang mengarahkan data ke jalur keluaran yang berbeda berdasarkan kondisi penyaringan yang ditentukan.

Bidang
  • Name Diperlukan: UTF-8 string, cocok denganCustom string pattern #68.

    Nama node rute.

  • Inputs- Diperlukan: Sebuah array UTF-8 string, tidak kurang dari 1 atau lebih dari 1 string.

    Koneksi input untuk node rute.

  • GroupFiltersListWajib: Susunan objek GroupFilters.

    Daftar filter grup yang menentukan kondisi routing dan kriteria untuk mengarahkan data ke jalur keluaran yang berbeda.

GroupFilters struktur

Menentukan kelompok filter dengan operator logis yang menentukan bagaimana filter digabungkan untuk mengevaluasi kondisi routing.

Bidang
  • GroupName Diperlukan: UTF-8 string, cocok denganCustom string pattern #65.

    Nama grup filter.

  • FiltersWajib: Susunan objek FilterExpression.

    Daftar ekspresi filter yang menentukan kondisi untuk grup ini.

  • LogicalOperator Diperlukan: UTF-8 string (nilai valid: AND |OR).

    Operator logis digunakan untuk menggabungkan filter dalam grup ini. Menentukan apakah semua filter harus cocok (DAN) atau filter apa pun dapat cocok (ATAU).

AutoDataQuality struktur

Menentukan opsi konfigurasi untuk evaluasi kualitas data otomatis dalam AWS Glue pekerjaan. Struktur ini memungkinkan pemeriksaan dan pemantauan kualitas data otomatis selama operasi ETL, membantu memastikan integritas dan keandalan data tanpa intervensi manual.

Bidang
  • IsEnabled – Boolean.

    Menentukan apakah evaluasi kualitas data otomatis diaktifkan. Ketika disetel ketrue, pemeriksaan kualitas data dilakukan secara otomatis.

  • EvaluationContext— UTF-8 string, cocok denganCustom string pattern #66.

    Konteks evaluasi untuk pemeriksaan kualitas data otomatis. Ini mendefinisikan ruang lingkup dan parameter untuk evaluasi kualitas data.