View a markdown version of this page

API processo visuale - AWS Aderenza
 - tipi di dati -CodeGenConfigurationNodeJDBCConnectorOptionsStreamingDataPreviewOptionsAthenaConnectorSourceJDBCConnectorSourceSparkConnectorSourceCatalogSourceMySQLCatalogSourcePostgreSQLCatalogSourceOracleSQLCatalogSourceMicrosoftSQLServerCatalogSourceCatalogKinesisSourceDirectKinesisSourceKinesisStreamingSourceOptionsCatalogKafkaSourceDirectKafkaSourceKafkaStreamingSourceOptionsRedshiftSourceAmazonRedshiftSourceAmazonRedshiftNodeDataAmazonRedshiftAdvancedOptionOpzioneS3CatalogSourceS3SourceAdditionalOptionsS3CsvSourceDirectJDBCSourceS3DirectSourceAdditionalOptionsS3JsonSourceS3ParquetSourceS3DeltaSourceS3CatalogDeltaSourceCatalogDeltaSourceS3HudiSourceS3CatalogHudiSourceS3ExcelSourceCatalogHudiSourceDynamoDBCatalogSourceRelationalCatalogSourceJDBCConnectorTargetSparkConnectorTargetBasicCatalogTargetMySQLCatalogTargetPostgreSQLCatalogTargetOracleSQLCatalogTargetMicrosoftSQLServerCatalogTargetRedshiftTargetAmazonRedshiftTargetUpsertRedshiftTargetOptionsS3CatalogTargetS3GlueParquetTargetCatalogSchemaChangePolicyS3DirectTargetS3HudiCatalogTargetS3HudiDirectTargetS3DeltaCatalogTargetS3DeltaDirectTargetS3HyperDirectTargetS3IcebergDirectTargetDirectSchemaChangePolicyApplyMappingMappingSelectFieldsDropFieldsRenameFieldSpigotJoinJoinColumnSplitFieldsSelectFromCollectionFillMissingValuesFiltroFilterExpressionFilterValueCustomCodeSparkSQLSqlAliasDropNullFieldsNullCheckBoxListNullValueFieldDataTypeUnioneUnionPIIDetectionAggregazioneDropDuplicatesGovernedCatalogTargetGovernedCatalogSourceAggregateOperationGlueSchemaGlueStudioSchemaColumnGlueStudioColumnDynamicTransformTransformConfigParameterEvaluateDataQualityDQResultsPublishingOptionsDQStopJobOnFailureOptionsEvaluateDataQualityMultiFrameRecipeRecipeReferenceSnowflakeNodeDataSnowflakeSourceSnowflakeTargetConnectorDataSourceConnectorDataTargetRecipeStepRecipeActionConditionExpressionS3CatalogIcebergSourceCatalogIcebergSourceS3IcebergCatalogTargetDynamoDBELTConnectorSourceDDBELTConnectionOptionsDDBELTCatalogAdditionalOptionsRouteGroupFiltersAutoDataQuality

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

API processo visuale

L'API Visual Job consente di creare processi di integrazione dei dati utilizzando l' AWS Glue API da un oggetto JSON che rappresenta una configurazione visiva di un AWS Glue processo.

Un elenco di CodeGenConfigurationNodes questi viene fornito a un'API di creazione o aggiornamento del lavoro per registrare un DAG in AWS Glue Studio per il lavoro creato e generare il codice associato.

Tipi di dati

CodeGenConfigurationNode struttura

CodeGenConfigurationNode enumera tutti i tipi di nodo validi. È possibile compilare una e solo una delle variabili membro.

Campi
  • AthenaConnectorSource: un oggetto AthenaConnectorSource.

    Specifica un connettore per un'origine dati Amazon Athena.

  • JDBCConnectorSource: un oggetto JDBCConnectorSource.

    Specifica un connettore per un'origine dati JDBC.

  • SparkConnectorSource: un oggetto SparkConnectorSource.

    Specifica un connettore per un'origine dati Apache Spark.

  • CatalogSource: un oggetto CatalogSource.

    Specifica un archivio dati nel catalogo AWS Glue dati.

  • RedshiftSource: un oggetto RedshiftSource.

    Specifica un archivio dati Amazon Redshift.

  • S3CatalogSource: un oggetto S3CatalogSource.

    Specifica un data store Amazon S3 nel Data Catalog. AWS Glue

  • S3CsvSource: un oggetto S3CsvSource.

    Specifica un archivio dati CSV (valori delimitati da comandi) archiviati in Amazon S3.

  • S3JsonSource: un oggetto S3JsonSource.

    Specifica un archivio dati JSON in Amazon S3.

  • S3ParquetSource: un oggetto S3ParquetSource.

    Specifica un archivio dati di Apache Parquet archiviato in Amazon S3.

  • RelationalCatalogSource: un oggetto RelationalCatalogSource.

    Specifica un archivio dati del catalogo relazionale nel Data Catalog. AWS Glue

  • DynamoDBCatalogSource: un oggetto DynamoDBCatalogSource.

    Specifica un data store del catalogo DynamoDBC nel catalogo dati. AWS Glue

  • JDBCConnectorTarget: un oggetto JDBCConnectorTarget.

    Specifica una destinazioni di dati che scrive su Amazon S3 nell'archiviazione a colonne di Apache Parquet.

  • SparkConnectorTarget: un oggetto SparkConnectorTarget.

    Specifica una destinazione che utilizza un connettore Apache Spark.

  • CatalogTarget: un oggetto BasicCatalogTarget.

    Specifica una destinazione che utilizza una AWS Glue tabella del Data Catalog.

  • RedshiftTarget: un oggetto RedshiftTarget.

    Specifica una destinazione che utilizza Amazon Redshift.

  • S3CatalogTarget: un oggetto S3CatalogTarget.

    Specifica un target di dati che scrive su Amazon S3 utilizzando il AWS Glue Data Catalog.

  • S3GlueParquetTarget: un oggetto S3GlueParquetTarget.

    Specifica una destinazioni di dati che scrive su Amazon S3 nell'archiviazione a colonne di Apache Parquet.

  • S3DirectTarget: un oggetto S3DirectTarget.

    Specifica una destinazione di dati che scrive su Amazon S3.

  • ApplyMapping: un oggetto ApplyMapping.

    Specifica una trasformazione che mappa le chiavi delle proprietà dei dati nell'origine dei dati alle chiavi delle proprietà dei dati nella destinazione. È possibile rinominare le chiavi, modificare i tipi di dati per le chiavi e scegliere le chiavi da eliminare dal set di dati.

  • SelectFields: un oggetto SelectFields.

    Specifica una trasformazione che sceglie le chiavi della proprietà dati che si desidera conservare.

  • DropFields: un oggetto DropFields.

    Specifica una trasformazione che sceglie le chiavi della proprietà dati che si desidera eliminare.

  • RenameField: un oggetto RenameField.

    Specifica una trasformazione che rinominerà una singola chiave di proprietà dati.

  • Spigot: un oggetto Spigot.

    Specifica una trasformazione che scrive campioni dei dati in un bucket Amazon S3.

  • Join: un oggetto Join.

    Specifica una trasformazione che unisce due set di dati in un unico set di dati utilizzando una frase di confronto sulle chiavi di proprietà dei dati specificate. È possibile utilizzare inner, outer, left, right, left semi e left anti join.

  • SplitFields: un oggetto SplitFields.

    Specifica una trasformazione che divide le chiavi della proprietà dati in due DynamicFrames. L'output è una raccolta di DynamicFrames: uno con le chiavi di proprietà dei dati selezionate e uno con le chiavi di proprietà dei dati rimanenti.

  • SelectFromCollection: un oggetto SelectFromCollection.

    Specifica una trasformazione che sceglie un DynamicFrame da una raccolta di DynamicFrames. L'output è il DynamicFrame selezionato

  • FillMissingValues: un oggetto FillMissingValues.

    Specifica una trasformazione che individua i registri nel set di dati che hanno valori mancanti e aggiunge un nuovo campo con un valore determinato dall'imputazione. Il set di dati di input viene utilizzato per addestrare il modello di machine learning che determina quale dovrebbe essere il valore mancante.

  • Filter: un oggetto Filtro.

    Specifica una trasformazione che divide un set di dati in due, in base a una condizione di filtro.

  • CustomCode: un oggetto CustomCode.

    Specifica una trasformazione che utilizza il codice personalizzato fornito per eseguire la trasformazione dei dati. L'output è una raccolta di. DynamicFrames

  • SparkSQL: un oggetto SparkSQL.

    Specifica una trasformazione in cui si inserisce una query SQL utilizzando la sintassi Spark SQL per trasformare i dati. L'output è un singolo DynamicFrame.

  • DirectKinesisSource: un oggetto DirectKinesisSource.

    Specifica un'origine dati Amazon Kinesis diretta.

  • DirectKafkaSource: un oggetto DirectKafkaSource.

    Specifica un archivio dati Apache Kafka.

  • CatalogKinesisSource: un oggetto CatalogKinesisSource.

    Specifica un'origine dati Kinesis nel AWS Glue Data Catalog.

  • CatalogKafkaSource: un oggetto CatalogKafkaSource.

    Specifica un archivio dati Apache Kafka nel catalogo dati.

  • DropNullFields: un oggetto DropNullFields.

    Specifica una trasformazione che rimuove le colonne dal set di dati se tutti i valori nella colonna sono “null”. Per impostazione predefinita, AWS Glue Studio riconoscerà gli oggetti nulli, ma alcuni valori come stringhe vuote, stringhe «nulle», numeri interi -1 o altri segnaposto come gli zeri, non vengono riconosciuti automaticamente come valori nulli.

  • Merge: un oggetto Unione.

    Specifica una trasformazione che unisce DynamicFrame a con un DynamicFrame di staging basato sulle chiavi primarie specificate per identificare i registri. I registri duplicati (registri con le stesse chiavi primarie) non vengono deduplicati.

  • Union: un oggetto Union.

    Specifica una trasformazione che combina le righe di due o più set di dati in un unico risultato.

  • PIIDetection: un oggetto PIIDetection.

    Specifica una trasformazione che identifica, rimuove o maschera i dati PII.

  • Aggregate: un oggetto Aggregazione.

    Specifica una trasformazione che raggruppa le righe in base ai campi scelti e calcola il valore aggregato in base alla funzione specificata.

  • DropDuplicates: un oggetto DropDuplicates.

    Specifica una trasformazione che rimuove le righe di dati ripetuti da un set di dati.

  • GovernedCatalogTarget: un oggetto GovernedCatalogTarget.

    Specifica una destinazione di dati che scrive su un catalogo governato.

  • GovernedCatalogSource: un oggetto GovernedCatalogSource.

    Specifica un'origine dei dati in un catalogo dati governato.

  • MicrosoftSQLServerCatalogSource: un oggetto MicrosoftSQLServerCatalogSource.

    Specifica un'origine dei dati di Microsoft SQL Server nel Catalogo dati di AWS Glue .

  • MySQLCatalogSource: un oggetto MySQLCatalogSource.

    Specifica una fonte di dati MySQL nel Data Catalog. AWS Glue

  • OracleSQLCatalogSource: un oggetto OracleSQLCatalogSource.

    Specifica un'origine dati Oracle nel Data Catalog. AWS Glue

  • PostgreSQLCatalogSource: un oggetto PostgreSQLCatalogSource.

    Specifica un'origine dati PostgreSQL nel Data Catalog. AWS Glue

  • MicrosoftSQLServerCatalogTarget: un oggetto MicrosoftSQLServerCatalogTarget.

    Specifica una destinazione che utilizza Microsoft SQL.

  • MySQLCatalogTarget: un oggetto MySQLCatalogTarget.

    Specifica una destinazione che utilizza MySQL.

  • OracleSQLCatalogTarget: un oggetto OracleSQLCatalogTarget.

    Specifica una destinazione che utilizza Oracle SQL.

  • PostgreSQLCatalogTarget: un oggetto PostgreSQLCatalogTarget.

    Specifica una destinazione che utilizza Postgres SQL.

  • Route: un oggetto Route.

    Specifica un nodo di routing che indirizza i dati verso diversi percorsi di output in base a condizioni di filtraggio definite.

  • DynamicTransform: un oggetto DynamicTransform.

    Specifica una trasformazione visiva personalizzata creata da un utente.

  • EvaluateDataQuality: un oggetto EvaluateDataQuality.

    Specifica i criteri di valutazione della qualità dei dati.

  • S3CatalogHudiSource: un oggetto S3CatalogHudiSource.

    Specifica un'origine dati Hudi registrata nel catalogo dati. AWS Glue L'origine dati deve essere archiviata in. Amazon S3

  • CatalogHudiSource: un oggetto CatalogHudiSource.

    Specifica un'origine dati Hudi registrata nel catalogo AWS Glue dati.

  • S3HudiSource: un oggetto S3HudiSource.

    Specifica un'origine dati Hudi archiviata in. Amazon S3

  • S3HudiCatalogTarget: un oggetto S3HudiCatalogTarget.

    Specifica una destinazione che scrive su un'origine dati Hudi nel catalogo dati. AWS Glue

  • S3HudiDirectTarget: un oggetto S3HudiDirectTarget.

    Specifica una destinazione che scrive su un'origine dati Hudi in. Amazon S3

  • S3CatalogDeltaSource: un oggetto S3CatalogDeltaSource.

    Specifica un'origine dati Delta Lake registrata nel catalogo dati. AWS Glue L'origine dati deve essere archiviata in Amazon S3.

  • CatalogDeltaSource: un oggetto CatalogDeltaSource.

    Specifica un'origine dati Delta Lake registrata nel catalogo AWS Glue dati.

  • S3DeltaSource: un oggetto S3DeltaSource.

    Specifica un'origine dati Delta Lake archiviata in. Amazon S3

  • S3DeltaCatalogTarget: un oggetto S3DeltaCatalogTarget.

    Specifica una destinazione che scrive su un'origine dati Delta Lake nel AWS Glue Data Catalog.

  • S3DeltaDirectTarget: un oggetto S3DeltaDirectTarget.

    Specifica una destinazione che scrive su un'origine dati Delta Lake in. Amazon S3

  • AmazonRedshiftSource: un oggetto AmazonRedshiftSource.

    Specifica una destinazione che scrive su un'origine dati in Amazon Redshift.

  • AmazonRedshiftTarget: un oggetto AmazonRedshiftTarget.

    Specifica una destinazione che scrive su una destinazione dati in Amazon Redshift.

  • EvaluateDataQualityMultiFrame: un oggetto EvaluateDataQualityMultiFrame.

    Specifica i criteri di valutazione della qualità dei dati. Consente più dati di input e restituisce una raccolta di frame dinamici.

  • Recipe: un oggetto Recipe.

    Specifica un nodo di AWS Glue DataBrew ricetta.

  • SnowflakeSource: un oggetto SnowflakeSource.

    Specifica un'origine dati Snowflake.

  • SnowflakeTarget: un oggetto SnowflakeTarget.

    Specifica una destinazione che scrive su un'origine dati Snowflake.

  • ConnectorDataSource: un oggetto ConnectorDataSource.

    Specifica un'origine generata con opzioni di connessione standard.

  • ConnectorDataTarget: un oggetto ConnectorDataTarget.

    Specifica un a destinazione generata con opzioni di connessione standard.

  • S3CatalogIcebergSource: un oggetto S3CatalogIcebergSource.

    Specifica un'origine dati Apache Iceberg registrata nel Data Catalog. AWS Glue L'origine dati Iceberg deve essere archiviata in. Amazon S3

  • CatalogIcebergSource: un oggetto CatalogIcebergSource.

    Specifica un'origine dati Apache Iceberg registrata nel Data Catalog. AWS Glue

  • S3IcebergCatalogTarget: un oggetto S3IcebergCatalogTarget.

    Specifica una destinazione del catalogo Apache Iceberg che scrive i dati Amazon S3 e registra la tabella nel Data Catalog. AWS Glue

  • S3IcebergDirectTarget: un oggetto S3IcebergDirectTarget.

    Definisce i parametri di configurazione per la scrittura dei dati in Amazon S3 come tabella Apache Iceberg.

  • S3ExcelSource: un oggetto S3ExcelSource.

    Definisce i parametri di configurazione per la lettura dei file Excel da Amazon S3.

  • S3HyperDirectTarget: un oggetto S3HyperDirectTarget.

    Definisce i parametri di configurazione per la scrittura di dati su Amazon S3 mediante l'ottimizzazione. HyperDirect

  • DynamoDBELTConnectorSource: un oggetto DynamoDBELTConnectorSource.

    Specifica un connettore ELT DynamoDB di origine per l'estrazione dei dati dalle tabelle DynamoDB.

JDBCConnectorOptions struttura

Opzioni di connessione aggiuntive per il connettore.

Campi
  • FilterPredicate— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Clausola condizione extra per filtrare i dati dall'origine. Ad esempio:

    BillingCity='Mountain View'

    Quando si utilizza una query anziché un nome di tabella, è necessario verificare che la query funzioni con il filterPredicate specificato.

  • PartitionColumn— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome di una colonna intera utilizzata per il partizionamento. Questa opzione funziona solo quando è inclusa con lowerBound, upperBound e numPartitions. Questa opzione funziona allo stesso modo del lettore Spark SQL JDBC.

  • LowerBound: numero (lungo).

    Il valore minimo di partitionColumn che viene utilizzato per decidere lo stride della partizione.

  • UpperBound: numero (lungo).

    Il valore massimo di partitionColumn che viene utilizzato per decidere lo stride della partizione.

  • NumPartitions: numero (lungo).

    Il numero di partizioni. Questo valore, insieme a lowerBound (incluso) e upperBound (escluso), forma stride di partizione per espressioni con le clausole WHERE generate che vengono utilizzate per dividere la partitionColumn.

  • JobBookmarkKeys— Una serie di UTF-8 stringhe.

    Il nome delle chiavi dei segnalibri di processo su cui eseguire l'ordinamento.

  • JobBookmarkKeysSortOrder— UTF-8 stringa, corrispondente a. Custom string pattern #66

    Specifica il criterio di ordinamento crescente o decrescente.

  • DataTypeMapping: una matrice della mappa di coppie chiave-valore.

    Ogni chiave è una UTF-8 stringa (valori validi: ARRAY | BIGINT | BINARY | BIT | BLOB | BOOLEAN | CHAR | | CLOB | DATALINK | DATE | DECIMAL | DISTINCT | DOUBLE | FLOAT | INTEGER | JAVA_OBJECT | LONGNVARCHAR | LONGVARBINARY | | LONGVARCHAR | NCHAR | NCLOB | NULL | NUMERIC | NVARCHAR | OTHER | REAL | REF | REF_CURSOR | ROWID | | SMALLINT | SQLXML | STRUCT | TIME | TIME_WITH_TIMEZONE | TIMESTAMP | TIMESTAMP_WITH_TIMEZONE| TINYINT | VARBINARY |VARCHAR).

    Ogni valore è una UTF-8 stringa (valori validi: DATE | STRING | TIMESTAMP | INT | FLOAT | LONG | BIGDECIMAL | BYTE | SHORT |DOUBLE).

    Mappatura del tipo di dati personalizzata che crea una mappatura da un tipo di dati JDBC a un tipo di dati AWS Glue . Ad esempio, l'opzione "dataTypeMapping":{"FLOAT":"STRING"} mappa i campi di dati di tipo JDBC FLOAT nel String tipo Java chiamando il ResultSet.getString() metodo del driver e lo utilizza per creare il AWS Glue record. L'oggetto ResultSet viene implementato da ciascun driver, quindi il comportamento è specifico del driver utilizzato. Consulta la documentazione relativa al driver JDBC per capire come il driver esegue le conversioni.

StreamingDataPreviewOptions struttura

Specifica le opzioni relative all'anteprima dei dati per la visualizzazione di un campione dei dati.

Campi
  • PollingTime: numero (lungo), almeno 10.

    Il tempo di polling in millisecondi.

  • RecordPollingLimit: numero (lungo), almeno 1.

    Il limite al numero di registri per cui è stato fatto il polling.

AthenaConnectorSource struttura

Specifica un connettore per un'origine dati Amazon Athena.

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.

    Il nome dell'origine dati.

  • ConnectionName Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome della connessione associata al connettore.

  • ConnectorName Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome di un connettore che facilita l'accesso all'archivio dati in AWS Glue Studio.

  • ConnectionType Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #66

    Il tipo di connessione, come marketplace.athena o custom.athena, che designa una connessione a un archivio dati Amazon Athena.

  • ConnectionTable— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome della tabella nell'origine dati.

  • SchemaName Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome del gruppo di log CloudWatch da cui leggere. Ad esempio, /aws-glue/jobs/output.

  • OutputSchemas: una matrice di oggetti GlueSchema.

    Specifica lo schema di dati per l'origine Athena personalizzata.

JDBCConnectorSource struttura

Specifica un connettore per un'origine dati JDBC.

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.

    Il nome dell'origine dati.

  • ConnectionName Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome della connessione associata al connettore.

  • ConnectorName Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome di un connettore che facilita l'accesso all'archivio dati in AWS Glue Studio.

  • ConnectionType Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #66

    Il tipo di connessione, come marketplace.jdbc o custom.jdbc, che designa una connessione a un archivio dati JDBC.

  • AdditionalOptions: un oggetto JDBCConnectorOptions.

    Opzioni di connessione aggiuntive per il connettore.

  • ConnectionTable— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome della tabella nell'origine dati.

  • Query— UTF-8 stringa, corrispondente aCustom string pattern #67.

    La tabella o la query SQL da cui ottenere i dati. Puoi specificare ConnectionTable o query, ma non entrambi.

  • OutputSchemas: una matrice di oggetti GlueSchema.

    Specifica lo schema di dati per l'origine JDBC personalizzata.

SparkConnectorSource struttura

Specifica un connettore per un'origine dati Apache Spark.

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.

    Il nome dell'origine dati.

  • ConnectionName Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome della connessione associata al connettore.

  • ConnectorName Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome di un connettore che facilita l'accesso all'archivio dati in AWS Glue Studio.

  • ConnectionType Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #66

    Il tipo di connessione, come marketplace.spark o custom.spark, che designa una connessione a un archivio dati di Apache Spark.

  • AdditionalOptions: una matrice della mappa di coppie chiave-valore.

    Ogni chiave è una UTF-8 stringa, corrispondente aCustom string pattern #66.

    Ogni valore è una UTF-8 stringa, corrispondente aCustom string pattern #66.

    Opzioni di connessione aggiuntive per il connettore.

  • OutputSchemas: una matrice di oggetti GlueSchema.

    Specifica lo schema di dati per l'origine Spark personalizzata.

CatalogSource struttura

Specifica un archivio dati nel catalogo AWS Glue dati.

Campi
  • Name Obbligatoria: UTF-8 stringa, corrispondente a. Custom string pattern #68

    Il nome del archivio dati.

  • Database Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome del database da cui leggere.

  • Table Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome della tabella nel database da cui leggere.

  • PartitionPredicate— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Le partizioni che soddisfano questo predicato vengono eliminate. I file all'interno del periodo di conservazione in queste partizioni non vengono eliminati.

  • OutputSchemas: una matrice di oggetti GlueSchema.

    Specifica lo schema di dati per l'origine del catalogo.

MySQLCatalogSource struttura

Specifica un'origine dati MySQL nel catalogo dati. AWS Glue

Campi

PostgreSQLCatalogSource struttura

Specifica un'origine dati PostgreSQL nel catalogo dati. AWS Glue

Campi

OracleSQLCatalogSource struttura

Specifica un'origine dati Oracle nel catalogo AWS Glue dati.

Campi

MicrosoftSQLServerCatalogSource struttura

Specifica un'origine dei dati di Microsoft SQL Server nel Catalogo dati di AWS Glue .

Campi

CatalogKinesisSource struttura

Specifica un'origine dati Kinesis nel AWS Glue Data Catalog.

Campi
  • Name Obbligatoria: UTF-8 stringa, corrispondente a. Custom string pattern #68

    Il nome dell'origine dati.

  • WindowSize: numero (intero).

    La quantità di tempo da dedicare all'elaborazione di ciascun micro batch.

  • DetectSchema: booleano.

    Se determinare automaticamente o meno lo schema dai dati in entrata.

  • Table Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome della tabella nel database da cui leggere.

  • Database Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome del database da cui leggere.

  • StreamingOptions: un oggetto KinesisStreamingSourceOptions.

    Opzioni aggiuntive per l'origine dati di streaming Kinesis.

  • DataPreviewOptions: un oggetto StreamingDataPreviewOptions.

    Opzioni aggiuntive per l'anteprima dei dati.

DirectKinesisSource struttura

Specifica un'origine dati Amazon Kinesis diretta.

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.

    Il nome dell'origine dati.

  • WindowSize: numero (intero).

    La quantità di tempo da dedicare all'elaborazione di ciascun micro batch.

  • DetectSchema: booleano.

    Se determinare automaticamente o meno lo schema dai dati in entrata.

  • StreamingOptions: un oggetto KinesisStreamingSourceOptions.

    Opzioni aggiuntive per l'origine dati di streaming Kinesis.

  • DataPreviewOptions: un oggetto StreamingDataPreviewOptions.

    Opzioni aggiuntive per l'anteprima dei dati.

KinesisStreamingSourceOptions struttura

Opzioni aggiuntive per l'origine dati di streaming Amazon Kinesis.

Campi
  • EndpointUrl— UTF-8 stringa, corrispondente aCustom string pattern #66.

    L'URL dell'endpoint di Kinesis.

  • StreamName— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome del flusso di dati Kinesis.

  • Classification— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Una classificazione facoltativa.

  • Delimiter— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Specifica il carattere delimitatore.

  • StartingPosition— UTF-8 stringa (valori validi: latest="LATEST" | trim_horizon="TRIM_HORIZON" | earliest="EARLIEST" |timestamp="TIMESTAMP").

    La posizione di partenza nel flusso dei dati Kinesis da cui leggere i dati. I valori possibili sono"latest", "trim_horizon""earliest", o una stringa di timestamp in formato UTC nel modello yyyy-mm-ddTHH:MM:SSZ (dove Z rappresenta un offset del fuso orario UTC con +/-). Ad esempio: «2023-04-04 «). T08:00:00-04:00 Il valore predefinito è "latest".

    Nota: l'utilizzo di un valore che è una stringa di timestamp in formato UTC per «startingPosition» è supportato solo per la versione 4.0 o successiva. AWS Glue

  • MaxFetchTimeInMs: numero (lungo).

    Il tempo massimo impiegato affinché l'esecutore del processo legga i record della batch attuale dal flusso di dati Kinesis, specificato in millisecondi (ms). Entro questo periodo è possibile effettuate più chiamate API GetRecords. Il valore predefinito è 1000.

  • MaxFetchRecordsPerShard: numero (lungo).

    Il numero massimo di record da recuperare per shard nel flusso di dati Kinesis per microbatch. Nota: il client può superare questo limite se il processo di streaming ha già letto i record aggiuntivi da Kinesis (nella stessa chiamata get-records). Se MaxFetchRecordsPerShard deve essere rigoroso, allora deve essere un multiplo di MaxRecordPerRead. Il valore predefinito è 100000.

  • MaxRecordPerRead: numero (lungo).

    Il numero massimo di registri da recuperare nel flusso dei dati Kinesis in ciascuna operazione getRecords. Il valore predefinito è 10000.

  • AddIdleTimeBetweenReads: booleano.

    Aggiunge un ritardo tra due operazioni consecutive getRecords. Il valore predefinito è "False". Questa opzione è configurabile solo per AWS Glue versione 2.0 e successive.

  • IdleTimeBetweenReadsInMs: numero (lungo).

    Il ritardo minimo tra due operazioni consecutive getRecords, specificato in ms. Il valore predefinito è 1000. Questa opzione è configurabile solo per la versione 2.0 e successive. AWS Glue

  • DescribeShardInterval: numero (lungo).

    L'intervallo di tempo minimo tra due chiamate ListShards API affinché lo script consideri il resharding. Il valore predefinito è 1s.

  • NumRetries: numero (intero).

    Il numero massimo di tentativi per le richieste API Kinesis Data Streams. Il valore predefinito è 3.

  • RetryIntervalMs: numero (lungo).

    Il periodo di raffreddamento (specificato in ms) prima di riprovare la chiamata API Kinesis Data Streams. Il valore predefinito è 1000.

  • MaxRetryIntervalMs: numero (lungo).

    Il periodo di raffreddamento (specificato in ms) tra due tentativi di chiamata API Kinesis Data Streams. Il valore predefinito è 10000.

  • AvoidEmptyBatches: booleano.

    Impedisce la creazione di un processo microbatch vuoto controllando la presenza di dati non letti nel flusso dei dati Kinesis prima che il batch venga avviato. Il valore predefinito è "False".

  • StreamArn— UTF-8 stringa, corrispondente a. Custom string pattern #66

    Il nome della risorsa Amazon (ARN) del flusso di dati Kinesis.

  • RoleArn— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome della risorsa Amazon (ARN) del ruolo da assumere tramite il Servizio di token di sicurezza AWS (AWS STS). Questo ruolo deve disporre delle autorizzazioni per descrivere o leggere le operazioni dei registri per il flusso di dati Kinesis. Quando si accede a un flusso di dati in un altro account, è necessario utilizzare questo parametro. Usato in combinazione con "awsSTSSessionName".

  • RoleSessionName— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Un identificatore della sessione che assume il ruolo tramite AWS STS. Quando si accede a un flusso di dati in un altro account, è necessario utilizzare questo parametro. Usato in combinazione con "awsSTSRoleARN".

  • AddRecordTimestamp— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Quando questa opzione è impostata su "true", l'output dei dati conterrà una colonna aggiuntiva denominata "__src_timestamp" che indica l'ora in cui il record corrispondente è stato ricevuto dal flusso. Il valore predefinito è "false". Questa opzione è supportata nella AWS Glue versione 4.0 o successiva.

  • EmitConsumerLagMetrics— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Quando questa opzione è impostata su «true», per ogni batch, emetterà le metriche relative alla durata compresa tra il record più vecchio ricevuto dallo stream e l'ora in AWS Glue cui arriva. CloudWatch Il nome della metrica è «glue.driver.streaming.max». ConsumerLagInMs Il valore predefinito è "false". Questa opzione è supportata in AWS Glue versione 4.0 o successive.

  • StartingTimestamp— stringa. UTF-8

    Il timestamp del record nel flusso di dati Kinesis da cui iniziare la lettura dei dati. I valori possibili sono una stringa di timestamp in formato UTC del modello yyyy-mm-ddTHH:MM:SSZ (dove Z rappresenta un offset del fuso orario UTC con un +/-). Ad esempio: «2023-04-04 + 08:00 «). T08:00:00

  • FanoutConsumerARN— UTF-8 stringa, corrispondente a. Custom string pattern #66

    Il nome della risorsa Amazon (ARN) del consumatore con fan-out avanzato del flusso di dati Kinesis. Quando è specificato, abilita il fan-out avanzato per un throughput dedicato e un consumo di dati a latenza inferiore.

CatalogKafkaSource struttura

Specifica un archivio dati Apache Kafka nel catalogo dati.

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.

    Il nome del archivio dati.

  • WindowSize: numero (intero).

    La quantità di tempo da dedicare all'elaborazione di ciascun micro batch.

  • DetectSchema: booleano.

    Se determinare automaticamente o meno lo schema dai dati in entrata.

  • Table Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome della tabella nel database da cui leggere.

  • Database Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome del database da cui leggere.

  • StreamingOptions: un oggetto KafkaStreamingSourceOptions.

    Specifica le opzioni di streaming.

  • DataPreviewOptions: un oggetto StreamingDataPreviewOptions.

    Specifica le opzioni relative all'anteprima dei dati per la visualizzazione di un campione dei dati.

DirectKafkaSource struttura

Specifica un archivio dati Apache Kafka.

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.

    Il nome del archivio dati.

  • StreamingOptions: un oggetto KafkaStreamingSourceOptions.

    Specifica le opzioni di streaming.

  • WindowSize: numero (intero).

    La quantità di tempo da dedicare all'elaborazione di ciascun micro batch.

  • DetectSchema: booleano.

    Se determinare automaticamente o meno lo schema dai dati in entrata.

  • DataPreviewOptions: un oggetto StreamingDataPreviewOptions.

    Specifica le opzioni relative all'anteprima dei dati per la visualizzazione di un campione dei dati.

KafkaStreamingSourceOptions struttura

Opzioni aggiuntive per lo streaming.

Campi
  • BootstrapServers— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Un elenco di URL del server bootstrap, ad esempio, come b-1.vpc-test-2.o4q88o.c6.kafka.us-east-1.amazonaws.com:9094. Questa opzione deve essere specificata nella chiamata API o definita nei metadati della tabella in catalogo dati.

  • SecurityProtocol— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il protocollo utilizzato per comunicare con i broker. I valori possibili sono "SSL" o "PLAINTEXT".

  • ConnectionName— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome della connessione.

  • TopicName— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome dell'argomento come specificato in Apache Kafka. Devi specificare almeno uno tra "topicName", "assign" o "subscribePattern".

  • Assign— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Lo specifico TopicPartitions per consumare. Devi specificare almeno uno tra "topicName", "assign" o "subscribePattern".

  • SubscribePattern— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Uuna stringa regex Java che identifichi l'elenco degli argomenti a cui effettuare la sottoscrizione. Devi specificare almeno uno tra "topicName", "assign" o "subscribePattern".

  • Classification— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Una classificazione facoltativa.

  • Delimiter— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Specifica il carattere delimitatore.

  • StartingOffsets— UTF-8 stringa, corrispondente aCustom string pattern #66.

    La posizione di partenza nell'argomento Kafka da cui leggere i dati. I valori possibili sono "earliest" o "latest". Il valore predefinito è "latest".

  • EndingOffsets— UTF-8 stringa, corrispondente aCustom string pattern #66.

    L'endpoint al quale viene terminata una query batch. I valori possibili sono "latest" o una stringa JSON che specifica un offset finale per ogni TopicPartition.

  • PollTimeoutMs: numero (lungo).

    Il timeout in millisecondi per il polling dei dati da Kafka negli esecutori del processo Spark. Il valore predefinito è 512.

  • NumRetries: numero (intero).

    Il numero di tentativi prima di non riuscire a recuperare gli offset Kafka. Il valore predefinito è 3.

  • RetryIntervalMs: numero (lungo).

    Il tempo di attesa in millisecondi prima di riprovare a recuperare gli offset Kafka. Il valore predefinito è 10.

  • MaxOffsetsPerTrigger: numero (lungo).

    Il limite di velocità sul numero massimo di offset elaborati per intervallo di attivazione. Il numero totale di offset specificato viene suddiviso proporzionalmente tra topicPartitions di diversi volumi. Il valore di default è null, il che significa che il consumer legge tutti gli offset fino all'ultimo offset noto.

  • MinPartitions: numero (intero).

    Il numero minimo desiderato di partizioni da leggere da Kafka. Il valore di default è null, il che significa che il numero di partizioni Spark è uguale al numero di partizioni Kafka.

  • IncludeHeaders: booleano.

    Se includere le intestazioni di Kafka. Quando l'opzione è impostata su "true", l'output dei dati conterrà una colonna aggiuntiva denominata "glue_streaming_kafka_headers" con tipo Array[Struct(key: String, value: String)]. Il valore di default è "false". Questa opzione è disponibile solo nella AWS Glue versione 3.0 o successiva.

  • AddRecordTimestamp— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Quando questa opzione è impostata su "true", l'output dei dati conterrà una colonna aggiuntiva denominata "__src_timestamp" che indica l'ora in cui il record corrispondente è stato ricevuto dall'argomento. Il valore predefinito è "false". Questa opzione è supportata nella AWS Glue versione 4.0 o successiva.

  • EmitConsumerLagMetrics— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Quando questa opzione è impostata su «true», per ogni batch, emetterà le metriche relative alla durata compresa tra il record più vecchio ricevuto dall'argomento e l'ora in AWS Glue cui arriva. CloudWatch Il nome della metrica è «glue.driver.streaming.max». ConsumerLagInMs Il valore predefinito è "false". Questa opzione è supportata in AWS Glue versione 4.0 o successive.

  • StartingTimestamp— stringa. UTF-8

    Il timestamp del record nell'argomento Kinesis da cui iniziare la lettura dei dati. I valori possibili sono una stringa di timestamp in formato UTC del modello yyyy-mm-ddTHH:MM:SSZ (dove Z rappresenta un offset del fuso orario UTC con un +/-). Ad esempio: «2023-04-04 + 08:00 «). T08:00:00

    Deve essere impostato solo un valore tra StartingTimestamp e StartingOffsets.

RedshiftSource struttura

Specifica un archivio dati Amazon Redshift.

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.

    Il nome dell'archivio dati Amazon Redshift.

  • Database Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il database da cui leggere.

  • Table Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    La tabella del database da cui leggere.

  • RedshiftTmpDir— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il percorso Amazon S3 in cui i dati temporanei possono essere caricati durante la copia dal database.

  • TmpDirIAMRole— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il ruolo IAM con autorizzazioni.

AmazonRedshiftSource struttura

Il nome della connessione è l'origine Amazon Redshift.

Campi

AmazonRedshiftNodeData struttura

Specifica un nodo Amazon Redshift.

Campi
  • AccessType— UTF-8 stringa, corrispondente aCustom string pattern #65.

    Il tipo di accesso per la connessione Redshift. Può essere una connessione diretta o una al catalogo.

  • SourceType— UTF-8 stringa, corrispondente aCustom string pattern #65.

    Il tipo di origine per specificare se una tabella specifica è l'origine o una query personalizzata.

  • Connection: un oggetto Opzione.

    La AWS Glue connessione al cluster Redshift.

  • Schema: un oggetto Opzione.

    Il nome dello schema Redshift quando si lavora con una connessione diretta.

  • Table: un oggetto Opzione.

    Il nome della tabella Redshift quando si lavora con una connessione diretta.

  • CatalogDatabase: un oggetto Opzione.

    Il nome del database AWS Glue Data Catalog quando si lavora con un catalogo dati.

  • CatalogTable: un oggetto Opzione.

    Il nome della tabella AWS Glue Data Catalog quando si lavora con un catalogo dati.

  • CatalogRedshiftSchema— UTF-8 stringa.

    Il nome dello schema Redshift quando si lavora con un catalogo dati.

  • CatalogRedshiftTable— UTF-8 corda.

    La tabella del database da cui leggere.

  • TempDir— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il percorso Amazon S3 in cui i dati temporanei possono essere caricati durante la copia dal database.

  • IamRole: un oggetto Opzione.

    Opzionale. Il nome del ruolo utilizzato durante la connessione a S3. Se lasciato vuoto, il ruolo IAM assumerà per impostazione predefinita il ruolo nel processo.

  • AdvancedOptions: una matrice di oggetti AmazonRedshiftAdvancedOption.

    Valori facoltativi durante la connessione al cluster Redshift.

  • SampleQuery— UTF-8 stringa.

    L'SQL utilizzato per recuperare i dati da una fonte Redshift quando si SourceType tratta di una 'query'.

  • PreAction UTF-8 — stringa.

    L'SQL utilizzato prima di un'esecuzione di MERGE o APPEND con upsert.

  • PostAction— UTF-8 corda.

    L'SQL utilizzato prima di un'esecuzione di MERGE o APPEND con upsert.

  • Action— UTF-8 corda.

    Specifica come verrà eseguita la scrittura su un cluster Redshift.

  • TablePrefix— UTF-8 stringa, corrispondente aCustom string pattern #65.

    Specifica il prefisso di una tabella.

  • Upsert: booleano.

    L'operazione utilizzata in un sink Redshift quando si esegue un APPEND.

  • MergeAction— UTF-8 stringa, corrispondente aCustom string pattern #65.

    L'operazione utilizzata per determinare come verrà gestito un MERGE in un sink Redshift.

  • MergeWhenMatched— UTF-8 stringa, corrispondente aCustom string pattern #65.

    L'operazione utilizzata per determinare come verrà gestito un MERGE in un sink Redshift quando un record esistente corrisponde a un nuovo record.

  • MergeWhenNotMatched— UTF-8 stringa, corrispondente aCustom string pattern #65.

    L'operazione utilizzata per determinare come verrà gestito un MERGE in un sink Redshift quando un record esistente non corrisponde a un nuovo record.

  • MergeClause— UTF-8 stringa.

    L'SQL utilizzato in un merge personalizzato per gestire i record corrispondenti.

  • CrawlerConnection— UTF-8 corda.

    Specifica il nome della connessione associata alla tabella del catalogo utilizzata.

  • TableSchema: una matrice di oggetti Opzione.

    L'array di output dello schema per un determinato nodo.

  • StagingTable— UTF-8 corda.

    Il nome della tabella intermedia temporanea utilizzata quando si esegue un MERGE o un APPEND con upsert.

  • SelectedColumns: una matrice di oggetti Opzione.

    L'elenco dei nomi di colonna utilizzati per determinare un record corrispondente quando si esegue un MERGE o un APPEND con upsert.

AmazonRedshiftAdvancedOption struttura

Specifica un valore facoltativo per la connessione al cluster Redshift.

Campi
  • Key— UTF-8 corda.

    La chiave dell'opzione di connessione aggiuntiva.

  • Value— UTF-8 corda.

    Il valore dell'opzione di connessione aggiuntiva.

Struttura Option

Specifica il valore di un'opzione.

Campi

S3CatalogSource struttura

Specifica un archivio dati Amazon S3 nel catalogo AWS Glue dati.

Campi
  • Name Obbligatoria: UTF-8 stringa, corrispondente a. Custom string pattern #68

    Il nome del archivio dati.

  • Database Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il database da cui leggere.

  • Table Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    La tabella del database da cui leggere.

  • PartitionPredicate— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Le partizioni che soddisfano questo predicato vengono eliminate. I file all'interno del periodo di conservazione in queste partizioni non vengono eliminati. Impostato su "": vuoto per impostazione predefinita.

  • AdditionalOptions: un oggetto S3SourceAdditionalOptions.

    Specifica opzioni di connessione aggiuntive.

S3SourceAdditionalOptions struttura

Specifica opzioni di connessione aggiuntive per l'archivio dati Amazon S3.

Campi
  • BoundedSize: numero (lungo).

    Imposta il limite superiore per la dimensione di destinazione del set di dati in byte che verranno elaborati.

  • BoundedFiles: numero (lungo).

    Imposta il limite superiore per il numero di file di destinazione che verranno elaborati.

S3CsvSource struttura

Specifica un archivio dati CSV (valori delimitati da comandi) archiviati in Amazon S3.

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.

    Il nome del archivio dati.

  • Paths Obbligatorio: una serie di UTF-8 stringhe.

    Un elenco dei percorsi Amazon S3 da cui leggere.

  • CompressionType— UTF-8 stringa (valori validi: gzip="GZIP" |bzip2="BZIP2").

    Specifica il modo in cui i dati sono compressi. In genere questo non è necessario se i dati hanno un'estensione del file standard. I valori possibili sono "gzip" e "bzip").

  • Exclusions— Una matrice di UTF-8 stringhe.

    Una stringa contenente un elenco JSON di pattern Unix-style globulari da escludere. Ad esempio "[\"**.pdf \"]" esclude tutti i file PDF.

  • GroupSize— UTF-8 stringa, corrispondente a. Custom string pattern #66

    La dimensione del gruppo di destinazione in byte. Il valore di default viene calcolato in base alla dimensione dei dati di input e alle dimensioni del cluster. Quando sono presenti meno di 50.000 file di input, "groupFiles" deve essere impostato su "inPartition" per rendere effettiva la modifica.

  • GroupFiles— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Quando l'input contiene più di 50.000 file, il raggruppamento di file è attivato per impostazione predefinita. Per attivare il raggruppamento con meno di 50.000 file, imposta questo parametro su “inPartition”. Per disabilitare il raggruppamento in presenza di più di 50.000 file, imposta il parametro su "none".

  • Recurse: booleano.

    Se è impostato su “Vero”, legge i file in modo ricorsivo in tutte le sottodirectory dei percorsi specificati.

  • MaxBand: numero (intero).

    Questa opzione controlla la durata in millisecondi dopo la quale è probabile che l'elenco s3 sia coerente. I file con timestamp di modifica che rientrano negli ultimi millisecondi di MaxBand vengono tracciati specialmente se utilizzati JobBookmarks per tenere conto dell'eventuale coerenza di Amazon S3. Per la maggior parte degli utenti non è necessario impostare questa opzione. Il valore di default è 900.000 millisecondi o 15 minuti.

  • MaxFilesInBand: numero (intero).

    Questa opzione specifica il numero massimo di file da salvare negli ultimi secondi maxBand. Se si supera questo valore, i file aggiuntivi vengono saltati e solo elaborati nella successiva esecuzione del processo.

  • AdditionalOptions: un oggetto S3DirectSourceAdditionalOptions.

    Specifica opzioni di connessione aggiuntive.

  • Separator Obbligatorio: UTF-8 stringa (valori validi: | | | |). comma="COMMA" ctrla="CTRLA" pipe="PIPE" semicolon="SEMICOLON" tab="TAB"

    Specifica il carattere delimitatore. Il valore di default è una virgola: ",", ma è possibile specificare qualsiasi altro carattere.

  • Escaper— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Specifica un carattere di escape. Questa opzione viene utilizzata solo durante la lettura di file CSV. Il valore predefinito è none. Se questa opzione è abilitata, il carattere immediatamente seguente viene usato così come è, ad eccezione di un piccolo set di caratteri di escape ben noti (\n, \r, \t e \0).

  • QuoteChar Obbligatorio: UTF-8 stringa (valori validi: quote="QUOTE" quillemet="QUILLEMET" | single_quote="SINGLE_QUOTE" | |disabled="DISABLED").

    Specifica il carattere da usare per le virgolette. Per impostazione predefinita vengono usate le virgolette doppie: '"'. Imposta questo valore su -1 per disattivare completamente le virgolette.

  • Multiline: booleano.

    Un valore booleano che specifica se un singolo registro può estendersi su più righe. Ciò può accadere quando un campo contiene un carattere di nuova riga tra virgolette. Imposta questa opzione su “Vero” se un qualsiasi registro si estende su più righe. Il valore di default è False, che consente una divisione dei file più netta durante l'analisi.

  • WithHeader: booleano.

    Un valore booleano che specifica se trattare la prima riga come intestazione. Il valore predefinito è False.

  • WriteHeader: booleano.

    Un valore booleano che specifica se scrivere l'intestazione nell'output. Il valore predefinito è True.

  • SkipFirst: booleano.

    Un valore booleano che specifica se ignorare la prima riga di dati. Il valore predefinito è False.

  • OptimizePerformance: booleano.

    Un valore booleano che specifica se utilizzare il lettore SIMD CSV avanzato insieme ai formati di memoria colonnare basati su Apache Arrow. Disponibile solo nella AWS Glue versione 3.0.

  • OutputSchemas: una matrice di oggetti GlueSchema.

    Specifica lo schema di dati per l'origine CSV S3 personalizzata.

Struttura DirectJDBCSource

Specifica la connessione diretta all'origine JDBC.

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.

    Il nome della connessione di origine JDBC.

  • Database Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il database della connessione di origine JDBC.

  • Table Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    La tabella della connessione di origine JDBC.

  • ConnectionName Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome della connessione dell'origine JDBC.

  • ConnectionType Obbligatorio: UTF-8 stringa (valori validi: sqlserver mysql | oracle | postgresql | |redshift).

    Il tipo di connessione dell'origine JDBC.

  • RedshiftTmpDir— UTF-8 stringa, corrispondente aCustom string pattern #66.

    La directory temporanea dell'origine JDBC Redshift.

  • OutputSchemas: una matrice di oggetti GlueSchema.

    Specifica lo schema di dati per l'origine JDBC diretta.

S3DirectSourceAdditionalOptions struttura

Specifica opzioni di connessione aggiuntive per l'archivio dati Amazon S3.

Campi
  • BoundedSize: numero (lungo).

    Imposta il limite superiore per la dimensione di destinazione del set di dati in byte che verranno elaborati.

  • BoundedFiles: numero (lungo).

    Imposta il limite superiore per il numero di file di destinazione che verranno elaborati.

  • EnableSamplePath: booleano.

    Imposta l'opzione per abilitare un percorso di esempio.

  • SamplePath— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Se abilitato, specifica il percorso di esempio.

S3JsonSource struttura

Specifica un archivio dati JSON in Amazon S3.

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.

    Il nome del archivio dati.

  • Paths Obbligatorio: una serie di UTF-8 stringhe.

    Un elenco dei percorsi Amazon S3 da cui leggere.

  • CompressionType— UTF-8 stringa (valori validi: gzip="GZIP" |bzip2="BZIP2").

    Specifica il modo in cui i dati sono compressi. In genere questo non è necessario se i dati hanno un'estensione del file standard. I valori possibili sono "gzip" e "bzip").

  • Exclusions— Una matrice di UTF-8 stringhe.

    Una stringa contenente un elenco JSON di pattern Unix-style globulari da escludere. Ad esempio "[\"**.pdf \"]" esclude tutti i file PDF.

  • GroupSize— UTF-8 stringa, corrispondente a. Custom string pattern #66

    La dimensione del gruppo di destinazione in byte. Il valore di default viene calcolato in base alla dimensione dei dati di input e alle dimensioni del cluster. Quando sono presenti meno di 50.000 file di input, "groupFiles" deve essere impostato su "inPartition" per rendere effettiva la modifica.

  • GroupFiles— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Quando l'input contiene più di 50.000 file, il raggruppamento di file è attivato per impostazione predefinita. Per attivare il raggruppamento con meno di 50.000 file, imposta questo parametro su “inPartition”. Per disabilitare il raggruppamento in presenza di più di 50.000 file, imposta il parametro su "none".

  • Recurse: booleano.

    Se è impostato su “Vero”, legge i file in modo ricorsivo in tutte le sottodirectory dei percorsi specificati.

  • MaxBand: numero (intero).

    Questa opzione controlla la durata in millisecondi dopo la quale è probabile che l'elenco s3 sia coerente. I file con timestamp di modifica che rientrano negli ultimi millisecondi di MaxBand vengono tracciati specialmente se utilizzati JobBookmarks per tenere conto dell'eventuale coerenza di Amazon S3. Per la maggior parte degli utenti non è necessario impostare questa opzione. Il valore di default è 900.000 millisecondi o 15 minuti.

  • MaxFilesInBand: numero (intero).

    Questa opzione specifica il numero massimo di file da salvare negli ultimi secondi maxBand. Se si supera questo valore, i file aggiuntivi vengono saltati e solo elaborati nella successiva esecuzione del processo.

  • AdditionalOptions: un oggetto S3DirectSourceAdditionalOptions.

    Specifica opzioni di connessione aggiuntive.

  • JsonPathCustom string pattern #66 stringa, corrispondente a. UTF-8

    Una JsonPath stringa che definisce i dati JSON.

  • Multiline: booleano.

    Un valore booleano che specifica se un singolo registro può estendersi su più righe. Ciò può accadere quando un campo contiene un carattere di nuova riga tra virgolette. Imposta questa opzione su “Vero” se un qualsiasi registro si estende su più righe. Il valore di default è False, che consente una divisione dei file più netta durante l'analisi.

  • OutputSchemas: una matrice di oggetti GlueSchema.

    Specifica lo schema di dati per l'origine JSON S3 personalizzata.

S3ParquetSource struttura

Specifica un archivio dati di Apache Parquet archiviato in Amazon S3.

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.

    Il nome del archivio dati.

  • Paths Obbligatorio: una serie di UTF-8 stringhe.

    Un elenco dei percorsi Amazon S3 da cui leggere.

  • CompressionType— UTF-8 stringa (valori validi: snappy="SNAPPY" | lzo="LZO" | gzip="GZIP" | brotli="BROTLI" | | lz4="LZ4" uncompressed="UNCOMPRESSED" |none="NONE").

    Specifica il modo in cui i dati sono compressi. In genere questo non è necessario se i dati hanno un'estensione del file standard. I valori possibili sono "gzip" e "bzip").

  • Exclusions— Una matrice di UTF-8 stringhe.

    Una stringa contenente un elenco JSON di pattern Unix-style globulari da escludere. Ad esempio "[\"**.pdf \"]" esclude tutti i file PDF.

  • GroupSize— UTF-8 stringa, corrispondente a. Custom string pattern #66

    La dimensione del gruppo di destinazione in byte. Il valore di default viene calcolato in base alla dimensione dei dati di input e alle dimensioni del cluster. Quando sono presenti meno di 50.000 file di input, "groupFiles" deve essere impostato su "inPartition" per rendere effettiva la modifica.

  • GroupFiles— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Quando l'input contiene più di 50.000 file, il raggruppamento di file è attivato per impostazione predefinita. Per attivare il raggruppamento con meno di 50.000 file, imposta questo parametro su “inPartition”. Per disabilitare il raggruppamento in presenza di più di 50.000 file, imposta il parametro su "none".

  • Recurse: booleano.

    Se è impostato su “Vero”, legge i file in modo ricorsivo in tutte le sottodirectory dei percorsi specificati.

  • MaxBand: numero (intero).

    Questa opzione controlla la durata in millisecondi dopo la quale è probabile che l'elenco s3 sia coerente. I file con timestamp di modifica che rientrano negli ultimi millisecondi di MaxBand vengono tracciati specialmente se utilizzati JobBookmarks per tenere conto dell'eventuale coerenza di Amazon S3. Per la maggior parte degli utenti non è necessario impostare questa opzione. Il valore di default è 900.000 millisecondi o 15 minuti.

  • MaxFilesInBand: numero (intero).

    Questa opzione specifica il numero massimo di file da salvare negli ultimi secondi maxBand. Se si supera questo valore, i file aggiuntivi vengono saltati e solo elaborati nella successiva esecuzione del processo.

  • AdditionalOptions: un oggetto S3DirectSourceAdditionalOptions.

    Specifica opzioni di connessione aggiuntive.

  • OutputSchemas: una matrice di oggetti GlueSchema.

    Specifica lo schema di dati per l'origine Parquet S3 personalizzata.

S3DeltaSource struttura

Specifica un'origine dati Delta Lake archiviata in Amazon S3.

Campi
  • Name Obbligatoria: UTF-8 stringa, corrispondente a. Custom string pattern #68

    Il nome dell'origine del Delta Lake.

  • Paths Obbligatorio: una serie di UTF-8 stringhe.

    Un elenco dei percorsi Amazon S3 da cui leggere.

  • AdditionalDeltaOptions: una matrice della mappa di coppie chiave-valore.

    Ogni chiave è una UTF-8 stringa, corrispondente a. Custom string pattern #66

    Ogni valore è una UTF-8 stringa, corrispondente aCustom string pattern #66.

    Specifica opzioni di connessione aggiuntive.

  • AdditionalOptions: un oggetto S3DirectSourceAdditionalOptions.

    Specifica opzioni aggiuntive per il connettore.

  • OutputSchemas: una matrice di oggetti GlueSchema.

    Specifica lo schema di dati per l'origine Delta Lake.

S3CatalogDeltaSource struttura

Specifica un'origine dati Delta Lake registrata nel catalogo AWS Glue dati. L'origine dati deve essere archiviata in Amazon S3.

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.

    Il nome dell'origine dati Delta Lake.

  • Database Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome del database da cui leggere.

  • Table Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome della tabella nel database da cui leggere.

  • AdditionalDeltaOptions: una matrice della mappa di coppie chiave-valore.

    Ogni chiave è una UTF-8 stringa, corrispondente aCustom string pattern #66.

    Ogni valore è una UTF-8 stringa, corrispondente aCustom string pattern #66.

    Specifica opzioni di connessione aggiuntive.

  • OutputSchemas: una matrice di oggetti GlueSchema.

    Specifica lo schema di dati per l'origine Delta Lake.

CatalogDeltaSource struttura

Specifica un'origine dati Delta Lake registrata nel catalogo AWS Glue dati.

Campi
  • Name Obbligatoria: UTF-8 stringa, corrispondente a. Custom string pattern #68

    Il nome dell'origine dati Delta Lake.

  • Database Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome del database da cui leggere.

  • Table Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome della tabella nel database da cui leggere.

  • AdditionalDeltaOptions: una matrice della mappa di coppie chiave-valore.

    Ogni chiave è una UTF-8 stringa, corrispondente aCustom string pattern #66.

    Ogni valore è una UTF-8 stringa, corrispondente aCustom string pattern #66.

    Specifica opzioni di connessione aggiuntive.

  • OutputSchemas: una matrice di oggetti GlueSchema.

    Specifica lo schema di dati per l'origine Delta Lake.

S3HudiSource struttura

Specifica un'origine dati Hudi archiviata in. Amazon S3

Campi
  • Name Obbligatoria: UTF-8 stringa, corrispondente a. Custom string pattern #68

    Il nome dell'origine Hudi.

  • Paths Obbligatorio: una serie di UTF-8 stringhe.

    Un elenco dei percorsi Amazon S3 da cui leggere.

  • AdditionalHudiOptions: una matrice della mappa di coppie chiave-valore.

    Ogni chiave è una UTF-8 stringa, corrispondente a. Custom string pattern #66

    Ogni valore è una UTF-8 stringa, corrispondente aCustom string pattern #66.

    Specifica opzioni di connessione aggiuntive.

  • AdditionalOptions: un oggetto S3DirectSourceAdditionalOptions.

    Specifica opzioni aggiuntive per il connettore.

  • OutputSchemas: una matrice di oggetti GlueSchema.

    Specifica lo schema di dati per l'origine Hudi.

S3CatalogHudiSource struttura

Specifica un'origine dati Hudi registrata nel catalogo AWS Glue dati. L'origine dati Hudi deve essere archiviata in. Amazon S3

Campi
  • Name Obbligatoria: UTF-8 stringa, corrispondente a. Custom string pattern #68

    Il nome dell'origine dati Hudi.

  • Database Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome del database da cui leggere.

  • Table Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome della tabella nel database da cui leggere.

  • AdditionalHudiOptions: una matrice della mappa di coppie chiave-valore.

    Ogni chiave è una UTF-8 stringa, corrispondente aCustom string pattern #66.

    Ogni valore è una UTF-8 stringa, corrispondente aCustom string pattern #66.

    Specifica opzioni di connessione aggiuntive.

  • OutputSchemas: una matrice di oggetti GlueSchema.

    Specifica lo schema di dati per l'origine Hudi.

S3ExcelSource struttura

Specifica un'origine dati S3 Excel.

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.

    Il nome dell'origine dati S3 Excel.

  • Paths Obbligatorio: una serie di UTF-8 stringhe.

    I percorsi S3 in cui si trovano i file Excel.

  • CompressionType— UTF-8 stringa (valori validi: snappy="SNAPPY" | lzo="LZO" | gzip="GZIP" | brotli="BROTLI" | | lz4="LZ4" uncompressed="UNCOMPRESSED" |none="NONE").

    Il formato di compressione utilizzato per i file Excel.

  • Exclusions— Una matrice di UTF-8 stringhe.

    Modelli per escludere file o percorsi specifici dall'elaborazione.

  • GroupSize— UTF-8 stringa, corrispondente a. Custom string pattern #66

    Definisce la dimensione dei gruppi di file per l'elaborazione in batch.

  • GroupFiles— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Specifica come i file devono essere raggruppati per l'elaborazione.

  • Recurse: booleano.

    Indica se elaborare le sottodirectory in modo ricorsivo.

  • MaxBand: numero (intero).

    Il numero massimo di bande di elaborazione da utilizzare.

  • MaxFilesInBand: numero (intero).

    Il numero massimo di file da elaborare in ogni banda.

  • AdditionalOptions: un oggetto S3DirectSourceAdditionalOptions.

    Opzioni di configurazione aggiuntive per l'elaborazione delle origini S3 dirette.

  • NumberRows: numero (lungo).

    Il numero di righe da elaborare da ogni file Excel.

  • SkipFooter: numero (intero).

    Il numero di righe da saltare alla fine di ogni file Excel.

  • OutputSchemas: una matrice di oggetti GlueSchema.

    Gli AWS Glue schemi da applicare ai dati elaborati.

CatalogHudiSource struttura

Specifica un'origine dati Hudi registrata nel catalogo AWS Glue dati.

Campi
  • Name Obbligatoria: UTF-8 stringa, corrispondente a. Custom string pattern #68

    Il nome dell'origine dati Hudi.

  • Database Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome del database da cui leggere.

  • Table Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome della tabella nel database da cui leggere.

  • AdditionalHudiOptions: una matrice della mappa di coppie chiave-valore.

    Ogni chiave è una UTF-8 stringa, corrispondente aCustom string pattern #66.

    Ogni valore è una UTF-8 stringa, corrispondente aCustom string pattern #66.

    Specifica opzioni di connessione aggiuntive.

  • OutputSchemas: una matrice di oggetti GlueSchema.

    Specifica lo schema di dati per l'origine Hudi.

DynamoDBCatalogSource struttura

Specifica un'origine dati DynamoDB nel catalogo dati. AWS Glue

Campi
  • Name Obbligatoria: UTF-8 stringa, corrispondente a. Custom string pattern #68

    Il nome dell'origine dati.

  • Database Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome del database da cui leggere.

  • Table Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome della tabella nel database da cui leggere.

  • PitrEnabled: booleano.

    Specifica se Point-in-Time il ripristino (PITR) è abilitato per la tabella DynamoDB. Se impostato su true, consente la lettura a partire da un point-in-time specifico. Il valore predefinito è false.

  • AdditionalOptions: un oggetto DDBELTCatalogAdditionalOptions.

    Specifica opzioni di connessione aggiuntive per l'origine dati DynamoDB.

RelationalCatalogSource struttura

Specifica un'origine dei dati del database relazionale nel Catalogo dati di AWS Glue .

Campi

JDBCConnectorTarget struttura

Specifica una destinazioni di dati che scrive su Amazon S3 nell'archiviazione a colonne di Apache Parquet.

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.

    Il nome di destinazione dati.

  • Inputs Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.

    I nodi che sono input per la destinazione di dati.

  • ConnectionName Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #66

    Il nome della connessione associata al connettore.

  • ConnectionTable Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome della tabella nella destinazione di dati.

  • ConnectorName Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome di un connettore che verrà utilizzato.

  • ConnectionType Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il tipo di connessione, come marketplace.jdbc o custom.jdbc, che designa una connessione a una destinazione di dati JDBC.

  • AdditionalOptions: una matrice della mappa di coppie chiave-valore.

    Ogni chiave è una UTF-8 stringa, corrispondente aCustom string pattern #66.

    Ogni valore è una UTF-8 stringa, corrispondente aCustom string pattern #66.

    Opzioni di connessione aggiuntive per il connettore.

  • OutputSchemas: una matrice di oggetti GlueSchema.

    Specifica lo schema dati per la destinazione JDBC.

SparkConnectorTarget struttura

Specifica una destinazione che utilizza un connettore Apache Spark.

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.

    Il nome di destinazione dati.

  • Inputs Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.

    I nodi che sono input per la destinazione di dati.

  • ConnectionName Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome di una connessione per un connettore Apache Spark.

  • ConnectorName Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome di un connettore Apache Spark.

  • ConnectionType Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il tipo di connessione, come marketplace.spark o custom.spark, che designa una connessione a un archivio dati di Apache Spark.

  • AdditionalOptions: una matrice della mappa di coppie chiave-valore.

    Ogni chiave è una UTF-8 stringa, corrispondente aCustom string pattern #66.

    Ogni valore è una UTF-8 stringa, corrispondente aCustom string pattern #66.

    Opzioni di connessione aggiuntive per il connettore.

  • OutputSchemas: una matrice di oggetti GlueSchema.

    Specifica lo schema di dati per la destinazione Spark personalizzata.

BasicCatalogTarget struttura

Specifica una destinazione che utilizza una tabella AWS Glue Data Catalog.

Campi
  • Name Obbligatoria: UTF-8 stringa, corrispondente a. Custom string pattern #68

    Il nome della destinazione di dati.

  • Inputs Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.

    I nodi che sono input per la destinazione di dati.

  • PartitionKeys— Una serie di stringhe. UTF-8

    Le chiavi di partizione utilizzate per distribuire i dati in più partizioni o shard in base a una chiave o a un set di chiavi specifici.

  • Database Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #66

    Il database che contiene la tabella da utilizzare come destinazione. Questo database deve esistere già nel catalogo dati.

  • Table Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    La tabella che definisce lo schema dei dati di output. Questa tabella deve esistere già nel Data Catalog.

MySQLCatalogTarget struttura

Specifica una destinazione che utilizza MySQL.

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.

    Il nome di destinazione dati.

  • Inputs Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.

    I nodi che sono input per la destinazione di dati.

  • Database Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #66

    Il nome del database in cui scrivere.

  • Table Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome della tabella del database in cui scrivere.

PostgreSQLCatalogTarget struttura

Specifica una destinazione che utilizza Postgres SQL.

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.

    Il nome di destinazione dati.

  • Inputs Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.

    I nodi che sono input per la destinazione di dati.

  • Database Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #66

    Il nome del database in cui scrivere.

  • Table Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome della tabella del database in cui scrivere.

OracleSQLCatalogTarget struttura

Specifica una destinazione che utilizza Oracle SQL.

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.

    Il nome di destinazione dati.

  • Inputs Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.

    I nodi che sono input per la destinazione di dati.

  • Database Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #66

    Il nome del database in cui scrivere.

  • Table Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome della tabella del database in cui scrivere.

MicrosoftSQLServerCatalogTarget struttura

Specifica una destinazione che utilizza Microsoft SQL.

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.

    Il nome di destinazione dati.

  • Inputs Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.

    I nodi che sono input per la destinazione di dati.

  • Database Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #66

    Il nome del database in cui scrivere.

  • Table Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome della tabella del database in cui scrivere.

RedshiftTarget struttura

Specifica una destinazione che utilizza Amazon Redshift.

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.

    Il nome di destinazione dati.

  • Inputs Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.

    I nodi che sono input per la destinazione di dati.

  • Database Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #66

    Il nome del database in cui scrivere.

  • Table Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome della tabella del database in cui scrivere.

  • RedshiftTmpDir— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il percorso Amazon S3 in cui i dati temporanei possono essere caricati durante la copia dal database.

  • TmpDirIAMRole— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il ruolo IAM con autorizzazioni.

  • UpsertRedshiftOptions: un oggetto UpsertRedshiftTargetOptions.

    Il set di opzioni per configurare un'operazione di upsert durante la scrittura su una destinazione Redshift.

AmazonRedshiftTarget struttura

Specifica una destinazione Amazon Redshift.

Campi
  • Name— UTF-8 stringa, corrispondente aCustom string pattern #68.

    Il nome della tabella Amazon Redshift.

  • Data: un oggetto AmazonRedshiftNodeData.

    Specifica i dati del nodo di destinazione Amazon Redshift.

  • Inputs— Una matrice di UTF-8 stringhe, non meno di 1 o più di 1 stringa.

    I nodi che sono input per la destinazione di dati.

UpsertRedshiftTargetOptions struttura

Le opzioni per configurare un'operazione di upsert durante la scrittura su una destinazione Redshift.

Campi
  • TableLocation— UTF-8 stringa, corrispondente aCustom string pattern #66.

    La posizione fisica della tabella Redshift.

  • ConnectionName— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome della connessione da usare per scrivere su Redshift.

  • UpsertKeys— Una serie di UTF-8 stringhe.

    Le chiavi utilizzate per determinare se eseguire un aggiornamento o un inserimento.

S3CatalogTarget struttura

Specifica un target di dati che scrive su Amazon S3 utilizzando il AWS Glue Data Catalog.

Campi
  • Name Obbligatoria: UTF-8 stringa, corrispondente a. Custom string pattern #68

    Il nome di destinazione dati.

  • Inputs Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.

    I nodi che sono input per la destinazione di dati.

  • PartitionKeys— Una serie di stringhe. UTF-8

    Specifica il partizionamento nativo utilizzando una sequenza di chiavi.

  • Table Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #66

    Il nome della tabella del database in cui scrivere.

  • Database Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome del database in cui scrivere.

  • SchemaChangePolicy: un oggetto CatalogSchemaChangePolicy.

    Una policy che specifica i comportamenti di aggiornamento per il crawler.

  • AutoDataQuality: un oggetto AutoDataQuality.

    Specifica se abilitare automaticamente la valutazione della qualità dei dati per il catalogo S3 di destinazione. Se impostato su true, i controlli di qualità dei dati vengono eseguiti automaticamente durante l'operazione di scrittura.

S3GlueParquetTarget struttura

Specifica una destinazioni di dati che scrive su Amazon S3 nell'archiviazione a colonne di Apache Parquet.

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.

    Il nome di destinazione dati.

  • Inputs Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.

    I nodi che sono input per la destinazione di dati.

  • PartitionKeys— Una serie di stringhe. UTF-8

    Specifica il partizionamento nativo utilizzando una sequenza di chiavi.

  • Path Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #66

    Un singolo percorso Amazon S3 su cui scrivere.

  • Compression— UTF-8 stringa (valori validi: snappy="SNAPPY" | lzo="LZO" | gzip="GZIP" | brotli="BROTLI" | lz4="LZ4" | uncompressed="UNCOMPRESSED" |none="NONE").

    Specifica il modo in cui i dati sono compressi. In genere questo non è necessario se i dati hanno un'estensione del file standard. I valori possibili sono "gzip" e "bzip").

  • NumberTargetPartitions— UTF-8 stringa.

    Specifica il numero di partizioni di destinazione per i file Parquet durante la scrittura in Amazon S3 utilizzando AWS Glue.

  • SchemaChangePolicy: un oggetto DirectSchemaChangePolicy.

    Una policy che specifica i comportamenti di aggiornamento per il crawler.

  • AutoDataQuality: un oggetto AutoDataQuality.

    Specifica se abilitare automaticamente la valutazione della qualità dei dati per il target S3 AWS Glue Parquet. Se impostato su true, i controlli di qualità dei dati vengono eseguiti automaticamente durante l'operazione di scrittura.

CatalogSchemaChangePolicy struttura

Una policy che specifica i comportamenti di aggiornamento per il crawler.

Campi
  • EnableUpdateCatalog: booleano.

    Stabilisce se usare il comportamento di aggiornamento quando il crawler riscontra una variazione dello schema.

  • UpdateBehavior— UTF-8 stringa (valori validi: UPDATE_IN_DATABASE |LOG).

    Il comportamento di aggiornamento quando il crawler riscontra una variazione dello schema.

S3DirectTarget struttura

Specifica una destinazione di dati che scrive su Amazon S3.

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.

    Il nome di destinazione dati.

  • Inputs Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.

    I nodi che sono input per la destinazione di dati.

  • PartitionKeys— Una serie di stringhe. UTF-8

    Specifica il partizionamento nativo utilizzando una sequenza di chiavi.

  • Path Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #66

    Un singolo percorso Amazon S3 su cui scrivere.

  • Compression— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Specifica il modo in cui i dati sono compressi. In genere questo non è necessario se i dati hanno un'estensione del file standard. I valori possibili sono "gzip" e "bzip").

  • NumberTargetPartitions— UTF-8 stringa.

    Specifica il numero di partizioni di destinazione durante la scrittura dei dati direttamente in Amazon S3.

  • Format Obbligatorio: UTF-8 stringa (valori validi: json="JSON" csv="CSV" avro="AVRO" | orc="ORC" | | parquet="PARQUET" | hudi="HUDI" | delta="DELTA" | iceberg="ICEBERG" | hyper="HYPER" | |xml="XML").

    Specifica il formato di output dei dati per la destinazione.

  • SchemaChangePolicy: un oggetto DirectSchemaChangePolicy.

    Una policy che specifica i comportamenti di aggiornamento per il crawler.

  • AutoDataQuality: un oggetto AutoDataQuality.

    Specifica se abilitare automaticamente la valutazione della qualità dei dati per la destinazione diretta S3. Se impostato su true, i controlli di qualità dei dati vengono eseguiti automaticamente durante l'operazione di scrittura.

  • OutputSchemas: una matrice di oggetti GlueSchema.

    Specifica lo schema di dati per la destinazione diretta S3.

S3HudiCatalogTarget struttura

Specifica una destinazione che scrive su un'origine dati Hudi nel catalogo AWS Glue dati.

Campi
  • Name Obbligatoria: UTF-8 stringa, corrispondente a. Custom string pattern #68

    Il nome di destinazione dati.

  • Inputs Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.

    I nodi che sono input per la destinazione di dati.

  • PartitionKeys— Una serie di stringhe. UTF-8

    Specifica il partizionamento nativo utilizzando una sequenza di chiavi.

  • Table Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #66

    Il nome della tabella del database in cui scrivere.

  • Database Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome del database in cui scrivere.

  • AdditionalOptions - obbligatorio: una matrice della mappa di coppie chiave-valore.

    Ogni chiave è una UTF-8 stringa, corrispondente aCustom string pattern #66.

    Ogni valore è una UTF-8 stringa, corrispondente aCustom string pattern #66.

    Specifica le opzioni di connessione aggiuntive per il connettore.

  • SchemaChangePolicy: un oggetto CatalogSchemaChangePolicy.

    Una policy che specifica i comportamenti di aggiornamento per il crawler.

  • AutoDataQuality: un oggetto AutoDataQuality.

    Specifica se abilitare automaticamente la valutazione della qualità dei dati per il catalogo S3 Hudi di destinazione. Se impostato su true, i controlli di qualità dei dati vengono eseguiti automaticamente durante l'operazione di scrittura.

  • OutputSchemas: una matrice di oggetti GlueSchema.

    Specifica lo schema di dati per il catalogo S3 Hudi di destinazione.

S3HudiDirectTarget struttura

Specifica una destinazione che scrive su un'origine dati Hudi in. Amazon S3

Campi
  • Name Obbligatoria: UTF-8 stringa, corrispondente a. Custom string pattern #68

    Il nome di destinazione dati.

  • Inputs Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.

    I nodi che sono input per la destinazione di dati.

  • Path Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #66

    Il percorso Amazon S3 dell'origine dati Hudi su cui scrivere.

  • Compression Obbligatorio: UTF-8 stringa (valori validi: gzip="GZIP" lzo="LZO" | uncompressed="UNCOMPRESSED" | |snappy="SNAPPY").

    Specifica il modo in cui i dati sono compressi. In genere questo non è necessario se i dati hanno un'estensione del file standard. I valori possibili sono "gzip" e "bzip").

  • NumberTargetPartitions— UTF-8 stringa.

    Specifica il numero di partizioni della destinazione per la distribuzione dei file del set di dati Hudi in Amazon S3.

  • PartitionKeys— Una serie di UTF-8 stringhe.

    Specifica il partizionamento nativo utilizzando una sequenza di chiavi.

  • Format Obbligatorio: UTF-8 stringa (valori validi: json="JSON" csv="CSV" | avro="AVRO" | orc="ORC" | parquet="PARQUET" | | hudi="HUDI" | delta="DELTA" | iceberg="ICEBERG" | hyper="HYPER" |xml="XML").

    Specifica il formato di output dei dati per la destinazione.

  • AdditionalOptions - obbligatorio: una matrice della mappa di coppie chiave-valore.

    Ogni chiave è una UTF-8 stringa, corrispondente aCustom string pattern #66.

    Ogni valore è una UTF-8 stringa, corrispondente aCustom string pattern #66.

    Specifica le opzioni di connessione aggiuntive per il connettore.

  • SchemaChangePolicy: un oggetto DirectSchemaChangePolicy.

    Una policy che specifica i comportamenti di aggiornamento per il crawler.

  • AutoDataQuality: un oggetto AutoDataQuality.

    Specifica se abilitare automaticamente la valutazione della qualità dei dati per la destinazione diretta S3 Hudi. Se impostato su true, i controlli di qualità dei dati vengono eseguiti automaticamente durante l'operazione di scrittura.

S3DeltaCatalogTarget struttura

Specifica una destinazione che scrive su un'origine dati Delta Lake nel AWS Glue Data Catalog.

Campi
  • Name Obbligatoria: UTF-8 stringa, corrispondente a. Custom string pattern #68

    Il nome di destinazione dati.

  • Inputs Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.

    I nodi che sono input per la destinazione di dati.

  • PartitionKeys— Una serie di stringhe. UTF-8

    Specifica il partizionamento nativo utilizzando una sequenza di chiavi.

  • Table Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #66

    Il nome della tabella del database in cui scrivere.

  • Database Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome del database in cui scrivere.

  • AdditionalOptions: una matrice della mappa di coppie chiave-valore.

    Ogni chiave è una UTF-8 stringa, corrispondente aCustom string pattern #66.

    Ogni valore è una UTF-8 stringa, corrispondente aCustom string pattern #66.

    Specifica le opzioni di connessione aggiuntive per il connettore.

  • SchemaChangePolicy: un oggetto CatalogSchemaChangePolicy.

    Una policy che specifica i comportamenti di aggiornamento per il crawler.

  • AutoDataQuality: un oggetto AutoDataQuality.

    Specifica se abilitare automaticamente la valutazione della qualità dei dati per il catalogo S3 Delta di destinazione. Se impostato su true, i controlli di qualità dei dati vengono eseguiti automaticamente durante l'operazione di scrittura.

  • OutputSchemas: una matrice di oggetti GlueSchema.

    Specifica lo schema di dati per il catalogo S3 Delta di destinazione.

S3DeltaDirectTarget struttura

Specifica una destinazione che scrive su un'origine dati Delta Lake in Amazon S3.

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #68

    Il nome di destinazione dati.

  • Inputs Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.

    I nodi che sono input per la destinazione di dati.

  • PartitionKeys— Una serie di stringhe. UTF-8

    Specifica il partizionamento nativo utilizzando una sequenza di chiavi.

  • Path Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #66

    Il percorso Amazon S3 dell'origine dati Delta Lake su cui scrivere.

  • Compression Obbligatorio: UTF-8 stringa (valori validi: uncompressed="UNCOMPRESSED" |snappy="SNAPPY").

    Specifica il modo in cui i dati sono compressi. In genere questo non è necessario se i dati hanno un'estensione del file standard. I valori possibili sono "gzip" e "bzip").

  • NumberTargetPartitions— UTF-8 stringa.

    Specifica il numero di partizioni della destinazione per la distribuzione dei file del set di dati Delta Lake in Amazon S3.

  • Format Obbligatorio: UTF-8 stringa (valori validi: json="JSON" csv="CSV" avro="AVRO" | orc="ORC" | | parquet="PARQUET" | hudi="HUDI" | delta="DELTA" | iceberg="ICEBERG" | hyper="HYPER" | |xml="XML").

    Specifica il formato di output dei dati per la destinazione.

  • AdditionalOptions: una matrice della mappa di coppie chiave-valore.

    Ogni chiave è una UTF-8 stringa, corrispondente aCustom string pattern #66.

    Ogni valore è una UTF-8 stringa, corrispondente aCustom string pattern #66.

    Specifica le opzioni di connessione aggiuntive per il connettore.

  • SchemaChangePolicy: un oggetto DirectSchemaChangePolicy.

    Una policy che specifica i comportamenti di aggiornamento per il crawler.

  • AutoDataQuality: un oggetto AutoDataQuality.

    Specifica se abilitare automaticamente la valutazione della qualità dei dati per la destinazione diretta S3 Delta. Se impostato su true, i controlli di qualità dei dati vengono eseguiti automaticamente durante l'operazione di scrittura.

S3HyperDirectTarget struttura

Specifica un target di HyperDirect dati che scrive su Amazon S3.

Campi
  • Name Obbligatoria: UTF-8 stringa, corrispondente a. Custom string pattern #68

    L'identificatore univoco per il nodo HyperDirect di destinazione.

  • Inputs Obbligatorio: una matrice di UTF-8 stringhe, non meno di 1 o più di 1 stringa.

    Specifica la fonte di input per la destinazione. HyperDirect

  • Format— UTF-8 stringa (valori validi: json="JSON" | csv="CSV" | | avro="AVRO" | orc="ORC" | parquet="PARQUET" | hudi="HUDI" | delta="DELTA" | | iceberg="ICEBERG" hyper="HYPER" |xml="XML").

    Specifica il formato di output dei dati per la HyperDirect destinazione.

  • PartitionKeys— Una matrice di UTF-8 stringhe.

    Definisce la strategia di partizionamento per i dati di output.

  • Path Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #66

    La posizione S3 dove verranno scritti i dati di output.

  • Compression— UTF-8 stringa (valori validi:uncompressed="UNCOMPRESSED").

    Il tipo di compressione da applicare ai dati di output.

  • SchemaChangePolicy: un oggetto DirectSchemaChangePolicy.

    Definisce come vengono gestite le modifiche allo schema durante le operazioni di scrittura.

  • AutoDataQuality: un oggetto AutoDataQuality.

    Specifica se abilitare automaticamente la valutazione della qualità dei dati per la destinazione diretta S3 Hyper. Se impostato su true, i controlli di qualità dei dati vengono eseguiti automaticamente durante l'operazione di scrittura.

  • OutputSchemas: una matrice di oggetti GlueSchema.

    Specifica lo schema di dati per la destinazione diretta S3 Hyper.

S3IcebergDirectTarget struttura

Specifica una destinazione che scrive su un'origine dati Iceberg in Amazon S3.

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.

    Specifica l'identificatore univoco per il nodo di destinazione Iceberg nella pipeline di dati.

  • Inputs Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.

    Definisce la singola origine di input che fornisce i dati a questa destinazione Iceberg.

  • PartitionKeys— Una serie di stringhe. UTF-8

    Specifica le colonne utilizzate per partizionare i dati della tabella Iceberg in S3.

  • Path Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #66

    Definisce la posizione S3 in cui saranno archiviati i dati della tabella Iceberg.

  • Format Obbligatorio: UTF-8 stringa (valori validi: json="JSON" csv="CSV" avro="AVRO" | orc="ORC" | | parquet="PARQUET" | hudi="HUDI" | delta="DELTA" | iceberg="ICEBERG" | hyper="HYPER" | |xml="XML").

    Specifica il formato di file utilizzato per l'archiviazione dei dati della tabella Iceberg (ad es., Parquet, ORC).

  • AdditionalOptions: una matrice della mappa di coppie chiave-valore.

    Ogni chiave è una UTF-8 stringa, corrispondente aCustom string pattern #66.

    Ogni valore è una UTF-8 stringa, corrispondente aCustom string pattern #66.

    Fornisce opzioni di configurazione aggiuntive per la personalizzazione del comportamento della tabella Iceberg.

  • SchemaChangePolicy: un oggetto DirectSchemaChangePolicy.

    Definisce come vengono gestite le modifiche allo schema durante la scrittura dei dati nella tabella Iceberg.

  • Compression Obbligatorio: UTF-8 stringa (valori validi: gzip="GZIP" lzo="LZO" | uncompressed="UNCOMPRESSED" | |snappy="SNAPPY").

    Specifica il codec di compressione utilizzato per i file della tabella Iceberg in S3.

  • NumberTargetPartitions— UTF-8 stringa.

    Imposta il numero di partizioni della destinazione per la distribuzione dei file della tabella Iceberg in S3.

  • OutputSchemas: una matrice di oggetti GlueSchema.

    Specifica lo schema di dati per la destinazione diretta S3 Iceberg.

DirectSchemaChangePolicy struttura

Una policy che specifica i comportamenti di aggiornamento per il crawler.

Campi
  • EnableUpdateCatalog: booleano.

    Stabilisce se usare il comportamento di aggiornamento quando il crawler riscontra una variazione dello schema.

  • UpdateBehavior— UTF-8 stringa (valori validi: UPDATE_IN_DATABASE |LOG).

    Il comportamento di aggiornamento quando il crawler riscontra una variazione dello schema.

  • Table— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Specifica la tabella nel database a cui si applica la policy di modifica dello schema.

  • Database— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Specifica il database a cui si applica la policy di modifica dello schema.

ApplyMapping struttura

Specifica una trasformazione che mappa le chiavi delle proprietà dei dati nell'origine dei dati alle chiavi delle proprietà dei dati nella destinazione. È possibile rinominare le chiavi, modificare i tipi di dati per le chiavi e scegliere le chiavi da eliminare dal set di dati.

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.

    Il nome del nodo di trasformazione.

  • Inputs Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.

    Gli input di dati identificati dai nomi dei nodi.

  • Mapping - obbligatorio: una matrice di oggetti Mapping.

    Specifica la mappatura delle chiavi delle proprietà dei dati nell'origine dei dati alle chiavi delle proprietà dei dati nella destinazione.

Struttura mappatura

Specifica la mappatura delle chiavi della proprietà dati.

Campi
  • ToKey— UTF-8 stringa, corrispondente a. Custom string pattern #66

    Dopo l'applicazione della mappatura, quale dovrebbe essere il nome della colonna. Può coincidere con FromPath.

  • FromPath— Una serie di UTF-8 stringhe.

    La tabella o la colonna da modificare.

  • FromType— UTF-8 stringa, corrispondente a. Custom string pattern #66

    Il tipo di dati da modificare.

  • ToType— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Tipo di dati che devono essere modificati.

  • Dropped: booleano.

    Se è true, la colonna viene rimossa.

  • Children: una matrice di oggetti Mapping.

    Applicabile solo alle strutture dati nidificate. Se si desidera modificare la struttura padre, ma anche uno dei suoi figli, è possibile compilare questa struttura di dati. È anche Mapping, ma il suo FromPath sarà la struttura padre FromPath più il FromPath da questa struttura.

    Per la parte dei figli, supponiamo di avere la struttura:

    { "FromPath": "OuterStructure", "ToKey": "OuterStructure", "ToType": "Struct", "Dropped": false, "Chidlren": [{ "FromPath": "inner", "ToKey": "inner", "ToType": "Double", "Dropped": false, }] }

    Puoi specificare un Mapping con l'aspetto:

    { "FromPath": "OuterStructure", "ToKey": "OuterStructure", "ToType": "Struct", "Dropped": false, "Chidlren": [{ "FromPath": "inner", "ToKey": "inner", "ToType": "Double", "Dropped": false, }] }

SelectFields struttura

Specifica una trasformazione che sceglie le chiavi della proprietà dati che si desidera conservare.

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.

    Il nome del nodo di trasformazione.

  • Inputs Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.

    Gli input di dati identificati dai nomi dei nodi.

  • Paths Obbligatorio: una serie di stringhe. UTF-8

    Un percorso JSON a una variabile nella struttura dati.

DropFields struttura

Specifica una trasformazione che sceglie le chiavi della proprietà dati che si desidera eliminare.

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.

    Il nome del nodo di trasformazione.

  • Inputs Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.

    Gli input di dati identificati dai nomi dei nodi.

  • Paths Obbligatorio: una serie di stringhe. UTF-8

    Un percorso JSON a una variabile nella struttura dati.

RenameField struttura

Specifica una trasformazione che rinominerà una singola chiave di proprietà dati.

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.

    Il nome del nodo di trasformazione.

  • Inputs Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.

    Gli input di dati identificati dai nomi dei nodi.

  • SourcePath Obbligatorio: una serie di stringhe. UTF-8

    Un percorso JSON a una variabile nella struttura dati per i dati di origine.

  • TargetPath Obbligatorio: una serie di UTF-8 stringhe.

    Un percorso JSON a una variabile nella struttura dati per i dati di destinazione.

Struttura Spigot

Specifica una trasformazione che scrive campioni dei dati in un bucket Amazon S3.

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #68

    Il nome del nodo di trasformazione.

  • Inputs Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.

    Gli input di dati identificati dai nomi dei nodi.

  • Path Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #66

    Un percorso in Amazon S3 dove la trasformazione scriverà un sottoinsieme di registri dal set di dati in un file JSON in un bucket Amazon S3.

  • Topk: numero (intero), non superiore a 100.

    Specifica un numero di registri da scrivere a partire dall'inizio del set di dati.

  • Prob: numero (doppio), non superiore a 1.

    La probabilità (un valore decimale con un valore massimo di 1) di scegliere un determinato registro. Il valore 1 indica che ogni riga letta dal set di dati deve essere inclusa nell'output del campione.

Struttura join

Specifica una trasformazione che unisce due set di dati in un unico set di dati utilizzando una frase di confronto sulle chiavi di proprietà dei dati specificate. È possibile utilizzare inner, outer, left, right, left semi e left anti join.

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.

    Il nome del nodo di trasformazione.

  • Inputs Obbligatorio: una serie di UTF-8 stringhe, non meno di 2 o più di 2 stringhe.

    Gli input di dati identificati dai nomi dei nodi.

  • JoinType Obbligatorio: UTF-8 stringa (valori validi: equijoin="EQUIJOIN" | left="LEFT" | | right="RIGHT" | outer="OUTER" leftsemi="LEFT_SEMI" |leftanti="LEFT_ANTI").

    Specifica il tipo di join da eseguire sui set di dati.

  • Columns - obbligatorio: una matrice di oggetti JoinColumn, non inferiore a o superiore a 2 strutture.

    Un elenco delle due colonne da unire.

JoinColumn struttura

Specifica una colonna da unire.

Campi
  • From Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    La colonna da unire.

  • Keys Obbligatorio: una serie di UTF-8 stringhe.

    La chiave della colonna da unire.

SplitFields struttura

Specifica una trasformazione che divide le chiavi della proprietà dati in due DynamicFrames. L'output è una raccolta di DynamicFrames: uno con le chiavi di proprietà dei dati selezionate e uno con le chiavi di proprietà dei dati rimanenti.

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.

    Il nome del nodo di trasformazione.

  • Inputs Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.

    Gli input di dati identificati dai nomi dei nodi.

  • Paths Obbligatorio: una serie di stringhe. UTF-8

    Un percorso JSON a una variabile nella struttura dati.

SelectFromCollection struttura

Specifica una trasformazione che sceglie un DynamicFrame da una raccolta di DynamicFrames. L'output è il DynamicFrame selezionato

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.

    Il nome del nodo di trasformazione.

  • Inputs Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.

    Gli input di dati identificati dai nomi dei nodi.

  • Index - obbligatorio: numero (intero).

    L'indice per il file DynamicFrame da selezionare.

FillMissingValues struttura

Specifica una trasformazione che individua i registri nel set di dati che hanno valori mancanti e aggiunge un nuovo campo con un valore determinato dall'imputazione. Il set di dati di input viene utilizzato per addestrare il modello di machine learning che determina quale dovrebbe essere il valore mancante.

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.

    Il nome del nodo di trasformazione.

  • Inputs Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.

    Gli input di dati identificati dai nomi dei nodi.

  • ImputedPath Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #66

    Un percorso JSON a una variabile nella struttura dati per il set di dati imputato.

  • FilledPath— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Un percorso JSON a una variabile nella struttura dati per il set di dati compilato.

Struttura filtro

Specifica una trasformazione che divide un set di dati in due, in base a una condizione di filtro.

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.

    Il nome del nodo di trasformazione.

  • Inputs Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.

    Gli input di dati identificati dai nomi dei nodi.

  • LogicalOperator Obbligatorio: UTF-8 stringa (valori validi: AND |OR).

    L'operatore utilizzato per filtrare le righe confrontando il valore chiave con un valore specificato.

  • Filters - obbligatorio: una matrice di oggetti FilterExpression.

    Specifica un'espressione di filtro.

FilterExpression struttura

Specifica un'espressione di filtro.

Campi
  • Operation Obbligatorio: UTF-8 stringa (valori validi: EQ LT | GT | LTE | GTE | REGEX | |ISNULL).

    Tipo di operazione da eseguire nell'espressione.

  • Negated: booleano.

    Se l'espressione deve essere negata.

  • Values - obbligatorio: una matrice di oggetti FilterValue.

    Un elenco di valori di filtro.

FilterValue struttura

Rappresenta un'unica voce nell'elenco di valori di un FilterExpression.

Campi
  • Type Obbligatorio: UTF-8 stringa (valori validi: COLUMNEXTRACTED |CONSTANT).

    Il tipo di valore del filtro.

  • Value Obbligatorio: una matrice di UTF-8 stringhe.

    Il valore da associare.

CustomCode struttura

Specifica una trasformazione che utilizza il codice personalizzato fornito per eseguire la trasformazione dei dati. L'output è una raccolta di DynamicFrames.

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.

    Il nome del nodo di trasformazione.

  • Inputs Obbligatorio: una matrice di UTF-8 stringhe, almeno 1 stringa.

    Gli input di dati identificati dai nomi dei nodi.

  • Code Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #59

    Il codice personalizzato utilizzato per eseguire la trasformazione dei dati.

  • ClassName Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome definito per la classe del nodo di codice personalizzato.

  • OutputSchemas: una matrice di oggetti GlueSchema.

    Specifica lo schema di dati per la trasformazione del codice personalizzata.

Struttura SparkSQL

Specifica una trasformazione in cui si inserisce una query SQL utilizzando la sintassi Spark SQL per trasformare i dati. L'output è un singolo DynamicFrame.

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.

    Il nome del nodo di trasformazione.

  • Inputs Obbligatorio: una matrice di UTF-8 stringhe, almeno 1 stringa.

    Gli input di dati identificati dai nomi dei nodi. È possibile associare un nome di tabella a ciascun nodo di input da utilizzare nella query SQL. Il nome scelto deve soddisfare le restrizioni sui nomi di Spark SQL.

  • SqlQuery Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #67

    Query SQL che deve utilizzare la sintassi Spark SQL e restituire un singolo set di dati.

  • SqlAliases - obbligatorio: una matrice di oggetti SqlAlias.

    Un elenco di alias. Un alias permette di specificare il nome da utilizzare nell'SQL per un determinato input. Ad esempio, hai un'origine dati denominata "». MyDataSource Se specifichi From as MyDataSource e Alias as SqlName, nel tuo SQL puoi fare:

    select * from SqlName

    e questo ottiene dati da MyDataSource.

  • OutputSchemas: una matrice di oggetti GlueSchema.

    Specifica lo schema di dati per la trasformazione SparkSQL.

SqlAlias struttura

Rappresenta un'unica voce nell'elenco di valori per SqlAliases.

Campi
  • From Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #65.

    Una tabella o una colonna in una tabella.

  • Alias Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Un nome temporaneo dato a una tabella o a una colonna in una tabella.

DropNullFields struttura

Specifica una trasformazione che rimuove le colonne dal set di dati se tutti i valori nella colonna sono “null”. Per impostazione predefinita, AWS Glue Studio riconoscerà gli oggetti nulli, ma alcuni valori come stringhe vuote, stringhe «nulle», numeri interi -1 o altri segnaposto come gli zeri, non vengono riconosciuti automaticamente come nulli.

Campi
  • Name— Obbligatorio: stringa, corrispondente a. UTF-8 Custom string pattern #68

    Il nome del nodo di trasformazione.

  • Inputs Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.

    Gli input di dati identificati dai nomi dei nodi.

  • NullCheckBoxList: un oggetto NullCheckBoxList.

    Struttura che indica se determinati valori siano riconosciuti come valori nulli per la rimozione.

  • NullTextList: una matrice di oggetti NullValueField, non superiore a 50 strutture.

    Una struttura che specifica un elenco di NullValueField strutture che rappresentano un valore nullo personalizzato come zero o un altro valore utilizzato come segnaposto nullo univoco per il set di dati.

    La trasformazione DropNullFields rimuove i valori nulli personalizzati solo se sia il valore del segnaposto null che il tipo di dati corrispondono ai dati.

NullCheckBoxList struttura

Indica se alcuni valori siano riconosciuti come valori nulli per la rimozione.

Campi
  • IsEmpty: booleano.

    Specifica che una stringa vuota è considerata un valore nullo.

  • IsNullString: booleano.

    Specifica che un valore che indica la parola “null” è considerato un valore nullo.

  • IsNegOne: booleano.

    Specifica che un valore intero di -1 è considerato un valore nullo.

NullValueField struttura

Rappresenta un valore nullo personalizzato, ad esempio uno zero o un altro valore utilizzato come segnaposto nullo univoco per il set di dati.

Campi
  • Value Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il valore del segnaposto nullo.

  • Datatype - obbligatorio: un oggetto DataType.

    Il tipo di dati del valore.

Struttura Datatype

Struttura che rappresenta il tipo di dati del valore.

Campi

Struttura Merge

Specifica una trasformazione che unisce DynamicFrame a con un DynamicFrame di staging basato sulle chiavi primarie specificate per identificare i registri. I registri duplicati (registri con le stesse chiavi primarie) non vengono deduplicati.

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.

    Il nome del nodo di trasformazione.

  • Inputs Obbligatorio: una serie di UTF-8 stringhe, non meno di 2 o più di 2 stringhe.

    Gli input di dati identificati dai nomi dei nodi.

  • Source Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #65

    L'origine DynamicFrame che sarà unita a DynamicFrame di staging.

  • PrimaryKeys Obbligatorio: una serie di UTF-8 stringhe.

    L'elenco dei campi chiave primaria per abbinare i registri dall'origine e dai frame dinamici di staging.

Struttura unione

Specifica una trasformazione che combina le righe di due o più set di dati in un unico risultato.

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #68

    Il nome del nodo di trasformazione.

  • Inputs Obbligatorio: una serie di UTF-8 stringhe, non meno di 2 o più di 2 stringhe.

    L'ID del nodo immette la trasformazione.

  • UnionType Obbligatorio: UTF-8 stringa (valori validi: ALL |DISTINCT).

    Indica il tipo di trasformazione Union.

    Specifica ALL di unire tutte le righe dalle origini dati a quelle risultanti DynamicFrame. L'unione risultante non rimuove le righe duplicate.

    Specifica DISTINCT di rimuovere le righe duplicate nel risultato. DynamicFrame

Struttura PIIDetection

Specifica una trasformazione che identifica, rimuove o maschera i dati PII.

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #68

    Il nome del nodo di trasformazione.

  • Inputs Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.

    L'ID del nodo immette la trasformazione.

  • PiiType Obbligatorio: UTF-8 stringa (valori validi: RowAudit | RowHashing | | RowMasking | RowPartialMasking | ColumnAudit ColumnHashing |ColumnMasking).

    Indica il tipo di trasformazione PIIDetection.

  • EntityTypesToDetect Obbligatorio: una serie di UTF-8 stringhe.

    Indica i tipi di entità che la trasformazione PIIDetection identificherà come dati PII.

    Le entità di tipo PII includono: PERSON_NAME, DATE, USA_SNN, EMAIL, USA_ITIN, USA_PASSPORT_NUMBER, PHONE_NUMBER, BANK_ACCOUNT, IP_ADDRESS, MAC_ADDRESS, USA_CPT_CODE, USA_HCPCS_CODE, USA_NATIONAL_DRUG_CODE, USA_MEDICARE_BENEFICIARY_IDENTIFIER, USA_HEALTH_INSURANCE_CLAIM_NUMBER,CREDIT_CARD,USA_NATIONAL_PROVIDER_IDENTIFIER,USA_DEA_NUMBER,USA_DRIVING_LICENSE

  • OutputColumnName— UTF-8 stringa, corrispondente a. Custom string pattern #66

    Indica il nome della colonna di output che conterrà qualsiasi tipo di entità rilevato in quella riga.

  • SampleFraction: numero (doppio), non superiore a 1.

    Indica la frazione dei dati da campionare durante la scansione di entità PII.

  • ThresholdFraction: numero (doppio), non superiore a 1.

    Indica la frazione dei dati che devono essere soddisfatti per identificare una colonna come dati PII.

  • MaskValue— UTF-8 stringa, lunga non più di 256 byte, corrispondente a. Custom string pattern #63

    Indica il valore che sostituirà l'entità rilevata.

  • RedactText— UTF-8 stringa, corrispondente a. Custom string pattern #66

    Specifica se oscurare il testo contenente informazioni di identificazione personale (PII) rilevato. Se impostato su true, il contenuto con PII viene sostituito con caratteri di redazione.

  • RedactChar— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il carattere utilizzato per sostituire il contenuto con PII rilevato quando è attivato l'oscuramento. Il carattere di redazione predefinito è *.

  • MatchPattern— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Un modello di espressione regolare utilizzato per identificare il contenuto con PII aggiuntivo oltre gli algoritmi di rilevamento standard.

  • NumLeftCharsToExclude: numero (intero).

    Il numero di caratteri da escludere dalla redazione a sinistra del contenuto con PII rilevato. In questo modo è possibile preservare il contesto attorno ai dati sensibili.

  • NumRightCharsToExclude: numero (intero).

    Il numero di caratteri da escludere dalla redazione a destra del contenuto con PII rilevato. In questo modo è possibile preservare il contesto attorno ai dati sensibili.

  • DetectionParameters— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Parametri aggiuntivi per la configurazione del comportamento di rilevamento delle PII e delle impostazioni di sensibilità.

  • DetectionSensitivity— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il livello di sensibilità per il rilevamento delle PII. Livelli di sensibilità più elevati rilevano più PII potenziali, ma possono dare luogo a più falsi positivi.

Struttura aggregata

Specifica una trasformazione che raggruppa le righe in base ai campi scelti e calcola il valore aggregato in base alla funzione specificata.

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.

    Il nome del nodo di trasformazione.

  • Inputs Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.

    Specifica i campi e le righe da utilizzare come input per la trasformazione aggregata.

  • Groups Obbligatorio: una serie di stringhe. UTF-8

    Specifica i campi in base ai quali raggruppare.

  • Aggs - obbligatorio: una matrice di oggetti AggregateOperation, non meno di 1 o più di 30 strutture.

    Specifica le funzioni di aggregazione da eseguire su campi specificati.

DropDuplicates struttura

Specifica una trasformazione che rimuove le righe di dati ripetuti da un set di dati.

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.

    Il nome del nodo di trasformazione.

  • Inputs Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.

    Gli input di dati identificati dai nomi dei nodi.

  • Columns— Una serie di stringhe. UTF-8

    Il nome delle colonne da unire o rimuovere in caso di ripetizione.

GovernedCatalogTarget struttura

Specifica un target di dati che scrive su Amazon S3 utilizzando il AWS Glue Data Catalog.

Campi
  • Name Obbligatoria: UTF-8 stringa, corrispondente a. Custom string pattern #68

    Il nome di destinazione dati.

  • Inputs Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.

    I nodi che sono input per la destinazione di dati.

  • PartitionKeys— Una serie di stringhe. UTF-8

    Specifica il partizionamento nativo utilizzando una sequenza di chiavi.

  • Table Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #66

    Il nome della tabella del database in cui scrivere.

  • Database Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome del database in cui scrivere.

  • SchemaChangePolicy: un oggetto CatalogSchemaChangePolicy.

    Una policy che specifica il comportamento di aggiornamento per il catalogo governato.

GovernedCatalogSource struttura

Specifica l'archivio dati nel catalogo AWS Glue dati governato.

Campi
  • Name Obbligatoria: UTF-8 stringa, corrispondente a. Custom string pattern #68

    Il nome del archivio dati.

  • Database Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il database da cui leggere.

  • Table Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    La tabella del database da cui leggere.

  • PartitionPredicate— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Le partizioni che soddisfano questo predicato vengono eliminate. I file all'interno del periodo di conservazione in queste partizioni non vengono eliminati. Impostato su "": vuoto per impostazione predefinita.

  • AdditionalOptions: un oggetto S3SourceAdditionalOptions.

    Specifica opzioni di connessione aggiuntive.

AggregateOperation struttura

Specifica il set di parametri necessari per eseguire l'aggregazione nella trasformazione di aggregazione.

Campi
  • Column Obbligatorio: una serie di UTF-8 stringhe.

    Specifica la colonna sul set di dati su cui verrà applicata la funzione di aggregazione.

  • AggFunc Obbligatorio: UTF-8 stringa (valori validi: avg countDistinct count | first | last | kurtosis | | max | min | skewness | stddev_samp | stddev_pop | sum | | sumDistinct var_samp |var_pop).

    Specifica la funzione di aggregazione da applicare.

    Le possibili funzioni di aggregazione includono: avg countDistinct, count, first, last, kurtosis, max, min, skewness, stddev_samp, stddev_pop, sum, sumDistinct, var_samp, var_pop

GlueSchema struttura

Specifica uno schema definito dall'utente quando uno schema non può essere determinato da AWS Glue.

Campi
  • Columns: una matrice di oggetti GlueStudioSchemaColumn.

    Specifica le definizioni delle colonne che costituiscono uno AWS Glue schema.

GlueStudioSchemaColumn struttura

Specifica una singola colonna in una definizione AWS Glue dello schema.

Campi
  • Name UTF-8 Obbligatoria: stringa, lunga non più di 1024 byte, corrispondente a. Single-line string pattern

    Il nome della colonna nello schema di AWS Glue Studio.

  • Type— UTF-8 stringa, lunga non più di 131072 byte, corrispondente a. Single-line string pattern

    Il tipo di hive per questa colonna nello schema di Studio. AWS Glue

  • GlueStudioType— UTF-8 stringa, lunga non più di 131072 byte, corrispondente a. Single-line string pattern

    Il tipo di dati della colonna come definito in Studio. AWS Glue

GlueStudioColumn struttura

Specifica una singola colonna in AWS Glue Studio.

Campi
  • Key Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #66

    La chiave della colonna in AWS Glue Studio.

  • FullPath Obbligatorio: una serie di UTF-8 stringhe.

    L'URL completo della colonna in AWS Glue Studio.

  • Type Obbligatorio: UTF-8 stringa (valori validi: array="ARRAY" bigint="BIGINT" bigint array="BIGINT_ARRAY" binary="BINARY" | binary array="BINARY_ARRAY" | boolean="BOOLEAN" | boolean array="BOOLEAN_ARRAY" | byte="BYTE" | byte array="BYTE_ARRAY" | char="CHAR" | char array="CHAR_ARRAY" | choice="CHOICE" | choice array="CHOICE_ARRAY" | date="DATE" | date array="DATE_ARRAY" | decimal="DECIMAL" | decimal array="DECIMAL_ARRAY" | double="DOUBLE" | double array="DOUBLE_ARRAY" | enum="ENUM" | enum array="ENUM_ARRAY" | float="FLOAT" | | float array="FLOAT_ARRAY" | int="INT" | int array="INT_ARRAY" | interval="INTERVAL" | interval array="INTERVAL_ARRAY" | long="LONG" | long array="LONG_ARRAY" | object="OBJECT" | short="SHORT" | short array="SHORT_ARRAY" | smallint="SMALLINT"| smallint array="SMALLINT_ARRAY" | string="STRING" | string array="STRING_ARRAY" | timestamp="TIMESTAMP" | timestamp array="TIMESTAMP_ARRAY" | tinyint="TINYINT" | | tinyint array="TINYINT_ARRAY" | varchar="VARCHAR" | varchar array="VARCHAR_ARRAY" | null="NULL" | unknown="UNKNOWN" |unknown array="UNKNOWN_ARRAY").

    Il tipo di colonna in AWS Glue Studio.

  • Children: un array di strutture.

    I figli della colonna principale in AWS Glue Studio.

  • GlueStudioType— UTF-8 stringa (valori validi: array="ARRAY" bigint="BIGINT" | bigint array="BIGINT_ARRAY" | binary="BINARY" | binary array="BINARY_ARRAY" | boolean="BOOLEAN" | boolean array="BOOLEAN_ARRAY" | byte="BYTE" | byte array="BYTE_ARRAY" | char="CHAR" | char array="CHAR_ARRAY" | choice="CHOICE" | choice array="CHOICE_ARRAY" | date="DATE" date array="DATE_ARRAY" | decimal="DECIMAL" | decimal array="DECIMAL_ARRAY" | double="DOUBLE" | double array="DOUBLE_ARRAY" | enum="ENUM" | enum array="ENUM_ARRAY" | float="FLOAT" | float array="FLOAT_ARRAY" | int="INT" | int array="INT_ARRAY" | interval="INTERVAL" | interval array="INTERVAL_ARRAY" | long="LONG" | long array="LONG_ARRAY" | object="OBJECT" | short="SHORT" | short array="SHORT_ARRAY" | smallint="SMALLINT" | smallint array="SMALLINT_ARRAY" | string="STRING"| string array="STRING_ARRAY" | timestamp="TIMESTAMP" | timestamp array="TIMESTAMP_ARRAY" | tinyint="TINYINT" | tinyint array="TINYINT_ARRAY" | | varchar="VARCHAR" | varchar array="VARCHAR_ARRAY" | null="NULL" | unknown="UNKNOWN" |unknown array="UNKNOWN_ARRAY").

    Il tipo di dati della colonna come definito in AWS Glue Studio.

DynamicTransform struttura

Specifica il set di parametri necessari per eseguire la trasformazione dinamica.

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Specifica il nome della trasformazione dinamica.

  • TransformName Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Specifica il nome della trasformazione dinamica così come appare nell'editor visuale di AWS Glue Studio.

  • Inputs Obbligatorio: una matrice di UTF-8 stringhe, non meno di 1 o più di 1 stringa.

    Specifica gli input necessari per la trasformazione dinamica.

  • Parameters: una matrice di oggetti TransformConfigParameter.

    Specifica i parametri della trasformazione dinamica.

  • FunctionName Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #66

    Specifica il nome della funzione della trasformazione dinamica.

  • Path Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Specifica il percorso dei file sorgente e di configurazione della trasformazione dinamica.

  • Version— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Questo campo non è utilizzato e verrà dichiarato obsoleto in una versione futura.

  • OutputSchemas: una matrice di oggetti GlueSchema.

    Specifica lo schema di dati per la trasformazione dinamica.

TransformConfigParameter struttura

Specifica i parametri nel file di configurazione della trasformazione dinamica.

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Specifica il nome del parametro nel file di configurazione della trasformazione dinamica.

  • Type Obbligatorio: UTF-8 stringa (valori validi: str="STR" int="INT" | float="FLOAT" | complex="COMPLEX" | bool="BOOL" | list="LIST" | |null="NULL").

    Specifica il tipo di parametro nel file di configurazione della trasformazione dinamica.

  • ValidationRule— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Specifica la regola di convalida nel file di configurazione della trasformazione dinamica.

  • ValidationMessage— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Specifica il messaggio di convalida nel file di configurazione della trasformazione dinamica.

  • Value— Una serie di UTF-8 stringhe.

    Specifica il valore del parametro nel file di configurazione della trasformazione dinamica.

  • ListType— UTF-8 stringa (valori validi: str="STR" | int="INT" | float="FLOAT" | complex="COMPLEX" | | bool="BOOL" list="LIST" |null="NULL").

    Specifica il tipo di elenco del parametro nel file di configurazione della trasformazione dinamica.

  • IsOptional: booleano.

    Specifica se il parametro è facoltativo o meno nel file di configurazione della trasformazione dinamica.

EvaluateDataQuality struttura

Specifica i criteri di valutazione della qualità dei dati.

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.

    Il nome della valutazione della qualità dei dati.

  • Inputs Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.

    Gli input della valutazione della qualità dei dati.

  • Ruleset UTF-8 Obbligatoria: stringa, lunga non meno di 1 o più di 65536 byte, corrispondente al. Custom string pattern #64

    Il set di regole per la valutazione della qualità dei dati.

  • Output— UTF-8 stringa (valori validi: PrimaryInput |EvaluationResults).

    L'output della valutazione della qualità dei dati.

  • PublishingOptions: un oggetto DQResultsPublishingOptions.

    Opzioni per configurare la modalità di pubblicazione dei risultati.

  • StopJobOnFailureOptions: un oggetto DQStopJobOnFailureOptions.

    Opzioni per configurare come si interromperà il processo se la valutazione della qualità dei dati fallisce.

DQResultsPublishingOptions struttura

Opzioni per configurare la modalità di pubblicazione dei risultati della valutazione della qualità dei dati.

Campi
  • EvaluationContext— UTF-8 stringa, corrispondente aCustom string pattern #65.

    Il contesto della valutazione.

  • ResultsS3Prefix— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il prefisso Amazon S3 aggiunto all'inizio dei risultati.

  • CloudWatchMetricsEnabled: booleano.

    Abilita i parametri per i risultati della qualità dei dati.

  • ResultsPublishingEnabled: booleano.

    Abilita la pubblicazione per i risultati della qualità dei dati.

DQStopJobOnFailureOptions struttura

Opzioni per configurare come si interromperà il processo se la valutazione della qualità dei dati fallisce.

Campi
  • StopJobOnFailureTiming— UTF-8 stringa (valori validi: Immediate |AfterDataLoad).

    Quando interrompere il processo se la valutazione della qualità dei dati fallisce. Le opzioni sono Immediate o AfterDataLoad.

EvaluateDataQualityMultiFrame struttura

Specifica i criteri di valutazione della qualità dei dati.

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.

    Il nome della valutazione della qualità dei dati.

  • Inputs Obbligatorio: una matrice di UTF-8 stringhe, almeno 1 stringa.

    Gli input della valutazione della qualità dei dati. Il primo input in questo elenco è l'origine dati primaria.

  • AdditionalDataSources: una matrice della mappa di coppie chiave-valore.

    Ogni chiave è una UTF-8 stringa, corrispondente a. Custom string pattern #68

    Ogni valore è una UTF-8 stringa, corrispondente aCustom string pattern #66.

    Gli alias di tutte le origini dati, tranne quella primaria.

  • Ruleset UTF-8 Obbligatoria: stringa, lunga non meno di 1 o più di 65536 byte, corrispondente al. Custom string pattern #64

    Il set di regole per la valutazione della qualità dei dati.

  • PublishingOptions: un oggetto DQResultsPublishingOptions.

    Opzioni per configurare la modalità di pubblicazione dei risultati.

  • AdditionalOptions: una matrice della mappa di coppie chiave-valore.

    Ogni chiave è una UTF-8 stringa (valori validi: performanceTuning.caching="CacheOption" | observations.scope="ObservationsOption" |compositeRuleEvaluation.method="CompositeOption").

    Ogni valore è una UTF-8 stringa.

    Opzioni per configurare il comportamento di runtime della trasformazione.

  • StopJobOnFailureOptions: un oggetto DQStopJobOnFailureOptions.

    Opzioni per configurare come si interromperà il processo se la valutazione della qualità dei dati fallisce.

Struttura Recipe

Un nodo di AWS Glue Studio che utilizza una AWS Glue DataBrew ricetta nei AWS Glue lavori.

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.

    Il nome del nodo AWS Glue Studio.

  • Inputs Obbligatorio: una matrice di UTF-8 stringhe, non meno di 1 o più di 1 stringa.

    I nodi che costituiscono gli input del nodo della ricetta, identificati dal rispettivo ID.

  • RecipeReference: un oggetto RecipeReference.

    Un riferimento alla DataBrew ricetta utilizzata dal nodo.

  • RecipeSteps: una matrice di oggetti RecipeStep.

    Passaggi di trasformazione utilizzati nel nodo della ricetta.

RecipeReference struttura

Un riferimento a una AWS Glue DataBrew ricetta.

Campi
  • RecipeArn Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    L'ARN della DataBrew ricetta.

  • RecipeVersion Richiesto: UTF-8 stringa di lunghezza non inferiore a 1 o superiore a 16 byte.

    Il RecipeVersion valore della DataBrew ricetta.

SnowflakeNodeData struttura

Specifica la configurazione per i nodi Snowflake in Studio. AWS Glue

Campi
  • SourceType— UTF-8 stringa, corrispondente a. Custom string pattern #65

    Specifica come vengono specificati i dati recuperati. Valori validi: "table", "query".

  • Connection: un oggetto Opzione.

    Specifica una connessione al catalogo AWS Glue dati a un endpoint Snowflake.

  • Schema— UTF-8 stringa.

    Specifica uno schema di database Snowflake da utilizzare per il nodo.

  • Table— UTF-8 corda.

    Specifica una tabella Snowflake da utilizzare per il nodo.

  • Database— UTF-8 corda.

    Specifica un database Snowflake da utilizzare per il nodo.

  • TempDir— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Attualmente non utilizzato.

  • IamRole: un oggetto Opzione.

    Attualmente non utilizzato.

  • AdditionalOptions: una matrice della mappa di coppie chiave-valore.

    Ogni chiave è una UTF-8 stringa, corrispondente aCustom string pattern #66.

    Ogni valore è una UTF-8 stringa, corrispondente aCustom string pattern #66.

    Specifica le opzioni aggiuntive trasmesse al connettore Snowflake. Se altre opzioni sono specificate altrove in questo nodo, esse avranno la precedenza.

  • SampleQuery— UTF-8 stringa.

    Una stringa SQL utilizzata per recuperare i dati con il tipo di origine query.

  • PreAction— UTF-8 corda.

    Una stringa SQL eseguita prima che il connettore Snowflake esegua le operazioni standard.

  • PostAction— UTF-8 corda.

    Una stringa SQL eseguita dopo che il connettore Snowflake esegua le operazioni standard.

  • Action— UTF-8 corda.

    Specifica l'operazione da intraprendere quando si scrive su una tabella con dati preesistenti. Valori validi: append, merge, truncate, drop.

  • Upsert: booleano.

    Utilizzato quando Operazione è append. Specifica il comportamento di risoluzione quando esiste già una riga. Se impostato su true, le righe preesistenti verranno aggiornate. Se false, verranno inserite quelle righe.

  • MergeAction— UTF-8 stringa, corrispondente aCustom string pattern #65.

    Specifica un'operazione di unione. Valori validi: simple, custom. Se semplice, il comportamento di unione è definito da MergeWhenMatched e MergeWhenNotMatched. Se personalizzato, definito da MergeClause.

  • MergeWhenMatched— UTF-8 stringa, corrispondente aCustom string pattern #65.

    Specifica come risolvere i record che corrispondono a dati preesistenti durante l'unione. Valori validi: update, delete.

  • MergeWhenNotMatched— UTF-8 stringa, corrispondente aCustom string pattern #65.

    Specifica come elaborare i record che non corrispondono a dati preesistenti durante l'unione. Valori validi: insert, none.

  • MergeClause— UTF-8 stringa.

    Un'istruzione SQL che specifica un comportamento di merge personalizzato.

  • StagingTable— UTF-8 corda.

    Il nome di una tabella intermedia utilizzata durante le operazioni merge o append con upsert. I dati vengono scritti in questa tabella, quindi spostati in table da un'azione successiva (PostAction) generata.

  • SelectedColumns: una matrice di oggetti Opzione.

    Specifica le colonne combinate per identificare un record quando vengono rilevate corrispondenze per i merge e gli upsert. Un elenco di strutture con chiavi value, label e description. Ogni struttura descrive una colonna.

  • AutoPushdown: booleano.

    Specifica se il pushdown automatico delle query è abilitato. Se il pushdown è abilitato, quando su Spark viene eseguita una query, se una parte di essa può essere "trasferita" al server Snowflake, viene sottoposta a pushdown. Ciò migliora le prestazioni di alcune query.

  • TableSchema: una matrice di oggetti Opzione.

    Definisce manualmente lo schema di destinazione per il nodo. Un elenco di strutture con chiavi value, label e description. Ogni struttura definisce una colonna.

SnowflakeSource struttura

Specifica un'origine dati Snowflake.

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.

    Il nome dell'origine dati Snowflake.

  • Data - obbligatorio: un oggetto SnowflakeNodeData.

    Configurazione per l'origine dati Snowflake.

  • OutputSchemas: una matrice di oggetti GlueSchema.

    Specifica gli schemi definiti dall'utente per i dati di output.

SnowflakeTarget struttura

Specifica una destinazione Snowflake.

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.

    Il nome della destinazione Snowflake.

  • Data - obbligatorio: un oggetto SnowflakeNodeData.

    Specifica i dati del nodo di destinazione Snowflake.

  • Inputs— Una matrice di UTF-8 stringhe, non meno di 1 o più di 1 stringa.

    I nodi che sono input per la destinazione di dati.

ConnectorDataSource struttura

Specifica un'origine generata con opzioni di connessione standard.

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.

    Il nome del nodo di origine.

  • ConnectionType Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    IlconnectionType, come fornito alla AWS Glue libreria sottostante. Il tipo di nodo supporta i tipi di connessione seguenti:

    • opensearch

    • azuresql

    • azurecosmos

    • bigquery

    • saphana

    • teradata

    • vertica

  • Data - obbligatorio: una matrice della mappa di coppie chiave-valore.

    Ogni chiave è una UTF-8 stringa.

    Ogni valore è una UTF-8 stringa.

    Una mappa che specifica le opzioni di connessione per il nodo. Le opzioni di connessione standard per il tipo di connessione corrispondente sono disponibili nella sezione Parametri di connessione della AWS Glue documentazione.

  • OutputSchemas: una matrice di oggetti GlueSchema.

    Specifica lo schema di dati per questa origine.

ConnectorDataTarget struttura

Specifica un a destinazione generata con opzioni di connessione standard.

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.

    Il nome del nodo di destinazione.

  • ConnectionType Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    IlconnectionType, come fornito alla AWS Glue libreria sottostante. Il tipo di nodo supporta i tipi di connessione seguenti:

    • opensearch

    • azuresql

    • azurecosmos

    • bigquery

    • saphana

    • teradata

    • vertica

  • Data - obbligatorio: una matrice della mappa di coppie chiave-valore.

    Ogni chiave è una UTF-8 stringa.

    Ogni valore è una UTF-8 stringa.

    Una mappa che specifica le opzioni di connessione per il nodo. Le opzioni di connessione standard per il tipo di connessione corrispondente sono disponibili nella sezione Parametri di connessione della AWS Glue documentazione.

  • Inputs— Una matrice di UTF-8 stringhe, non meno di 1 o più di 1 stringa.

    I nodi che sono input per la destinazione di dati.

RecipeStep struttura

Una fase di ricetta utilizzata in un nodo di ricetta per la preparazione dei dati di AWS Glue Studio.

Campi
  • Action - obbligatorio: un oggetto RecipeAction.

    L'operazione di trasformazione del passaggio della ricetta.

  • ConditionExpressions: una matrice di oggetti ConditionExpression.

    Le espressioni di condizione per il passaggio della ricetta.

RecipeAction struttura

Azioni definite nel nodo delle ricette di preparazione dei dati di AWS Glue Studio.

Campi
  • Operation UTF-8 Obbligatoria: stringa, lunga non meno di 1 o più di 128 byte, corrispondente a. Custom string pattern #61

    Il funzionamento dell'operazione della ricetta.

  • Parameters: una matrice della mappa di coppie chiave-valore.

    Ogni chiave è una UTF-8 stringa, lunga non meno di 1 o più di 128 byte, corrispondente al. Custom string pattern #62

    Ogni valore è una UTF-8 stringa di lunghezza non inferiore a 1 o superiore a 32768 byte.

    I parametri dell'operazione della ricetta.

ConditionExpression struttura

Espressione di condizione definita nel nodo della ricetta per la preparazione dei dati di AWS Glue Studio.

Campi
  • Condition UTF-8 Obbligatoria: stringa, lunga non meno di 1 o più di 128 byte, corrispondente a. Custom string pattern #61

    La condizione dell'espressione di condizione.

  • Value— UTF-8 stringa, lunga non più di 1024 byte.

    Il valore dell'espressione di condizione.

  • TargetColumn Obbligatoria: UTF-8 stringa, lunga non meno di 1 o più di 1024 byte.

    La colonna di destinazione delle espressioni di condizione.

S3CatalogIcebergSource struttura

Specifica un'origine dati Apache Iceberg registrata nel Data Catalog. AWS Glue L'origine dati Iceberg deve essere archiviata in. Amazon S3

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #68

    Il nome dell'origine dati Iceberg.

  • Database Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome del database da cui leggere.

  • Table Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome della tabella nel database da cui leggere.

  • AdditionalIcebergOptions: una matrice della mappa di coppie chiave-valore.

    Ogni chiave è una UTF-8 stringa, corrispondente aCustom string pattern #66.

    Ogni valore è una UTF-8 stringa, corrispondente aCustom string pattern #66.

    Specifica opzioni di connessione aggiuntive per l'origine dati Iceberg.

  • OutputSchemas: una matrice di oggetti GlueSchema.

    Specifica lo schema di dati per l'origine Iceberg.

CatalogIcebergSource struttura

Specifica un'origine dati Apache Iceberg registrata nel Data Catalog. AWS Glue

Campi
  • Name Obbligatoria: UTF-8 stringa, corrispondente a. Custom string pattern #68

    Il nome dell'origine dati Iceberg.

  • Database Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome del database da cui leggere.

  • Table Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome della tabella nel database da cui leggere.

  • AdditionalIcebergOptions: una matrice della mappa di coppie chiave-valore.

    Ogni chiave è una UTF-8 stringa, corrispondente aCustom string pattern #66.

    Ogni valore è una UTF-8 stringa, corrispondente aCustom string pattern #66.

    Specifica opzioni di connessione aggiuntive per l'origine dati Iceberg.

  • OutputSchemas: una matrice di oggetti GlueSchema.

    Specifica lo schema di dati per l'origine Iceberg.

S3IcebergCatalogTarget struttura

Specifica una destinazione del catalogo Apache Iceberg che scrive i dati Amazon S3 e registra la tabella nel Data Catalog. AWS Glue

Campi
  • Name Obbligatoria: UTF-8 stringa, corrispondente a. Custom string pattern #68

    Il nome del catalogo Iceberg di destinazione.

  • Inputs Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.

    La connessione di input del catalogo Iceberg di destinazione.

  • PartitionKeys— Una serie di stringhe. UTF-8

    Un elenco di chiavi di partizione per la tabella Iceberg.

  • Table Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #66

    Il nome della tabella da scrivere nel catalogo.

  • Database Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome del database in cui scrivere.

  • AdditionalOptions: una matrice della mappa di coppie chiave-valore.

    Ogni chiave è una UTF-8 stringa, corrispondente aCustom string pattern #66.

    Ogni valore è una UTF-8 stringa, corrispondente aCustom string pattern #66.

    Specifica opzioni di connessione aggiuntive per il catalogo Iceberg di destinazione.

  • SchemaChangePolicy: un oggetto CatalogSchemaChangePolicy.

    La policy per la gestione delle modifiche allo schema nel catalogo di destinazione.

  • AutoDataQuality: un oggetto AutoDataQuality.

    Specifica se abilitare automaticamente la valutazione della qualità dei dati per il catalogo S3 Iceberg di destinazione. Se impostato su true, i controlli di qualità dei dati vengono eseguiti automaticamente durante l'operazione di scrittura.

DynamoDBELTConnectorSource struttura

Specifica un connettore ELT DynamoDB di origine per l'estrazione dei dati dalle tabelle DynamoDB.

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.

    Il nome del connettore ELT DynamoDB di origine.

  • ConnectionOptions: un oggetto DDBELTConnectionOptions.

    Le opzioni di connessione per il connettore DynamoDB ELT di origine.

  • OutputSchemas: una matrice di oggetti GlueSchema.

    Specifica lo schema di dati per il connettore DynamoDB ELT di origine.

DDBELTConnectionOptions struttura

Specifica le opzioni di connessione per le operazioni DynamoDB ELT (estrazione, caricamento, trasformazione). Questa struttura contiene parametri di configurazione per la connessione a e l'estrazione di dati da tabelle DynamoDB utilizzando il connettore ELT.

Campi
  • DynamodbExport— UTF-8 stringa (valori validi: ddb |s3).

    Specifica il tipo di esportazione per l'estrazione di dati DynamoDB. Questo parametro determina il modo di cui i dati vengono esportati dalla tabella DynamoDB durante il processo ELT.

  • DynamodbUnnestDDBJson: booleano.

    Un valore booleano che specifica se annullare la nidificazione del formato DynamoDB JSON durante l'estrazione dei dati. Se impostato su true, il connettore appiattirà le strutture JSON annidate negli elementi DynamoDB. Se impostato su false, la struttura JSON DynamoDB originale viene preservata.

  • DynamodbTableArn Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome della risorsa Amazon (ARN) della tabella DynamoDB da cui estrarre i dati. Questo parametro specifica la tabella di origine per l'operazione ELT.

  • DynamodbS3Bucket— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il nome del bucket Amazon S3 utilizzato per l'archiviazione intermedia durante il processo ELT DynamoDB. Questo bucket viene utilizzato per archiviare temporaneamente i dati DynamoDB esportati prima che vengano elaborati dal processo ELT.

  • DynamodbS3Prefix— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Il prefisso della chiave dell'oggetto S3 per i file archiviati nel bucket S3 intermedio durante il processo ELT DynamoDB. Questo prefisso aiuta a organizzare e identificare i file temporanei creati durante l'estrazione dei dati.

  • DynamodbS3BucketOwner— UTF-8 stringa, corrispondente aCustom string pattern #66.

    L'ID dell' AWS account del proprietario del bucket S3 specificato in. DynamodbS3Bucket Questo parametro è obbligatorio quando il bucket S3 è di proprietà di un AWS account diverso da quello che esegue il job ELT, e consente l'accesso tra account al bucket di archiviazione intermedio.

  • DynamodbStsRoleArn— UTF-8 stringa, corrispondente a. Custom string pattern #66

    L'Amazon Resource Name (ARN) del ruolo di AWS Security Token Service (STS) da assumere per accedere alle risorse DynamoDB e S3 durante l'operazione ELT. Questo ruolo deve disporre delle autorizzazioni necessarie per leggere dalla tabella DynamoDB e scrivere nel bucket S3 intermedio.

DDBELTCatalogAdditionalOptions struttura

Specifica opzioni aggiuntive per le operazioni di catalogo ELT DynamoDB.

Campi
  • DynamodbExport— UTF-8 stringa, corrispondente aCustom string pattern #66.

    Specifica la configurazione di esportazione DynamoDB per l'operazione ETL.

  • DynamodbUnnestDDBJson: booleano.

    Specifica se annullare la nidificazione del formato JSON DynamoDB. Se impostato su true, le strutture JSON annidate negli elementi DynamoDB vengono appiattite.

Struttura Route

Specifica un nodo di routing che indirizza i dati verso diversi percorsi di output in base a condizioni di filtraggio definite.

Campi
  • Name Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.

    Il nome del nodo di routing.

  • Inputs Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.

    La connessione di ingresso del nodo di routing.

  • GroupFiltersList - obbligatorio: una matrice di oggetti GroupFilters.

    Un elenco di filtri di gruppo che definiscono le condizioni di routing e i criteri per l'indirizzamento dei dati in diversi percorsi di output.

GroupFilters struttura

Specifica un gruppo di filtri con un operatore logico che stabilisce come i filtri vengono combinati per valutare le condizioni di routing.

Campi
  • GroupName Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #65.

    Il nome del gruppo di filtri.

  • Filters - obbligatorio: una matrice di oggetti FilterExpression.

    Un elenco di espressioni di filtro che definiscono le condizioni per questo gruppo.

  • LogicalOperator Obbligatorio: UTF-8 stringa (valori validi: AND |OR).

    L'operatore logico utilizzato per combinare i filtri in questo gruppo. Determina se tutti i filtri devono corrispondere (AND) o può corrispondere uno qualsiasi dei filtri (OR).

AutoDataQuality struttura

Specifica le opzioni di configurazione per la valutazione automatica della qualità dei dati nei AWS Glue processi. Questa struttura abilita controlli e monitoraggio automatizzati della qualità dei dati durante le operazioni ETL, contribuendo a garantire l'integrità e l'affidabilità dei dati senza interventi manuali.

Campi
  • IsEnabled: booleano.

    Specifica se è abilitata la valutazione automatica della qualità dei dati. Se impostato su true, i controlli di qualità dei dati vengono eseguiti automaticamente.

  • EvaluationContext— UTF-8 stringa, corrispondente a. Custom string pattern #66

    Il contesto di valutazione per i controlli di qualità dei dati automatici. Definisce l'ambito e i parametri per la valutazione della qualità dei dati.