Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
API processo visuale
L'API Visual Job consente di creare processi di integrazione dei dati utilizzando l' AWS Glue API da un oggetto JSON che rappresenta una configurazione visiva di un AWS Glue processo.
Un elenco di CodeGenConfigurationNodes questi viene fornito a un'API di creazione o aggiornamento del lavoro per registrare un DAG in AWS Glue Studio per il lavoro creato e generare il codice associato.
Tipi di dati
CodeGenConfigurationNode struttura
CodeGenConfigurationNode enumera tutti i tipi di nodo validi. È possibile compilare una e solo una delle variabili membro.
Campi
-
AthenaConnectorSource: un oggetto AthenaConnectorSource.Specifica un connettore per un'origine dati Amazon Athena.
-
JDBCConnectorSource: un oggetto JDBCConnectorSource.Specifica un connettore per un'origine dati JDBC.
-
SparkConnectorSource: un oggetto SparkConnectorSource.Specifica un connettore per un'origine dati Apache Spark.
-
CatalogSource: un oggetto CatalogSource.Specifica un archivio dati nel catalogo AWS Glue dati.
-
RedshiftSource: un oggetto RedshiftSource.Specifica un archivio dati Amazon Redshift.
-
S3CatalogSource: un oggetto S3CatalogSource.Specifica un data store Amazon S3 nel Data Catalog. AWS Glue
-
S3CsvSource: un oggetto S3CsvSource.Specifica un archivio dati CSV (valori delimitati da comandi) archiviati in Amazon S3.
-
S3JsonSource: un oggetto S3JsonSource.Specifica un archivio dati JSON in Amazon S3.
-
S3ParquetSource: un oggetto S3ParquetSource.Specifica un archivio dati di Apache Parquet archiviato in Amazon S3.
-
RelationalCatalogSource: un oggetto RelationalCatalogSource.Specifica un archivio dati del catalogo relazionale nel Data Catalog. AWS Glue
-
DynamoDBCatalogSource: un oggetto DynamoDBCatalogSource.Specifica un data store del catalogo DynamoDBC nel catalogo dati. AWS Glue
-
JDBCConnectorTarget: un oggetto JDBCConnectorTarget.Specifica una destinazioni di dati che scrive su Amazon S3 nell'archiviazione a colonne di Apache Parquet.
-
SparkConnectorTarget: un oggetto SparkConnectorTarget.Specifica una destinazione che utilizza un connettore Apache Spark.
-
CatalogTarget: un oggetto BasicCatalogTarget.Specifica una destinazione che utilizza una AWS Glue tabella del Data Catalog.
-
RedshiftTarget: un oggetto RedshiftTarget.Specifica una destinazione che utilizza Amazon Redshift.
-
S3CatalogTarget: un oggetto S3CatalogTarget.Specifica un target di dati che scrive su Amazon S3 utilizzando il AWS Glue Data Catalog.
-
S3GlueParquetTarget: un oggetto S3GlueParquetTarget.Specifica una destinazioni di dati che scrive su Amazon S3 nell'archiviazione a colonne di Apache Parquet.
-
S3DirectTarget: un oggetto S3DirectTarget.Specifica una destinazione di dati che scrive su Amazon S3.
-
ApplyMapping: un oggetto ApplyMapping.Specifica una trasformazione che mappa le chiavi delle proprietà dei dati nell'origine dei dati alle chiavi delle proprietà dei dati nella destinazione. È possibile rinominare le chiavi, modificare i tipi di dati per le chiavi e scegliere le chiavi da eliminare dal set di dati.
-
SelectFields: un oggetto SelectFields.Specifica una trasformazione che sceglie le chiavi della proprietà dati che si desidera conservare.
-
DropFields: un oggetto DropFields.Specifica una trasformazione che sceglie le chiavi della proprietà dati che si desidera eliminare.
-
RenameField: un oggetto RenameField.Specifica una trasformazione che rinominerà una singola chiave di proprietà dati.
-
Spigot: un oggetto Spigot.Specifica una trasformazione che scrive campioni dei dati in un bucket Amazon S3.
-
Join: un oggetto Join.Specifica una trasformazione che unisce due set di dati in un unico set di dati utilizzando una frase di confronto sulle chiavi di proprietà dei dati specificate. È possibile utilizzare inner, outer, left, right, left semi e left anti join.
-
SplitFields: un oggetto SplitFields.Specifica una trasformazione che divide le chiavi della proprietà dati in due
DynamicFrames. L'output è una raccolta diDynamicFrames: uno con le chiavi di proprietà dei dati selezionate e uno con le chiavi di proprietà dei dati rimanenti. -
SelectFromCollection: un oggetto SelectFromCollection.Specifica una trasformazione che sceglie un
DynamicFrameda una raccolta diDynamicFrames. L'output è ilDynamicFrameselezionato -
FillMissingValues: un oggetto FillMissingValues.Specifica una trasformazione che individua i registri nel set di dati che hanno valori mancanti e aggiunge un nuovo campo con un valore determinato dall'imputazione. Il set di dati di input viene utilizzato per addestrare il modello di machine learning che determina quale dovrebbe essere il valore mancante.
-
Filter: un oggetto Filtro.Specifica una trasformazione che divide un set di dati in due, in base a una condizione di filtro.
-
CustomCode: un oggetto CustomCode.Specifica una trasformazione che utilizza il codice personalizzato fornito per eseguire la trasformazione dei dati. L'output è una raccolta di. DynamicFrames
-
SparkSQL: un oggetto SparkSQL.Specifica una trasformazione in cui si inserisce una query SQL utilizzando la sintassi Spark SQL per trasformare i dati. L'output è un singolo
DynamicFrame. -
DirectKinesisSource: un oggetto DirectKinesisSource.Specifica un'origine dati Amazon Kinesis diretta.
-
DirectKafkaSource: un oggetto DirectKafkaSource.Specifica un archivio dati Apache Kafka.
-
CatalogKinesisSource: un oggetto CatalogKinesisSource.Specifica un'origine dati Kinesis nel AWS Glue Data Catalog.
-
CatalogKafkaSource: un oggetto CatalogKafkaSource.Specifica un archivio dati Apache Kafka nel catalogo dati.
-
DropNullFields: un oggetto DropNullFields.Specifica una trasformazione che rimuove le colonne dal set di dati se tutti i valori nella colonna sono “null”. Per impostazione predefinita, AWS Glue Studio riconoscerà gli oggetti nulli, ma alcuni valori come stringhe vuote, stringhe «nulle», numeri interi -1 o altri segnaposto come gli zeri, non vengono riconosciuti automaticamente come valori nulli.
-
Merge: un oggetto Unione.Specifica una trasformazione che unisce
DynamicFramea con unDynamicFramedi staging basato sulle chiavi primarie specificate per identificare i registri. I registri duplicati (registri con le stesse chiavi primarie) non vengono deduplicati. -
Union: un oggetto Union.Specifica una trasformazione che combina le righe di due o più set di dati in un unico risultato.
-
PIIDetection: un oggetto PIIDetection.Specifica una trasformazione che identifica, rimuove o maschera i dati PII.
-
Aggregate: un oggetto Aggregazione.Specifica una trasformazione che raggruppa le righe in base ai campi scelti e calcola il valore aggregato in base alla funzione specificata.
-
DropDuplicates: un oggetto DropDuplicates.Specifica una trasformazione che rimuove le righe di dati ripetuti da un set di dati.
-
GovernedCatalogTarget: un oggetto GovernedCatalogTarget.Specifica una destinazione di dati che scrive su un catalogo governato.
-
GovernedCatalogSource: un oggetto GovernedCatalogSource.Specifica un'origine dei dati in un catalogo dati governato.
-
MicrosoftSQLServerCatalogSource: un oggetto MicrosoftSQLServerCatalogSource.Specifica un'origine dei dati di Microsoft SQL Server nel Catalogo dati di AWS Glue .
-
MySQLCatalogSource: un oggetto MySQLCatalogSource.Specifica una fonte di dati MySQL nel Data Catalog. AWS Glue
-
OracleSQLCatalogSource: un oggetto OracleSQLCatalogSource.Specifica un'origine dati Oracle nel Data Catalog. AWS Glue
-
PostgreSQLCatalogSource: un oggetto PostgreSQLCatalogSource.Specifica un'origine dati PostgreSQL nel Data Catalog. AWS Glue
-
MicrosoftSQLServerCatalogTarget: un oggetto MicrosoftSQLServerCatalogTarget.Specifica una destinazione che utilizza Microsoft SQL.
-
MySQLCatalogTarget: un oggetto MySQLCatalogTarget.Specifica una destinazione che utilizza MySQL.
-
OracleSQLCatalogTarget: un oggetto OracleSQLCatalogTarget.Specifica una destinazione che utilizza Oracle SQL.
-
PostgreSQLCatalogTarget: un oggetto PostgreSQLCatalogTarget.Specifica una destinazione che utilizza Postgres SQL.
-
Route: un oggetto Route.Specifica un nodo di routing che indirizza i dati verso diversi percorsi di output in base a condizioni di filtraggio definite.
-
DynamicTransform: un oggetto DynamicTransform.Specifica una trasformazione visiva personalizzata creata da un utente.
-
EvaluateDataQuality: un oggetto EvaluateDataQuality.Specifica i criteri di valutazione della qualità dei dati.
-
S3CatalogHudiSource: un oggetto S3CatalogHudiSource.Specifica un'origine dati Hudi registrata nel catalogo dati. AWS Glue L'origine dati deve essere archiviata in. Amazon S3
-
CatalogHudiSource: un oggetto CatalogHudiSource.Specifica un'origine dati Hudi registrata nel catalogo AWS Glue dati.
-
S3HudiSource: un oggetto S3HudiSource.Specifica un'origine dati Hudi archiviata in. Amazon S3
-
S3HudiCatalogTarget: un oggetto S3HudiCatalogTarget.Specifica una destinazione che scrive su un'origine dati Hudi nel catalogo dati. AWS Glue
-
S3HudiDirectTarget: un oggetto S3HudiDirectTarget.Specifica una destinazione che scrive su un'origine dati Hudi in. Amazon S3
-
S3CatalogDeltaSource: un oggetto S3CatalogDeltaSource.Specifica un'origine dati Delta Lake registrata nel catalogo dati. AWS Glue L'origine dati deve essere archiviata in Amazon S3.
-
CatalogDeltaSource: un oggetto CatalogDeltaSource.Specifica un'origine dati Delta Lake registrata nel catalogo AWS Glue dati.
-
S3DeltaSource: un oggetto S3DeltaSource.Specifica un'origine dati Delta Lake archiviata in. Amazon S3
-
S3DeltaCatalogTarget: un oggetto S3DeltaCatalogTarget.Specifica una destinazione che scrive su un'origine dati Delta Lake nel AWS Glue Data Catalog.
-
S3DeltaDirectTarget: un oggetto S3DeltaDirectTarget.Specifica una destinazione che scrive su un'origine dati Delta Lake in. Amazon S3
-
AmazonRedshiftSource: un oggetto AmazonRedshiftSource.Specifica una destinazione che scrive su un'origine dati in Amazon Redshift.
-
AmazonRedshiftTarget: un oggetto AmazonRedshiftTarget.Specifica una destinazione che scrive su una destinazione dati in Amazon Redshift.
-
EvaluateDataQualityMultiFrame: un oggetto EvaluateDataQualityMultiFrame.Specifica i criteri di valutazione della qualità dei dati. Consente più dati di input e restituisce una raccolta di frame dinamici.
-
Recipe: un oggetto Recipe.Specifica un nodo di AWS Glue DataBrew ricetta.
-
SnowflakeSource: un oggetto SnowflakeSource.Specifica un'origine dati Snowflake.
-
SnowflakeTarget: un oggetto SnowflakeTarget.Specifica una destinazione che scrive su un'origine dati Snowflake.
-
ConnectorDataSource: un oggetto ConnectorDataSource.Specifica un'origine generata con opzioni di connessione standard.
-
ConnectorDataTarget: un oggetto ConnectorDataTarget.Specifica un a destinazione generata con opzioni di connessione standard.
-
S3CatalogIcebergSource: un oggetto S3CatalogIcebergSource.Specifica un'origine dati Apache Iceberg registrata nel Data Catalog. AWS Glue L'origine dati Iceberg deve essere archiviata in. Amazon S3
-
CatalogIcebergSource: un oggetto CatalogIcebergSource.Specifica un'origine dati Apache Iceberg registrata nel Data Catalog. AWS Glue
-
S3IcebergCatalogTarget: un oggetto S3IcebergCatalogTarget.Specifica una destinazione del catalogo Apache Iceberg che scrive i dati Amazon S3 e registra la tabella nel Data Catalog. AWS Glue
-
S3IcebergDirectTarget: un oggetto S3IcebergDirectTarget.Definisce i parametri di configurazione per la scrittura dei dati in Amazon S3 come tabella Apache Iceberg.
-
S3ExcelSource: un oggetto S3ExcelSource.Definisce i parametri di configurazione per la lettura dei file Excel da Amazon S3.
-
S3HyperDirectTarget: un oggetto S3HyperDirectTarget.Definisce i parametri di configurazione per la scrittura di dati su Amazon S3 mediante l'ottimizzazione. HyperDirect
-
DynamoDBELTConnectorSource: un oggetto DynamoDBELTConnectorSource.Specifica un connettore ELT DynamoDB di origine per l'estrazione dei dati dalle tabelle DynamoDB.
JDBCConnectorOptions struttura
Opzioni di connessione aggiuntive per il connettore.
Campi
-
FilterPredicate— UTF-8 stringa, corrispondente aCustom string pattern #66.Clausola condizione extra per filtrare i dati dall'origine. Ad esempio:
BillingCity='Mountain View'Quando si utilizza una query anziché un nome di tabella, è necessario verificare che la query funzioni con il
filterPredicatespecificato. -
PartitionColumn— UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome di una colonna intera utilizzata per il partizionamento. Questa opzione funziona solo quando è inclusa con
lowerBound,upperBoundenumPartitions. Questa opzione funziona allo stesso modo del lettore Spark SQL JDBC. -
LowerBound: numero (lungo).Il valore minimo di
partitionColumnche viene utilizzato per decidere lo stride della partizione. -
UpperBound: numero (lungo).Il valore massimo di
partitionColumnche viene utilizzato per decidere lo stride della partizione. -
NumPartitions: numero (lungo).Il numero di partizioni. Questo valore, insieme a
lowerBound(incluso) eupperBound(escluso), forma stride di partizione per espressioni con le clausoleWHEREgenerate che vengono utilizzate per dividere lapartitionColumn. -
JobBookmarkKeys— Una serie di UTF-8 stringhe.Il nome delle chiavi dei segnalibri di processo su cui eseguire l'ordinamento.
-
JobBookmarkKeysSortOrder— UTF-8 stringa, corrispondente a. Custom string pattern #66Specifica il criterio di ordinamento crescente o decrescente.
-
DataTypeMapping: una matrice della mappa di coppie chiave-valore.Ogni chiave è una UTF-8 stringa (valori validi:
ARRAY|BIGINT|BINARY|BIT|BLOB|BOOLEAN|CHAR| |CLOB|DATALINK|DATE|DECIMAL|DISTINCT|DOUBLE|FLOAT|INTEGER|JAVA_OBJECT|LONGNVARCHAR|LONGVARBINARY| |LONGVARCHAR|NCHAR|NCLOB|NULL|NUMERIC|NVARCHAR|OTHER|REAL|REF|REF_CURSOR|ROWID| |SMALLINT|SQLXML|STRUCT|TIME|TIME_WITH_TIMEZONE|TIMESTAMP|TIMESTAMP_WITH_TIMEZONE|TINYINT|VARBINARY|VARCHAR).Ogni valore è una UTF-8 stringa (valori validi:
DATE|STRING|TIMESTAMP|INT|FLOAT|LONG|BIGDECIMAL|BYTE|SHORT|DOUBLE).Mappatura del tipo di dati personalizzata che crea una mappatura da un tipo di dati JDBC a un tipo di dati AWS Glue . Ad esempio, l'opzione
"dataTypeMapping":{"FLOAT":"STRING"}mappa i campi di dati di tipo JDBCFLOATnelStringtipo Java chiamando ilResultSet.getString()metodo del driver e lo utilizza per creare il AWS Glue record. L'oggettoResultSetviene implementato da ciascun driver, quindi il comportamento è specifico del driver utilizzato. Consulta la documentazione relativa al driver JDBC per capire come il driver esegue le conversioni.
StreamingDataPreviewOptions struttura
Specifica le opzioni relative all'anteprima dei dati per la visualizzazione di un campione dei dati.
Campi
-
PollingTime: numero (lungo), almeno 10.Il tempo di polling in millisecondi.
-
RecordPollingLimit: numero (lungo), almeno 1.Il limite al numero di registri per cui è stato fatto il polling.
AthenaConnectorSource struttura
Specifica un connettore per un'origine dati Amazon Athena.
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.Il nome dell'origine dati.
-
ConnectionName— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome della connessione associata al connettore.
-
ConnectorName— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome di un connettore che facilita l'accesso all'archivio dati in AWS Glue Studio.
-
ConnectionType— Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #66Il tipo di connessione, come marketplace.athena o custom.athena, che designa una connessione a un archivio dati Amazon Athena.
-
ConnectionTable— UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome della tabella nell'origine dati.
-
SchemaName— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome del gruppo di log CloudWatch da cui leggere. Ad esempio,
/aws-glue/jobs/output. -
OutputSchemas: una matrice di oggetti GlueSchema.Specifica lo schema di dati per l'origine Athena personalizzata.
JDBCConnectorSource struttura
Specifica un connettore per un'origine dati JDBC.
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.Il nome dell'origine dati.
-
ConnectionName— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome della connessione associata al connettore.
-
ConnectorName— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome di un connettore che facilita l'accesso all'archivio dati in AWS Glue Studio.
-
ConnectionType— Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #66Il tipo di connessione, come marketplace.jdbc o custom.jdbc, che designa una connessione a un archivio dati JDBC.
-
AdditionalOptions: un oggetto JDBCConnectorOptions.Opzioni di connessione aggiuntive per il connettore.
-
ConnectionTable— UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome della tabella nell'origine dati.
-
Query— UTF-8 stringa, corrispondente aCustom string pattern #67.La tabella o la query SQL da cui ottenere i dati. Puoi specificare
ConnectionTableoquery, ma non entrambi. -
OutputSchemas: una matrice di oggetti GlueSchema.Specifica lo schema di dati per l'origine JDBC personalizzata.
SparkConnectorSource struttura
Specifica un connettore per un'origine dati Apache Spark.
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.Il nome dell'origine dati.
-
ConnectionName— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome della connessione associata al connettore.
-
ConnectorName— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome di un connettore che facilita l'accesso all'archivio dati in AWS Glue Studio.
-
ConnectionType— Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #66Il tipo di connessione, come marketplace.spark o custom.spark, che designa una connessione a un archivio dati di Apache Spark.
-
AdditionalOptions: una matrice della mappa di coppie chiave-valore.Ogni chiave è una UTF-8 stringa, corrispondente aCustom string pattern #66.
Ogni valore è una UTF-8 stringa, corrispondente aCustom string pattern #66.
Opzioni di connessione aggiuntive per il connettore.
-
OutputSchemas: una matrice di oggetti GlueSchema.Specifica lo schema di dati per l'origine Spark personalizzata.
CatalogSource struttura
Specifica un archivio dati nel catalogo AWS Glue dati.
Campi
-
Name— Obbligatoria: UTF-8 stringa, corrispondente a. Custom string pattern #68Il nome del archivio dati.
-
Database— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome del database da cui leggere.
-
Table— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome della tabella nel database da cui leggere.
-
PartitionPredicate— UTF-8 stringa, corrispondente aCustom string pattern #66.Le partizioni che soddisfano questo predicato vengono eliminate. I file all'interno del periodo di conservazione in queste partizioni non vengono eliminati.
-
OutputSchemas: una matrice di oggetti GlueSchema.Specifica lo schema di dati per l'origine del catalogo.
MySQLCatalogSource struttura
Specifica un'origine dati MySQL nel catalogo dati. AWS Glue
Campi
-
Name— Obbligatoria: UTF-8 stringa, corrispondente a. Custom string pattern #68Il nome dell'origine dati.
-
Database— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome del database da cui leggere.
-
Table— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome della tabella nel database da cui leggere.
PostgreSQLCatalogSource struttura
Specifica un'origine dati PostgreSQL nel catalogo dati. AWS Glue
Campi
-
Name— Obbligatoria: UTF-8 stringa, corrispondente a. Custom string pattern #68Il nome dell'origine dati.
-
Database— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome del database da cui leggere.
-
Table— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome della tabella nel database da cui leggere.
OracleSQLCatalogSource struttura
Specifica un'origine dati Oracle nel catalogo AWS Glue dati.
Campi
-
Name— Obbligatoria: UTF-8 stringa, corrispondente a. Custom string pattern #68Il nome dell'origine dati.
-
Database— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome del database da cui leggere.
-
Table— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome della tabella nel database da cui leggere.
MicrosoftSQLServerCatalogSource struttura
Specifica un'origine dei dati di Microsoft SQL Server nel Catalogo dati di AWS Glue .
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.Il nome dell'origine dati.
-
Database— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome del database da cui leggere.
-
Table— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome della tabella nel database da cui leggere.
CatalogKinesisSource struttura
Specifica un'origine dati Kinesis nel AWS Glue Data Catalog.
Campi
-
Name— Obbligatoria: UTF-8 stringa, corrispondente a. Custom string pattern #68Il nome dell'origine dati.
-
WindowSize: numero (intero).La quantità di tempo da dedicare all'elaborazione di ciascun micro batch.
-
DetectSchema: booleano.Se determinare automaticamente o meno lo schema dai dati in entrata.
-
Table— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome della tabella nel database da cui leggere.
-
Database— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome del database da cui leggere.
-
StreamingOptions: un oggetto KinesisStreamingSourceOptions.Opzioni aggiuntive per l'origine dati di streaming Kinesis.
-
DataPreviewOptions: un oggetto StreamingDataPreviewOptions.Opzioni aggiuntive per l'anteprima dei dati.
DirectKinesisSource struttura
Specifica un'origine dati Amazon Kinesis diretta.
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.Il nome dell'origine dati.
-
WindowSize: numero (intero).La quantità di tempo da dedicare all'elaborazione di ciascun micro batch.
-
DetectSchema: booleano.Se determinare automaticamente o meno lo schema dai dati in entrata.
-
StreamingOptions: un oggetto KinesisStreamingSourceOptions.Opzioni aggiuntive per l'origine dati di streaming Kinesis.
-
DataPreviewOptions: un oggetto StreamingDataPreviewOptions.Opzioni aggiuntive per l'anteprima dei dati.
KinesisStreamingSourceOptions struttura
Opzioni aggiuntive per l'origine dati di streaming Amazon Kinesis.
Campi
-
EndpointUrl— UTF-8 stringa, corrispondente aCustom string pattern #66.L'URL dell'endpoint di Kinesis.
-
StreamName— UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome del flusso di dati Kinesis.
-
Classification— UTF-8 stringa, corrispondente aCustom string pattern #66.Una classificazione facoltativa.
-
Delimiter— UTF-8 stringa, corrispondente aCustom string pattern #66.Specifica il carattere delimitatore.
-
StartingPosition— UTF-8 stringa (valori validi:latest="LATEST"|trim_horizon="TRIM_HORIZON"|earliest="EARLIEST"|timestamp="TIMESTAMP").La posizione di partenza nel flusso dei dati Kinesis da cui leggere i dati. I valori possibili sono
"latest","trim_horizon""earliest", o una stringa di timestamp in formato UTC nel modelloyyyy-mm-ddTHH:MM:SSZ(doveZrappresenta un offset del fuso orario UTC con +/-). Ad esempio: «2023-04-04 «). T08:00:00-04:00 Il valore predefinito è"latest".Nota: l'utilizzo di un valore che è una stringa di timestamp in formato UTC per «startingPosition» è supportato solo per la versione 4.0 o successiva. AWS Glue
-
MaxFetchTimeInMs: numero (lungo).Il tempo massimo impiegato affinché l'esecutore del processo legga i record della batch attuale dal flusso di dati Kinesis, specificato in millisecondi (ms). Entro questo periodo è possibile effettuate più chiamate API
GetRecords. Il valore predefinito è1000. -
MaxFetchRecordsPerShard: numero (lungo).Il numero massimo di record da recuperare per shard nel flusso di dati Kinesis per microbatch. Nota: il client può superare questo limite se il processo di streaming ha già letto i record aggiuntivi da Kinesis (nella stessa chiamata get-records). Se
MaxFetchRecordsPerSharddeve essere rigoroso, allora deve essere un multiplo diMaxRecordPerRead. Il valore predefinito è100000. -
MaxRecordPerRead: numero (lungo).Il numero massimo di registri da recuperare nel flusso dei dati Kinesis in ciascuna operazione getRecords. Il valore predefinito è
10000. -
AddIdleTimeBetweenReads: booleano.Aggiunge un ritardo tra due operazioni consecutive getRecords. Il valore predefinito è
"False". Questa opzione è configurabile solo per AWS Glue versione 2.0 e successive. -
IdleTimeBetweenReadsInMs: numero (lungo).Il ritardo minimo tra due operazioni consecutive getRecords, specificato in ms. Il valore predefinito è
1000. Questa opzione è configurabile solo per la versione 2.0 e successive. AWS Glue -
DescribeShardInterval: numero (lungo).L'intervallo di tempo minimo tra due chiamate ListShards API affinché lo script consideri il resharding. Il valore predefinito è
1s. -
NumRetries: numero (intero).Il numero massimo di tentativi per le richieste API Kinesis Data Streams. Il valore predefinito è
3. -
RetryIntervalMs: numero (lungo).Il periodo di raffreddamento (specificato in ms) prima di riprovare la chiamata API Kinesis Data Streams. Il valore predefinito è
1000. -
MaxRetryIntervalMs: numero (lungo).Il periodo di raffreddamento (specificato in ms) tra due tentativi di chiamata API Kinesis Data Streams. Il valore predefinito è
10000. -
AvoidEmptyBatches: booleano.Impedisce la creazione di un processo microbatch vuoto controllando la presenza di dati non letti nel flusso dei dati Kinesis prima che il batch venga avviato. Il valore predefinito è
"False". -
StreamArn— UTF-8 stringa, corrispondente a. Custom string pattern #66Il nome della risorsa Amazon (ARN) del flusso di dati Kinesis.
-
RoleArn— UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome della risorsa Amazon (ARN) del ruolo da assumere tramite il Servizio di token di sicurezza AWS (AWS STS). Questo ruolo deve disporre delle autorizzazioni per descrivere o leggere le operazioni dei registri per il flusso di dati Kinesis. Quando si accede a un flusso di dati in un altro account, è necessario utilizzare questo parametro. Usato in combinazione con
"awsSTSSessionName". -
RoleSessionName— UTF-8 stringa, corrispondente aCustom string pattern #66.Un identificatore della sessione che assume il ruolo tramite AWS STS. Quando si accede a un flusso di dati in un altro account, è necessario utilizzare questo parametro. Usato in combinazione con
"awsSTSRoleARN". -
AddRecordTimestamp— UTF-8 stringa, corrispondente aCustom string pattern #66.Quando questa opzione è impostata su "true", l'output dei dati conterrà una colonna aggiuntiva denominata "__src_timestamp" che indica l'ora in cui il record corrispondente è stato ricevuto dal flusso. Il valore predefinito è "false". Questa opzione è supportata nella AWS Glue versione 4.0 o successiva.
-
EmitConsumerLagMetrics— UTF-8 stringa, corrispondente aCustom string pattern #66.Quando questa opzione è impostata su «true», per ogni batch, emetterà le metriche relative alla durata compresa tra il record più vecchio ricevuto dallo stream e l'ora in AWS Glue cui arriva. CloudWatch Il nome della metrica è «glue.driver.streaming.max». ConsumerLagInMs Il valore predefinito è "false". Questa opzione è supportata in AWS Glue versione 4.0 o successive.
-
StartingTimestamp— stringa. UTF-8Il timestamp del record nel flusso di dati Kinesis da cui iniziare la lettura dei dati. I valori possibili sono una stringa di timestamp in formato UTC del modello
yyyy-mm-ddTHH:MM:SSZ(dove Z rappresenta un offset del fuso orario UTC con un +/-). Ad esempio: «2023-04-04 + 08:00 «). T08:00:00 -
FanoutConsumerARN— UTF-8 stringa, corrispondente a. Custom string pattern #66Il nome della risorsa Amazon (ARN) del consumatore con fan-out avanzato del flusso di dati Kinesis. Quando è specificato, abilita il fan-out avanzato per un throughput dedicato e un consumo di dati a latenza inferiore.
CatalogKafkaSource struttura
Specifica un archivio dati Apache Kafka nel catalogo dati.
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.Il nome del archivio dati.
-
WindowSize: numero (intero).La quantità di tempo da dedicare all'elaborazione di ciascun micro batch.
-
DetectSchema: booleano.Se determinare automaticamente o meno lo schema dai dati in entrata.
-
Table— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome della tabella nel database da cui leggere.
-
Database— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome del database da cui leggere.
-
StreamingOptions: un oggetto KafkaStreamingSourceOptions.Specifica le opzioni di streaming.
-
DataPreviewOptions: un oggetto StreamingDataPreviewOptions.Specifica le opzioni relative all'anteprima dei dati per la visualizzazione di un campione dei dati.
DirectKafkaSource struttura
Specifica un archivio dati Apache Kafka.
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.Il nome del archivio dati.
-
StreamingOptions: un oggetto KafkaStreamingSourceOptions.Specifica le opzioni di streaming.
-
WindowSize: numero (intero).La quantità di tempo da dedicare all'elaborazione di ciascun micro batch.
-
DetectSchema: booleano.Se determinare automaticamente o meno lo schema dai dati in entrata.
-
DataPreviewOptions: un oggetto StreamingDataPreviewOptions.Specifica le opzioni relative all'anteprima dei dati per la visualizzazione di un campione dei dati.
KafkaStreamingSourceOptions struttura
Opzioni aggiuntive per lo streaming.
Campi
-
BootstrapServers— UTF-8 stringa, corrispondente aCustom string pattern #66.Un elenco di URL del server bootstrap, ad esempio, come
b-1.vpc-test-2.o4q88o.c6.kafka.us-east-1.amazonaws.com:9094. Questa opzione deve essere specificata nella chiamata API o definita nei metadati della tabella in catalogo dati. -
SecurityProtocol— UTF-8 stringa, corrispondente aCustom string pattern #66.Il protocollo utilizzato per comunicare con i broker. I valori possibili sono
"SSL"o"PLAINTEXT". -
ConnectionName— UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome della connessione.
-
TopicName— UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome dell'argomento come specificato in Apache Kafka. Devi specificare almeno uno tra
"topicName","assign"o"subscribePattern". -
Assign— UTF-8 stringa, corrispondente aCustom string pattern #66.Lo specifico
TopicPartitionsper consumare. Devi specificare almeno uno tra"topicName","assign"o"subscribePattern". -
SubscribePattern— UTF-8 stringa, corrispondente aCustom string pattern #66.Uuna stringa regex Java che identifichi l'elenco degli argomenti a cui effettuare la sottoscrizione. Devi specificare almeno uno tra
"topicName","assign"o"subscribePattern". -
Classification— UTF-8 stringa, corrispondente aCustom string pattern #66.Una classificazione facoltativa.
-
Delimiter— UTF-8 stringa, corrispondente aCustom string pattern #66.Specifica il carattere delimitatore.
-
StartingOffsets— UTF-8 stringa, corrispondente aCustom string pattern #66.La posizione di partenza nell'argomento Kafka da cui leggere i dati. I valori possibili sono
"earliest"o"latest". Il valore predefinito è"latest". -
EndingOffsets— UTF-8 stringa, corrispondente aCustom string pattern #66.L'endpoint al quale viene terminata una query batch. I valori possibili sono
"latest"o una stringa JSON che specifica un offset finale per ogniTopicPartition. -
PollTimeoutMs: numero (lungo).Il timeout in millisecondi per il polling dei dati da Kafka negli esecutori del processo Spark. Il valore predefinito è
512. -
NumRetries: numero (intero).Il numero di tentativi prima di non riuscire a recuperare gli offset Kafka. Il valore predefinito è
3. -
RetryIntervalMs: numero (lungo).Il tempo di attesa in millisecondi prima di riprovare a recuperare gli offset Kafka. Il valore predefinito è
10. -
MaxOffsetsPerTrigger: numero (lungo).Il limite di velocità sul numero massimo di offset elaborati per intervallo di attivazione. Il numero totale di offset specificato viene suddiviso proporzionalmente tra
topicPartitionsdi diversi volumi. Il valore di default è null, il che significa che il consumer legge tutti gli offset fino all'ultimo offset noto. -
MinPartitions: numero (intero).Il numero minimo desiderato di partizioni da leggere da Kafka. Il valore di default è null, il che significa che il numero di partizioni Spark è uguale al numero di partizioni Kafka.
-
IncludeHeaders: booleano.Se includere le intestazioni di Kafka. Quando l'opzione è impostata su "true", l'output dei dati conterrà una colonna aggiuntiva denominata "glue_streaming_kafka_headers" con tipo
Array[Struct(key: String, value: String)]. Il valore di default è "false". Questa opzione è disponibile solo nella AWS Glue versione 3.0 o successiva. -
AddRecordTimestamp— UTF-8 stringa, corrispondente aCustom string pattern #66.Quando questa opzione è impostata su "true", l'output dei dati conterrà una colonna aggiuntiva denominata "__src_timestamp" che indica l'ora in cui il record corrispondente è stato ricevuto dall'argomento. Il valore predefinito è "false". Questa opzione è supportata nella AWS Glue versione 4.0 o successiva.
-
EmitConsumerLagMetrics— UTF-8 stringa, corrispondente aCustom string pattern #66.Quando questa opzione è impostata su «true», per ogni batch, emetterà le metriche relative alla durata compresa tra il record più vecchio ricevuto dall'argomento e l'ora in AWS Glue cui arriva. CloudWatch Il nome della metrica è «glue.driver.streaming.max». ConsumerLagInMs Il valore predefinito è "false". Questa opzione è supportata in AWS Glue versione 4.0 o successive.
-
StartingTimestamp— stringa. UTF-8Il timestamp del record nell'argomento Kinesis da cui iniziare la lettura dei dati. I valori possibili sono una stringa di timestamp in formato UTC del modello
yyyy-mm-ddTHH:MM:SSZ(dove Z rappresenta un offset del fuso orario UTC con un +/-). Ad esempio: «2023-04-04 + 08:00 «). T08:00:00Deve essere impostato solo un valore tra
StartingTimestampeStartingOffsets.
RedshiftSource struttura
Specifica un archivio dati Amazon Redshift.
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.Il nome dell'archivio dati Amazon Redshift.
-
Database— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il database da cui leggere.
-
Table— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.La tabella del database da cui leggere.
-
RedshiftTmpDir— UTF-8 stringa, corrispondente aCustom string pattern #66.Il percorso Amazon S3 in cui i dati temporanei possono essere caricati durante la copia dal database.
-
TmpDirIAMRole— UTF-8 stringa, corrispondente aCustom string pattern #66.Il ruolo IAM con autorizzazioni.
AmazonRedshiftSource struttura
Il nome della connessione è l'origine Amazon Redshift.
Campi
-
Name— UTF-8 stringa, corrispondente aCustom string pattern #68.Il nome dell'origine Amazon Redshift.
-
Data: un oggetto AmazonRedshiftNodeData.Specifica i dati del nodo di origine Amazon Redshift.
AmazonRedshiftNodeData struttura
Specifica un nodo Amazon Redshift.
Campi
-
AccessType— UTF-8 stringa, corrispondente aCustom string pattern #65.Il tipo di accesso per la connessione Redshift. Può essere una connessione diretta o una al catalogo.
-
SourceType— UTF-8 stringa, corrispondente aCustom string pattern #65.Il tipo di origine per specificare se una tabella specifica è l'origine o una query personalizzata.
-
Connection: un oggetto Opzione.La AWS Glue connessione al cluster Redshift.
-
Schema: un oggetto Opzione.Il nome dello schema Redshift quando si lavora con una connessione diretta.
-
Table: un oggetto Opzione.Il nome della tabella Redshift quando si lavora con una connessione diretta.
-
CatalogDatabase: un oggetto Opzione.Il nome del database AWS Glue Data Catalog quando si lavora con un catalogo dati.
-
CatalogTable: un oggetto Opzione.Il nome della tabella AWS Glue Data Catalog quando si lavora con un catalogo dati.
-
CatalogRedshiftSchema— UTF-8 stringa.Il nome dello schema Redshift quando si lavora con un catalogo dati.
-
CatalogRedshiftTable— UTF-8 corda.La tabella del database da cui leggere.
-
TempDir— UTF-8 stringa, corrispondente aCustom string pattern #66.Il percorso Amazon S3 in cui i dati temporanei possono essere caricati durante la copia dal database.
-
IamRole: un oggetto Opzione.Opzionale. Il nome del ruolo utilizzato durante la connessione a S3. Se lasciato vuoto, il ruolo IAM assumerà per impostazione predefinita il ruolo nel processo.
-
AdvancedOptions: una matrice di oggetti AmazonRedshiftAdvancedOption.Valori facoltativi durante la connessione al cluster Redshift.
-
SampleQuery— UTF-8 stringa.L'SQL utilizzato per recuperare i dati da una fonte Redshift quando si SourceType tratta di una 'query'.
-
PreActionUTF-8 — stringa.L'SQL utilizzato prima di un'esecuzione di MERGE o APPEND con upsert.
-
PostAction— UTF-8 corda.L'SQL utilizzato prima di un'esecuzione di MERGE o APPEND con upsert.
-
Action— UTF-8 corda.Specifica come verrà eseguita la scrittura su un cluster Redshift.
-
TablePrefix— UTF-8 stringa, corrispondente aCustom string pattern #65.Specifica il prefisso di una tabella.
-
Upsert: booleano.L'operazione utilizzata in un sink Redshift quando si esegue un APPEND.
-
MergeAction— UTF-8 stringa, corrispondente aCustom string pattern #65.L'operazione utilizzata per determinare come verrà gestito un MERGE in un sink Redshift.
-
MergeWhenMatched— UTF-8 stringa, corrispondente aCustom string pattern #65.L'operazione utilizzata per determinare come verrà gestito un MERGE in un sink Redshift quando un record esistente corrisponde a un nuovo record.
-
MergeWhenNotMatched— UTF-8 stringa, corrispondente aCustom string pattern #65.L'operazione utilizzata per determinare come verrà gestito un MERGE in un sink Redshift quando un record esistente non corrisponde a un nuovo record.
-
MergeClause— UTF-8 stringa.L'SQL utilizzato in un merge personalizzato per gestire i record corrispondenti.
-
CrawlerConnection— UTF-8 corda.Specifica il nome della connessione associata alla tabella del catalogo utilizzata.
-
TableSchema: una matrice di oggetti Opzione.L'array di output dello schema per un determinato nodo.
-
StagingTable— UTF-8 corda.Il nome della tabella intermedia temporanea utilizzata quando si esegue un MERGE o un APPEND con upsert.
-
SelectedColumns: una matrice di oggetti Opzione.L'elenco dei nomi di colonna utilizzati per determinare un record corrispondente quando si esegue un MERGE o un APPEND con upsert.
AmazonRedshiftAdvancedOption struttura
Specifica un valore facoltativo per la connessione al cluster Redshift.
Campi
-
Key— UTF-8 corda.La chiave dell'opzione di connessione aggiuntiva.
-
Value— UTF-8 corda.Il valore dell'opzione di connessione aggiuntiva.
Struttura Option
Specifica il valore di un'opzione.
Campi
-
Value— UTF-8 stringa, corrispondente aCustom string pattern #66.Specifica il valore dell'opzione.
-
Label— UTF-8 stringa, corrispondente aCustom string pattern #66.Specifica l'etichetta dell'opzione.
-
Description— UTF-8 stringa, corrispondente aCustom string pattern #66.Specifica la descrizione dell'opzione.
S3CatalogSource struttura
Specifica un archivio dati Amazon S3 nel catalogo AWS Glue dati.
Campi
-
Name— Obbligatoria: UTF-8 stringa, corrispondente a. Custom string pattern #68Il nome del archivio dati.
-
Database— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il database da cui leggere.
-
Table— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.La tabella del database da cui leggere.
-
PartitionPredicate— UTF-8 stringa, corrispondente aCustom string pattern #66.Le partizioni che soddisfano questo predicato vengono eliminate. I file all'interno del periodo di conservazione in queste partizioni non vengono eliminati. Impostato su
"": vuoto per impostazione predefinita. -
AdditionalOptions: un oggetto S3SourceAdditionalOptions.Specifica opzioni di connessione aggiuntive.
S3SourceAdditionalOptions struttura
Specifica opzioni di connessione aggiuntive per l'archivio dati Amazon S3.
Campi
-
BoundedSize: numero (lungo).Imposta il limite superiore per la dimensione di destinazione del set di dati in byte che verranno elaborati.
-
BoundedFiles: numero (lungo).Imposta il limite superiore per il numero di file di destinazione che verranno elaborati.
S3CsvSource struttura
Specifica un archivio dati CSV (valori delimitati da comandi) archiviati in Amazon S3.
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.Il nome del archivio dati.
-
Paths— Obbligatorio: una serie di UTF-8 stringhe.Un elenco dei percorsi Amazon S3 da cui leggere.
-
CompressionType— UTF-8 stringa (valori validi:gzip="GZIP"|bzip2="BZIP2").Specifica il modo in cui i dati sono compressi. In genere questo non è necessario se i dati hanno un'estensione del file standard. I valori possibili sono
"gzip"e"bzip"). -
Exclusions— Una matrice di UTF-8 stringhe.Una stringa contenente un elenco JSON di pattern Unix-style globulari da escludere. Ad esempio "[\"**.pdf \"]" esclude tutti i file PDF.
-
GroupSize— UTF-8 stringa, corrispondente a. Custom string pattern #66La dimensione del gruppo di destinazione in byte. Il valore di default viene calcolato in base alla dimensione dei dati di input e alle dimensioni del cluster. Quando sono presenti meno di 50.000 file di input,
"groupFiles"deve essere impostato su"inPartition"per rendere effettiva la modifica. -
GroupFiles— UTF-8 stringa, corrispondente aCustom string pattern #66.Quando l'input contiene più di 50.000 file, il raggruppamento di file è attivato per impostazione predefinita. Per attivare il raggruppamento con meno di 50.000 file, imposta questo parametro su “inPartition”. Per disabilitare il raggruppamento in presenza di più di 50.000 file, imposta il parametro su
"none". -
Recurse: booleano.Se è impostato su “Vero”, legge i file in modo ricorsivo in tutte le sottodirectory dei percorsi specificati.
-
MaxBand: numero (intero).Questa opzione controlla la durata in millisecondi dopo la quale è probabile che l'elenco s3 sia coerente. I file con timestamp di modifica che rientrano negli ultimi millisecondi di MaxBand vengono tracciati specialmente se utilizzati JobBookmarks per tenere conto dell'eventuale coerenza di Amazon S3. Per la maggior parte degli utenti non è necessario impostare questa opzione. Il valore di default è 900.000 millisecondi o 15 minuti.
-
MaxFilesInBand: numero (intero).Questa opzione specifica il numero massimo di file da salvare negli ultimi secondi maxBand. Se si supera questo valore, i file aggiuntivi vengono saltati e solo elaborati nella successiva esecuzione del processo.
-
AdditionalOptions: un oggetto S3DirectSourceAdditionalOptions.Specifica opzioni di connessione aggiuntive.
-
Separator— Obbligatorio: UTF-8 stringa (valori validi: | | | |).comma="COMMA"ctrla="CTRLA"pipe="PIPE"semicolon="SEMICOLON"tab="TAB"Specifica il carattere delimitatore. Il valore di default è una virgola: ",", ma è possibile specificare qualsiasi altro carattere.
-
Escaper— UTF-8 stringa, corrispondente aCustom string pattern #66.Specifica un carattere di escape. Questa opzione viene utilizzata solo durante la lettura di file CSV. Il valore predefinito è
none. Se questa opzione è abilitata, il carattere immediatamente seguente viene usato così come è, ad eccezione di un piccolo set di caratteri di escape ben noti (\n,\r,\te\0). -
QuoteChar— Obbligatorio: UTF-8 stringa (valori validi:quote="QUOTE"quillemet="QUILLEMET"|single_quote="SINGLE_QUOTE"| |disabled="DISABLED").Specifica il carattere da usare per le virgolette. Per impostazione predefinita vengono usate le virgolette doppie:
'"'. Imposta questo valore su-1per disattivare completamente le virgolette. -
Multiline: booleano.Un valore booleano che specifica se un singolo registro può estendersi su più righe. Ciò può accadere quando un campo contiene un carattere di nuova riga tra virgolette. Imposta questa opzione su “Vero” se un qualsiasi registro si estende su più righe. Il valore di default è
False, che consente una divisione dei file più netta durante l'analisi. -
WithHeader: booleano.Un valore booleano che specifica se trattare la prima riga come intestazione. Il valore predefinito è
False. -
WriteHeader: booleano.Un valore booleano che specifica se scrivere l'intestazione nell'output. Il valore predefinito è
True. -
SkipFirst: booleano.Un valore booleano che specifica se ignorare la prima riga di dati. Il valore predefinito è
False. -
OptimizePerformance: booleano.Un valore booleano che specifica se utilizzare il lettore SIMD CSV avanzato insieme ai formati di memoria colonnare basati su Apache Arrow. Disponibile solo nella AWS Glue versione 3.0.
-
OutputSchemas: una matrice di oggetti GlueSchema.Specifica lo schema di dati per l'origine CSV S3 personalizzata.
Struttura DirectJDBCSource
Specifica la connessione diretta all'origine JDBC.
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.Il nome della connessione di origine JDBC.
-
Database— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il database della connessione di origine JDBC.
-
Table— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.La tabella della connessione di origine JDBC.
-
ConnectionName— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome della connessione dell'origine JDBC.
-
ConnectionType— Obbligatorio: UTF-8 stringa (valori validi:sqlservermysql|oracle|postgresql| |redshift).Il tipo di connessione dell'origine JDBC.
-
RedshiftTmpDir— UTF-8 stringa, corrispondente aCustom string pattern #66.La directory temporanea dell'origine JDBC Redshift.
-
OutputSchemas: una matrice di oggetti GlueSchema.Specifica lo schema di dati per l'origine JDBC diretta.
S3DirectSourceAdditionalOptions struttura
Specifica opzioni di connessione aggiuntive per l'archivio dati Amazon S3.
Campi
-
BoundedSize: numero (lungo).Imposta il limite superiore per la dimensione di destinazione del set di dati in byte che verranno elaborati.
-
BoundedFiles: numero (lungo).Imposta il limite superiore per il numero di file di destinazione che verranno elaborati.
-
EnableSamplePath: booleano.Imposta l'opzione per abilitare un percorso di esempio.
-
SamplePath— UTF-8 stringa, corrispondente aCustom string pattern #66.Se abilitato, specifica il percorso di esempio.
S3JsonSource struttura
Specifica un archivio dati JSON in Amazon S3.
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.Il nome del archivio dati.
-
Paths— Obbligatorio: una serie di UTF-8 stringhe.Un elenco dei percorsi Amazon S3 da cui leggere.
-
CompressionType— UTF-8 stringa (valori validi:gzip="GZIP"|bzip2="BZIP2").Specifica il modo in cui i dati sono compressi. In genere questo non è necessario se i dati hanno un'estensione del file standard. I valori possibili sono
"gzip"e"bzip"). -
Exclusions— Una matrice di UTF-8 stringhe.Una stringa contenente un elenco JSON di pattern Unix-style globulari da escludere. Ad esempio "[\"**.pdf \"]" esclude tutti i file PDF.
-
GroupSize— UTF-8 stringa, corrispondente a. Custom string pattern #66La dimensione del gruppo di destinazione in byte. Il valore di default viene calcolato in base alla dimensione dei dati di input e alle dimensioni del cluster. Quando sono presenti meno di 50.000 file di input,
"groupFiles"deve essere impostato su"inPartition"per rendere effettiva la modifica. -
GroupFiles— UTF-8 stringa, corrispondente aCustom string pattern #66.Quando l'input contiene più di 50.000 file, il raggruppamento di file è attivato per impostazione predefinita. Per attivare il raggruppamento con meno di 50.000 file, imposta questo parametro su “inPartition”. Per disabilitare il raggruppamento in presenza di più di 50.000 file, imposta il parametro su
"none". -
Recurse: booleano.Se è impostato su “Vero”, legge i file in modo ricorsivo in tutte le sottodirectory dei percorsi specificati.
-
MaxBand: numero (intero).Questa opzione controlla la durata in millisecondi dopo la quale è probabile che l'elenco s3 sia coerente. I file con timestamp di modifica che rientrano negli ultimi millisecondi di MaxBand vengono tracciati specialmente se utilizzati JobBookmarks per tenere conto dell'eventuale coerenza di Amazon S3. Per la maggior parte degli utenti non è necessario impostare questa opzione. Il valore di default è 900.000 millisecondi o 15 minuti.
-
MaxFilesInBand: numero (intero).Questa opzione specifica il numero massimo di file da salvare negli ultimi secondi maxBand. Se si supera questo valore, i file aggiuntivi vengono saltati e solo elaborati nella successiva esecuzione del processo.
-
AdditionalOptions: un oggetto S3DirectSourceAdditionalOptions.Specifica opzioni di connessione aggiuntive.
-
JsonPath— Custom string pattern #66 stringa, corrispondente a. UTF-8Una JsonPath stringa che definisce i dati JSON.
-
Multiline: booleano.Un valore booleano che specifica se un singolo registro può estendersi su più righe. Ciò può accadere quando un campo contiene un carattere di nuova riga tra virgolette. Imposta questa opzione su “Vero” se un qualsiasi registro si estende su più righe. Il valore di default è
False, che consente una divisione dei file più netta durante l'analisi. -
OutputSchemas: una matrice di oggetti GlueSchema.Specifica lo schema di dati per l'origine JSON S3 personalizzata.
S3ParquetSource struttura
Specifica un archivio dati di Apache Parquet archiviato in Amazon S3.
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.Il nome del archivio dati.
-
Paths— Obbligatorio: una serie di UTF-8 stringhe.Un elenco dei percorsi Amazon S3 da cui leggere.
-
CompressionType— UTF-8 stringa (valori validi:snappy="SNAPPY"|lzo="LZO"|gzip="GZIP"|brotli="BROTLI"| |lz4="LZ4"uncompressed="UNCOMPRESSED"|none="NONE").Specifica il modo in cui i dati sono compressi. In genere questo non è necessario se i dati hanno un'estensione del file standard. I valori possibili sono
"gzip"e"bzip"). -
Exclusions— Una matrice di UTF-8 stringhe.Una stringa contenente un elenco JSON di pattern Unix-style globulari da escludere. Ad esempio "[\"**.pdf \"]" esclude tutti i file PDF.
-
GroupSize— UTF-8 stringa, corrispondente a. Custom string pattern #66La dimensione del gruppo di destinazione in byte. Il valore di default viene calcolato in base alla dimensione dei dati di input e alle dimensioni del cluster. Quando sono presenti meno di 50.000 file di input,
"groupFiles"deve essere impostato su"inPartition"per rendere effettiva la modifica. -
GroupFiles— UTF-8 stringa, corrispondente aCustom string pattern #66.Quando l'input contiene più di 50.000 file, il raggruppamento di file è attivato per impostazione predefinita. Per attivare il raggruppamento con meno di 50.000 file, imposta questo parametro su “inPartition”. Per disabilitare il raggruppamento in presenza di più di 50.000 file, imposta il parametro su
"none". -
Recurse: booleano.Se è impostato su “Vero”, legge i file in modo ricorsivo in tutte le sottodirectory dei percorsi specificati.
-
MaxBand: numero (intero).Questa opzione controlla la durata in millisecondi dopo la quale è probabile che l'elenco s3 sia coerente. I file con timestamp di modifica che rientrano negli ultimi millisecondi di MaxBand vengono tracciati specialmente se utilizzati JobBookmarks per tenere conto dell'eventuale coerenza di Amazon S3. Per la maggior parte degli utenti non è necessario impostare questa opzione. Il valore di default è 900.000 millisecondi o 15 minuti.
-
MaxFilesInBand: numero (intero).Questa opzione specifica il numero massimo di file da salvare negli ultimi secondi maxBand. Se si supera questo valore, i file aggiuntivi vengono saltati e solo elaborati nella successiva esecuzione del processo.
-
AdditionalOptions: un oggetto S3DirectSourceAdditionalOptions.Specifica opzioni di connessione aggiuntive.
-
OutputSchemas: una matrice di oggetti GlueSchema.Specifica lo schema di dati per l'origine Parquet S3 personalizzata.
S3DeltaSource struttura
Specifica un'origine dati Delta Lake archiviata in Amazon S3.
Campi
-
Name— Obbligatoria: UTF-8 stringa, corrispondente a. Custom string pattern #68Il nome dell'origine del Delta Lake.
-
Paths— Obbligatorio: una serie di UTF-8 stringhe.Un elenco dei percorsi Amazon S3 da cui leggere.
-
AdditionalDeltaOptions: una matrice della mappa di coppie chiave-valore.Ogni chiave è una UTF-8 stringa, corrispondente a. Custom string pattern #66
Ogni valore è una UTF-8 stringa, corrispondente aCustom string pattern #66.
Specifica opzioni di connessione aggiuntive.
-
AdditionalOptions: un oggetto S3DirectSourceAdditionalOptions.Specifica opzioni aggiuntive per il connettore.
-
OutputSchemas: una matrice di oggetti GlueSchema.Specifica lo schema di dati per l'origine Delta Lake.
S3CatalogDeltaSource struttura
Specifica un'origine dati Delta Lake registrata nel catalogo AWS Glue dati. L'origine dati deve essere archiviata in Amazon S3.
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.Il nome dell'origine dati Delta Lake.
-
Database— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome del database da cui leggere.
-
Table— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome della tabella nel database da cui leggere.
-
AdditionalDeltaOptions: una matrice della mappa di coppie chiave-valore.Ogni chiave è una UTF-8 stringa, corrispondente aCustom string pattern #66.
Ogni valore è una UTF-8 stringa, corrispondente aCustom string pattern #66.
Specifica opzioni di connessione aggiuntive.
-
OutputSchemas: una matrice di oggetti GlueSchema.Specifica lo schema di dati per l'origine Delta Lake.
CatalogDeltaSource struttura
Specifica un'origine dati Delta Lake registrata nel catalogo AWS Glue dati.
Campi
-
Name— Obbligatoria: UTF-8 stringa, corrispondente a. Custom string pattern #68Il nome dell'origine dati Delta Lake.
-
Database— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome del database da cui leggere.
-
Table— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome della tabella nel database da cui leggere.
-
AdditionalDeltaOptions: una matrice della mappa di coppie chiave-valore.Ogni chiave è una UTF-8 stringa, corrispondente aCustom string pattern #66.
Ogni valore è una UTF-8 stringa, corrispondente aCustom string pattern #66.
Specifica opzioni di connessione aggiuntive.
-
OutputSchemas: una matrice di oggetti GlueSchema.Specifica lo schema di dati per l'origine Delta Lake.
S3HudiSource struttura
Specifica un'origine dati Hudi archiviata in. Amazon S3
Campi
-
Name— Obbligatoria: UTF-8 stringa, corrispondente a. Custom string pattern #68Il nome dell'origine Hudi.
-
Paths— Obbligatorio: una serie di UTF-8 stringhe.Un elenco dei percorsi Amazon S3 da cui leggere.
-
AdditionalHudiOptions: una matrice della mappa di coppie chiave-valore.Ogni chiave è una UTF-8 stringa, corrispondente a. Custom string pattern #66
Ogni valore è una UTF-8 stringa, corrispondente aCustom string pattern #66.
Specifica opzioni di connessione aggiuntive.
-
AdditionalOptions: un oggetto S3DirectSourceAdditionalOptions.Specifica opzioni aggiuntive per il connettore.
-
OutputSchemas: una matrice di oggetti GlueSchema.Specifica lo schema di dati per l'origine Hudi.
S3CatalogHudiSource struttura
Specifica un'origine dati Hudi registrata nel catalogo AWS Glue dati. L'origine dati Hudi deve essere archiviata in. Amazon S3
Campi
-
Name— Obbligatoria: UTF-8 stringa, corrispondente a. Custom string pattern #68Il nome dell'origine dati Hudi.
-
Database— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome del database da cui leggere.
-
Table— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome della tabella nel database da cui leggere.
-
AdditionalHudiOptions: una matrice della mappa di coppie chiave-valore.Ogni chiave è una UTF-8 stringa, corrispondente aCustom string pattern #66.
Ogni valore è una UTF-8 stringa, corrispondente aCustom string pattern #66.
Specifica opzioni di connessione aggiuntive.
-
OutputSchemas: una matrice di oggetti GlueSchema.Specifica lo schema di dati per l'origine Hudi.
S3ExcelSource struttura
Specifica un'origine dati S3 Excel.
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.Il nome dell'origine dati S3 Excel.
-
Paths— Obbligatorio: una serie di UTF-8 stringhe.I percorsi S3 in cui si trovano i file Excel.
-
CompressionType— UTF-8 stringa (valori validi:snappy="SNAPPY"|lzo="LZO"|gzip="GZIP"|brotli="BROTLI"| |lz4="LZ4"uncompressed="UNCOMPRESSED"|none="NONE").Il formato di compressione utilizzato per i file Excel.
-
Exclusions— Una matrice di UTF-8 stringhe.Modelli per escludere file o percorsi specifici dall'elaborazione.
-
GroupSize— UTF-8 stringa, corrispondente a. Custom string pattern #66Definisce la dimensione dei gruppi di file per l'elaborazione in batch.
-
GroupFiles— UTF-8 stringa, corrispondente aCustom string pattern #66.Specifica come i file devono essere raggruppati per l'elaborazione.
-
Recurse: booleano.Indica se elaborare le sottodirectory in modo ricorsivo.
-
MaxBand: numero (intero).Il numero massimo di bande di elaborazione da utilizzare.
-
MaxFilesInBand: numero (intero).Il numero massimo di file da elaborare in ogni banda.
-
AdditionalOptions: un oggetto S3DirectSourceAdditionalOptions.Opzioni di configurazione aggiuntive per l'elaborazione delle origini S3 dirette.
-
NumberRows: numero (lungo).Il numero di righe da elaborare da ogni file Excel.
-
SkipFooter: numero (intero).Il numero di righe da saltare alla fine di ogni file Excel.
-
OutputSchemas: una matrice di oggetti GlueSchema.Gli AWS Glue schemi da applicare ai dati elaborati.
CatalogHudiSource struttura
Specifica un'origine dati Hudi registrata nel catalogo AWS Glue dati.
Campi
-
Name— Obbligatoria: UTF-8 stringa, corrispondente a. Custom string pattern #68Il nome dell'origine dati Hudi.
-
Database— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome del database da cui leggere.
-
Table— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome della tabella nel database da cui leggere.
-
AdditionalHudiOptions: una matrice della mappa di coppie chiave-valore.Ogni chiave è una UTF-8 stringa, corrispondente aCustom string pattern #66.
Ogni valore è una UTF-8 stringa, corrispondente aCustom string pattern #66.
Specifica opzioni di connessione aggiuntive.
-
OutputSchemas: una matrice di oggetti GlueSchema.Specifica lo schema di dati per l'origine Hudi.
DynamoDBCatalogSource struttura
Specifica un'origine dati DynamoDB nel catalogo dati. AWS Glue
Campi
-
Name— Obbligatoria: UTF-8 stringa, corrispondente a. Custom string pattern #68Il nome dell'origine dati.
-
Database— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome del database da cui leggere.
-
Table— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome della tabella nel database da cui leggere.
-
PitrEnabled: booleano.Specifica se Point-in-Time il ripristino (PITR) è abilitato per la tabella DynamoDB. Se impostato su
true, consente la lettura a partire da un point-in-time specifico. Il valore predefinito èfalse. -
AdditionalOptions: un oggetto DDBELTCatalogAdditionalOptions.Specifica opzioni di connessione aggiuntive per l'origine dati DynamoDB.
RelationalCatalogSource struttura
Specifica un'origine dei dati del database relazionale nel Catalogo dati di AWS Glue .
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.Il nome dell'origine dati.
-
Database— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome del database da cui leggere.
-
Table— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome della tabella nel database da cui leggere.
JDBCConnectorTarget struttura
Specifica una destinazioni di dati che scrive su Amazon S3 nell'archiviazione a colonne di Apache Parquet.
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.Il nome di destinazione dati.
-
Inputs— Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.I nodi che sono input per la destinazione di dati.
-
ConnectionName— Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #66Il nome della connessione associata al connettore.
-
ConnectionTable— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome della tabella nella destinazione di dati.
-
ConnectorName— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome di un connettore che verrà utilizzato.
-
ConnectionType— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il tipo di connessione, come marketplace.jdbc o custom.jdbc, che designa una connessione a una destinazione di dati JDBC.
-
AdditionalOptions: una matrice della mappa di coppie chiave-valore.Ogni chiave è una UTF-8 stringa, corrispondente aCustom string pattern #66.
Ogni valore è una UTF-8 stringa, corrispondente aCustom string pattern #66.
Opzioni di connessione aggiuntive per il connettore.
-
OutputSchemas: una matrice di oggetti GlueSchema.Specifica lo schema dati per la destinazione JDBC.
SparkConnectorTarget struttura
Specifica una destinazione che utilizza un connettore Apache Spark.
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.Il nome di destinazione dati.
-
Inputs— Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.I nodi che sono input per la destinazione di dati.
-
ConnectionName— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome di una connessione per un connettore Apache Spark.
-
ConnectorName— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome di un connettore Apache Spark.
-
ConnectionType— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il tipo di connessione, come marketplace.spark o custom.spark, che designa una connessione a un archivio dati di Apache Spark.
-
AdditionalOptions: una matrice della mappa di coppie chiave-valore.Ogni chiave è una UTF-8 stringa, corrispondente aCustom string pattern #66.
Ogni valore è una UTF-8 stringa, corrispondente aCustom string pattern #66.
Opzioni di connessione aggiuntive per il connettore.
-
OutputSchemas: una matrice di oggetti GlueSchema.Specifica lo schema di dati per la destinazione Spark personalizzata.
BasicCatalogTarget struttura
Specifica una destinazione che utilizza una tabella AWS Glue Data Catalog.
Campi
-
Name— Obbligatoria: UTF-8 stringa, corrispondente a. Custom string pattern #68Il nome della destinazione di dati.
-
Inputs— Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.I nodi che sono input per la destinazione di dati.
-
PartitionKeys— Una serie di stringhe. UTF-8Le chiavi di partizione utilizzate per distribuire i dati in più partizioni o shard in base a una chiave o a un set di chiavi specifici.
-
Database— Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #66Il database che contiene la tabella da utilizzare come destinazione. Questo database deve esistere già nel catalogo dati.
-
Table— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.La tabella che definisce lo schema dei dati di output. Questa tabella deve esistere già nel Data Catalog.
MySQLCatalogTarget struttura
Specifica una destinazione che utilizza MySQL.
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.Il nome di destinazione dati.
-
Inputs— Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.I nodi che sono input per la destinazione di dati.
-
Database— Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #66Il nome del database in cui scrivere.
-
Table— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome della tabella del database in cui scrivere.
PostgreSQLCatalogTarget struttura
Specifica una destinazione che utilizza Postgres SQL.
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.Il nome di destinazione dati.
-
Inputs— Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.I nodi che sono input per la destinazione di dati.
-
Database— Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #66Il nome del database in cui scrivere.
-
Table— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome della tabella del database in cui scrivere.
OracleSQLCatalogTarget struttura
Specifica una destinazione che utilizza Oracle SQL.
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.Il nome di destinazione dati.
-
Inputs— Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.I nodi che sono input per la destinazione di dati.
-
Database— Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #66Il nome del database in cui scrivere.
-
Table— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome della tabella del database in cui scrivere.
MicrosoftSQLServerCatalogTarget struttura
Specifica una destinazione che utilizza Microsoft SQL.
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.Il nome di destinazione dati.
-
Inputs— Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.I nodi che sono input per la destinazione di dati.
-
Database— Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #66Il nome del database in cui scrivere.
-
Table— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome della tabella del database in cui scrivere.
RedshiftTarget struttura
Specifica una destinazione che utilizza Amazon Redshift.
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.Il nome di destinazione dati.
-
Inputs— Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.I nodi che sono input per la destinazione di dati.
-
Database— Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #66Il nome del database in cui scrivere.
-
Table— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome della tabella del database in cui scrivere.
-
RedshiftTmpDir— UTF-8 stringa, corrispondente aCustom string pattern #66.Il percorso Amazon S3 in cui i dati temporanei possono essere caricati durante la copia dal database.
-
TmpDirIAMRole— UTF-8 stringa, corrispondente aCustom string pattern #66.Il ruolo IAM con autorizzazioni.
-
UpsertRedshiftOptions: un oggetto UpsertRedshiftTargetOptions.Il set di opzioni per configurare un'operazione di upsert durante la scrittura su una destinazione Redshift.
AmazonRedshiftTarget struttura
Specifica una destinazione Amazon Redshift.
Campi
-
Name— UTF-8 stringa, corrispondente aCustom string pattern #68.Il nome della tabella Amazon Redshift.
-
Data: un oggetto AmazonRedshiftNodeData.Specifica i dati del nodo di destinazione Amazon Redshift.
-
Inputs— Una matrice di UTF-8 stringhe, non meno di 1 o più di 1 stringa.I nodi che sono input per la destinazione di dati.
UpsertRedshiftTargetOptions struttura
Le opzioni per configurare un'operazione di upsert durante la scrittura su una destinazione Redshift.
Campi
-
TableLocation— UTF-8 stringa, corrispondente aCustom string pattern #66.La posizione fisica della tabella Redshift.
-
ConnectionName— UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome della connessione da usare per scrivere su Redshift.
-
UpsertKeys— Una serie di UTF-8 stringhe.Le chiavi utilizzate per determinare se eseguire un aggiornamento o un inserimento.
S3CatalogTarget struttura
Specifica un target di dati che scrive su Amazon S3 utilizzando il AWS Glue Data Catalog.
Campi
-
Name— Obbligatoria: UTF-8 stringa, corrispondente a. Custom string pattern #68Il nome di destinazione dati.
-
Inputs— Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.I nodi che sono input per la destinazione di dati.
-
PartitionKeys— Una serie di stringhe. UTF-8Specifica il partizionamento nativo utilizzando una sequenza di chiavi.
-
Table— Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #66Il nome della tabella del database in cui scrivere.
-
Database— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome del database in cui scrivere.
-
SchemaChangePolicy: un oggetto CatalogSchemaChangePolicy.Una policy che specifica i comportamenti di aggiornamento per il crawler.
-
AutoDataQuality: un oggetto AutoDataQuality.Specifica se abilitare automaticamente la valutazione della qualità dei dati per il catalogo S3 di destinazione. Se impostato su
true, i controlli di qualità dei dati vengono eseguiti automaticamente durante l'operazione di scrittura.
S3GlueParquetTarget struttura
Specifica una destinazioni di dati che scrive su Amazon S3 nell'archiviazione a colonne di Apache Parquet.
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.Il nome di destinazione dati.
-
Inputs— Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.I nodi che sono input per la destinazione di dati.
-
PartitionKeys— Una serie di stringhe. UTF-8Specifica il partizionamento nativo utilizzando una sequenza di chiavi.
-
Path— Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #66Un singolo percorso Amazon S3 su cui scrivere.
-
Compression— UTF-8 stringa (valori validi:snappy="SNAPPY"|lzo="LZO"|gzip="GZIP"|brotli="BROTLI"|lz4="LZ4"|uncompressed="UNCOMPRESSED"|none="NONE").Specifica il modo in cui i dati sono compressi. In genere questo non è necessario se i dati hanno un'estensione del file standard. I valori possibili sono
"gzip"e"bzip"). -
NumberTargetPartitions— UTF-8 stringa.Specifica il numero di partizioni di destinazione per i file Parquet durante la scrittura in Amazon S3 utilizzando AWS Glue.
-
SchemaChangePolicy: un oggetto DirectSchemaChangePolicy.Una policy che specifica i comportamenti di aggiornamento per il crawler.
-
AutoDataQuality: un oggetto AutoDataQuality.Specifica se abilitare automaticamente la valutazione della qualità dei dati per il target S3 AWS Glue Parquet. Se impostato su
true, i controlli di qualità dei dati vengono eseguiti automaticamente durante l'operazione di scrittura.
CatalogSchemaChangePolicy struttura
Una policy che specifica i comportamenti di aggiornamento per il crawler.
Campi
-
EnableUpdateCatalog: booleano.Stabilisce se usare il comportamento di aggiornamento quando il crawler riscontra una variazione dello schema.
-
UpdateBehavior— UTF-8 stringa (valori validi:UPDATE_IN_DATABASE|LOG).Il comportamento di aggiornamento quando il crawler riscontra una variazione dello schema.
S3DirectTarget struttura
Specifica una destinazione di dati che scrive su Amazon S3.
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.Il nome di destinazione dati.
-
Inputs— Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.I nodi che sono input per la destinazione di dati.
-
PartitionKeys— Una serie di stringhe. UTF-8Specifica il partizionamento nativo utilizzando una sequenza di chiavi.
-
Path— Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #66Un singolo percorso Amazon S3 su cui scrivere.
-
Compression— UTF-8 stringa, corrispondente aCustom string pattern #66.Specifica il modo in cui i dati sono compressi. In genere questo non è necessario se i dati hanno un'estensione del file standard. I valori possibili sono
"gzip"e"bzip"). -
NumberTargetPartitions— UTF-8 stringa.Specifica il numero di partizioni di destinazione durante la scrittura dei dati direttamente in Amazon S3.
-
Format— Obbligatorio: UTF-8 stringa (valori validi:json="JSON"csv="CSV"avro="AVRO"|orc="ORC"| |parquet="PARQUET"|hudi="HUDI"|delta="DELTA"|iceberg="ICEBERG"|hyper="HYPER"| |xml="XML").Specifica il formato di output dei dati per la destinazione.
-
SchemaChangePolicy: un oggetto DirectSchemaChangePolicy.Una policy che specifica i comportamenti di aggiornamento per il crawler.
-
AutoDataQuality: un oggetto AutoDataQuality.Specifica se abilitare automaticamente la valutazione della qualità dei dati per la destinazione diretta S3. Se impostato su
true, i controlli di qualità dei dati vengono eseguiti automaticamente durante l'operazione di scrittura. -
OutputSchemas: una matrice di oggetti GlueSchema.Specifica lo schema di dati per la destinazione diretta S3.
S3HudiCatalogTarget struttura
Specifica una destinazione che scrive su un'origine dati Hudi nel catalogo AWS Glue dati.
Campi
-
Name— Obbligatoria: UTF-8 stringa, corrispondente a. Custom string pattern #68Il nome di destinazione dati.
-
Inputs— Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.I nodi che sono input per la destinazione di dati.
-
PartitionKeys— Una serie di stringhe. UTF-8Specifica il partizionamento nativo utilizzando una sequenza di chiavi.
-
Table— Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #66Il nome della tabella del database in cui scrivere.
-
Database— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome del database in cui scrivere.
-
AdditionalOptions- obbligatorio: una matrice della mappa di coppie chiave-valore.Ogni chiave è una UTF-8 stringa, corrispondente aCustom string pattern #66.
Ogni valore è una UTF-8 stringa, corrispondente aCustom string pattern #66.
Specifica le opzioni di connessione aggiuntive per il connettore.
-
SchemaChangePolicy: un oggetto CatalogSchemaChangePolicy.Una policy che specifica i comportamenti di aggiornamento per il crawler.
-
AutoDataQuality: un oggetto AutoDataQuality.Specifica se abilitare automaticamente la valutazione della qualità dei dati per il catalogo S3 Hudi di destinazione. Se impostato su
true, i controlli di qualità dei dati vengono eseguiti automaticamente durante l'operazione di scrittura. -
OutputSchemas: una matrice di oggetti GlueSchema.Specifica lo schema di dati per il catalogo S3 Hudi di destinazione.
S3HudiDirectTarget struttura
Specifica una destinazione che scrive su un'origine dati Hudi in. Amazon S3
Campi
-
Name— Obbligatoria: UTF-8 stringa, corrispondente a. Custom string pattern #68Il nome di destinazione dati.
-
Inputs— Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.I nodi che sono input per la destinazione di dati.
-
Path— Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #66Il percorso Amazon S3 dell'origine dati Hudi su cui scrivere.
-
Compression— Obbligatorio: UTF-8 stringa (valori validi:gzip="GZIP"lzo="LZO"|uncompressed="UNCOMPRESSED"| |snappy="SNAPPY").Specifica il modo in cui i dati sono compressi. In genere questo non è necessario se i dati hanno un'estensione del file standard. I valori possibili sono
"gzip"e"bzip"). -
NumberTargetPartitions— UTF-8 stringa.Specifica il numero di partizioni della destinazione per la distribuzione dei file del set di dati Hudi in Amazon S3.
-
PartitionKeys— Una serie di UTF-8 stringhe.Specifica il partizionamento nativo utilizzando una sequenza di chiavi.
-
Format— Obbligatorio: UTF-8 stringa (valori validi:json="JSON"csv="CSV"|avro="AVRO"|orc="ORC"|parquet="PARQUET"| |hudi="HUDI"|delta="DELTA"|iceberg="ICEBERG"|hyper="HYPER"|xml="XML").Specifica il formato di output dei dati per la destinazione.
-
AdditionalOptions- obbligatorio: una matrice della mappa di coppie chiave-valore.Ogni chiave è una UTF-8 stringa, corrispondente aCustom string pattern #66.
Ogni valore è una UTF-8 stringa, corrispondente aCustom string pattern #66.
Specifica le opzioni di connessione aggiuntive per il connettore.
-
SchemaChangePolicy: un oggetto DirectSchemaChangePolicy.Una policy che specifica i comportamenti di aggiornamento per il crawler.
-
AutoDataQuality: un oggetto AutoDataQuality.Specifica se abilitare automaticamente la valutazione della qualità dei dati per la destinazione diretta S3 Hudi. Se impostato su
true, i controlli di qualità dei dati vengono eseguiti automaticamente durante l'operazione di scrittura.
S3DeltaCatalogTarget struttura
Specifica una destinazione che scrive su un'origine dati Delta Lake nel AWS Glue Data Catalog.
Campi
-
Name— Obbligatoria: UTF-8 stringa, corrispondente a. Custom string pattern #68Il nome di destinazione dati.
-
Inputs— Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.I nodi che sono input per la destinazione di dati.
-
PartitionKeys— Una serie di stringhe. UTF-8Specifica il partizionamento nativo utilizzando una sequenza di chiavi.
-
Table— Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #66Il nome della tabella del database in cui scrivere.
-
Database— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome del database in cui scrivere.
-
AdditionalOptions: una matrice della mappa di coppie chiave-valore.Ogni chiave è una UTF-8 stringa, corrispondente aCustom string pattern #66.
Ogni valore è una UTF-8 stringa, corrispondente aCustom string pattern #66.
Specifica le opzioni di connessione aggiuntive per il connettore.
-
SchemaChangePolicy: un oggetto CatalogSchemaChangePolicy.Una policy che specifica i comportamenti di aggiornamento per il crawler.
-
AutoDataQuality: un oggetto AutoDataQuality.Specifica se abilitare automaticamente la valutazione della qualità dei dati per il catalogo S3 Delta di destinazione. Se impostato su
true, i controlli di qualità dei dati vengono eseguiti automaticamente durante l'operazione di scrittura. -
OutputSchemas: una matrice di oggetti GlueSchema.Specifica lo schema di dati per il catalogo S3 Delta di destinazione.
S3DeltaDirectTarget struttura
Specifica una destinazione che scrive su un'origine dati Delta Lake in Amazon S3.
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #68Il nome di destinazione dati.
-
Inputs— Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.I nodi che sono input per la destinazione di dati.
-
PartitionKeys— Una serie di stringhe. UTF-8Specifica il partizionamento nativo utilizzando una sequenza di chiavi.
-
Path— Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #66Il percorso Amazon S3 dell'origine dati Delta Lake su cui scrivere.
-
Compression— Obbligatorio: UTF-8 stringa (valori validi:uncompressed="UNCOMPRESSED"|snappy="SNAPPY").Specifica il modo in cui i dati sono compressi. In genere questo non è necessario se i dati hanno un'estensione del file standard. I valori possibili sono
"gzip"e"bzip"). -
NumberTargetPartitions— UTF-8 stringa.Specifica il numero di partizioni della destinazione per la distribuzione dei file del set di dati Delta Lake in Amazon S3.
-
Format— Obbligatorio: UTF-8 stringa (valori validi:json="JSON"csv="CSV"avro="AVRO"|orc="ORC"| |parquet="PARQUET"|hudi="HUDI"|delta="DELTA"|iceberg="ICEBERG"|hyper="HYPER"| |xml="XML").Specifica il formato di output dei dati per la destinazione.
-
AdditionalOptions: una matrice della mappa di coppie chiave-valore.Ogni chiave è una UTF-8 stringa, corrispondente aCustom string pattern #66.
Ogni valore è una UTF-8 stringa, corrispondente aCustom string pattern #66.
Specifica le opzioni di connessione aggiuntive per il connettore.
-
SchemaChangePolicy: un oggetto DirectSchemaChangePolicy.Una policy che specifica i comportamenti di aggiornamento per il crawler.
-
AutoDataQuality: un oggetto AutoDataQuality.Specifica se abilitare automaticamente la valutazione della qualità dei dati per la destinazione diretta S3 Delta. Se impostato su
true, i controlli di qualità dei dati vengono eseguiti automaticamente durante l'operazione di scrittura.
S3HyperDirectTarget struttura
Specifica un target di HyperDirect dati che scrive su Amazon S3.
Campi
-
Name— Obbligatoria: UTF-8 stringa, corrispondente a. Custom string pattern #68L'identificatore univoco per il nodo HyperDirect di destinazione.
-
Inputs— Obbligatorio: una matrice di UTF-8 stringhe, non meno di 1 o più di 1 stringa.Specifica la fonte di input per la destinazione. HyperDirect
-
Format— UTF-8 stringa (valori validi:json="JSON"|csv="CSV"| |avro="AVRO"|orc="ORC"|parquet="PARQUET"|hudi="HUDI"|delta="DELTA"| |iceberg="ICEBERG"hyper="HYPER"|xml="XML").Specifica il formato di output dei dati per la HyperDirect destinazione.
-
PartitionKeys— Una matrice di UTF-8 stringhe.Definisce la strategia di partizionamento per i dati di output.
-
Path— Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #66La posizione S3 dove verranno scritti i dati di output.
-
Compression— UTF-8 stringa (valori validi:uncompressed="UNCOMPRESSED").Il tipo di compressione da applicare ai dati di output.
-
SchemaChangePolicy: un oggetto DirectSchemaChangePolicy.Definisce come vengono gestite le modifiche allo schema durante le operazioni di scrittura.
-
AutoDataQuality: un oggetto AutoDataQuality.Specifica se abilitare automaticamente la valutazione della qualità dei dati per la destinazione diretta S3 Hyper. Se impostato su
true, i controlli di qualità dei dati vengono eseguiti automaticamente durante l'operazione di scrittura. -
OutputSchemas: una matrice di oggetti GlueSchema.Specifica lo schema di dati per la destinazione diretta S3 Hyper.
S3IcebergDirectTarget struttura
Specifica una destinazione che scrive su un'origine dati Iceberg in Amazon S3.
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.Specifica l'identificatore univoco per il nodo di destinazione Iceberg nella pipeline di dati.
-
Inputs— Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.Definisce la singola origine di input che fornisce i dati a questa destinazione Iceberg.
-
PartitionKeys— Una serie di stringhe. UTF-8Specifica le colonne utilizzate per partizionare i dati della tabella Iceberg in S3.
-
Path— Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #66Definisce la posizione S3 in cui saranno archiviati i dati della tabella Iceberg.
-
Format— Obbligatorio: UTF-8 stringa (valori validi:json="JSON"csv="CSV"avro="AVRO"|orc="ORC"| |parquet="PARQUET"|hudi="HUDI"|delta="DELTA"|iceberg="ICEBERG"|hyper="HYPER"| |xml="XML").Specifica il formato di file utilizzato per l'archiviazione dei dati della tabella Iceberg (ad es., Parquet, ORC).
-
AdditionalOptions: una matrice della mappa di coppie chiave-valore.Ogni chiave è una UTF-8 stringa, corrispondente aCustom string pattern #66.
Ogni valore è una UTF-8 stringa, corrispondente aCustom string pattern #66.
Fornisce opzioni di configurazione aggiuntive per la personalizzazione del comportamento della tabella Iceberg.
-
SchemaChangePolicy: un oggetto DirectSchemaChangePolicy.Definisce come vengono gestite le modifiche allo schema durante la scrittura dei dati nella tabella Iceberg.
-
Compression— Obbligatorio: UTF-8 stringa (valori validi:gzip="GZIP"lzo="LZO"|uncompressed="UNCOMPRESSED"| |snappy="SNAPPY").Specifica il codec di compressione utilizzato per i file della tabella Iceberg in S3.
-
NumberTargetPartitions— UTF-8 stringa.Imposta il numero di partizioni della destinazione per la distribuzione dei file della tabella Iceberg in S3.
-
OutputSchemas: una matrice di oggetti GlueSchema.Specifica lo schema di dati per la destinazione diretta S3 Iceberg.
DirectSchemaChangePolicy struttura
Una policy che specifica i comportamenti di aggiornamento per il crawler.
Campi
-
EnableUpdateCatalog: booleano.Stabilisce se usare il comportamento di aggiornamento quando il crawler riscontra una variazione dello schema.
-
UpdateBehavior— UTF-8 stringa (valori validi:UPDATE_IN_DATABASE|LOG).Il comportamento di aggiornamento quando il crawler riscontra una variazione dello schema.
-
Table— UTF-8 stringa, corrispondente aCustom string pattern #66.Specifica la tabella nel database a cui si applica la policy di modifica dello schema.
-
Database— UTF-8 stringa, corrispondente aCustom string pattern #66.Specifica il database a cui si applica la policy di modifica dello schema.
ApplyMapping struttura
Specifica una trasformazione che mappa le chiavi delle proprietà dei dati nell'origine dei dati alle chiavi delle proprietà dei dati nella destinazione. È possibile rinominare le chiavi, modificare i tipi di dati per le chiavi e scegliere le chiavi da eliminare dal set di dati.
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.Il nome del nodo di trasformazione.
-
Inputs— Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.Gli input di dati identificati dai nomi dei nodi.
-
Mapping- obbligatorio: una matrice di oggetti Mapping.Specifica la mappatura delle chiavi delle proprietà dei dati nell'origine dei dati alle chiavi delle proprietà dei dati nella destinazione.
Struttura mappatura
Specifica la mappatura delle chiavi della proprietà dati.
Campi
-
ToKey— UTF-8 stringa, corrispondente a. Custom string pattern #66Dopo l'applicazione della mappatura, quale dovrebbe essere il nome della colonna. Può coincidere con
FromPath. -
FromPath— Una serie di UTF-8 stringhe.La tabella o la colonna da modificare.
-
FromType— UTF-8 stringa, corrispondente a. Custom string pattern #66Il tipo di dati da modificare.
-
ToType— UTF-8 stringa, corrispondente aCustom string pattern #66.Tipo di dati che devono essere modificati.
-
Dropped: booleano.Se è true, la colonna viene rimossa.
-
Children: una matrice di oggetti Mapping.Applicabile solo alle strutture dati nidificate. Se si desidera modificare la struttura padre, ma anche uno dei suoi figli, è possibile compilare questa struttura di dati. È anche
Mapping, ma il suoFromPathsarà la struttura padreFromPathpiù ilFromPathda questa struttura.Per la parte dei figli, supponiamo di avere la struttura:
{ "FromPath": "OuterStructure", "ToKey": "OuterStructure", "ToType": "Struct", "Dropped": false, "Chidlren": [{ "FromPath": "inner", "ToKey": "inner", "ToType": "Double", "Dropped": false, }] }Puoi specificare un
Mappingcon l'aspetto:{ "FromPath": "OuterStructure", "ToKey": "OuterStructure", "ToType": "Struct", "Dropped": false, "Chidlren": [{ "FromPath": "inner", "ToKey": "inner", "ToType": "Double", "Dropped": false, }] }
SelectFields struttura
Specifica una trasformazione che sceglie le chiavi della proprietà dati che si desidera conservare.
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.Il nome del nodo di trasformazione.
-
Inputs— Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.Gli input di dati identificati dai nomi dei nodi.
-
Paths— Obbligatorio: una serie di stringhe. UTF-8Un percorso JSON a una variabile nella struttura dati.
DropFields struttura
Specifica una trasformazione che sceglie le chiavi della proprietà dati che si desidera eliminare.
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.Il nome del nodo di trasformazione.
-
Inputs— Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.Gli input di dati identificati dai nomi dei nodi.
-
Paths— Obbligatorio: una serie di stringhe. UTF-8Un percorso JSON a una variabile nella struttura dati.
RenameField struttura
Specifica una trasformazione che rinominerà una singola chiave di proprietà dati.
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.Il nome del nodo di trasformazione.
-
Inputs— Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.Gli input di dati identificati dai nomi dei nodi.
-
SourcePath— Obbligatorio: una serie di stringhe. UTF-8Un percorso JSON a una variabile nella struttura dati per i dati di origine.
-
TargetPath— Obbligatorio: una serie di UTF-8 stringhe.Un percorso JSON a una variabile nella struttura dati per i dati di destinazione.
Struttura Spigot
Specifica una trasformazione che scrive campioni dei dati in un bucket Amazon S3.
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #68Il nome del nodo di trasformazione.
-
Inputs— Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.Gli input di dati identificati dai nomi dei nodi.
-
Path— Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #66Un percorso in Amazon S3 dove la trasformazione scriverà un sottoinsieme di registri dal set di dati in un file JSON in un bucket Amazon S3.
-
Topk: numero (intero), non superiore a 100.Specifica un numero di registri da scrivere a partire dall'inizio del set di dati.
-
Prob: numero (doppio), non superiore a 1.La probabilità (un valore decimale con un valore massimo di 1) di scegliere un determinato registro. Il valore 1 indica che ogni riga letta dal set di dati deve essere inclusa nell'output del campione.
Struttura join
Specifica una trasformazione che unisce due set di dati in un unico set di dati utilizzando una frase di confronto sulle chiavi di proprietà dei dati specificate. È possibile utilizzare inner, outer, left, right, left semi e left anti join.
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.Il nome del nodo di trasformazione.
-
Inputs— Obbligatorio: una serie di UTF-8 stringhe, non meno di 2 o più di 2 stringhe.Gli input di dati identificati dai nomi dei nodi.
-
JoinType— Obbligatorio: UTF-8 stringa (valori validi:equijoin="EQUIJOIN"|left="LEFT"| |right="RIGHT"|outer="OUTER"leftsemi="LEFT_SEMI"|leftanti="LEFT_ANTI").Specifica il tipo di join da eseguire sui set di dati.
-
Columns- obbligatorio: una matrice di oggetti JoinColumn, non inferiore a o superiore a 2 strutture.Un elenco delle due colonne da unire.
JoinColumn struttura
Specifica una colonna da unire.
Campi
-
From— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.La colonna da unire.
-
Keys— Obbligatorio: una serie di UTF-8 stringhe.La chiave della colonna da unire.
SplitFields struttura
Specifica una trasformazione che divide le chiavi della proprietà dati in due DynamicFrames. L'output è una raccolta di DynamicFrames: uno con le chiavi di proprietà dei dati selezionate e uno con le chiavi di proprietà dei dati rimanenti.
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.Il nome del nodo di trasformazione.
-
Inputs— Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.Gli input di dati identificati dai nomi dei nodi.
-
Paths— Obbligatorio: una serie di stringhe. UTF-8Un percorso JSON a una variabile nella struttura dati.
SelectFromCollection struttura
Specifica una trasformazione che sceglie un DynamicFrame da una raccolta di DynamicFrames. L'output è il DynamicFrame selezionato
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.Il nome del nodo di trasformazione.
-
Inputs— Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.Gli input di dati identificati dai nomi dei nodi.
-
Index- obbligatorio: numero (intero).L'indice per il file DynamicFrame da selezionare.
FillMissingValues struttura
Specifica una trasformazione che individua i registri nel set di dati che hanno valori mancanti e aggiunge un nuovo campo con un valore determinato dall'imputazione. Il set di dati di input viene utilizzato per addestrare il modello di machine learning che determina quale dovrebbe essere il valore mancante.
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.Il nome del nodo di trasformazione.
-
Inputs— Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.Gli input di dati identificati dai nomi dei nodi.
-
ImputedPath— Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #66Un percorso JSON a una variabile nella struttura dati per il set di dati imputato.
-
FilledPath— UTF-8 stringa, corrispondente aCustom string pattern #66.Un percorso JSON a una variabile nella struttura dati per il set di dati compilato.
Struttura filtro
Specifica una trasformazione che divide un set di dati in due, in base a una condizione di filtro.
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.Il nome del nodo di trasformazione.
-
Inputs— Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.Gli input di dati identificati dai nomi dei nodi.
-
LogicalOperator— Obbligatorio: UTF-8 stringa (valori validi:AND|OR).L'operatore utilizzato per filtrare le righe confrontando il valore chiave con un valore specificato.
-
Filters- obbligatorio: una matrice di oggetti FilterExpression.Specifica un'espressione di filtro.
FilterExpression struttura
Specifica un'espressione di filtro.
Campi
-
Operation— Obbligatorio: UTF-8 stringa (valori validi:EQLT|GT|LTE|GTE|REGEX| |ISNULL).Tipo di operazione da eseguire nell'espressione.
-
Negated: booleano.Se l'espressione deve essere negata.
-
Values- obbligatorio: una matrice di oggetti FilterValue.Un elenco di valori di filtro.
FilterValue struttura
Rappresenta un'unica voce nell'elenco di valori di un FilterExpression.
Campi
-
Type— Obbligatorio: UTF-8 stringa (valori validi:COLUMNEXTRACTED|CONSTANT).Il tipo di valore del filtro.
-
Value— Obbligatorio: una matrice di UTF-8 stringhe.Il valore da associare.
CustomCode struttura
Specifica una trasformazione che utilizza il codice personalizzato fornito per eseguire la trasformazione dei dati. L'output è una raccolta di DynamicFrames.
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.Il nome del nodo di trasformazione.
-
Inputs— Obbligatorio: una matrice di UTF-8 stringhe, almeno 1 stringa.Gli input di dati identificati dai nomi dei nodi.
-
Code— Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #59Il codice personalizzato utilizzato per eseguire la trasformazione dei dati.
-
ClassName— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome definito per la classe del nodo di codice personalizzato.
-
OutputSchemas: una matrice di oggetti GlueSchema.Specifica lo schema di dati per la trasformazione del codice personalizzata.
Struttura SparkSQL
Specifica una trasformazione in cui si inserisce una query SQL utilizzando la sintassi Spark SQL per trasformare i dati. L'output è un singolo DynamicFrame.
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.Il nome del nodo di trasformazione.
-
Inputs— Obbligatorio: una matrice di UTF-8 stringhe, almeno 1 stringa.Gli input di dati identificati dai nomi dei nodi. È possibile associare un nome di tabella a ciascun nodo di input da utilizzare nella query SQL. Il nome scelto deve soddisfare le restrizioni sui nomi di Spark SQL.
-
SqlQuery— Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #67Query SQL che deve utilizzare la sintassi Spark SQL e restituire un singolo set di dati.
-
SqlAliases- obbligatorio: una matrice di oggetti SqlAlias.Un elenco di alias. Un alias permette di specificare il nome da utilizzare nell'SQL per un determinato input. Ad esempio, hai un'origine dati denominata "». MyDataSource Se specifichi
Fromas MyDataSource eAliasas SqlName, nel tuo SQL puoi fare:select * from SqlNamee questo ottiene dati da MyDataSource.
-
OutputSchemas: una matrice di oggetti GlueSchema.Specifica lo schema di dati per la trasformazione SparkSQL.
SqlAlias struttura
Rappresenta un'unica voce nell'elenco di valori per SqlAliases.
Campi
-
From— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #65.Una tabella o una colonna in una tabella.
-
Alias— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Un nome temporaneo dato a una tabella o a una colonna in una tabella.
DropNullFields struttura
Specifica una trasformazione che rimuove le colonne dal set di dati se tutti i valori nella colonna sono “null”. Per impostazione predefinita, AWS Glue Studio riconoscerà gli oggetti nulli, ma alcuni valori come stringhe vuote, stringhe «nulle», numeri interi -1 o altri segnaposto come gli zeri, non vengono riconosciuti automaticamente come nulli.
Campi
-
Name— Obbligatorio: stringa, corrispondente a. UTF-8 Custom string pattern #68Il nome del nodo di trasformazione.
-
Inputs— Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.Gli input di dati identificati dai nomi dei nodi.
-
NullCheckBoxList: un oggetto NullCheckBoxList.Struttura che indica se determinati valori siano riconosciuti come valori nulli per la rimozione.
-
NullTextList: una matrice di oggetti NullValueField, non superiore a 50 strutture.Una struttura che specifica un elenco di NullValueField strutture che rappresentano un valore nullo personalizzato come zero o un altro valore utilizzato come segnaposto nullo univoco per il set di dati.
La trasformazione
DropNullFieldsrimuove i valori nulli personalizzati solo se sia il valore del segnaposto null che il tipo di dati corrispondono ai dati.
NullCheckBoxList struttura
Indica se alcuni valori siano riconosciuti come valori nulli per la rimozione.
Campi
-
IsEmpty: booleano.Specifica che una stringa vuota è considerata un valore nullo.
-
IsNullString: booleano.Specifica che un valore che indica la parola “null” è considerato un valore nullo.
-
IsNegOne: booleano.Specifica che un valore intero di -1 è considerato un valore nullo.
NullValueField struttura
Rappresenta un valore nullo personalizzato, ad esempio uno zero o un altro valore utilizzato come segnaposto nullo univoco per il set di dati.
Campi
-
Value— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il valore del segnaposto nullo.
-
Datatype- obbligatorio: un oggetto DataType.Il tipo di dati del valore.
Struttura Datatype
Struttura che rappresenta il tipo di dati del valore.
Campi
-
Id— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #65.Il tipo di dati del valore.
-
Label— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #65.Etichetta assegnata al tipo di dati.
Struttura Merge
Specifica una trasformazione che unisce DynamicFrame a con un DynamicFrame di staging basato sulle chiavi primarie specificate per identificare i registri. I registri duplicati (registri con le stesse chiavi primarie) non vengono deduplicati.
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.Il nome del nodo di trasformazione.
-
Inputs— Obbligatorio: una serie di UTF-8 stringhe, non meno di 2 o più di 2 stringhe.Gli input di dati identificati dai nomi dei nodi.
-
Source— Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #65L'origine
DynamicFrameche sarà unita aDynamicFramedi staging. -
PrimaryKeys— Obbligatorio: una serie di UTF-8 stringhe.L'elenco dei campi chiave primaria per abbinare i registri dall'origine e dai frame dinamici di staging.
Struttura unione
Specifica una trasformazione che combina le righe di due o più set di dati in un unico risultato.
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #68Il nome del nodo di trasformazione.
-
Inputs— Obbligatorio: una serie di UTF-8 stringhe, non meno di 2 o più di 2 stringhe.L'ID del nodo immette la trasformazione.
-
UnionType— Obbligatorio: UTF-8 stringa (valori validi:ALL|DISTINCT).Indica il tipo di trasformazione Union.
Specifica
ALLdi unire tutte le righe dalle origini dati a quelle risultanti DynamicFrame. L'unione risultante non rimuove le righe duplicate.Specifica
DISTINCTdi rimuovere le righe duplicate nel risultato. DynamicFrame
Struttura PIIDetection
Specifica una trasformazione che identifica, rimuove o maschera i dati PII.
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #68Il nome del nodo di trasformazione.
-
Inputs— Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.L'ID del nodo immette la trasformazione.
-
PiiType— Obbligatorio: UTF-8 stringa (valori validi:RowAudit|RowHashing| |RowMasking|RowPartialMasking|ColumnAuditColumnHashing|ColumnMasking).Indica il tipo di trasformazione PIIDetection.
-
EntityTypesToDetect— Obbligatorio: una serie di UTF-8 stringhe.Indica i tipi di entità che la trasformazione PIIDetection identificherà come dati PII.
Le entità di tipo PII includono: PERSON_NAME, DATE, USA_SNN, EMAIL, USA_ITIN, USA_PASSPORT_NUMBER, PHONE_NUMBER, BANK_ACCOUNT, IP_ADDRESS, MAC_ADDRESS, USA_CPT_CODE, USA_HCPCS_CODE, USA_NATIONAL_DRUG_CODE, USA_MEDICARE_BENEFICIARY_IDENTIFIER, USA_HEALTH_INSURANCE_CLAIM_NUMBER,CREDIT_CARD,USA_NATIONAL_PROVIDER_IDENTIFIER,USA_DEA_NUMBER,USA_DRIVING_LICENSE
-
OutputColumnName— UTF-8 stringa, corrispondente a. Custom string pattern #66Indica il nome della colonna di output che conterrà qualsiasi tipo di entità rilevato in quella riga.
-
SampleFraction: numero (doppio), non superiore a 1.Indica la frazione dei dati da campionare durante la scansione di entità PII.
-
ThresholdFraction: numero (doppio), non superiore a 1.Indica la frazione dei dati che devono essere soddisfatti per identificare una colonna come dati PII.
-
MaskValue— UTF-8 stringa, lunga non più di 256 byte, corrispondente a. Custom string pattern #63Indica il valore che sostituirà l'entità rilevata.
-
RedactText— UTF-8 stringa, corrispondente a. Custom string pattern #66Specifica se oscurare il testo contenente informazioni di identificazione personale (PII) rilevato. Se impostato su
true, il contenuto con PII viene sostituito con caratteri di redazione. -
RedactChar— UTF-8 stringa, corrispondente aCustom string pattern #66.Il carattere utilizzato per sostituire il contenuto con PII rilevato quando è attivato l'oscuramento. Il carattere di redazione predefinito è
*. -
MatchPattern— UTF-8 stringa, corrispondente aCustom string pattern #66.Un modello di espressione regolare utilizzato per identificare il contenuto con PII aggiuntivo oltre gli algoritmi di rilevamento standard.
-
NumLeftCharsToExclude: numero (intero).Il numero di caratteri da escludere dalla redazione a sinistra del contenuto con PII rilevato. In questo modo è possibile preservare il contesto attorno ai dati sensibili.
-
NumRightCharsToExclude: numero (intero).Il numero di caratteri da escludere dalla redazione a destra del contenuto con PII rilevato. In questo modo è possibile preservare il contesto attorno ai dati sensibili.
-
DetectionParameters— UTF-8 stringa, corrispondente aCustom string pattern #66.Parametri aggiuntivi per la configurazione del comportamento di rilevamento delle PII e delle impostazioni di sensibilità.
-
DetectionSensitivity— UTF-8 stringa, corrispondente aCustom string pattern #66.Il livello di sensibilità per il rilevamento delle PII. Livelli di sensibilità più elevati rilevano più PII potenziali, ma possono dare luogo a più falsi positivi.
Struttura aggregata
Specifica una trasformazione che raggruppa le righe in base ai campi scelti e calcola il valore aggregato in base alla funzione specificata.
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.Il nome del nodo di trasformazione.
-
Inputs— Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.Specifica i campi e le righe da utilizzare come input per la trasformazione aggregata.
-
Groups— Obbligatorio: una serie di stringhe. UTF-8Specifica i campi in base ai quali raggruppare.
-
Aggs- obbligatorio: una matrice di oggetti AggregateOperation, non meno di 1 o più di 30 strutture.Specifica le funzioni di aggregazione da eseguire su campi specificati.
DropDuplicates struttura
Specifica una trasformazione che rimuove le righe di dati ripetuti da un set di dati.
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.Il nome del nodo di trasformazione.
-
Inputs— Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.Gli input di dati identificati dai nomi dei nodi.
-
Columns— Una serie di stringhe. UTF-8Il nome delle colonne da unire o rimuovere in caso di ripetizione.
GovernedCatalogTarget struttura
Specifica un target di dati che scrive su Amazon S3 utilizzando il AWS Glue Data Catalog.
Campi
-
Name— Obbligatoria: UTF-8 stringa, corrispondente a. Custom string pattern #68Il nome di destinazione dati.
-
Inputs— Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.I nodi che sono input per la destinazione di dati.
-
PartitionKeys— Una serie di stringhe. UTF-8Specifica il partizionamento nativo utilizzando una sequenza di chiavi.
-
Table— Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #66Il nome della tabella del database in cui scrivere.
-
Database— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome del database in cui scrivere.
-
SchemaChangePolicy: un oggetto CatalogSchemaChangePolicy.Una policy che specifica il comportamento di aggiornamento per il catalogo governato.
GovernedCatalogSource struttura
Specifica l'archivio dati nel catalogo AWS Glue dati governato.
Campi
-
Name— Obbligatoria: UTF-8 stringa, corrispondente a. Custom string pattern #68Il nome del archivio dati.
-
Database— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il database da cui leggere.
-
Table— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.La tabella del database da cui leggere.
-
PartitionPredicate— UTF-8 stringa, corrispondente aCustom string pattern #66.Le partizioni che soddisfano questo predicato vengono eliminate. I file all'interno del periodo di conservazione in queste partizioni non vengono eliminati. Impostato su
"": vuoto per impostazione predefinita. -
AdditionalOptions: un oggetto S3SourceAdditionalOptions.Specifica opzioni di connessione aggiuntive.
AggregateOperation struttura
Specifica il set di parametri necessari per eseguire l'aggregazione nella trasformazione di aggregazione.
Campi
-
Column— Obbligatorio: una serie di UTF-8 stringhe.Specifica la colonna sul set di dati su cui verrà applicata la funzione di aggregazione.
-
AggFunc— Obbligatorio: UTF-8 stringa (valori validi:avgcountDistinctcount|first|last|kurtosis| |max|min|skewness|stddev_samp|stddev_pop|sum| |sumDistinctvar_samp|var_pop).Specifica la funzione di aggregazione da applicare.
Le possibili funzioni di aggregazione includono: avg countDistinct, count, first, last, kurtosis, max, min, skewness, stddev_samp, stddev_pop, sum, sumDistinct, var_samp, var_pop
GlueSchema struttura
Specifica uno schema definito dall'utente quando uno schema non può essere determinato da AWS Glue.
Campi
-
Columns: una matrice di oggetti GlueStudioSchemaColumn.Specifica le definizioni delle colonne che costituiscono uno AWS Glue schema.
GlueStudioSchemaColumn struttura
Specifica una singola colonna in una definizione AWS Glue dello schema.
Campi
-
Name— UTF-8 Obbligatoria: stringa, lunga non più di 1024 byte, corrispondente a. Single-line string patternIl nome della colonna nello schema di AWS Glue Studio.
-
Type— UTF-8 stringa, lunga non più di 131072 byte, corrispondente a. Single-line string patternIl tipo di hive per questa colonna nello schema di Studio. AWS Glue
-
GlueStudioType— UTF-8 stringa, lunga non più di 131072 byte, corrispondente a. Single-line string patternIl tipo di dati della colonna come definito in Studio. AWS Glue
GlueStudioColumn struttura
Specifica una singola colonna in AWS Glue Studio.
Campi
-
Key— Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #66La chiave della colonna in AWS Glue Studio.
-
FullPath— Obbligatorio: una serie di UTF-8 stringhe.L'URL completo della colonna in AWS Glue Studio.
-
Type— Obbligatorio: UTF-8 stringa (valori validi:array="ARRAY"bigint="BIGINT"bigint array="BIGINT_ARRAY"binary="BINARY"|binary array="BINARY_ARRAY"|boolean="BOOLEAN"|boolean array="BOOLEAN_ARRAY"|byte="BYTE"|byte array="BYTE_ARRAY"|char="CHAR"|char array="CHAR_ARRAY"|choice="CHOICE"|choice array="CHOICE_ARRAY"|date="DATE"|date array="DATE_ARRAY"|decimal="DECIMAL"|decimal array="DECIMAL_ARRAY"|double="DOUBLE"|double array="DOUBLE_ARRAY"|enum="ENUM"|enum array="ENUM_ARRAY"|float="FLOAT"| |float array="FLOAT_ARRAY"|int="INT"|int array="INT_ARRAY"|interval="INTERVAL"|interval array="INTERVAL_ARRAY"|long="LONG"|long array="LONG_ARRAY"|object="OBJECT"|short="SHORT"|short array="SHORT_ARRAY"|smallint="SMALLINT"|smallint array="SMALLINT_ARRAY"|string="STRING"|string array="STRING_ARRAY"|timestamp="TIMESTAMP"|timestamp array="TIMESTAMP_ARRAY"|tinyint="TINYINT"| |tinyint array="TINYINT_ARRAY"|varchar="VARCHAR"|varchar array="VARCHAR_ARRAY"|null="NULL"|unknown="UNKNOWN"|unknown array="UNKNOWN_ARRAY").Il tipo di colonna in AWS Glue Studio.
-
Children: un array di strutture.I figli della colonna principale in AWS Glue Studio.
-
GlueStudioType— UTF-8 stringa (valori validi:array="ARRAY"bigint="BIGINT"|bigint array="BIGINT_ARRAY"|binary="BINARY"|binary array="BINARY_ARRAY"|boolean="BOOLEAN"|boolean array="BOOLEAN_ARRAY"|byte="BYTE"|byte array="BYTE_ARRAY"|char="CHAR"|char array="CHAR_ARRAY"|choice="CHOICE"|choice array="CHOICE_ARRAY"|date="DATE"date array="DATE_ARRAY"|decimal="DECIMAL"|decimal array="DECIMAL_ARRAY"|double="DOUBLE"|double array="DOUBLE_ARRAY"|enum="ENUM"|enum array="ENUM_ARRAY"|float="FLOAT"|float array="FLOAT_ARRAY"|int="INT"|int array="INT_ARRAY"|interval="INTERVAL"|interval array="INTERVAL_ARRAY"|long="LONG"|long array="LONG_ARRAY"|object="OBJECT"|short="SHORT"|short array="SHORT_ARRAY"|smallint="SMALLINT"|smallint array="SMALLINT_ARRAY"|string="STRING"|string array="STRING_ARRAY"|timestamp="TIMESTAMP"|timestamp array="TIMESTAMP_ARRAY"|tinyint="TINYINT"|tinyint array="TINYINT_ARRAY"| |varchar="VARCHAR"|varchar array="VARCHAR_ARRAY"|null="NULL"|unknown="UNKNOWN"|unknown array="UNKNOWN_ARRAY").Il tipo di dati della colonna come definito in AWS Glue Studio.
DynamicTransform struttura
Specifica il set di parametri necessari per eseguire la trasformazione dinamica.
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Specifica il nome della trasformazione dinamica.
-
TransformName— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Specifica il nome della trasformazione dinamica così come appare nell'editor visuale di AWS Glue Studio.
-
Inputs— Obbligatorio: una matrice di UTF-8 stringhe, non meno di 1 o più di 1 stringa.Specifica gli input necessari per la trasformazione dinamica.
-
Parameters: una matrice di oggetti TransformConfigParameter.Specifica i parametri della trasformazione dinamica.
-
FunctionName— Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #66Specifica il nome della funzione della trasformazione dinamica.
-
Path— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Specifica il percorso dei file sorgente e di configurazione della trasformazione dinamica.
-
Version— UTF-8 stringa, corrispondente aCustom string pattern #66.Questo campo non è utilizzato e verrà dichiarato obsoleto in una versione futura.
-
OutputSchemas: una matrice di oggetti GlueSchema.Specifica lo schema di dati per la trasformazione dinamica.
TransformConfigParameter struttura
Specifica i parametri nel file di configurazione della trasformazione dinamica.
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Specifica il nome del parametro nel file di configurazione della trasformazione dinamica.
-
Type— Obbligatorio: UTF-8 stringa (valori validi:str="STR"int="INT"|float="FLOAT"|complex="COMPLEX"|bool="BOOL"|list="LIST"| |null="NULL").Specifica il tipo di parametro nel file di configurazione della trasformazione dinamica.
-
ValidationRule— UTF-8 stringa, corrispondente aCustom string pattern #66.Specifica la regola di convalida nel file di configurazione della trasformazione dinamica.
-
ValidationMessage— UTF-8 stringa, corrispondente aCustom string pattern #66.Specifica il messaggio di convalida nel file di configurazione della trasformazione dinamica.
-
Value— Una serie di UTF-8 stringhe.Specifica il valore del parametro nel file di configurazione della trasformazione dinamica.
-
ListType— UTF-8 stringa (valori validi:str="STR"|int="INT"|float="FLOAT"|complex="COMPLEX"| |bool="BOOL"list="LIST"|null="NULL").Specifica il tipo di elenco del parametro nel file di configurazione della trasformazione dinamica.
-
IsOptional: booleano.Specifica se il parametro è facoltativo o meno nel file di configurazione della trasformazione dinamica.
EvaluateDataQuality struttura
Specifica i criteri di valutazione della qualità dei dati.
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.Il nome della valutazione della qualità dei dati.
-
Inputs— Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.Gli input della valutazione della qualità dei dati.
-
Ruleset— UTF-8 Obbligatoria: stringa, lunga non meno di 1 o più di 65536 byte, corrispondente al. Custom string pattern #64Il set di regole per la valutazione della qualità dei dati.
-
Output— UTF-8 stringa (valori validi:PrimaryInput|EvaluationResults).L'output della valutazione della qualità dei dati.
-
PublishingOptions: un oggetto DQResultsPublishingOptions.Opzioni per configurare la modalità di pubblicazione dei risultati.
-
StopJobOnFailureOptions: un oggetto DQStopJobOnFailureOptions.Opzioni per configurare come si interromperà il processo se la valutazione della qualità dei dati fallisce.
DQResultsPublishingOptions struttura
Opzioni per configurare la modalità di pubblicazione dei risultati della valutazione della qualità dei dati.
Campi
-
EvaluationContext— UTF-8 stringa, corrispondente aCustom string pattern #65.Il contesto della valutazione.
-
ResultsS3Prefix— UTF-8 stringa, corrispondente aCustom string pattern #66.Il prefisso Amazon S3 aggiunto all'inizio dei risultati.
-
CloudWatchMetricsEnabled: booleano.Abilita i parametri per i risultati della qualità dei dati.
-
ResultsPublishingEnabled: booleano.Abilita la pubblicazione per i risultati della qualità dei dati.
DQStopJobOnFailureOptions struttura
Opzioni per configurare come si interromperà il processo se la valutazione della qualità dei dati fallisce.
Campi
-
StopJobOnFailureTiming— UTF-8 stringa (valori validi:Immediate|AfterDataLoad).Quando interrompere il processo se la valutazione della qualità dei dati fallisce. Le opzioni sono Immediate o AfterDataLoad.
EvaluateDataQualityMultiFrame struttura
Specifica i criteri di valutazione della qualità dei dati.
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.Il nome della valutazione della qualità dei dati.
-
Inputs— Obbligatorio: una matrice di UTF-8 stringhe, almeno 1 stringa.Gli input della valutazione della qualità dei dati. Il primo input in questo elenco è l'origine dati primaria.
-
AdditionalDataSources: una matrice della mappa di coppie chiave-valore.Ogni chiave è una UTF-8 stringa, corrispondente a. Custom string pattern #68
Ogni valore è una UTF-8 stringa, corrispondente aCustom string pattern #66.
Gli alias di tutte le origini dati, tranne quella primaria.
-
Ruleset— UTF-8 Obbligatoria: stringa, lunga non meno di 1 o più di 65536 byte, corrispondente al. Custom string pattern #64Il set di regole per la valutazione della qualità dei dati.
-
PublishingOptions: un oggetto DQResultsPublishingOptions.Opzioni per configurare la modalità di pubblicazione dei risultati.
-
AdditionalOptions: una matrice della mappa di coppie chiave-valore.Ogni chiave è una UTF-8 stringa (valori validi:
performanceTuning.caching="CacheOption"|observations.scope="ObservationsOption"|compositeRuleEvaluation.method="CompositeOption").Ogni valore è una UTF-8 stringa.
Opzioni per configurare il comportamento di runtime della trasformazione.
-
StopJobOnFailureOptions: un oggetto DQStopJobOnFailureOptions.Opzioni per configurare come si interromperà il processo se la valutazione della qualità dei dati fallisce.
Struttura Recipe
Un nodo di AWS Glue Studio che utilizza una AWS Glue DataBrew ricetta nei AWS Glue lavori.
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.Il nome del nodo AWS Glue Studio.
-
Inputs— Obbligatorio: una matrice di UTF-8 stringhe, non meno di 1 o più di 1 stringa.I nodi che costituiscono gli input del nodo della ricetta, identificati dal rispettivo ID.
-
RecipeReference: un oggetto RecipeReference.Un riferimento alla DataBrew ricetta utilizzata dal nodo.
-
RecipeSteps: una matrice di oggetti RecipeStep.Passaggi di trasformazione utilizzati nel nodo della ricetta.
RecipeReference struttura
Un riferimento a una AWS Glue DataBrew ricetta.
Campi
-
RecipeArn— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.L'ARN della DataBrew ricetta.
-
RecipeVersion— Richiesto: UTF-8 stringa di lunghezza non inferiore a 1 o superiore a 16 byte.Il RecipeVersion valore della DataBrew ricetta.
SnowflakeNodeData struttura
Specifica la configurazione per i nodi Snowflake in Studio. AWS Glue
Campi
-
SourceType— UTF-8 stringa, corrispondente a. Custom string pattern #65Specifica come vengono specificati i dati recuperati. Valori validi:
"table","query". -
Connection: un oggetto Opzione.Specifica una connessione al catalogo AWS Glue dati a un endpoint Snowflake.
-
Schema— UTF-8 stringa.Specifica uno schema di database Snowflake da utilizzare per il nodo.
-
Table— UTF-8 corda.Specifica una tabella Snowflake da utilizzare per il nodo.
-
Database— UTF-8 corda.Specifica un database Snowflake da utilizzare per il nodo.
-
TempDir— UTF-8 stringa, corrispondente aCustom string pattern #66.Attualmente non utilizzato.
-
IamRole: un oggetto Opzione.Attualmente non utilizzato.
-
AdditionalOptions: una matrice della mappa di coppie chiave-valore.Ogni chiave è una UTF-8 stringa, corrispondente aCustom string pattern #66.
Ogni valore è una UTF-8 stringa, corrispondente aCustom string pattern #66.
Specifica le opzioni aggiuntive trasmesse al connettore Snowflake. Se altre opzioni sono specificate altrove in questo nodo, esse avranno la precedenza.
-
SampleQuery— UTF-8 stringa.Una stringa SQL utilizzata per recuperare i dati con il tipo di origine
query. -
PreAction— UTF-8 corda.Una stringa SQL eseguita prima che il connettore Snowflake esegua le operazioni standard.
-
PostAction— UTF-8 corda.Una stringa SQL eseguita dopo che il connettore Snowflake esegua le operazioni standard.
-
Action— UTF-8 corda.Specifica l'operazione da intraprendere quando si scrive su una tabella con dati preesistenti. Valori validi:
append,merge,truncate,drop. -
Upsert: booleano.Utilizzato quando Operazione è
append. Specifica il comportamento di risoluzione quando esiste già una riga. Se impostato su true, le righe preesistenti verranno aggiornate. Se false, verranno inserite quelle righe. -
MergeAction— UTF-8 stringa, corrispondente aCustom string pattern #65.Specifica un'operazione di unione. Valori validi:
simple,custom. Se semplice, il comportamento di unione è definito daMergeWhenMatchedeMergeWhenNotMatched. Se personalizzato, definito daMergeClause. -
MergeWhenMatched— UTF-8 stringa, corrispondente aCustom string pattern #65.Specifica come risolvere i record che corrispondono a dati preesistenti durante l'unione. Valori validi:
update,delete. -
MergeWhenNotMatched— UTF-8 stringa, corrispondente aCustom string pattern #65.Specifica come elaborare i record che non corrispondono a dati preesistenti durante l'unione. Valori validi:
insert,none. -
MergeClause— UTF-8 stringa.Un'istruzione SQL che specifica un comportamento di merge personalizzato.
-
StagingTable— UTF-8 corda.Il nome di una tabella intermedia utilizzata durante le operazioni
mergeoappendcon upsert. I dati vengono scritti in questa tabella, quindi spostati intableda un'azione successiva (PostAction) generata. -
SelectedColumns: una matrice di oggetti Opzione.Specifica le colonne combinate per identificare un record quando vengono rilevate corrispondenze per i merge e gli upsert. Un elenco di strutture con chiavi
value,labeledescription. Ogni struttura descrive una colonna. -
AutoPushdown: booleano.Specifica se il pushdown automatico delle query è abilitato. Se il pushdown è abilitato, quando su Spark viene eseguita una query, se una parte di essa può essere "trasferita" al server Snowflake, viene sottoposta a pushdown. Ciò migliora le prestazioni di alcune query.
-
TableSchema: una matrice di oggetti Opzione.Definisce manualmente lo schema di destinazione per il nodo. Un elenco di strutture con chiavi
value,labeledescription. Ogni struttura definisce una colonna.
SnowflakeSource struttura
Specifica un'origine dati Snowflake.
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.Il nome dell'origine dati Snowflake.
-
Data- obbligatorio: un oggetto SnowflakeNodeData.Configurazione per l'origine dati Snowflake.
-
OutputSchemas: una matrice di oggetti GlueSchema.Specifica gli schemi definiti dall'utente per i dati di output.
SnowflakeTarget struttura
Specifica una destinazione Snowflake.
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.Il nome della destinazione Snowflake.
-
Data- obbligatorio: un oggetto SnowflakeNodeData.Specifica i dati del nodo di destinazione Snowflake.
-
Inputs— Una matrice di UTF-8 stringhe, non meno di 1 o più di 1 stringa.I nodi che sono input per la destinazione di dati.
ConnectorDataSource struttura
Specifica un'origine generata con opzioni di connessione standard.
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.Il nome del nodo di origine.
-
ConnectionType— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il
connectionType, come fornito alla AWS Glue libreria sottostante. Il tipo di nodo supporta i tipi di connessione seguenti:-
opensearch -
azuresql -
azurecosmos -
bigquery -
saphana -
teradata -
vertica
-
-
Data- obbligatorio: una matrice della mappa di coppie chiave-valore.Ogni chiave è una UTF-8 stringa.
Ogni valore è una UTF-8 stringa.
Una mappa che specifica le opzioni di connessione per il nodo. Le opzioni di connessione standard per il tipo di connessione corrispondente sono disponibili nella sezione Parametri di connessione della AWS Glue documentazione.
-
OutputSchemas: una matrice di oggetti GlueSchema.Specifica lo schema di dati per questa origine.
ConnectorDataTarget struttura
Specifica un a destinazione generata con opzioni di connessione standard.
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.Il nome del nodo di destinazione.
-
ConnectionType— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il
connectionType, come fornito alla AWS Glue libreria sottostante. Il tipo di nodo supporta i tipi di connessione seguenti:-
opensearch -
azuresql -
azurecosmos -
bigquery -
saphana -
teradata -
vertica
-
-
Data- obbligatorio: una matrice della mappa di coppie chiave-valore.Ogni chiave è una UTF-8 stringa.
Ogni valore è una UTF-8 stringa.
Una mappa che specifica le opzioni di connessione per il nodo. Le opzioni di connessione standard per il tipo di connessione corrispondente sono disponibili nella sezione Parametri di connessione della AWS Glue documentazione.
-
Inputs— Una matrice di UTF-8 stringhe, non meno di 1 o più di 1 stringa.I nodi che sono input per la destinazione di dati.
RecipeStep struttura
Una fase di ricetta utilizzata in un nodo di ricetta per la preparazione dei dati di AWS Glue Studio.
Campi
-
Action- obbligatorio: un oggetto RecipeAction.L'operazione di trasformazione del passaggio della ricetta.
-
ConditionExpressions: una matrice di oggetti ConditionExpression.Le espressioni di condizione per il passaggio della ricetta.
RecipeAction struttura
Azioni definite nel nodo delle ricette di preparazione dei dati di AWS Glue Studio.
Campi
-
Operation— UTF-8 Obbligatoria: stringa, lunga non meno di 1 o più di 128 byte, corrispondente a. Custom string pattern #61Il funzionamento dell'operazione della ricetta.
-
Parameters: una matrice della mappa di coppie chiave-valore.Ogni chiave è una UTF-8 stringa, lunga non meno di 1 o più di 128 byte, corrispondente al. Custom string pattern #62
Ogni valore è una UTF-8 stringa di lunghezza non inferiore a 1 o superiore a 32768 byte.
I parametri dell'operazione della ricetta.
ConditionExpression struttura
Espressione di condizione definita nel nodo della ricetta per la preparazione dei dati di AWS Glue Studio.
Campi
-
Condition— UTF-8 Obbligatoria: stringa, lunga non meno di 1 o più di 128 byte, corrispondente a. Custom string pattern #61La condizione dell'espressione di condizione.
-
Value— UTF-8 stringa, lunga non più di 1024 byte.Il valore dell'espressione di condizione.
-
TargetColumn— Obbligatoria: UTF-8 stringa, lunga non meno di 1 o più di 1024 byte.La colonna di destinazione delle espressioni di condizione.
S3CatalogIcebergSource struttura
Specifica un'origine dati Apache Iceberg registrata nel Data Catalog. AWS Glue L'origine dati Iceberg deve essere archiviata in. Amazon S3
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #68Il nome dell'origine dati Iceberg.
-
Database— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome del database da cui leggere.
-
Table— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome della tabella nel database da cui leggere.
-
AdditionalIcebergOptions: una matrice della mappa di coppie chiave-valore.Ogni chiave è una UTF-8 stringa, corrispondente aCustom string pattern #66.
Ogni valore è una UTF-8 stringa, corrispondente aCustom string pattern #66.
Specifica opzioni di connessione aggiuntive per l'origine dati Iceberg.
-
OutputSchemas: una matrice di oggetti GlueSchema.Specifica lo schema di dati per l'origine Iceberg.
CatalogIcebergSource struttura
Specifica un'origine dati Apache Iceberg registrata nel Data Catalog. AWS Glue
Campi
-
Name— Obbligatoria: UTF-8 stringa, corrispondente a. Custom string pattern #68Il nome dell'origine dati Iceberg.
-
Database— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome del database da cui leggere.
-
Table— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome della tabella nel database da cui leggere.
-
AdditionalIcebergOptions: una matrice della mappa di coppie chiave-valore.Ogni chiave è una UTF-8 stringa, corrispondente aCustom string pattern #66.
Ogni valore è una UTF-8 stringa, corrispondente aCustom string pattern #66.
Specifica opzioni di connessione aggiuntive per l'origine dati Iceberg.
-
OutputSchemas: una matrice di oggetti GlueSchema.Specifica lo schema di dati per l'origine Iceberg.
S3IcebergCatalogTarget struttura
Specifica una destinazione del catalogo Apache Iceberg che scrive i dati Amazon S3 e registra la tabella nel Data Catalog. AWS Glue
Campi
-
Name— Obbligatoria: UTF-8 stringa, corrispondente a. Custom string pattern #68Il nome del catalogo Iceberg di destinazione.
-
Inputs— Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.La connessione di input del catalogo Iceberg di destinazione.
-
PartitionKeys— Una serie di stringhe. UTF-8Un elenco di chiavi di partizione per la tabella Iceberg.
-
Table— Obbligatorio: UTF-8 stringa, corrispondente a. Custom string pattern #66Il nome della tabella da scrivere nel catalogo.
-
Database— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome del database in cui scrivere.
-
AdditionalOptions: una matrice della mappa di coppie chiave-valore.Ogni chiave è una UTF-8 stringa, corrispondente aCustom string pattern #66.
Ogni valore è una UTF-8 stringa, corrispondente aCustom string pattern #66.
Specifica opzioni di connessione aggiuntive per il catalogo Iceberg di destinazione.
-
SchemaChangePolicy: un oggetto CatalogSchemaChangePolicy.La policy per la gestione delle modifiche allo schema nel catalogo di destinazione.
-
AutoDataQuality: un oggetto AutoDataQuality.Specifica se abilitare automaticamente la valutazione della qualità dei dati per il catalogo S3 Iceberg di destinazione. Se impostato su
true, i controlli di qualità dei dati vengono eseguiti automaticamente durante l'operazione di scrittura.
DynamoDBELTConnectorSource struttura
Specifica un connettore ELT DynamoDB di origine per l'estrazione dei dati dalle tabelle DynamoDB.
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.Il nome del connettore ELT DynamoDB di origine.
-
ConnectionOptions: un oggetto DDBELTConnectionOptions.Le opzioni di connessione per il connettore DynamoDB ELT di origine.
-
OutputSchemas: una matrice di oggetti GlueSchema.Specifica lo schema di dati per il connettore DynamoDB ELT di origine.
DDBELTConnectionOptions struttura
Specifica le opzioni di connessione per le operazioni DynamoDB ELT (estrazione, caricamento, trasformazione). Questa struttura contiene parametri di configurazione per la connessione a e l'estrazione di dati da tabelle DynamoDB utilizzando il connettore ELT.
Campi
-
DynamodbExport— UTF-8 stringa (valori validi:ddb|s3).Specifica il tipo di esportazione per l'estrazione di dati DynamoDB. Questo parametro determina il modo di cui i dati vengono esportati dalla tabella DynamoDB durante il processo ELT.
-
DynamodbUnnestDDBJson: booleano.Un valore booleano che specifica se annullare la nidificazione del formato DynamoDB JSON durante l'estrazione dei dati. Se impostato su
true, il connettore appiattirà le strutture JSON annidate negli elementi DynamoDB. Se impostato sufalse, la struttura JSON DynamoDB originale viene preservata. -
DynamodbTableArn— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome della risorsa Amazon (ARN) della tabella DynamoDB da cui estrarre i dati. Questo parametro specifica la tabella di origine per l'operazione ELT.
-
DynamodbS3Bucket— UTF-8 stringa, corrispondente aCustom string pattern #66.Il nome del bucket Amazon S3 utilizzato per l'archiviazione intermedia durante il processo ELT DynamoDB. Questo bucket viene utilizzato per archiviare temporaneamente i dati DynamoDB esportati prima che vengano elaborati dal processo ELT.
-
DynamodbS3Prefix— UTF-8 stringa, corrispondente aCustom string pattern #66.Il prefisso della chiave dell'oggetto S3 per i file archiviati nel bucket S3 intermedio durante il processo ELT DynamoDB. Questo prefisso aiuta a organizzare e identificare i file temporanei creati durante l'estrazione dei dati.
-
DynamodbS3BucketOwner— UTF-8 stringa, corrispondente aCustom string pattern #66.L'ID dell' AWS account del proprietario del bucket S3 specificato in.
DynamodbS3BucketQuesto parametro è obbligatorio quando il bucket S3 è di proprietà di un AWS account diverso da quello che esegue il job ELT, e consente l'accesso tra account al bucket di archiviazione intermedio. -
DynamodbStsRoleArn— UTF-8 stringa, corrispondente a. Custom string pattern #66L'Amazon Resource Name (ARN) del ruolo di AWS Security Token Service (STS) da assumere per accedere alle risorse DynamoDB e S3 durante l'operazione ELT. Questo ruolo deve disporre delle autorizzazioni necessarie per leggere dalla tabella DynamoDB e scrivere nel bucket S3 intermedio.
DDBELTCatalogAdditionalOptions struttura
Specifica opzioni aggiuntive per le operazioni di catalogo ELT DynamoDB.
Campi
-
DynamodbExport— UTF-8 stringa, corrispondente aCustom string pattern #66.Specifica la configurazione di esportazione DynamoDB per l'operazione ETL.
-
DynamodbUnnestDDBJson: booleano.Specifica se annullare la nidificazione del formato JSON DynamoDB. Se impostato su
true, le strutture JSON annidate negli elementi DynamoDB vengono appiattite.
Struttura Route
Specifica un nodo di routing che indirizza i dati verso diversi percorsi di output in base a condizioni di filtraggio definite.
Campi
-
Name— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #68.Il nome del nodo di routing.
-
Inputs— Obbligatorio: una serie di UTF-8 stringhe, non meno di 1 o più di 1 stringa.La connessione di ingresso del nodo di routing.
-
GroupFiltersList- obbligatorio: una matrice di oggetti GroupFilters.Un elenco di filtri di gruppo che definiscono le condizioni di routing e i criteri per l'indirizzamento dei dati in diversi percorsi di output.
GroupFilters struttura
Specifica un gruppo di filtri con un operatore logico che stabilisce come i filtri vengono combinati per valutare le condizioni di routing.
Campi
-
GroupName— Obbligatorio: UTF-8 stringa, corrispondente aCustom string pattern #65.Il nome del gruppo di filtri.
-
Filters- obbligatorio: una matrice di oggetti FilterExpression.Un elenco di espressioni di filtro che definiscono le condizioni per questo gruppo.
-
LogicalOperator— Obbligatorio: UTF-8 stringa (valori validi:AND|OR).L'operatore logico utilizzato per combinare i filtri in questo gruppo. Determina se tutti i filtri devono corrispondere (AND) o può corrispondere uno qualsiasi dei filtri (OR).
AutoDataQuality struttura
Specifica le opzioni di configurazione per la valutazione automatica della qualità dei dati nei AWS Glue processi. Questa struttura abilita controlli e monitoraggio automatizzati della qualità dei dati durante le operazioni ETL, contribuendo a garantire l'integrità e l'affidabilità dei dati senza interventi manuali.
Campi
-
IsEnabled: booleano.Specifica se è abilitata la valutazione automatica della qualità dei dati. Se impostato su
true, i controlli di qualità dei dati vengono eseguiti automaticamente. -
EvaluationContext— UTF-8 stringa, corrispondente a. Custom string pattern #66Il contesto di valutazione per i controlli di qualità dei dati automatici. Definisce l'ambito e i parametri per la valutazione della qualità dei dati.