View a markdown version of this page

Zero-ETL integrazione con Amazon OpenSearch Service - Amazon DocumentDB

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

Zero-ETL integrazione con Amazon OpenSearch Service

Amazon OpenSearch Service come destinazione

OpenSearch L'integrazione del servizio con Amazon DocumentDB consente di trasmettere eventi di dati a pieno carico e di modificare i OpenSearch domini. L'infrastruttura di ingestion è ospitata come pipeline di OpenSearch ingestione e fornisce un meccanismo su larga scala e bassa latenza per lo streaming continuo di dati dalle raccolte Amazon DocumentDB.

Durante il pieno carico, l'integrazione Zero-ETL estrae innanzitutto i dati storici a pieno carico utilizzando una pipeline di ingestione. OpenSearch Una volta inseriti i dati a pieno carico, le pipeline di OpenSearch ingestione inizieranno a leggere i dati provenienti dai flussi di modifica di Amazon DocumentDB e alla fine recupereranno il ritardo per mantenere la coerenza dei dati quasi in tempo reale tra Amazon DocumentDB e. OpenSearch OpenSearch archivia i documenti in indici. I dati in entrata da una raccolta Amazon DocumentDB possono essere inviati a un indice o possono essere partizionati in indici diversi. Le pipeline di ingestione sincronizzeranno tutti gli eventi di creazione, aggiornamento ed eliminazione in una raccolta Amazon DocumentDB come corrispondente creazione, aggiornamento ed eliminazione dei documenti per mantenere sincronizzati entrambi i sistemi di OpenSearch dati. Le pipeline di ingestione possono essere configurate per leggere i dati da una raccolta e scrivere su un indice o leggere i dati da una raccolta e indirizzarli condizionatamente a più indici.

Le pipeline di ingestione possono essere configurate per lo streaming di dati da Amazon DocumentDB ad Amazon Service utilizzando: OpenSearch

  • Solo a pieno carico

  • Trasmetti in streaming gli eventi di change stream da Amazon DocumentDB senza caricamento completo

  • Caricamento completo seguito dai flussi di modifiche da Amazon DocumentDB

Per configurare la pipeline di ingestione, procedi nel seguente modo:

Passaggio 1: crea un dominio Amazon OpenSearch Service o una raccolta serverless OpenSearch

È necessaria una raccolta Amazon OpenSearch Service con le autorizzazioni appropriate per leggere i dati. Per creare una raccolta, consulta Getting started with Amazon OpenSearch Service o Getting started with Amazon OpenSearch Serverless nella Amazon OpenSearch Service Developer Guide. Fai riferimento ad Amazon OpenSearch Ingestion nella Amazon OpenSearch Service Developer Guide per creare un ruolo AIM con le autorizzazioni corrette per accedere ai dati di scrittura nella raccolta o nel dominio.

Passaggio 2: abilitare i flussi di modifica sul cluster Amazon DocumentDB

Assicurati che i flussi di modifica siano abilitati sulle raccolte richieste nel cluster Amazon DocumentDB. Per ulteriori informazioni, consulta Utilizzo dei flussi di modifiche con Amazon DocumentDB.

Passaggio 3: configura il ruolo della pipeline con le autorizzazioni di scrittura nel bucket Amazon S3 e nel dominio o nella raccolta di destinazione

Dopo aver creato la raccolta Amazon DocumentDB e aver abilitato il change stream, configura il ruolo della pipeline che desideri utilizzare nella configurazione della pipeline e aggiungi le seguenti autorizzazioni nel ruolo:

JSON
{ "Version":"2012-10-17", "Statement": [ { "Sid": "allowReadAndWriteToS3ForExport", "Effect": "Allow", "Action": [ "s3:GetObject", "s3:AbortMultipartUpload", "s3:PutObject", "s3:PutObjectAcl" ], "Resource": [ "arn:aws:s3:::my-bucket/export/*" ] } ] }

Affinché una OpenSearch pipeline possa scrivere dati su un OpenSearch dominio, il dominio deve disporre di una policy di accesso a livello di dominio che consenta al ruolo della pipeline sts_role_arn di accedervi. Il seguente esempio di politica di accesso al dominio consente al ruolo della pipeline denominatopipeline-role, creato nel passaggio precedente, di scrivere dati nel dominio denominato: ingestion-domain

{ "Statement": [ { "Effect": "Allow", "Principal": { "AWS": "arn:aws:iam::{your-account-id}:role/{pipeline-role}" }, "Action": ["es:DescribeDomain", "es:ESHttp*"], "Resource": "arn:aws:es:{region}:{your-account-id}:domain/{domain-name}/*" } ] }

Passaggio 4: aggiungere le autorizzazioni richieste sul ruolo della pipeline da creare X-ENI

JSON
{ "Version":"2012-10-17", "Statement": [ { "Effect": "Allow", "Action": [ "ec2:AttachNetworkInterface", "ec2:CreateNetworkInterface", "ec2:CreateNetworkInterfacePermission", "ec2:DeleteNetworkInterface", "ec2:DeleteNetworkInterfacePermission", "ec2:DetachNetworkInterface", "ec2:DescribeNetworkInterfaces" ], "Resource": [ "arn:aws:ec2:*:420497401461:network-interface/*", "arn:aws:ec2:*:420497401461:subnet/*", "arn:aws:ec2:*:420497401461:security-group/*" ] }, { "Effect": "Allow", "Action": [ "ec2:DescribeDhcpOptions", "ec2:DescribeRouteTables", "ec2:DescribeSecurityGroups", "ec2:DescribeSubnets", "ec2:DescribeVpcs", "ec2:Describe*" ], "Resource": "*" }, { "Effect": "Allow", "Action": [ "ec2:CreateTags" ], "Resource": "arn:aws:ec2:*:*:network-interface/*", "Condition": { "StringEquals": { "aws:RequestTag/OSISManaged": "true" } } } ] }

Passaggio 5: creare la pipeline

Configura una pipeline OpenSearch di ingestion specificando Amazon DocumentDB come fonte. Questa configurazione di pipeline di esempio presuppone l'uso di un meccanismo di recupero del flusso di modifiche. Per ulteriori informazioni, consulta Using an OpenSearch Ingestion pipeline with Amazon DocumentDB nella Amazon Service Developer Guide. OpenSearch

Limitazioni

Le seguenti limitazioni si applicano all'integrazione di Amazon DocumentDB: OpenSearch

  • È supportata una sola raccolta Amazon DocumentDB come origine per pipeline.

  • Cross-region l'inserimento di dati non è supportato. Il cluster e il OpenSearch dominio Amazon DocumentDB devono appartenere allo stesso. Regione AWS

  • Cross-account l'inserimento di dati non è supportato. Il cluster Amazon DocumentDB e la pipeline OpenSearch di ingestione devono trovarsi nello stesso account. AWS

  • I cluster elastici Amazon DocumentDB non sono supportati. Sono supportati solo i cluster basati su istanze Amazon DocumentDB.

  • Assicurati che il cluster Amazon DocumentDB abbia l'autenticazione abilitata utilizzando i segreti. AWS AWS i segreti sono l'unico meccanismo di autenticazione supportato.

  • La configurazione della pipeline esistente non può essere aggiornata per importare dati da un database diverso da and/or una raccolta diversa. Per aggiornare il nome della and/or raccolta del database di una pipeline, è necessario creare una nuova pipeline.