Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.
Cargue datos con AWS DataSync
AWS DataSync es un servicio de transferencia de datos en línea que simplifica, automatiza y acelera el proceso de transferencia de datos entre los servicios de almacenamiento y almacenamiento locales o entre los servicios de AWS almacenamiento. AWS DataSync admite una variedad de sistemas de almacenamiento locales, como el sistema de archivos distribuidos (HDFS) de Hadoop, los servidores de archivos NAS y el almacenamiento de objetos autogestionado.
La forma más común de tener datos en un clúster es mediante la carga de datos en Amazon S3 y el uso de características integradas de Amazon EMR para cargar los datos en el clúster.
DataSync puede ayudarle a realizar las siguientes tareas:
-
Replicar el HDFS de su clúster de Hadoop en Amazon S3 para garantizar la continuidad empresarial
-
Copiar el HDFS a Amazon S3 para rellenar sus lagos de datos
-
Transferir datos entre el HDFS de su clúster de Hadoop y Amazon S3 para su análisis y procesamiento
Para subir datos a tu bucket de S3, primero debes implementar uno o más DataSync agentes en la misma red que tu almacenamiento local. Un agente es una máquina virtual (VM) que se utiliza para leer o escribir datos en una ubicación autoadministrada. A continuación, activa los agentes en el depósito de S3 Cuenta de AWS y en el Región de AWS lugar en el que se encuentra.
Una vez activado el agente, debe crear una ubicación de origen para el almacenamiento en las instalaciones, una ubicación de destino para el bucket de S3 y una tarea. Una tarea es un conjunto de dos ubicaciones (origen y destino) y un conjunto de opciones predeterminadas que se utilizan para controlar el comportamiento de la tarea.
Por último, ejecuta la DataSync tarea para transferir los datos del origen al destino.
Para obtener más información, consulta Introducción a AWS DataSync.