AWS Glue
La nube de AWS
Inscríbase para recibir actualizaciones

AWS Glue es un servicio ETL totalmente administrado que facilita la transferencia de datos entre sus almacenes de datos. AWS Glue simplifica y automatiza las difíciles y arduas tareas de descubrimiento, conversión y asignación de datos y las tareas de programación de trabajos. AWS Glue le guía a lo largo del proceso de transferencia de datos con una consola de uso sencillo que le ayuda a comprender sus fuentes de datos, preparar los datos para el análisis y cargarlos de manera fiable de fuentes de datos a destinos.

AWS Glue se integra con Amazon S3, Amazon RDSAmazon Redshift, y se puede conectar con cualquier almacén de datos conforme con JDBC. AWS Glue rastrea automáticamente sus fuentes de datos, identifica formatos de datos y, a continuación, sugiere esquemas y transformaciones para que no tenga que dedicar tiempo a codificar manualmente flujos de datos. En caso necesario, puede editar estas transformaciones con las herramientas y tecnologías que ya conoce, como Python, Spark, Git y su entorno de desarrollo integrado (IDE) preferido, y compartirlas con otros usuarios de AWS Glue. AWS Glue programa sus trabajos ETL y aprovisiona y escala toda la infraestructura necesaria para que los trabajos ETL se ejecuten de manera rápida y eficaz a cualquier escala. No es necesario administrar servidores, y solo paga por los recursos consumidos por los trabajos ETL.

Para obtener la información más reciente sobre disponibilidad, inscríbase aquí y le mantendremos informado por correo electrónico.

Paso 1. Cree su catálogo de datos

Primero, use la consola de administración de AWS para registrar sus fuentes de datos con AWS Glue. AWS Glue rastrea las fuentes de datos y construye un catálogo de datos con clasificadores predeterminados para muchos formatos de origen y tipos de datos populares, incluidos JSON, CSV, Parquet y más. También puede agregar sus clasificadores o elegir clasificadores de la comunidad de AWS Glue para añadir a sus rastreos.


Paso 1. Cree su catálogo de datos automáticamente
Paso 1. Cree su catálogo de datos automáticamente

Haga clic para ver la imagen más grande


Paso 2. Genere y edite transformaciones

A continuación, seleccione una fuente de datos y un destino, y AWS Glue generará código Python para extraer datos de la fuente, transformar los datos para que se correspondan con el esquema de destino y cargarlos en el destino. El código autogenerado administra casos de errores comunes, como datos erróneos o fallos del hardware. Puede editar el código con su IDE favorito y probarlo con sus propios datos de muestra. También puede buscar código compartido por otros usuarios de AWS Glue y utilizarlo en sus trabajos.


Paso 2. Genere las transformaciones
Paso 2. Genere las transformaciones

Haga clic para ver la imagen más grande


Paso 3. Programe y ejecute los trabajos

Por último, puede utilizar el programador flexible de AWS Glue para ejecutar sus flujos de forma periódica o como respuesta a activadores, o incluso a eventos de AWS Lambda. AWS Glue distribuye automáticamente sus trabajos ETL en nodos de Apache Spark, para que sus tiempos de ejecución ETL se mantengan constantes a medida que el volumen de los datos crece. AWS Glue coordina la ejecución de sus trabajos en la secuencia adecuada y realiza reintentos de los trabajos fallidos de manera automática. AWS Glue escala elásticamente la infraestructura necesaria para completar trabajos a tiempo y minimizar los costos.


Paso 3. Programe y ejecute los trabajos
Paso 3. Programe y ejecute los trabajos

Haga clic para ver la imagen más grande


Listo.

¡Así de sencillo! Una vez que los trabajos ETL están en producción, AWS Glue le ayuda a monitorizar los cambios en los metadatos, como definiciones de esquemas y formatos de datos, para que pueda mantener sus trabajos ETL actualizados.

Para obtener la información más reciente sobre disponibilidad del servicio, inscríbase aquí y le mantendremos informado por correo electrónico.

Inscríbase para recibir actualizaciones