O AWS Glue é um serviço de ETL totalmente gerenciado que facilita a movimentação de dados entre datastores. O AWS Glue simplifica e automatiza tarefas difíceis e demoradas de descoberta, conversão, mapeamento e programação de trabalhos de dados. O AWS Glue oferece orientações durante o processo de movimentação de dados com um console fácil de usar que ajuda a compreender as fontes de dados, preparar os dados para análise e transportar os dados de forma confiável entre as fontes e os destinos.
O AWS Glue é integrado aos serviços Amazon S3, Amazon RDS e Amazon Redshift, além de poder se conectar a qualquer datastore compatível com JDBC. O AWS Glue percorre automaticamente as fontes de dados, identificando formatos de dados e sugerindo schemas e transformações para que você não tenha de perder tempo codificando manualmente fluxos de dados. Em seguida, se necessário, você pode editar as transformações usando as ferramentas e tecnologias que já conhece, como Python, Spark, Git e seu ambiente integrado de desenvolvimento (IDE) favorito, e compartilhá-las com outros usuários do AWS Glue. O AWS Glue programa trabalhos de ETL e provisiona e define a escala de toda a infraestrutura necessária, permitindo que os trabalhos sejam executados com rapidez e eficiência em qualquer escala. Não há necessidade de gerenciar servidores e você paga apenas pelos recursos consumidos pelos trabalhos de ETL.
Para obter as mais recentes informações sobre a disponibilidade do serviço, inscreva-se aqui para que possamos mantê-lo atualizado por e-mail.
Etapa 1. Crie um catálogo de dados
Primeiro, use o Console de Gerenciamento da AWS para registrar os dados no AWS Glue. O AWS Glue percorre as fontes de dados e constrói um catálogo de dados usando classificadores predefinidos para diversos formatos de fontes e tipos de dados comuns, incluindo JSON, CSV e Parquet, entre outros. Também é possível adicionar seus próprios classificadores ou escolher classificadores da comunidade do AWS Glue para usá-los ao percorrer os dados.
Etapa 2. Gere e edite as transformações
Em seguida, selecione uma fonte e um destino de dados. O AWS Glue gerará código Python para extrair dados da fonte, transformar os dados de acordo com o schema de destino e carregá-los no destino. O código gerado automaticamente trata os casos de erros comuns, como dados inválidos ou falhas de hardware. Você pode editar esse código usando seu IDE favorito e testá-lo com seus próprios dados de amostra. Também é possível examinar o código compartilhado por outros usuários do AWS Glue e incorporá-lo aos trabalhos.
Etapa 3. Programe e execute os trabalhos
Por fim, você pode usar o programador flexível do AWS Glue para executar fluxos de forma recorrente, como resposta a triggers ou até mesmo como resposta a eventos do AWS Lambda. O AWS Glue distribui automaticamente trabalhos de ETL em nós do Apache Spark, permitindo que os tempos de execução do ETL permaneçam constantes com o crescimento do volume dos dados. O AWS Glue coordena a execução dos trabalhos na sequência correta e tenta reexecutar automaticamente os trabalhos que apresentam falha. O AWS Glue altera de maneira elástica a escala da infraestrutura necessária para concluir os trabalhos no prazo e reduzir custos.
Pronto.
É só isso! Com os trabalhos de ETL em produção, o AWS Glue ajuda a rastrear alterações nos metadados, como definições de schemas e formatos de dados, para que os trabalhos de ETL fiquem sempre atualizados.
Para obter as mais recentes informações sobre a disponibilidade do serviço, inscreva-se aqui para que possamos mantê-lo atualizado por e-mail.

