Entrar em Contato

Programa do Curso

Introdução, Objetivos e Estratégia de Migração

  • Objetivos do curso, alinhamento do perfil dos participantes e critérios de sucesso
  • Aproximações de alto nível da migração e considerações de risco
  • Configuração de workspaces, repositórios e conjuntos de dados para laboratório

Dia 1 — Fundamentos de Migração e Arquitetura

  • Conceitos de Lakehouse, visão geral do Delta Lake e arquitetura do Databricks
  • Diferenças entre SMP e MPP e implicações para a migração
  • Design Medallion (Bronze→Silver→Gold) e visão geral do Unity Catalog

Laboratório Dia 1 — Traduzindo um Procedimento Armazenado

  • Migração prática de um procedimento armazenado de exemplo para um notebook
  • Mapeamento de tabelas temporárias e cursores para transformações em DataFrame
  • Validação e comparação com a saída original

Dia 2 — Delta Lake Avançado & Carga Incremental

  • Transações ACID, logs de commit, versionamento e time travel
  • Auto Loader, padrões de MERGE INTO, upserts e evolução de esquema
  • OPTIMIZE, VACUUM, Z-ORDER, particionamento e ajuste de armazenamento

Laboratório Dia 2 — Ingestão Incremental & Otimização

  • Implementação de ingestão com Auto Loader e fluxos de MERGE
  • Aplique OPTIMIZE, Z-ORDER e VACUUM; valide os resultados
  • Meça as melhorias no desempenho de leitura/escrita

Dia 3 — SQL no Databricks, Desempenho & Depuração

  • Recursos de SQL analítico: funções de janela, funções de ordem superior, tratamento de JSON/array
  • Lendo a Spark UI, DAGs, shuffles, estágios, tarefas e diagnóstico de gargalos
  • Padrões de ajuste de consultas: broadcast joins, dicas (hints), cache e redução de spill

Laboratório Dia 3 — Refatoração de SQL & Ajuste de Desempenho

  • Refatore um processo pesado em SQL para Spark SQL otimizado
  • Use os rastros da Spark UI para identificar e corrigir problemas de skew e shuffle
  • Realize benchmarks antes/depois e documente as etapas de ajuste

Dia 4 — PySpark Tático: Substituindo Lógica Procedural

  • Modelo de execução do Spark: driver, executores, avaliação preguiçosa (lazy evaluation) e estratégias de particionamento
  • Transformando laços e cursores em operações vetorizadas de DataFrame
  • Modularização, UDFs/UDFs pandas, widgets e bibliotecas reutilizáveis

Laboratório Dia 4 — Refatorando Scripts Procedurais

  • Refatore um script ETL procedural para notebooks PySpark modulares
  • Introduza parametrização, testes de estilo unitário e funções reutilizáveis
  • Revisão de código e aplicação da lista de verificação de melhores práticas

Dia 5 — Orquestração, Pipeline de Ponta a Ponta & Melhores Práticas

  • Databricks Workflows: design de jobs, dependências de tarefas, gatilhos e tratamento de erros
  • Projetando pipelines Medallion incrementais com regras de qualidade e validação de esquema
  • Integração com Git (GitHub/Azure DevOps), CI e estratégias de teste para lógica PySpark

Laboratório Dia 5 — Construindo um Pipeline Completo de Ponta a Ponta

  • Monte um pipeline Bronze→Silver→Gold orquestrado com Workflows
  • Implemente log, auditoria, retries e validações automatizadas
  • Execute o pipeline completo, valide as saídas e prepare notas de implantação

Operacionalização, Governança e Prontidão para Produção

  • Melhores práticas de governança do Unity Catalog, linhagem e controles de acesso
  • Custo, dimensionamento de clusters, autoscaling e padrões de concorrência de jobs
  • Listas de verificação de implantação, estratégias de rollback e criação de runbooks

Revisão Final, Transferência de Conhecimento e Próximos Passos

  • Apresentações dos participantes sobre o trabalho de migração e lições aprendidas
  • Análise de lacunas, atividades de acompanhamento recomendadas e entrega de materiais de treinamento
  • Referências, caminhos de aprendizado adicionais e opções de suporte

Requisitos

  • Compreensão dos conceitos de engenharia de dados
  • Experiência com SQL e procedimentos armazenados (Synapse / SQL Server)
  • Familiaridade com os conceitos de orquestração de ETL (ADF ou semelhante)

Público-Alvo

  • Gestores de tecnologia com experiência em engenharia de dados
  • Engenheiros de dados migrando lógica procedural de OLAP para padrões Lakehouse
  • Engenheiros de plataforma responsáveis pela adoção do Databricks
 35 Horas

Treinamento Corporativo Personalizado

Soluções de treinamento projetadas exclusivamente para empresas.

  • Conteúdo Personalizado: Adaptamos o programa e os exercícios práticos aos objetivos e necessidades reais do seu projeto.
  • Horário Flexível: Datas e horários adaptados à agenda da sua equipe.
  • Formato: Online (ao vivo), In-Company (em suas instalações) ou Híbrido.
Investimento

Preço por grupo privado, treinamento online ao vivo, a partir de 6500 € + VAT*

Entre em contato conosco para obter um orçamento preciso e conhecer nossas promoções mais recentes

Próximas Formações Provisórias

Categorias Relacionadas