Programa do Curso
Introdução, Objetivos e Estratégia de Migração
- Objetivos do curso, alinhamento do perfil dos participantes e critérios de sucesso
- Aproximações de alto nível da migração e considerações de risco
- Configuração de workspaces, repositórios e conjuntos de dados para laboratório
Dia 1 — Fundamentos de Migração e Arquitetura
- Conceitos de Lakehouse, visão geral do Delta Lake e arquitetura do Databricks
- Diferenças entre SMP e MPP e implicações para a migração
- Design Medallion (Bronze→Silver→Gold) e visão geral do Unity Catalog
Laboratório Dia 1 — Traduzindo um Procedimento Armazenado
- Migração prática de um procedimento armazenado de exemplo para um notebook
- Mapeamento de tabelas temporárias e cursores para transformações em DataFrame
- Validação e comparação com a saída original
Dia 2 — Delta Lake Avançado & Carga Incremental
- Transações ACID, logs de commit, versionamento e time travel
- Auto Loader, padrões de MERGE INTO, upserts e evolução de esquema
- OPTIMIZE, VACUUM, Z-ORDER, particionamento e ajuste de armazenamento
Laboratório Dia 2 — Ingestão Incremental & Otimização
- Implementação de ingestão com Auto Loader e fluxos de MERGE
- Aplique OPTIMIZE, Z-ORDER e VACUUM; valide os resultados
- Meça as melhorias no desempenho de leitura/escrita
Dia 3 — SQL no Databricks, Desempenho & Depuração
- Recursos de SQL analítico: funções de janela, funções de ordem superior, tratamento de JSON/array
- Lendo a Spark UI, DAGs, shuffles, estágios, tarefas e diagnóstico de gargalos
- Padrões de ajuste de consultas: broadcast joins, dicas (hints), cache e redução de spill
Laboratório Dia 3 — Refatoração de SQL & Ajuste de Desempenho
- Refatore um processo pesado em SQL para Spark SQL otimizado
- Use os rastros da Spark UI para identificar e corrigir problemas de skew e shuffle
- Realize benchmarks antes/depois e documente as etapas de ajuste
Dia 4 — PySpark Tático: Substituindo Lógica Procedural
- Modelo de execução do Spark: driver, executores, avaliação preguiçosa (lazy evaluation) e estratégias de particionamento
- Transformando laços e cursores em operações vetorizadas de DataFrame
- Modularização, UDFs/UDFs pandas, widgets e bibliotecas reutilizáveis
Laboratório Dia 4 — Refatorando Scripts Procedurais
- Refatore um script ETL procedural para notebooks PySpark modulares
- Introduza parametrização, testes de estilo unitário e funções reutilizáveis
- Revisão de código e aplicação da lista de verificação de melhores práticas
Dia 5 — Orquestração, Pipeline de Ponta a Ponta & Melhores Práticas
- Databricks Workflows: design de jobs, dependências de tarefas, gatilhos e tratamento de erros
- Projetando pipelines Medallion incrementais com regras de qualidade e validação de esquema
- Integração com Git (GitHub/Azure DevOps), CI e estratégias de teste para lógica PySpark
Laboratório Dia 5 — Construindo um Pipeline Completo de Ponta a Ponta
- Monte um pipeline Bronze→Silver→Gold orquestrado com Workflows
- Implemente log, auditoria, retries e validações automatizadas
- Execute o pipeline completo, valide as saídas e prepare notas de implantação
Operacionalização, Governança e Prontidão para Produção
- Melhores práticas de governança do Unity Catalog, linhagem e controles de acesso
- Custo, dimensionamento de clusters, autoscaling e padrões de concorrência de jobs
- Listas de verificação de implantação, estratégias de rollback e criação de runbooks
Revisão Final, Transferência de Conhecimento e Próximos Passos
- Apresentações dos participantes sobre o trabalho de migração e lições aprendidas
- Análise de lacunas, atividades de acompanhamento recomendadas e entrega de materiais de treinamento
- Referências, caminhos de aprendizado adicionais e opções de suporte
Requisitos
- Compreensão dos conceitos de engenharia de dados
- Experiência com SQL e procedimentos armazenados (Synapse / SQL Server)
- Familiaridade com os conceitos de orquestração de ETL (ADF ou semelhante)
Público-Alvo
- Gestores de tecnologia com experiência em engenharia de dados
- Engenheiros de dados migrando lógica procedural de OLAP para padrões Lakehouse
- Engenheiros de plataforma responsáveis pela adoção do Databricks
Treinamento Corporativo Personalizado
Soluções de treinamento projetadas exclusivamente para empresas.
- Conteúdo Personalizado: Adaptamos o programa e os exercícios práticos aos objetivos e necessidades reais do seu projeto.
- Horário Flexível: Datas e horários adaptados à agenda da sua equipe.
- Formato: Online (ao vivo), In-Company (em suas instalações) ou Híbrido.
Preço por grupo privado, treinamento online ao vivo, a partir de 6500 € + VAT*
Entre em contato conosco para obter um orçamento preciso e conhecer nossas promoções mais recentes