Entrar em Contato

Programa do Curso

Fundamentos da Plataforma Databricks e do Lakehouse

  • Arquitetura e componentes do Lakehouse no Databricks.
  • Organização de espaços de trabalho e catálogos.

Espaço de Trabalho e Notebooks no Databricks

  • Navegação pelo espaço de trabalho e desenvolvimento baseado em notebooks.
  • Estruturação do código em notebooks reutilizáveis.

Arquitetura e Execução do Apache Spark

  • Arquitetura do tempo de execução do Spark e modelo de execução.
  • Avaliação preguiçosa (lazy evaluation) e DAG do job.

DataFrames PySpark e a API DataFrame

  • Abstrações de DataFrames e esquemas.
  • Operações centrais de DataFrames e expressões de colunas.

Convertendo SQL para DataFrames PySpark

  • Conversão de cláusulas SQL básicas para operações de DataFrame.
  • Funções de janela e agregações no PySpark.

Ler e Gravar Dados no Databricks

  • Leitura a partir de fontes comuns de arquivos e bancos de dados.
  • Gravação e particionamento de dados no Lakehouse.

Delta Lake e Gerenciamento de Tabelas

  • Tabelas Delta e transações ACID.
  • Time travel e evolução do esquema.

Padrões de Limpeza e Transformação de Dados

  • Limpeza de dados e conversão de tipos.
  • Construção de lógica de transformação reutilizável.

Funções Definidas pelo Usuário (UDFs) e Código Modular

  • UDFs Python e pandas UDFs.
  • Modularização da lógica procedural em funções.

Afinamento de Performance e Otimização

  • Estratégias de particionamento e cache.
  • Diagnóstico de gargalos com a Spark UI.

Fundamentos do Structured Streaming

  • Modelos de processamento em lote versus streaming.
  • DataFrames em streaming e agregações básicas.

Jobs no Databricks e Orquestração de Fluxos de Trabalho

  • Agendamento de notebooks como jobs e tarefas.
  • Criação de fluxos de trabalho multi-etapas com dependências.

Unity Catalog e Governança de Dados

  • Arquitetura do Unity Catalog e namespaces.
  • Controle de acesso e linhagem de dados (data lineage).

Testes, Depuração e Práticas de Produção

  • Teste unitário da lógica PySpark.
  • Depuração e padrões de qualidade de código.

Estudos de Caso End-to-End em Serviços Financeiros

  • Construção de um pipeline ETL bancário end-to-end.
  • Conversão de processos SQL legados para PySpark.

Migração de Cargas de Trabalho SQL para PySpark

  • Estratégia de migração e padrões de planejamento.
  • Conversão incremental de fluxos de trabalho SQL para PySpark.

Requisitos

  • Experiência com programação Python, incluindo funções e tipos de dados.
  • Compreensão de SQL, incluindo joins, agregações e subconsultas.
  • Não é necessária experiência prévia com Databricks ou PySpark.

Público-Alvo

  • Engenheiros de dados, analistas de dados e profissionais da área de dados.
  • Equipes que estão migrando fluxos de trabalho baseados em SQL existentes para o Databricks e PySpark.
 35 Horas

Treinamento Corporativo Personalizado

Soluções de treinamento projetadas exclusivamente para empresas.

  • Conteúdo Personalizado: Adaptamos o programa e os exercícios práticos aos objetivos e necessidades reais do seu projeto.
  • Horário Flexível: Datas e horários adaptados à agenda da sua equipe.
  • Formato: Online (ao vivo), In-Company (em suas instalações) ou Híbrido.
Investimento

Preço por grupo privado, treinamento online ao vivo, a partir de 6500 € + VAT*

Entre em contato conosco para obter um orçamento preciso e conhecer nossas promoções mais recentes

Testemunhos de Clientes (1)

Próximas Formações Provisórias

Categorias Relacionadas