Programa do Curso
Fundamentos da Plataforma Databricks e do Lakehouse
- Arquitetura e componentes do Lakehouse no Databricks.
- Organização de espaços de trabalho e catálogos.
Espaço de Trabalho e Notebooks no Databricks
- Navegação pelo espaço de trabalho e desenvolvimento baseado em notebooks.
- Estruturação do código em notebooks reutilizáveis.
Arquitetura e Execução do Apache Spark
- Arquitetura do tempo de execução do Spark e modelo de execução.
- Avaliação preguiçosa (lazy evaluation) e DAG do job.
DataFrames PySpark e a API DataFrame
- Abstrações de DataFrames e esquemas.
- Operações centrais de DataFrames e expressões de colunas.
Convertendo SQL para DataFrames PySpark
- Conversão de cláusulas SQL básicas para operações de DataFrame.
- Funções de janela e agregações no PySpark.
Ler e Gravar Dados no Databricks
- Leitura a partir de fontes comuns de arquivos e bancos de dados.
- Gravação e particionamento de dados no Lakehouse.
Delta Lake e Gerenciamento de Tabelas
- Tabelas Delta e transações ACID.
- Time travel e evolução do esquema.
Padrões de Limpeza e Transformação de Dados
- Limpeza de dados e conversão de tipos.
- Construção de lógica de transformação reutilizável.
Funções Definidas pelo Usuário (UDFs) e Código Modular
- UDFs Python e pandas UDFs.
- Modularização da lógica procedural em funções.
Afinamento de Performance e Otimização
- Estratégias de particionamento e cache.
- Diagnóstico de gargalos com a Spark UI.
Fundamentos do Structured Streaming
- Modelos de processamento em lote versus streaming.
- DataFrames em streaming e agregações básicas.
Jobs no Databricks e Orquestração de Fluxos de Trabalho
- Agendamento de notebooks como jobs e tarefas.
- Criação de fluxos de trabalho multi-etapas com dependências.
Unity Catalog e Governança de Dados
- Arquitetura do Unity Catalog e namespaces.
- Controle de acesso e linhagem de dados (data lineage).
Testes, Depuração e Práticas de Produção
- Teste unitário da lógica PySpark.
- Depuração e padrões de qualidade de código.
Estudos de Caso End-to-End em Serviços Financeiros
- Construção de um pipeline ETL bancário end-to-end.
- Conversão de processos SQL legados para PySpark.
Migração de Cargas de Trabalho SQL para PySpark
- Estratégia de migração e padrões de planejamento.
- Conversão incremental de fluxos de trabalho SQL para PySpark.
Requisitos
- Experiência com programação Python, incluindo funções e tipos de dados.
- Compreensão de SQL, incluindo joins, agregações e subconsultas.
- Não é necessária experiência prévia com Databricks ou PySpark.
Público-Alvo
- Engenheiros de dados, analistas de dados e profissionais da área de dados.
- Equipes que estão migrando fluxos de trabalho baseados em SQL existentes para o Databricks e PySpark.
Treinamento Corporativo Personalizado
Soluções de treinamento projetadas exclusivamente para empresas.
- Conteúdo Personalizado: Adaptamos o programa e os exercícios práticos aos objetivos e necessidades reais do seu projeto.
- Horário Flexível: Datas e horários adaptados à agenda da sua equipe.
- Formato: Online (ao vivo), In-Company (em suas instalações) ou Híbrido.
Preço por grupo privado, treinamento online ao vivo, a partir de 6500 € + VAT*
Entre em contato conosco para obter um orçamento preciso e conhecer nossas promoções mais recentes
Testemunhos de Clientes (1)
Gostei do fato de ser prático. Adorei aplicar o conhecimento teórico com exemplos práticos.
Aurelia-Adriana - Allianz Services Romania
Curso - Python and Spark for Big Data (PySpark)
Máquina Traduzida