Entrar em Contato

Programa do Curso

Infraestrutura como Código para EXO

  • Noção geral dos padrões de implantação do EXO: nó único, múltiplos nós e clusters RDMA
  • Automatização da instalação de dependências (Xcode, uv, Node.js, Rust) com gerenciamento de configuração
  • Uso de Nix flakes para builds reproduzíveis do EXO e ambientes de desenvolvimento
  • Criação de playbooks Ansible ou scripts shell para provisionamento não supervisionado dos clusters

Builds Reproduzíveis e Integração com CI

  • Fixação de dependências e build do painel em pipelines de CI
  • Execução de testes básicos do EXO nos runners do GitHub Actions ou GitLab CI
  • Criação de imagens base e workflows de reversão baseados em snapshots para VMs macOS e Linux
  • Versionamento de cards de modelos personalizados junto ao código da aplicação

Descoberta de Cluster e Automação de Rede

  • Configuração de mDNS e DNS estático para descoberta confiável de nós libp2p
  • Automatização da criação de perfis de rede e gerenciamento de bridge Thunderbolt no macOS
  • Uso de namespaces personalizados (EXO_LIBP2P_NAMESPACE) para separar clusters de dev, staging e prod
  • Regras de firewall e segmentação de rede para ambientes multi-inquilinos

Gerenciamento de Armazenamento e Ciclo de Vida dos Modelos

  • Padrão de projeto para EXO_MODELS_DIRS e EXO_MODELS_READ_ONLY_DIRS
  • Mapeamento de shares NFS ou SAN como repositórios de modelos somente leitura para provisionamento rápido
  • Cópia de segurança (garbage collection) de caches obsoletos e políticas de retenção de pesos versionados
  • Pré-download automatizado de modelos e verificações de saúde antes de atualizações em lote

Monitoramento e Alertas

  • Envio dos logs do EXO para registro centralizado (ELK, Loki ou Splunk)
  • Criação de dashboards Grafana a partir da saída EXO_TRACING_ENABLED
  • Alertas sobre alterações na membresia do cluster, eventos OOM e picos de latência de inferência
  • Correlação da telemetria de hardware macmon com regressões de desempenho do modelo

Atualização, Reversão e Recuperação de Desastres

  • Teste (staging) das atualizações dos binários EXO em um nó canário antes da implantação generalizada
  • Reversão em nível de modelo: alternar entre versões quantizadas sem o necessidade de novo download
  • Backup e restauração do estado do cluster, namespaces personalizados e pesos em cache
  • Documentação dos runbooks de recuperação para cenários de rebuild total do cluster

Endurecimento da Segurança e Conformidade

  • Aplicação de TLS na camada de proxy reverso (nginx, traefik) para o painel e a API
  • Implementação de limitação de taxa (rate limiting) e whitelist de IPs para endpoints do EXO
  • Isolamento de clusters com VLANs e políticas de rede zero-trust
  • Auditoria de acesso e manutenção de inventário dos modelos implantados e suas versões

Requisitos

  • Experiência com práticas de DevOps (CI/CD, IaC, orquestração de contêineres)
  • Conhecimento básico de administração de sistemas e gerenciamento de pacotes no macOS ou Linux
  • Compreensão de conceitos de rede, DNS e armazenamento

Público-alvo

  • Engenheiros de DevOps
  • Arquitetos de infraestrutura
  • SREs responsáveis por cargas de trabalho de IA on-premise
 21 Horas

Treinamento Corporativo Personalizado

Soluções de treinamento projetadas exclusivamente para empresas.

  • Conteúdo Personalizado: Adaptamos o programa e os exercícios práticos aos objetivos e necessidades reais do seu projeto.
  • Horário Flexível: Datas e horários adaptados à agenda da sua equipe.
  • Formato: Online (ao vivo), In-Company (em suas instalações) ou Híbrido.
Investimento

Preço por grupo privado, treinamento online ao vivo, a partir de 3900 € + VAT*

Entre em contato conosco para obter um orçamento preciso e conhecer nossas promoções mais recentes

Testemunhos de Clientes (2)

Próximas Formações Provisórias

Categorias Relacionadas