Entrar em Contato

Programa do Curso

Fundamentos da Produção do Tencent Hunyuan

  • Visão geral dos cenários de disponibilização de modelos Tencent Hunyuan
  • Características em produção de modelos grandes e MoE
  • Gargalos comuns de latência, taxa de transferência e custos
  • Definição de objetivos de nível de serviço para cargas de trabalho de inferência

Arquitetura de Implantação e Fluxo de Disponibilização

  • Componentes principais de uma pilha de inferência em produção
  • Escolha entre modelos de implantação com contêineres, local ou em nuvem
  • Fundamentos de carregamento do modelo, roteamento de solicitações e alocação de GPUs
  • Projeto pensando na confiabilidade e simplicidade operacional

Otimização de Latência na Prática

  • Uso de motores de inferência otimizados, como o TensorRT, quando aplicável
  • Conceitos de KV-cache e ajuste prático de cache
  • Redução da sobrecarga inicial, de aquecimento e de resposta
  • Medição do tempo até o primeiro token e da velocidade de geração de tokens

Taxa de Transferência, Batching e Eficiência da GPU

  • Estratégias de continuous batching e request batching
  • Gestão de concorrência e comportamento de filas
  • Melhoria da utilização de GPUs sem prejudicar a experiência do usuário
  • Manipulação de solicitações de contexto longo e cargas de trabalho mistas

Quantização e Controle de Custos

  • Por que a quantização é importante para a disponibilização em produção
  • Compromissos práticos entre FP16, INT8 e outras opções comuns de precisão
  • Equilíbrio entre qualidade do modelo, latência e custos de infraestrutura
  • Construção de uma lista de verificação simples para otimização de custos

Operações, Monitoramento e Revisão de Prontidão

  • Gatilhos de escalonamento automático para serviços de inferência
  • Monitoramento de latência, taxa de transferência, uso de cache e saúde da GPU
  • Fundamentos de registro de logs (logging), alerta e resposta a incidentes
  • Revisão de uma implantação de referência e criação de um plano de melhorias

Requisitos

  • Conhecimento básico de implantação e fluxos de trabalho de inferência de modelos de linguagem grandes
  • Experiência com contêineres, infraestrutura em nuvem ou local, e serviços baseados em API
  • Conhecimento prático de Python ou tarefas de engenharia de sistemas

Público-alvo

  • Engenheiros de ML implantando LLMs em produção
  • Engenheiros de plataforma responsáveis por serviços de inferência baseados em GPU
  • Arquitetos de solução que projetam plataformas escaláveis de disponibilização de IA
 14 Horas

Treinamento Corporativo Personalizado

Soluções de treinamento projetadas exclusivamente para empresas.

  • Conteúdo Personalizado: Adaptamos o programa e os exercícios práticos aos objetivos e necessidades reais do seu projeto.
  • Horário Flexível: Datas e horários adaptados à agenda da sua equipe.
  • Formato: Online (ao vivo), In-Company (em suas instalações) ou Híbrido.
Investimento

Preço por grupo privado, treinamento online ao vivo, a partir de 2600 € + VAT*

Entre em contato conosco para obter um orçamento preciso e conhecer nossas promoções mais recentes

Próximas Formações Provisórias

Categorias Relacionadas