Obrigado por enviar sua consulta! Um dos membros da nossa equipe entrará em contato com você em breve.
Obrigado por enviar sua reserva! Um dos membros da nossa equipe entrará em contato com você em breve.
Duração 14 horas
Programa do Curso
Fundamentos da Produção do Tencent Hunyuan
- Visão geral dos cenários de disponibilização de modelos Tencent Hunyuan
- Características em produção de modelos grandes e MoE
- Gargalos comuns de latência, taxa de transferência e custos
- Definição de objetivos de nível de serviço para cargas de trabalho de inferência
Arquitetura de Implantação e Fluxo de Disponibilização
- Componentes principais de uma pilha de inferência em produção
- Escolha entre modelos de implantação com contêineres, local ou em nuvem
- Fundamentos de carregamento do modelo, roteamento de solicitações e alocação de GPUs
- Projeto pensando na confiabilidade e simplicidade operacional
Otimização de Latência na Prática
- Uso de motores de inferência otimizados, como o TensorRT, quando aplicável
- Conceitos de KV-cache e ajuste prático de cache
- Redução da sobrecarga inicial, de aquecimento e de resposta
- Medição do tempo até o primeiro token e da velocidade de geração de tokens
Taxa de Transferência, Batching e Eficiência da GPU
- Estratégias de continuous batching e request batching
- Gestão de concorrência e comportamento de filas
- Melhoria da utilização de GPUs sem prejudicar a experiência do usuário
- Manipulação de solicitações de contexto longo e cargas de trabalho mistas
Quantização e Controle de Custos
- Por que a quantização é importante para a disponibilização em produção
- Compromissos práticos entre FP16, INT8 e outras opções comuns de precisão
- Equilíbrio entre qualidade do modelo, latência e custos de infraestrutura
- Construção de uma lista de verificação simples para otimização de custos
Operações, Monitoramento e Revisão de Prontidão
- Gatilhos de escalonamento automático para serviços de inferência
- Monitoramento de latência, taxa de transferência, uso de cache e saúde da GPU
- Fundamentos de registro de logs (logging), alerta e resposta a incidentes
- Revisão de uma implantação de referência e criação de um plano de melhorias
Requisitos
- Conhecimento básico de implantação e fluxos de trabalho de inferência de modelos de linguagem grandes
- Experiência com contêineres, infraestrutura em nuvem ou local, e serviços baseados em API
- Conhecimento prático de Python ou tarefas de engenharia de sistemas
Público-alvo
- Engenheiros de ML implantando LLMs em produção
- Engenheiros de plataforma responsáveis por serviços de inferência baseados em GPU
- Arquitetos de solução que projetam plataformas escaláveis de disponibilização de IA
Treinamento Corporativo Personalizado
Soluções de treinamento projetadas exclusivamente para empresas.
- Conteúdo Personalizado: Adaptamos o programa e os exercícios práticos aos objetivos e necessidades reais do seu projeto.
- Horário Flexível: Datas e horários adaptados à agenda da sua equipe.
- Formato: Online (ao vivo), In-Company (em suas instalações) ou Híbrido.
Preço por grupo privado, treinamento online ao vivo, a partir de 2600 € + VAT*
Entre em contato conosco para obter um orçamento preciso e conhecer nossas promoções mais recentes