Obrigado por enviar sua consulta! Um dos membros da nossa equipe entrará em contato com você em breve.
Obrigado por enviar sua reserva! Um dos membros da nossa equipe entrará em contato com você em breve.
Programa do Curso
Cada sessão tem duração de 2 horas
Dia 1: Sessão 1: Visão Geral de Negócios do Porquê da Business Intelligence de Big Data no Governo
- Estudos de Caso da NIH, DoE
- Taxa de adaptação de Big Data nas Agências Governamentais e como estão alinhando suas operações futuras à Analítica Preditiva de Big Data
- Áreas de Aplicação em Grande Escala na DoD, NSA, IRS, USDA, etc.
- Interfacing Big Data com dados legados
- Entendimento básico das tecnologias habilitadoras na analítica preditiva
- Integração de Dados e visualização de Dashboards
- Gestão de Fraudes
- Geração de Regras de Negócio / Detecção de Fraudes
- Detecção e perfilamento de ameaças
- Análise de custos e benefícios para implementação de Big Data
Dia 1: Sessão 2: Introdução ao Big Data-1
- Principais características do Big Data: volume, variedade, velocidade e veracidade. Arquitetura MPP para volume.
- Depósitos de Dados (Data Warehouses) – esquema estático, conjunto de dados que evolui lentamente
- Bancos de Dados MPP como Greenplum, Exadata, Teradata, Netezza, Vertica, etc.
- Soluções Baseadas em Hadoop – sem condições sobre a estrutura do conjunto de dados.
- Padrão típico: HDFS, MapReduce (crunch), recuperação do HDFS
- Processamento em Lote (Batch) – adequado para analítico/não interativo
- Volume: CEP streaming data
- Escolhas típicas – produtos CEP (ex. Infostreams, Apama, MarkLogic, etc.)
- Menos prontos para produção – Storm/S4
- Bancos de Dados NoSQL – (colunar e chave-valor): Mais adequados como adjuvante analítico ao data warehouse/banco de dados
Dia 1: Sessão 3: Introdução ao Big Data-2
Soluções NoSQL
- KV Store - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
- KV Store - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
- KV Store (Hierárquico) - GT.m, Cache
- KV Store (Ordenado) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
- KV Cache - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
- Tuple Store - Gigaspaces, Coord, Apache River
- Banco de Objetos - ZopeDB, DB40, Shoal
- Document Store - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databases, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
- Wide Columnar Store - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI
Variedades de Dados: Introdução às questões de Limpeza de Dados em Big Data
- RDBMS – estrutura/esquema estático, não promove um ambiente ágil e exploratório.
- NoSQL – semi estruturado, estrutura suficiente para armazenar dados sem esquema exato antes do armazenamento
- Questões de limpeza de dados
Dia 1: Sessão 4: Introdução ao Big Data-3: Hadoop
- Quando selecionar Hadoop?
- ESTRUTURADO - Depósitos de dados/bancos de dados empresariais podem armazenar dados massivos (a um custo), mas impõem estrutura (não bom para exploração ativa)
- Dados SEMI ESTRUTURADOS – difícil de tratar com soluções tradicionais (DW/DB)
- Armazenamento de dados = GRANDE esforço e estático mesmo após a implementação
- Para variedade e volume de dados, processados em hardware commodity – HADOOP
- Hardware Commodity necessário para criar um Cluster Hadoop
Introdução a Map Reduce /HDFS
- MapReduce – distribuir computação em vários servidores
- HDFS – tornar dados disponíveis localmente para o processo de computação (com redundância)
- Dados – podem ser não estruturados/sem esquema (diferente de RDBMS)
- Responsabilidade do desenvolvedor para dar sentido aos dados
- Programação MapReduce = trabalhar com Java (prós/contras), carregando manualmente dados para o HDFS
Dia 2: Sessão 1: Ecossistema de Big Data - Construindo Big Data ETL: universo de Ferramentas de Big Data - qual usar e quando?
- Hadoop vs. Outras soluções NoSQL
- Para acesso interativo e aleatório a dados
- Hbase (banco de dados orientado a colunas) em cima do Hadoop
- Acesso aleatório a dados, mas com restrições impostas (máx. 1 PB)
- Não bom para análises ad-hoc, bom para log, contagem, séries temporais
- Sqoop - Importação de bancos de dados para Hive ou HDFS (acesso JDBC/ODBC)
- Flume – Stream de dados (ex. dados de log) para o HDFS
Dia 2: Sessão 2: Sistema de Gerenciamento de Big Data
- Movimentação de partes, nós de computação iniciar/falhar: ZooKeeper - Para serviços de configuração/coordenação/nomeação
- Pipeline/fluxo de trabalho complexo: Oozie – gerenciar fluxo de trabalho, dependências, cadeia
- Implantação, configuração, gerenciamento de cluster, upgrade, etc. (sys admin): Ambari
- Em Nuvem: Whirr
Dia 2: Sessão 3: Analítica Preditiva em Business Intelligence -1: Técnicas Fundamentais e BI baseado em Machine Learning:
- Introdução ao Machine Learning
- Técnicas de aprendizagem de classificação
- Predição Bayesiana-preparação do arquivo de treinamento
- Máquina Vetor de Suporte (SVM)
- KNN p-Tree Algebra & mineração vertical
- Rede Neural
- Problema de variáveis grandes em Big Data - Floresta Aleatória (RF)
- Problema de Automação em Big Data – Ensemble multi-modelo RF
- Automação através do Soft10-M
- Ferramenta de análise de texto-Treeminer
- Aprendizagem Ágil
- Aprendizagem baseada em Agentes
- Aprendizagem Distribuída
- Introdução a Ferramentas Open source para analítica preditiva: R, Rapidminer, Mahut
Dia 2: Sessão 4: Ecossistema de analítica preditiva-2: Problemas comuns de analítica preditiva no Governo
- Analítica de Insight
- Analítica de Visualização
- Analítica preditiva estruturada
- Analítica preditiva não estruturada
- Perfilamento de ameaça/fraude/fornecedor
- Motor de Recomendação
- Detecção de Padrões
- Descoberta de Regras/Cenários – falha, fraude, otimização
- Descoberta de Causa Raiz
- Análise de Sentimento
- Analítica de CRM
- Analítica de Rede
- Análise de Texto
- Revisão assistida por tecnologia
- Analítica de Fraudes
- Análise em Tempo Real
Dia 3: Sessão 1: Análise em Tempo Real e Escalável sobre Hadoop
- Por que algoritmos de análise comuns falham em Hadoop/HDFS
- Apache Hama- para computação distribuída Síncrona em Lote
- Apache SPARK- para computação em cluster para análise em tempo real
- CMU Graphics Lab2- Abordagem assíncrona baseada em grafos para computação distribuída
- Abordagem baseada em KNN p-Algebra do Treeminer para reduzir custos de hardware de operação
Dia 3: Sessão 2: Ferramentas para eDiscovery e Forense
- eDiscovery sobre Big Data vs. dados Legados – uma comparação de custo e desempenho
- Codificação preditiva e revisão assistida por tecnologia (TAR)
- Demonstração ao vivo de um produto Tar (vMiner) para entender como o TAR funciona para descoberta mais rápida
- Indexação mais rápida através do HDFS – velocidade dos dados
- NLP ou Processamento de Linguagem Natural – várias técnicas e produtos open source
- eDiscovery em línguas estrangeiras - tecnologia para processamento de língua estrangeira
Dia 3: Sessão 3: BI de Big Data para Segurança Cibernética – Entendendo as vistas 360 graus da coleta rápida de dados à identificação de ameaças
- Entendendo as bases da analítica de segurança – superfície de ataque, configuração incorreta de segurança, defesas do host
- Infraestrutura de Rede / Grande datapipe / ETL de Resposta para analítica em tempo real
- Prescritivo vs Preditivo – Baseado em regras fixas vs auto-descoberta de regras de ameaças de Metadados
Dia 3: Sessão 4: Big Data na USDA: Aplicação na Agricultura
- Introdução ao IoT (Internet das Coisas) para agricultura – Big Data baseado em sensores e controle
- Introdução à imagem por satélite e sua aplicação na agricultura
- Integrando dados de sensores e imagens para fertilidade do solo, recomendação de cultivo e previsão
- Seguro agrícola e Big Data
- Previsão de Perda de Colheita
Dia 4: Sessão 1: BI de prevenção de fraudes a partir de Big Data no Governo – Analítica de fraudes:
- Classificação básica de analítica de fraudes - baseada em regras vs analítica preditiva
- Machine learning supervisionado vs não supervisionado para detecção de padrões de fraude
- Fraude de fornecedor/cobrança excessiva por projetos
- Fraude em Medicare e Medicaid - técnicas de detecção de fraude para processamento de pedidos
- Fraudes em reembolsos de viagem
- Fraudes em reembolso do IRS
- Estudos de caso e demonstrações ao vivo serão dados sempre que houver dados disponíveis.
Dia 4: Sessão 2: Analítica de Mídias Sociais - Coleta e análise de inteligência
- API de ETL de Big Data para extração de dados de mídias sociais
- Texto, imagem, metadados e vídeo
- Análise de sentimento de feeds de mídias sociais
- Filtragem contextual e não contextual de feeds de mídias sociais
- Dashboard de Mídias Sociais para integrar diversas mídias sociais
- Perfilamento automatizado de perfil de mídias sociais
- Demonstração ao vivo de cada análise será dada através da ferramenta Treeminer.
Dia 4: Sessão 3: Analítica de Big Data em processamento de imagem e feeds de vídeo
- Técnicas de Armazenamento de Imagem em Big Data - Solução de armazenamento para dados excedendo petabytes
- LTFS e LTO
- GPFS-LTFS (Solução de armazenamento em camadas para Big image data)
- Fundamentos da analítica de imagem
- Reconhecimento de Objetos
- Segmentação de Imagem
- Rastreamento de Movimento
- Reconstrução de imagem 3-D
Dia 4: Sessão 4: Aplicações de Big Data na NIH:
- Áreas emergentes de Bio-informática
- Meta-genômica e questões de mineração de Big Data
- Analítica Preditiva de Big Data para Farmacogenômica, Metabolômica e Proteômica
- Big Data no processo downstream de Genômica
- Aplicação da analítica preditiva de Big data em Saúde Pública
Dashboard de Big Data para acessibilidade rápida de dados diversos e display :
- Integração da plataforma de aplicação existente com Dashboard de Big Data
- Gestão de Big Data
- Estudo de Caso de Dashboard de Big Data: Tableau e Pentaho
- Use app de Big Data para impulsionar serviços baseados em localização no Governo.
- Sistema de rastreamento e gerenciamento
Dia 5: Sessão 1: Como justificar a implementação de BI de Big Data dentro de uma organização:
- Definindo ROI para implementação de Big Data
- Estudos de caso para economia de Tempo de Analista para coleta e preparação de Dados – aumento no ganho de produtividade
- Estudos de caso de ganho de receita da economia do custo de banco de dados licenciado
- Ganho de receita de serviços baseados em localização
- Economia de prevenção de fraudes
- Uma abordagem integrada de planilha para calcular aproximadamente despesa vs. ganho de receita/economias da implementação de Big Data.
Dia 5: Sessão 2: Procedimento passo a passo para substituir sistema de dados legado por Sistema de Big Data:
- Entendendo o Mapa de Migração Prático de Big Data
- Quais são as informações importantes necessárias antes de projetar uma implementação de Big Data
- Quais são as diferentes maneiras de calcular volume, velocidade, variedade e veracidade dos dados
- Como estimar o crescimento dos dados
- Estudos de caso
Dia 5: Sessão 4: Revisão de Vendedores de Big Data e revisão de seus produtos. Sessão Q/A:
- Accenture
- APTEAN (Anteriormente CDC Software)
- Cisco Systems
- Cloudera
- Dell
- EMC
- GoodData Corporation
- Guavus
- Hitachi Data Systems
- Hortonworks
- HP
- IBM
- Informatica
- Intel
- Jaspersoft
- Microsoft
- MongoDB (Anteriormente 10Gen)
- MU Sigma
- Netapp
- Opera Solutions
- Oracle
- Pentaho
- Platfora
- Qliktech
- Quantum
- Rackspace
- Revolution Analytics
- Salesforce
- SAP
- SAS Institute
- Sisense
- Software AG/Terracotta
- Soft10 Automation
- Splunk
- Sqrrl
- Supermicro
- Tableau Software
- Teradata
- Think Big Analytics
- Tidemark Systems
- Treeminer
- VMware (Parte da EMC)
Requisitos
- Conhecimento básico da operação de negócios e sistemas de dados no governo em seu domínio
- Entendimento básico de SQL/Oracle ou banco de dados relacional
- Entendimento básico de Estatística (em nível de planilhas)
35 Horas
Treinamento Corporativo Personalizado
Soluções de treinamento projetadas exclusivamente para empresas.
- Conteúdo Personalizado: Adaptamos o programa e os exercícios práticos aos objetivos e necessidades reais do seu projeto.
- Horário Flexível: Datas e horários adaptados à agenda da sua equipe.
- Formato: Online (ao vivo), In-Company (em suas instalações) ou Híbrido.
Preço por grupo privado, treinamento online ao vivo, a partir de 6500 € + VAT*
Entre em contato conosco para obter um orçamento preciso e conhecer nossas promoções mais recentes
Testemunhos de Clientes (1)
A capacidade do instrutor de alinhar o curso com os requisitos da organização, e não apenas oferecer o curso por mera formalidade.
Masilonyane - Revenue Services Lesotho
Curso - Big Data Business Intelligence for Govt. Agencies
Máquina Traduzida