Entrar em Contato

Programa do Curso

Cada sessão tem duração de 2 horas

Dia 1: Sessão 1: Visão Geral de Negócios do Porquê da Business Intelligence de Big Data no Governo

  • Estudos de Caso da NIH, DoE
  • Taxa de adaptação de Big Data nas Agências Governamentais e como estão alinhando suas operações futuras à Analítica Preditiva de Big Data
  • Áreas de Aplicação em Grande Escala na DoD, NSA, IRS, USDA, etc.
  • Interfacing Big Data com dados legados
  • Entendimento básico das tecnologias habilitadoras na analítica preditiva
  • Integração de Dados e visualização de Dashboards
  • Gestão de Fraudes
  • Geração de Regras de Negócio / Detecção de Fraudes
  • Detecção e perfilamento de ameaças
  • Análise de custos e benefícios para implementação de Big Data

Dia 1: Sessão 2: Introdução ao Big Data-1

  • Principais características do Big Data: volume, variedade, velocidade e veracidade. Arquitetura MPP para volume.
  • Depósitos de Dados (Data Warehouses) – esquema estático, conjunto de dados que evolui lentamente
  • Bancos de Dados MPP como Greenplum, Exadata, Teradata, Netezza, Vertica, etc.
  • Soluções Baseadas em Hadoop – sem condições sobre a estrutura do conjunto de dados.
  • Padrão típico: HDFS, MapReduce (crunch), recuperação do HDFS
  • Processamento em Lote (Batch) – adequado para analítico/não interativo
  • Volume: CEP streaming data
  • Escolhas típicas – produtos CEP (ex. Infostreams, Apama, MarkLogic, etc.)
  • Menos prontos para produção – Storm/S4
  • Bancos de Dados NoSQL – (colunar e chave-valor): Mais adequados como adjuvante analítico ao data warehouse/banco de dados

Dia 1: Sessão 3: Introdução ao Big Data-2

Soluções NoSQL

  • KV Store - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
  • KV Store - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
  • KV Store (Hierárquico) - GT.m, Cache
  • KV Store (Ordenado) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
  • KV Cache - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
  • Tuple Store - Gigaspaces, Coord, Apache River
  • Banco de Objetos - ZopeDB, DB40, Shoal
  • Document Store - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databases, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
  • Wide Columnar Store - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI

Variedades de Dados: Introdução às questões de Limpeza de Dados em Big Data

  • RDBMS – estrutura/esquema estático, não promove um ambiente ágil e exploratório.
  • NoSQL – semi estruturado, estrutura suficiente para armazenar dados sem esquema exato antes do armazenamento
  • Questões de limpeza de dados

Dia 1: Sessão 4: Introdução ao Big Data-3: Hadoop

  • Quando selecionar Hadoop?
  • ESTRUTURADO - Depósitos de dados/bancos de dados empresariais podem armazenar dados massivos (a um custo), mas impõem estrutura (não bom para exploração ativa)
  • Dados SEMI ESTRUTURADOS – difícil de tratar com soluções tradicionais (DW/DB)
  • Armazenamento de dados = GRANDE esforço e estático mesmo após a implementação
  • Para variedade e volume de dados, processados em hardware commodity – HADOOP
  • Hardware Commodity necessário para criar um Cluster Hadoop

Introdução a Map Reduce /HDFS

  • MapReduce – distribuir computação em vários servidores
  • HDFS – tornar dados disponíveis localmente para o processo de computação (com redundância)
  • Dados – podem ser não estruturados/sem esquema (diferente de RDBMS)
  • Responsabilidade do desenvolvedor para dar sentido aos dados
  • Programação MapReduce = trabalhar com Java (prós/contras), carregando manualmente dados para o HDFS

Dia 2: Sessão 1: Ecossistema de Big Data - Construindo Big Data ETL: universo de Ferramentas de Big Data - qual usar e quando?

  • Hadoop vs. Outras soluções NoSQL
  • Para acesso interativo e aleatório a dados
  • Hbase (banco de dados orientado a colunas) em cima do Hadoop
  • Acesso aleatório a dados, mas com restrições impostas (máx. 1 PB)
  • Não bom para análises ad-hoc, bom para log, contagem, séries temporais
  • Sqoop - Importação de bancos de dados para Hive ou HDFS (acesso JDBC/ODBC)
  • Flume – Stream de dados (ex. dados de log) para o HDFS

Dia 2: Sessão 2: Sistema de Gerenciamento de Big Data

  • Movimentação de partes, nós de computação iniciar/falhar: ZooKeeper - Para serviços de configuração/coordenação/nomeação
  • Pipeline/fluxo de trabalho complexo: Oozie – gerenciar fluxo de trabalho, dependências, cadeia
  • Implantação, configuração, gerenciamento de cluster, upgrade, etc. (sys admin): Ambari
  • Em Nuvem: Whirr

Dia 2: Sessão 3: Analítica Preditiva em Business Intelligence -1: Técnicas Fundamentais e BI baseado em Machine Learning:

  • Introdução ao Machine Learning
  • Técnicas de aprendizagem de classificação
  • Predição Bayesiana-preparação do arquivo de treinamento
  • Máquina Vetor de Suporte (SVM)
  • KNN p-Tree Algebra & mineração vertical
  • Rede Neural
  • Problema de variáveis grandes em Big Data - Floresta Aleatória (RF)
  • Problema de Automação em Big Data – Ensemble multi-modelo RF
  • Automação através do Soft10-M
  • Ferramenta de análise de texto-Treeminer
  • Aprendizagem Ágil
  • Aprendizagem baseada em Agentes
  • Aprendizagem Distribuída
  • Introdução a Ferramentas Open source para analítica preditiva: R, Rapidminer, Mahut

Dia 2: Sessão 4: Ecossistema de analítica preditiva-2: Problemas comuns de analítica preditiva no Governo

  • Analítica de Insight
  • Analítica de Visualização
  • Analítica preditiva estruturada
  • Analítica preditiva não estruturada
  • Perfilamento de ameaça/fraude/fornecedor
  • Motor de Recomendação
  • Detecção de Padrões
  • Descoberta de Regras/Cenários – falha, fraude, otimização
  • Descoberta de Causa Raiz
  • Análise de Sentimento
  • Analítica de CRM
  • Analítica de Rede
  • Análise de Texto
  • Revisão assistida por tecnologia
  • Analítica de Fraudes
  • Análise em Tempo Real

Dia 3: Sessão 1: Análise em Tempo Real e Escalável sobre Hadoop

  • Por que algoritmos de análise comuns falham em Hadoop/HDFS
  • Apache Hama- para computação distribuída Síncrona em Lote
  • Apache SPARK- para computação em cluster para análise em tempo real
  • CMU Graphics Lab2- Abordagem assíncrona baseada em grafos para computação distribuída
  • Abordagem baseada em KNN p-Algebra do Treeminer para reduzir custos de hardware de operação

Dia 3: Sessão 2: Ferramentas para eDiscovery e Forense

  • eDiscovery sobre Big Data vs. dados Legados – uma comparação de custo e desempenho
  • Codificação preditiva e revisão assistida por tecnologia (TAR)
  • Demonstração ao vivo de um produto Tar (vMiner) para entender como o TAR funciona para descoberta mais rápida
  • Indexação mais rápida através do HDFS – velocidade dos dados
  • NLP ou Processamento de Linguagem Natural – várias técnicas e produtos open source
  • eDiscovery em línguas estrangeiras - tecnologia para processamento de língua estrangeira

Dia 3: Sessão 3: BI de Big Data para Segurança Cibernética – Entendendo as vistas 360 graus da coleta rápida de dados à identificação de ameaças

  • Entendendo as bases da analítica de segurança – superfície de ataque, configuração incorreta de segurança, defesas do host
  • Infraestrutura de Rede / Grande datapipe / ETL de Resposta para analítica em tempo real
  • Prescritivo vs Preditivo – Baseado em regras fixas vs auto-descoberta de regras de ameaças de Metadados

Dia 3: Sessão 4: Big Data na USDA: Aplicação na Agricultura

  • Introdução ao IoT (Internet das Coisas) para agricultura – Big Data baseado em sensores e controle
  • Introdução à imagem por satélite e sua aplicação na agricultura
  • Integrando dados de sensores e imagens para fertilidade do solo, recomendação de cultivo e previsão
  • Seguro agrícola e Big Data
  • Previsão de Perda de Colheita

Dia 4: Sessão 1: BI de prevenção de fraudes a partir de Big Data no Governo – Analítica de fraudes:

  • Classificação básica de analítica de fraudes - baseada em regras vs analítica preditiva
  • Machine learning supervisionado vs não supervisionado para detecção de padrões de fraude
  • Fraude de fornecedor/cobrança excessiva por projetos
  • Fraude em Medicare e Medicaid - técnicas de detecção de fraude para processamento de pedidos
  • Fraudes em reembolsos de viagem
  • Fraudes em reembolso do IRS
  • Estudos de caso e demonstrações ao vivo serão dados sempre que houver dados disponíveis.

Dia 4: Sessão 2: Analítica de Mídias Sociais - Coleta e análise de inteligência

  • API de ETL de Big Data para extração de dados de mídias sociais
  • Texto, imagem, metadados e vídeo
  • Análise de sentimento de feeds de mídias sociais
  • Filtragem contextual e não contextual de feeds de mídias sociais
  • Dashboard de Mídias Sociais para integrar diversas mídias sociais
  • Perfilamento automatizado de perfil de mídias sociais
  • Demonstração ao vivo de cada análise será dada através da ferramenta Treeminer.

Dia 4: Sessão 3: Analítica de Big Data em processamento de imagem e feeds de vídeo

  • Técnicas de Armazenamento de Imagem em Big Data - Solução de armazenamento para dados excedendo petabytes
  • LTFS e LTO
  • GPFS-LTFS (Solução de armazenamento em camadas para Big image data)
  • Fundamentos da analítica de imagem
  • Reconhecimento de Objetos
  • Segmentação de Imagem
  • Rastreamento de Movimento
  • Reconstrução de imagem 3-D

Dia 4: Sessão 4: Aplicações de Big Data na NIH:

  • Áreas emergentes de Bio-informática
  • Meta-genômica e questões de mineração de Big Data
  • Analítica Preditiva de Big Data para Farmacogenômica, Metabolômica e Proteômica
  • Big Data no processo downstream de Genômica
  • Aplicação da analítica preditiva de Big data em Saúde Pública

Dashboard de Big Data para acessibilidade rápida de dados diversos e display :

  • Integração da plataforma de aplicação existente com Dashboard de Big Data
  • Gestão de Big Data
  • Estudo de Caso de Dashboard de Big Data: Tableau e Pentaho
  • Use app de Big Data para impulsionar serviços baseados em localização no Governo.
  • Sistema de rastreamento e gerenciamento

Dia 5: Sessão 1: Como justificar a implementação de BI de Big Data dentro de uma organização:

  • Definindo ROI para implementação de Big Data
  • Estudos de caso para economia de Tempo de Analista para coleta e preparação de Dados – aumento no ganho de produtividade
  • Estudos de caso de ganho de receita da economia do custo de banco de dados licenciado
  • Ganho de receita de serviços baseados em localização
  • Economia de prevenção de fraudes
  • Uma abordagem integrada de planilha para calcular aproximadamente despesa vs. ganho de receita/economias da implementação de Big Data.

Dia 5: Sessão 2: Procedimento passo a passo para substituir sistema de dados legado por Sistema de Big Data:

  • Entendendo o Mapa de Migração Prático de Big Data
  • Quais são as informações importantes necessárias antes de projetar uma implementação de Big Data
  • Quais são as diferentes maneiras de calcular volume, velocidade, variedade e veracidade dos dados
  • Como estimar o crescimento dos dados
  • Estudos de caso

Dia 5: Sessão 4: Revisão de Vendedores de Big Data e revisão de seus produtos. Sessão Q/A:

  • Accenture
  • APTEAN (Anteriormente CDC Software)
  • Cisco Systems
  • Cloudera
  • Dell
  • EMC
  • GoodData Corporation
  • Guavus
  • Hitachi Data Systems
  • Hortonworks
  • HP
  • IBM
  • Informatica
  • Intel
  • Jaspersoft
  • Microsoft
  • MongoDB (Anteriormente 10Gen)
  • MU Sigma
  • Netapp
  • Opera Solutions
  • Oracle
  • Pentaho
  • Platfora
  • Qliktech
  • Quantum
  • Rackspace
  • Revolution Analytics
  • Salesforce
  • SAP
  • SAS Institute
  • Sisense
  • Software AG/Terracotta
  • Soft10 Automation
  • Splunk
  • Sqrrl
  • Supermicro
  • Tableau Software
  • Teradata
  • Think Big Analytics
  • Tidemark Systems
  • Treeminer
  • VMware (Parte da EMC)

Requisitos

  • Conhecimento básico da operação de negócios e sistemas de dados no governo em seu domínio
  • Entendimento básico de SQL/Oracle ou banco de dados relacional
  • Entendimento básico de Estatística (em nível de planilhas)
 35 Horas

Treinamento Corporativo Personalizado

Soluções de treinamento projetadas exclusivamente para empresas.

  • Conteúdo Personalizado: Adaptamos o programa e os exercícios práticos aos objetivos e necessidades reais do seu projeto.
  • Horário Flexível: Datas e horários adaptados à agenda da sua equipe.
  • Formato: Online (ao vivo), In-Company (em suas instalações) ou Híbrido.
Investimento

Preço por grupo privado, treinamento online ao vivo, a partir de 6500 € + VAT*

Entre em contato conosco para obter um orçamento preciso e conhecer nossas promoções mais recentes

Testemunhos de Clientes (1)

Próximas Formações Provisórias

Categorias Relacionadas