Prenez contact avec nous

Plan du cours

Chaque session dure 2 heures

Jour 1 : Session -1 : Vue d'ensemble des affaires sur la raison d'être de la BI Big Data dans le gouvernement

  • Études de cas provenant du NIH, du DoE
  • Taux d'adaptation du Big Data dans les agences gouvernementales et la façon dont elles alignent leurs opérations futures sur l'analytique prédictive du Big Data
  • Domaines d'application à grande échelle dans le DoD, la NSA, le IRS, le USDA, etc.
  • Interfaçage du Big Data avec les données de patrimoine (legacy)
  • Compréhension de base des technologies d'habilitation dans l'analytique prédictive
  • Intégration des données & visualisation par tableau de bord
  • Gestion de la fraude
  • Génération de règles métier / détection de la fraude
  • Détection et profilage des menaces
  • Analyse coûts-avantages pour la mise en œuvre du Big Data

Jour 1 : Session-2 : Introduction au Big Data-1

  • Caractéristiques principales du Big Data : volume, variété, vélocité et véracité. Architecture MPP pour le volume.
  • Entrepôts de données – schéma statique, jeu de données évoluant lentement
  • Bases de données MPP comme Greenplum, Exadata, Teradata, Netezza, Vertica, etc.
  • Solutions basées sur Hadoop – aucune condition sur la structure du jeu de données.
  • Modèle typique : HDFS, MapReduce (crunch), récupération depuis HDFS
  • Par lot – adapté à l'analytique/non interactif
  • Volume : données en flux CEP
  • Choix typiques – produits CEP (p. ex. Infostreams, Apama, MarkLogic, etc.)
  • Moins prêts pour la production – Storm/S4
  • Bases de données NoSQL – (colonne et clé-valeur) : Le mieux adapté comme adjunct analytique à l'entrepôt de données/base de données

Jour 1 : Session -3 : Introduction au Big Data-2

Solutions NoSQL

  • KV Store - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
  • KV Store - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
  • KV Store (Hiérarchique) - GT.m, Cache
  • KV Store (Ordonné) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
  • KV Cache - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
  • Tuple Store - Gigaspaces, Coord, Apache River
  • Base de données objet - ZopeDB, DB40, Shoal
  • Document Store - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databases, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
  • Wide Columnar Store - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI

Variétés de données : Introduction à la question du nettoyage des données dans le Big Data

  • RDBMS – structure/schéma statique, ne favorise pas un environnement agile et exploratoire.
  • NoSQL – semi-structuré, structure suffisante pour stocker des données sans schéma exact avant le stockage
  • Problèmes de nettoyage des données

Jour 1 : Session-4 : Introduction au Big Data-3 : Hadoop

  • Quand choisir Hadoop ?
  • STRUCTURÉ - Les entrepôts de données/bases de données d'entreprise peuvent stocker des données massives (à un coût) mais imposent une structure (pas bon pour l'exploration active)
  • Données SEMI STRUCTURÉES – difficile à gérer avec les solutions traditionnelles (DW/DB)
  • Entreposage des données = effort ENORME et statique même après mise en œuvre
  • Pour la variété & le volume de données, traité sur matériel de commodité – HADOOP
  • Matériel de commodité (H/W) nécessaire pour créer un cluster Hadoop

Introduction à MapReduce /HDFS

  • MapReduce – distribuer le calcul sur plusieurs serveurs
  • HDFS – rendre les données disponibles localement pour le processus de calcul (avec redondance)
  • Données – peuvent être non structurées/sans schéma (contrairement aux RDBMS)
  • Responsabilité du développeur de donner un sens aux données
  • Programmation de MapReduce = travail avec Java (avantages/inconvénients), chargement manuel des données dans HDFS

Jour 2 : Session-1 : Écosystème du Big Data-Construire le Big Data ETL : univers d'outils Big Data-lequel utiliser et quand ?

  • Hadoop vs. Autres solutions NoSQL
  • Pour l'accès interactif, aléatoire aux données
  • Hbase (base de données orientée colonnes) sur Hadoop
  • Accès aléatoire aux données mais restrictions imposées (max 1 Po)
  • Non bon pour l'analytique ad hoc, bon pour la journalisation, le comptage, les séries temporelles
  • Sqoop - Importation depuis les bases de données vers Hive ou HDFS (accès JDBC/ODBC)
  • Flume – Flux de données (p. ex. données de journal) vers HDFS

Jour 2 : Session-2 : Système de gestion du Big Data

  • Déplacements de parties, démarrage/échec des nœuds de calcul : ZooKeeper - Pour les services de configuration/coordination/nommage
  • Chaîne de traitement/complexe de workflow : Oozie – gérer le workflow, les dépendances, la chaîne en série
  • Déploiement, configuration, gestion de cluster, mise à niveau, etc. (admin système) : Ambari
  • Dans le Cloud : Whirr

Jour 2 : Session-3 : Analytique prédictive dans la Business Intelligence -1 : Techniques fondamentales & BI basée sur l'apprentissage automatique :

  • Introduction à l'apprentissage automatique
  • Techniques d'apprentissage de la classification
  • Prédiction bayésienne- préparation du fichier d'entraînement
  • Machine à Vecteurs de Support
  • KNN p-Tree Algebra & mining vertical
  • Réseau de neurones
  • Problème de grandes variables dans le Big Data - Forêt aléatoire (RF)
  • Problème d'automatisation du Big Data – Ensemble multi-modèle RF
  • Automatisation via Soft10-M
  • Outil d'analytique de texte-Treeminer
  • Apprentissage agile
  • Apprentissage par agents
  • Apprentissage distribué
  • Introduction aux outils open source pour l'analytique prédictive : R, Rapidminer, Mahut

Jour 2 : Session-4 Écosystème de l'analytique prédictive-2 : Problèmes d'analytique prédictive courants dans le gouvernement.

  • Analytique d'insights
  • Analytique de visualisation
  • Analytique prédictive structurée
  • Analytique prédictive non structurée
  • Profilage des menaces/fraude/vendeurs
  • Moteur de recommandation
  • Détection de schémas
  • Découverte de règles/scénarios – échec, fraude, optimisation
  • Découverte de la cause racine
  • Analyse de sentiment
  • Analytique CRM
  • Analytique de réseau
  • Analytique de texte
  • Assistance technologique à la révision
  • Analytique de la fraude
  • Analytique en temps réel

Jour 3 : Sesion-1 : Analytique en temps réel et scalable sur Hadoop

  • Pourquoi les algorithmes d'analytique courants échouent sur Hadoop/HDFS
  • Apache Hama- pour le calcul distribué synchrone par lots
  • Apache SPARK- pour le calcul de cluster pour l'analytique en temps réel
  • CMU Graphics Lab2- Approche asynchrone basée sur les graphes pour le calcul distribué
  • Approche basée sur KNN p-Algebra de Treeminer pour réduire les coûts matériels de fonctionnement

Jour 3 : Session-2 : Outils pour eDiscovery et Forensics

  • eDiscovery sur Big Data vs. données de patrimoine – une comparaison des coûts et des performances
  • Prédiction de code et assistance technologique à la révision (TAR)
  • Démonstration live d'un produit Tar (vMiner) pour comprendre comment TAR fonctionne pour une découverte plus rapide
  • Indexation plus rapide via HDFS – vélocité des données
  • NLP ou traitement du langage naturel – diverses techniques et produits open source
  • eDiscovery en langues étrangères-technologie pour le traitement des langues étrangères

Jour 3 : Session 3 : BI Big Data pour la cybersécurité – Comprendre la vue à 360 degrés de la collecte rapide de données à l'identification des menaces

  • Comprendre les bases de l'analytique de sécurité-surface d'attaque, mauvaise configuration de sécurité, défenses de l'hôte
  • Infrastructure réseau/Grand tuyau de données/ETL de réponse pour l'analytique en temps réel
  • Prescriptif vs prédictif – Règles fixes basées sur des règles vs découverte automatique de règles de menace depuis les méta-données

Jour 3 : Session 4 : Big Data dans le USDA : Application en agriculture

  • Introduction à l'IoT (Internet des Objets) pour l'agriculture-Big Data basé sur capteurs et contrôle
  • Introduction à l'imagerie satellite et son application en agriculture
  • Intégration des données de capteurs et d'images pour la fertilité du sol, la recommandation de culture et la prévision
  • Assurance agricole et Big Data
  • Prévision des pertes de récolte

Jour 4 : Session-1: BI de prévention de la fraude depuis le Big Data dans le gouvernement-Analytique de la fraude:

  • Classification de base de l'analytique de la fraude-basée sur des règles vs analytique prédictive
  • Apprentissage automatique supervisé vs non supervisé pour la détection de schémas de fraude
  • Fraude des fournisseurs/surfacturation des projets
  • Fraude Medicare et Medicaid-techniques de détection de la fraude pour le traitement des réclamations
  • Fraudes de remboursement de voyage
  • Fraudes de remboursement IRS
  • Des études de cas et des démonstrations live seront données chaque fois que les données sont disponibles.

Jour 4 : Session-2: Analytique des médias sociaux-Collecte et analyse d'intelligence

  • API ETL Big Data pour l'extraction de données de médias sociaux
  • Texte, image, méta-données et vidéo
  • Analyse de sentiment à partir des flux de médias sociaux
  • Filtrage contextuel et non contextuel des flux de médias sociaux
  • Tableau de bord des médias sociaux pour intégrer les divers médias sociaux
  • Profilage automatisé des profils de médias sociaux
  • Une démonstration live de chaque analytique sera donnée via l'outil Treeminer.

Jour 4 : Session-3: Analytique Big Data dans le traitement d'images et les flux vidéo

  • Techniques de stockage d'images dans le Big Data-Solution de stockage pour les données dépassant les péta-octets
  • LTFS et LTO
  • GPFS-LTFS (Solution de stockage stratifiée pour les grandes données d'images)
  • Fondamentaux de l'analytique d'images
  • Reconnaissance d'objets
  • Segmentation d'images
  • Suivi de mouvement
  • Reconstruction d'images 3D

Jour 4: Session-4: Applications du Big Data dans le NIH:

  • Domaines émergents de la Bio-informatique
  • Méta-génomique et problèmes de minage du Big Data
  • Analytique prédictive du Big Data pour la Pharmacogénomique, la Métabolomique et la Protéomique
  • Big Data dans le processus en aval de la Génomique
  • Application de l'analytique prédictive Big Data dans la Santé publique

Tableau de bord Big Data pour l'accessibilité rapide de données diverses et l'affichage :

  • Intégration de la plateforme d'application existante avec le Tableau de bord Big Data
  • Gestion du Big Data
  • Étude de cas du Tableau de bord Big Data: Tableau et Pentaho
  • Utiliser l'app Big Data pour pousser les services basés sur la localisation dans le gouvernement.
  • Système de suivi et de gestion

Jour 5 : Session-1: Comment justifier la mise en œuvre de la BI Big Data au sein d'une organisation:

  • Définition du ROI pour la mise en œuvre du Big Data
  • Études de cas pour économiser le temps d'analyste pour la collecte et la préparation des données –augmentation du gain de productivité
  • Études de cas de gains de revenus issus de l'économie des coûts des bases de données licenciées
  • Gains de revenus issus des services basés sur la localisation
  • Économies provenant de la prévention de la fraude
  • Une approche intégrée par tableur pour calculer l'approximation des dépenses vs. les gains de revenus/économies de la mise en œuvre du Big Data.

Jour 5 : Session-2: Procédure étape par étape pour remplacer le système de données de patrimoine par un système Big Data:

  • Compréhension d'une feuille de route de migration Big Data pratique
  • Quelles sont les informations importantes nécessaires avant d'architecturer une mise en œuvre Big Data
  • Quelles sont les différentes façons de calculer le volume, la vélocité, la variété et la véracité des données
  • Comment estimer la croissance des données
  • Études de cas

Jour 5: Session 4: Revue des fournisseurs Big Data et de leurs produits. Session Q/R:

  • Accenture
  • APTEAN (Anciennement CDC Software)
  • Cisco Systems
  • Cloudera
  • Dell
  • EMC
  • GoodData Corporation
  • Guavus
  • Hitachi Data Systems
  • Hortonworks
  • HP
  • IBM
  • Informatica
  • Intel
  • Jaspersoft
  • Microsoft
  • MongoDB (Anciennement 10Gen)
  • MU Sigma
  • Netapp
  • Opera Solutions
  • Oracle
  • Pentaho
  • Platfora
  • Qliktech
  • Quantum
  • Rackspace
  • Revolution Analytics
  • Salesforce
  • SAP
  • SAS Institute
  • Sisense
  • Software AG/Terracotta
  • Soft10 Automation
  • Splunk
  • Sqrrl
  • Supermicro
  • Tableau Software
  • Teradata
  • Think Big Analytics
  • Tidemark Systems
  • Treeminer
  • VMware (Partie d'EMC)

Pré requis

  • Connaissances de base du fonctionnement des affaires et des systèmes de données dans le domaine gouvernemental
  • Compréhension de base de SQL/Oracle ou des bases de données relationnelles
  • Compréhension de base de la statistique (au niveau des tableurs)
 35 Heures

Nombre de participants


Prix par participant

Nos clients témoignent (1)

Cours à venir

Catégories Similaires