Merci d'avoir envoyé votre demande ! Un membre de notre équipe vous contactera sous peu.
Merci d'avoir envoyé votre réservation ! Un membre de notre équipe vous contactera sous peu.
Plan du cours
Chaque session dure 2 heures
Jour 1 : Session -1 : Vue d'ensemble des affaires sur la raison d'être de la BI Big Data dans le gouvernement
- Études de cas provenant du NIH, du DoE
- Taux d'adaptation du Big Data dans les agences gouvernementales et la façon dont elles alignent leurs opérations futures sur l'analytique prédictive du Big Data
- Domaines d'application à grande échelle dans le DoD, la NSA, le IRS, le USDA, etc.
- Interfaçage du Big Data avec les données de patrimoine (legacy)
- Compréhension de base des technologies d'habilitation dans l'analytique prédictive
- Intégration des données & visualisation par tableau de bord
- Gestion de la fraude
- Génération de règles métier / détection de la fraude
- Détection et profilage des menaces
- Analyse coûts-avantages pour la mise en œuvre du Big Data
Jour 1 : Session-2 : Introduction au Big Data-1
- Caractéristiques principales du Big Data : volume, variété, vélocité et véracité. Architecture MPP pour le volume.
- Entrepôts de données – schéma statique, jeu de données évoluant lentement
- Bases de données MPP comme Greenplum, Exadata, Teradata, Netezza, Vertica, etc.
- Solutions basées sur Hadoop – aucune condition sur la structure du jeu de données.
- Modèle typique : HDFS, MapReduce (crunch), récupération depuis HDFS
- Par lot – adapté à l'analytique/non interactif
- Volume : données en flux CEP
- Choix typiques – produits CEP (p. ex. Infostreams, Apama, MarkLogic, etc.)
- Moins prêts pour la production – Storm/S4
- Bases de données NoSQL – (colonne et clé-valeur) : Le mieux adapté comme adjunct analytique à l'entrepôt de données/base de données
Jour 1 : Session -3 : Introduction au Big Data-2
Solutions NoSQL
- KV Store - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
- KV Store - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
- KV Store (Hiérarchique) - GT.m, Cache
- KV Store (Ordonné) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
- KV Cache - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
- Tuple Store - Gigaspaces, Coord, Apache River
- Base de données objet - ZopeDB, DB40, Shoal
- Document Store - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databases, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
- Wide Columnar Store - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI
Variétés de données : Introduction à la question du nettoyage des données dans le Big Data
- RDBMS – structure/schéma statique, ne favorise pas un environnement agile et exploratoire.
- NoSQL – semi-structuré, structure suffisante pour stocker des données sans schéma exact avant le stockage
- Problèmes de nettoyage des données
Jour 1 : Session-4 : Introduction au Big Data-3 : Hadoop
- Quand choisir Hadoop ?
- STRUCTURÉ - Les entrepôts de données/bases de données d'entreprise peuvent stocker des données massives (à un coût) mais imposent une structure (pas bon pour l'exploration active)
- Données SEMI STRUCTURÉES – difficile à gérer avec les solutions traditionnelles (DW/DB)
- Entreposage des données = effort ENORME et statique même après mise en œuvre
- Pour la variété & le volume de données, traité sur matériel de commodité – HADOOP
- Matériel de commodité (H/W) nécessaire pour créer un cluster Hadoop
Introduction à MapReduce /HDFS
- MapReduce – distribuer le calcul sur plusieurs serveurs
- HDFS – rendre les données disponibles localement pour le processus de calcul (avec redondance)
- Données – peuvent être non structurées/sans schéma (contrairement aux RDBMS)
- Responsabilité du développeur de donner un sens aux données
- Programmation de MapReduce = travail avec Java (avantages/inconvénients), chargement manuel des données dans HDFS
Jour 2 : Session-1 : Écosystème du Big Data-Construire le Big Data ETL : univers d'outils Big Data-lequel utiliser et quand ?
- Hadoop vs. Autres solutions NoSQL
- Pour l'accès interactif, aléatoire aux données
- Hbase (base de données orientée colonnes) sur Hadoop
- Accès aléatoire aux données mais restrictions imposées (max 1 Po)
- Non bon pour l'analytique ad hoc, bon pour la journalisation, le comptage, les séries temporelles
- Sqoop - Importation depuis les bases de données vers Hive ou HDFS (accès JDBC/ODBC)
- Flume – Flux de données (p. ex. données de journal) vers HDFS
Jour 2 : Session-2 : Système de gestion du Big Data
- Déplacements de parties, démarrage/échec des nœuds de calcul : ZooKeeper - Pour les services de configuration/coordination/nommage
- Chaîne de traitement/complexe de workflow : Oozie – gérer le workflow, les dépendances, la chaîne en série
- Déploiement, configuration, gestion de cluster, mise à niveau, etc. (admin système) : Ambari
- Dans le Cloud : Whirr
Jour 2 : Session-3 : Analytique prédictive dans la Business Intelligence -1 : Techniques fondamentales & BI basée sur l'apprentissage automatique :
- Introduction à l'apprentissage automatique
- Techniques d'apprentissage de la classification
- Prédiction bayésienne- préparation du fichier d'entraînement
- Machine à Vecteurs de Support
- KNN p-Tree Algebra & mining vertical
- Réseau de neurones
- Problème de grandes variables dans le Big Data - Forêt aléatoire (RF)
- Problème d'automatisation du Big Data – Ensemble multi-modèle RF
- Automatisation via Soft10-M
- Outil d'analytique de texte-Treeminer
- Apprentissage agile
- Apprentissage par agents
- Apprentissage distribué
- Introduction aux outils open source pour l'analytique prédictive : R, Rapidminer, Mahut
Jour 2 : Session-4 Écosystème de l'analytique prédictive-2 : Problèmes d'analytique prédictive courants dans le gouvernement.
- Analytique d'insights
- Analytique de visualisation
- Analytique prédictive structurée
- Analytique prédictive non structurée
- Profilage des menaces/fraude/vendeurs
- Moteur de recommandation
- Détection de schémas
- Découverte de règles/scénarios – échec, fraude, optimisation
- Découverte de la cause racine
- Analyse de sentiment
- Analytique CRM
- Analytique de réseau
- Analytique de texte
- Assistance technologique à la révision
- Analytique de la fraude
- Analytique en temps réel
Jour 3 : Sesion-1 : Analytique en temps réel et scalable sur Hadoop
- Pourquoi les algorithmes d'analytique courants échouent sur Hadoop/HDFS
- Apache Hama- pour le calcul distribué synchrone par lots
- Apache SPARK- pour le calcul de cluster pour l'analytique en temps réel
- CMU Graphics Lab2- Approche asynchrone basée sur les graphes pour le calcul distribué
- Approche basée sur KNN p-Algebra de Treeminer pour réduire les coûts matériels de fonctionnement
Jour 3 : Session-2 : Outils pour eDiscovery et Forensics
- eDiscovery sur Big Data vs. données de patrimoine – une comparaison des coûts et des performances
- Prédiction de code et assistance technologique à la révision (TAR)
- Démonstration live d'un produit Tar (vMiner) pour comprendre comment TAR fonctionne pour une découverte plus rapide
- Indexation plus rapide via HDFS – vélocité des données
- NLP ou traitement du langage naturel – diverses techniques et produits open source
- eDiscovery en langues étrangères-technologie pour le traitement des langues étrangères
Jour 3 : Session 3 : BI Big Data pour la cybersécurité – Comprendre la vue à 360 degrés de la collecte rapide de données à l'identification des menaces
- Comprendre les bases de l'analytique de sécurité-surface d'attaque, mauvaise configuration de sécurité, défenses de l'hôte
- Infrastructure réseau/Grand tuyau de données/ETL de réponse pour l'analytique en temps réel
- Prescriptif vs prédictif – Règles fixes basées sur des règles vs découverte automatique de règles de menace depuis les méta-données
Jour 3 : Session 4 : Big Data dans le USDA : Application en agriculture
- Introduction à l'IoT (Internet des Objets) pour l'agriculture-Big Data basé sur capteurs et contrôle
- Introduction à l'imagerie satellite et son application en agriculture
- Intégration des données de capteurs et d'images pour la fertilité du sol, la recommandation de culture et la prévision
- Assurance agricole et Big Data
- Prévision des pertes de récolte
Jour 4 : Session-1: BI de prévention de la fraude depuis le Big Data dans le gouvernement-Analytique de la fraude:
- Classification de base de l'analytique de la fraude-basée sur des règles vs analytique prédictive
- Apprentissage automatique supervisé vs non supervisé pour la détection de schémas de fraude
- Fraude des fournisseurs/surfacturation des projets
- Fraude Medicare et Medicaid-techniques de détection de la fraude pour le traitement des réclamations
- Fraudes de remboursement de voyage
- Fraudes de remboursement IRS
- Des études de cas et des démonstrations live seront données chaque fois que les données sont disponibles.
Jour 4 : Session-2: Analytique des médias sociaux-Collecte et analyse d'intelligence
- API ETL Big Data pour l'extraction de données de médias sociaux
- Texte, image, méta-données et vidéo
- Analyse de sentiment à partir des flux de médias sociaux
- Filtrage contextuel et non contextuel des flux de médias sociaux
- Tableau de bord des médias sociaux pour intégrer les divers médias sociaux
- Profilage automatisé des profils de médias sociaux
- Une démonstration live de chaque analytique sera donnée via l'outil Treeminer.
Jour 4 : Session-3: Analytique Big Data dans le traitement d'images et les flux vidéo
- Techniques de stockage d'images dans le Big Data-Solution de stockage pour les données dépassant les péta-octets
- LTFS et LTO
- GPFS-LTFS (Solution de stockage stratifiée pour les grandes données d'images)
- Fondamentaux de l'analytique d'images
- Reconnaissance d'objets
- Segmentation d'images
- Suivi de mouvement
- Reconstruction d'images 3D
Jour 4: Session-4: Applications du Big Data dans le NIH:
- Domaines émergents de la Bio-informatique
- Méta-génomique et problèmes de minage du Big Data
- Analytique prédictive du Big Data pour la Pharmacogénomique, la Métabolomique et la Protéomique
- Big Data dans le processus en aval de la Génomique
- Application de l'analytique prédictive Big Data dans la Santé publique
Tableau de bord Big Data pour l'accessibilité rapide de données diverses et l'affichage :
- Intégration de la plateforme d'application existante avec le Tableau de bord Big Data
- Gestion du Big Data
- Étude de cas du Tableau de bord Big Data: Tableau et Pentaho
- Utiliser l'app Big Data pour pousser les services basés sur la localisation dans le gouvernement.
- Système de suivi et de gestion
Jour 5 : Session-1: Comment justifier la mise en œuvre de la BI Big Data au sein d'une organisation:
- Définition du ROI pour la mise en œuvre du Big Data
- Études de cas pour économiser le temps d'analyste pour la collecte et la préparation des données –augmentation du gain de productivité
- Études de cas de gains de revenus issus de l'économie des coûts des bases de données licenciées
- Gains de revenus issus des services basés sur la localisation
- Économies provenant de la prévention de la fraude
- Une approche intégrée par tableur pour calculer l'approximation des dépenses vs. les gains de revenus/économies de la mise en œuvre du Big Data.
Jour 5 : Session-2: Procédure étape par étape pour remplacer le système de données de patrimoine par un système Big Data:
- Compréhension d'une feuille de route de migration Big Data pratique
- Quelles sont les informations importantes nécessaires avant d'architecturer une mise en œuvre Big Data
- Quelles sont les différentes façons de calculer le volume, la vélocité, la variété et la véracité des données
- Comment estimer la croissance des données
- Études de cas
Jour 5: Session 4: Revue des fournisseurs Big Data et de leurs produits. Session Q/R:
- Accenture
- APTEAN (Anciennement CDC Software)
- Cisco Systems
- Cloudera
- Dell
- EMC
- GoodData Corporation
- Guavus
- Hitachi Data Systems
- Hortonworks
- HP
- IBM
- Informatica
- Intel
- Jaspersoft
- Microsoft
- MongoDB (Anciennement 10Gen)
- MU Sigma
- Netapp
- Opera Solutions
- Oracle
- Pentaho
- Platfora
- Qliktech
- Quantum
- Rackspace
- Revolution Analytics
- Salesforce
- SAP
- SAS Institute
- Sisense
- Software AG/Terracotta
- Soft10 Automation
- Splunk
- Sqrrl
- Supermicro
- Tableau Software
- Teradata
- Think Big Analytics
- Tidemark Systems
- Treeminer
- VMware (Partie d'EMC)
Pré requis
- Connaissances de base du fonctionnement des affaires et des systèmes de données dans le domaine gouvernemental
- Compréhension de base de SQL/Oracle ou des bases de données relationnelles
- Compréhension de base de la statistique (au niveau des tableurs)
35 Heures
Nos clients témoignent (1)
La capacité du formateur à aligner le cours sur les exigences de l'organisation, et non simplement à le dispenser pour le principe de sa livraison.
Masilonyane - Revenue Services Lesotho
Formation - Big Data Business Intelligence for Govt. Agencies
Traduction automatique