Neem contact met ons op

Cursusaanbod

Elke sessie duurt 2 uur

Dag 1: Sessie 1: Business Overview: Waarom Big Data Business Intelligence in de overheid

  • Casestudies van NIH en DoE
  • Adaptatiegraad van Big Data bij overheidsinstanties en hoe zij hun toekomstige operaties uitlijnen op Big Data Predictive Analytics
  • Breedschalige toepassingsgebieden bij DoD, NSA, IRS, USDA, etc.
  • Interfacing van Big Data met legacy-data
  • Basisbegrip van enabling technologies in predictive analytics
  • Data-integratie en dashboardvisualisatie
  • Fraudebeheer
  • Generatie van business rules/fraudedetectie
  • Dreigingsdetectie en profiling
  • Kosten-batenanalyse voor Big Data-implementatie

Dag 1: Sessie 2: Inleiding Big Data-1

  • Hoofdkenmerken van Big Data: volume, variëteit, snelheid (velocity) en betrouwbaarheid (veracity). MPP-architectuur voor volume.
  • Datawarehouses – statisch schema, traag evoluerende dataset
  • MPP-databases zoals Greenplum, Exadata, Teradata, Netezza, Vertica, etc.
  • Hadoop-gebaseerde oplossingen – geen voorwaarden aan de structuur van de dataset.
  • Typisch patroon: HDFS, MapReduce (crunch), ophalen van HDFS
  • Batch – geschikt voor analytisch/niet-interactief gebruik
  • Volume: CEP streaming data
  • Typische keuzes – CEP-producten (bijv. Infostreams, Apama, MarkLogic, etc.)
  • Minder productie-klaar – Storm/S4
  • NoSQL-databases – (kolomgebaseerd en key-value): Beste aanvulling op datawarehouse/database voor analyse

Dag 1: Sessie 3: Inleiding Big Data-2

NoSQL-oplossingen

  • KV Store - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
  • KV Store - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
  • KV Store (Hiërarchisch) - GT.m, Cache
  • KV Store (Gerangschikt) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
  • KV Cache - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
  • Tuple Store - Gigaspaces, Coord, Apache River
  • Object Database - ZopeDB, DB40, Shoal
  • Document Store - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databases, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
  • Wide Columnar Store - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI

Soorten Data: Inleiding tot data-schoonmaakproblemen in Big Data

  • RDBMS – statische structuur/schema, bevordert geen agiele, exploratieve omgeving.
  • NoSQL – semi-gestructureerd, voldoende structuur om data op te slaan zonder exact schema vóór het opslaan
  • Data-schoonmaakproblemen

Dag 1: Sessie 4: Inleiding Big Data-3: Hadoop

  • Wanneer Hadoop kiezen?
  • GESTRUCTUREERD - Enterprise datawarehouses/databases kunnen enorme data opslaan (met kosten) maar leggen structuur op (niet geschikt voor actieve exploratie)
  • SEMI-GESTRUCTUREERDE data – moeilijk te verwerken met traditionele oplossingen (DW/DB)
  • Opbergen van data = ENORME inspanning en statisch zelfs na implementatie
  • Voor variëteit & volume van data, verwerkt op commodity hardware – HADOOP
  • Commodity H/W nodig om een Hadoop Cluster aan te maken

Inleiding tot Map Reduce /HDFS

  • MapReduce – verdelen van berekeningen over meerdere servers
  • HDFS – data lokaal beschikbaar maken voor het berekeningsproces (met redundantie)
  • Data – kan niet-gestructureerd/schema-loos zijn (in tegenstelling tot RDBMS)
  • Plicht van de ontwikkelaar om betekenis te geven aan data
  • Programmeren van MapReduce = werken met Java (voors/tegens), handmatig laden van data in HDFS

Dag 2: Sessie 1: Big Data Ecosystem - Opbouwen van Big Data ETL: het universum van Big Data Tools – welke gebruiken en wanneer?

  • Hadoop vs. andere NoSQL-oplossingen
  • Voor interactieve, willekeurige toegang tot data
  • Hbase (kolomgebaseerde database) bovenop Hadoop
  • Willekeurige toegang tot data maar met beperkingen (max 1 PB)
  • Niet geschikt voor ad-hoc analytics, wel geschikt voor logging, tellingen, time-series
  • Sqoop - Import vanuit databases naar Hive of HDFS (JDBC/ODBC toegang)
  • Flume – Stream data (bijv. logdata) naar HDFS

Dag 2: Sessie 2: Big Data Managementsysteem

  • Verplaatsende onderdelen, start/falen van compute nodes: ZooKeeper - Voor configuratie/coördinatie/naming services
  • Complexe pipeline/workflow: Oozie – beheer van workflows, afhankelijkheden, daisy chain
  • Deployen, configureren, clusterbeheer, upgrade, etc. (sys admin): Ambari
  • In de Cloud: Whirr

Dag 2: Sessie 3: Predictive analytics in Business Intelligence -1: Fundamentele Technieken & Machine learning based BI :

  • Inleiding tot Machine learning
  • Leer klassificatietechnieken
  • Bayesiaanse Voorspelling - voorbereiden trainingsbestand
  • Support Vector Machine
  • KNN p-Tree Algebra & verticale mining
  • Neural Network
  • Big Data groot variabele probleem -Random forest (RF)
  • Big Data Automatiseringsprobleem – Multi-model ensemble RF
  • Automatisering door Soft10-M
  • Text analytic tool-Treeminer
  • Agile learning
  • Agent based learning
  • Distributed learning
  • Inleiding tot Open source Tools voor predictive analytics : R, Rapidminer, Mahut

Dag 2: Sessie 4 Predictive analytics ecosysteem-2: Veelvoorkomende predictive analytic problemen in de overheid.

  • Insight analytic
  • Visualization analytic
  • Gestructureerde predictive analytic
  • Niet-gestructureerde predictive analytic
  • Dreiging/fraude/vendor profiling
  • Recommendation Engine
  • Patroondetectie
  • Rule/Scenario discovery – falen, fraude, optimalisatie
  • Root cause discovery
  • Sentiment analysis
  • CRM analytic
  • Network analytic
  • Text Analytics
  • Technology assisted review
  • Fraude analytic
  • Real Time Analytic

Dag 3 : Sessie 1 : Real Time and Scalable Analytic Over Hadoop

  • Waarom algemene analyse-algoritmen falen in Hadoop/HDFS
  • Apache Hama- voor Bulk Synchronous distributed computing
  • Apache SPARK- voor cluster computing voor real time analytic
  • CMU Graphics Lab2- Grafische asynchrone aanpak voor distributed computing
  • KNN p-Algebra based approach van Treeminer voor gereduceerde hardwarekosten van operatie

Dag 3: Sessie 2: Tools voor eDiscovery en Forensics

  • eDiscovery over Big Data vs. Legacy data – een vergelijking van kosten en prestaties
  • Predictive coding en technology assisted review (TAR)
  • Live demo van een Tar product ( vMiner) om te begrijpen hoe TAR werkt voor snellere discovery
  • Snellere indexering via HDFS –velocity van data
  • NLP of Natural Language processing –verscheidende technieken en open source producten
  • eDiscovery in vreemde talen-technologie voor verwerking van vreemde talen

Dag 3 : Sessie 3: Big Data BI voor Cyber Security – Begrip van het volledige 360 graden overzicht van snelle datacollectie tot identificatie van dreigingen

  • Begrip van basiskennis van security analytics-attack surface, security misconfiguration, host defenses
  • Netwerk-infrastructure / Large datapipe / Response ETL voor real time analytic
  • Prescriptief vs voorspellend – Vast regelgebaseerd vs auto-discovery van dreigingsregels uit Meta data

Dag 3: Sessie 4: Big Data in USDA : Toepassing in de landbouw

  • Inleiding tot IoT ( Internet of Things) voor landbouw-sensor based Big Data en controle
  • Inleiding tot Satelliet imaging en de toepassing hierin in de landbouw
  • Integratie van sensor- en imagedata voor vruchtbaarheid van bodem, kweekaanbevelingen en prognoses
  • Landbouwverzekerings en Big Data
  • Prognose van oogstverlies

Dag 4 : Sessie 1: Fraudepreventie BI vanuit Big Data in de overheid-Fraude analytic:

  • Basis classificatie van Fraud analytics- regelgebaseerd vs predictive analytics
  • Supervised vs unsupervised Machine learning voor Fraud patroondetectie
  • Vendor fraude/overbepaling voor projecten
  • Medicare en Medicaid fraude- fraude detectietechnieken voor claimverwerking
  • Reiskostenvergoeding fraudes
  • IRS terugbetalingsfraudes
  • Casestudies en live demo worden gegeven waar data beschikbaar is.

Dag 4 : Sessie 2: Social Media Analytic- Inlichtingenverzameling en analyse

  • Big Data ETL API voor het extraheren van social media data
  • Text, image, meta data en video
  • Sentiment analysis vanuit social media feed
  • Contextuele en non-contextuele filtering van social media feed
  • Social Media Dashboard om diverse social media te integreren
  • Gearceerde profiling van social media profiel
  • Live demo van elke analyse wordt gegeven via het Treeminer Tool.

Dag 4 : Sessie 3: Big Data Analytic in beeldverwerking en videostreams

  • Image Storage technieken in Big Data- Storage solution voor data die petabytes overschrijden
  • LTFS en LTO
  • GPFS-LTFS ( Laaggestructureerde oplossing voor Big image data)
  • Fundamenten van image analytics
  • Object recognition
  • Image segmentation
  • Motion tracking
  • 3-D image reconstruction

Dag 4: Sessie 4: Big Data toepassingen in NIH:

  • Opkomende gebieden van Bio-informatics
  • Meta-genomics en Big Data mining problemen
  • Big Data Predictive analytic voor Pharmacogenomics, Metabolomics en Proteomics
  • Big Data in downstream Genomics proces
  • Toepassing van Big data predictive analytics in Openbare gezondheid

Big Data Dashboard voor snelle toegankelijkheid van diverse data en weergave :

  • Integratie van bestaande applicatie platform met Big Data Dashboard
  • Big Data management
  • Casestudy van Big Data Dashboard: Tableau en Pentaho
  • Gebruik Big Data app om locatiegebonden services in de overheid te duwen.
  • Tracking systeem en beheer

Dag 5 : Sessie 1: Hoe te rechtvaardigen Big Data BI implementatie binnen een organisatie:

  • Definiteren van ROI voor Big Data implementatie
  • Casestudies voor het besparen van Analyst Tijd voor collectie en voorbereiding van Data –toename van productiviteitswinst
  • Casestudies van omzetwinst door het besparen van de kosten van gelicentieerde database
  • Omzetwinst uit locatiegebonden services
  • Besparing uit fraudepreventie
  • Een geïntegreerde spreadsheet aanpak om approx. kosten vs. Omzetwinst/besparingen van Big Data implementatie te berekenen.

Dag 5 : Sessie 2: Stappenplan om legacy data systeem te vervangen door Big Data Systeem:

  • Begrip van praktische Big Data Migrations Roadmap
  • Welke belangrijke informatie is nodig voordat een Big Data implementatie wordt geïntroduceerd
  • Wat zijn de verschillende manieren van berekenen volume, velocity, variëteit en veracity van data
  • Hoe data groei te schatten
  • Casestudies

Dag 5: Sessie 4: Review van Big Data Vendors en review van hun producten. Q/A sessie:

  • Accenture
  • APTEAN (Formerly CDC Software)
  • Cisco Systems
  • Cloudera
  • Dell
  • EMC
  • GoodData Corporation
  • Guavus
  • Hitachi Data Systems
  • Hortonworks
  • HP
  • IBM
  • Informatica
  • Intel
  • Jaspersoft
  • Microsoft
  • MongoDB (Formerly 10Gen)
  • MU Sigma
  • Netapp
  • Opera Solutions
  • Oracle
  • Pentaho
  • Platfora
  • Qliktech
  • Quantum
  • Rackspace
  • Revolution Analytics
  • Salesforce
  • SAP
  • SAS Institute
  • Sisense
  • Software AG/Terracotta
  • Soft10 Automation
  • Splunk
  • Sqrrl
  • Supermicro
  • Tableau Software
  • Teradata
  • Think Big Analytics
  • Tidemark Systems
  • Treeminer
  • VMware (Part of EMC)

Vereisten

  • Basis kennis van bedrijfsvoering en datasystemen binnen de overheid in hun respectieve domein
  • Basiskennis van SQL/Oracle of relationele databases
  • Basiskennis van statistiek (op spreadsheet-niveau)
 35 Uren

Aantal deelnemers


Prijs per deelnemer

Getuigenissen (1)

Voorlopige Aankomende Cursussen

Gerelateerde categorieën