Bedankt voor uw aanvraag! Een van onze medewerkers neemt binnenkort contact met u op
Bedankt voor uw boeking! Een van onze medewerkers neemt binnenkort contact met u op.
Cursusaanbod
Elke sessie duurt 2 uur
Dag 1: Sessie 1: Business Overview: Waarom Big Data Business Intelligence in de overheid
- Casestudies van NIH en DoE
- Adaptatiegraad van Big Data bij overheidsinstanties en hoe zij hun toekomstige operaties uitlijnen op Big Data Predictive Analytics
- Breedschalige toepassingsgebieden bij DoD, NSA, IRS, USDA, etc.
- Interfacing van Big Data met legacy-data
- Basisbegrip van enabling technologies in predictive analytics
- Data-integratie en dashboardvisualisatie
- Fraudebeheer
- Generatie van business rules/fraudedetectie
- Dreigingsdetectie en profiling
- Kosten-batenanalyse voor Big Data-implementatie
Dag 1: Sessie 2: Inleiding Big Data-1
- Hoofdkenmerken van Big Data: volume, variëteit, snelheid (velocity) en betrouwbaarheid (veracity). MPP-architectuur voor volume.
- Datawarehouses – statisch schema, traag evoluerende dataset
- MPP-databases zoals Greenplum, Exadata, Teradata, Netezza, Vertica, etc.
- Hadoop-gebaseerde oplossingen – geen voorwaarden aan de structuur van de dataset.
- Typisch patroon: HDFS, MapReduce (crunch), ophalen van HDFS
- Batch – geschikt voor analytisch/niet-interactief gebruik
- Volume: CEP streaming data
- Typische keuzes – CEP-producten (bijv. Infostreams, Apama, MarkLogic, etc.)
- Minder productie-klaar – Storm/S4
- NoSQL-databases – (kolomgebaseerd en key-value): Beste aanvulling op datawarehouse/database voor analyse
Dag 1: Sessie 3: Inleiding Big Data-2
NoSQL-oplossingen
- KV Store - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
- KV Store - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
- KV Store (Hiërarchisch) - GT.m, Cache
- KV Store (Gerangschikt) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
- KV Cache - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
- Tuple Store - Gigaspaces, Coord, Apache River
- Object Database - ZopeDB, DB40, Shoal
- Document Store - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databases, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
- Wide Columnar Store - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI
Soorten Data: Inleiding tot data-schoonmaakproblemen in Big Data
- RDBMS – statische structuur/schema, bevordert geen agiele, exploratieve omgeving.
- NoSQL – semi-gestructureerd, voldoende structuur om data op te slaan zonder exact schema vóór het opslaan
- Data-schoonmaakproblemen
Dag 1: Sessie 4: Inleiding Big Data-3: Hadoop
- Wanneer Hadoop kiezen?
- GESTRUCTUREERD - Enterprise datawarehouses/databases kunnen enorme data opslaan (met kosten) maar leggen structuur op (niet geschikt voor actieve exploratie)
- SEMI-GESTRUCTUREERDE data – moeilijk te verwerken met traditionele oplossingen (DW/DB)
- Opbergen van data = ENORME inspanning en statisch zelfs na implementatie
- Voor variëteit & volume van data, verwerkt op commodity hardware – HADOOP
- Commodity H/W nodig om een Hadoop Cluster aan te maken
Inleiding tot Map Reduce /HDFS
- MapReduce – verdelen van berekeningen over meerdere servers
- HDFS – data lokaal beschikbaar maken voor het berekeningsproces (met redundantie)
- Data – kan niet-gestructureerd/schema-loos zijn (in tegenstelling tot RDBMS)
- Plicht van de ontwikkelaar om betekenis te geven aan data
- Programmeren van MapReduce = werken met Java (voors/tegens), handmatig laden van data in HDFS
Dag 2: Sessie 1: Big Data Ecosystem - Opbouwen van Big Data ETL: het universum van Big Data Tools – welke gebruiken en wanneer?
- Hadoop vs. andere NoSQL-oplossingen
- Voor interactieve, willekeurige toegang tot data
- Hbase (kolomgebaseerde database) bovenop Hadoop
- Willekeurige toegang tot data maar met beperkingen (max 1 PB)
- Niet geschikt voor ad-hoc analytics, wel geschikt voor logging, tellingen, time-series
- Sqoop - Import vanuit databases naar Hive of HDFS (JDBC/ODBC toegang)
- Flume – Stream data (bijv. logdata) naar HDFS
Dag 2: Sessie 2: Big Data Managementsysteem
- Verplaatsende onderdelen, start/falen van compute nodes: ZooKeeper - Voor configuratie/coördinatie/naming services
- Complexe pipeline/workflow: Oozie – beheer van workflows, afhankelijkheden, daisy chain
- Deployen, configureren, clusterbeheer, upgrade, etc. (sys admin): Ambari
- In de Cloud: Whirr
Dag 2: Sessie 3: Predictive analytics in Business Intelligence -1: Fundamentele Technieken & Machine learning based BI :
- Inleiding tot Machine learning
- Leer klassificatietechnieken
- Bayesiaanse Voorspelling - voorbereiden trainingsbestand
- Support Vector Machine
- KNN p-Tree Algebra & verticale mining
- Neural Network
- Big Data groot variabele probleem -Random forest (RF)
- Big Data Automatiseringsprobleem – Multi-model ensemble RF
- Automatisering door Soft10-M
- Text analytic tool-Treeminer
- Agile learning
- Agent based learning
- Distributed learning
- Inleiding tot Open source Tools voor predictive analytics : R, Rapidminer, Mahut
Dag 2: Sessie 4 Predictive analytics ecosysteem-2: Veelvoorkomende predictive analytic problemen in de overheid.
- Insight analytic
- Visualization analytic
- Gestructureerde predictive analytic
- Niet-gestructureerde predictive analytic
- Dreiging/fraude/vendor profiling
- Recommendation Engine
- Patroondetectie
- Rule/Scenario discovery – falen, fraude, optimalisatie
- Root cause discovery
- Sentiment analysis
- CRM analytic
- Network analytic
- Text Analytics
- Technology assisted review
- Fraude analytic
- Real Time Analytic
Dag 3 : Sessie 1 : Real Time and Scalable Analytic Over Hadoop
- Waarom algemene analyse-algoritmen falen in Hadoop/HDFS
- Apache Hama- voor Bulk Synchronous distributed computing
- Apache SPARK- voor cluster computing voor real time analytic
- CMU Graphics Lab2- Grafische asynchrone aanpak voor distributed computing
- KNN p-Algebra based approach van Treeminer voor gereduceerde hardwarekosten van operatie
Dag 3: Sessie 2: Tools voor eDiscovery en Forensics
- eDiscovery over Big Data vs. Legacy data – een vergelijking van kosten en prestaties
- Predictive coding en technology assisted review (TAR)
- Live demo van een Tar product ( vMiner) om te begrijpen hoe TAR werkt voor snellere discovery
- Snellere indexering via HDFS –velocity van data
- NLP of Natural Language processing –verscheidende technieken en open source producten
- eDiscovery in vreemde talen-technologie voor verwerking van vreemde talen
Dag 3 : Sessie 3: Big Data BI voor Cyber Security – Begrip van het volledige 360 graden overzicht van snelle datacollectie tot identificatie van dreigingen
- Begrip van basiskennis van security analytics-attack surface, security misconfiguration, host defenses
- Netwerk-infrastructure / Large datapipe / Response ETL voor real time analytic
- Prescriptief vs voorspellend – Vast regelgebaseerd vs auto-discovery van dreigingsregels uit Meta data
Dag 3: Sessie 4: Big Data in USDA : Toepassing in de landbouw
- Inleiding tot IoT ( Internet of Things) voor landbouw-sensor based Big Data en controle
- Inleiding tot Satelliet imaging en de toepassing hierin in de landbouw
- Integratie van sensor- en imagedata voor vruchtbaarheid van bodem, kweekaanbevelingen en prognoses
- Landbouwverzekerings en Big Data
- Prognose van oogstverlies
Dag 4 : Sessie 1: Fraudepreventie BI vanuit Big Data in de overheid-Fraude analytic:
- Basis classificatie van Fraud analytics- regelgebaseerd vs predictive analytics
- Supervised vs unsupervised Machine learning voor Fraud patroondetectie
- Vendor fraude/overbepaling voor projecten
- Medicare en Medicaid fraude- fraude detectietechnieken voor claimverwerking
- Reiskostenvergoeding fraudes
- IRS terugbetalingsfraudes
- Casestudies en live demo worden gegeven waar data beschikbaar is.
Dag 4 : Sessie 2: Social Media Analytic- Inlichtingenverzameling en analyse
- Big Data ETL API voor het extraheren van social media data
- Text, image, meta data en video
- Sentiment analysis vanuit social media feed
- Contextuele en non-contextuele filtering van social media feed
- Social Media Dashboard om diverse social media te integreren
- Gearceerde profiling van social media profiel
- Live demo van elke analyse wordt gegeven via het Treeminer Tool.
Dag 4 : Sessie 3: Big Data Analytic in beeldverwerking en videostreams
- Image Storage technieken in Big Data- Storage solution voor data die petabytes overschrijden
- LTFS en LTO
- GPFS-LTFS ( Laaggestructureerde oplossing voor Big image data)
- Fundamenten van image analytics
- Object recognition
- Image segmentation
- Motion tracking
- 3-D image reconstruction
Dag 4: Sessie 4: Big Data toepassingen in NIH:
- Opkomende gebieden van Bio-informatics
- Meta-genomics en Big Data mining problemen
- Big Data Predictive analytic voor Pharmacogenomics, Metabolomics en Proteomics
- Big Data in downstream Genomics proces
- Toepassing van Big data predictive analytics in Openbare gezondheid
Big Data Dashboard voor snelle toegankelijkheid van diverse data en weergave :
- Integratie van bestaande applicatie platform met Big Data Dashboard
- Big Data management
- Casestudy van Big Data Dashboard: Tableau en Pentaho
- Gebruik Big Data app om locatiegebonden services in de overheid te duwen.
- Tracking systeem en beheer
Dag 5 : Sessie 1: Hoe te rechtvaardigen Big Data BI implementatie binnen een organisatie:
- Definiteren van ROI voor Big Data implementatie
- Casestudies voor het besparen van Analyst Tijd voor collectie en voorbereiding van Data –toename van productiviteitswinst
- Casestudies van omzetwinst door het besparen van de kosten van gelicentieerde database
- Omzetwinst uit locatiegebonden services
- Besparing uit fraudepreventie
- Een geïntegreerde spreadsheet aanpak om approx. kosten vs. Omzetwinst/besparingen van Big Data implementatie te berekenen.
Dag 5 : Sessie 2: Stappenplan om legacy data systeem te vervangen door Big Data Systeem:
- Begrip van praktische Big Data Migrations Roadmap
- Welke belangrijke informatie is nodig voordat een Big Data implementatie wordt geïntroduceerd
- Wat zijn de verschillende manieren van berekenen volume, velocity, variëteit en veracity van data
- Hoe data groei te schatten
- Casestudies
Dag 5: Sessie 4: Review van Big Data Vendors en review van hun producten. Q/A sessie:
- Accenture
- APTEAN (Formerly CDC Software)
- Cisco Systems
- Cloudera
- Dell
- EMC
- GoodData Corporation
- Guavus
- Hitachi Data Systems
- Hortonworks
- HP
- IBM
- Informatica
- Intel
- Jaspersoft
- Microsoft
- MongoDB (Formerly 10Gen)
- MU Sigma
- Netapp
- Opera Solutions
- Oracle
- Pentaho
- Platfora
- Qliktech
- Quantum
- Rackspace
- Revolution Analytics
- Salesforce
- SAP
- SAS Institute
- Sisense
- Software AG/Terracotta
- Soft10 Automation
- Splunk
- Sqrrl
- Supermicro
- Tableau Software
- Teradata
- Think Big Analytics
- Tidemark Systems
- Treeminer
- VMware (Part of EMC)
Vereisten
- Basis kennis van bedrijfsvoering en datasystemen binnen de overheid in hun respectieve domein
- Basiskennis van SQL/Oracle of relationele databases
- Basiskennis van statistiek (op spreadsheet-niveau)
35 Uren
Getuigenissen (1)
De capaciteit van de trainer om de cursus af te stemmen op de eisen van de organisatie, in plaats van de cursus alleen maar voor het geven ervan te bieden.
Masilonyane - Revenue Services Lesotho
Cursus - Big Data Business Intelligence for Govt. Agencies
Automatisch vertaald