Datastreaming en realtimeverwerking van gegevens Training Cursus
Overzicht van de cursus
In deze cursus krijgt u een praktische en gestructureerde introductie in het bouwen van realtime datastreamingsystemen. U leert over de belangrijkste concepten, architectuurpatronen en gangbare tools die worden gebruikt voor het verwerken van continu binnenkomende gegevens op grote schaal. Deelnemers ontwikkelen vaardigheden om streamingpipelines te ontwerpen, implementeren en optimaliseren met behulp van moderne frameworks. De cursus begint bij de basisideeën en leidt u geleidelijk naar praktische toepassingen, zodat u na afloop met vertrouwen realtimeoplossingen kunt ontwikkelen voor productieomgevingen.
Vorm van de training
• Lesonderdelen onder leiding van een instructeur, voorzien van uitgebreide uitleg
• Toelichting op theorieën aan de hand van relevante praktijkvoorbeelden
• Praktische demonstraties en programmeeroefeningen
• Stapsgewijze oefeningen die aansluiten bij de dagelijkse leerdoelen
• Interactieve discussies en vraag- en antwoordsessies
Cursusdoelstellingen
• Inzicht krijgen in de principes van realtime datastreaming en systeemarchitectuur
• Het verschil begrijpen tussen batchverwerking en streamingverwerking
• Scalable en fouttolerant streamingpipelines ontwerpen
• Omgaan met gedistribueerde streamingtools en -frameworks
• Het toepassen van event timeverwerking, windowing en stateful operaties
Oplossingen ontwikkelen en optimaliseren die geschikt zijn voor realtime zakelijke toepassingen
Cursusaanbod
Cursusopbouw – Dag 1
• Inleiding tot de concepten van datastreaming
• Basisprincipes van batch- versus realtimeverwerking
• Grondbeginselen van een event-driven architectuur
• Voorbeelden van veelvoorkomende toepassingen in de industrie
• Overzicht van het totale streamingecosysteem
Dag 2
• Ontwerpstrategieën voor streamingarchitecturen
• Grondbeginselen van gedistribueerde messagingsystemen
• Productoren en -consumenten
• Topics, partities en datastromen
• Strategieën voor het verzamelen van gegevens
Dag 3
• Concepten en frameworks binnen streamverwerking
• Het verschil tussen event time en processing time
• Windowingtechnieken en hun toepassingen
• Stateful streamverwerking
• Basisprincipes van fouttolerantheid en checkpointing
Dag 4
• Gegevenstransformatie binnen streamingpipelines
• ETL- en ELT-processen in realtimeomgevingen
• Beheer en evolutie van schema’s
• Stream joins en dataverrijking
• Introductie tot cloudgebaseerde streamingdiensten
Dag 5
• Monitoring en observability in streamingsystemen
• Basisprincipes van beveiliging en toegangscontrole
• Prestatie-optimalisatie en fine-tuning
• Beoordeling van het ontwerp van end-to-end streamingpipelines
• Praktijkvoorbeelden zoals fraude-detectie en verwerking van IoT-gegevens
Voor open trainingen is een minimum aantal van 5 deelnemers vereist
Datastreaming en realtimeverwerking van gegevens Training Cursus - Boeking
Datastreaming en realtimeverwerking van gegevens Training Cursus - Navraag
Datastreaming en realtimeverwerking van gegevens - Consultancyaanvraag
Getuigenissen (2)
Een reis door de wereld van Spark: een zeer intensieve cursus. DSL, Spark SQL, partitie versus bucketing voor mij.
Georgiana Elisabeta
Cursus - Apache Spark Fundamentals
Automatisch vertaald
Praktijkopdrachten. De cursus had eigenlijk vijf dagen moeten duren, maar de drie dagen hebben al veel van mijn vragen beantwoord die ik had na het werken met NiFi.
James - BHG Financial
Cursus - Apache NiFi for Administrators
Automatisch vertaald
Voorlopige Aankomende Cursussen
Gerelateerde cursussen
Geavanceerd Apache Iceberg
21 UrenDeze door een instructeur geleide training in België (online of op locatie) is bedoeld voor gevorderde data-professionals die hun dataverwerkingsworkflows willen optimaliseren, de integriteit van data willen waarborgen en robuuste datalakehouse-oplossingen willen implementeren die goed kunnen omgaan met de complexiteit van hedendaagse big data-toepassingen.
Na afloop van deze training zullen de deelnemers in staat zijn om:
- De architectuur van Iceberg grondig te begrijpen, inclusief het beheer van metadata en de opbouw van bestanden.
- Iceberg zo in te stellen dat het optimaal presteert onder verschillende omstandigheden, evenals het integreren ervan met diverse dataverwerkingsengines.
- Grote Iceberg-tabellen te beheren, complexe schemawijzigingen door te voeren en veranderingen in partities af te handelen.
- Technieken onder de knie te krijgen waarmee de queryperformance en efficiëntie van gegevensscanning bij grote datasets verbeterd kunnen worden.
- Mechanismen te implementeren die dataconsistentie waarborgen, transactiegaranties regelen en fouten in gedistribueerde omgevingen afhandelen.
Grondbeginselen van Apache Iceberg
14 UrenDeze door een instructeur geleide live-training in België (online of op locatie) richt zich op beginnende data-professionals die de benodigde kennis en vaardigheden willen verwerven om Apache Iceberg effectief te gebruiken bij het beheren van grote datasets, het waarborgen van datakwaliteit en het optimaliseren van dataverwerkingsworkflows.
Aan het einde van deze training zullen de deelnemers in staat zijn om:
- De architectuur, kenmerken en voordelen van Apache Iceberg grondig te begrijpen.
- Meer te leren over tabelformaten, partitionering, schema-evolutie en de mogelijkheid tot time travel.
- Apache Iceberg te installeren en te configureren in verschillende omgevingen.
- Iceberg-tabellen aan te maken, te beheren en te wijzigen.
- Het proces van migreren van data uit andere tabelformaten naar Iceberg te begrijpen.
Big Data-analyse met Google Colab en Apache Spark
14 UrenDeze praktijkgerichte training onder begeleiding van een docent (online of op locatie) richt zich op datawetenschappers en -engineers met een gemiddelde kennisgraad die Google Colab en Apache Spark willen gebruiken voor big data-verwerking en analyse.
Na afloop van deze training zullen deelnemers in staat zijn om:
- Een big data-omgeving op te zetten met behulp van Google Colab en Spark.
- Grote datasets efficiënt te verwerken en te analyseren met Apache Spark.
- Big data visueel weer te geven in een collaboratieve omgeving.
- Apache Spark te integreren met cloudgebaseerde hulpmiddelen.
Big Data Business Intelligence voor overheidsinstanties
35 UrenDankzij technologische ontwikkelingen en de steeds groeiende hoeveelheid informatie verandert de manier waarop zaken worden gedaan in vele sectoren, inclusief de overheidssector. Door het snelle toename van mobiele apparaten, slimme sensoren, cloudcomputing-oplossingen en digitale portals voor burgers neemt ook het aantal overheidgegevens en digitale archieven toe. Naarmate deze informatie complexer wordt, worden ook de uitdagingen rond informatiemanagement, verwerking, opslag, beveiliging en verwijdering groter. Nieuwe hulpmiddelen voor het vastleggen, zoeken, ontdekken en analyseren van gegevens helpen organisaties om inzichten te verkrijgen uit ongestructureerde data. De overheid bevindt zich nu op een keerpunt: men realiseert zich dat informatie een strategisch bezit is, en dat overheidsinstanties zowel gestructureerde als ongestructureerde gegevens moeten beschermen, benutten en analyseren om hun missiedoelstellingen te bereiken. Terwijl leiders binnen de overheid inspanningen verrichten om data-gedreven organisaties te vormen, leggen ze daarmee de basis voor het correleren van relaties tussen gebeurtenissen, personen, processen en informatie.
Er zullen nu waardevolle overheidsoplossingen ontstaan door het combineren van de meest innovatieve technologieën:
- Mobiele apparaten en applicaties
- Cloudservices
- Sociale zakelijke technologieën en netwerken
- Big Data en analysemethoden
Big Data vormt één van de slimme sectoroplossingen; het stelt overheden in staat betere beslissingen te nemen op basis van patronen die blijken uit het analyseren van enorme hoeveelheden data – ongeacht of deze gestructureerd of ongestructureerd zijn.
Om dit te bereiken is echter meer nodig dan enkel veel gegevens verzamelen. ‘Om zinvol met zulke volumes aan Big Data om te gaan, zijn geavanceerde hulpmiddelen en technologieën nodig die uit diverse en immense informatiestromen bruikbare kennis weten te halen,’ schreven Tom Kalil en Fen Zhao van het Office of Science and Technology Policy van het Witte Huis in een blogpost.
Om overheidsinstanties te helpen deze benodigde technologieën te vinden, werd in 2012 de National Big Data Research and Development Initiative opgestart; hierbij is meer dan $200 miljoen uitgetrokken voor het verder ontwikkelen van Big Data-technieken en -instrumenten.
De uitdagingen rond Big Data zijn minstens zo groot als de kansen die ervan worden verwacht. Eén belangrijk probleem is efficiënte opslag: aangezien budgetten beperkt blijven, moeten instanties proberen de kosten per megabyte zo laag mogelijk te houden en data toegankelijk maken wanneer gebruikers het nodig hebben. Daarnaast maakt het veiligstellen van grote hoeveelheden gegevens dit proces nog ingewikkelder.
Ook effectieve analyse vormt een uitdaging: veel overheidsinstellingen gebruiken commerciële tools om zich door de enorme datahoeveelheden heen te werken, waarbij ze patronen kunnen ontdekken die hen helpen efficiënter te opereren. Uit een recent onderzoek van MeriTalk bleek dat IT-experts binnen de federale overheid geloven dat Big Data kan helpen meer dan $500 miljard te besparen, terwijl tegelijkertijd aan de missiedoelstellingen wordt voldaan.
Bovendien maken op maat ontwikkelde Big Data-hulpmiddelen het mogelijk dat overheidsorganisaties hun eigen data analyseren. Zo heeft bijvoorbeeld de Computational Data Analytics Group van het Oak Ridge National Laboratory haar Piranha-systeem beschikbaar gesteld aan andere instanties. Dit systeem heeft medisch onderzoekers geholpen een verband te ontdekken waarmee hartartsen vóór uitvallen kunnen signaleren dat er een aneurysma dreigt op te treden; het wordt ook gebruikt voor minder ingewikkelde taken, zoals het matchen van sollicitanten aan bepaalde vacatures.
Een praktische introductie tot gegevensanalyse en big data – 3 dagen
21 UrenDeelnemers die deze door een instructeur geleide, live-training in België volgen, krijgen een praktische en reële begrip van big data en de bijbehorende technologieën, methoden en hulpmiddelen.
Tijdens de cursus hebben deelnemers de mogelijkheid om deze kennis toe te passen via hands-on oefeningen. Groepsinteractie en feedback van de instructeur vormen een belangrijk onderdeel van de training.
De cursus begint met een introductie op de basisconcepten van big data, waarna aandacht wordt besteed aan programmeertalen en methodologieën voor gegevensanalyse. Tot slot behandelen we de tools en infrastructuur die het opslaan, gedistribueerd verwerken en schaalbaarheid van grote hoeveelheden data mogelijk maken.
Big Data en geavanceerde analyse
42 UrenBig Data en geavanceerde analyse draait om het toepassen van uitgebreide technieken en hulpmiddelen om grote, complexe datasets te analyseren, zodat er bruikbare inzichten en strategische beslissingen kunnen worden genomen.
Deze praktijkgerichte training wordt gegeven door een instructeur (online of op locatie) en is bedoeld voor data-professionals met ervaring die geïnteresseerd zijn in het gebruik van innovatieve analytische methoden en big datatechnologieën voor voorspellende, prescriptieve en real-time analyse.
Aan het einde van de training zullen deelnemers in staat zijn om:
- Scalabele dataverwerkingstrajecten te ontwerpen en implementeren voor zowel gestructureerde als ongestructureerde gegevens.
- Gevorderde machine learning- en deep learning-technieken toe te passen op enorme datasets.
- Distributieve computing-frameworks te benutten voor real-time analyse en data-streaming.
- Big Data-analysetechnieken te integreren in business intelligence- en besluitvormingssystemen.
Vorm van de cursus
- Interactieve presentaties en discussies.
- Uitgebreide oefeningen en praktijkopdrachten.
- Praktische implementatie in een live-lab-omgeving.
Mogelijkheden voor cursusaanpassing
- Wilt u een op maat gemaakte training? Neem dan contact met ons op om de mogelijkheden te bespreken.
Apache NiFi voor beheerders
21 UrenApache NiFi is een open source-platform voor gegevensintegratie en -verwerking, dat werkt op basis van dataflows. Het maakt geautomatiseerde, real-time routing en transformatie van gegevens mogelijk tussen verschillende systemen, met behulp van een webgebaseerd gebruikersinterface en gedetailleerde beheersmogelijkheden.
Deze praktijkgerichte training, verzorgd door ervaren instructeurs (fysiek of online), richt zich op beheerders en engineers met een middenniveau kennis die NiFi willen implementeren, beheren, beveiligen en optimaliseren in productieomgevingen.
Na afloop van deze training zijn de deelnemers in staat tot het volgende:
- Apache NiFi-clusters installeren, configureren en onderhouden.
- Dataflows ontwerpen en beheren vanuit diverse bronnen en bestemmingen.
- Automatisering, routing en transformatielogica in dataflows implementeren.
- Prestaties optimaliseren, bewerkingen monitoren en problemen oplossen.
Opzet van de cursus
- Interactieve presentaties met besprekingen over reële architecturen.
- Praktijkopdrachten: het opbouwen, implementeren en beheren van dataflows.
- Oefeningen gebaseerd op realistische scenario’s in een live-labomgeving.
Individuele aanpassingsmogelijkheden
- Indien u een maatwerktraining wenst, kunt u contact met ons opnemen om deze te regelen.
PySpark en Machine Learning
21 UrenDeze training biedt een praktische introductie tot het ontwikkelen van schaalbare dataprocessings- en Machine Learning-workflows met behulp van PySpark. Deelnemers leren hoe Apache Spark functioneert binnen moderne big data-omgevingen en hoe ze grote datasets efficiënt verwerken aan de hand van principes van gedistribueerde berekeningen.
Grondbeginselen van Apache Spark
21 UrenDeze door instructeurs geleide live-training in België (online of op locatie) richt zich op engineers die Apache Spark willen implementeren voor het verwerken van zeer grote hoeveelheden data.
Aan het einde van deze training zullen de deelnemers in staat zijn om:
- Apache Spark te installeren en configureren.
- Zeer grote datasets snel te verwerken en te analyseren.
- Het verschil tussen Apache Spark en Hadoop MapReduce te begrijpen, evenals wanneer je het een of het ander gebruikt.
- Apache Spark te integreren met andere machine learning-tools.
Beheer van Apache Spark
35 UrenDeze door een instructeur geleide live-training in België (online of op locatie) is bedoeld voor systeembeheerders met weinig tot gemiddelde ervaring die Spark-clusters willen implementeren, onderhouden en optimaliseren.
Aan het einde van deze training zijn de deelnemers in staat om:
- Apache Spark te installeren en te configureren in diverse omgevingen.
- Clusterbronnen te beheren en Spark-applicaties te monitoren.
- De prestaties van Spark-clusters te optimaliseren.
- Beveiligingsmaatregelen door te voeren en een hoge beschikbaarheid te garanderen.
- Veelvoorkomende problemen met Spark te debuggen en op te lossen.
Apache Spark in de Cloud
21 UrenAanvankelijk is de leercurve van Apache Spark vrij steil; het vergt veel inspanning om de eerste resultaten te behalen. Deze cursus helpt deelnemers deze moeilijke fase snel te doorlopen. Na afronding van de cursus hebben zij een grondige basiskennis van Apache Spark, kunnen ze RDD onderscheiden van DataFrame en kennen ze de Python- en Scala-API's. Daarnaast begrijpen ze het concept van executors en taken. Deze cursus legt sterk de nadruk op best practices en specifiek op cloudimplementatie, waarbij aandacht wordt geschonken aan Databricks en AWS. Deelnemers krijgen tevens inzicht in de verschillen tussen AWS EMR en AWS Glue – het nieuwste Spark-gebaseerde service van AWS.
DOELGROEP:
Data Engineers, DevOps-specialisten, Data Scientists
Python en Spark voor big data (PySpark)
21 UrenIn deze door een instructeur geleide praktijktraining, die wordt aangeboden in België, leren deelnemers hoe ze Python en Spark gezamenlijk kunnen gebruiken voor het analyseren van big data, waarbij zij actief oefeningen maken.
Aan het einde van deze training zijn de deelnemers in staat tot:
- Het gebruiken van Spark samen met Python om grote hoeveelheden data te analyseren.
- Het uitvoeren van oefeningen die reële situaties simuleren.
- Het hanteren van diverse tools en technieken voor big data-analyse via PySpark.
Python, Spark en Hadoop voor Big Data
21 UrenDeze begeleide, live-training in België (online of op locatie) richt zich op ontwikkelaars die Spark, Hadoop en Python willen gebruiken om grote en complexe datasets te verwerken, analyseren en transformeren.
Aan het einde van deze training zullen deelnemers in staat zijn tot het volgende:
- Het instellen van de benodigde omgeving voor het verwerken van big data met Spark, Hadoop en Python.
- De kenmerken, kernonderdelen en architectuur van Spark en Hadoop begrijpen.
- Leren hoe Spark, Hadoop en Python te integreren zijn voor big data-verwerking.
- De tools binnen het Spark-ecosysteem verkennen (Spark MlLib, Spark Streaming, Kafka, Sqoop, en Flume).
- Samenwerkingsgerichte aanbevelingssystemen ontwikkelen, vergelijkbaar met die van Netflix, YouTube, Amazon, Spotify en Google.
- Apache Mahout gebruiken om machine learning-algoritmen te schalen.
Stratio: Rocket- en Intelligence-modules met PySpark
14 UrenStratio is een datagericht platform dat big data, kunstmatige intelligentie en beheer in één oplossing integreert. De Rocket- en Intelligence-modules maken snelle verkenning, transformatie en geavanceerde analyse van data mogelijk binnen ondernemingen.
Deze live-training, begeleid door een instructeur (online of op locatie), is bedoeld voor data-professionals met een gematigde kennis die Stratio’s Rocket- en Intelligence-modules effectief willen gebruiken met PySpark. De nadruk ligt op lusconstructies, zelfgedefinieerde functies en geavanceerde datalogica.
Na afloop van deze training kunnen deelnemers:
- Navigeren door en werken binnen het Stratio-platform met behulp van de Rocket- en Intelligence-modules.
- PySpark toepassen bij het inladen, transformeren en analyseren van data.
- Lussen en conditionele logica gebruiken om datastromen te beheren en feature engineering-taken uit te voeren.
- Zelfgedefinieerde functies (UDF’s) creëren en beheren voor herbruikbare dataoperaties in PySpark.
Opbouw van de cursus
- Interactieve presentaties en discussies.
- Talrijke oefeningen en praktische opdrachten.
- Praktische implementatie in een live-labomgeving.
Mogelijkheden tot aanpassing van de cursus
- Voor een op maat gemaakte versie van deze training kunt u contact met ons opnemen om de details te bespreken.