Neem contact met ons op

Cursusaanbod

PySpark & Machine Learning 

Module 1: Big Data en de basisprincipes van Spark

  • Overzicht van het big data-ecosysteem en de rol van Spark in hedendaagse dataprocessingsplatforms
  • Inzicht in de Spark-architectuur: driver, executors, clusterbeheerder, lazy evaluation, DAG en uitvoeringsplanning
  • Verschillen tussen RDD- en DataFrame-API’s en wanneer welke benadering het meest geschikt is
  • Het maken en configureren van een SparkSession, alsook de basisprincipes voor applicatieconfiguratie

Module 2: PySpark DataFrames

  • Het lezen en schrijven van data uit bedrijfsbronnen in diverse formaten zoals CSV, JSON, Parquet en Delta
  • Werken met PySpark DataFrames: transformaties, acties, kolomexpressies, filteren, koppelingen tussen tabellen en aggregaties
  • Het toepassen van geavanceerde technieken zoals windowfuncties, verwerking van datum- en tijdgegevens en omgaan met geneste data
  • Data-kwaliteitscontroles uitvoeren en het schrijven van herbruikbare, onderhoudbare PySpark-code

Module 3: Efficiënt verwerken van grote datasets

  • Basisprincipes voor prestatieoptimalisatie: strategieën rond partitioning, shuffle-gedrag, caching en persistentie
  • Optimisatietechnieken zoals broadcast joins en analyse van de uitvoeringsplannen
  • Best practices voor het efficiënt verwerken van grote hoeveelheden data in schaalbare workflows
  • Inzicht in schema-evolutie en hedendaagse opslagformaten binnen zakelijke omgevingen

Module 4: Feature Engineering op grote schaal

  • Feature engineering met Spark MLlib: omgaan met ontbrekende waarden, coderen van categorische variabelen en feature scaling
  • Het ontwerpen van herbruikbare voorbereidingsstappen en het structureren van datasets voor Machine Learning-pipelines
  • Introductie tot feature selectie en behandeling van onuitgebalanceerde datasets

Module 5: Machine Learning met Spark MLlib

  • Inzicht in de architectuur van MLlib en het onderscheid tussen Estimator- en Transformer-componenten
  • Het trainen van regressie- en classificatiemodellen op grote schaal, waaronder Lineaire Regressie, Logistische Regressie, Besluitbomen en Random Forest
  • Modelvergelijkingen maken en resultaten interpreteren binnen gedistribueerde Machine Learning-workflows

Module 6: End-to-end ML-pipelines

  • Het samenstellen van end-to-end Machine Learning-pipelines waarin preprocessing, feature engineering en modelleren gecombineerd worden
  • Strategieën voor het verdelen in trainings-, validatie- en testdatasets
  • Cross-validation uitvoeren en hyperparameter-tuning door middel van grid search en random search
  • Hoe reproduceerbare Machine Learning-experimenten op te zetten

Module 7: Modelevaluatie & praktische besluitvorming in Machine Learning

  • Toepassing van geschikte evaluatiemetingen voor regressie- en classificatieproblemen
  • Herkennen van overfitting en onderfitting en het nemen van praktische beslissingen bij modelselectie
  • Interpretatie van feature-importantiegegevens en inzicht in gedragingen van modellen

Module 8: Productieomgevingen & bedrijfsmatige praktijken

  • Modellen opslaan en herladen binnen Spark-omgevingen
  • Het implementeren van batch-inference-workflows voor grote datasets
  • Inzicht in de volledige levenscyclus van Machine Learning-modellen binnen bedrijven
  • Introductie tot versiebeheer, experimenttracking en basisstrategieën voor testen

 

Praktische uitkomsten

  • Deelnemers kunnen zelfstandig werken met PySpark
  • Zij kunnen grote datasets efficiënt verwerken
  • Ze beschikken over vaardigheden voor feature engineering op grote schaal
  • Zij zijn in staat om schaalbare Machine Learning-pipelines te ontwikkelen

Vereisten

Deelnemers dienen over de volgende voorkennis te beschikken:

Basiskennis van Python-programmeren, met name het werken met functies, datastructuren en bibliotheken
Fundamentele kennis van data-analyseconcepten zoals datasets, transformaties en aggregaties
Inzicht in SQL en relatiebeheerstechnieken
Eenvoudige kennis van Machine Learning-concepten zoals trainingssets, features en evaluatiemetingen
Kennis van commando-regelsomgevingen en basispraktijken voor softwareontwikkeling is aan te raden

Ervaring met bibliotheken als Pandas of NumPy is nuttig, maar niet verplicht.

 21 Uren

Aantal deelnemers


Prijs per deelnemer

Getuigenissen (1)

Voorlopige Aankomende Cursussen

Gerelateerde categorieën