Cursusaanbod
PySpark & Machine Learning
Module 1: Big Data en de basisprincipes van Spark
- Overzicht van het big data-ecosysteem en de rol van Spark in hedendaagse dataprocessingsplatforms
- Inzicht in de Spark-architectuur: driver, executors, clusterbeheerder, lazy evaluation, DAG en uitvoeringsplanning
- Verschillen tussen RDD- en DataFrame-API’s en wanneer welke benadering het meest geschikt is
- Het maken en configureren van een SparkSession, alsook de basisprincipes voor applicatieconfiguratie
Module 2: PySpark DataFrames
- Het lezen en schrijven van data uit bedrijfsbronnen in diverse formaten zoals CSV, JSON, Parquet en Delta
- Werken met PySpark DataFrames: transformaties, acties, kolomexpressies, filteren, koppelingen tussen tabellen en aggregaties
- Het toepassen van geavanceerde technieken zoals windowfuncties, verwerking van datum- en tijdgegevens en omgaan met geneste data
- Data-kwaliteitscontroles uitvoeren en het schrijven van herbruikbare, onderhoudbare PySpark-code
Module 3: Efficiënt verwerken van grote datasets
- Basisprincipes voor prestatieoptimalisatie: strategieën rond partitioning, shuffle-gedrag, caching en persistentie
- Optimisatietechnieken zoals broadcast joins en analyse van de uitvoeringsplannen
- Best practices voor het efficiënt verwerken van grote hoeveelheden data in schaalbare workflows
- Inzicht in schema-evolutie en hedendaagse opslagformaten binnen zakelijke omgevingen
Module 4: Feature Engineering op grote schaal
- Feature engineering met Spark MLlib: omgaan met ontbrekende waarden, coderen van categorische variabelen en feature scaling
- Het ontwerpen van herbruikbare voorbereidingsstappen en het structureren van datasets voor Machine Learning-pipelines
- Introductie tot feature selectie en behandeling van onuitgebalanceerde datasets
Module 5: Machine Learning met Spark MLlib
- Inzicht in de architectuur van MLlib en het onderscheid tussen Estimator- en Transformer-componenten
- Het trainen van regressie- en classificatiemodellen op grote schaal, waaronder Lineaire Regressie, Logistische Regressie, Besluitbomen en Random Forest
- Modelvergelijkingen maken en resultaten interpreteren binnen gedistribueerde Machine Learning-workflows
Module 6: End-to-end ML-pipelines
- Het samenstellen van end-to-end Machine Learning-pipelines waarin preprocessing, feature engineering en modelleren gecombineerd worden
- Strategieën voor het verdelen in trainings-, validatie- en testdatasets
- Cross-validation uitvoeren en hyperparameter-tuning door middel van grid search en random search
- Hoe reproduceerbare Machine Learning-experimenten op te zetten
Module 7: Modelevaluatie & praktische besluitvorming in Machine Learning
- Toepassing van geschikte evaluatiemetingen voor regressie- en classificatieproblemen
- Herkennen van overfitting en onderfitting en het nemen van praktische beslissingen bij modelselectie
- Interpretatie van feature-importantiegegevens en inzicht in gedragingen van modellen
Module 8: Productieomgevingen & bedrijfsmatige praktijken
- Modellen opslaan en herladen binnen Spark-omgevingen
- Het implementeren van batch-inference-workflows voor grote datasets
- Inzicht in de volledige levenscyclus van Machine Learning-modellen binnen bedrijven
- Introductie tot versiebeheer, experimenttracking en basisstrategieën voor testen
Praktische uitkomsten
- Deelnemers kunnen zelfstandig werken met PySpark
- Zij kunnen grote datasets efficiënt verwerken
- Ze beschikken over vaardigheden voor feature engineering op grote schaal
- Zij zijn in staat om schaalbare Machine Learning-pipelines te ontwikkelen
Vereisten
Deelnemers dienen over de volgende voorkennis te beschikken:
Basiskennis van Python-programmeren, met name het werken met functies, datastructuren en bibliotheken
Fundamentele kennis van data-analyseconcepten zoals datasets, transformaties en aggregaties
Inzicht in SQL en relatiebeheerstechnieken
Eenvoudige kennis van Machine Learning-concepten zoals trainingssets, features en evaluatiemetingen
Kennis van commando-regelsomgevingen en basispraktijken voor softwareontwikkeling is aan te raden
Ervaring met bibliotheken als Pandas of NumPy is nuttig, maar niet verplicht.
Getuigenissen (1)
Ik vond het fijn dat het praktisch was. Ik hield ervan om de theoretische kennis toe te passen met praktijkvoorbeelden.
Aurelia-Adriana - Allianz Services Romania
Cursus - Python and Spark for Big Data (PySpark)
Automatisch vertaald