Bedankt voor uw aanvraag! Een van onze medewerkers neemt binnenkort contact met u op
Bedankt voor uw boeking! Een van onze medewerkers neemt binnenkort contact met u op.
Cursusaanbod
Inleiding, doelstellingen en migratiestrategie
- Doelstellingen van de cursus, profielmatching van deelnemers en succescriteria
- Hoog-niveau migratiebenaderingen en risicoverwagingen
- Instellen van workspaces, repositories en lab-datasets
Dag 1 — Grondslagen van migratie en architectuur
- Lakehouse-concepten, overzicht van Delta Lake en Databricks-architectuur
- Verschillen tussen SMP en MPP en de implicaties voor migratie
- Ontwerp van Medallion (Bronze→Silver→Gold) en overzicht van Unity Catalog
Dag 1 Lab — Vertalen van een opbergprocedure
- Hands-on migratie van een voorbeeldopbergprocedure naar een notebook
- Koppelen van tijdelijke tabellen en cursors naar DataFrame-transformaties
- Validatie en vergelijking met de oorspronkelijke output
Dag 2 — Geavanceerde Delta Lake & incrementele inlaad
- ACID-transacties, commit logs, versiebeheer en time travel
- Auto Loader, MERGE INTO patronen, upserts en schema-evolutie
- OPTIMIZE, VACUUM, Z-ORDER, partitie-indeling en opslag-tuning
Dag 2 Lab — Incrementele inlaad & optimalisatie
- Implementeren van Auto Loader-inlaad en MERGE-workflows
- Toepassen van OPTIMIZE, Z-ORDER en VACUUM; valideren van resultaten
- Meten van prestatieverbeteringen bij lezen/schrijven
Dag 3 — SQL in Databricks, prestaties & foutopsporing
- Analytische SQL-functies: vensterfuncties, hogere-ordefuncties, JSON/array-behandeling
- Lezen van de Spark UI, DAGs, shuffles, stages, taken en diagnose van knelpunten
- Query-tuningpatronen: broadcast joins, hints, caching en reductie van spill
Dag 3 Lab — SQL-refactoriseren & prestatietuning
- Een zwaar SQL-proces refactoriseren naar geoptimaliseerde Spark SQL
- Gebruik maken van Spark UI-sporen om skewedness- en shuffleproblemen te identificeren en op te lossen
- Benchmarken vóór/ná en documenteren van tuningsstappen
Dag 4 — Tactische PySpark: Vervangen van procedurele logica
- Uitvoeringsmodel van Spark: driver, executors, luie evaluatie en partitie-strategieën
- Omzetten van lusjes en cursors naar gevectoriseerde DataFrame-operaties
- Modularisatie, UDF's/pandas UDF's, widgets en herbruikbare bibliotheken
Dag 4 Lab — Refactoriseren van procedurele scripts
- Een procedureel ETL-script refactoriseren naar modulaire PySpark-notebooks
- Introduceren van parameterisatie, unit-achtige tests en herbruikbare functies
- Code review en toepassing van een checklist voor beste praktijken
Dag 5 — Orchestratie, end-to-end pipeline & beste praktijken
- Databricks Workflows: jobontwerp, taakafhankelijkheden, triggers en foutafhandeling
- Ontwerpen van incrementele Medallion-pipelines met kwaliteitsregels en schema-validatie
- Integratie met Git (GitHub/Azure DevOps), CI en teststrategieën voor PySpark-logica
Dag 5 Lab — Bouwen van een complete end-to-end pipeline
- Samenstellen van een Bronze→Silver→Gold-pipeline georkestreerd met Workflows
- Implementeren van logboekvoering, audit, herhalingen en geautomatiseerde validaties
- Draaien van de volledige pipeline, valideren van outputs en voorbereiden van implementatie-opmerkingen
Operationalisering, governance en productieklaarheid
- Unity Catalog-governance, afleiding en toegangscontrole beste praktijken
- Kosten, clustergrootte, autoscaling en job-concurrentiepatronen
- Implementatie-checklists, terugrolstrategieën en maken van een runbook
Eindcontrole, kennisoverdracht en volgende stappen
- Presentaties van deelnemers over migratiework en geleerde lessen
- Gapanalyse, aanbevolen vervolgactiviteiten en overdracht van trainingsmateriaal
- Referenties, verdere leertrajecten en ondersteuningsopties
Vereisten
- Verstandhouding van data engineering-concepten
- Ervaring met SQL en opbergprocedures (Synapse / SQL Server)
- Bekendheid met ETL-orchestratieconcepten (ADF of vergelijkbaar)
Publiek
- Technologie managers met een achtergrond in data engineering
- Data engineers die procedurele OLAP-logica naar Lakehouse-patronen willen overzetten
- Platform engineers die verantwoordelijk zijn voor de adoptie van Databricks
35 Uren