Plan du cours
Introduction, Objectifs et Stratégie de Migration
- Objectifs du cours, alignement du profil des participants et critères de réussite
- Approches de migration de haut niveau et considérations relatives aux risques
- Configuration des espaces de travail, des dépôts et des jeux de données de laboratoire
Jour 1 — Fondamentaux de la migration et Architecture
- Concepts du Lakehouse, présentation de Delta Lake et architecture Databricks
- Différences entre SMP et MPP et implications pour la migration
- Conception Medallion (Bronze→Silver→Gold) et présentation d'Unity Catalog
Atelier Jour 1 — Traduction d'une procédure stockée
- Migration pratique d'une procédure stockée d'exemple vers un notebook
- Cartographie des tables temporaires et des curseurs vers des transformations DataFrame
- Validation et comparaison avec la sortie originale
Jour 2 — Delta Lake avancé & Chargement incrémental
- Transactions ACID, journaux d'engagement (commit logs), versionnement et time travel
- Auto Loader, modèles MERGE INTO, upserts et évolution du schéma
- OPTIMIZE, VACUUM, Z-ORDER, partitionnement et réglage du stockage
Atelier Jour 2 — Ingestion incrémentale & Optimisation
- Mise en œuvre de l'ingestion Auto Loader et des flux de travail MERGE
- Application de OPTIMIZE, Z-ORDER et VACUUM ; validation des résultats
- Mesure des améliorations des performances de lecture/écriture
Jour 3 — SQL dans Databricks, Performances & Débogage
- Fonctionnalités SQL analytiques : fonctions de fenêtre, fonctions d'ordre supérieur, traitement JSON/tableaux
- Lecture de l'interface Spark UI, DAG, shuffles, stages, tâches et diagnostic des goulots d'étranglement
- Modèles de réglage de requêtes : jointures en diffusion (broadcast joins), indices (hints), mise en cache et réduction des déversements (spill)
Atelier Jour 3 — Réécriture SQL & Réglage des performances
- Réécriture d'un processus SQL lourd en Spark SQL optimisé
- Utilisation des traces Spark UI pour identifier et corriger les problèmes de skew et de shuffle
- Benchmark avant/après et documentation des étapes de réglage
Jour 4 — PySpark tactique : Remplacer la logique procédurale
- Modèle d'exécution Spark : pilote (driver), exécuteurs, évaluation paresseuse et stratégies de partitionnement
- Transformation des boucles et des curseurs en opérations DataFrame vectorisées
- Modularisation, UDFs/UDFs pandas, widgets et bibliothèques réutilisables
Atelier Jour 4 — Réécriture de scripts procéduraux
- Réécriture d'un script ETL procédural en notebooks PySpark modulaires
- Introduction de la paramétrisation, des tests de style unitaire et des fonctions réutilisables
- Relecture de code et application de la liste de contrôle des meilleures pratiques
Jour 5 — Orchestration, Pipeline de bout en bout & Meilleures pratiques
- Databricks Workflows : conception des tâches, dépendances, déclencheurs et gestion des erreurs
- Conception de pipelines Medallion incrémentaux avec règles de qualité et validation de schéma
- Intégration avec Git (GitHub/Azure DevOps), CI et stratégies de test pour la logique PySpark
Atelier Jour 5 — Construction d'un pipeline complet de bout en bout
- Assemblage du pipeline Bronze→Silver→Gold orchestré avec Workflows
- Mise en œuvre de la journalisation, de l'audit, des nouvelles tentatives (retries) et des validations automatisées
- Exécution du pipeline complet, validation des sorties et préparation des notes de déploiement
Opérationnalisation, Gouvernance et Prêt pour la production
- Gouvernance Unity Catalog, lignée (lineage) et meilleures pratiques pour le contrôle d'accès
- Coûts, dimensionnement des clusters, mise à l'échelle automatique (autoscaling) et modèles de concurrence des tâches
- Listes de contrôle de déploiement, stratégies de retour arrière (rollback) et création de runbooks
Revue finale, Transfert de connaissances et Prochaines étapes
- Présentations des participants sur le travail de migration et les leçons apprises
- Analyse des écarts (gap analysis), activités de suivi recommandées et remise des documents de formation
- Références, parcours d'apprentissage supplémentaires et options de support
Pré requis
- Compréhension des concepts d'ingénierie des données
- Expérience avec SQL et les procédures stockées (Synapse / SQL Server)
- Connaissance des concepts d'orchestration ETL (ADF ou similaires)
Public cible
- Gestionnaires technologiques avec un profil en ingénierie des données
- Ingénieurs des données passant d'une logique OLAP procédurale à des modèles Lakehouse
- Ingénieurs plateforme responsables de l'adoption de Databricks
Nos clients témoignent (1)
les labs et la qualité des exercices de mise en pratique