Plan du cours
Principes fondamentaux de la plateforme Databricks et du Lakehouse
- Architecture et composants du Lakehouse Databricks
- Organisation des espaces de travail et des catalogues
Espace de travail Databricks et Notebooks
- Navigation dans l'espace de travail et développement basé sur les notebooks
- Structuration du code en notebooks réutilisables
Architecture et exécution d'Apache Spark
- Architecture du runtime Spark et modèle d'exécution
- Évaluation paresseuse et DAG du job
DataFrames PySpark et API DataFrame
- Abstractions de DataFrame et schémas
- Opérations principales sur les DataFrames et expressions de colonnes
Traduction du SQL vers des DataFrames PySpark
- Traduction des clauses SQL fondamentales en opérations sur DataFrame
- Fenêtres et agrégations dans PySpark
Lecture et écriture de données dans Databricks
- Lecture depuis des sources courantes (fichiers, bases de données)
- Écriture et partitionnement des données dans le Lakehouse
Delta Lake et gestion des tables
- Tables Delta et transactions ACID
- Time travel et évolution du schéma
Nettoyage et transformation des données
- Nettoyage des données et conversion de types
- Mise en place de logique de transformation réutilisable
Fonctions définies par l'utilisateur (UDF) et code modulaire
- UDF Python et pandas UDFs
- Modularisation de la logique procédurale en fonctions
Mise au point et optimisation des performances
- Stratégies de partitionnement et de mise en cache
- Diagnostic des goulots d'étranglement via l'interface utilisateur Spark
Fondamentaux du streaming structuré
- Traitement par lots versus traitement en flux continu
- DataFrames de streaming et agrégations basiques
Jobs Databricks et orchestration de workflows
- Planification de notebooks en tant que jobs et tâches
- Construction de workflows multi-étapes avec dépendances
Unity Catalog et gouvernance des données
- Architecture et namespaces d'Unity Catalog
- Contrôle d'accès et linéage des données
Tests, débogage et pratiques de production
- Tests unitaires de la logique PySpark
- Débogage et normes de qualité du code
Cas d'usage complets pour les services financiers
- Conception d'un pipeline ETL bancaire complet
- Traduction des processus SQL legacy vers PySpark
Migration des charges de travail SQL vers PySpark
- Stratégie de migration et modèles de planification
- Conversion incrémentale des workflows SQL vers PySpark
Pré requis
- Expérience avec la programmation Python, incluant les fonctions et les types de données
- Compréhension du SQL, y compris les jointures, les agrégations et les sous-requêtes
- Aucune expérience préalable avec Databricks ou PySpark n'est requise
Participants
- Ingénieurs, analystes des données et professionnels travaillant avec les données
- Équipes migrant leurs workflows SQL existants vers Databricks et PySpark
Nos clients témoignent (1)
J'ai aimé qu'il soit pratique. J'ai adoré appliquer les connaissances théoriques avec des exemples pratiques.
Aurelia-Adriana - Allianz Services Romania
Formation - Python and Spark for Big Data (PySpark)
Traduction automatique