Prenez contact avec nous

Plan du cours

Principes fondamentaux de la plateforme Databricks et du Lakehouse

  • Architecture et composants du Lakehouse Databricks
  • Organisation des espaces de travail et des catalogues

Espace de travail Databricks et Notebooks

  • Navigation dans l'espace de travail et développement basé sur les notebooks
  • Structuration du code en notebooks réutilisables

Architecture et exécution d'Apache Spark

  • Architecture du runtime Spark et modèle d'exécution
  • Évaluation paresseuse et DAG du job

DataFrames PySpark et API DataFrame

  • Abstractions de DataFrame et schémas
  • Opérations principales sur les DataFrames et expressions de colonnes

Traduction du SQL vers des DataFrames PySpark

  • Traduction des clauses SQL fondamentales en opérations sur DataFrame
  • Fenêtres et agrégations dans PySpark

Lecture et écriture de données dans Databricks

  • Lecture depuis des sources courantes (fichiers, bases de données)
  • Écriture et partitionnement des données dans le Lakehouse

Delta Lake et gestion des tables

  • Tables Delta et transactions ACID
  • Time travel et évolution du schéma

Nettoyage et transformation des données

  • Nettoyage des données et conversion de types
  • Mise en place de logique de transformation réutilisable

Fonctions définies par l'utilisateur (UDF) et code modulaire

  • UDF Python et pandas UDFs
  • Modularisation de la logique procédurale en fonctions

Mise au point et optimisation des performances

  • Stratégies de partitionnement et de mise en cache
  • Diagnostic des goulots d'étranglement via l'interface utilisateur Spark

Fondamentaux du streaming structuré

  • Traitement par lots versus traitement en flux continu
  • DataFrames de streaming et agrégations basiques

Jobs Databricks et orchestration de workflows

  • Planification de notebooks en tant que jobs et tâches
  • Construction de workflows multi-étapes avec dépendances

Unity Catalog et gouvernance des données

  • Architecture et namespaces d'Unity Catalog
  • Contrôle d'accès et linéage des données

Tests, débogage et pratiques de production

  • Tests unitaires de la logique PySpark
  • Débogage et normes de qualité du code

Cas d'usage complets pour les services financiers

  • Conception d'un pipeline ETL bancaire complet
  • Traduction des processus SQL legacy vers PySpark

Migration des charges de travail SQL vers PySpark

  • Stratégie de migration et modèles de planification
  • Conversion incrémentale des workflows SQL vers PySpark

Pré requis

  • Expérience avec la programmation Python, incluant les fonctions et les types de données
  • Compréhension du SQL, y compris les jointures, les agrégations et les sous-requêtes
  • Aucune expérience préalable avec Databricks ou PySpark n'est requise

Participants

  • Ingénieurs, analystes des données et professionnels travaillant avec les données
  • Équipes migrant leurs workflows SQL existants vers Databricks et PySpark
 35 Heures

Nombre de participants


Prix par participant

Nos clients témoignent (1)

Cours à venir

Catégories Similaires