Prenez contact avec nous

Plan du cours

Introduction

Comprendre les Big Data

Vue d'ensemble de Spark

Vue d'ensemble de Python

Vue d'ensemble de PySpark

  • Partage des données à l'aide du framework Resilient Distributed Datasets
  • Partage du calcul à l'aide des opérateurs de l'API Spark

Configuration de Python avec Spark

Configuration de PySpark

Utilisation d'instances EC2 d'Amazon Web Services (AWS) pour Spark

Configuration de Databricks

Configuration du cluster AWS EMR

Apprendre les bases de la programmation en Python

  • Démarrage avec Python
  • Utilisation du Jupyter Notebook
  • Utilisation des variables et des types de données simples
  • Manipulation des listes
  • Utilisation des instructions if
  • Utilisation des entrées utilisateur
  • Manipulation des boucles while
  • Implémentation de fonctions
  • Manipulation des classes
  • Manipulation des fichiers et des exceptions
  • Travail sur les projets, les données et les API

Apprendre les bases des Spark DataFrame

  • Démarrage avec les Spark DataFrames
  • Implémentation d'opérations de base avec Spark
  • Utilisation des opérations Groupby et Aggregate
  • Manipulation des horodatages et des dates

Réalisation d'un exercice de projet sur un Spark DataFrame

Compréhension de l'apprentissage automatique avec MLlib

Utilisation de MLlib, Spark et Python pour l'apprentissage automatique

Compréhension des régressions

  • Étude de la théorie de la régression linéaire
  • Implémentation d'un code d'évaluation de régression
  • Réalisation d'un exercice type de régression linéaire
  • Étude de la théorie de la régression logistique
  • Implémentation d'un code de régression logistique
  • Réalisation d'un exercice type de régression logistique

Compréhension des forêts aléatoires et des arbres de décision

  • Étude de la théorie des méthodes d'arbres
  • Implémentation de codes pour les arbres de décision et les forêts aléatoires
  • Réalisation d'un exercice type de classification par forêts aléatoires

Travail avec le clustering K-means

  • Compréhension de la théorie du clustering K-means
  • Implémentation d'un code de clustering K-means
  • Réalisation d'un exercice type de clustering

Travail avec les systèmes de recommandation

Implémentation du traitement du langage naturel

  • Compréhension du traitement du langage naturel (NLP)
  • Vue d'ensemble des outils NLP
  • Réalisation d'un exercice type NLP

Streaming avec Spark sur Python

  • Vue d'ensemble du streaming avec Spark
  • Exercice type de streaming Spark

Pré requis

  • Compétences générales en programmation

Public cible

  • Développeurs
  • Professionnels de l'informatique
  • Scientists des données
 21 Heures

Nombre de participants


Prix par participant

Nos clients témoignent (6)

Cours à venir

Catégories Similaires