Prenez contact avec nous
 Durée 21 heures

Plan du cours

Fondamentaux de NiFi et du flux de données

  • Données en mouvement vs données au repos : concepts et défis
  • Architecture NiFi : cœurs, contrôleur de flux, provenance et bulletin
  • Composants clés : processeurs, connexions, contrôleurs et provenance

Contexte Big Data et intégration

  • Rôle de NiFi dans les écosystèmes Big Data (Hadoop, Kafka, stockage cloud)
  • Vue d'ensemble d'HDFS, MapReduce et des alternatives modernes
  • Cas d'usage : ingestion de flux, acheminement de journaux, pipelines d'événements

Installation, configuration & setup de cluster

  • Installation de NiFi sur un nœud unique et en mode cluster
  • Configuration du cluster : rôles des nœuds, ZooKeeper et équilibrage de charge
  • Orchestration des déploiements NiFi : utilisation d'Ansible, Docker ou Helm

Conception et gestion des flux de données

  • Routage, filtrage, division et fusion des flux
  • Configuration des processeurs (InvokeHTTP, QueryRecord, PutDatabaseRecord, etc.)
  • Gestion du schéma, de l'enrichissement et des opérations de transformation
  • Gestion des erreurs, relations de tentative (retry) et backpressure

Scénarios d'intégration

  • Connexion aux bases de données, systèmes de messagerie et API REST
  • Streaming vers les systèmes d'analyse : Kafka, Elasticsearch ou stockage cloud
  • Intégration avec Splunk, Prometheus ou les pipelines de journalisation

Surveillance, récupération & provenance

  • Utilisation de l'interface NiFi, des métriques et du visualiseur de provenance
  • Conception de la récupération autonome et de la gestion élégante des défaillances
  • Sauvegarde, versioning des flux et gestion des changements

Ajustement des performances & optimisation

  • Ajustement du JVM, de la heap, des pools de threads et des paramètres de clustering
  • Optimisation de la conception des flux pour réduire les goulots d'étranglement
  • Isolation des ressources, priorisation des flux et contrôle du débit

Meilleures pratiques & gouvernance

  • Documentation des flux, normes de nommage, conception modulaire
  • Sécurité : TLS, authentification, contrôle d'accès, chiffrement des données
  • Contrôle des changements, versioning, accès par rôle, pistes d'audit

Dépannage & réponse aux incidents

  • Problèmes courants : blocages (deadlocks), fuites de mémoire, erreurs de processeur
  • Analyse des journaux, diagnostic des erreurs et enquête sur la cause racine
  • Stratégies de récupération et retour arrière (rollback) des flux

Laboratoire pratique : implémentation d'un pipeline de données réaliste

  • Construction d'un flux de bout en bout : ingestion, transformation, livraison
  • Mise en œuvre de la gestion des erreurs, du backpressure et du passage à l'échelle (scaling)
  • Test de performance et ajustement du pipeline

Résumé et prochaines étapes

Pré requis

  • Expérience avec la ligne de commande Linux
  • Compréhension de base du réseau et des systèmes de données
  • Notions sur le streaming de données ou les concepts ETL

Public cible

  • Administrateurs systèmes
  • Ingénieurs en données
  • Développeurs
  • Professionnels DevOps

Nombre de participants


Prix par participant

Nos clients témoignent (7)

Cours à venir

Catégories Similaires