Prenez contact avec nous

Plan du cours

Introduction à l'AIOps prédictive

  • Vue d'ensemble de l'analytique prédictive dans les opérations informatiques
  • Sources de données pour la prédiction (journaux, mesures, événements)
  • Concepts clés en prévision des séries temporelles et schémas d'anomalies

Conception de modèles de prédiction des incidents

  • Étiquetage des incidents historiques et du comportement du système
  • Choix et entraînement des modèles (ex. : LSTM, Random Forest, AutoML)
  • Évaluation des performances du modèle et gestion des faux positifs

Collecte de données et ingénierie des caractéristiques

  • Ingestion et alignement des données de journaux et de mesures pour l'entrée du modèle
  • Extraction de caractéristiques à partir de données structurées et non structurées
  • Gestion du bruit et des données manquantes dans les pipelines opérationnels

Automatisation de l'analyse des causes racines (RCA)

  • Corrélation basée sur les graphes des services et de l'infrastructure
  • Utilisation du ML pour inférer les causes racines probables à partir des chaînes d'événements
  • Visualisation de la RCA avec des tableaux de bord prenant en compte la topologie

Remédiation et automatisation des workflows

  • Intégration avec des plateformes d'automatisation (ex. : Ansible, Rundeck)
  • Déclenchement de retours arrière, de redémarrages ou de redirection de trafic
  • Audit et documentation des interventions automatisées

Dimensionnement des pipelines AIOps intelligents

  • MLOps pour l'observabilité : réentraînement et versionnage des modèles
  • Exécution de prédictions en temps réel sur des nœuds distribués
  • Bonnes pratiques pour le déploiement de l'AIOps dans les environnements de production

Études de cas et applications pratiques

  • Analyse de données d'incidents réelles à l'aide de modèles AIOps prédictifs
  • Déploiement de pipelines RCA avec des données synthétiques et de production
  • Revue des cas d'usage sectoriels : pannes cloud, instabilité des microservices, dégradations réseau

Résumé et prochaines étapes

Pré requis

  • Expérience avec des systèmes de supervision tels que Prometheus ou ELK
  • Connaissances opérationnelles de Python et de l'apprentissage automatique de base
  • Familiarité avec les workflows de gestion des incidents

Public cible

  • Ingénieurs seniors en fiabilité des sites (SRE)
  • Architectes en automatisation IT
  • Responsables des plateformes DevOps et d'observabilité
 14 Heures

Nombre de participants


Prix par participant

Cours à venir

Catégories Similaires