Merci d'avoir envoyé votre demande ! Un membre de notre équipe vous contactera sous peu.
Merci d'avoir envoyé votre réservation ! Un membre de notre équipe vous contactera sous peu.
Plan du cours
Introduction à l'AIOps prédictive
- Vue d'ensemble de l'analytique prédictive dans les opérations informatiques
- Sources de données pour la prédiction (journaux, mesures, événements)
- Concepts clés en prévision des séries temporelles et schémas d'anomalies
Conception de modèles de prédiction des incidents
- Étiquetage des incidents historiques et du comportement du système
- Choix et entraînement des modèles (ex. : LSTM, Random Forest, AutoML)
- Évaluation des performances du modèle et gestion des faux positifs
Collecte de données et ingénierie des caractéristiques
- Ingestion et alignement des données de journaux et de mesures pour l'entrée du modèle
- Extraction de caractéristiques à partir de données structurées et non structurées
- Gestion du bruit et des données manquantes dans les pipelines opérationnels
Automatisation de l'analyse des causes racines (RCA)
- Corrélation basée sur les graphes des services et de l'infrastructure
- Utilisation du ML pour inférer les causes racines probables à partir des chaînes d'événements
- Visualisation de la RCA avec des tableaux de bord prenant en compte la topologie
Remédiation et automatisation des workflows
- Intégration avec des plateformes d'automatisation (ex. : Ansible, Rundeck)
- Déclenchement de retours arrière, de redémarrages ou de redirection de trafic
- Audit et documentation des interventions automatisées
Dimensionnement des pipelines AIOps intelligents
- MLOps pour l'observabilité : réentraînement et versionnage des modèles
- Exécution de prédictions en temps réel sur des nœuds distribués
- Bonnes pratiques pour le déploiement de l'AIOps dans les environnements de production
Études de cas et applications pratiques
- Analyse de données d'incidents réelles à l'aide de modèles AIOps prédictifs
- Déploiement de pipelines RCA avec des données synthétiques et de production
- Revue des cas d'usage sectoriels : pannes cloud, instabilité des microservices, dégradations réseau
Résumé et prochaines étapes
Pré requis
- Expérience avec des systèmes de supervision tels que Prometheus ou ELK
- Connaissances opérationnelles de Python et de l'apprentissage automatique de base
- Familiarité avec les workflows de gestion des incidents
Public cible
- Ingénieurs seniors en fiabilité des sites (SRE)
- Architectes en automatisation IT
- Responsables des plateformes DevOps et d'observabilité
14 Heures