Prenez contact avec nous

Plan du cours

Paysage de l'observabilité IA

  • Des tableaux de bord aux conversations : le virage vers une observabilité augmentée par l'IA
  • Capacités des LLM pertinentes pour l'observabilité : résumé, raisonnement, correspondance de motifs
  • Modèles d'architecture : intégration de l'IA dans les piles d'observabilité existantes

Interrogation en langage naturel des données de télémétrie

  • Texte-to-PromQL : traduction du langage naturel en requêtes de surveillance
  • Interrogation en NL pour Elasticsearch, OpenSearch et les entrepôts de logs Loki
  • Génération de SQL à partir du langage naturel pour la télémétrie structurée
  • Création d'un assistant de requête intelligent avec utilisation d'outils et prise de contexte

Analyse de logs alimentée par des LLM

  • Décodage et structuration automatisés des logs avec des LLM
  • Détection d'anomalies dans les flux de logs via la similarité d'embeddings
  • Regroupement des logs et découverte de motifs à grande échelle
  • Génération d'explications lisibles par l'homme à partir de séquences brutes de logs

Alerte intelligente et enrichissement des incidents

  • Corrélation et déduplication des alertes avec compréhension sémantique
  • Rassemblement automatique du contexte des incidents à partir des runbooks, des incidents passés et de la documentation
  • Routage intelligent des alertes basé sur la compréhension du contenu et l'expertise de l'équipe
  • Réduction de la fatigue d'alerte grâce à la réduction du bruit pilotée par l'IA

Analyse des causes racines assistée par l'IA

  • Génération d'hypothèses à partir de la corrélation de télémétrie multi-sources
  • Enchaînement des preuves : connexion des symptômes entre les métriques, les logs et les traces
  • Dépannage guidé avec des sessions de diagnostic IA interactives
  • Construction d'un agent d'analyse des causes racines avec enquête progressive

Réponse automatisée aux incidents et communication

  • Génération de résumés d'incidents et de mises à jour d'état à partir de la télémétrie
  • Rédaction automatique des analyses post-mortem avec reconstitution de la chronologie
  • Communication aux parties prenantes adaptée aux audiences techniques et executives
  • Suggestions de runbooks et recommandations de correction automatisées

ML pour l'observabilité

  • Prévision de séries temporelles pour la planification des capacités et la prédiction d'anomalies
  • Modèles de base pour la détection d'anomalies zero-shot sur les métriques
  • Cartographie des dépendances de services et découverte de topologie basées sur les embeddings
  • Entraînement et déploiement de modèles ML légers en parallèle des pipelines d'observabilité

Déploiement en production et éthique

  • Considérations de latence et de coût pour l'observabilité IA en temps réel
  • Vie privée des données : assurer que les LLM ne divulguent pas de télémétrie sensible
  • Supervision humaine : quand le diagnostic IA nécessite une validation par l'opérateur
  • Mesure d'impact : MTTD, MTTR et métriques de la expérience de garde

Pré requis

  • Expérience avec des outils d'observabilité tels que Prometheus, Grafana, Datadog ou OpenTelemetry.
  • Connaissance des concepts de gestion des logs et des métriques.
  • Scripting Python basique pour le traitement des données.

Audience cible

  • Ingénieurs SRE et chargés de l'observabilité adoptant des outils améliorés par l'IA.
  • Ingénieurs plateforme construisant des pipelines de surveillance de nouvelle génération.
  • Responsables DevOps évaluant l'intégration des LLM dans les workflows d'incidents.
 14 Heures

Nombre de participants


Prix par participant

Cours à venir

Catégories Similaires