Prenez contact avec nous

Plan du cours

Introduction de l’IA agentique pour les opérations

  • Des procédures statiques aux agents rationnels : l’évolution de l’automatisation IT
  • Anatomie d’un agent : boucle de raisonnement, utilisation d’outils, mémoire et planification
  • Lorsqu’il faut automatiser vs quand maintenir un contrôle humain

Frameworks et architectures d’agents

  • Modèles mono-agent : ReAct, Plan-and-Execute et boucles d’appel d’outils
  • Architectures multi-agents : superviseur, hiérarchique et essaims
  • Comparaison des frameworks : LangGraph, CrewAI, AutoGen et agents sur mesure
  • Créer votre premier agent opérationnel : interroger les systèmes de surveillance, diagnostiquer, proposer

Intégration d’outils pour les opérations IT

  • Connecter les agents aux API Prometheus, Grafana, Datadog et PagerDuty
  • Interrogation des journaux avec des agents : intégration Elasticsearch, Loki et Splunk
  • Utilisation d’outils d’infrastructure : kubectl, Terraform, Ansible via des actions agent
  • Conception d’interfaces d’outils sûres avec validation des paramètres et idempotence

Automatisation de la réponse aux incidents

  • Triage automatique des incidents : classification par gravité et routage
  • Génération d’hypothèses sur la cause racine et collecte de preuves
  • Réparation automatisée : actions de redémarrage, mise à l’échelle, retour en arrière et bascule
  • Construire un agent de résolution d’incidents avec des niveaux d’autonomie progressive

Sécurité, garde-fous et intervention humaine

  • Classification des actions : en lecture seule, faible risque, haut risque et destructrices
  • Points de validation et politiques d’escalade pour les opérations critiques
  • Modèles de garde-fous : listes d’actions autorisées, limites d’impact et garanties de retour en arrière
  • Traces d’audit et origine des décisions pour la conformité

Orchestration multi-agents pour les incidents complexes

  • Coordination d’agents spécialisés : agent de triage, agent de diagnostic, agent de réparation
  • Communication inter-agents et gestion du contexte partagé
  • Résolution de conflits lorsque les agents proposent des actions contradictoires
  • Simulation de bout en bout d’un incident majeur avec une réponse multi-agents

Observabilité et évaluation

  • Suivi des chaînes de raisonnement des agents pour le débogage et l’audit
  • Évaluation de la qualité des décisions des agents : précision, rappel, temps de résolution
  • Boucles de rétroaction : apprentissage à partir des substitutions opérateur et des résultats
  • Suivi des coûts et économie de jetons pour les agents opérationnels

Déploiement en production et opérations

  • Déploiement des agents en tant que services : API, webhooks et tâches planifiées
  • Progression de l’autonomie : du mode ombre à la réparation entièrement automatique
  • Procédure pour les pannes d’agent : que faire lorsque l’agent lui-même est en panne
  • Construire la justification commerciale et mesurer le ROI des opérations autonomes

Pré requis

  • Expérience dans les opérations IT, les pratiques DevOps ou SRE.
  • Maîtrise du script Python et des API REST.
  • Compréhension de base des capacités des LLM et de l’ingénierie de prompt.

Public cible

  • Ingénieurs SRE et DevOps explorant l’automatisation par l’IA.
  • Ingénieurs plateforme construisant des infrastructures auto-guérissantes.
  • Responsables des opérations IT évaluant l’IA agentique pour la gestion des incidents.
 14 Heures

Nombre de participants


Prix par participant

Cours à venir

Catégories Similaires