Prenez contact avec nous

Plan du cours

1. Introduction au Deep Reinforcement Learning

  • Qu'est-ce que l'apprentissage par renforcement ?
  • Différence entre apprentissage supervisé, non supervisé et par renforcement
  • Applications du DRL en 2025 (robotique, santé, finance, logistique)
  • Comprendre la boucle d'interaction agent-environnement

2. Fondamentaux de l'apprentissage par renforcement

  • Processus de décision de Markov (MDP)
  • État, Action, Récompense, Politique et fonctions de valeur
  • Compromis entre exploration et exploitation
  • Méthodes de Monte Carlo et apprentissage Temporal-Difference (TD)

3. Implémentation d'algorithmes de RL de base

  • Méthodes tabulaires : programmation dynamique, évaluation et itération de politique
  • Q-Learning et SARSA
  • Exploration epsilon-greedy et stratégies de décroissance
  • Implémentation d'environnements RL avec OpenAI Gymnasium

4. Transition vers le Deep Reinforcement Learning

  • Limites des méthodes tabulaires
  • Utilisation de réseaux de neurones pour l'approximation de fonctions
  • Architecture et flux de travail de Deep Q-Network (DQN)
  • Réutilisation d'expérience et réseaux cibles

5. Algorithmes avancés de DRL

  • Double DQN, Dueling DQN et réutilisation d'expérience prioritaire
  • Méthodes de Gradient de Politique : algorithme REINFORCE
  • Architectures Actor-Critic (A2C, A3C)
  • Optimisation de la politique proximale (PPO)
  • Soft Actor-Critic (SAC)

6. Travail avec des espaces d'actions continus

  • Défis du contrôle continu
  • Utilisation de DDPG (Deep Deterministic Policy Gradient)
  • Twin Delayed DDPG (TD3)

7. Outils et frameworks pratiques

  • Utilisation de Stable-Baselines3 et Ray RLlib
  • Journalisation et suivi avec TensorBoard
  • Ajustement des hyperparamètres pour les modèles DRL

8. Ingénierie des récompenses et conception d'environnements

  • Façonnage des récompenses et équilibre des pénalités
  • Concepts de transfert d'apprentissage sim-to-real
  • Création d'environnements personnalisés dans Gymnasium

9. Environnements partiellement observables et généralisation

  • Gérer les informations d'état incomplètes (POMDP)
  • Approches basées sur la mémoire utilisant LSTM et RNN
  • Améliorer la robustesse et la généralisation des agents

10. Théorie des jeux et apprentissage par renforcement multi-agents

  • Introduction aux environnements multi-agents
  • Applications dans l'entraînement adversarial et l'optimisation des stratégies

11. Études de cas et applications réelles

  • Simulations de conduite autonome

12. Dépannage et optimisation

  • Diagnostic d'un entraînement instable

13. Résumé et prochaines étapes

  • Récapitulatif de l'architecture DRL et des algorithmes clés

Pré requis

  • Maîtrise de la programmation en Python
  • Connaissance du calcul et de l'algèbre linéaire
  • Connaissances de base en probabilités et statistique
  • Expérience dans la construction de modèles d'apprentissage machine avec Python et NumPy ou TensorFlow/PyTorch

Public cible

  • Développeurs intéressés par l'IA et les systèmes intelligents
  • Scientifiques de données explorant les cadres de l'apprentissage par renforcement
  • Ingénieurs en machine learning travaillant sur des systèmes autonomes
 21 Heures

Nombre de participants


Prix par participant

Nos clients témoignent (3)

Cours à venir

Catégories Similaires