Plan du cours
1. Introduction au Deep Reinforcement Learning
- Qu'est-ce que l'apprentissage par renforcement ?
- Différence entre apprentissage supervisé, non supervisé et par renforcement
- Applications du DRL en 2025 (robotique, santé, finance, logistique)
- Comprendre la boucle d'interaction agent-environnement
2. Fondamentaux de l'apprentissage par renforcement
- Processus de décision de Markov (MDP)
- État, Action, Récompense, Politique et fonctions de valeur
- Compromis entre exploration et exploitation
- Méthodes de Monte Carlo et apprentissage Temporal-Difference (TD)
3. Implémentation d'algorithmes de RL de base
- Méthodes tabulaires : programmation dynamique, évaluation et itération de politique
- Q-Learning et SARSA
- Exploration epsilon-greedy et stratégies de décroissance
- Implémentation d'environnements RL avec OpenAI Gymnasium
4. Transition vers le Deep Reinforcement Learning
- Limites des méthodes tabulaires
- Utilisation de réseaux de neurones pour l'approximation de fonctions
- Architecture et flux de travail de Deep Q-Network (DQN)
- Réutilisation d'expérience et réseaux cibles
5. Algorithmes avancés de DRL
- Double DQN, Dueling DQN et réutilisation d'expérience prioritaire
- Méthodes de Gradient de Politique : algorithme REINFORCE
- Architectures Actor-Critic (A2C, A3C)
- Optimisation de la politique proximale (PPO)
- Soft Actor-Critic (SAC)
6. Travail avec des espaces d'actions continus
- Défis du contrôle continu
- Utilisation de DDPG (Deep Deterministic Policy Gradient)
- Twin Delayed DDPG (TD3)
7. Outils et frameworks pratiques
- Utilisation de Stable-Baselines3 et Ray RLlib
- Journalisation et suivi avec TensorBoard
- Ajustement des hyperparamètres pour les modèles DRL
8. Ingénierie des récompenses et conception d'environnements
- Façonnage des récompenses et équilibre des pénalités
- Concepts de transfert d'apprentissage sim-to-real
- Création d'environnements personnalisés dans Gymnasium
9. Environnements partiellement observables et généralisation
- Gérer les informations d'état incomplètes (POMDP)
- Approches basées sur la mémoire utilisant LSTM et RNN
- Améliorer la robustesse et la généralisation des agents
10. Théorie des jeux et apprentissage par renforcement multi-agents
- Introduction aux environnements multi-agents
- Applications dans l'entraînement adversarial et l'optimisation des stratégies
11. Études de cas et applications réelles
- Simulations de conduite autonome
12. Dépannage et optimisation
- Diagnostic d'un entraînement instable
13. Résumé et prochaines étapes
- Récapitulatif de l'architecture DRL et des algorithmes clés
Pré requis
- Maîtrise de la programmation en Python
- Connaissance du calcul et de l'algèbre linéaire
- Connaissances de base en probabilités et statistique
- Expérience dans la construction de modèles d'apprentissage machine avec Python et NumPy ou TensorFlow/PyTorch
Public cible
- Développeurs intéressés par l'IA et les systèmes intelligents
- Scientifiques de données explorant les cadres de l'apprentissage par renforcement
- Ingénieurs en machine learning travaillant sur des systèmes autonomes
Nos clients témoignent (3)
J'ai vraiment aimé la fin où nous avons pris le temps de jouer avec CHAT GPT. La salle n'était pas très bien organisée pour cela - au lieu d'une grande table, quelques petites tables auraient été préférables afin que nous puissions travailler en petits groupes et brainstormer.
Nola - Laramie County Community College
Formation - Artificial Intelligence (AI) Overview
Traduction automatique
Travailler à partir des principes fondamentaux de manière concentrée, puis passer à l'application d'études de cas le même jour
Maggie Webb - Department of Jobs, Regions, and Precincts
Formation - Artificial Neural Networks, Machine Learning, Deep Thinking
Traduction automatique
Qu'il utilisait des données réelles d'entreprise. Le formateur avait une très bonne approche en faisant participer et concourir les stagiaires
Jimena Esquivel - Zaklad Uslugowy Hakoman Andrzej Cybulski
Formation - Applied AI from Scratch in Python
Traduction automatique