Cursusaanbod
1. Inleiding tot Deep Reinforcement Learning
- Wat is Reinforcement Learning?
- Verschil tussen Supervized, Unsupervised en Reinforcement Learning
- Toepassingen van DRL in 2025 (robotica, zorg, financiën, logistiek)
- Begrijpen van de interactielus agent-omgeving
2. Fundamentele Reinforcement Learning
- Markov Besluitprocessen (MDP)
- Toestand, Actie, Beloning, Beleid en Waardesfuncties
- Afweging tussen Verkenning (Exploration) en Exploitatie (Exploitation)
- Monte Carlo methoden en Temporal-Difference (TD) leren
3. Implementatie van basis RL-algoritmen
- Tabelmethoden: Dynamisch Programmeren, Beleidbeoordeling en Iteratie
- Q-Learning en SARSA
- Epsilon-greedy verkenning en afnemende strategieën
- Implementeren van RL-omgevingen met OpenAI Gymnasium
4. Overgang naar Deep Reinforcement Learning
- Beperkingen van tabelmethodes
- Gebruik van neurale netwerken voor functieapproximatie
- Architectuur en werking van Deep Q-Network (DQN)
- Experience replay en target netwerken
5. Geavanceerde DRL-algoritmen
- Double DQN, Dueling DQN en Prioritized Experience Replay
- Policy Gradient Methoden: REINFORCE algoritme
- Actor-Critic architecturen (A2C, A3C)
- Proximal Policy Optimization (PPO)
- Soft Actor-Critic (SAC)
6. Werken met continue actieruimtes
- Uitdagingen in continue besturing
- Gebruik van DDPG (Deep Deterministic Policy Gradient)
- Twin Delayed DDPG (TD3)
7. Praktische tools en frameworks
- Gebruik van Stable-Baselines3 en Ray RLlib
- Loggen en monitoren met TensorBoard
- Hyperparameter tuning voor DRL-modellen
8. Beloningsingenieur en omgevingsonderzoek
- Beloningsvormgeving en evenwicht van boetes
- Concepten van Sim-to-real transfer learning
- Aanmaken van custom omgevingen in Gymnasium
9. Gedeeltelijk waarneembare omgevingen en generalisatie
- Omgaan met onvolledige toestandsinformatie (POMDPs)
- Geheugen-gebaseerde benaderingen met behulp van LSTMs en RNNs
- Verbeteren van robuustheid en generalisatie van agentsen
10. Speltheorie en Multi-Agent Reinforcement Learning
- Inleiding tot multi-agent omgevingen
- Samenwerking vs. concurrentie
- Toepassingen in adversariaal trainen en strategie-optimalisatie
11. Casestudies en toepassingen in de echte wereld
- Simulaties van zelfrijdende voertuigen
- Dynamisch prijzen en financiële handelsstrategieën
- Robotica en industriële automatisering
12. Problemen oplossen en optimalisatie
- Diagnose van onstabiele training
- Beheren van beloningsknaptheid en overfitting
- Schalen van DRL-modellen op GPU's en gedistribueerde systemen
13. Samenvatting en vervolgstappen
- Terugblik op DRL-architectuur en belangrijke algoritmen
- Industriële trends en onderzoeksrichtingen (bijv. RLHF, hybride modellen)
- Verdere bronnen en leesmaterialen
Vereisten
- Vaardigheid in Python-programmeren
- Begrip van Calculus en Lineaire Algebra
- Basis kennis van Waarschijnlijkheid en Statistiek
- Ervaring met het bouwen van machine learning modellen met behulp van Python en NumPy of TensorFlow/PyTorch
Doelgroep
- Ontwikkelaars geïnteresseerd in AI en intelligente systemen
- Datawetenschappers die reinforcement learning frameworks verkennen
- Machine Learning Engineers die werken aan autonome systemen
Getuigenissen (3)
Ik vond het echt leuk hoe we aan het einde de tijd namen om te experimenteren met CHAT GPT. De ruimte was hier niet ideaal voor ingericht - in plaats van één grote tafel zouden een paar kleinere tafels handig geweest zijn, zodat we in kleine groepjes konden brainstormen.
Nola - Laramie County Community College
Cursus - Artificial Intelligence (AI) Overview
Automatisch vertaald
Werken op basis van eerste principes op een gefocuste manier, en overgaan naar het toepassen van casestudies binnen dezelfde dag
Maggie Webb - Department of Jobs, Regions, and Precincts
Cursus - Artificial Neural Networks, Machine Learning, Deep Thinking
Automatisch vertaald
Dat het echte bedrijfsgegevens gebruikte. De trainer had een zeer goede benadering door de deelnemers te laten meedoen en tegen elkaar aan treden
Jimena Esquivel - Zaklad Uslugowy Hakoman Andrzej Cybulski
Cursus - Applied AI from Scratch in Python
Automatisch vertaald