Plan Szkolenia
1. Wprowadzenie do głębokiego uczenia przez wzmacnianie
- Czym jest uczenie przez wzmacnianie?
- Różnice między uczeniem nadzorowanym, nienadzorowanym i przez wzmacnianie
- Zastosowania DRL w 2025 roku (robotyka, opieka zdrowotna, finanse, logistyka)
- Zrozumienie pętli interakcji agent-środowisko
2. Podstawy uczenia przez wzmacnianie
- Markowa procesy decyzyjne (MDP)
- Stan, akcja, nagroda, polityka i funkcje wartości
- Kompromis między eksploracją a eksploatacją
- Metody Monte Carlo i uczenie z różnicą czasową (TD)
3. Implementacja podstawowych algorytmów RL
- Metody tabelaryczne: programowanie dynamiczne, ewaluacja i iteracja polityki
- Q-Learning i SARSA
- Eksploracja epsilon-zachłanna i strategie malejące
- Implementacja środowisk RL z OpenAI Gymnasium
4. Przejście do głębokiego uczenia przez wzmacnianie
- Ograniczenia metod tabelarycznych
- Wykorzystanie sieci neuronowych do aproksymacji funkcji
- Architektura i przepływ pracy Deep Q-Network (DQN)
- Powtórka doświadczeń i sieci docelowe
5. Zaawansowane algorytmy DRL
- Double DQN, Dueling DQN i priorytetowa powtórka doświadczeń
- Metody gradientu polityki: algorytm REINFORCE
- Architektury aktor-krytyk (A2C, A3C)
- Proximal Policy Optimization (PPO)
- Soft Actor-Critic (SAC)
6. Praca z ciągłymi przestrzeniami akcji
- Wyzwania w sterowaniu ciągłym
- Wykorzystanie DDPG (Deep Deterministic Policy Gradient)
- Twin Delayed DDPG (TD3)
7. Praktyczne narzędzia i frameworki
- Korzystanie ze Stable-Baselines3 i Ray RLlib
- Logowanie i monitorowanie za pomocą TensorBoard
- Strojenie hiperparametrów dla modeli DRL
8. Inżynieria nagród i projektowanie środowiska
- Kształtowanie nagród i równoważenie kar
- Koncepcje uczenia transferowego symulacja-rzeczywistość
- Tworzenie niestandardowych środowisk w Gymnasium
9. Środowiska częściowo obserwowalne i generalizacja
- Radzenie sobie z niepełną informacją o stanie (POMDP)
- Podejścia oparte na pamięci z wykorzystaniem LSTM i RNN
- Poprawa odporności i generalizacji agenta
10. Teoria gier i wieloagentowe uczenie przez wzmacnianie
- Wprowadzenie do środowisk wieloagentowych
- Współpraca a rywalizacja
- Zastosowania w treningu kontradyktoryjnym i optymalizacji strategii
11. Studia przypadków i zastosowania praktyczne
- Symulacje jazdy autonomicznej
- Dynamiczne ustalanie cen i strategie handlu finansowego
- Robotyka i automatyzacja przemysłowa
12. Rozwiązywanie problemów i optymalizacja
- Diagnozowanie niestabilnego treningu
- Zarządzanie rzadkością nagród i przeuczeniem
- Skalowanie modeli DRL na GPU i systemy rozproszone
13. Podsumowanie i dalsze kroki
- Przypomnienie architektury DRL i kluczowych algorytmów
- Trendy branżowe i kierunki badań (np. RLHF, modele hybrydowe)
- Dodatkowe zasoby i materiały do dalszej lektury
Wymagania
- Biegłość w programowaniu w Pythonie
- Znajomość rachunku różniczkowego i algebry liniowej
- Podstawowa wiedza z rachunku prawdopodobieństwa i statystyki
- Doświadczenie w budowaniu modeli uczenia maszynowego w Pythonie z użyciem NumPy lub TensorFlow/PyTorch
Grupa docelowa
- Programiści zainteresowani sztuczną inteligencją i systemami inteligentnymi
- Analitycy danych poznający frameworki uczenia przez wzmacnianie
- Inżynierowie uczenia maszynowego pracujący z systemami autonomicznymi
Opinie uczestników (4)
Interaktywność szkolenia. Dużo eksperymentowaliśmy.
Lidia Opuchlik - Orange Szkolenia
Szkolenie - Deep Reinforcement Learning with Python
przejście po kolei od podstaw po zagadnieniach RL, tak by użycie framework'ów i customizowanych środowisk było finalnie w pełni zrozumiałe
Magdalena Dziwiszewska - Orange Szkolenia
Szkolenie - Deep Reinforcement Learning with Python
Dużo przykładów, interaktywny styl prowadzenia, odpowiedni czas na przerwy i rozwiązywanie zadań, gotowe maszyny ze środowiskiem i materiałami
Wojciech Bogucki - Orange Szkolenia
Szkolenie - Deep Reinforcement Learning with Python
wiedza trenera i sposób jej przekazania, możliwość dyskusji i zadawania pytań