Bądźmy w kontakcie
 Czas trwania 21 godzin

Plan Szkolenia

1. Wprowadzenie do głębokiego uczenia przez wzmacnianie

  • Czym jest uczenie przez wzmacnianie?
  • Różnice między uczeniem nadzorowanym, nienadzorowanym i przez wzmacnianie
  • Zastosowania DRL w 2025 roku (robotyka, opieka zdrowotna, finanse, logistyka)
  • Zrozumienie pętli interakcji agent-środowisko

2. Podstawy uczenia przez wzmacnianie

  • Markowa procesy decyzyjne (MDP)
  • Stan, akcja, nagroda, polityka i funkcje wartości
  • Kompromis między eksploracją a eksploatacją
  • Metody Monte Carlo i uczenie z różnicą czasową (TD)

3. Implementacja podstawowych algorytmów RL

  • Metody tabelaryczne: programowanie dynamiczne, ewaluacja i iteracja polityki
  • Q-Learning i SARSA
  • Eksploracja epsilon-zachłanna i strategie malejące
  • Implementacja środowisk RL z OpenAI Gymnasium

4. Przejście do głębokiego uczenia przez wzmacnianie

  • Ograniczenia metod tabelarycznych
  • Wykorzystanie sieci neuronowych do aproksymacji funkcji
  • Architektura i przepływ pracy Deep Q-Network (DQN)
  • Powtórka doświadczeń i sieci docelowe

5. Zaawansowane algorytmy DRL

  • Double DQN, Dueling DQN i priorytetowa powtórka doświadczeń
  • Metody gradientu polityki: algorytm REINFORCE
  • Architektury aktor-krytyk (A2C, A3C)
  • Proximal Policy Optimization (PPO)
  • Soft Actor-Critic (SAC)

6. Praca z ciągłymi przestrzeniami akcji

  • Wyzwania w sterowaniu ciągłym
  • Wykorzystanie DDPG (Deep Deterministic Policy Gradient)
  • Twin Delayed DDPG (TD3)

7. Praktyczne narzędzia i frameworki

  • Korzystanie ze Stable-Baselines3 i Ray RLlib
  • Logowanie i monitorowanie za pomocą TensorBoard
  • Strojenie hiperparametrów dla modeli DRL

8. Inżynieria nagród i projektowanie środowiska

  • Kształtowanie nagród i równoważenie kar
  • Koncepcje uczenia transferowego symulacja-rzeczywistość
  • Tworzenie niestandardowych środowisk w Gymnasium

9. Środowiska częściowo obserwowalne i generalizacja

  • Radzenie sobie z niepełną informacją o stanie (POMDP)
  • Podejścia oparte na pamięci z wykorzystaniem LSTM i RNN
  • Poprawa odporności i generalizacji agenta

10. Teoria gier i wieloagentowe uczenie przez wzmacnianie

  • Wprowadzenie do środowisk wieloagentowych
  • Współpraca a rywalizacja
  • Zastosowania w treningu kontradyktoryjnym i optymalizacji strategii

11. Studia przypadków i zastosowania praktyczne

  • Symulacje jazdy autonomicznej
  • Dynamiczne ustalanie cen i strategie handlu finansowego
  • Robotyka i automatyzacja przemysłowa

12. Rozwiązywanie problemów i optymalizacja

  • Diagnozowanie niestabilnego treningu
  • Zarządzanie rzadkością nagród i przeuczeniem
  • Skalowanie modeli DRL na GPU i systemy rozproszone

13. Podsumowanie i dalsze kroki

  • Przypomnienie architektury DRL i kluczowych algorytmów
  • Trendy branżowe i kierunki badań (np. RLHF, modele hybrydowe)
  • Dodatkowe zasoby i materiały do dalszej lektury

Wymagania

  • Biegłość w programowaniu w Pythonie
  • Znajomość rachunku różniczkowego i algebry liniowej
  • Podstawowa wiedza z rachunku prawdopodobieństwa i statystyki
  • Doświadczenie w budowaniu modeli uczenia maszynowego w Pythonie z użyciem NumPy lub TensorFlow/PyTorch

Grupa docelowa

  • Programiści zainteresowani sztuczną inteligencją i systemami inteligentnymi
  • Analitycy danych poznający frameworki uczenia przez wzmacnianie
  • Inżynierowie uczenia maszynowego pracujący z systemami autonomicznymi

Liczba uczestników


Cena za uczestnika (netto)

Opinie uczestników (4)

Propozycje terminów

Powiązane Kategorie