Bądźmy w kontakcie

Plan Szkolenia

Wstęp do uczenia z wzmacnianiem i agenticznego AI

  • Podejmowanie decyzji w warunkach niepewności i sekwencyjne planowanie
  • Kluczowe komponenty RL: agenci, środowiska, stany i nagrody
  • Rola RL w adaptacyjnych i agenticznych systemach AI

Procesy decyzyjne Markowa (MDP)

  • Formalna definicja i właściwości MDP
  • Funkcje wartości, równania Bella i programowanie dynamiczne
  • Ewaluacja, ulepszanie i iteracja polityki

Uczenie z wzmacnianiem bez modelu

  • Uczenie Monte Carlo i Temporal-Difference (TD)
  • Q-learning i SARSA
  • Praktycznie: implementowanie tabelarycznych metod RL w Pythonie

Głębokie uczenie z wzmacnianiem

  • Łączenie sieci neuronowych z RL do przybliżania funkcji
  • Deep Q-Networks (DQN) i odtwarzanie doświadczeń (experience replay)
  • Architektury Actor-Critic i gradienty polityki
  • Praktycznie: trenowanie agenta za pomocą DQN i PPO przy użyciu Stable-Baselines3

Strategie eksploracji i kształtowanie nagród

  • Balansowanie eksploracji i eksploatacji (ε-greedy, UCB, metody entropii)
  • Projektowanie funkcji nagród i unikanie niechcianego zachowania
  • Kształtowanie nagród i uczenie programowe (curriculum learning)

Zaawansowane tematy w RL i podejmowaniu decyzji

  • Uczenie z wzmacnianiem wieloagentowe i strategie kooperacyjne
  • Ierarchiczne uczenie z wzmacnianiem i framework opcji (options framework)
  • Offline RL i uczenie z imitacji dla bezpieczniejszego wdrażania

Środowiska symulacyjne i ewaluacja

  • Używanie OpenAI Gym i niestandardowych środowisk
  • Przestrzenie akcji ciągłych vs. dyskretnych
  • Metryki wydajności agentów, stabilności i efektywności próbki

Integrowanie RL w systemach agenticznego AI

  • Łączenie rozumowania i RL w hybrydowych architekturach agentów
  • Integrowanie uczenia z wzmacnianiem z agentami korzystającymi z narzędzi
  • Rozważania operacyjne dotyczące skalowania i wdrażania

Projekt końcowy (Capstone)

  • Projektowanie i implementowanie agenta uczenia z wzmacnianiem dla zadania symulowanego
  • Analiza wydajności treningowej i optymalizacja hiperparametrów
  • Demonstracja zachowania adaptacyjnego i podejmowania decyzji w kontekście agenticznym

Podsumowanie i kolejne kroki

Wymagania

  • Zaawansowana biegłość w programowaniu w Pythonie
  • Solidne zrozumienie pojęć z zakresu uczenia maszynowego i głębokiego uczenia
  • Znajomość algebry liniowej, prawdopodobieństwa i podstawowych metod optymalizacji

Grupa docelowa

  • Inżynierowie ds. uczenia z wzmacnianiem i badacze AI stosowanej
  • Twórcy oprogramowania do robotyki i automatyzacji
  • Zespoły inżynieryjne pracujące nad adaptacyjnymi i agenticznymi systemami AI
 28 godzin

Liczba uczestników


Cena za uczestnika (netto)

Opinie uczestników (3)

Propozycje terminów

Powiązane Kategorie