Plan Szkolenia
Wprowadzenie, cele i strategia migracji
- Cele kursu, dopasowanie profilu uczestników i kryteria sukcesu
- Podejścia do migracji na wysokim poziomie oraz kwestie ryzyka
- Konfiguracja przestrzeni roboczych (workspaces), repository i zbiorów danych do laboratoriów
Dzień 1 — Fundamenty migracji i architektura
- Pojęcia Lakehouse, przegląd Delta Lake i architektury Databricks
- Różnice między SMP a MPP i ich implikacje dla migracji
- Projektowanie wzorca Medallion (Brąz→Srebro→Złoto) i przegląd Unity Catalog
Dzień 1 Laboratorium — Przekształcanie procedury przechowywanej
- Praktyczna migracja przykładowej procedury przechowywanej do notebooka
- Mapowanie tabel tymczasowych i kursorów na transformacje DataFrame
- Weryfikacja i porównanie z oryginalnym wynikiem
Dzień 2 — Zaawansowane Delta Lake i ładowanie inkrementalne
- Transakcje ACID, dzienniki commit, wersjonowanie i podróże w czasie (time travel)
- Auto Loader, wzorce MERGE INTO, operacje upsert oraz ewolucja schematu
- OPTIMIZE, VACUUM, Z-ORDER, partycjonowanie i tuning magazynowania
Dzień 2 Laboratorium — Inkrementalny pobór danych i optymalizacja
- Implementacja pobierania danych Auto Loader i workflow MERGE
- Stosowanie OPTIMIZE, Z-ORDER i VACUUM; weryfikacja wyników
- Pomiar poprawy wydajności odczytu/zapisu
Dzień 3 — SQL w Databricks, wydajność i debugowanie
- Funkcje analityczne SQL: funkcje okienkowe, funkcje wyższego rzędu, obsługa JSON/tablic
- Czytanie Spark UI, DAG-ów, shuffli, etapów, zadań i diagnozowanie wąskich gardeł
- Wzorce optymalizacji zapytań: połączenia broadcast, podpowiedzi (hints), cache'owanie i redukcja przelewów (spill)
Dzień 3 Laboratorium — Refaktoryzacja SQL i optymalizacja wydajności
- Refaktoryzacja ciężkiego procesu SQL w zoptymalizowane Spark SQL
- Używanie śladów Spark UI do identyfikacji i naprawy problemów ze skosem i shufflingiem
- Przetestowanie wydajności przed i po oraz dokumentacja kroków optymalizacji
Dzień 4 — Taktyczny PySpark: zastępowanie logiki proceduralnej
- Model wykonania Spark: driver, executorzy, leniwe wyliczanie i strategie partycjonowania
- Przekształcanie pętli i kursorów na wektorowane operacje DataFrame
- Modularyzacja, funkcje UDF/pandas UDF, widżety i ponownie używalne biblioteki
Dzień 4 Laboratorium — Refaktoryzacja skryptów proceduralnych
- Refaktoryzacja proceduralnego skryptu ETL w modularne notebooki PySpark
- Wprowadzenie parametryzacji, testów w stylu unit i ponownie używalnych funkcji
- Przegląd kodu i stosowanie listy kontroli dobrych praktyk
Dzień 5 — Koordynacja, pipeline end-to-end i dobre praktyki
- Databricks Workflows: projektowanie zadań, zależności, wyzwalacze i obsługa błędów
- Projektowanie inkrementalnych pipeline'ów Medallion z regułami jakości i walidacją schematu
- Integracja z Git (GitHub/Azure DevOps), CI i strategie testowania logiki PySpark
Dzień 5 Laboratorium — Budowa kompletnego pipeline'a end-to-end
- Skomponowanie pipeline'u Brąz→Srebro→Złoto koordynowanego przez Workflows
- Implementacja logowania, audytu, ponowień (retries) i automatycznych walidacji
- Uruchomienie pełnego pipeline'a, weryfikacja wyjść i przygotowanie notatek wdrożeniowych
Operacjonalizacja, zarządzanie i gotowość produkcyjna
- Zarządzanie Unity Catalog, genealogia danych i najlepsze praktyki kontroli dostępu
- Koszty, rozmiar klastra, autoskalowanie i wzorce współbieżności zadań
- Listy kontroli wdrożenia, strategie wycofania (rollback) i tworzenie runbooków
Ostateczna przegląd, transfer wiedzy i kolejne kroki
- Prezentacje uczestników dotyczących prac migracyjnych i wniosków z doświadczeń
- Analiza luk, zalecane kolejne działania i przekazanie materiałów szkoleniowych
- Referencje, ścieżki dalszego rozwoju i opcje wsparcia
Wymagania
- Znajomość pojęć związanych z inżynierią danych
- Doświadczenie w zakresie SQL i procedur przechowywanych (Synapse / SQL Server)
- Znajomość pojęć dotyczących koordynacji ETL (ADF lub podobne)
Grupa docelowa
- Menedżerowie technologii z doświadczeniem w inżynierii danych
- Inżynierowie danych przechodzący od proceduralnej logiki OLAP do wzorców Lakehouse
- Inżynierowie platformy odpowiedzialni za wdrażanie Databricks