Bądźmy w kontakcie

Plan Szkolenia

Wprowadzenie, cele i strategia migracji

  • Cele kursu, dopasowanie profilu uczestników i kryteria sukcesu
  • Podejścia do migracji na wysokim poziomie oraz kwestie ryzyka
  • Konfiguracja przestrzeni roboczych (workspaces), repository i zbiorów danych do laboratoriów

Dzień 1 — Fundamenty migracji i architektura

  • Pojęcia Lakehouse, przegląd Delta Lake i architektury Databricks
  • Różnice między SMP a MPP i ich implikacje dla migracji
  • Projektowanie wzorca Medallion (Brąz→Srebro→Złoto) i przegląd Unity Catalog

Dzień 1 Laboratorium — Przekształcanie procedury przechowywanej

  • Praktyczna migracja przykładowej procedury przechowywanej do notebooka
  • Mapowanie tabel tymczasowych i kursorów na transformacje DataFrame
  • Weryfikacja i porównanie z oryginalnym wynikiem

Dzień 2 — Zaawansowane Delta Lake i ładowanie inkrementalne

  • Transakcje ACID, dzienniki commit, wersjonowanie i podróże w czasie (time travel)
  • Auto Loader, wzorce MERGE INTO, operacje upsert oraz ewolucja schematu
  • OPTIMIZE, VACUUM, Z-ORDER, partycjonowanie i tuning magazynowania

Dzień 2 Laboratorium — Inkrementalny pobór danych i optymalizacja

  • Implementacja pobierania danych Auto Loader i workflow MERGE
  • Stosowanie OPTIMIZE, Z-ORDER i VACUUM; weryfikacja wyników
  • Pomiar poprawy wydajności odczytu/zapisu

Dzień 3 — SQL w Databricks, wydajność i debugowanie

  • Funkcje analityczne SQL: funkcje okienkowe, funkcje wyższego rzędu, obsługa JSON/tablic
  • Czytanie Spark UI, DAG-ów, shuffli, etapów, zadań i diagnozowanie wąskich gardeł
  • Wzorce optymalizacji zapytań: połączenia broadcast, podpowiedzi (hints), cache'owanie i redukcja przelewów (spill)

Dzień 3 Laboratorium — Refaktoryzacja SQL i optymalizacja wydajności

  • Refaktoryzacja ciężkiego procesu SQL w zoptymalizowane Spark SQL
  • Używanie śladów Spark UI do identyfikacji i naprawy problemów ze skosem i shufflingiem
  • Przetestowanie wydajności przed i po oraz dokumentacja kroków optymalizacji

Dzień 4 — Taktyczny PySpark: zastępowanie logiki proceduralnej

  • Model wykonania Spark: driver, executorzy, leniwe wyliczanie i strategie partycjonowania
  • Przekształcanie pętli i kursorów na wektorowane operacje DataFrame
  • Modularyzacja, funkcje UDF/pandas UDF, widżety i ponownie używalne biblioteki

Dzień 4 Laboratorium — Refaktoryzacja skryptów proceduralnych

  • Refaktoryzacja proceduralnego skryptu ETL w modularne notebooki PySpark
  • Wprowadzenie parametryzacji, testów w stylu unit i ponownie używalnych funkcji
  • Przegląd kodu i stosowanie listy kontroli dobrych praktyk

Dzień 5 — Koordynacja, pipeline end-to-end i dobre praktyki

  • Databricks Workflows: projektowanie zadań, zależności, wyzwalacze i obsługa błędów
  • Projektowanie inkrementalnych pipeline'ów Medallion z regułami jakości i walidacją schematu
  • Integracja z Git (GitHub/Azure DevOps), CI i strategie testowania logiki PySpark

Dzień 5 Laboratorium — Budowa kompletnego pipeline'a end-to-end

  • Skomponowanie pipeline'u Brąz→Srebro→Złoto koordynowanego przez Workflows
  • Implementacja logowania, audytu, ponowień (retries) i automatycznych walidacji
  • Uruchomienie pełnego pipeline'a, weryfikacja wyjść i przygotowanie notatek wdrożeniowych

Operacjonalizacja, zarządzanie i gotowość produkcyjna

  • Zarządzanie Unity Catalog, genealogia danych i najlepsze praktyki kontroli dostępu
  • Koszty, rozmiar klastra, autoskalowanie i wzorce współbieżności zadań
  • Listy kontroli wdrożenia, strategie wycofania (rollback) i tworzenie runbooków

Ostateczna przegląd, transfer wiedzy i kolejne kroki

  • Prezentacje uczestników dotyczących prac migracyjnych i wniosków z doświadczeń
  • Analiza luk, zalecane kolejne działania i przekazanie materiałów szkoleniowych
  • Referencje, ścieżki dalszego rozwoju i opcje wsparcia

Wymagania

  • Znajomość pojęć związanych z inżynierią danych
  • Doświadczenie w zakresie SQL i procedur przechowywanych (Synapse / SQL Server)
  • Znajomość pojęć dotyczących koordynacji ETL (ADF lub podobne)

Grupa docelowa

  • Menedżerowie technologii z doświadczeniem w inżynierii danych
  • Inżynierowie danych przechodzący od proceduralnej logiki OLAP do wzorców Lakehouse
  • Inżynierowie platformy odpowiedzialni za wdrażanie Databricks
 35 godzin

Liczba uczestników


Cena za uczestnika (netto)

Propozycje terminów

Powiązane Kategorie