Bądźmy w kontakcie
 Czas trwania 35 godzin

Plan Szkolenia

Wprowadzenie, cele i strategia migracji

  • Cele kursu, dopasowanie profilu uczestników i kryteria sukcesu
  • Ogólne podejścia do migracji i rozważania dotyczące ryzyka
  • Konfiguracja obszarów roboczych, repozytoriów i zestawów danych laboratoryjnych

Dzień 1 — Podstawy migracji i architektura

  • Koncepcje Lakehouse, przegląd Delta Lake i architektura Databricks
  • Różnice między SMP a MPP oraz ich implikacje dla migracji
  • Projekt Medallion (Brąz→Srebro→Złoto) i przegląd Unity Catalog

Laboratorium dnia 1 — Tłumaczenie procedury składowanej

  • Praktyczna migracja przykładowej procedury składowanej do notebooka
  • Mapowanie tabel tymczasowych i kursorów na transformacje DataFrame
  • Walidacja i porównanie z oryginalnym wyjściem

Dzień 2 — Zaawansowany Delta Lake i ładowanie przyrostowe

  • Transakcje ACID, dzienniki commitów, wersjonowanie i podróże w czasie
  • Auto Loader, wzorce MERGE INTO, upserty i ewolucja schematu
  • OPTIMIZE, VACUUM, Z-ORDER, partycjonowanie i strojenie magazynowania

Laboratorium dnia 2 — Przyrostowe ładowanie i optymalizacja

  • Implementacja ładowania Auto Loader i przepływów MERGE
  • Stosowanie OPTIMIZE, Z-ORDER i VACUUM; walidacja wyników
  • Pomiar poprawy wydajności odczytu/zapisu

Dzień 3 — SQL w Databricks, wydajność i debugowanie

  • Analityczne funkcje SQL: funkcje okienne, funkcje wyższego rzędu, obsługa JSON/tablic
  • Czytanie Spark UI, DAG-ów, przetasowań, etapów, zadań i diagnozowanie wąskich gardeł
  • Wzorce strojenia zapytań: złączenia broadcast, podpowiedzi, buforowanie i redukcja rozlewania

Laboratorium dnia 3 — Refaktoryzacja SQL i strojenie wydajności

  • Refaktoryzacja ciężkiego procesu SQL na zoptymalizowany Spark SQL
  • Wykorzystanie śladów Spark UI do identyfikacji i naprawy problemów z nierównomiernym rozkładem i przetasowaniami
  • Porównanie wydajności przed/po i dokumentacja kroków strojenia

Dzień 4 — Taktyczny PySpark: zastępowanie logiki proceduralnej

  • Model wykonania Spark: sterownik, executories, leniwa ewaluacja i strategie partycjonowania
  • Przekształcanie pętli i kursorów na zwektoryzowane operacje DataFrame
  • Modularyzacja, UDF/pandas UDF, widżety i biblioteki wielokrotnego użytku

Laboratorium dnia 4 — Refaktoryzacja skryptów proceduralnych

  • Refaktoryzacja proceduralnego skryptu ETL na modułowe notebooki PySpark
  • Wprowadzenie parametryzacji, testów jednostkowych i funkcji wielokrotnego użytku
  • Przegląd kodu i zastosowanie listy kontrolnej najlepszych praktyk

Dzień 5 — Orkiestracja, kompleksowy potok danych i najlepsze praktyki

  • Databricks Workflows: projektowanie zadań, zależności między zadaniami, wyzwalacze i obsługa błędów
  • Projektowanie przyrostowych potoków Medallion z regułami jakości i walidacją schematu
  • Integracja z Git (GitHub/Azure DevOps), CI i strategie testowania logiki PySpark

Laboratorium dnia 5 — Budowa kompletnego potoku end-to-end

  • Złożenie potoku Brąz→Srebro→Złoto zorkiestrowanego za pomocą Workflows
  • Implementacja logowania, audytowania, ponownych prób i automatycznych walidacji
  • Uruchomienie pełnego potoku, walidacja wyników i przygotowanie notatek wdrożeniowych

Operacjonalizacja, zarządzanie i gotowość produkcyjna

  • Zarządzanie Unity Catalog, pochodzenie danych i najlepsze praktyki kontroli dostępu
  • Koszty, dobór wielkości klastra, autoskalowanie i wzorce współbieżności zadań
  • Listy kontrolne wdrożeń, strategie wycofywania i tworzenie runbooków

Przegląd końcowy, transfer wiedzy i kolejne kroki

  • Prezentacje uczestników dotyczące prac migracyjnych i wyciągniętych wniosków
  • Analiza luk, zalecane działania uzupełniające i przekazanie materiałów szkoleniowych
  • Odnośniki, dalsze ścieżki nauki i opcje wsparcia

Wymagania

  • Zrozumienie koncepcji inżynierii danych
  • Doświadczenie z SQL i procedurami składowanymi (Synapse / SQL Server)
  • Znajomość koncepcji orkiestracji ETL (ADF lub podobne)

Grupa docelowa

  • Menedżerowie technologiczni z doświadczeniem w inżynierii danych
  • Inżynierowie danych przenoszący proceduralną logikę OLAP do wzorców Lakehouse
  • Inżynierowie platform odpowiedzialni za wdrażanie Databricks

Liczba uczestników


Cena za uczestnika (netto)

Propozycje terminów

Powiązane Kategorie