Dziękujemy za wysłanie zapytania! Jeden z członków naszego zespołu skontaktuje się z Państwem wkrótce.
Dziękujemy za wysłanie rezerwacji! Jeden z członków naszego zespołu skontaktuje się z Państwem wkrótce.
Czas trwania 35 godzin
Plan Szkolenia
Wprowadzenie, cele i strategia migracji
- Cele kursu, dopasowanie profilu uczestników i kryteria sukcesu
- Ogólne podejścia do migracji i rozważania dotyczące ryzyka
- Konfiguracja obszarów roboczych, repozytoriów i zestawów danych laboratoryjnych
Dzień 1 — Podstawy migracji i architektura
- Koncepcje Lakehouse, przegląd Delta Lake i architektura Databricks
- Różnice między SMP a MPP oraz ich implikacje dla migracji
- Projekt Medallion (Brąz→Srebro→Złoto) i przegląd Unity Catalog
Laboratorium dnia 1 — Tłumaczenie procedury składowanej
- Praktyczna migracja przykładowej procedury składowanej do notebooka
- Mapowanie tabel tymczasowych i kursorów na transformacje DataFrame
- Walidacja i porównanie z oryginalnym wyjściem
Dzień 2 — Zaawansowany Delta Lake i ładowanie przyrostowe
- Transakcje ACID, dzienniki commitów, wersjonowanie i podróże w czasie
- Auto Loader, wzorce MERGE INTO, upserty i ewolucja schematu
- OPTIMIZE, VACUUM, Z-ORDER, partycjonowanie i strojenie magazynowania
Laboratorium dnia 2 — Przyrostowe ładowanie i optymalizacja
- Implementacja ładowania Auto Loader i przepływów MERGE
- Stosowanie OPTIMIZE, Z-ORDER i VACUUM; walidacja wyników
- Pomiar poprawy wydajności odczytu/zapisu
Dzień 3 — SQL w Databricks, wydajność i debugowanie
- Analityczne funkcje SQL: funkcje okienne, funkcje wyższego rzędu, obsługa JSON/tablic
- Czytanie Spark UI, DAG-ów, przetasowań, etapów, zadań i diagnozowanie wąskich gardeł
- Wzorce strojenia zapytań: złączenia broadcast, podpowiedzi, buforowanie i redukcja rozlewania
Laboratorium dnia 3 — Refaktoryzacja SQL i strojenie wydajności
- Refaktoryzacja ciężkiego procesu SQL na zoptymalizowany Spark SQL
- Wykorzystanie śladów Spark UI do identyfikacji i naprawy problemów z nierównomiernym rozkładem i przetasowaniami
- Porównanie wydajności przed/po i dokumentacja kroków strojenia
Dzień 4 — Taktyczny PySpark: zastępowanie logiki proceduralnej
- Model wykonania Spark: sterownik, executories, leniwa ewaluacja i strategie partycjonowania
- Przekształcanie pętli i kursorów na zwektoryzowane operacje DataFrame
- Modularyzacja, UDF/pandas UDF, widżety i biblioteki wielokrotnego użytku
Laboratorium dnia 4 — Refaktoryzacja skryptów proceduralnych
- Refaktoryzacja proceduralnego skryptu ETL na modułowe notebooki PySpark
- Wprowadzenie parametryzacji, testów jednostkowych i funkcji wielokrotnego użytku
- Przegląd kodu i zastosowanie listy kontrolnej najlepszych praktyk
Dzień 5 — Orkiestracja, kompleksowy potok danych i najlepsze praktyki
- Databricks Workflows: projektowanie zadań, zależności między zadaniami, wyzwalacze i obsługa błędów
- Projektowanie przyrostowych potoków Medallion z regułami jakości i walidacją schematu
- Integracja z Git (GitHub/Azure DevOps), CI i strategie testowania logiki PySpark
Laboratorium dnia 5 — Budowa kompletnego potoku end-to-end
- Złożenie potoku Brąz→Srebro→Złoto zorkiestrowanego za pomocą Workflows
- Implementacja logowania, audytowania, ponownych prób i automatycznych walidacji
- Uruchomienie pełnego potoku, walidacja wyników i przygotowanie notatek wdrożeniowych
Operacjonalizacja, zarządzanie i gotowość produkcyjna
- Zarządzanie Unity Catalog, pochodzenie danych i najlepsze praktyki kontroli dostępu
- Koszty, dobór wielkości klastra, autoskalowanie i wzorce współbieżności zadań
- Listy kontrolne wdrożeń, strategie wycofywania i tworzenie runbooków
Przegląd końcowy, transfer wiedzy i kolejne kroki
- Prezentacje uczestników dotyczące prac migracyjnych i wyciągniętych wniosków
- Analiza luk, zalecane działania uzupełniające i przekazanie materiałów szkoleniowych
- Odnośniki, dalsze ścieżki nauki i opcje wsparcia
Wymagania
- Zrozumienie koncepcji inżynierii danych
- Doświadczenie z SQL i procedurami składowanymi (Synapse / SQL Server)
- Znajomość koncepcji orkiestracji ETL (ADF lub podobne)
Grupa docelowa
- Menedżerowie technologiczni z doświadczeniem w inżynierii danych
- Inżynierowie danych przenoszący proceduralną logikę OLAP do wzorców Lakehouse
- Inżynierowie platform odpowiedzialni za wdrażanie Databricks