Plan Szkolenia
Podstawy platformy Databricks i architektury Lakehouse
- Architektura i komponenty Databricks Lakehouse.
- Organizacja przestrzeni roboczych i katalogów.
Przestrzeń robocza Databricks i notatniki
- Nawigowanie po przestrzeni roboczej oraz tworzenie aplikacji w oparciu o notatniki.
- Strukturyzacja kodu w celu utworzenia wielokrotnego użytku notatników.
Architektura i wykonanie Apache Spark
- Architektura środowiska wykonawczego Spark oraz model wykonania.
- Ocena leniwa (lazy evaluation) oraz DAG zadania (Job DAG).
DataFrame w PySpark i API DataFrame
- Abstrakcje DataFrame oraz schematy.
- Podstawowe operacje DataFrame oraz wyrażenia kolumnowe.
Tłumaczenie SQL na DataFrame w PySpark
- Tłumaczenie podstawowych klauzul SQL na operacje DataFrame.
- Funkcje okienkowe (window functions) oraz agregacje w PySpark.
Czytanie i zapisywanie danych w Databricks
- Odczyt z powszechnie używanych formatów plików i źródeł bazodanowych.
- Zapisywanie i partycjonowanie danych w architekturze Lakehouse.
Delta Lake i zarządzanie tabelami
- Tabele Delta oraz transakcje ACID.
- Funkcja time travel (nawigacja w czasie) oraz ewolucja schematu.
Wzorce czyszczenia i transformacji danych
- Czyszczenie danych oraz konwersja typów.
- Tworzenie wielokrotnego użytku logiki transformacyjnej.
Funkcje definiowane przez użytkownika (UDF) i kod modularny
- Python UDF oraz pandas UDF.
- Modularyzacja proceduralnej logiki w funkcje.
Optymalizacja wydajności i tuningowanie
- Strategie partycjonowania oraz buforowania (caching).
- Rozpoznawanie wąskich gardeł za pomocą interfejsu Spark UI.
Podstawy Structured Streaming
- Modele przetwarzania wsadowego versus strumieniowego.
- DataFrame strumieniowe oraz podstawowe agregacje.
Zadania Databricks i koordynacja przepływu pracy
- Planowanie notatników jako zadań i etapów procesu.
- Tworzenie wieloetapowych przepływów pracy z zależnościami.
Unity Catalog i zarządzanie danymi (Data Governance)
- Architektura Unity Catalog oraz przestrzenie nazw.
- Kontrola dostępu i śledzenie pochodzenia danych (lineage).
Testowanie, debugowanie i praktyki produkcyjne
- Testy jednostkowe logiki PySpark.
- Debugowanie oraz standardy jakości kodu.
Kompleksowe przypadki użycia w sektorze finansowym
- Budowanie kompleksowego potoku ETL dla sektora bankowego.
- Tłumaczenie tradycyjnych procesów SQL na PySpark.
Migracja obciążeń SQL na PySpark
- Strategie migracji oraz wzorce planowania.
- Częściowa konwersja przepływów pracy SQL na PySpark.
Wymagania
- Doświadczenie w programowaniu w Pythonie, obejmujące funkcje i typy danych.
- Zrozumienie SQL, łącznie z joins (połączeniami), agregacjami i podzapytaniami.
- Nie jest wymagane wcześniejsze doświadczenie z Databricks ani PySpark.
Grupa docelowa
- Inżynierowie danych, analitycy danych oraz profesjonalisty działające w obszarze danych.
- Zespoły migrujące istniejące przepływy pracy oparte na SQL do środowisk Databricks i PySpark.
Opinie uczestników (1)
ankieta przed szkoleniem i zastosowanie jej wynikow.