Bądźmy w kontakcie

Plan Szkolenia

Podstawy platformy Databricks i architektury Lakehouse

  • Architektura i komponenty Databricks Lakehouse.
  • Organizacja przestrzeni roboczych i katalogów.

Przestrzeń robocza Databricks i notatniki

  • Nawigowanie po przestrzeni roboczej oraz tworzenie aplikacji w oparciu o notatniki.
  • Strukturyzacja kodu w celu utworzenia wielokrotnego użytku notatników.

Architektura i wykonanie Apache Spark

  • Architektura środowiska wykonawczego Spark oraz model wykonania.
  • Ocena leniwa (lazy evaluation) oraz DAG zadania (Job DAG).

DataFrame w PySpark i API DataFrame

  • Abstrakcje DataFrame oraz schematy.
  • Podstawowe operacje DataFrame oraz wyrażenia kolumnowe.

Tłumaczenie SQL na DataFrame w PySpark

  • Tłumaczenie podstawowych klauzul SQL na operacje DataFrame.
  • Funkcje okienkowe (window functions) oraz agregacje w PySpark.

Czytanie i zapisywanie danych w Databricks

  • Odczyt z powszechnie używanych formatów plików i źródeł bazodanowych.
  • Zapisywanie i partycjonowanie danych w architekturze Lakehouse.

Delta Lake i zarządzanie tabelami

  • Tabele Delta oraz transakcje ACID.
  • Funkcja time travel (nawigacja w czasie) oraz ewolucja schematu.

Wzorce czyszczenia i transformacji danych

  • Czyszczenie danych oraz konwersja typów.
  • Tworzenie wielokrotnego użytku logiki transformacyjnej.

Funkcje definiowane przez użytkownika (UDF) i kod modularny

  • Python UDF oraz pandas UDF.
  • Modularyzacja proceduralnej logiki w funkcje.

Optymalizacja wydajności i tuningowanie

  • Strategie partycjonowania oraz buforowania (caching).
  • Rozpoznawanie wąskich gardeł za pomocą interfejsu Spark UI.

Podstawy Structured Streaming

  • Modele przetwarzania wsadowego versus strumieniowego.
  • DataFrame strumieniowe oraz podstawowe agregacje.

Zadania Databricks i koordynacja przepływu pracy

  • Planowanie notatników jako zadań i etapów procesu.
  • Tworzenie wieloetapowych przepływów pracy z zależnościami.

Unity Catalog i zarządzanie danymi (Data Governance)

  • Architektura Unity Catalog oraz przestrzenie nazw.
  • Kontrola dostępu i śledzenie pochodzenia danych (lineage).

Testowanie, debugowanie i praktyki produkcyjne

  • Testy jednostkowe logiki PySpark.
  • Debugowanie oraz standardy jakości kodu.

Kompleksowe przypadki użycia w sektorze finansowym

  • Budowanie kompleksowego potoku ETL dla sektora bankowego.
  • Tłumaczenie tradycyjnych procesów SQL na PySpark.

Migracja obciążeń SQL na PySpark

  • Strategie migracji oraz wzorce planowania.
  • Częściowa konwersja przepływów pracy SQL na PySpark.

Wymagania

  • Doświadczenie w programowaniu w Pythonie, obejmujące funkcje i typy danych.
  • Zrozumienie SQL, łącznie z joins (połączeniami), agregacjami i podzapytaniami.
  • Nie jest wymagane wcześniejsze doświadczenie z Databricks ani PySpark.

Grupa docelowa

  • Inżynierowie danych, analitycy danych oraz profesjonalisty działające w obszarze danych.
  • Zespoły migrujące istniejące przepływy pracy oparte na SQL do środowisk Databricks i PySpark.
 35 godzin

Liczba uczestników


Cena za uczestnika (netto)

Opinie uczestników (1)

Propozycje terminów

Powiązane Kategorie