Ten trzudniowy, praktyczny kurs koncentruje się na budowaniu i optymalizacji wydajnych obciążeń przetwarzania danych przy użyciu PySpark, Pandas oraz Polars w środowiskach opartych na Kubernetesie.
Uczestnicy zdobędą praktyczną wiedzę na temat tego, jak aplikacje Spark są wykonywane w Kubernetesie oraz jak decyzje dotyczące konfiguracji na poziomie aplikacji wpływają na wydajność, skalowalność, zużycie zasobów i koszty. Kurs obejmuje kluczowe obszary optymalizacji, takie jak rozmiar executorów, alokacja pamięci, dynamiczna alokacja, strategie partycjonowania, zachowanie shuffle, problem małych plików oraz wydajne przetwarzanie formatu Parquet.
Kurs porusza również typowe wyzwania związane z pracą w Pandasie, w tym ograniczenia pamięci i błędy przekroczenia pamięci (out-of-memory), wprowadzając Polarsa jako wysokowydajną alternatywę dla wybranych zadań przetwarzania danych. Dzięki ćwiczeniom praktycznym uczestnicy nauczą się diagnozować problemy z wydajnością i pamięcią, porównywać różne strategie konfiguracyjne oraz stosować techniki optymalizacji w realistycznych scenariuszach ETL i uczenia maszynowego.
Przez cały kurs kładziemy nacisk na praktyczne podejmowanie decyzji: rozumienie sposobów identyfikowania wąskich gardeł, wybierania odpowiednich narzędzi, efektywnej konfiguracji Sparka oraz utrzymywania równowagi między wydajnością a zużyciem zasobów infrastruktury i kosztami.
Więcej...