Pobierz kartę szkolenia

Databricks Data Transformation

kod szkolenia: DBX-PFE / PL DL 1d

Szkolenie Databricks Data Transformation zamyka ścieżkę Fundamental → Explorer → Lakehouse → Transformation i koncentruje się na praktycznym projektowaniu produkcyjnych przepływów przetwarzania danych w architekturze Lakehouse. Uczestnicy uczą się tworzyć modularne pipeline’y, łączyć przetwarzanie batch i streaming, stosować zaawansowane transformacje w PySpark oraz automatyzować procesy z wykorzystaniem Delta Live Tables. Kurs pokazuje także, jak integrować przepływy z Git i CI/CD, kontrolować jakość danych oraz monitorować lineage w środowisku Databricks.

Termin
tryb Distance Learning

poziom Zaawansowany

czas trwania 1 dzień |  7h|  29.09
2 000,00 PLN + 23% VAT (2 460,00 PLN brutto)
Poprzednia najniższa cena:
2 000,00PLN
tryb Distance Learning

poziom Zaawansowany

czas trwania 1 dzień |  7h|  09.11
2 000,00 PLN + 23% VAT (2 460,00 PLN brutto)
Poprzednia najniższa cena:
2 000,00PLN
2 000,00 PLN 2 460,00 PLN brutto

Szkolenie jest przeznaczone dla inżynierów danych oraz zespołów DataOps odpowiedzialnych za projektowanie, wdrażanie i utrzymanie produkcyjnych procesów przetwarzania danych w architekturze Lakehouse. Szczególnie sprawdzi się u osób, które chcą rozwijać praktyczne umiejętności budowania pipeline’ów danych w Databricks oraz integrowania ich z narzędziami wspierającymi jakość, automatyzację i ciągłość dostarczania.

Szkolenie rekomendowane jest dla:

• inżynierów danych,

• specjalistów DataOps,

• osób projektujących i utrzymujących pipeline’y danych w Databricks,

• zespołów odpowiedzialnych za produkcyjne procesy przetwarzania danych,

• specjalistów pracujących z architekturą Lakehouse.

1. Projektowanie pipeline’ów danych – poznasz, jak tworzyć modularne przepływy Silver → Gold w architekturze Lakehouse.

2. Łączenie batch i streaming – nauczysz się, jak integrować przetwarzanie wsadowe i strumieniowe w jednym spójnym przepływie danych.

3. Zaawansowane transformacje w PySpark – poznasz, jak wykorzystywać funkcje okienkowe do przekształcania i analizowania danych.

4. Automatyzacja pipeline’ów – nauczysz się, jak korzystać z Delta Live Tables do budowania i utrzymywania zautomatyzowanych procesów danych.

5. Orkiestracja i CI/CD w Databricks – dowiesz się, jak stosować dobre praktyki wdrażania, wersjonowania i utrzymania przepływów danych.

6. Kontrola jakości i lineage danych – poznasz, jak wykorzystywać expectations oraz mechanizmy monitorowania lineage do zwiększania niezawodności procesów danych.

 

1.Architektura przetwarzania danych

  • Przypomnienie koncepcji Bronze–Silver–Gold w kontekście pipeline’ów transformacyjnych

  • Projektowanie przepływów danych w warstwach Silver i Gold

  • Modularność i separacja logiki przetwarzania (load → transform → save)

2.Batch i Stream Load w praktyce

  • Różnice między przetwarzaniem wsadowym a strumieniowym

  • Batch ingest przy użyciu COPY INTO i zapis do tabel Delta

  • Strumieniowy ingest z Auto Loader (cloudFiles)

  • Structured Streaming: readStream, writeStream, checkpointing i fault tolerance

  • Integracja batch i stream

3.Zaawansowane transformacje danych

  • Tworzenie cech numerycznych, tekstowych i binarnych

  • Transformacje logiczne (case when, when, otherwise)

  • Funkcje okienkowe (lag, lead, row_number, rolling average)

  • Tworzenie cech czasowych i sesyjnych

4.Delta Live Tables – automatyzacja pipeline’ów

  • Deklaratywne podejście do przetwarzania: CREATE LIVE TABLE

  • Tworzenie DAG-ów i ustalanie harmonogramów w DLT

  • Integracja DLT z Auto Loader i Structured Streaming

  • Expectations – kontrola jakości danych w czasie rzeczywistym

  • Monitoring i lineage danych w interfejsie DLT

5.Orkiestracja i automatyzacja

  • Workflows w Databricks – multi-task joby, zależności, retry

  • Parametryzacja pipeline’ów (dbutils.widgets, dbutils.notebook.run)

  • Dobre praktyki CI/CD i utrzymania kodu (Repos, wersjonowanie notebooków)

6.CI/CD – praktyczny demo z Git (Repos)

  • Klonowanie repozytorium w Databricks Repos

  • Commit i push notebooka do Gita

  • Uruchomienie pipeline’u z Workflows w oparciu o repo

  • Best practices DevOps dla Databricks

7.Projekt końcowy

  • Zaprojektowanie i uruchomienie pipeline’u Silver → Gold z wykorzystaniem batch i stream load, Delta Live Tables, reguł kontroli jakości i integracji z Git

– Ukończone szkolenie Databricks Lakehouse lub równoważna wiedza

– Znajomość SQL i PySpark

– Podstawowe doświadczenie w implementacji pipeline’ów danych

Dla zwiększenia komfortu pracy oraz efektywności szkolenia zalecamy skorzystanie z dodatkowego ekranu. Brak dodatkowego ekranu nie jest przeciwwskazaniem do udziału w szkoleniu, ale w znaczący sposób wpływa na komfort pracy podczas zajęć
Informacje oraz wymagania dotyczące uczestniczenia w szkoleniach w formule zdalnej dostępne na: https://www.altkomakademia.pl/jak-dzialamy/o-szkoleniach/?distance-learning

* dostęp do portalu słuchacza Altkom Akademii

Szkolenie prowadzone jest w środowisku Databricks w chmurze. Każdy uczestnik otrzymuje własny workspace z dostępem do Unity Catalog, SQL Editor, Notebooków oraz katalogu z danymi testowymi.

Uwaga:W trakcie wybranych szkoleń Akademia zapewnia Uczestnikom dostęp do płatnych narzędzi i usług niezbędnych do realizacji programu szkolenia (w szczególności usług Azure, Fabric oraz innych zasobów chmurowych). Uczestnik zobowiązany jest do korzystania z udostępnionych zasobów wyłącznie w zakresie wynikającym z agendy szkolenia oraz zgodnie z poleceniami trenera. Wykorzystywanie tych zasobów w sposób wykraczający poza zakres szkoleniowy, w szczególności do realizacji projektów prywatnych, testowania dodatkowych usług, modyfikowania konfiguracji środowiska lub podejmowania działań generujących koszty niezwiązane z realizacją ćwiczeń – skutkować będzie obciążeniem Uczestnika kosztami przekraczającymi przewidziany limit, na podstawie wydatków poniesionych przez Akademię (https://www.altkomakademia.pl/ogolne-warunki-uczestnictwa-w-szkoleniach/)

Wykład: polski
Materiały: angielski

Szkolenie nie zawiera formalnego egzaminu. Zaleca się jednak podejście do egzaminu Databricks Certified Data Engineer Associate jako kolejny krok rozwojowy.

Szkolenie nie zawiera formalnego egzaminu. Zaleca się jednak podejście do egzaminu Databricks Certified Data Engineer Associate jako kolejny krok rozwojowy.