Databricks Lakehouse Architecture
kod szkolenia: DBX-LKH / PL DL 1d
Szkolenie Databricks Lakehouse Architecture to trzeci etap ścieżki Fundamental → Explorer → Lakehouse → Transformation. Kurs pokazuje, jak projektować i wdrażać architekturę Lakehouse w środowisku Databricks, wykorzystując Delta Lake, Auto Loader oraz Structured Streaming. Uczestnicy poznają zasady pracy z architekturą Medallion, techniki ładowania i aktualizowania danych, podstawy governance w Unity Catalog oraz praktyczne podejście do optymalizacji, monitorowania i zarządzania kosztami procesów danych.
Szkolenie jest przeznaczone dla inżynierów danych oraz zespołów DataOps, które chcą poznać zasady projektowania, wdrażania i utrzymania architektury Lakehouse w środowisku Databricks. Szczególnie sprawdzi się u osób odpowiedzialnych za budowę procesów przetwarzania danych, optymalizację tabel Delta, zarządzanie przepływami batch i streaming oraz podstawy governance danych.
Szkolenie rekomendowane jest dla:
• inżynierów danych,
• specjalistów DataOps,
• osób projektujących i utrzymujących procesy przetwarzania danych w Databricks,
• zespołów pracujących z architekturą Lakehouse,
• specjalistów odpowiedzialnych za optymalizację, monitorowanie i jakość przepływów danych.
1. Architektura Lakehouse – poznasz, jak działa koncepcja Lakehouse oraz jak wykorzystywać architekturę Medallion do porządkowania przepływów danych.
2. Praca z Delta Lake – nauczysz się, jak tworzyć, ładować i aktualizować dane w tabelach Delta.
3. Ładowanie danych w Databricks – poznasz, jak wykorzystywać batch load, streaming load, Auto Loader oraz Structured Streaming w procesach przetwarzania danych.
4. Optymalizacja tabel Delta – nauczysz się, jak monitorować i usprawniać działanie tabel Delta w środowisku Databricks.
5. Governance i lineage danych – dowiesz się, jak wykorzystywać Unity Catalog do zarządzania zasadami governance oraz śledzenia pochodzenia danych.
6. Kontrola jakości i efektywność procesów – poznasz, jak łączyć transformacje, optymalizację i kontrolę jakości w praktycznym przepływie danych.
7. Przygotowanie do dalszej pracy z Databricks – dowiesz się, jak wykorzystać zdobytą wiedzę jako fundament do kolejnego etapu ścieżki, czyli szkolenia Databricks Data Transformation.
1.Wprowadzenie do architektury Lakehouse
• Koncepcja Lakehouse – połączenie Data Lake i Data Warehouse
• Struktura Medallion Architecture (Bronze, Silver, Gold)
• Rola Delta Lake i Unity Catalog w zarządzaniu danymi
• Projektowanie logiki przepływu danych między warstwami
2.Delta Lake w praktyce
• Operacje ACID i schema enforcement
• MERGE, UPDATE, DELETE i INSERT – modyfikacje tabel Delta
• Time travel i historia zmian (DESCRIBE HISTORY)
• Tworzenie tabel managed i external w Unity Catalog
3.Ingest danych – batch i stream
• COPY INTO jako metoda wsadowego ładowania danych
• Auto Loader (cloudFiles) – incremental ingest i schema evolution
• Monitoring strumieni w nowym interfejsie Streaming UI
4.Optymalizacja i zarządzanie danymi
• OPTIMIZE, ZORDER i VACUUM – mechanizmy optymalizacji Delta Lake
• Partitioning i analiza planów zapytań
• Liquid Clustering – automatyczne klastrowanie danych
• Delta Sharing – współdzielenie danych między zespołami i środowiskami
5.Cost management (practical)
• Koszty batch vs streaming (Auto Loader, Structured Streaming)
• Wpływ OPTIMIZE, ZORDER i VACUUM na koszty
• Planowanie zasobów dla dużych tabel i pipeline’ów
• Architektura kosztów w modelu Bronze–Silver–Gold
6.Observability & Monitoring (light)
• Monitoring w Streaming UI i Metrics UI
• Alerty w Workflows i SQL dashboardy
• Best practices obserwowalności w Lakehouse
7.Security fundamentals (light)
• Row-level security i column masking – podstawy
• Token passthrough – świadomość i scenariusze
• Unity Catalog jako warstwa governance
8.Projekt końcowy
• Zaprojektowanie i wdrożenie mini-Lakehouse z danymi ładowanymi batch i stream, optymalizacją Delta, kontrolą jakości, monitoringiem i kosztami
– Ukończone szkolenie Databricks Explorer lub równoważna wiedza
– Doświadczenie w pracy z SQL i podstawami PySpark
– Znajomość podstawowych koncepcji chmury i architektury danych
Dla zwiększenia komfortu pracy oraz efektywności szkolenia zalecamy skorzystanie z dodatkowego ekranu. Brak dodatkowego ekranu nie jest przeciwwskazaniem do udziału w szkoleniu, ale w znaczący sposób wpływa na komfort pracy podczas zajęć
Informacje oraz wymagania dotyczące uczestniczenia w szkoleniach w formule zdalnej dostępne na: https://www.altkomakademia.pl/jak-dzialamy/o-szkoleniach/?distance-learning
* dostęp do portalu słuchacza Altkom Akademii
Szkolenie prowadzone jest w środowisku Databricks w chmurze. Każdy uczestnik otrzymuje własny workspace z dostępem do Unity Catalog, SQL Editor, Notebooków oraz katalogu z danymi testowymi.
Uwaga:W trakcie wybranych szkoleń Akademia zapewnia Uczestnikom dostęp do płatnych narzędzi i usług niezbędnych do realizacji programu szkolenia (w szczególności usług Azure, Fabric oraz innych zasobów chmurowych). Uczestnik zobowiązany jest do korzystania z udostępnionych zasobów wyłącznie w zakresie wynikającym z agendy szkolenia oraz zgodnie z poleceniami trenera. Wykorzystywanie tych zasobów w sposób wykraczający poza zakres szkoleniowy, w szczególności do realizacji projektów prywatnych, testowania dodatkowych usług, modyfikowania konfiguracji środowiska lub podejmowania działań generujących koszty niezwiązane z realizacją ćwiczeń – skutkować będzie obciążeniem Uczestnika kosztami przekraczającymi przewidziany limit, na podstawie wydatków poniesionych przez Akademię (https://www.altkomakademia.pl/ogolne-warunki-uczestnictwa-w-szkoleniach/)
Wykład: polski
Materiały: angielski
Szkolenie nie zawiera formalnego egzaminu. Zaleca się jednak podejście do egzaminu Databricks Certified Data Engineer Associate jako kolejny krok rozwojowy.
Szkolenie nie zawiera formalnego egzaminu. Zaleca się jednak podejście do egzaminu Databricks Certified Data Engineer Associate jako kolejny krok rozwojowy.

