Kontakt aufnehmen

Schulungsübersicht

Einführung, Ziele und Migrationsstrategie

  • Kursziele, Ausrichtung des Teilnehmerprofils und Erfolgskriterien
  • Übersicht über Migrationsansätze und Risikobewertung
  • Einrichtung von Workspaces, Repositories und Lab-Datensätzen

Tag 1 — Migrationsgrundlagen und Architektur

  • Lakehouse-Konzepte, Delta Lake-Überblick und Databricks-Architektur
  • Unterschiede zwischen SMP und MPP sowie deren Auswirkungen auf die Migration
  • Medallion-Design (Bronze→Silber→Gold) und Unity Catalog-Überblick

Tag 1 Lab — Übersetzung einer gespeicherten Prozedur

  • Praktische Migration einer Beispiel-gepeicherten Prozedur in ein Notebook
  • Abbildung von Temp-Tabellen und Cursoren auf DataFrame-Transformationen
  • Validierung und Vergleich mit der ursprünglichen Ausgabe

Tag 2 — Erweitertes Delta Lake & Inkrementelles Laden

  • ACID-Transaktionen, Commit-Logs, Versionierung und Time Travel
  • Auto Loader, MERGE INTO-Muster, Upserts und Schema-Evolution
  • OPTIMIZE, VACUUM, Z-ORDER, Partitionierung und Speicher-Tuning

Tag 2 Lab — Inkrementelle Ingestion & Optimierung

  • Implementierung der Auto Loader-Ingestion und MERGE-Workflows
  • Anwendung von OPTIMIZE, Z-ORDER und VACUUM; Validierung der Ergebnisse
  • Messung der Verbesserungen in der Lese-/Schreib-Performance

Tag 3 — SQL in Databricks, Performance & Debugging

  • Analytische SQL-Funktionen: Fensterfunktionen, Higher-Order-Funktionen, JSON-/Array-Verarbeitung
  • Lesen der Spark UI, DAGs, Shuffles, Stages, Tasks und Diagnose von Engpässen
  • Query-Tuning-Muster: Broadcast Joins, Hints, Caching und Spill-Reduktion

Tag 3 Lab — SQL-Refactoring & Performance-Tuning

  • Refactoring eines schwerfälligen SQL-Prozesses in optimiertes Spark SQL
  • Verwendung von Spark-UI-Traces zur Identifizierung und Behebung von Skew- und Shuffle-Problemen
  • Vergleich vor/nachher und Dokumentation der Tuning-Schritte

Tag 4 — Taktisches PySpark: Ersetzung prozeduraler Logik

  • Spark-Ausführungsmodell: Driver, Executors, lazy evaluation und Partitionierungsstrategien
  • Transformation von Schleifen und Cursoren in vektorisierte DataFrame-Operationen
  • Modularisierung, UDFs/pandas UDFs, Widgets und wiederverwendbare Bibliotheken

Tag 4 Lab — Refactoring prozeduraler Skripte

  • Refactoring eines prozeduralen ETL-Skripts in modulare PySpark-Notebooks
  • Einführung von Parametrisierung, Unit-Tests und wiederverwendbaren Funktionen
  • Code-Review und Anwendung einer Best-Practice-Checkliste

Tag 5 — Orchestrierung, End-to-End-Pipeline & Best Practices

  • Databricks Workflows: Job-Design, Task-Abhängigkeiten, Trigger und Fehlerbehandlung
  • Design inkrementeller Medallion-Pipelines mit Qualitätsregeln und Schemavalidierung
  • Integration mit Git (GitHub/Azure DevOps), CI und Testing-Strategien für PySpark-Logik

Tag 5 Lab — Aufbau einer vollständigen End-to-End-Pipeline

  • Zusammenstellung einer Bronze→Silber→Gold-Pipeline, orchestriert mit Workflows
  • Implementierung von Logging, Auditing, Retries und automatisierten Validierungen
  • Ausführen der vollständigen Pipeline, Validierung der Ausgabedaten und Vorbereitung der Deployment-Notizen

Operationalisierung, Governance und Produktionsreife

  • Unity Catalog Governance, Stammbaum (Lineage) und Best Practices für Zugriffssteuerungen
  • Kosten, Cluster-Größen, Autoscaling und Job-Konkurrenz-Muster
  • Deployment-Checklisten, Rollback-Strategien und Erstellung von Runbooks

Abschlussprüfung, Wissenstransfer und nächste Schritte

  • Präsentationen der Teilnehmer zu Migrationsarbeiten und gewonnenen Erkenntnissen
  • Lückenalysen, empfohlene Anschlussaktivitäten und Übergabe des Schulungsmaterials
  • Referenzen, weitere Lernpfade und Support-Optionen

Voraussetzungen

  • Verständnis von Data-Engineering-Konzepten
  • Erfahrung mit SQL und gespeicherten Prozeduren (Synapse / SQL Server)
  • Vertrautheit mit ETL-Orchestrierungskonzepten (ADF oder ähnliche)

Zielgruppe

  • Technologie-Manager mit Hintergrund im Data Engineering
  • Data Engineers, die prozedurale OLAP-Logik in Lakehouse-Muster überführen
  • Plattform-Ingenieure, die für die Einführung von Databricks verantwortlich sind
 35 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Kommende Kurse

Verwandte Kategorien