Kontakt aufnehmen

Schulungsübersicht

Einführung, Ziele und Migrationsstrategie

  • Kursziele, Anpassung des Teilnehmerprofils und Erfolgskriterien
  • Übergreifende Migrationsansätze und Risikobetrachtungen
  • Einrichtung von Workspaces, Repositories und Labor-Datensätzen

Tag 1 — Grundlagen der Migration und Architektur

  • Lakehouse-Konzepte, Überblick über Delta Lake und Databricks-Architektur
  • Unterschiede zwischen SMP und MPP und deren Auswirkungen auf die Migration
  • Gestaltung des Medallion-Musters (Bronze→Silver→Gold) und Überblick über Unity Catalog

Tag 1 Labor — Übersetzen einer gespeicherten Prozedur

  • Praktische Migration einer Beispielspeicherverfahren in ein Notebook
  • Zuordnung von Temporärtabellen und Cursors zu DataFrame-Transformationen
  • Validierung und Vergleich mit dem ursprünglichen Ergebnis

Tag 2 — Erweitertes Delta Lake & Inkrementelles Laden

  • ACID-Transaktionen, Commit-Logs, Versionsverfolgung und Time Travel
  • Auto Loader, MERGE INTO-Muster, Upserts und Schema-Evolution
  • OPTIMIZE, VACUUM, Z-ORDER, Partitionierung und Speichertuning

Tag 2 Labor — Inkrementelle Aufnahme & Optimierung

  • Implementierung von Auto Loader-Aufnahme und MERGE-Workflows
  • Anwendung von OPTIMIZE, Z-ORDER und VACUUM; Validierung der Ergebnisse
  • Messung der Verbesserungen der Lese-/Schreibperformance

Tag 3 — SQL in Databricks, Performance & Fehlersuche

  • Analytische SQL-Funktionen: Window Functions, Higher-Order Functions, Behandlung von JSON/Arrays
  • Lesen der Spark UI, DAGs, Shuffles, Stages, Tasks und Diagnose von Engpässen
  • Muster für Query-Tuning: Broadcast Joins, Hints, Caching und Reduzierung von Spills

Tag 3 Labor — SQL-Refactoring & Performance-Tuning

  • Refactoring eines aufwändigen SQL-Prozesses in optimiertes Spark SQL
  • Nutzung von Spark UI-Traces zur Identifizierung und Behebung von Skew- und Shuffle-Problemen
  • Benchmarking vor/nach und Dokumentation der Tuning-Schritte

Tag 4 — Taktisches PySpark: Ersetzen von prozeduraler Logik

  • Spark-Ausführungsmodell: Driver, Executors, Lazy Evaluation und Partitionierungsstrategien
  • Transformation von Schleifen und Cursors in vektorisierte DataFrame-Operationen
  • Modularisierung, UDFs/pandas UDFs, Widgets und wiederverwendbare Bibliotheken

Tag 4 Labor — Refactoring prozeduraler Skripte

  • Refactoring eines prozeduralen ETL-Skripts in modulare PySpark-Notebooks
  • Einführung von Parametrisierung, Unit-Tests und wiederverwendbaren Funktionen
  • Code-Review und Anwendung der Best-Practice-Checkliste

Tag 5 — Orchestrierung, Ende-zu-Ende-Pipeline & Best Practices

  • Databricks Workflows: Job-Design, Task-Abhängigkeiten, Trigger und Fehlerbehandlung
  • Design inkrementeller Medallion-Pipelines mit Qualitätsregeln und Schema-Validierung
  • Integration mit Git (GitHub/Azure DevOps), CI und Teststrategien für PySpark-Logik

Tag 5 Labor — Erstellung einer vollständigen Ende-zu-Ende-Pipeline

  • Zusammensetzung der Bronze→Silver→Gold-Pipeline, orchestriert mit Workflows
  • Implementierung von Logging, Auditing, Retries und automatisierten Validierungen
  • Ausführen der gesamten Pipeline, Validieren der Ausgaben und Vorbereiten der Bereitstellungshinweise

Operationalisierung, Governance und Produktionsreife

  • Governance mit Unity Catalog, Linienverfolgung und Best Practices für Zugriffskontrollen
  • Kosten, Cluster-Größe, Autoscaling und Job-Parallelitätsmuster
  • Bereitstellungs-Checklisten, Rollback-Strategien und Erstellung von Runbooks

Abschließende Überprüfung, Wissentransfer und nächste Schritte

  • Präsentationen der Teilnehmer zur Migrationsarbeit und erlangten Erkenntnissen
  • Lückenanalyse, empfohlene Folgetätigkeiten und Übergabe des Schulungsmaterials
  • Referenzen, weitere Lernpfade und Unterstützungsoptionen

Voraussetzungen

  • Verständnis von Konzepten im Data Engineering
  • Erfahrung mit SQL und gespeicherten Prozeduren (Synapse / SQL Server)
  • Vertrautheit mit Konzepten der ETL-Orchestrierung (ADF oder ähnlich)

Zielgruppe

  • Technologiemanager mit einem Hintergrund im Data Engineering
  • Data Engineers, die prozedurale OLAP-Logik in Lakehouse-Muster überführen
  • Plattform-Ingenieure, die für die Einführung von Databricks verantwortlich sind
 35 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Kommende Kurse

Verwandte Kategorien