Vielen Dank für die Zusendung Ihrer Anfrage! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Vielen Dank, dass Sie Ihre Buchung abgeschickt haben! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Schulungsübersicht
Einführung, Ziele und Migrationsstrategie
- Kursziele, Ausrichtung des Teilnehmerprofils und Erfolgskriterien
- Übersicht über Migrationsansätze und Risikobewertung
- Einrichtung von Workspaces, Repositories und Lab-Datensätzen
Tag 1 — Migrationsgrundlagen und Architektur
- Lakehouse-Konzepte, Delta Lake-Überblick und Databricks-Architektur
- Unterschiede zwischen SMP und MPP sowie deren Auswirkungen auf die Migration
- Medallion-Design (Bronze→Silber→Gold) und Unity Catalog-Überblick
Tag 1 Lab — Übersetzung einer gespeicherten Prozedur
- Praktische Migration einer Beispiel-gepeicherten Prozedur in ein Notebook
- Abbildung von Temp-Tabellen und Cursoren auf DataFrame-Transformationen
- Validierung und Vergleich mit der ursprünglichen Ausgabe
Tag 2 — Erweitertes Delta Lake & Inkrementelles Laden
- ACID-Transaktionen, Commit-Logs, Versionierung und Time Travel
- Auto Loader, MERGE INTO-Muster, Upserts und Schema-Evolution
- OPTIMIZE, VACUUM, Z-ORDER, Partitionierung und Speicher-Tuning
Tag 2 Lab — Inkrementelle Ingestion & Optimierung
- Implementierung der Auto Loader-Ingestion und MERGE-Workflows
- Anwendung von OPTIMIZE, Z-ORDER und VACUUM; Validierung der Ergebnisse
- Messung der Verbesserungen in der Lese-/Schreib-Performance
Tag 3 — SQL in Databricks, Performance & Debugging
- Analytische SQL-Funktionen: Fensterfunktionen, Higher-Order-Funktionen, JSON-/Array-Verarbeitung
- Lesen der Spark UI, DAGs, Shuffles, Stages, Tasks und Diagnose von Engpässen
- Query-Tuning-Muster: Broadcast Joins, Hints, Caching und Spill-Reduktion
Tag 3 Lab — SQL-Refactoring & Performance-Tuning
- Refactoring eines schwerfälligen SQL-Prozesses in optimiertes Spark SQL
- Verwendung von Spark-UI-Traces zur Identifizierung und Behebung von Skew- und Shuffle-Problemen
- Vergleich vor/nachher und Dokumentation der Tuning-Schritte
Tag 4 — Taktisches PySpark: Ersetzung prozeduraler Logik
- Spark-Ausführungsmodell: Driver, Executors, lazy evaluation und Partitionierungsstrategien
- Transformation von Schleifen und Cursoren in vektorisierte DataFrame-Operationen
- Modularisierung, UDFs/pandas UDFs, Widgets und wiederverwendbare Bibliotheken
Tag 4 Lab — Refactoring prozeduraler Skripte
- Refactoring eines prozeduralen ETL-Skripts in modulare PySpark-Notebooks
- Einführung von Parametrisierung, Unit-Tests und wiederverwendbaren Funktionen
- Code-Review und Anwendung einer Best-Practice-Checkliste
Tag 5 — Orchestrierung, End-to-End-Pipeline & Best Practices
- Databricks Workflows: Job-Design, Task-Abhängigkeiten, Trigger und Fehlerbehandlung
- Design inkrementeller Medallion-Pipelines mit Qualitätsregeln und Schemavalidierung
- Integration mit Git (GitHub/Azure DevOps), CI und Testing-Strategien für PySpark-Logik
Tag 5 Lab — Aufbau einer vollständigen End-to-End-Pipeline
- Zusammenstellung einer Bronze→Silber→Gold-Pipeline, orchestriert mit Workflows
- Implementierung von Logging, Auditing, Retries und automatisierten Validierungen
- Ausführen der vollständigen Pipeline, Validierung der Ausgabedaten und Vorbereitung der Deployment-Notizen
Operationalisierung, Governance und Produktionsreife
- Unity Catalog Governance, Stammbaum (Lineage) und Best Practices für Zugriffssteuerungen
- Kosten, Cluster-Größen, Autoscaling und Job-Konkurrenz-Muster
- Deployment-Checklisten, Rollback-Strategien und Erstellung von Runbooks
Abschlussprüfung, Wissenstransfer und nächste Schritte
- Präsentationen der Teilnehmer zu Migrationsarbeiten und gewonnenen Erkenntnissen
- Lückenalysen, empfohlene Anschlussaktivitäten und Übergabe des Schulungsmaterials
- Referenzen, weitere Lernpfade und Support-Optionen
Voraussetzungen
- Verständnis von Data-Engineering-Konzepten
- Erfahrung mit SQL und gespeicherten Prozeduren (Synapse / SQL Server)
- Vertrautheit mit ETL-Orchestrierungskonzepten (ADF oder ähnliche)
Zielgruppe
- Technologie-Manager mit Hintergrund im Data Engineering
- Data Engineers, die prozedurale OLAP-Logik in Lakehouse-Muster überführen
- Plattform-Ingenieure, die für die Einführung von Databricks verantwortlich sind
35 Stunden