Vielen Dank für die Zusendung Ihrer Anfrage! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Vielen Dank, dass Sie Ihre Buchung abgeschickt haben! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Schulungsübersicht
Einführung, Ziele und Migrationsstrategie
- Kursziele, Anpassung des Teilnehmerprofils und Erfolgskriterien
- Übergreifende Migrationsansätze und Risikobetrachtungen
- Einrichtung von Workspaces, Repositories und Labor-Datensätzen
Tag 1 — Grundlagen der Migration und Architektur
- Lakehouse-Konzepte, Überblick über Delta Lake und Databricks-Architektur
- Unterschiede zwischen SMP und MPP und deren Auswirkungen auf die Migration
- Gestaltung des Medallion-Musters (Bronze→Silver→Gold) und Überblick über Unity Catalog
Tag 1 Labor — Übersetzen einer gespeicherten Prozedur
- Praktische Migration einer Beispielspeicherverfahren in ein Notebook
- Zuordnung von Temporärtabellen und Cursors zu DataFrame-Transformationen
- Validierung und Vergleich mit dem ursprünglichen Ergebnis
Tag 2 — Erweitertes Delta Lake & Inkrementelles Laden
- ACID-Transaktionen, Commit-Logs, Versionsverfolgung und Time Travel
- Auto Loader, MERGE INTO-Muster, Upserts und Schema-Evolution
- OPTIMIZE, VACUUM, Z-ORDER, Partitionierung und Speichertuning
Tag 2 Labor — Inkrementelle Aufnahme & Optimierung
- Implementierung von Auto Loader-Aufnahme und MERGE-Workflows
- Anwendung von OPTIMIZE, Z-ORDER und VACUUM; Validierung der Ergebnisse
- Messung der Verbesserungen der Lese-/Schreibperformance
Tag 3 — SQL in Databricks, Performance & Fehlersuche
- Analytische SQL-Funktionen: Window Functions, Higher-Order Functions, Behandlung von JSON/Arrays
- Lesen der Spark UI, DAGs, Shuffles, Stages, Tasks und Diagnose von Engpässen
- Muster für Query-Tuning: Broadcast Joins, Hints, Caching und Reduzierung von Spills
Tag 3 Labor — SQL-Refactoring & Performance-Tuning
- Refactoring eines aufwändigen SQL-Prozesses in optimiertes Spark SQL
- Nutzung von Spark UI-Traces zur Identifizierung und Behebung von Skew- und Shuffle-Problemen
- Benchmarking vor/nach und Dokumentation der Tuning-Schritte
Tag 4 — Taktisches PySpark: Ersetzen von prozeduraler Logik
- Spark-Ausführungsmodell: Driver, Executors, Lazy Evaluation und Partitionierungsstrategien
- Transformation von Schleifen und Cursors in vektorisierte DataFrame-Operationen
- Modularisierung, UDFs/pandas UDFs, Widgets und wiederverwendbare Bibliotheken
Tag 4 Labor — Refactoring prozeduraler Skripte
- Refactoring eines prozeduralen ETL-Skripts in modulare PySpark-Notebooks
- Einführung von Parametrisierung, Unit-Tests und wiederverwendbaren Funktionen
- Code-Review und Anwendung der Best-Practice-Checkliste
Tag 5 — Orchestrierung, Ende-zu-Ende-Pipeline & Best Practices
- Databricks Workflows: Job-Design, Task-Abhängigkeiten, Trigger und Fehlerbehandlung
- Design inkrementeller Medallion-Pipelines mit Qualitätsregeln und Schema-Validierung
- Integration mit Git (GitHub/Azure DevOps), CI und Teststrategien für PySpark-Logik
Tag 5 Labor — Erstellung einer vollständigen Ende-zu-Ende-Pipeline
- Zusammensetzung der Bronze→Silver→Gold-Pipeline, orchestriert mit Workflows
- Implementierung von Logging, Auditing, Retries und automatisierten Validierungen
- Ausführen der gesamten Pipeline, Validieren der Ausgaben und Vorbereiten der Bereitstellungshinweise
Operationalisierung, Governance und Produktionsreife
- Governance mit Unity Catalog, Linienverfolgung und Best Practices für Zugriffskontrollen
- Kosten, Cluster-Größe, Autoscaling und Job-Parallelitätsmuster
- Bereitstellungs-Checklisten, Rollback-Strategien und Erstellung von Runbooks
Abschließende Überprüfung, Wissentransfer und nächste Schritte
- Präsentationen der Teilnehmer zur Migrationsarbeit und erlangten Erkenntnissen
- Lückenanalyse, empfohlene Folgetätigkeiten und Übergabe des Schulungsmaterials
- Referenzen, weitere Lernpfade und Unterstützungsoptionen
Voraussetzungen
- Verständnis von Konzepten im Data Engineering
- Erfahrung mit SQL und gespeicherten Prozeduren (Synapse / SQL Server)
- Vertrautheit mit Konzepten der ETL-Orchestrierung (ADF oder ähnlich)
Zielgruppe
- Technologiemanager mit einem Hintergrund im Data Engineering
- Data Engineers, die prozedurale OLAP-Logik in Lakehouse-Muster überführen
- Plattform-Ingenieure, die für die Einführung von Databricks verantwortlich sind
35 Stunden