Kontakt aufnehmen

Schulungsübersicht

PySpark & maschinelles Lernen /

Modul 1: Grundlagen zu Big Data und Spark

  • Überblick über das Big-Data-Ökosystem sowie die Rolle von Spark in heutigen Datenplattformen
  • Grundlagen der Spark-Architektur: Treiber, Ausführungsprozesse, Cluster-Manager, Trägheitsprinzip bei Auswertungen, DAG sowie Planung von Berechnungsabläufen
  • Unterschiede zwischen den APIs RDD und DataFrame – wann welche Methode sinnvoll ist
  • Erstellen und Konfigurieren von SparkSession sowie Verständnis der grundlegenden Einstellungsmöglichkeiten für Anwendungen

Modul 2: PySpark DataFrames

  • Lesen und Schreiben von Daten aus verschiedenen Quellen sowie Formaten (CSV, JSON, Parquet, Delta)
  • Arbeiten mit PySpark DataFrames: Transformationen, Auswertungsvorgänge, Ausdrücke zu Spaltenwerten, Filterung, Verknüpfungen sowie Aggregationen
  • Umsetzung fortgeschrittener Operationen wie Fensterfunktionen, Umgang mit Zeitstempeln sowie Bearbeitung verschachtelter Datenstrukturen
  • Durchführung von Qualitätsprüfungen an Daten sowie Erstellung wiederverwendbaren, wartbaren PySpark-Codes

Modul 3: Effiziente Verarbeitung großer Datensätze

  • Wesentliche Aspekte zur Performance-Optimierung: Strategien zum Partitionieren, Umgang mit Shuffle-Vorgängen, Caching und Datenpersistenz
  • Einsatz bewährter Optimierungstechniken – beispielsweise Broadcast-Joins sowie Analyse von Ausführungsplänen
  • Sicherstellung einer effizienten Verarbeitung großer Datenmengen samt bewährten Vorgehensweisen für skalierbare Workflows
  • Behandlung von Schema-Änderungen sowie Kenntnis moderner Speicherformate im Enterprise-Umfeld

Modul 4: Merkmalsextraktion in großem Maßstab

  • Durchführung von Merkmalsextraktionsschritten mittels Spark MLlib – etwa Beseitigung fehlender Werte, Kodierung kategorischer Variablen sowie Skalierung der Merkmale
  • Entwicklung wiederverwendbarer Vorverarbeitungsschritte sowie Vorbereitung der Daten für Maschinenlern-Pipelines
  • Einführung in Verfahren zur Auswahl relevanter Merkmale sowie Umgang mit ungleichmäßig verteilten Klassen in Datensätzen

Modul 5: Maschinelles Lernen mittels Spark MLlib

  • Übersicht über die Architektur von MLlib sowie das Konzept der Estimator- und Transformer-Komponenten
  • Training von Regressions- sowie Klassifikationsmodellen im großen Maßstab – etwa mit linearer Regression, logistischer Regression, Entscheidungsbäumen oder Random Forests
  • Vergleich verschiedener Modelle sowie Interpretation ihrer Ergebnisse innerhalb von verteilten Maschinenlern-Prozessen

Modul 6: Vollständige ML-Pipelines

  • Konzeption und Aufbau ganzheitlicher Maschinenlern-Pipelines, die Vorverarbeitungsschritte, Merkmalsextraktion sowie Modelltraining umfassen
  • Anwendung sinnvoller Strategien zur Aufteilung der Daten in Trainings-, Validierungs- und Testdatensätze
  • Durchführung von Kreuzvalidierung sowie Optimierung der Hyperparameter mittels Grid Search oder Random Search
  • Gestaltung reproduzierbarer Experimente im Bereich des maschinellen Lernens

Modul 7: Modellbewertung & praktische Entscheidungsfindung im Maschinenlernen

  • Auswahl geeigneter Bewertungsmetriken für Regressions- und Klassifikationsprobleme
  • Erkennen von Überanpassung bzw. Unteranpassung der Modelle sowie fundierte Entscheidungen zur Modellauswahl
  • Interpretation der Bedeutung einzelner Merkmale sowie Verständnis des allgemeinen Verhaltens von trainierten Modellen

Modul 8: Einsatz in Produktion & bewährte Enterprise-Praktiken

  • Speichern und Laden von Modellen innerhalb des Spark-Ökosystems
  • Umsetzung von Batch-Inferenzprozessen zur Verarbeitung großer Datensätze
  • Grundlagen zum Lebenszyklus von Maschinenlern-Projekten im Unternehmenseinsatz
  • Einführung in Konzepte wie Versionsverwaltung, Nachverfolgung von Experimenten sowie Basismaßnahmen zur Qualitätssicherung

 

Praktische Ergebnisse des Trainings

  • Fähigkeit, selbstständig mit PySpark zu arbeiten
  • Fähigkeit, große Datensätze effizient zu verarbeiten
  • Kompetenz in der Merkmalsextraktion auf großem Maßstab
  • Fähigkeit, skalierbare Maschinenlern-Pipelines zu konzipieren und umzusetzen

Voraussetzungen

Voraussetzung für die Teilnahme sind folgende Kenntnisse:

Grundkenntnisse in der Python-Programmierung – insbesondere im Umgang mit Funktionen, Datenstrukturen und Bibliotheken
Basisverständnis für Konzepte der Datenanalyse wie Datensätze, Transformationen und Aggregationen
Grundwissen in SQL sowie Konzepten der relationalen Datenbanken
Einfache Kenntnisse im Bereich des maschinellen Lernens – etwa zu Trainingsdatensätzen, Merkmalen und Bewertungskriterien
Vertrautheit mit der Arbeit in Kommandozeilenumgebungen sowie grundlegende Softwareentwicklungspraktiken ist von Vorteil

Erfahrungen mit Bibliotheken wie Pandas, NumPy oder ähnlichen Werkzeugen zur Datenverarbeitung sind hilfreich, aber nicht zwingend erforderlich.

 21 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Erfahrungsberichte (1)

Kommende Kurse

Verwandte Kategorien