Kontakt aufnehmen

Schulungsübersicht

Einleitung

Grundlagen des Big Data-Begriffs

Überblick über Spark

Überblick über Python

Überblick über PySpark

  • Datenverteilung mittels des Resilient Distributed Datasets-Frameworks
  • Berechnungen verteilen mit Hilfe der Spark-API-Operatoren

Einrichtung von Python für die Nutzung mit Spark

Konfiguration von PySpark

Nutzung von Amazon Web Services (AWS) EC2-Instances für Spark

Einrichtung von Databricks

Konfiguration des AWS EMR-Clusters

Grundlagen der Python-Programmierung erlernen

  • Einstieg in die Arbeit mit Python
  • Nutzung des Jupyter Notebooks
  • Verwendung von Variablen und einfachen Datentypen
  • Arbeiten mit Listen
  • Einsatz von if-Anweisungen
  • Akzeptieren von Benutzereingaben
  • Nutzung von while-Schleifen
  • Funktionen erstellen und einsetzen
  • Arbeiten mit Klassen
  • Umgang mit Dateien sowie Fehlerbehandlung
  • Projektarbeit, Datenverwaltung sowie Integration von APIs

Einführung in Spark DataFrames

  • Grundlagen der Nutzung von Spark DataFrames
  • Durchführen grundlegender Operationen mit Spark
  • Nutzung von Groupby- und Aggregationsoperationen
  • Umgang mit Zeitstempeln und Datumsangaben

Praktische Übungen zur Arbeit mit Spark DataFrames

Einführung in maschinelles Lernen mittels MLlib

Nutzung von MLlib, Spark sowie Python für maschinelle Lernsysteme

Verständnis von Regressionsverfahren

  • Theoretische Grundlagen der linearen Regression erlernen
  • Eine Bewertungsroutine zur linearen Regression implementieren
  • Ein Übungsbeispiel zur linearen Regression durchführen
  • Theoretische Grundlagen der logistischen Regression kennenlernen
  • Code für die logistische Regression programmieren
  • Ein Übungsbeispiel zur logistischen Regression verwirklichen

Verständnis von Entscheidungsbäumen und Zufallswaldsystemen

  • Theoretische Grundlagen der Baum-basierten Verfahren erlernen
  • Code für Entscheidungsbäume und Zufallswälder implementieren
  • Ein Übungsbeispiel zur Klassifizierung mittels Zufallswäldern ausprobieren

Nutzung des K-Means-Clustering-Verfahrens

  • Theoretische Grundlagen des K-Means-Algorithmus verstehen
  • Einen K-Means-Clustering-Code programmieren
  • Ein Übungsbeispiel zur Clusterbildung durchführen

Arbeiten mit Empfehlungssystemen

Implementierung von Methoden der natürlichen Sprachverarbeitung

  • Grundlagen der Natürlichen Sprachverarbeitung (NLP) erlernen
  • Überblick über gängige NLP-Werkzeuge geben
  • Ein Beispiel für die Anwendung von NLP bearbeiten

Datenstreaming mithilfe von Spark und Python verwirklichen

  • Grundlagen des Datenstreamings unter Verwendung von Spark erklären
  • Ein Beispiel für das Arbeiten mit Streaming-Daten ausprobieren

Abschlussbemerkungen

Voraussetzungen

  • Grundsätzliche Programmierkenntnisse

Zielgruppe

  • Entwickler
  • IT-Fachkräfte
  • Datenwissenschaftler
 21 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Erfahrungsberichte (6)

Kommende Kurse

Verwandte Kategorien