Kontakt aufnehmen

Schulungsübersicht

Einführung:

  • Apache Spark im Hadoop-Ökosystem
  • Kurze Einführung in Python und Scala

Grundlagen (Theorie):

  • Aufbau
  • RDD
  • Transformationen und Aktionen
  • Stage, Task, Abhängigkeiten

Verständnis der Grundlagen in der Databricks-Umgebung (Praxisworkshop):

  • Übungen mit der RDD-API
  • Grundlegende Aktions- und Transformationsfunktionen
  • PairRDD
  • Join
  • Caching-Strategien
  • Übungen mit der DataFrame-API
  • SparkSQL
  • DataFrame: select, filter, group, sort
  • UDF (User Defined Function)
  • Blick in die DataSet-API
  • Streaming

Verständnis der Bereitstellung in der AWS-Umgebung (Praxisworkshop):

  • Grundlagen von AWS Glue
  • Unterschiede zwischen AWS EMR und AWS Glue verstehen
  • Beispielaufgaben in beiden Umgebungen
  • Vorteile und Nachteile verstehen

Zusätzlich:

  • Einführung in die Orchestrierung mit Apache Airflow

Voraussetzungen

Programmierkenntnisse (vorzugsweise Python, Scala)

SQL-Grundlagen

 21 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Erfahrungsberichte (3)

Kommende Kurse

Verwandte Kategorien