Kontakt aufnehmen

Schulungsübersicht

Einführung:

  • Apache Spark im Hadoop-Ökosystem
  • Kurze Einführung in Python und Scala

Theoretische Grundlagen:

  • Architektur von Apache Spark
  • RDD – Resilient Distributed Datasets
  • Transformationen und Aktionen
  • Stages, Tasks sowie Abhängigkeiten

Praxisorientierte Übungen in der Databricks-Umgebung:

  • Übungen mit der RDD-API
  • Einfache Transformations- und Aktionsfunktionen
  • Arbeiten mit PairRDD
  • Ausführen von Join-Operationen
  • Caching-Strategien verstehen und anwenden
  • Übungen mit der DataFrame-API
  • Einsatz von SparkSQL
  • DataFrame: Auswählen, Filtern, Gruppieren und Sortieren von Daten
  • Erstellung und Nutzung von UDFs (User Defined Functions)
  • Einblick in die DataSet-API
  • Einführung in das Streaming-Prinzip

Praxisorientierte Übungen in der AWS-Umgebung:

  • Grundlagen zu AWS Glue
  • Unterschiede zwischen AWS EMR und AWS Glue verstehen
  • Praktische Beispiele für Jobs in beiden Umgebungen
  • Vor- und Nachteile der jeweiligen Plattformen erkennen

Zusätzliche Inhalte:

  • Einführung in die Orchestrierung mit Apache Airflow

Voraussetzungen

Programmierkenntnisse (vorzugsweise in Python oder Scala)

Grundlagen der SQL-Abfragesprache

 21 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Erfahrungsberichte (3)

Kommende Kurse

Verwandte Kategorien