Schulungsübersicht
Einleitung
Grundlagen des Big Data-Begriffs
Überblick über Spark
Überblick über Python
Überblick über PySpark
- Datenverteilung mittels des Resilient Distributed Datasets-Frameworks
- Berechnungen verteilen mit Hilfe der Spark-API-Operatoren
Einrichtung von Python für die Nutzung mit Spark
Konfiguration von PySpark
Nutzung von Amazon Web Services (AWS) EC2-Instances für Spark
Einrichtung von Databricks
Konfiguration des AWS EMR-Clusters
Grundlagen der Python-Programmierung erlernen
- Einstieg in die Arbeit mit Python
- Nutzung des Jupyter Notebooks
- Verwendung von Variablen und einfachen Datentypen
- Arbeiten mit Listen
- Einsatz von if-Anweisungen
- Akzeptieren von Benutzereingaben
- Nutzung von while-Schleifen
- Funktionen erstellen und einsetzen
- Arbeiten mit Klassen
- Umgang mit Dateien sowie Fehlerbehandlung
- Projektarbeit, Datenverwaltung sowie Integration von APIs
Einführung in Spark DataFrames
- Grundlagen der Nutzung von Spark DataFrames
- Durchführen grundlegender Operationen mit Spark
- Nutzung von Groupby- und Aggregationsoperationen
- Umgang mit Zeitstempeln und Datumsangaben
Praktische Übungen zur Arbeit mit Spark DataFrames
Einführung in maschinelles Lernen mittels MLlib
Nutzung von MLlib, Spark sowie Python für maschinelle Lernsysteme
Verständnis von Regressionsverfahren
- Theoretische Grundlagen der linearen Regression erlernen
- Eine Bewertungsroutine zur linearen Regression implementieren
- Ein Übungsbeispiel zur linearen Regression durchführen
- Theoretische Grundlagen der logistischen Regression kennenlernen
- Code für die logistische Regression programmieren
- Ein Übungsbeispiel zur logistischen Regression verwirklichen
Verständnis von Entscheidungsbäumen und Zufallswaldsystemen
- Theoretische Grundlagen der Baum-basierten Verfahren erlernen
- Code für Entscheidungsbäume und Zufallswälder implementieren
- Ein Übungsbeispiel zur Klassifizierung mittels Zufallswäldern ausprobieren
Nutzung des K-Means-Clustering-Verfahrens
- Theoretische Grundlagen des K-Means-Algorithmus verstehen
- Einen K-Means-Clustering-Code programmieren
- Ein Übungsbeispiel zur Clusterbildung durchführen
Arbeiten mit Empfehlungssystemen
Implementierung von Methoden der natürlichen Sprachverarbeitung
- Grundlagen der Natürlichen Sprachverarbeitung (NLP) erlernen
- Überblick über gängige NLP-Werkzeuge geben
- Ein Beispiel für die Anwendung von NLP bearbeiten
Datenstreaming mithilfe von Spark und Python verwirklichen
- Grundlagen des Datenstreamings unter Verwendung von Spark erklären
- Ein Beispiel für das Arbeiten mit Streaming-Daten ausprobieren
Abschlussbemerkungen
Voraussetzungen
- Grundsätzliche Programmierkenntnisse
Zielgruppe
- Entwickler
- IT-Fachkräfte
- Datenwissenschaftler
Erfahrungsberichte (6)
Ich mochte es, dass es praktisch war. Ich liebte es, die theoretischen Kenntnisse mit praktischen Beispielen anzuwenden.
Aurelia-Adriana - Allianz Services Romania
Kurs - Python and Spark for Big Data (PySpark)
Maschinelle Übersetzung
Der Kurs befasste sich mit einer Reihe sehr komplexer und zusammenhängender Themen, und Pablo verfügt über umfassende Expertise in jedem von ihnen. Manchmal gingen Nuancen in der Kommunikation verloren oder lagen an zeitlichen Druck und möglicherweise wurden die Erwartungen dadurch nicht ganz erfüllt. Auch gab es einige UHG/Azure Databricks Setup-Probleme, die jedoch schnell gelöst wurden, sobald sie offensichtlich wurden. Dies zeigte für mich ein hohes Maß an Verständnis und Professionalität zwischen UHG und Pablo,
Michael Monks - Tech NorthWest Skillnet
Kurs - Python and Spark for Big Data (PySpark)
Maschinelle Übersetzung
Individuelle Betreuung.
ARCHANA ANILKUMAR - PPL
Kurs - Python and Spark for Big Data (PySpark)
Maschinelle Übersetzung
Praktische Übungen...
Abraham Thomas - PPL
Kurs - Python and Spark for Big Data (PySpark)
Maschinelle Übersetzung
Die Lektionen wurden in einem Jupyter-Notebook unterrichtet. Die Themen waren strukturiert und folgten einer logischen Abfolge, die es natürlich erscheinen ließ, wie sich die Sitzung von den einfacheren Teilen zu den komplexeren entwickelte. Ich bin bereits ein fortgeschrittener Python-Benutzer mit Hintergrund in Maschinellem Lernen, daher fand ich den Kurs leichter zu verfolgen als möglicherweise einige meiner Kommilitonen, die den Trainingskurs besucht haben. Ich schätze, dass einige der elementarsten Konzepte übersprungen wurden und er sich auf die wichtigsten Themen konzentrierte.
Angela DeLaMora - ADT, LLC
Kurs - Python and Spark for Big Data (PySpark)
Maschinelle Übersetzung
Übungsaufgaben
Pawel Kozikowski - GE Medical Systems Polska Sp. Zoo
Kurs - Python and Spark for Big Data (PySpark)
Maschinelle Übersetzung