Datenströme und Echtzeit-Datenverarbeitung Schulung
Kursübersicht
Dieser Kurs bietet eine praxisnahe und strukturierte Einführung in die Entwicklung von Systemen zur Echtzeit-Verarbeitung von Datenströmen. Er behandelt grundlegende Konzepte, Architekturmuster sowie gängige Werkzeuge aus der Branche, mit denen kontinuierlich anfallende Daten effizient verarbeitet werden können. Die Teilnehmenden lernen, wie man Streaming-Pipelines unter Verwendung moderner Frameworks entwirft, implementiert und optimiert. Der Kurs führt von grundlegenden Ideen zu praktischen Anwendungen – sodass die Lernenden in der Lage sind, produktionsreife Echtzeit-Lösungen sicher zu erstellen.
Ablauf des Trainings
• Unterricht von erfahrenen Instruktoren mit ausführlichen Erläuterungen
• Darstellung der Konzepte anhand realer Beispiele
• Praktische Demos sowie Programmierübungen
• Schrittweise Übungen, die auf tägliche Kursinhalte abgestimmt sind
• Interaktive Diskussionen sowie Fragen und Antworten
Lernziele des Kurses
• Verständnis der Konzepte der Echtzeit-Datenverarbeitung sowie der zugrunde liegenden Systemarchitektur
• Unterscheidung zwischen Batch- und Streaming-basierter Datenverarbeitung
• Entwurf skalierbarer und fehlertoleranter Streaming-Pipelines
• Umgang mit verteilten Tools und Frameworks für die Datenströme-Verarbeitung
• Anwendung von Verfahren wie Verarbeitung basierend auf Ereigniszeit, Fensterbildung sowie zustandsbehafteter Datenverarbeitung
Entwicklung und Optimierung von Echtzeit-Lösungen für spezifische geschäftliche Anforderungen.
Schulungsübersicht
Kursinhalt – Tag 1
• Einführung in grundlegende Konzepte der Datenströme-Verarbeitung
• Grundlagen des Batch- sowie des Echtzeit-Datenverarbeitungsmodells
• Grundzüge einer ereignisgesteuerten Architektur
• Häufige Anwendungsfälle in der Praxis
• Übersicht über das Ökosystem der Datenströme-Verarbeitung
Tag 2
• Architekturdesign-Muster für Streaming-Systeme
• Grundlagen verteilter Nachrichtenübermittlungssysteme
• Funktionen von Produzenten und Konsumenten
• Verständnis von Themen, Partitionierung sowie Datenflussmechanismen
• Strategien zur effizienten Dateneingabe
Tag 3
• Konzepte und Frameworks der Stream-Verarbeitung
• Unterschiede zwischen Ereigniszeit und Verarbeitungszeit
• Einsatz sowie Grundlagen von Fenstertechniken
• Zustandsbehaftete Datenverarbeitung in Streams
• Fehlertoleranz-Prinzipien samt der Notwendigkeit von Sicherungsmechanismen (Checkpoints)
Tag 4
• Transformation von Daten innerhalb von Streaming-Pipelines
• Einsatz von ETL- und ELT-Verfahren im Echtzeitkontext
• Handhabung von Datenschemata sowie deren Weiterentwicklung
• Verknüpfungsvorgänge zwischen Datenströmen und Datenerweiterungen
• Einführung in Cloud-basierte Stream-Verarbeitungsdienste
Tag 5
• Überwachung und Transparenz in komplexen Datenströme-Systemen
• Basisprinzipien der Sicherheit sowie des Zugriffsmanagements
• Methoden zur Leistungsoptimierung und Anpassung von Systemparametern
• Gesamte Bewertung sowie Überarbeitung komplexer Pipeline-Entwürfe
• Praktische Fälle aus der Realität, etwa Betrugserkennung oder Verarbeitung großer Mengen IoT-Daten
Offene Schulungskurse erfordern mindestens 5 Teilnehmer.
Datenströme und Echtzeit-Datenverarbeitung Schulung - Buchung
Datenströme und Echtzeit-Datenverarbeitung Schulung - Anfrage
Datenströme und Echtzeit-Datenverarbeitung - Beratungsanfrage
Erfahrungsberichte (2)
Eine Reise durch die Spark-Welt: ein sehr intensiver Kurs. DSL, Spark SQL, Partitionierung versus Bucketing für mich.
Georgiana Elisabeta
Kurs - Apache Spark Fundamentals
Maschinelle Übersetzung
Praktische Übungen. Die Kursdauer sollte eigentlich fünf Tage betragen, aber die drei Tage halfen dabei, viele Fragen zu klären, die ich bei der Arbeit mit NiFi bereits hatte.
James - BHG Financial
Kurs - Apache NiFi for Administrators
Maschinelle Übersetzung
Kommende Kurse
Kombinierte Kurse
Fortgeschrittene Apache Iceberg-Anwendung
21 StundenDieses von einem Trainer geleitete Live-Training in Deutschland – online oder vor Ort – wendet sich an erfahrene Datenfachkräfte, die ihre Datenaustauschprozesse optimieren, die Datenintegrität gewährleisten sowie robuste Data Lakehouse-Lösungen implementieren möchten, die den Anforderungen moderner Big-Data-Anwendungen gerecht werden.
Nach Abschluss dieses Trainings werden die Teilnehmenden in der Lage sein zu:
- Das Verständnis der Architektur von Apache Iceberg vertiefen, insbesondere was Metadatenverwaltung und Dateiorganisation betrifft.
- Die Konfiguration von Apache Iceberg zur Optimierung der Leistungsfähigkeit in unterschiedlichen Umgebungen vorzunehmen sowie deren Integration mit mehreren Datenverarbeitungstools zu realisieren.
- Große Apache-Iceberg-Tabellen verwalten, komplexe Schemaänderungen durchführen und Entwicklungen in der Partitionierung beherrschen.
- Methoden zur Optimierung von Abfragegeschwindigkeit sowie zur effizienten Verarbeitung umfangreicher Datenmengen anzuwenden.
- Mechanismen zur Sicherstellung der Datentreue, Implementierung transaktionaler Garantien und Umgang mit Ausfällen in verteilten Umgebungen zu nutzen.
Grundlagen von Apache Iceberg
14 StundenDieses von einem Trainer geleitete Live-Training in Deutschland (online oder vor Ort) richtet sich an Datenexperten auf Einsteigerlevel, die Kenntnisse und Fähigkeiten erlangen möchten, um Apache Iceberg effektiv einzusetzen – zur Verwaltung großer Datensätze, zum Schutz der Datenintegrität sowie zur Optimierung von Datenverarbeitungsprozessen.
Am Ende des Trainings werden die Teilnehmenden in der Lage sein zu:
- Ein tiefgreifendes Verständnis der Architektur, Funktionen und Vorteile von Apache Iceberg zu erlangen.
- Sich mit Table-Formaten, Partitionierung, Schemaentwicklung sowie den Möglichkeiten des Time Travel vertraut zu machen.
- Apache Iceberg in verschiedenen Umgebungen zu installieren und zu konfigurieren.
- Iceberg-Tabellen zu erstellen, zu verwalten sowie zu bearbeiten.
- Den Prozess der Datenmigration von anderen Table-Formaten nach Apache Iceberg zu verstehen.
Big Data-Analyse mit Google Colab und Apache Spark
14 StundenDieses von einem Trainer geleitete Live-Training in Deutschland – ebenfalls online oder vor Ort – richtet sich an Datenwissenschaftler und Ingenieure mittleren Kenntnisstands, die Google Colab sowie Apache Spark zur Verarbeitung und Analyse großer Datenmengen nutzen möchten.
Am Ende des Kurses können die Teilnehmenden:
- Eine Big-Data-Umgebung unter Verwendung von Google Colab und Spark konfigurieren.
- Riesige Datensätze mittels Apache Spark zügig verarbeiten und analysieren.
- Große Datenmengen in einer gemeinsamen Arbeitsumgebung visualisieren.
- Apache Spark erfolgreich mit cloudbasierten Werkzeugen verbinden.
Big Data Business Intelligence for Govt. Agencies
35 StundenFortschritte in der Technologie sowie die stetig zunehmende Informationsmenge verändern die Geschäftspraktiken in zahlreichen Branchen – auch im öffentlichen Sektor. Durch den raschen Ausbau mobiler Geräte und Anwendungen, intelligenter Sensoren, Cloud-Computing-Lösungen sowie Portale für Bürger wächst die Menge an erzeugten Regierungsdaten ebenso wie deren digitale Archivierung. Mit der zunehmenden Komplexität digitaler Informationen werden auch Aufgaben im Bereich Informationsverwaltung, -verarbeitung, -speicherung, Sicherheit und -aufbewahrung immer anspruchsvoller. Neue Werkzeuge zur Erfassung, Suche, Identifikation und Analyse helfen Organisationen dabei, aus unstrukturierten Daten wertvolle Erkenntnisse zu gewinnen. Der Regierungsbereich befindet sich an einem Wendepunkt: Man erkennt zunehmend, dass Informationen ein strategisches Gut sind – daher müssen Behörden sowohl strukturierte als auch unstrukturierte Daten schützen, nutzen und analysieren, um ihre Aufgaben effizienter zu erfüllen. Um datengetriebene Organisationen aufzubauen, legen Regierungsvertreter die Grundlagen dafür, Abhängigkeiten zwischen Ereignissen, Personen, Prozessen und Informationen nachzuweisen.
Hochwertige Lösungen für den öffentlichen Sektor werden zukünftig durch die Kombination bahnbrechender Technologien entstehen:
- Mobile Geräte und Anwendungen
- Cloud-Dienste
- Soziale Geschäftstechnologien sowie Netzwerke
- Big Data und Analysetechniken
Big Data ist eine solche innovative Branchenlösung: Sie ermöglicht Regierungen bessere Entscheidungen zu treffen, indem Handlungsoptionen auf der Grundlage von Mustern basieren, die sich aus der Analyse großer Datenmengen – sowohl strukturiert als auch unstrukturiert – ergeben.
Doch solche Erfolge lassen sich nicht durch bloße Datensammlung erreichen. „Um diese enormen Big-Data-Mengen sinnvoll zu nutzen, benötigt man fortschrittliche Werkzeuge und Technologien, mit denen man aus vielfältigen Informationen wertvolles Wissen gewinnen kann“, so Tom Kalil und Fen Zhao vom Office of Science and Technology Policy des Weißen Hauses in einem Blogbeitrag.
Ein wichtiger Schritt zur Unterstützung der Behörden war die im Jahr 2012 ins Leben gerufene National Big Data Research and Development Initiative – sie stellte über 200 Millionen US-Dollar bereit, um diese Datensphäre optimal auszuschöpfen und entsprechende Analysewerkzeuge zu entwickeln.
Die Herausforderungen im Big-Data-Bereich sind ebenso groß wie die Erwartungen. Effizientes Speichern von Daten ist eine davon: Aufgrund begrenzter Budgets müssen Behörden die Kosten pro Megabyte senken und sicherstellen, dass die Daten stets verfügbar bleiben. Das Erstellen von Backups für enorme Datenmengen erschwert die Situation noch weiter.
Eine weitere große Hürde ist die effektive Analyse der Daten. Viele Behörden nutzen kommerzielle Tools, um sich durch riesige Datensätze zu arbeiten und Trends zu erkennen, die ihnen helfen, ihre Arbeit zu optimieren – laut einer aktuellen Studie von MeriTalk könnten Big-Data-Lösungen Bundesbehörden dabei helfen, über 500 Milliarden US-Dollar einzusparen und zugleich ihre Ziele zu erreichen.
Ebenso werden eigens entwickelte Big-Data-Werkzeuge genutzt, um diesen Bedarf abzudecken. So hat etwa das Computational Data Analytics Group des Oak Ridge National Laboratory sein Piranha-Analysetool anderen Behörden zur Verfügung gestellt – es hilft medizinischen Forschern dabei, Gefäßerkrankungen frühzeitig zu erkennen und findet ebenso Einsatz bei alltäglichen Aufgaben, etwa bei der Zuordnung von Bewerbern zu Personalverantwortlichen.
Eine praktische Einführung in Datenanalyse und Big Data – 3 Tage
21 StundenTeilnehmer, die an dieser von einem Instruktor geleiteten Live-Schulung in Deutschland teilnehmen, erlangen ein praxisnahes Verständnis von Big Data sowie den zugehörigen Technologien, Methoden und Werkzeugen.
Sie haben außerdem die Möglichkeit, dieses Wissen anhand praktischer Übungen in die Tat umzusetzen. Der Austausch in der Gruppe sowie das Feedback des Instruktors sind wesentliche Bestandteile des Kurses.
Der Kurs beginnt mit einer Einführung in grundlegende Konzepte von Big Data und führt anschließend zu den Programmiersprachen sowie Methoden, die bei der Datenanalyse eingesetzt werden. Zum Abschluss behandeln wir die Werkzeuge und Infrastrukturen, welche für das Speichern, verteilte Verarbeitung sowie die Skalierbarkeit von Big Data erforderlich sind.
Big Data und fortgeschrittene Analytik
42 StundenBig Data und fortgeschrittene Analytik bezeichnet die Anwendung komplexer Techniken und Werkzeuge zur Auswertung umfangreicher, komplexer Datensätze, um daraus handlungsrelevante Erkenntnisse sowie fundierte strategische Entscheidungen abzuleiten.
Dieses von erfahrenen Trainern geleitete Live-Training – online oder vor Ort – richtet sich an Datenprofis auf fortgeschrittenem Niveau, die moderne analytische Methoden sowie Big-Data-Technologien nutzen möchten, um prädiktive, präskriptive und Echtzeitanalysen durchzuführen.
Am Ende dieses Trainings werden die Teilnehmer in der Lage sein:
- Skalierbare Datenverarbeitungspipelines für strukturierte sowie unstrukturierte Daten zu entwerfen und umzusetzen.
- Fortschrittliche Methoden des maschinellen Lernens und des tiefen Lernens auf großen Datensätzen anzuwenden.
- Verteilte Rechenumgebungen für Echtzeitanalysen sowie Datenströme einzusetzen.
- Big-Data-Analytik in Geschäftsintelligenzsysteme und Entscheidungsprozesse zu integrieren.
Ablauf des Kurses
- Interaktive Vorlesungen sowie Diskussionen.
- Zahlreiche Übungen und praktische Aufgaben.
- Praktische Umsetzung in einer Live-Laborumgebung.
Möglichkeiten zur Kursanpassung
- Für eine individuelle Schulungsgestaltung kontaktieren Sie uns bitte, um die Details zu besprechen.
Apache NiFi für Administratoren
21 StundenApache NiFi ist eine Open-Source-Plattform zur datenbasierten Integration und Ereignisverarbeitung. Sie ermöglicht die automatische, in Echtzeit erfolgende Weiterleitung sowie Transformation von Daten zwischen verschiedenen Systemen – alles über eine webbasierte Oberfläche mit fein abgestimmten Steuerungsmöglichkeiten.
Dieses vom Kursleiter geleitete Live-Training (vor Ort oder remote) richtet sich an Administratoren und Ingenieure mittleren Kenntnisstands, die NiFi-Workflows in Produktivumgebungen installieren, verwalten, sichern und optimieren möchten.
Am Ende des Trainings werden die Teilnehmenden in der Lage sein zu:
- Apache NiFi-Cluster zu installieren, zu konfigurieren und zu warten.
- Workflows von diversen Datenquellen und -zielen zu entwerfen sowie zu verwalten.
- Automatisierungs-, Routing- und Transformationslogik innerhalb von Datenflüssen umzusetzen.
- Die Leistung zu optimieren, den Betrieb zu überwachen sowie auftretende Probleme zu beheben.
Aufbau des Kurses
- Interaktive Vorlesungen mit Diskussionen zu realistischen Architekturen.
- Praktische Übungen: Erstellung, Bereitstellung und Verwaltung von Datenflüssen.
- Szenariobasierte Aufgaben in einer Live-Lab-Umgebung.
Möglichkeiten zur individuellen Anpassung des Kurses
- Falls Sie eine auf Ihre Bedürfnisse zugeschnittene Variante dieses Kurses wünschen, kontaktieren Sie uns bitte zur Absprache.
PySpark und maschinelles Lernen
21 StundenIn diesem Training erhalten die Teilnehmer eine praxisorientierte Einführung in den Aufbau skalierbarer Datenverarbeitungs- sowie Maschinenlern-Workflows mithilfe von PySpark. Sie lernen, wie Apache Spark in modernen Big-Data-Umgebungen eingesetzt wird und wie man große Datensätze effizient unter Verwendung der Prinzipien der verteilten Rechenverarbeitung verarbeitet.
Grundlagen von Apache Spark
21 StundenDieses von einem Trainer geleitete Live-Training in Deutschland (online oder vor Ort) richtet sich an Ingenieure, die Apache Spark zur Verarbeitung sehr großer Datenmengen einrichten und einsetzen möchten.
Am Ende dieses Trainings werden die Teilnehmer in der Lage sein zu:
- Apache Spark zu installieren und zu konfigurieren.
- schnell sehr große Datensätze zu verarbeiten und auszuwerten.
- den Unterschied zwischen Apache Spark und Hadoop MapReduce zu erkennen sowie die passende Wahl zu treffen.
- Apache Spark mit anderen Tools für maschinelles Lernen zu verbinden.
Verwaltung von Apache Spark
35 StundenDieses praxisorientierte Training unter Anleitung eines Dozenten in Deutschland (online oder vor Ort) richtet sich an Systemadministratoren mit Grund- bis Mittelkenntnissen, die Spark-Clusters einrichten, verwalten und optimieren möchten.
Am Ende des Kurses sind die Teilnehmer in der Lage:
- Apache Spark in verschiedenen Umgebungen zu installieren und zu konfigurieren.
- Ressourcen eines Clusters zu verwalten sowie Spark-Anwendungen zu überwachen.
- Die Leistung von Spark-Clustern zu optimieren.
- Sicherheitsmaßnahmen umzusetzen und eine hohe Verfügbarkeit sicherzustellen.
- Häufige Probleme bei der Nutzung von Spark zu diagnostizieren und zu beheben.
Apache Spark in der Cloud
21 StundenZu Beginn ist die Lernkurve bei Apache Spark zwar etwas steil – man muss viel Aufwand investieren, um erste Ergebnisse zu erzielen. Dieser Kurs soll dabei helfen, diese Hürde erfolgreich zu überwinden. Nach Abschluss des Kurses verstehen die Teilnehmer die Grundlagen von Apache Spark, können RDD von DataFrame klar unterscheiden, lernen die Python- sowie Scala-APIs kennen und erhalten ein Verständnis für Executors und Tasks.
Darüber hinaus legt der Kurs großen Wert auf bewährte Vorgehensweisen im Bereich Cloud-Deployment – insbesondere mit Databricks und AWS. Die Teilnehmenden erfahren auch, worin sich AWS EMR und AWS Glue, einer der neuesten Spark-Dienste von AWS, unterscheiden.
ZIELGRUPPE:
Daten-Ingenieure, DevOps-Fachkräfte sowie Datenwissenschaftler
Python und Spark für Big Data (PySpark)
21 StundenIn diesem praxisorientierten Training unter Anleitung erfahrener Instruktoren lernen die Teilnehmer in Deutschland, wie sie Python und Spark gemeinsam zur Analyse von Big Data einsetzen können – dabei führen sie zahlreiche Übungen durch.
Am Ende dieses Kurses werden die Teilnehmer folgende Fähigkeiten erlangt haben:
- Sie lernen, wie man Spark in Verbindung mit Python zur Analyse von Big Data nutzt.
- Sie arbeiten an Aufgabenstellungen, die reale Szenarien aus der Praxis nachbilden.
- Sie setzen verschiedene Werkzeuge und Methoden ein, um mithilfe von PySpark Big Data zu analysieren.
Python, Spark und Hadoop für Big Data
21 StundenDieser von erfahrenen Dozenten geleitete Live-Kurs in Deutschland (online oder vor Ort) richtet sich an Entwickler, die Spark, Hadoop und Python nutzen wollen, um umfangreiche sowie komplexe Datensätze zu verarbeiten, zu analysieren und zu transformieren.
Nach Abschluss dieses Kurses werden die Teilnehmer in der Lage sein:
- Die erforderliche Umgebung einzurichten, um mit Spark, Hadoop und Python Big Data zu verarbeiten.
- Die Funktionen, Kernkomponenten sowie die Architektur von Spark und Hadoop zu verstehen.
- Zu erfahren, wie man Spark, Hadoop und Python miteinander kombiniert, um große Datenmengen effizient zu bearbeiten.
- Die Werkzeuge innerhalb des Spark-Ökosystems kennenzulernen (z. B. Spark MlLib, Spark Streaming, Kafka, Sqoop und Flume).
- Empfehlungssysteme basierend auf kollaborativem Filtering zu entwickeln – ähnlich wie Netflix, YouTube, Amazon, Spotify oder Google.
- Apache Mahout zur Skalierung von Algorithmen des maschinellen Lernens einzusetzen.
Stratio: Rocket- und Intelligence-Module mit PySpark
14 StundenStratio ist eine datenzentrierte Plattform, die Big Data, KI sowie Governance in einer einzigen Lösung vereint. Die Module Rocket und Intelligence ermöglichen eine schnelle Datenerkundung, -transformation sowie fortgeschrittene Analysen in unternehmensweiten Umgebungen.
Dieses von einem Trainer geleitete Live-Training – entweder online oder vor Ort – richtet sich an Datenexperten mittleren Kenntnisstands, die die Rocket- und Intelligence-Module in Stratio erfolgreich mit PySpark nutzen möchten. Im Mittelpunkt stehen dabei Schleifenstrukturen, benutzerdefinierte Funktionen sowie komplexe datenbezogene Logik.
Am Ende des Trainings werden die Teilnehmer in der Lage sein:
- Die Stratio-Plattform mitsamt den Rocket- und Intelligence-Modulen zu bedienen und effizient darin zu arbeiten.
- PySpark im Zusammenhang mit Dateneingabe, -transformation und -analyse einzusetzen.
- Schleifen sowie bedingte Ausdrücke zur Steuerung von Datenworkflows und zur Erstellung von Merkmalen zu verwenden.
- Benutzerdefinierte Funktionen (UDFs) für wiederverwendbare Datenvorgänge in PySpark zu erstellen und zu verwalten.
Ablauf des Kurses
- Interaktive Vorlesungen sowie Diskussionen.
- Zahlreiche Übungen und praktische Aufgaben.
- Praxisnahe Umsetzung in einer Live-Lab-Umgebung.
Möglichkeiten zur Kursanpassung
- Falls Sie ein maßgeschneidertes Training zu diesem Thema wünschen, kontaktieren Sie uns gerne, um die Details zu besprechen.