Talend Big Data Integration Schulung
Talend Open Studio for Big Data ist ein quelloffenes ETL-Tool zur Verarbeitung von Big Data. Es enthält eine Entwicklungsumgebung, um mit Big Data-Quellen und -Zielen zu interagieren und Aufträge auszuführen, ohne Code schreiben zu müssen.
Dieses von einem Trainer geleitete Live-Training (online oder vor Ort) richtet sich an technische Fachkräfte, die Talend Open Studio for Big Data einsetzen möchten, um den Prozess des Lesens und Verarbeitens von Big Data zu vereinfachen.
Am Ende dieses Trainings werden die Teilnehmer in der Lage sein:
- Talend Open Studio for Big Data zu installieren und zu konfigurieren.
- Sich mit Big Data-Systemen wie Cloudera, HortonWorks, MapR, Amazon EMR und Apache zu verbinden.
- Die Big Data-Komponenten und -Connectoren von Open Studio zu verstehen und einzurichten.
- Parameter zu konfigurieren, um MapReduce-Code automatisch zu generieren.
- Die Drag-and-Drop-Oberfläche von Open Studio zu verwenden, um Hadoop-Aufträge auszuführen.
- Big Data-Pipelines zu prototypieren.
- Big Data-Integration-Projekte zu automatisieren.
Kursformat
- Interaktive Vorlesung und Diskussion.
- Viele Übungen und Praxisübungen.
- Hands-on-Implementierung in einer Live-Lab-Umgebung.
Kursanpassungsoptionen
- Für eine angepasste Schulung zu diesem Kurs kontaktieren Sie uns bitte, um die Anforderungen abzustimmen.
Schulungsübersicht
Einführung
Überblick über die Funktionen und Architektur von „Open Studio for Big Data“
Einrichtung von Open Studio for Big Data
Navigation in der Benutzeroberfläche
Verstehen der Big Data-Komponenten und -Connectoren
Verbindung mit einem Hadoop-Cluster herstellen
Daten lesen und schreiben
Datenverarbeitung mit Hive und MapReduce
Ergebnisse analysieren
Verbessern der Big Data-Qualität
Erstellen einer Big Data-Pipeline
Verwalten von Benutzern, Gruppen, Rollen und Projekten
Bereitstellung von Open Studio in der Produktion
Überwachung von Open Studio
Problembehandlung
Zusammenfassung und Schlussfolgerungen
Voraussetzungen
- Ein Verständnis von relationellen Datenbanken
- Ein Verständnis von Data Warehouses
- Ein Verständnis von ETL-Konzepten (Extract, Transform, Load)
Zielgruppe
- Business-Intelligence-Fachkräfte
- Datenbankfachkräfte
- SQL-Entwickler
- ETL-Entwickler
- Lösungsarchitekten
- Datenarchitekten
- Data-Warehouse-Fachkräfte
- Systemadministratoren und -integritätssicherer
Offene Schulungskurse erfordern mindestens 5 Teilnehmer.
Talend Big Data Integration Schulung - Buchung
Talend Big Data Integration Schulung - Anfrage
Talend Big Data Integration - Beratungsanfrage
Erfahrungsberichte (1)
Praktische Übungen. Die Kursdauer sollte eigentlich fünf Tage betragen, aber die drei Tage halfen dabei, viele Fragen zu klären, die ich bei der Arbeit mit NiFi bereits hatte.
James - BHG Financial
Kurs - Apache NiFi for Administrators
Maschinelle Übersetzung
Kommende Kurse
Kombinierte Kurse
Erweitertes Apache Iceberg
21 StundenDieses von einem Ausbilder geleitete, Live-Training in Deutschland (online oder vor Ort) richtet sich an fortgeschrittene Datenprofis, die Workflows zur Datenverarbeitung optimieren, die Datenintegrität sicherstellen und robuste Datenlakehouse-Lösungen implementieren möchten, die die Komplexitäten moderner Big-Data-Anwendungen bewältigen können.
Am Ende dieses Trainings werden die Teilnehmer in der Lage sein:
- Ein tiefgründiges Verständnis von Icebergs Architektur, einschließlich Metadaten-Management und Dateilayout, zu erlangen.
- Iceberg für optimale Leistung in verschiedenen Umgebungen zu konfigurieren und mit mehreren Datenverarbeitungsmotoren zu integrieren.
- Große Iceberg-Tabellen zu verwalten, komplexe Schemawechsel durchzuführen und Partitionsevolution zu handhaben.
- Techniken zur Optimierung der Abfrageleistung und der Datenscan-Effizienz für große Datenmengen zu beherrschen.
- Mechanismen zur Sicherstellung der Datenkonsistenz, Verwaltung transaktionaler Garantien und Handhabung von Fehlern in verteilten Umgebungen umzusetzen.
Apache Iceberg Grundlagen
14 StundenDieses von einem Trainer geleitete, Live-Training in Deutschland (online oder vor Ort) richtet sich an datentechnische Anfänger, die das notwendige Wissen und die Fähigkeiten erwerben möchten, um Apache Iceberg effektiv für die Verwaltung von großen Datenmengen, die Sicherstellung der Datensicherheit und die Optimierung von Datenverarbeitungsabläufen zu nutzen.
Am Ende dieses Trainings werden die Teilnehmer in der Lage sein:
- Ein tiefgehendes Verständnis für die Architektur, Funktionen und Vorteile von Apache Iceberg zu erlangen.
- Sich mit Tabellenformaten, Partitionierung, Schemaevolution und Zeitreisefähigkeiten vertraut zu machen.
- Apache Iceberg in verschiedenen Umgebungen zu installieren und zu konfigurieren.
- Iceberg-Tabellen zu erstellen, zu verwalten und zu bearbeiten.
- Den Prozess des Datenmigrations von anderen Tabellenformaten nach Iceberg zu verstehen.
Big Data-Analytik mit Google Colab und Apache Spark
14 StundenDieser von einem Trainer durchgeführte Live-Kurs in Deutschland (online oder vor Ort) richtet sich an mittelcalibrige Datenwissenschaftler und Ingenieure, die Google Colab und Apache Spark für das Verarbeiten und Analysieren von Big Data einsetzen möchten.
Am Ende des Trainings werden die Teilnehmer in der Lage sein:
- Eine Big-Data-Umgebung mit Google Colab und Spark einzurichten.
- Große Datensätze effizient mit Apache Spark zu verarbeiten und zu analysieren.
- Big Data in einer kollaborativen Umgebung visualisieren.
- Apache Spark mit cloudbasierten Tools zu integrieren.
Apache NiFi für Administratorinnen und Administratorinnen
21 StundenApache NiFi ist eine Open-Source-Plattform für flussbasierte Datenintegration und Ereignisverarbeitung. Sie ermöglicht die automatisierte, in Echtzeit stattfindende Datenrouting-, Transformations- und Systemvermittlungsfunktionen zwischen unterschiedlichen Systemen mit einer webbasierten Benutzeroberfläche und feingranularen Kontrollmöglichkeiten.
Dieses vom Trainer geleitete, live Training (vor Ort oder remote) richtet sich an fortgeschrittene Administratoren und Ingenieure, die NiFi-Datenflüsse in Produktionsumgebungen bereitstellen, verwalten, schützen und optimieren möchten.
Zum Ende dieses Trainings werden die Teilnehmer in der Lage sein:
- Apache NiFi-Clusters zu installieren, zu konfigurieren und zuwartenden.
- Datenflüsse von verschiedenen Quellen und Senken zu planen und zu verwalten.
- Flussautomatisierung, Routing und Transformationslogik umzusetzen.
- Die Leistung zu optimieren, Operationen zu überwachen und Probleme zu beheben.
Kursformat
- Interaktive Vorlesung mit Diskussion realer Architekturen.
- Praktische Übungen: Erstellen, Bereitstellen und Verwalten von Flüssen.
- Szenario-basierte Aufgaben in einer Live-Lab-Umgebung.
Kursanpassungsoptionen
- Für eine angepasste Schulung für diesen Kurs kontaktieren Sie uns, um einen Termin zu vereinbaren.
PySpark und Machine Learning
21 StundenDiese Schulung bietet eine praxisorientierte Einführung in den Aufbau skalierbarer Datenverarbeitungs- und Machine-Learning-Workflows mit PySpark. Die Teilnehmenden lernen, wie Apache Spark in modernen Big-Data-Ökosystemen funktioniert und wie große Datensätze mithilfe verteilter Rechenprinzipien effizient verarbeitet werden können.
Grundlagen von Apache Spark
21 StundenDieses von einem Dozenten geleitete Live-Training in Deutschland (online oder vor Ort) richtet sich an Ingenieure, die Apache Spark-System zur Verarbeitung sehr großer Datenmengen einrichten und bereitstellen möchten.
Am Ende dieses Trainings werden die Teilnehmer in der Lage sein:
- Apache Spark zu installieren und zu konfigurieren.
- Sehr große Datensätze schnell zu verarbeiten und zu analysieren.
- Den Unterschied zwischen Apache Spark und Hadoop MapReduce zu verstehen und zu wissen, wann welches System verwendet werden sollte.
- Apache Spark mit anderen maschinellen Lernwerkzeugen zu integrieren.
Administration von Apache Spark
35 StundenDiese von einem Trainer geleitete Live-Schulung in Deutschland (online oder vor Ort) richtet sich an Anfänger bis fortgeschrittene Systemadministratoren, die Spark-Cluster einsetzen, warten und optimieren möchten.
Am Ende dieser Schulung werden die Teilnehmer in der Lage sein,:
- Installieren und konfigurieren Sie Apache Spark in verschiedenen Umgebungen.
- Cluster-Ressourcen zu verwalten und Spark-Anwendungen zu überwachen.
- Die Leistung von Spark-Clustern zu optimieren.
- Sicherheitsmaßnahmen zu implementieren und Hochverfügbarkeit zu gewährleisten.
- Allgemeine Spark-Probleme zu debuggen und zu beheben.
Apache Spark in der Cloud
21 StundenDie Lernkurve von Apache Spark steigt am Anfang langsam an, es bedarf viel Mühe, um den ersten Erfolg zu erzielen. Dieses Kursziel ist es, den ersten schwierigen Teil zu überwinden. Nachdem die Teilnehmer diesen Kurs absolviert haben, verstehen sie die Grundlagen von Apache Spark, sie können RDD und DataFrame klar voneinander abgrenzen, sie lernen die Python- und Scala-APIs, sie verstehen Executoren und Tasks usw. Auch indem es sich an beste Praktiken orientiert, konzentriert sich dieser Kurs stark auf die Cloudbereitstellung, insbesondere auf Databricks und AWS. Die Teilnehmer werden auch die Unterschiede zwischen AWS EMR und AWS Glue verstehen, einem der neuesten Spark-Dienste von AWS.
ZIELGRUPPE:
Data Engineer, DevOps, Data Scientist
Python und Spark für Big Data (PySpark)
21 StundenIn dieser von einem Trainer geleiteten Live-Schulung in Deutschland lernen die Teilnehmer anhand praktischer Übungen, wie sie Python und Spark gemeinsam zur Analyse von Big Data einsetzen können.
Am Ende dieser Schulung werden die Teilnehmer in der Lage sein:
- Lernen, wie man Spark mit Python verwendet, um Big Data zu analysieren.
- An Übungen arbeiten, die reale Fälle nachahmen.
- Verschiedene Tools und Techniken für die Big-Data-Analyse mit PySpark verwenden.
Python, Spark und Hadoop für Big Data
21 StundenDiese von einem Trainer geleitete Live-Schulung in Deutschland (online oder vor Ort) richtet sich an Entwickler, die Spark, Hadoop und Python verwenden und integrieren möchten, um große und komplexe Datensätze zu verarbeiten, zu analysieren und zu transformieren.
Am Ende dieser Schulung werden die Teilnehmer in der Lage sein,:
- die notwendige Umgebung einzurichten, um mit der Verarbeitung von Big Data mit Spark, Hadoop und Python zu beginnen.
- die Funktionen, Kernkomponenten und Architektur von Spark und Hadoop zu verstehen.
- Lernen, wie man Spark, Hadoop und Python für die Verarbeitung von Big Data integriert.
- Erkunden Sie die Werkzeuge im Spark-Ökosystem (Spark MlLib, Spark Streaming, Kafka, Sqoop, Kafka und Flume).
- Erstellen Sie Empfehlungssysteme mit kollaborativer Filterung ähnlich wie bei Netflix, YouTube, Amazon, Spotify und Google.
- Apache Mahout zur Skalierung von maschinellen Lernalgorithmen verwenden.
Stratio: Rocket- und Intelligence-Module mit PySpark
14 StundenStratio ist eine datenzentrierte Plattform, die Big Data, KI und Governance in einer einzigen Lösung integriert. Die Rocket- und Intelligence-Module ermöglichen eine schnelle Datenauswertung, -transformation und fortgeschrittene Analysen in Unternehmensumgebungen.
Diese von einem Dozenten geleitete Live-Schulung (online oder vor Ort) richtet sich an datenzentrierte Fachkräfte mittlerer Qualifikation, die lernen möchten, die Rocket- und Intelligence-Module in Stratio effektiv mit PySpark zu nutzen. Der Fokus liegt auf Schleifenstrukturen, benutzerdefinierten Funktionen und fortgeschrittenen Datenlogiken.
Am Ende dieser Schulung werden die Teilnehmer in der Lage sein:
- Sich innerhalb der Stratio-Plattform mit den Rocket- und Intelligence-Modulen zu orientieren und darin zu arbeiten.
- PySpark im Kontext von Datenaufnahme, -transformation und -analyse anzuwenden.
- Schleifen und bedingte Logiken zur Steuerung von Datenworkflows und Feature-Engineering-Aufgaben zu verwenden.
- Benutzerdefinierte Funktionen (UDFs) für wiederverwendbare Datenoperationen in PySpark zu erstellen und zu verwalten.
Kursformat
- Interaktive Vorlesung und Diskussion.
- Viele Übungen und Praxisbeispiele.
- Hands-on-Implementierung in einer Live-Lab-Umgebung.
Kursanpassungsoptionen
- Für eine angepasste Schulung für diesen Kurs, kontaktieren Sie uns bitte zur Terminfindung.
Talend Administration Center (TAC)
14 StundenDieses von einem Instructor angeführte Live-Training in Deutschland (online oder vor Ort) richtet sich an Systemadministratoren, Datenwissenschaftler und Business-Analysten, die Talend Administration Center einrichten möchten, um die Rollen und Aufgaben der Organisation zu verwalten.
Am Ende dieses Trainings werden die Teilnehmer in der Lage sein:
- Talend Administration Center zu installieren und einzurichten.
- Talend-Management-Grundlagen zu verstehen und umzusetzen.
- Geschäftliche Projekte oder Aufgaben in Talend aufzubauen, bereitzustellen und auszuführen.
- Die Sicherheit von Datensätzen zu überwachen und Geschäftsabläufe basierend auf dem TAC-Framework zu entwickeln.
- Eine umfassendere Kenntnis von Big-Data-Anwendungen zu erlangen.
Talend Data Stewardship
14 StundenDieses von einem Dozenten angeführte Live-Training in Deutschland (online oder vor Ort) richtet sich an Anfänger bis fortgeschrittene Datenanalytiker, die ihr Verständnis und ihre Fähigkeiten im Management und Verbessern der Datenqualität unter Verwendung von Talend Data Stewardship vertiefen möchten.
Am Ende dieses Trainings werden die Teilnehmer in der Lage sein:
- Eine umfassende Kenntnis der Rolle des Datenmanagement bei der Aufrechterhaltung der Datenqualität zu erlangen.
- Talend Data Stewardship für die Verwaltung von Datenqualitätsaufgaben zu verwenden.
- Aufgaben in Talend Data Stewardship zu erstellen, zuzuweisen und zu verwalten, einschließlich der Anpassung von Workflows.
- Die Berichterstellungs- und Überwachungsfunktionen des Tools zur Verfolgung der Datenqualität und der Stewardship-Bemühungen zu nutzen.
Talend Open Studio for ESB
21 StundenIn diesem von einem Dozenten angeleiteten Live-Training in Deutschland lernen die Teilnehmer, wie sie Talend Open Studio für ESB nutzen können, um Dienste und deren Interaktionen zu erstellen, zu verbinden, zu vermitteln und zu verwalten.
Am Ende dieses Trainings werden die Teilnehmer in der Lage sein:
- ESB-Technologien als einzelne Pakete in verschiedenen Bereitstellungsumgebungen zu integrieren, zu erweitern und bereitzustellen.
- Die am häufigsten verwendeten Komponenten von Talend Open Studio zu verstehen und zu nutzen.
- Jede Anwendung, Datenbank, API oder Webdienste zu integrieren.
- Heterogene Systeme und Anwendungen nahtlos zu integrieren.
- Bestehende Java-Codebibliotheken einzubinden, um Projekte zu erweitern.
- Kommunikationskomponenten und Code der Community zu nutzen, um Projekte zu erweitern.
- Systeme, Anwendungen und Datenquellen schnell in einer drag-and-drop-fähigen Eclipse-Umgebung zu integrieren.
- Die Entwicklungszeit und die Wartungskosten durch die Erstellung optimierter, wiederverwendbarer Codes zu reduzieren.