Schulungsübersicht
Einführung in das maschinelle Lernen
- Arten des maschinellen Lernens – überwachtes versus unüberwachtes Lernen
- Von der statistischen Analyse zum maschinellen Lernen
- Der Arbeitsablauf beim Data Mining: Geschäftsverständnis, Datenaufbereitung, Modellierung und Implementierung
- Auswahl des geeigneten Algorithmus für die jeweilige Aufgabe
- Überanpassung sowie das Verhältnis zwischen Bias und Varianz
Übersicht über Python und ML-Bibliotheken
- Warum Programmiersprachen im maschinellen Lernen eingesetzt werden
- Vergleich zwischen R und Python
- Einführungskurs in Python sowie die Verwendung von Jupyter Notebooks
- Wichtige Python-Bibliotheken: pandas, NumPy, scikit-learn, matplotlib, seaborn
Testen und Bewerten von ML-Algorithmen
- Generalisierung, Überanpassung sowie Validierung der Modelle
- Evaluationsstrategien: holdout-Verfahren, Kreuzvalidierung, Bootstrap-Methode
- Bewertungsmaße für Regressionsaufgaben: ME, MSE, RMSE, MAPE
- Bewertungsmaße für Klassifikationsprobleme: Genauigkeit, Konfusionsmatrix sowie Umgang mit ungleich verteilten Klassen
- Visualisierung der Modellleistung: Gewinnkurve, ROC-Kurve, Lift-Kurve
- Auswahl geeigneter Modelle sowie Optimierung mittels Grid Search
Datenaufbereitung
- Import und Speicherung von Daten in Python
- Explorative Datenanalyse sowie Berechnung von Zusammenfassungsstatistiken
- Umgang mit fehlenden Werten und Ausreißern
- Standardisierung, Normalisierung und Transformation der Daten
- Kodierung qualitativer Variablen sowie Aufbereitung von Daten mithilfe von pandas
Klassifikationsalgorithmen
- Binäre vs. mehrklassige Klassifikation
- Logistische Regression und diskriminierende Funktionen
- Naive Bayes, k-neächste Nachbarn
- Entscheidungsbäume: CART, Random Forests, Bagging, Boosting sowie XGBoost
- Support-Vektor-Maschinen und deren Kernelfunktionen
- Ensemble-Lernmethoden zur Verbesserung der Modellqualität
Regression und numerische Vorhersage
- Methode der kleinsten Quadrate sowie Auswahl relevanter Variablen
- Regularisierungsverfahren: L1- und L2-Regularisierung
- Polynomregression sowie nichtlineare Modellansätze
- Regressionsbäume sowie Splines als Alternative zur linearen Regression
Neuronale Netze
- Einführung in neuronale Netze und Deep Learning
- Aktivierungsfunktionen, Netzschichten sowie das Prinzip der Backpropagation
- Multilayer Perceptrons (MLP)
- Grundlagen des neuronalen Netzdesigns mittels TensorFlow oder PyTorch
- Einsatz von neuronalen Netzen für Klassifikations- und Regressionsaufgaben
Verkaufsprognose und prädiktive Analyse
- Zeitreihenanalyse im Vergleich zu regressionsbasierten Vorhersageansätzen
- Umgang mit saisonalen Schwankungen sowie trendspezifischen Mustern in den Daten
- Entwicklung eines Modells zur Prognose von Verkaufszahlen mittels maschinellem Lernen
- Bewertung der Vorhersagegenauigkeit sowie Abschätzung der Unsicherheiten
- Interpretation und Kommunikation der Ergebnisse im geschäftlichen Kontext
Unüberwachtes Lernen
- Clustering-Methoden: k-Means, k-Medoids, hierarchisches Clustering sowie SOMs
- Reduktion der Dimensionalität: PCA, Faktorenanalyse, SVD
- Multidimensionale Skalierung zur Visualisierung komplexer Datenstrukturen
Textanalyse und Textminierung
- Vorverarbeitung von Textdaten sowie Tokenisierung
- Verfahren wie Bag-of-Words, Stammformreduktion sowie Lemmatisierung
- Sentimentanalyse sowie Analyse der Worthäufigkeiten
- Visualisierung von Textdaten durch Word Clouds
Empfehlungssysteme
- Kooperative Filterverfahren auf Basis von Benutzern oder Produkten
- Entwicklung und Evaluation leistungsstarker Empfehlungssysteme
Assoziationsregelmäßigkeiten erkennen
- Identifikation häufiger Elementkombinationen mittels des Apriori-Algorithmus
- Marktanalyse anhand von Einkaufsmustern sowie Bestimmung des Lift-Ratio
Ausreißerdetektion
- Analyse extremer Werte in Datensätzen
- Distanz- sowie dichtebasierte Ansätze zur Erkennung von Anomalien
- Spezielle Methoden für die Ausreißerdetektion in hochdimensionalen Datenräumen
Praktisches Fallbeispiel zum maschinellen Lernen
- Analyse des konkreten Geschäftsproblems im Vorfeld der Modellierung
- Aufbereitung sowie Merkmalsextraktion aus den vorliegenden Daten
- Auswahl geeigneter Modelle und deren Parameteroptimierung
- Bewertung der Modellergebnisse sowie prägnante Darstellung der Erkenntnisse
- Finale Implementierung des entwickelten Modells in die Praxis
Zusammenfassung und weitere Entwicklungsmöglichkeiten
Voraussetzungen
- Grundkenntnisse in maschinellen Lernkonzepten wie überwachtem und unüberwachtem Lernen
- Vertrautheit mit der Python-Programmierung (Variablen, Schleifen, Funktionen)
- Erfahrung im Umgang mit Daten durch Bibliotheken wie pandas oder NumPy ist hilfreich, aber nicht zwingend erforderlich
- Vorkenntnisse in fortgeschrittener Modellierung oder neuronalen Netzen werden nicht vorausgesetzt
Zielgruppe
- Datenwissenschaftler
- Geschäftsanalysten
- Softwareentwickler sowie technische Fachkräfte, die mit Daten arbeiten
Erfahrungsberichte (3)
Mir hat besonders der Schluss gefallen, als wir die Zeit nahmen, mit CHAT GPT herumzuspielen. Der Raum war dafür jedoch nicht optimal eingerichtet – anstelle eines großen Tisches wären ein paar kleinere Tische nützlicher gewesen, damit wir in kleinen Gruppen zusammenkommen und brainstormen könnten.
Nola - Laramie County Community College
Kurs - Artificial Intelligence (AI) Overview
Maschinelle Übersetzung
Nach grundlegenden Prinzipien arbeiten und sich innerhalb desselben Tages auf die Anwendung von Fallstudien konzentrieren
Maggie Webb - Department of Jobs, Regions, and Precincts
Kurs - Artificial Neural Networks, Machine Learning, Deep Thinking
Maschinelle Übersetzung
Dass es reale Firmendaten verwendete. Der Trainer hatte einen sehr guten Ansatz, indem er die Teilnehmer aktiv einbezog und sie miteinander wetteifern ließ.
Jimena Esquivel - Zaklad Uslugowy Hakoman Andrzej Cybulski
Kurs - Applied AI from Scratch in Python
Maschinelle Übersetzung