Schulungsübersicht
Einführung in das Maschinelle Lernen
- Arten des Maschinellen Lernens – überwachtes vs. unüberwachtes Lernen
- Vom statistischen Lernen zum Maschinellen Lernen
- Der Ablauf der Datenanalyse: Verständnis der Geschäftsanforderungen, Datenvorbereitung, Modellierung und Deployment
- Auswahl des passenden Algorithmus für die jeweilige Aufgabe
- Überanpassung sowie das Abwägen zwischen Bias und Varianz
Überblick über Python und ML-Bibliotheken
- Warum Programmiersprachen im Maschinellen Lernen zum Einsatz kommen
- Auswahl zwischen R und Python
- Einführungskurs zu Python samt Jupyter-Notebooks
- Relevante Python-Bibliotheken: pandas, NumPy, scikit-learn, matplotlib sowie seaborn
Testen und Bewerten von Maschinellen Lernalgorithmen
- Generalisierungsfähigkeit, Überanpassung und Modellvalidierung
- Evaluationsverfahren: Holdout-Methode, Kreuzvalidierung sowie Bootstrapping
- Metriken für Regressionsaufgaben: ME, MSE, RMSE und MAPE
- Metriken für Klassifikationsprobleme: Genauigkeit, Konfusionsmatrix und Umgang mit unausgeglichenen Datenklassen
- Visualisierung der Modellleistung mittels Profitkurve, ROC-Kurve sowie Lift-Kurve
- Auswahl geeigneter Modelle sowie Optimierung via Grid Search
Datenvorbereitung
- Import und Speicherung von Daten in Python
- Explorative Datenanalyse und statistische Zusammenfassungen
- Umgang mit fehlenden Werten sowie Ausreißern
- Standardisierung, Normalisierung und weitere Transformationsverfahren
- Umcodierung kategorialer Variablen und Datenbereinigung mit pandas
Klassifikationsalgorithmen
- Binaire vs. mehrklassige Klassifikation
- Logistische Regression sowie diskriminierende Funktionen
- Naive Bayes-Verfahren und k-nächste Nachbarn-Algorithmus
- Entscheidungsbäume: CART, Random Forests, Bagging, Boosting und XGBoost
- Support Vector Machines sowie deren Kernel-Funktionen
- Methode der Ensemble-Lernverfahren
Regression und numerische Vorhersage
- Kleinste-Quadrate-Methode sowie Auswahl relevanter Variablen
- Regularisierungsverfahren: L1- und L2-Regularisierung
- Polynomregression sowie nichtlineare Modelle
- Regressionsbäume und Splines
Unüberwachtes Lernen
- Klassische Clustering-Verfahren: k-Means, k-Medoids, hierarchisches Clustering sowie SOMs
- Dimensionalitätsreduktion mittels PCA, Faktorenanalyse oder SVD
- Mehrdimensionale Skalierung
Textanalyse und Text Mining
- Vorbereitung von Textdaten sowie Tokenisierung
- Bag-of-Words-Methode, Stämmlung sowie Lemmatisierung
- Sentiment-Analyse und Analyse der Worthäufigkeit
- Visualisierung textbasierten Daten mittels Word Clouds
Empfehlungssysteme
- Benutzer- sowie artikelbasiertes Collaborative Filtering
- Entwurf und Bewertung von Empfehlungsalgorithmen
Assoziationsmuster-Mining
- Häufig vorkommende Item-Sets und der Apriori-Algorithmus
- Einsatz im Markt-Basket-Analyse sowie Berechnung des Lift-Verhältnisses
Ausreißerdetektion
- Analyse extremer Werte
- Distanzbasierte und dichtebasierte Detektionsverfahren
- Ausreißeridentifikation in hochdimensionalen Datensätzen
Fallstudie zum Maschinellen Lernen
- Verständnis des zugrundeliegenden Geschäftsproblems
- Datenaufbereitung und Merkmalsgenerierung
- Auswahl der geeigneten Modelle sowie deren Parameteroptimierung
- Evaluierung und Darstellung der Ergebnisse
- Deployment des entwickelten Modells
Zusammenfassung und weitere Schritte
Voraussetzungen
- Grundkenntnisse in Statistik und linearer Algebra
- Vertrautheit mit Konzepten der Datenanalyse oder des Business Intelligence
- Erfahrung mit Programmierung – vorzugsweise Python oder R – ist von Vorteil
- Interesse daran, anwendungsorientiertes Maschinelles Lernen für datengestützte Projekte zu erlernen
Zielgruppe
- Datenanalysten und Data Scientists
- Statistiker sowie Forscher
- Entwickler und IT-Fachkräfte, die sich mit Werkzeugen des Maschinellen Lernens beschäftigen wollen
- Alle Personen, die an Datenwissenschafts- oder Prädiktiv-Analyseprojekten arbeiten
Erfahrungsberichte (3)
Trotz des verpassten Tages aufgrund von Kundengesprächen fühle ich mich nun viel sicherer in der Understanding der Prozesse und Techniken, die in maschinellem Lernen eingesetzt werden, sowie darüber, wann ich einen bestimmten Ansatz gegenüber einem anderen bevorzugen sollte. Unsere Herausforderung besteht jetzt darin, das Gelernte zu üben und es auf unser Problemfeld anzuwenden.
Richard Blewett - Rock Solid Knowledge Ltd
Kurs - Machine Learning – Data science
Maschinelle Übersetzung
Mir hat gefallen, dass die Schulung sich auf Beispiele und Programmierung konzentrierte. Ich dachte, es wäre unmöglich, so viel Inhalt in drei Tage zu packen, aber ich lag falsch. Die Schulung behandelte viele Themen und alles wurde sehr detailliert durchgeführt (insbesondere die Feinabstimmung der Modellparameter - damit hatte ich nicht gerechnet und war angenehm überrascht).
Bartosz Rosiek - GE Medical Systems Polska Sp. Zoo
Kurs - Machine Learning – Data science
Maschinelle Übersetzung
Es zeigt viele Methoden mit vorbereiten Skripten – sehr gut aufbereitete Materialien und leicht zu verfolgen.
Kamila Begej - GE Medical Systems Polska Sp. Zoo
Kurs - Machine Learning – Data science
Maschinelle Übersetzung