Kontakt aufnehmen

Schulungsübersicht

Einführung

In diesem Abschnitt erhalten Sie eine allgemeine Einführung in die Anwendungsbereiche des maschinellen Lernens, die wesentlichen Überlegungen und deren Auswirkungen – einschließlich Vor- und Nachteilen. Behandelt werden Datentypen (strukturiert/unstrukturiert/statisch/streaming), Datenvalidität und -volumen, datengetriebene im Gegensatz zu nutzergesteuerten Analysen, statistische Modelle versus Modelle des maschinellen Lernens sowie die Herausforderungen des unüberwachten Lernens. Weiterhin werden Themen wie der Bias-Varianz-Ausgleich, iterative Evaluationsprozesse, verschiedene Verfahren zur Kreuzvalidierung sowie Unterschiede zwischen überwachtem, unüberwachtem und verstärkendem Lernen erläutert.

HAUPTTHEMEN

1. Grundlagen von Naive Bayes

  • Grundsätze der bayesschen Verfahren
  • Wahrscheinlichkeitstheorie
  • gemeinsame Wahrscheinlichkeit
  • Bedingte Wahrscheinlichkeit mithilfe des Satzes von Bayes
  • Der Algorithmus von Naive Bayes
  • Die Klassifizierung nach dem Verfahren Naive Bayes
  • Der Laplace-Schätzer
  • Einsatz numerischer Merkmale mit Naive Bayes

2. Grundlagen von Entscheidungsbäumen

  • Das Prinzip der Teilung und Eroberung
  • Der C5.0-Algorithmus für Entscheidungsbäume
  • Auswahl der optimalen Aufteilungsstelle
  • Pruning von Entscheidungsbäumen

3. Grundlagen neuronaler Netze

  • Von biologischen zu künstlichen Neuronen
  • Aktivierungsfunktionen
  • Netzwerk-Topologie
  • Anzahl der Netzwerkschichten
  • Richtung des Informationsflusses
  • Anzahl der Knoten pro Schicht
  • Training neuronaler Netze mittels Backpropagation
  • Deep Learning

4. Grundlagen von Support Vector Machines

  • Klassifizierung anhand von Hyperebenen
  • Ermittlung des maximalen Abstands zwischen Klassen
  • Fall linear trennbarer Daten
  • Fall nichtlinear trennbarer Daten
  • Einsatz von Kerneln für nichtlineare Zusammenhänge

5. Grundlagen des Clusterings

  • Clustering als Aufgabe im maschinellen Lernen
  • Der k-Means-Algorithmus zur Gruppierung von Daten
  • Nutzung der Distanz zur Zuweisung und Aktualisierung von Clustern
  • Auswahl der optimalen Anzahl an Clustern

6. Bewertung der Leistungsfähigkeit bei der Klassifikation

  • Umgang mit Daten aus Klassifizierungsvorhersagen
  • Einblicke in Konfusionsmatrizen
  • Nutzung von Konfusionsmatrizen zur Bewertung der Ergebnisse
  • Weitere Leistungsmaße neben der Genauigkeit
  • Der Kappa-Koeffizient
  • Empfindlichkeit und Spezifität
  • Präzision und Recall
  • Der F-Wert
  • Visualisierung von Leistungsabwägungen
  • ROC-Kurven
  • Abschätzung zukünftiger Modelleffizienz
  • Das Holdout-Verfahren
  • Kreuzvalidierung
  • Bootstrap-Stichprobenverfahren

7. Optimierung bestehender Modelle zur Verbesserung der Leistung

  • Einsatz von caret für automatisches Parameter-Tuning
  • Erstellung eines einfach getunten Modells
  • Individuelle Anpassung des Tuning-Prozesses
  • Leistungssteigerung durch Metastudien
  • Grundlagen von Ensemble-Methoden
  • Bagging-Verfahren
  • Boosting-Techniken
  • Random Forests
  • Training mittels Random Forest Modellen
  • Evaluation der Leistung von Random Forest Modellen

NEBENTHEMEN

8. Klassifikation anhand des nächstgelegenen Nachbarn verstehen

  • Der kNN-Algorithmus
  • Berechnung der Distanz zwischen Objekten
  • Auswahl eines geeigneten Wertes für „k“
  • Datenvorbereitung für den Einsatz mit kNN
  • Warum wird der kNN-Algorithmus als „faul“ bezeichnet?

9. Grundlagen von Klassifizierungsregeln

  • Aufteilung und Erobern als Vorgehensweise
  • Der One-Rule-Algorithmus
  • Der RIPPER-Algorithmus
  • Regelbildung aus Entscheidungsbäumen

10. Grundlagen der Regressionsanalyse

  • Einfache lineare Regression
  • Schätzung nach der Methode der kleinsten Quadrate
  • Zusammenhänge zwischen Variablen
  • Multiple lineare Regression

11. Grundlagen von Regressionsbäumen und Modellbäumen

  • Einführung der Regressionsfunktion in Entscheidungsbäume

12. Grundlagen von Assoziationsregeln

  • Der Apriori-Algorithmus zur Erkennung von Zusammenhängen
  • Messung des Interesses an Regeln – Support und Konfidenz
  • Erstellung von Regelsätzen mittels des Apriori-Verfahrens

Ergänzendes Material

  • Spark, PySpark, MLlib sowie Multi-Armed Bandits

Voraussetzungen

Python-Kenntnisse

 21 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Erfahrungsberichte (7)

Kommende Kurse

Verwandte Kategorien