Kontakt aufnehmen

Schulungsübersicht

Einführung in predictive AIOps

  • Grundlagen der prädiktiven Analytik im IT-Betrieb
  • Relevante Datenquellen zur Vorhersage (Logs, Metriken, Ereignisdaten)
  • Grundlegende Konzepte zur Zeitreihenprognose und Mustererkennung bei Anomalien

Entwicklung von Modellen zur Vorhersage von Störungen

  • Klassifizierung historischer Störungsfälle sowie Systemverhaltensweisen
  • Auswahl und Trainieren geeigneter Modelle (z. B. LSTM, Random Forest, AutoML)
  • Bewertung der Modellgüte sowie Umgang mit falsch positiven Vorhersagen

Datenerfassung und Merkmalsgewinnung

  • Erfassen und Synchronisieren von Log- sowie Metrikdaten als Modell-Eingabe
  • Extraktion relevanter Merkmale aus strukturierten wie auch unstrukturierten Daten
  • Bearbeitung von Störungen und fehlenden Daten innerhalb der Produktionsprozesse

Automatisierung der Ursachenanalyse (RCA)

  • Grafische Darstellung der Beziehungen zwischen Diensten und Infrastrukturkomponenten
  • Nutzung maschinellen Lernens zur Bestimmung wahrscheinlicher Ursachen anhand von Ereignisketten
  • Visualisierung der Ergebnisse mittels topologiebewusster Dashboards

Abhilfemaßnahmen und Workflow-Automatisierung

  • Integration in etablierte Automatisierungsplattformen (z. B. Ansible, Rundeck)
  • Auslösen von Rollbacks, Neustarts oder Umleitungen des Datenverkehrs
  • Dokumentation und Überwachung automatisch eingeleiteter Maßnahmen

Skalierung intelligenter AIOps-Pipelines

  • MLOps im Bereich der Beobachtbarkeit: regelmäßiges Retraining und Versionierung von Modellen
  • Echtzeit-Vorhersageprozesse auf verteilten Systemen
  • Empfohlene Vorgehensweisen zur erfolgreichen Einführung von AIOps in Produktionsumgebungen

Fallstudien und praktische Anwendungen

  • Auswertung realer Störungsdaten mittels prädiktiver AIOps-Modelle
  • Einrichtung von RCA-Workflows unter Verwendung sowohl synthetischer als auch echter Produktionsdaten
  • Betrachtung typischer Anwendungsbeispiele aus der Praxis: Cloud-Ausfälle, Instabilitäten in Mikroservices sowie Netzwerkprobleme

Zusammenfassung und weitere Schritte

Voraussetzungen

  • Erfahrung mit Überwachungssystemen wie Prometheus oder ELK
  • Grundkenntnisse in Python sowie grundlegendes Verständnis von maschinellem Lernen
  • Vertrautheit mit gängigen Prozessen der Störungsbearbeitung

Zielgruppe

  • Erfahrene Site Reliability Engineers (SREs)
  • Architekten für IT-Automatisierung
  • Leitende Fachkräfte aus den Bereichen DevOps und Observability-Plattformen
 14 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Kommende Kurse

Verwandte Kategorien