Vielen Dank für die Zusendung Ihrer Anfrage! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Vielen Dank, dass Sie Ihre Buchung abgeschickt haben! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Schulungsübersicht
Einführung in predictive AIOps
- Grundlagen der prädiktiven Analytik im IT-Betrieb
- Relevante Datenquellen zur Vorhersage (Logs, Metriken, Ereignisdaten)
- Grundlegende Konzepte zur Zeitreihenprognose und Mustererkennung bei Anomalien
Entwicklung von Modellen zur Vorhersage von Störungen
- Klassifizierung historischer Störungsfälle sowie Systemverhaltensweisen
- Auswahl und Trainieren geeigneter Modelle (z. B. LSTM, Random Forest, AutoML)
- Bewertung der Modellgüte sowie Umgang mit falsch positiven Vorhersagen
Datenerfassung und Merkmalsgewinnung
- Erfassen und Synchronisieren von Log- sowie Metrikdaten als Modell-Eingabe
- Extraktion relevanter Merkmale aus strukturierten wie auch unstrukturierten Daten
- Bearbeitung von Störungen und fehlenden Daten innerhalb der Produktionsprozesse
Automatisierung der Ursachenanalyse (RCA)
- Grafische Darstellung der Beziehungen zwischen Diensten und Infrastrukturkomponenten
- Nutzung maschinellen Lernens zur Bestimmung wahrscheinlicher Ursachen anhand von Ereignisketten
- Visualisierung der Ergebnisse mittels topologiebewusster Dashboards
Abhilfemaßnahmen und Workflow-Automatisierung
- Integration in etablierte Automatisierungsplattformen (z. B. Ansible, Rundeck)
- Auslösen von Rollbacks, Neustarts oder Umleitungen des Datenverkehrs
- Dokumentation und Überwachung automatisch eingeleiteter Maßnahmen
Skalierung intelligenter AIOps-Pipelines
- MLOps im Bereich der Beobachtbarkeit: regelmäßiges Retraining und Versionierung von Modellen
- Echtzeit-Vorhersageprozesse auf verteilten Systemen
- Empfohlene Vorgehensweisen zur erfolgreichen Einführung von AIOps in Produktionsumgebungen
Fallstudien und praktische Anwendungen
- Auswertung realer Störungsdaten mittels prädiktiver AIOps-Modelle
- Einrichtung von RCA-Workflows unter Verwendung sowohl synthetischer als auch echter Produktionsdaten
- Betrachtung typischer Anwendungsbeispiele aus der Praxis: Cloud-Ausfälle, Instabilitäten in Mikroservices sowie Netzwerkprobleme
Zusammenfassung und weitere Schritte
Voraussetzungen
- Erfahrung mit Überwachungssystemen wie Prometheus oder ELK
- Grundkenntnisse in Python sowie grundlegendes Verständnis von maschinellem Lernen
- Vertrautheit mit gängigen Prozessen der Störungsbearbeitung
Zielgruppe
- Erfahrene Site Reliability Engineers (SREs)
- Architekten für IT-Automatisierung
- Leitende Fachkräfte aus den Bereichen DevOps und Observability-Plattformen
14 Stunden