Vielen Dank für die Zusendung Ihrer Anfrage! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Vielen Dank, dass Sie Ihre Buchung abgeschickt haben! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Dauer 14 Stunden
Schulungsübersicht
Einführung in prädiktives AIOps
- Überblick über prädiktive Analytik im IT-Betrieb
- Datenquellen für Vorhersagen (Logs, Metriken, Ereignisse)
- Wichtige Konzepte in Zeitreihenvorhersage und Anomalieerfassung
Gestaltung von Störungsvorhersagemodellen
- Labeling historischer Störungen und Systemverhaltens
- Auswahl und Training von Modellen (z. B. LSTM, Random Forest, AutoML)
- Bewertung der Modellleistung und Behandlung falsch-positiver Meldungen
Datenerfassung und Feature-Engineering
- Erfassung und Abgleich von Log- und Metrikdaten für die Modellnutzung
- Extraktion von Merkmalen aus strukturierten und unstrukturierten Daten
- Umgang mit Rauschen und fehlenden Daten in Betriebspipelines
Automatisierung der Root-Cause-Analyse (RCA)
- Graphbasierte Korrelation von Diensten und Infrastruktur
- Nutzung von ML zur Ableitung wahrscheinlicher Ursachen aus Ereignisketten
- Visualisierung der RCA mit Topologie-bewussten Dashboards
Fehlerbehebung und Workflow-Automatisierung
- Integration mit Automatisierungsplattformen (z. B. Ansible, Rundeck)
- Auslösung von Rollbacks, Neustarts oder Verkehrsumleitungen
- Prüfung und Dokumentation automatischer Eingriffe
Skalierung intelligenter AIOps-Pipelines
- MLOps für Observability: Retraining und Modellversionierung
- Durchführung von Echtzeit-Vorhersagen über verteilte Knoten hinweg
- Best Practices für den Einsatz von AIOps in Produktionsumgebungen
Fallstudien und praktische Anwendungen
- Analyse realer Störungsdaten mit prädiktiven AIOps-Modellen
- Einführung von RCA-Pipelines mit synthetischen und Produktionsdaten
- Überprüfung von Branchenusecases: Cloud-Ausfälle, Instabilität von Microservices, Netzwerkdeterioration
Zusammenfassung und nächste Schritte
Voraussetzungen
- Erfahrung mit Überwachungssystemen wie Prometheus oder ELK
- Fundierte Kenntnisse in Python und grundlegendem Machine Learning
- Vertrautheit mit Störungsmanagement-Workflows
Zielgruppe
- Senior Site Reliability Engineers (SREs)
- IT-Automatisierungsarchitekten
- Leitende DevOps- und Observability-Platform-Manager