Vielen Dank für die Zusendung Ihrer Anfrage! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Vielen Dank, dass Sie Ihre Buchung abgeschickt haben! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Schulungsübersicht
Einführung in AIOps
- Was ist AIOps und warum ist es wichtig?
- Konventionelles Monitoring im Vergleich zur durch AIOps gestützten Observability
- Die Architektur von AIOps sowie deren Hauptbestandteile
Sammlung und Normalisierung operativer Daten
- Arten von Beobachtungsdaten: Metriken, Log-Daten sowie Trace-Informationen
- Datenerfassung aus verschiedenen Quellen (Server, Container, Cloud)
- Einsatz von Agenten und Exportern wie Prometheus, Beats oder Fluentd
Datenkorrelation sowie Erkennung von Anomalien
- Korrelationsverfahren für Zeitreihendaten sowie statistische Analysemethoden
- Einsatz maschineller Lernalgorithmen zur Identifikation ungewöhnlicher Zustände
- Erkennung von Störungen in verteilten Systemumgebungen
Alarmierung und Reduzierung unerwünschter Benachrichtigungen
- Gestaltung intelligenter Regeln zur Alarmauslösung sowie festlegbare Schwellenwerte
- Unterdrückung, Zusammenfassung sowie Gruppierung von Alarmeingängen
- Integration mit Systemen wie Alertmanager, Slack, PagerDuty oder Opsgenie
Ursachenanalyse und Visualisierung der Ergebnisse
- Nutzung von Dashboards zur Darstellung von Metriken sowie Trenderkennung
- Auswertung von Ereignissen im Zeitverlauf zur Identifikation von Ursachenproblemen
- Verfolgung von Problemquellen über mehrere Systemebenen mithilfe von Werkzeugen für verteiltes Tracing
Automatisierung sowie automatisierte Abhilfemaßnahmen
- Auslösen von Skripten oder Workflows ausgehend von Vorfallmeldungen
- Anbindung an ITSM-Systeme wie ServiceNow und Jira
- Praktische Beispiele: Selbstreparaturmechanismen, automatisches Skalieren oder Umleiten von Datenverkehr
Open-Source- sowie kommerzielle AIOps-Plattformen
- Übersicht bekannter Werkzeuge: Prometheus, Grafana, ELK, Moogsoft und Dynatrace
- Auswahlkriterien für die Evaluierung geeigneter AIOps-Plattformen
- Vorführung sowie praktische Übungen mit einer ausgewählten Plattform-Kombination
Zusammenfassung und weitere Schritte
Voraussetzungen
- Grundverständnis der Konzepte aus IT-Operations sowie Systemüberwachung
- Erfahrung mit Monitoring-Tools oder Dashboards
- Vertrautheit mit gängigen Formaten für Log-Daten und Metriken
Zielgruppe
- Operations-Teams, die für Infrastruktur und Anwendungen verantwortlich sind
- Site Reliability Engineers (SREs)
- IT-Monitoring- und Observability-Teams
14 Stunden