Vielen Dank für die Zusendung Ihrer Anfrage! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Vielen Dank, dass Sie Ihre Buchung abgeschickt haben! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Schulungsübersicht
Einführung in AIOps
- Was ist AIOps und warum ist es wichtig?
- Traditionelles Monitoring im Vergleich zur AIOps-gestützten Observability
- AIOps-Architektur und Kernkomponenten
Erfassung und Normalisierung von Betriebsdaten
- Arten von Observability-Daten: Metriken, Logs und Traces
- Erfassung von Daten aus verschiedenen Quellen (Server, Container, Cloud)
- Verwendung von Agents und Exportern (Prometheus, Beats, Fluentd)
Datekorrelation und Anomalie-Erkennung
- Zeitreihenkorrelation und statistische Methoden
- Einsatz von ML-Modellen zur Anomalie-Erkennung
- Erkennung von Incidents in verteilten Systemen
Alarmierung und Reduzierung von Rauschen
- Gestaltung intelligenter Alarmregeln und Schwellenwerte
- Unterdrückung, Deduplizierung und Gruppierung von Alarmen
- Integration mit Alertmanager, Slack, PagerDuty oder Opsgenie
Root Cause Analysis und Visualisierung
- Verwendung von Dashboards zur Visualisierung von Metriken und zur Trendidentifikation
- Analyse von Ereignissen und Zeitachsen für die RCA (Root Cause Analysis)
- Verfolgung von Problemen über Schichten hinweg mit Tools für verteilte Tracing-Analyse
Automatisierung und Behebung
- Auslösen automatisierter Skripte oder Workflows aus Incidents
- Integration mit ITSM-Systemen (ServiceNow, Jira)
- Anwendungsfälle: Selbstheilung, Skalierung, Umleitung des Datenverkehrs
Open-Source- und kommerzielle AIOps-Plattformen
- Überblick über Tools: Prometheus, Grafana, ELK, Moogsoft, Dynatrace
- Bewertungskriterien für die Auswahl einer AIOps-Plattform
- Demonstration und Praxis mit einem ausgewählten Stack
Zusammenfassung und nächste Schritte
Voraussetzungen
- Verständnis von Konzepten im IT-Betrieb und Systemmonitoring
- Erfahrung mit Monitoring-Tools oder Dashboards
- Vertrautheit mit grundlegenden Log- und Metrikformaten
Zielgruppe
- Betriebsteams, die für Infrastruktur und Anwendungen zuständig sind
- Site Reliability Engineers (SREs)
- Teams für IT-Monitoring und Beobachtbarkeit
14 Stunden