Kontakt aufnehmen

Schulungsübersicht

Einführung in AIOps

  • Was ist AIOps und warum ist es wichtig?
  • Konventionelles Monitoring im Vergleich zur durch AIOps gestützten Observability
  • Die Architektur von AIOps sowie deren Hauptbestandteile

Sammlung und Normalisierung operativer Daten

  • Arten von Beobachtungsdaten: Metriken, Log-Daten sowie Trace-Informationen
  • Datenerfassung aus verschiedenen Quellen (Server, Container, Cloud)
  • Einsatz von Agenten und Exportern wie Prometheus, Beats oder Fluentd

Datenkorrelation sowie Erkennung von Anomalien

  • Korrelationsverfahren für Zeitreihendaten sowie statistische Analysemethoden
  • Einsatz maschineller Lernalgorithmen zur Identifikation ungewöhnlicher Zustände
  • Erkennung von Störungen in verteilten Systemumgebungen

Alarmierung und Reduzierung unerwünschter Benachrichtigungen

  • Gestaltung intelligenter Regeln zur Alarmauslösung sowie festlegbare Schwellenwerte
  • Unterdrückung, Zusammenfassung sowie Gruppierung von Alarmeingängen
  • Integration mit Systemen wie Alertmanager, Slack, PagerDuty oder Opsgenie

Ursachenanalyse und Visualisierung der Ergebnisse

  • Nutzung von Dashboards zur Darstellung von Metriken sowie Trenderkennung
  • Auswertung von Ereignissen im Zeitverlauf zur Identifikation von Ursachenproblemen
  • Verfolgung von Problemquellen über mehrere Systemebenen mithilfe von Werkzeugen für verteiltes Tracing

Automatisierung sowie automatisierte Abhilfemaßnahmen

  • Auslösen von Skripten oder Workflows ausgehend von Vorfallmeldungen
  • Anbindung an ITSM-Systeme wie ServiceNow und Jira
  • Praktische Beispiele: Selbstreparaturmechanismen, automatisches Skalieren oder Umleiten von Datenverkehr

Open-Source- sowie kommerzielle AIOps-Plattformen

  • Übersicht bekannter Werkzeuge: Prometheus, Grafana, ELK, Moogsoft und Dynatrace
  • Auswahlkriterien für die Evaluierung geeigneter AIOps-Plattformen
  • Vorführung sowie praktische Übungen mit einer ausgewählten Plattform-Kombination

Zusammenfassung und weitere Schritte

Voraussetzungen

  • Grundverständnis der Konzepte aus IT-Operations sowie Systemüberwachung
  • Erfahrung mit Monitoring-Tools oder Dashboards
  • Vertrautheit mit gängigen Formaten für Log-Daten und Metriken

Zielgruppe

  • Operations-Teams, die für Infrastruktur und Anwendungen verantwortlich sind
  • Site Reliability Engineers (SREs)
  • IT-Monitoring- und Observability-Teams
 14 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Kommende Kurse

Verwandte Kategorien